拓冰建站拓冰建站
首页 / 资讯中心 / 正文

faster-whisper 10 分钟快速部署:比原始 Whisper 快 4 倍的语音转文字安装避坑指南

faster-whisper 10 分钟快速部署比原始 Whisper 快 4 倍的语音转文字安装避坑指南【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisperfaster-whisper 是 OpenAI Whisper 的加速重实现底层换成 CTranslate2Transformer 模型的快速推理引擎同等精度下快 4 倍、显存更省还支持 INT8 量化。它负责把语音转成带时间戳的文字适合想低成本跑通语音识别的开发者。本文 10 分钟带你完成 faster-whisper 安装并跑通第一个示例。开工前自检faster-whisper 安装环境检查清单先花 30 秒核对这五项缺哪项补哪项别急着装。操作系统Linux、macOS、Windows 都行无特殊限制。机器若是 32 位系统先换 64 位。Python ≥ 3.9用python3 --version查看。低于 3.9 就升级或用 conda 单独建一个环境。GPU可选想用 GPU 加速需要 NVIDIA 驱动 CUDA 12 配套的 cuBLAS、cuDNN 9 两个库。没有 GPU 就直接用 CPU 跑不用装任何驱动。FFmpeg无需手动安装。包里自带的 PyAV一个音频解码库已经把 FFmpeg 依赖打包好了。网络首次运行会自动从 Hugging Face 模型库下载模型权重。网络受限时提前把模型下到本地目录即可。faster-whisper 一键安装命令建环境、装依赖、验证三步走完CPU 路线全程不超过 5 分钟GPU 那步可选。① 建虚拟环境python3 -m venv fw-env source fw-env/bin/activate② 安装依赖pip install faster-whisperCPU 场景装完即可。要上 GPU 且你在 Linux 上补装两个 NVIDIA 库并设置搜索路径pip install nvidia-cublas-cu12 nvidia-cudnn-cu129.* export LD_LIBRARY_PATHpython3 -c import os; import nvidia.cublas.lib; import nvidia.cudnn.lib; print(os.path.dirname(nvidia.cublas.lib.__file__) : os.path.dirname(nvidia.cudnn.lib.__file__))不想手装的话直接用官方 Docker 镜像nvidia/cuda:12.3.2-cudnn9-runtime-ubuntu22.04构建写法见 docker/Dockerfile。③ 验证安装python3 -c import faster_whisper; print(faster_whisper.__version__)输出版本号即安装成功。踩坑速查CUDA 不匹配、OSError 找不到库怎么解决安装阶段 90% 的报错都集中在这四种按现象对号入座。现象一句话原因解法加载 GPU 模型报OSError: Could not load cuBLAS之类cuBLAS/cuDNN 没装或LD_LIBRARY_PATH没导出按上面步骤 pip 安装并 export 后再启动 PythonWindows 用户把库放进PATH目录ctranslate2 提示 CUDA 版本不匹配新版 ctranslate2 只支持 CUDA 12 cuDNN 9CUDA 11 机器执行pip install --force-reinstall ctranslate23.24.0CUDA 12 cuDNN 8 则降级到 4.4.0GPU 显存爆OOMlarge-v3 的 fp16 要吃约 4.5GB 显存compute_type改int8_float16或换更小的small模型transcribe返回了却迟迟没输出segments是生成器不迭代就不推理先list(segments)收集或在 for 循环里打印最小可用示例跑通第一条语音转文字转录仓库的 tests/data/ 里自带jfk.flac等样例音频可直接拿来当输入试。from faster_whisper import WhisperModel model WhisperModel(small, devicecpu, compute_typeint8) segments, info model.transcribe(jfk.flac, beam_size5) print(fDetected language {info.language} with probability {info.language_probability:.2f}) for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})⚠️segments是生成器对象for 循环里才真正开始推理想存完整结果就list(segments)收进列表。成功的标志首次运行先出现模型下载进度条随后第一行打印Detected language en with probability 0.99...接着持续滚出[0.00s - 4.50s] And so my fellow Americans...这类带时间戳的文字行——只要时间戳句子稳定输出就说明环境完全跑通了。跑通之后把word_timestamps设为True可以拿到词级时间戳vad_filterTrue会自动裁掉静音段可调阈值都写在 faster_whisper/vad.py 里。有 GPU 的话建议再试BatchedInferencePipeline批量转录13 分钟音频能压到十几秒。beam_size、hotwords等更多参数直接翻转录入口 faster_whisper/transcribe.py。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门