16秒转完13分钟音频:faster-whisper 从安装到出结果的完整走查
16秒转完13分钟音频faster-whisper 从安装到出结果的完整走查【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper手里有一段 13 分钟的播客录音想转成文字。用原版 openai/whisper 跑一遍要两分多钟faster-whisper 用 CTranslate2 重写后同样精度下 16 秒出结果显存还更省。这篇文章带你从安装到出完整结果。pip 装好 6 行代码出结果环境要求很简单Python 3.9 以上NVIDIA GPU 还需要 CUDA 12 配套的 cuBLAS 和 cuDNN 9纯 CPU 直接跳过。音频解码内置了 PyAV不用像原版那样单独装 FFmpeg。装好就能跑pip install faster-whisperfrom faster_whisper import WhisperModel model WhisperModel(large-v3, devicecuda, compute_typefloat16) segments, info model.transcribe(audio.mp3, beam_size5) print(f检测到语言: {info.language}置信度 {info.language_probability:.2f}) for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})注意transcribe返回的是生成器真正开始转录发生在遍历segments的时候。没指定语言时它会看前 30 秒音频自动判断该用哪种语言。large-v3 的实测差距速度翻倍、显存减半下面这组数据来自仓库 README 的基准测试RTX 3070 Ti 8GB、large-v2 模型、13 分钟音频。实现精度耗时显存openai/whisperfp162m23s4708MBfaster-whisperfp161m03s4525MBfaster-whisper 批量 int8int816s4500MB批量 int8 需要显存多花约 1GB换回来的是十几倍的提速不开批量、只上 int8 的话是 59 秒、2926MB。同一精度下识别准确率WER两者相当也就是说快是真的快不是拿效果换的速度。完整走一遍会议录音转纪要拿到 40 分钟的会议录音.m4a、.mp3 都行。模型选large-v3求稳显存紧张就换small。开启 VAD 过滤长静音段落直接跳过40 分钟的会里那两分钟会议室噪音不会被硬译成文字。segments, info model.transcribe(meeting.m4a, vad_filterTrue) for seg in segments: print(f[{seg.start:6.1f}s] {seg.text.strip()})如果要出 SRT 字幕加word_timestampsTrue拿到逐字时间轴segments, _ model.transcribe(meeting.m4a, word_timestampsTrue) n 1 for seg in segments: for w in seg.words: print(f{n}\n{fmt(w.start)} -- {fmt(w.end)}\n{w.word}) n 1文件多的时候把WhisperModel.transcribe换成BatchedInferencePipeline.transcribe加batch_size16README 里 13 分钟音频从 59 秒压到 16 秒靠的就是这一步模型和参数的完整选项可以看 faster_whisper/transcribe.py。踩坑速查报找不到 cuBLAS/cuDNN→ 新版 ctranslate2 只支持 CUDA 12 cuDNN 9老卡装不了 9 的话降ctranslate23.24.0对应 CUDA 11或4.4.0对应 CUDA 12 cuDNN 8。显存不够→compute_type从float16换int8_float16或换小模型CPU 机器直接用compute_typeint8。调了参数却没生效→ 检查是否在for循环里打印segments是生成器不遍历转录根本不启动。先把上面 6 行示例跑通再用 word_timestamps 生成第一份 SRT剩下的参数细节留在代码注释里边用边查。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考