拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Windows 下用 faster-whisper 搭建 GPU 加速的语音转写环境

Windows 下用 faster-whisper 搭建 GPU 加速的语音转写环境【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper场景切入手里有一段 60 秒的会议录音要出文字稿。原版 openai/whisper 在 CPU 上要跑三四分钟而同一段音频在 faster-whisper 加 GPU 的组合下通常 30 秒内就能拿到结果——差的不是显卡而是推理引擎。faster-whisper 用 CTranslate2一个专门做 Transformer 推理加速的引擎重写了推理层在相同准确率下比原版快 2-4 倍显存占用更低还支持 int8 量化进一步压内存。本文以 Windows 11 NVIDIA 显卡为基准把从装环境到跑出第一条转写结果的路径走完没有独显也可以最后参考 int8 CPU 的降速方案但主体按 GPU 加速来写。门槛与选型先交代两个名词后面直接用CUDA 是 NVIDIA 的并行计算平台负责把计算任务调度到显卡上cuDNN 是它上面的深度学习加速库。faster-whisper 的推理引擎 CTranslate2 只预编译支持 CUDA 12 cuDNN 9 这套组合这是整条安装路线的锚点。项目最低推荐NVIDIA 显卡GTX 1050 Ti / 4 GB 显存RTX 30 系 / 6 GB 以上显卡驱动支持 CUDA 12.4 的版本nvidia-smi 右上角可查最新 Studio 驱动Python3.93.10磁盘10 GBSSD20 GB内存 8 GB 起步即可。注意驱动版本决定你能用哪套 CUDA用 nvidia-smi 看一下右上角的 CUDA Version 不小于 12.4 就可以开工不用单独装完整的 CUDA Toolkit。三步安装法第一步部署 CUDA 12 运行库与 cuDNN 9安装 CUDA 12.x winget install --id NVIDIA.CUDA # 或者官网下载 12.x 安装包 走自定义安装勾 Toolkit 和 cuBLAS矩阵运算库CTranslate2 依赖它即可VS 集成组件不用勾。验证nvcc -V 能打印出 V12.x 版本号就说明编译器和运行库都就位了。装 cuDNN 9注册 NVIDIA 账号后下载 cuDNN v9for CUDA 12zip 包把里面 bin 目录中的 cudnn64_9.dll 等文件复制到 C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.x\bin\cuDNN 的 DLL 需要和 CUDA 放在一起才能被找到并确认该目录已加入系统 PATH。这一步最容易漏。后面报错 cudnn64_9.dll not found 九成是文件没复制对位置。第二步装 Python 依赖项目可以从仓库源码装faster-whisper 仓库日常使用直接 pip 安装即可python -m venv venv venv\Scripts\activate pip install -U pip pip install faster-whisper依赖会一次性拉齐ctranslate2推理引擎要求 4.0 以上、avPyAV音频解码、onnxruntime 等。PyAV 是 FFmpeg 的 Python 封装faster-whisper 靠它解码 mp3、m4a 这类格式所以不用再系统级装 FFmpeg。它自带静态链接的解码库Windows 上有官方预编译轮子pip 直接装就不会碰到编译报错。第三步验证环境python -c from faster_whisper import WhisperModel; print(ok)打印 ok 就代表转写链路可用模型文件不用手动下载——首次按名字加载时会自动从 Hugging Face 拉取并缓存到本地。第一次转写faster-whisper 本体是 Python 库不带命令行入口。想要一条命令搞定用基于它的命令行工具 whisper-ctranslate2pip install whisper-ctranslate2 whisper-ctranslate2 transcribe --model large-v3 --device cuda --language zh meeting.m4a -o transcript.txt不想加组件就写个脚本下面这个例子已经是最小可运行版本from faster_whisper import WhisperModel model WhisperModel(large-v3, devicecuda, compute_typeint8_float16) segments, info model.transcribe(meeting.m4a, beam_size5, vad_filterTrue) print(f语言: {info.language} ({info.language_probability:.2f}), 时长: {info.duration:.1f}s) for seg in segments: print(f[{seg.start:6.2f}s - {seg.end:6.2f}s] {seg.text.strip()})跑起来大概三件事首次运行下载模型large-v3 约 3 GB之后走缓存vad_filterTrue 让内置的 Silero VAD语音活动检测模型先剪掉纯静音段少算很多空帧segments 是生成器for 循环跑到哪算到哪中途 CtrlC 不会白等。正常输出类似语言: en (0.99), 时长: 12.3s [ 0.00s - 2.10s] Good morning, thanks for joining. [ 2.30s - 5.80s] Lets start with the Q3 roadmap.排障速查错误信息可能原因修复命令 / 操作cudnn64_9.dll not foundcuDNN 没装或 DLL 不在 PATH复制 cuDNN bin 下的 dll 到 CUDA 的 bin 目录并加入 PATHCUDA error: out of memory显存装不下当前模型/批量换 int8_float16、降 batch_size或改用 small 模型ImportError: DLL load failedav 模块缺 VC 运行库winget install Microsoft.VC2015-2022Redist-x64模型下载反复中断网络到 Hugging Face 不稳用 hf 镜像环境变量重试或手动下载模型目录后传本地路径Compute type int8_float16 not supported老架构 GPU 不支持混合精度改用 compute_typeint8 或 float16性能旋钮⚡️ 主要调节项就是 compute_type它决定模型以什么精度驻留和计算float16 精度最稳、速度中等int8_float16 是速度与显存的平衡点权重用 int8累加用 fp16int8 面向纯 CPU 场景。官方基准里large-v2 转写 13 分钟音频原版 whisper 2 分 23 秒faster-whisper float16 1 分 03 秒int8 模式 59 秒且显存从 4525 MB 降到 2926 MB再套上批量推理管线还能再快一倍代价是显存占用上升。compute_type适用场景精度显存float16对准确率敏感最高中int8_float16日常批量转写略降低int8CPU / 小显存略降最低收尾三件事CUDA 12 cuDNN 9 装对位置并加进 PATH虚拟环境里 pip install faster-whisper 一步到位用 compute_type 在精度、速度、显存之间选平衡点。后续可以看 faster-whisper 源码 里的 transcribe 参数全集或用 ct2-transformers-converter 把自己微调过的模型转成 CTranslate2 格式。延伸方向有三个给转写结果加 word_timestamps 做字幕对齐把转写流程封装成 HTTP 服务供其他系统调用结合社区方案加说话人分离。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门