FunASR 实战指南:3条命令跑通带说话人分离的语音识别服务
FunASR 实战指南3条命令跑通带说话人分离的语音识别服务【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR如果你曾被Whisper 在 CPU 上跑不动卡住或者做识别服务时还要额外花钱接说话人分离那 FunASR 就是为你准备的。它是一个开源的端到端语音识别工具包把识别、VAD语音端点检测即切出人声有效片段、加标点、说话人分离整条链路打包成工具CPU 和 GPU 都能自托管部署适合想在本地搭 ASR 服务、或正打算从 Whisper 迁移的开发者。 它到底是干什么的FunASR 的定位一句话不是单个模型而是一套语音到文本的工具箱——训练、推理、流式识别、服务部署都有现成件可挑。几个可以验证的硬数据当前版本1.4.13见 funasr/version.txt核心代码 MIT 协议官方基准测试中SenseVoiceSmall 中文 CER字错率越低越好7.81%纯 CPU 也能跑到17 倍实时速度模型库覆盖 220M 到 1.7B 多个量级从旗舰 Fun-ASR-Nano800M到轻量 VAD0.4M都有 核心能力拆解三个点看懂它一条命令拼出全链路VAD、识别、标点、说话人它解决的问题原始识别结果是一整段没标点、分不清谁在说话的文本没法直接交付。它怎么解决AutoModel一次配置 ASR、VAD、标点、说话人四个模型返回带时间戳和说话人 ID 的结构化结果。管线内部按端点检测 → 声学模型 → 解码器 → 标点预测 → 文本正则化串起来你不用自己写任何拼接逻辑按任务挑模型而不是一模打天下这是它和 Whisper 最大的区别——Whisper 是一个模型FunASR 是一个模型库每个场景挑最合适的Fun-ASR-Nano800M中/英/日 中文方言口音配 vLLM 时 GPU 速度 340 倍实时SenseVoiceSmall234M五语言识别 情绪 音频事件标签CPU 友好Paraformer-zh / streaming220M中文低延迟streaming 版支持实时流式Qwen3-ASR1.7B52 种语言不改代码就能接进现有 AI 服务OpenAI 兼容 APIfunasr-server起一个标准/v1/audio/transcriptions接口现有 OpenAI SDK 客户端可直接改地址接入完整示例在 examples/openai_api/内置 CLIfunasr audio.wav直接出结果--output-format srt出字幕-f json给 AI Agent 用MCP Server让 Claude / Cursor 这类 Agent 直接调用识别能力 零基础第一次跑通3条命令出结果环境要求就三行Python ≥ 3.8Linux / Windows / macOS 都行纯 CPU 即可GPU 可选跑 Nano 才需要。pip install torch torchaudio pip install funasr此时 pip 应输出Successfully installed funasr-1.4.13 ...。如果装不上先看末尾避坑第 1 条。from funasr import AutoModel model AutoModel(modeliic/SenseVoiceSmall, vad_modelfsmn-vad, spk_modelcam, devicecpu) result model.generate(inputaudio.wav, batch_size_s300) print(result[0])把audio.wav换成你的 16kHz 音频路径或任意 wav 的 URL。首次运行会自动下载模型权重网络畅通的情况下耐心等待跑通后你应该看到带时间戳和说话人标签如[0.6s] Speaker 0: ...的结构化文本。iic/开头的模型名会走国内 ModelScope 源下载更快。 深挖一个真实场景长会议录音转成带说话人的文本会议记录是最能体现工具包价值的场景。官方基准用184 段共 192 分钟的长音频测出的数据SenseVoice-Small中文 CER 7.81%GPU 170 倍实时、CPU 17 倍实时——即 1 小时录音 CPU 上几分钟就转完Fun-ASR-Nano vLLMCER 8.20%GPU 340 倍实时比 Whisper-large-v3 快26 倍对照组Whisper-large-v3CER 20.02%GPU 13 倍实时CPU 基本跑不动一张来自官方例图的对比完整基准说明在远场嘈杂、复杂背景、中文方言这些 Whisper 的传统弱项上FunASR 系列优势明显。转完之后想对外提供服务装好服务依赖再起一条命令pip install funasr vllm fastapi uvicorn python-multipart funasr-server --device cuda此时终端应提示服务监听在localhost:8000。用下面的请求验证curl http://localhost:8000/v1/audio/transcriptions \ -F filesample.wav -F modelsensevoice -F response_formatverbose_json你应该看到一段含text字段的 JSON 返回这就是标准 OpenAI 转写接口任何现有 SDK 都能接。⚠️ 避坑手册最常被卡住的 4 个问题现象import funasr报错或安装时缺依赖。原因没先装 torch/torchaudio或不同渠道的 CUDA wheel 混装。解法先pip install torch torchaudio再装 funasr同一环境内保持 PyTorch 系列版本同源。现象首次运行卡在下载或模型下载失败。原因默认源在你的网络环境下很慢。解法国内用iic/开头的模型名走 ModelScope 源下载中断后清掉该模型的部分缓存重试。现象devicecuda报找不到 GPU。原因装的是 CPU 版 PyTorch。解法先执行torch.cuda.is_available()输出False就改用devicecpu或按驱动版本重装对应 CUDA 的 PyTorch。现象funasr-server起了但请求返回 4xx/5xx。原因漏装 FastAPI/Uvicorn/multipart 依赖或浏览器页面有 CORS 拦截。解法补装上述依赖包浏览器端请求用--cors-origin http://localhost:3000放行对应源。⚖️ 该不该用选型建议适合你如果数据不能出内网或想省掉云 ASR API 按分钟计费只有 CPUSenseVoice 17 倍实时而 Whisper-large-v3 在 CPU 上实际不可用要识别之外的能力说话人分离、情绪、音频事件、实时流式FunASR 全在工具箱里不适合你如果只认一个模型跑 57 语言、对中文精度不敏感Whisper-large-v3 更省心且 MIT 协议想零配置微调超大工业数据集FunASR 有训练能力examples/下有完整配方但配置门槛不低一句话对比中文场景下精度8.20% vs 20.02% CER和速度340x vs 13x GPU 实时FunASR 全面占优Whisper 的优势在语言覆盖广和附带翻译能力。FunASR 是一个 CPU 也跑得动、能力整链打包、模型随便挑的自托管语音识别工具包。先用上面的 6 行示例跑通第一声再去 模型选型指南 和 故障排查文档 按场景挑模型。需要源码的话git clone https://gitcode.com/GitHub_Trending/fun/FunASR【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考