拓冰建站拓冰建站
首页 / 资讯中心 / 正文

FunASR 语音识别工具包安装指南:十分钟跑通环境并完成首次识别

FunASR 语音识别工具包安装指南十分钟跑通环境并完成首次识别【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASRFunASR 是阿里巴巴达摩院开源的端到端语音识别ASR工具包集语音识别、语音活动检测VAD自动切出有人在说话的片段、标点恢复、说话人分离等能力于一身用 Python 编写基于 PyTorch 构建。本文按先看能干什么 → 查一遍环境 → 三条命令装好 → 确认跑通的顺序带你上手装完你手里就是一个能识别、能切句、能断句加标点、还能区分谁在说话的本地 ASR 服务。 先看清全貌FunASR 到底能干哪些事很多开源 ASR 项目只给一个识别模型FunASR 的思路是工具箱——不同任务挑不同的模型串成一条流水线。一句话概括每个角色的分工能力一句话人话解释代表模型语音识别ASR把音频变成文字核心中的核心Paraformer-large非自回归端到端识别速度比传统自回归路线快不少多语言识别与翻译一条音频多语种 翻译Whisper-large-v3-turbo语音理解不只转写还能听懂语气、事件SenseVoice语音活动检测VAD从长音频里剪出真正有声音的片段内置 VAD 模型标点恢复给识别结果补上逗号句号可读性立刻不一样内置标点模型说话人验证 / 分离判断是不是同一个人、这段话是谁说的内置说话人模型多说话人识别多人对话场景下按人分开转写说话人分离 ASR 组合整个工具包的脉络可以从这张架构图一眼看懂左边是模型库Model Zoo中间是 funasr 核心库右边通向推理服务与 Runtime 部署。如果你关心实时语音识别FunASR 的两遍式2-pass方案值得一提先用流式模型边说边出结果等静音点出现再用离线模型把这段结果精修一遍兼顾了低延迟和准确率。✅ 动手前检查一分钟确认环境开始之前把下面这张清单过一遍能省掉后面 80% 的报错检查项要求说明操作系统Linux 或 macOSWindows 不在官方支持范围Python3.6 及以上版本用python3 --version看一眼包管理器pip / pip3 可用用来装 Python 依赖GPU可选支持 CUDA 的 NVIDIA GPU没有也能装纯 CPU 可用有 GPU 时训练和推理会快很多音频工具sox处理音频的常用命令行工具下面步骤会一起装好 上手安装三步搭好可用环境装 FunASR 一共就三步拿源码 → 补系统依赖 → 装 Python 包。第 1 步克隆仓库git clone https://gitcode.com/GitHub_Trending/fun/FunASR cd FunASR做什么把 FunASR 源码拉到本地并进入项目目录。为什么先做这个后续装依赖都是在这个目录里执行源码里的配置和脚本也都在这里。怎么判断成功ls能看到funasr/、docs/、data/等目录说明仓库完整。第 2 步补齐系统级依赖不同发行版命令不同按你的系统二选一。Ubuntu 系sudo apt-get update sudo apt-get install -y python3-pip python3-dev build-essential \ libssl-dev libffi-dev python3-setuptools libsox-fmt-mp3 soxmacOSbrew install python libffi做什么装上编译 Python C 扩展需要的开发库libffi、编译工具链以及处理 MP3 的 sox 工具。为什么不能跳过FunASR 的部分依赖需要现场编译缺了这些库 pip 会直接报 build 失败。怎么判断成功命令跑完没有红色 error 提示即可。第 3 步安装 Python 依赖pip3 install -r requirements.txt做什么按仓库声明的依赖清单一次性装好所有 Python 包底层主要框架是 PyTorch。为什么用 requirements.txt它锁定的是项目验证过的版本组合比手动一个个装更不容易踩版本坑。怎么判断成功最后出现Successfully installed ...字样若某一步报 CUDA 相关错误多半是 PyTorch 版本和你的显卡驱动不匹配换匹配的 wheel 重装即可。装完这一步按需从 ModelScope 或 Hugging Face 下载你要用的预训练模型比如 Paraformer 或 SenseVoice 的权重模型文件下载下来后按对应脚本指向路径即可。 验证与初见确认装好了没有验证很简单直接跑测试入口python3 setup.py test做什么让 FunASR 跑一遍自带的测试流程。怎么判断成功测试全部通过、没有 import 错误和模型加载报错说明环境是通的。装好后的第一次使用体验比想象中顺滑调一个识别接口丢一段音频进去回来的是带标点、切好句子的文本接上 VAD 和说话人模型后还能看到第几句话是谁说的。这就是 FunASR 相对单模型工具包的最大差别——一次调用整条流水线协同工作。想动手写第一行代码可以直接看仓库里的 使用教程 和 CLI 说明。 常见坑与延伸高频问题一次说清M1/M2 Mac 装包报 cffi 架构错误这是 Apple 芯片上最常见的坑pip uninstall cffi pycparser ARCHFLAGS-arch arm64 pip install cffi pycparser --compile --no-cache-dirCPU 上跑得动吗跑得动只是慢。需要加速训练和推理时上支持 CUDA 的 NVIDIA GPU装好 PyTorch 的 CUDA 版本即可。模型在哪下预训练模型托管在 ModelScope 和 Hugging Face 上按你想跑的任务识别、VAD、标点、说话人挑对应权重即可模型列表 有完整目录。装完往哪走几份值得收藏的官方材料安装文档含 Conda 环境搭法使用教程与参数说明训练/微调构建指南常见问题 FAQ示例训练代码在 examples 目录覆盖 aishell、wenetspeech 等数据集把上面的坑绕过去FunASR 就是一个开箱即用、从研究到生产都能顶的语音识别工具包。【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门