FunASR 语音识别工具包安装教程:三步从零到第一次 ASR 识别
FunASR 语音识别工具包安装教程三步从零到第一次 ASR 识别【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASRFunASR 是阿里巴巴达摩院开源的端到端语音识别工具包一次装好就能串起语音识别ASR、语音活动检测VAD、标点恢复、说话人分离还能一键起 OpenAI 兼容的推理服务。这篇 FunASR 安装配置教程带你走完环境准备到跑通第一句识别的全过程全程大约二十分钟。开始之前能力范围与环境检查清单它能做什么一句话概括——你给一段音频它按任务给你文字、时间戳、说话人编号、情绪标签。具体模型侧有 Paraformer低延迟流式、SenseVoiceSmall中英日韩粤语 情绪 音频事件CPU 可跑、Fun-ASR-Nano中日英 方言需要 GPU、Whisper-large-v3 等完整清单见 docs/model_selection.md。环境检查清单对照打勾即可操作系统Linux、macOS、Windows 均可Python3.8 及以上setup.py 的硬门槛是 3.7建议直接用 3.8~3.12PyTorch1.11 及以上这是唯一需要提前装的重依赖GPU可选。没有显卡也能用 SenseVoiceSmall 在 CPU 上以数十倍实时速度识别只有跑 Fun-ASR-Nano 这类大模型才必须上 CUDA选型建议只跑推理直接pip install funasr就够不用克隆仓库要改代码、加模型或看源码才走下面源码 可编辑安装的路线。本文按后者完整演示前者可以跳过第一步。三步装完第 1 步获取代码打开终端执行把仓库克隆到本地装完后改代码可立即生效git clone https://gitcode.com/GitHub_Trending/fun/FunASR cd FunASR装好 conda 的话顺手开个独立环境conda create -n funasr python3.10 conda activate funasr。不装 conda 用python -m venv也行关键是别把 funasr 装进系统 Python。第 2 步装依赖分两小步顺序不能反先装 PyTorch。有 N 卡就装与你 CUDA 驱动匹配的 torch 和 torchaudio 轮子没有就装默认 CPU 版pip install torch torchaudio再装 FunASR 本体。源码目录下执行pip install -e .它会把 setup.py 里声明的 scipy、librosa、soundfile、modelscope、huggingface_hub、transformers 等二十来个依赖一并拉齐。如果你本机要读 mp3 格式音频soundfile 原生不支持Ubuntu 上补一句sudo apt install -y libsox-fmt-mp3 sox因为部分脚本靠 sox 做解码。装完顺手确认 GPU 是否可见python -c import torch; print(torch.cuda.is_available())输出 True 后续才能用devicecuda。第 3 步下载模型并跑第一次识别FunASR 的模型不随包发布首次调用时按模型名自动从 ModelScope国内快或 Hugging Face海外快拉取无需手动下载文件。推荐第一炮打 SenseVoiceSmall234M 参数、CPU 就能跑还自带 VAD 和说话人分离。用仓库自带的命令行入口验证给任意一段 wavfunasr 你的音频.wav --model sensevoice屏幕上打出识别文本示例输出欢迎大家来体验达摩院推出的语音识别模型说明整条链路已通。想写进代码里等价写法是from funasr import AutoModel后调AutoModel(modeliic/SenseVoiceSmall, devicecpu).generate(input你的音频.wav)。一分钟验证确认环境没装坏做两个检查都过了才算装完导入检查python -c import funasr; print(funasr.__version__)打印出版本号当前最新为 1.3.x 系列即包安装成功。端到端检查上面那条funasr命令能出文本说明模型下载、音频读取、推理全通。失败了先查两处一查pip list | grep -E torch|torchaudio|funasrtorch 与 torchaudio 必须是同一渠道装的兼容版本二查模型下载源国内网络建议加--hub ms走 ModelScope。更细的报错对照见 docs/troubleshooting.md。常见报错与修复Q1import funasr 报 torch 相关错误先pip install -U torch torchaudio再重装 funasr并保证 torchvision如果装了也来自同一安装渠道。版本混装是最常见的翻车点。Q2模型下载慢或中断国内优先用 ModelScope模型名形如iic/SenseVoiceSmall海外优先 Hugging Face下载中断后清掉该模型的残留缓存重试即可。Q3没有显卡能装吗能。devicecpu直接跑SenseVoiceSmall 在 CPU 上也能有远超实时的速度只是 Fun-ASR-Nano 这类 800M 的 LLM-ASR 模型建议留给 GPU。Q4Mac M 系列芯片报 cffi 架构不兼容执行pip uninstall cffi pycparser然后ARCHFLAGS-arch arm64 pip install cffi pycparser --compile --no-cache-dir这是 docs/installation/installation.md 里记载的已知问题。下一步官方文档入口docs/安装细节在 docs/installation/installation.md模型选型与平台docs/model_selection.md模型托管在 ModelScope 与 Hugging Face 两个平台社区与贡献CONTRIBUTING.md训练示例脚本在 examples/【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考