拓冰建站拓冰建站
首页 / 资讯中心 / 正文

FunASR Hugging Face 预训练模型仓库(Model Zoo)完整指南:许可证边界、模型清单与接入方式

FunASR Hugging Face 预训练模型仓库Model Zoo完整指南许可证边界、模型清单与接入方式【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASRFunASR 是一个开源的语音识别工具包其 Hugging Face 模型仓库Model Zoo集中收录了语音识别ASR、语音活动检测VAD、标点恢复、说话人相关任务以及第三方统一转写/说话人日志Diarization等方向的预训练模型与对应接口约定。本文以 model_zoo/huggingface_models.md 为核心结合仓库源码逐项说明许可证边界、模型清单含参数规模、语言覆盖、离线/在线属性、别名解析机制与原生 Transformers 接入方式帮助你按任务快速选型并在服务化部署前厘清各 checkpoints 的差异。一、许可证边界软件许可证 ≠ 模型权重许可证FunASR 工具包本体采用 MIT 软件许可证但模型权重遵循单独的条款。使用或再分发任何 checkpoint 前必须逐一核对对应模型卡model card、随附许可证文件license file以及所选 revisionFunASR 模型开源协议版本 1.1仅适用于其发布条款明确采纳该协议的模型并非本目录中所有条目的默认许可第三方模型例如 OpenMOSS 发布的 MOSS-Transcribe-Diarize保留其原始作者身份与模型专属许可证Apache-2.0FunASR 团队不代为声明其许可条款再分发模型或派生制品时需保留上游署名。选型与部署边界方面官方建议先阅读 Model Zoo 总览 与 MOSS 集成指南。模型 Zoo 总览中还有一句重要提醒一个模型被列入清单不代表它被每一个服务端或导出后端自动支持——模型、checkpoint 格式、运行时要分开选择。二、模型清单总览Hugging Face 收录条目以下清单对应 model_zoo/huggingface_models.md 中实际收录的 HF 条目。清单还包含部分历史变体正式使用前务必核对每个模型卡。2.1 Fun-ASR-Nano 系列按接口选择 checkpointFun-ASR-Nano 是 FunASR 的旗舰模型SenseVoice 编码器 Qwen3 解码器的 LLM 路径覆盖中文、英文、日文及中文方言/口音。关键在于同一模型名存在多个互不通用not interchangeable的 checkpoint 产物需按加载接口区分Checkpoint接口适用范围Fun-ASR-Nano-2512-hf原生 Transformers5.17.0AutoProcessorAutoModelForSpeechSeq2Seq中/英/日转写不依赖远程 Python 代码不提供词级时间戳或说话人身份Fun-ASR-Nano-2512FunASR 工具包AutoModel原始工具包产物与原生导出不可互换Fun-ASR-Nano-2512-vllm原生 vLLM独立的服务化转换与运行时产物Fun-ASR-MLT-Nano-2512FunASR 工具包独立的 31 语言 checkpoint并非 zh/en/ja 原生导出的语言覆盖注意MLT多语言checkpoint 是独立模型不能把其 31 语言覆盖能力归因到基础 Nano 模型上。基础 checkpoint 与 vLLM 转换后的 checkpoint 也是不同的 artifact。Fun-ASR-Nano 的入门路径有三条原生 Transformers 指南、在线 Space 演示、以及批量示例与 Notebook若需要服务化则按 部署矩阵 选择路径。2.2 Paraformer 模型Paraformer 是非自回归NAT离线 ASR 模型中文语音识别的主流选择支持字符级时间戳与热词模型名语言训练数据词表大小参数量离线/在线备注Paraformer-large中英Alibaba Speech Data60000 小时8404220M离线输入 wav 时长 ≤ 20s该模型的原始工具包版本以paraformer-zh别名在 HF 与 funasr/models/seaco_paraformerparaformer-zh别名在 ModelScope 端实际解析到 SeACo checkpoint。2.3 语音活动检测VAD模型名训练数据参数量采样率备注FSMN-VADAlibaba Speech Data5000 小时0.4M16000检测语音起止不转写、不识别说话人FSMN-VAD 通过fsmn-vad别名接入源码实现位于 funasr/models/fsmn_vad_streaming可配合 ASR 组成VAD → 识别流水线。2.4 标点恢复Punctuation Restoration模型名训练数据参数量词表大小离线/在线备注CT-TransformerAlibaba Text Data70M272727离线离线标点恢复模型CT-Transformer 通过ct-punc别名接入实现见 funasr/models/ct_transformer离线版与 funasr/models/ct_transformer_streaming在线版。需要注意标点模型不生成声学时间戳。2.5 第三方统一转写与说话人日志Third-party模型名发布方参数量备注MOSS-Transcribe-DiarizeOpenMOSS见官方模型卡第三方 Apache-2.0 模型。一次离线请求同时返回转写文本、时间戳与说话人标签FunASR 集成路径无需外部 VAD 服务。MOSS 与 FunASR 生态的对接细节backendhf/vllm/sglang三种后端、sentence_info返回契约、部署容器等见 MOSS 部署指南。从源码结构看其适配器在 funasr/models/moss_transcribe_diarize 中实现保留上游 tagged 生成于raw_text并把解析出的start/end/spk/text归一化为统一的sentence_info字段。2.6 未列入 HF 目录的历史模型家族原目录中还存在 UniASR流式离线统一模型、Conformer、RNN-T、多说话人识别 MFCCA、语言模型、说话人验证Xvector、说话人日志SOND、时间戳预测TP-Aligner等家族的表格但它们在 HF 清单中均以注释形式保留仅提供 ModelScope 链接。按照 Model Zoo 总览 的说明这些属于历史变体清单完整 ModelScope 清单可查 modelscope_models.md。在新的服务中使用某个 checkpoint 之前务必逐一核对模型卡。三、如何在 FunASR 中接入 Hugging Face 模型hub 映射与下载流程清单中的 HF 模型可通过 FunASR 工具包直接加载。核心机制是别名映射表 funasr/download/name_maps_from_hub.pySDK 别名如paraformer-zh、paraformer-en、fsmn-vad、ct-punc、fa-zh、cam被解析为具体的 HF 仓库 IDname_maps_hf { paraformer: funasr/paraformer-zh, paraformer-zh: funasr/paraformer-zh, paraformer-en: funasr/paraformer-en, paraformer-zh-streaming: funasr/paraformer-zh-streaming, fsmn-vad: funasr/fsmn-vad, ct-punc: funasr/ct-punc, fa-zh: funasr/fa-zh, cam: funasr/campplus, ... }别名解析与下载在 funasr/download/download_model_from_hub.py 中完成download_model(**kwargs)根据hub参数ms/modelscope走 ModelScopehf/huggingface走huggingface_hub.snapshot_downloadopenai走 Whisper 兼容路径分发随后读取本地configuration.json或config.yaml、tokens.txt、am.mvn、bpe.model等文件组装完整的模型初始化参数。别名只是便捷写法并非不可变的模型 revision——生产环境建议记录解析后的具体 checkpoint/revision。典型用法显式指定 hubfrom funasr import AutoModel model AutoModel(modelparaformer-zh, hubhf, devicecpu) result model.generate(inputmeeting.wav) print(result[0][text])替换meeting.wav为真实录音即可运行。注意下载耗时、预热warmup与推理耗时是三个独立的测量项验证时间戳、说话人标签或模型专属标签时应保留原始返回结果。仓库还提供了别名契约的测试用例tests/test_hf_model_aliases.py 断言name_maps_hf[paraformer-en] funasr/paraformer-en保证英文别名指向英文 checkpoint。四、原生 Transformers 路径Fun-ASR-Nano-2512-hf如果你不引入 FunASR 工具包而希望直接用 Hugging Face 生态的标准接口应选择Fun-ASR-Nano-2512-hf这个原生导出。官方 原生 Transformers 指南 提供了完整说明核心要点如下Transformers 5.17.0 是已发布的正式包原生支持 Fun-ASR-Nano无需源码检出、无需 FunASR 工具包、无需模型自带的远程 Python 代码需要匹配的torch/torchaudio原生特征提取器使用torchaudio.compliance.kaldi.fbank该 zh/en/ja 导出只返回文本不含词级时间戳与说话人身份原生导出省略了 CTC 时间戳分支原生类位于transformers.models.fun_asr_nano。最小推理示例CPU、float32import torch from transformers import AutoModelForSpeechSeq2Seq, AutoProcessor torch.set_num_threads(4) model_id FunAudioLLM/Fun-ASR-Nano-2512-hf revision d93b302ee7fd505e1b3576120fc142fc6f7820e1 processor AutoProcessor.from_pretrained(model_id, revisionrevision, trust_remote_codeFalse) model AutoModelForSpeechSeq2Seq.from_pretrained( model_id, revisionrevision, trust_remote_codeFalse, dtypetorch.float32, ).to(cpu).eval() inputs processor.apply_transcription_request( audioyour.wav, languagezh, processor_kwargs{ return_tensors: pt, audio_kwargs: {sampling_rate: 16000}, text_kwargs: {padding: True}, }, ) with torch.inference_mode(): generated model.generate(**inputs, max_new_tokens128, do_sampleFalse) new_tokens generated[:, inputs.input_ids.shape[1]:] # 去除 prompt 部分 print(processor.batch_decode(new_tokens, skip_special_tokensTrue)[0])要点apply_transcription_request接受波形必须标注真实采样率不能把 48 kHz 样本标成 16 kHz、本地路径或受支持的 URLlanguage取zh/en/ja批量场景传入音频列表 等长语言列表 text_kwargs{padding: True}解码时保持输入顺序keywords词汇提示与prompt上下文不是强制词表也不是工具包的hotword参数——例如中文样例中加开放时间并未纠正开饭时间的输出需用代表性录音与人审评估质量max_new_tokens128只是示例上限缺失 EOS 可能意味着截断增加上限并不证明长录音被完整覆盖官方还提供了不加载权重的预处理自检脚本合成静音经 processor 检查输出张量形状但预处理成功不代表识别准确率或容量达标。五、选型、部署边界与可复现性5.1 四个 checkpoint 不是同一个模型 ID从 部署矩阵 与 原生 Transformers 指南 中的对照表可以归纳出四条相互独立的路径需求checkpoint 与接口Python 内原生 TransformersFun-ASR-Nano-2512-hfAutoProcessorAutoModelForSpeechSeq2SeqFunASR 流水线与 HTTP 适配Fun-ASR-Nano-2512funasr.AutoModel部署矩阵原生 vLLMFun-ASR-Nano-2512-vllm原生 vLLM 验证C / 边缘设备转换后的 GGUF 文件llama.cpp 运行时原生 Transformers 支持不附带HTTP 服务、队列、流式协议、词级时间戳或说话人身份。选择模型时模型、checkpoint 格式、接口与运行环境要一起决定再在目标硬件上验证 GPU dtype、注意力后端、显存、并发与质量。5.2 公开资料与可复现性原生 public revision 为d93b302ee7fd505e1b3576120fc142fc6f7820e1解析为FunAsrNanoForConditionalGenerationtrust_remote_codeFalsemodel.safetensors大小 1,659,773,320 字节官方验证记录2026-09-09基于实际发布的 5.17.0 wheel、Python 3.12.3、匹配的 torch/torchaudio 2.10.0cpu、float32 与 4 线程样本均返回非空文本且在 128 token 内到达 EOS这些短样本不构成CER/WER、GPU 兼容性或服务容量的结论若加载失败先检查解释器、transformers.__version__5.16.1 及更早版本不含该模型、-hf模型 ID 与 revision。六、总结与下一步FunASR 的 Hugging Face Model Zoo 是一份按任务 → 按接口组织的预训练模型清单从 LLM 路径的 Fun-ASR-Nano 系列、非自回归的 Paraformer-large到轻量的 FSMN-VAD、CT-Transformer 与第三方 MOSS-Transcribe-Diarize。使用前牢记三点许可证按权重单独核对、checkpoint 按接口区分、别名不等于固定 revision。进一步深入可参考任务选型模型选择指南SDK 参数与返回值契约Python API 指南说话人与情感标签speaker_emotion.md、关键词唤醒keyword_spotting.md训练/微调training.md、自定义模型注册model_registration.md质量与耗时分开度量RTF 可复现性。【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门