拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Xinference 内置 F5-TTS 社区共享模型卡(SHARED.md):多语言 TTS 检查点速查与加载实战

Xinference 内置 F5-TTS 社区共享模型卡SHARED.md多语言 TTS 检查点速查与加载实战【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference本文以xinference/thirdparty/f5_tts/infer/SHARED.md社区共享模型卡文档为主线讲清这份多语言 F5-TTS 检查点速查表的定位、当前收录的全部模型条目及其ckpt/vocab文件坐标并结合仓库内推理 CLIinfer_cli.py、检查点加载实现utils_infer.py与 Xinference 音频服务封装f5tts.py说明这些社区模型下载后如何真正跑起来以及如何把自己的微调成果提交回模型卡。读完你能准确使用表中的任一共享检查点、理解ema_model_state_dict与 vocab 文件的硬性依赖、并把多语言模型接入命令行推理或 Xinference 服务。SHARED.md 是什么社区检查点速查表的定位SHARED.md 是 F5-TTS 推理目录xinference/thirdparty/f5_tts/infer/下的共享模型卡页面官方推理文档 infer/README.md 明确写道More checkpoints with whole community efforts can be found in SHARED.md, supporting more languages即官方仓库只保证预训练 Base 模型而社区训练/微调出的多语言成果统一登记在这份文档里。文档开头给出了三条使用前提值得原文照录该文档是社区训练/微调结果的快速查找表quick lookup table覆盖多种语言仓库中的模型均为开源基于贡献者的自愿贡献模型的使用必须建立在对各自创作者的尊重之上便利性来自他们的付出。从仓库结构看该文档处于第三方上游代码thirdparty/f5_tts而非 Xinference 自研模块中它服务于 F5-TTS 的命令行/脚本推理链路Xinference 自身的音频服务封装在 xinference/model/audio/f5tts.py两者关系后文单独说明。当前收录的共享模型完整条目速查模型卡按语言分组Multilingual / Mandarin / Japanese / English / French当前有实际条目的为多语言、日语和法语三组。以下完整继承原文档的全部条目信息MultilingualF5-TTS Basepretrain中文 英文模型Hugging Face数据小时模型许可F5-TTS BaseSWivid/F5-TTS 仓库下的F5TTS_Base目录ckpt vocabEmilia 95K zhencc-by-nc-4.0MODEL_CKPT: hf://SWivid/F5-TTS/F5TTS_Base/model_1200000.safetensors VOCAB_FILE: hf://SWivid/F5-TTS/F5TTS_Base/vocab.txt这是官方基础检查点与 Xinference 内置服务默认加载的模型一致见下文 f5tts.py 部分。JapaneseF5-TTS Basepretrain/finetune日语模型Hugging Face数据小时模型许可F5-TTS BaseJmica/F5TTS 仓库下的JA_8500000目录ckpt vocabEmilia 1.7k JA 与 Galgame Dataset 5.4kcc-by-nc-4.0MODEL_CKPT: hf://Jmica/F5TTS/JA_8500000/model_8499660.pt VOCAB_FILE: hf://Jmica/F5TTS/JA_8500000/vocab_updated.txt注意日语条目的 vocab 文件名是vocab_updated.txt——微调过程扩展了词表这正是每个社区模型必须自带 vocab 文件的原因。FrenchFrench LibriVoxfinetune法语模型Hugging Face数据小时模型许可F5-TTS FrenchRASPIAUDIO/F5-French-MixedSpeakers-reduced 仓库ckpt vocabLibriVoxcc-by-nc-4.0MODEL_CKPT: hf://RASPIAUDIO/F5-French-MixedSpeakers-reduced/model_last_reduced.pt VOCAB_FILE: hf://RASPIAUDIO/F5-French-MixedSpeakers-reduced/vocab.txt原文档还为法语条目附了三条附加资源在线推理 Space、训练新语言模型的教程视频、关于该次训练的 issue 讨论具体跳转链接以 SHARED.md 原文为准。Mandarin 与 English 两个分组当前只有标题占位等待社区提交使用时请以文档最新状态为准。检查点如何被加载-p/-v参数与 ema 权重机制模型卡给出的MODEL_CKPT/VOCAB_FILE两个坐标对应的就是推理 CLI 的两个参数。infer_cli.py 中定义了-p, --ckpt_file检查点.pt文件-v, --vocab_filetokenization 用的.txt词表。两者都留空时走官方默认值vocoder 为vocos时自动用cached_path拉取hf://SWivid/F5-TTS/F5TTS_Base/model_1200000.safetensors为bigvgan时拉取hf://SWivid/F5-TTS/F5TTS_Base_bigvgan/model_1250000.pt见 infer_cli.py。而加载 SHARED.md 中的社区模型典型命令形态为f5-tts_infer-cli \ --model F5-TTS \ --ckpt_file ./Jmica_F5TTS/model_8499660.pt \ --vocab_file ./Jmica_F5TTS/vocab_updated.txt \ --ref_audio ref_ja.wav \ --ref_text 参考音频的文本内容 \ --gen_text 要合成的文本从源码结构看有两个关键细节1. 用户传入的-p是本地路径需先自行下载。utils_infer.py 的load_checkpoint只按文件后缀分流.safetensors走safetensors.torch.load_file其余一律torch.load(..., weights_onlyTrue)均要求磁盘上的实际文件路径hf://形式的 URL 只在默认分支经cached_path解析。因此使用 SHARED.md 条目时需先把对应仓库文件下载到本地再传给-p。2. 为什么模型卡要求checkpoint 只保留ema_model_state_dict。load_checkpoint在use_emaTrue默认时会把.pt检查点中的ema_model_state_dict摘出来剥离ema_model.前缀并剔除initted/step键后再load_state_dict对.safetensors则直接整个文件当作 ema state dict 处理utils_infer.py。这意味着训练仓库里动辄数 GB 的完整 checkpoint含优化器状态、非 ema 副本对推理毫无价值按模型卡建议裁剪成只留ema_model_state_dict后文件更小且可直接作为推理权重加载——日语、法语条目中.pt文件能直接被加载正是遵循了这条裁剪约定。vocab 文件是自定义 tokenizer 的词表不能混用。utils_infer.py 的load_model中vocab_file为空时回退到内置f5_tts/infer/examples/vocab.txt随后以tokenizercustom调用get_tokenizer构建字符映射并把vocab_size传入模型构造text_num_embeds。换用社区微调模型时若不带对应 vocab文本侧 embedding 维度与权重对不上因此模型卡把ckpt vocab 成对提交写进了共享规范。Vocoder 与检查点的配套关系SHARED.md 各条目未单独标注 vocoder 类型使用时需按检查点命名判断F5-TTS 训练产物分两条线vocos线对应F5TTS_Base/model_1200000.safetensorsbigvgan线对应F5TTS_Base_bigvgan/model_1250000.pt。infer_cli.py 中vocoder_name同时决定三件事vocoder 本地路径vocos-mel-24khz或bigvgan_v2_24khz_100band_256x、默认 ckpt 文件名、以及 mel 谱类型mel_spec_type。推理端的采样参数集中在 utils_infer.py24kHz 采样率、100 维 mel、nfe_step32、cfg_strength2.0、sway_sampling_coef-1.0infer_batch_process 据此完成 CFM 采样、vocoder 解码与 0.15s 交叉淡入拼接多段音频靠它衔接自然。从 Xinference 侧看内置服务与社区模型的分界Xinference 将 F5-TTS 封装为音频模型服务core.py 按设备把模型实例化为F5TTSModelCUDA/CPU或F5TTSMLXModelApple Silicon。其 load() 的实现方式是把xinference/thirdparty插入sys.path后from f5_tts.infer.utils_infer import load_model以DiT(dim1024, depth22, heads16, ff_mult2, text_dim512, conv_layers4)配置构造模型并按 vocoder 拼出固定检查点路径{model_path}/F5TTS_Base/model_1200000.safetensors或F5TTS_Base_bigvgan/model_1250000.safetensors。由此可以推断Xinference 内置音频服务默认加载的是 SHARED.md 中Multilingual Base这一条官方检查点要求模型目录下存在相应子目录结构而日语、法语等社区微调模型不在此固定路径约定内推荐通过上一节的 CLI 方式-p/-v直接使用。服务化调用时 speech() 仍提供了完整的参考音频机制prompt_speech音频字节prompt_text必须同时提供否则抛ValueError不传prompt_speech时回退到 basic.toml 中的示例音频与文本。f5tts.py 的_infer还实现了与 story.toml 同构的多角色能力文本中用[角色名]标签正则\[(\w)\]切换不同ref_audio/ref_text组合未匹配角色回退main各段音频拼接返回speed控制语速response_format经 soundfile 编码为 mp3/wav 等流式streamTrue不被支持。多角色文本示例可参考 story.txt。如何把自己的模型提交回模型卡SHARED.md 的Welcome to share章节给出了标准共享流程这里完整继承准备预训练/微调结果模型检查点建议裁剪方便推理只保留ema_model_state_dict——前文已从load_checkpoint实现解释了原因与配套的 vocab 文件tokenization 用在 Hugging Face 上新建一个公开模型仓库并上传模型相关文件发起 Pull Request向模型卡页面上游路径为src/f5_tts/infer/SHARED.md本仓库对应 xinference/thirdparty/f5_tts/infer/SHARED.md添加自己的模型卡条目字段参照现有条目模型名、HF 仓库位置、训练数据规模小时数、模型许可。注意现有条目许可均为cc-by-nc-4.0提交与使用时都应确认许可条款。推理实操注意事项使用 SHARED.md 中任一共享检查点前infer/README.md 列出的通用限制同样适用单次生成上限约30s含参考音频在内的总时长更长文本会自动分块生成参考音频会被裁剪到约 15s参考音频建议 15s 且结尾留约 1s 静音否则可能在词中间截断导致生成质量下降preprocess_ref_audio_text 实现了三级剪枝并在 50ms 静音处收尾大写单词会被逐字母朗读普通词请用小写用空格或标点显式制造停顿数字想读中文请先预处理成汉字否则按英文读ref_text留空会触发 Whisper ASR 自动转写额外占用显存转写结果按参考音频 MD5 缓存。小结SHARED.md 的价值在于把 F5-TTS 生态的多语言社区成果收敛成一张可检索的ckpt vocab坐标表官方 Base中英Emilia 95K、日语微调JmicaEmilia JA Galgame 数据与法语微调RASPIAUDIOLibriVox目前各有明确条目全部采用ema_model_state_dict裁剪约定与cc-by-nc-4.0许可。结合 infer_cli.py 的-p/-v参数与 utils_infer.py 的加载实现社区检查点可以无改动接入命令行推理而 Xinference 服务侧则通过 f5tts.py 以官方 Base 为默认加载对象为多角色、变速等能力提供了 API 级封装。掌握条目速查 → 本地下载 →-p/-v加载 → 按 vocoder 配套推理这条链路即可在 Xinference 仓库内完整消费这份社区模型卡。【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门