拓冰建站拓冰建站
首页 / 资讯中心 / 正文

OpenVoice 语音克隆本地部署:把参考音频的音色套到任意文本上

OpenVoice 语音克隆本地部署把参考音频的音色套到任意文本上【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoiceOpenVoice 是 MIT 与 MyShell 开源的即时语音克隆instant voice cloning方案给一段几秒的参考音频就能提取其音色让指定文本用这个音色说话并支持跨语言生成。它面向开发者和研究者MIT 许可可商用。本文带你完成 OpenVoice 本地部署从环境搭建、V1 检查点配置到首次生成、风格调参与中英跨语言克隆的完整链路。⚙️ 快速上手环境清单与安装官方文档以 Linux 为主线Windows 与 Docker 有社区贡献的非官方安装指南。环境上需要满足Linux 环境社区指南覆盖 Windows有 condaPython 3.9PyTorch 环境建议带 GPU 加速推理磁盘空间存放 V1/V2 检查点与中间音频能下载 silero VAD、unidic 等运行时依赖的网络下面这段命令创建独立环境并安装项目依赖conda create -n openvoice python3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .V1 和 V2 共用同一份代码区别在检查点与 V2 的额外依赖下一节展开。️ 核心能力实测音色克隆与风格控制场景用一段参考音频替换生成语音的音色。这是 OpenVoice 语音克隆的核心链路分两步先用se_extractor从参考音频提取目标音色向量再让转换器把基础 TTS 模型的输出染色。target_se, _ se_extractor.get_se(resources/example_reference.mp3, tone_color_converter, vadTrue)base_speaker_tts.tts(text, src_path, speakerdefault, languageEnglish, speed1.0) tone_color_converter.convert(src_path, source_se, target_se, output_pathout.wav, tau0.3)预期效果输出音频的节奏、语速来自基础说话人模型音色来自参考音频tau控制音色融合强度。场景只改风格不改音色。换用whispering基础说话人并调低语速base_speaker_tts.tts(text, src_path, speakerwhispering, languageEnglish, speed0.9)预期效果输出为耳语风格但音色仍克隆自参考音频。注意一个容易误解的点OpenVoice 只克隆音色tone color口音和情感由基础说话人模型决定参考音频的口音不会被克隆过去。架构图Base speaker TTS 负责文本与风格参数Tone color extractor 从参考音频提取音色经 Flow 网络实现音色替换跨语言克隆是 V1 的另一项能力基础说话人模型支持中文时可用英文克隆的音色朗读中文文本流程不变详见 demo_part2.ipynb。 关键配置V1 与 V2 检查点差异V1 的检查点压缩包checkpoints_1226.zip官方文档提供直链解压到checkpoints/目录结构为base_speakers/EN、base_speakers/ZH与converter三部分。V2 检查点checkpoints_v2_0417.zip解压到单独的checkpoints_v2文件夹。维度V1V2音频质量基线水平训练策略改进音质更好语言支持依赖基础说话人模型官方提供英文、中文原生支持英、西、法、中、日、韩检查点目录checkpoints/checkpoints_v2/额外依赖无需安装 MeloTTS 并下载 unidic 日语词典许可MIT可商用MIT可商用V2 的依赖安装需要能访问对应代码仓库的网络pip install githttps://github.com/myshell-ai/MeloTTS.git python -m unidic download更完整的下载与目录说明见 docs/USAGE.md。 实战操作从首次生成到跨语言本地 Gradio 界面首次生成检查点就绪后Gradio 演示会同时加载英文、中文基础说话人与转换器并自动做语言检测仅支持 zh/en。python -m openvoice_app --share不加--share时仅在本地端口提供访问加上后生成一个临时外网链接方便手机预览效果。API 流程首次跑通以下初始化代码与 demo_part1.ipynb 中的写法一致加载英文基础说话人与转换器base_speaker_tts BaseSpeakerTTS(f{ckpt_base}/config.json, devicedevice) base_speaker_tts.load_ckpt(f{ckpt_base}/checkpoint.pth) tone_color_converter ToneColorConverter(f{ckpt_converter}/config.json, devicedevice) tone_color_converter.load_ckpt(f{ckpt_converter}/checkpoint.pth) source_se torch.load(f{ckpt_base}/en_default_se.pth).to(device)完整推理链路提取参考音频音色向量基础模型生成tmp.wav转换器替换音色后写出最终文件。target_se, _ se_extractor.get_se(ref_audio, tone_color_converter, target_dirprocessed, vadTrue) base_speaker_tts.tts(This audio is generated by OpenVoice., src_path, speakerdefault, languageEnglish) tone_color_converter.convert(src_path, source_se, target_se, output_pathout.wav, messageMyShell)message参数会向输出音频写入不可听的水印默认开启初始化ToneColorConverter时传enable_watermarkFalse可关闭。风格参数与语速调优想换语气换speaker与对应的源音色向量即可例如speakerwhispering搭配检查点目录里的en_style_se.pth想控制节奏调speed它直接映射到内部length_scale。base_speaker_tts.tts(text, src_path, speakerwhispering, languageEnglish, speed0.9)转换器侧的tau决定融合程度demo 默认 0.3数值大小可试听对比后自行取舍。跨语言克隆英文音色读中文把基础说话人换成中文检查点音色向量沿用英文克隆得到的target_se其余步骤不变。zh_base BaseSpeakerTTS(fcheckpoints/base_speakers/ZH/config.json, devicedevice) zh_base.load_ckpt(fcheckpoints/base_speakers/ZH/checkpoint.pth) zh_base.tts(今天天气真好我们一起出去吃饭吧。, src_path, speakerdefault, languageChinese)转换后输出为中文语音音色仍是参考音频的音色。V1 能覆盖哪些语言取决于你手头的基础说话人模型。️ 排错与调优三个高频问题现象首次运行报 silero VAD 相关下载错误原因se_extractor.get_se依赖 silero VAD其模型从 GitHub 拉取无外网机器会失败解法手动下载对应 zip 并解压到~/.cache/torch/hub/snakers4_silero-vad_master处理方式见 docs/QA.md现象克隆出的语音口音、情绪和参考音频不像原因OpenVoice 只克隆音色口音与情感由基础说话人模型提供参考音频的口音不在克隆范围内解法换成带目标口音的基础说话人模型OpenVoice 支持替换自定义基础模型转换器可复用现象输出音质差、有杂音或长度异常原因参考音频带背景噪声、时长过短、混入多人语音或含大段静音解法换干净清晰的参考音频并检查同名参考音频对应的processed缓存目录是否与本次输入一致到这里你可以从任意一段参考音频出发在本地批量生成带目标音色的语音文件需要更多语言和更好音质时切到 V2 并按 demo_part3.ipynb 的流程走即可。【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门