拓冰建站拓冰建站
首页 / 资讯中心 / 正文

VoiceCraft 完整指南:零样本语音编辑与文本转语音,几分钟克隆一个声音

VoiceCraft 完整指南零样本语音编辑与文本转语音几分钟克隆一个声音【免费下载链接】VoiceCraftZero-Shot Speech Editing and Text-to-Speech in the Wild项目地址: https://gitcode.com/GitHub_Trending/vo/VoiceCraftVoiceCraft 解决一个很具体的麻烦录音念错一个词以前要整条重录现在只改那一个词就行。它做的是零样本语音编辑和文本转语音只靠几秒参考音频就能克隆或改写未见过的声音。适合播客作者、剪辑人员和想本地部署语音模型的开发者。 它替你省掉哪步活录播客录到第 40 分钟发现第 7 分钟念错了一个词。以前的流程暂停、倒带、重录那一条再重新剪进去现在把音频丢给 VoiceCraft圈出错词、输入正确的句子其他部分原样保留。念错词只改错的那一处拿几秒音频就能克隆音色输入文字直接合成新语音全程本地跑音频不出机器不挑数据播客、视频、有声书都能用 最快五分钟部署方式用 Docker 是最省事的一条路一条构建命令把环境全打好git clone https://gitcode.com/GitHub_Trending/vo/VoiceCraft # 拉取项目仓库 cd VoiceCraft # 进入项目目录 docker build --tag voicecraft . # 构建镜像装好全部依赖 ./start-jupyter.sh # 启动容器里的 JupyterWindows 用 start-jupyter.bat docker logs jupyter # 查看终端输出的访问地址不想装 Docker 的话也可以自己建 conda 环境按 environment.yml 装依赖步骤多但原理一样。怎么算跑通了在宿主机浏览器打开 Jupyter 地址按单元格外地跑 inference_tts.ipynb跑完听生成的音频——音色和仓库里demo/目录下的参考音频一致但说的却是你指定的新句子就算成功。首次运行会自动把 encodec 模型下载到pretrained_models/目录。 两个值得亲手试的场景场景一用参考音频做零样本文本转语音你想做给 VoiceCraft 几秒人声让它用这个声音读任意新文本。直接在项目目录跑这条默认演示命令首次会自动下载模型权重耐心等一下python tts_demo.py # 默认用 demo/ 里的参考音频合成一句新台词默认配置会读取 demo/5895_34622_000026_000002.wav输出一条全新台词的语音。想换成自己的声音和文本加上-oa指定音频、-tt指定文本即可先跑python tts_demo.py -h看全部参数。你会看到什么输出保存在generated_tts/目录播出来是参考音频的音色却说着你没听过的新句子——这就是零样本克隆的效果。场景二圈出错词只改那一处你想做一段已经录好的音频里有个词说错了想原地修掉不动前后内容。终端运行python gradio_app.py浏览器打开 http://127.0.0.1:7860。先选模型、点加载上传音频让它自动转写然后在转写文本上选中错词填入替换文本切到 Edit 模式点运行。你会看到什么新生成的音频里被圈出的片段变成了新句子的声音音色、语气和原句保持一致前后的段落则完全是原始录音。⚙️ 它的核心原理给音频做填空题VoiceCraft 先把音频转成一串离散编码——可以理解为给声音做的一层层压缩编码默认 4 层每层 2048 个码。模型的任务就是填空编辑时原句编码是完整的句子被圈出的词变成空格模型只生成空格里缺的编码其余位置原封不动文本转语音时参考音频的编码是开头模型顺着往下写再解码回音频。相当于填空题只挖一个洞答案填进去后其余一个字都不动。核心实现见 models/voicecraft.py。️ 调优与踩坑速查参考音频怎么选、对齐不准怎么办选 3–5 秒干净人声无背景音、无回声、说话节奏正常截断点用tts_demo.py的-co参数控制对齐偏差导致截断位置怪把-mamargin从 0.04 调大一点给词边界留余量生成带长静音或断句怪把-stop_repetition从默认 2 调小到 1能更快掐断重复某个种子总不满意换一个-seed同文本不同种子的结果差别不小语速偏快或个别词被拉长把--sample_batch_size调到 4 以上模型会生成多条候选、挑最短自然的一条显存和速度怎么安排显存不够OOM先-kv 0关掉 KV 缓存还是不行就换 330M 模型嫌生成慢保持默认-kv 1开启 KV 缓存官方说能快 4–8 倍想控制生成质量README 提到把采样从 top_p 切成 topk40 后编辑和合成效果明显变好推理脚本默认已按此调整红线别拿它克隆别人未经本人同意不要用它的声音做生成或编辑README 的 Disclaimer 写得很明确代码是 CC BY-NC-SA 4.0 许可、权重是 Coqui 公共模型许可商用前请先看清楚条款它适合做播客、视频和有声内容、想省掉重录环节的人。下一步克隆仓库跑上面的构建命令然后跑一次python tts_demo.py听效果。【免费下载链接】VoiceCraftZero-Shot Speech Editing and Text-to-Speech in the Wild项目地址: https://gitcode.com/GitHub_Trending/vo/VoiceCraft创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门