RVC 语音克隆快速上手:从 10 分钟录音到可用音色模型
RVC 语音克隆快速上手从 10 分钟录音到可用音色模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI只有 10 分钟干净录音能不能练出一个能唱歌、能配音的音色模型RVCRetrieval-based-Voice-Conversion-WebUI是一个基于 VITS 的开源语音转换框架把这件事变成了网页界面里的几次点击。本文带你从零走到产出第一段转换音频。项目定位语音转换框架与 Web 界面是什么关系RVC 做的是语音转换Voice Conversion输入一段任意说话人的音频输出保持原内容和节奏、但换成目标音色 timbre 的音频。它把训练和推理全部封装在 Gradio 网页界面里不用写代码。低门槛训练4G 显存的显卡也能跑程序会根据显卡型号自动降级精度fp16/fp32top1 检索特征混合用训练集特征替换源特征减少音色泄漏输出听起来像底模而不是目标人内置 UVR5网页内就能做人声/伴奏分离唱歌场景的前置工具RMVPE 音高提取唱歌场景下的音高预测算法速度和质量优于旧方案环境要求与安装命令依赖清单Python 3.8 及以上FFmpeg音频解码用NVIDIA CUDA 显卡可选无独显也能用 CPU、macOS 用 MPS、Windows 核显走 DirectML对应requirements-dml.txt等变体依赖文件git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install torch torchvision torchaudio pip install -r requirements.txt python tools/download_models.py python infer-web.pyWindows 用户也可以直接双击go-web.batmacOS 用户运行sh ./run.sh。预训练权重由 tools/download_models.py 自动下载到assets/目录首次启动前请保持网络畅通默认监听 7865 端口冲突时用--port换端口。四步拿到第一段转换音频准备数据把目标音色的 10 分钟以上音频WAV/MP3采样率 32k/40k/48k放进一个文件夹单段 3–10 秒、底噪低。处理数据打开训练标签页填实验名和训练文件夹路径点处理数据——自动切片、去静音、响度归一化产物落在datasets/目录。一键训练设置目标采样率、总轮数等参数点一键训练模型训练和索引训练一起完成产物在logs/目录。单次推理切到模型推理 → 单次推理选择刚训出的.pth模型和对应added_*索引文件上传一段测试音频点转换即可听到结果。训练参数推荐起始值参数推荐起点对产出的影响目标采样率40k源音频 48k 时选 48k决定音质上限48k 对训练集质量要求更高总训练轮数 total_epoch300–1000轮数越多音色越稳超过 2000 收益递减每显卡 batch_size4显存不足降到 2大显存可提到 8检索特征占比 index_rate0.7–1.0调高减少音色泄漏但音色会偏向训练集protect0.33默认保护辅音清晰度过高音色发虚场景实战AI 唱歌、实时变声与批量转换场景一AI 唱歌训练时勾选模型带音高指导唱歌一定要输入用 UVR5 分离出的干声推理时用变调半音对齐歌曲音域。注意唱歌对数据要求更高建议 15 分钟以上高质量演唱样本否则会出现音高漂移和破音。场景二实时变声Windows 下双击go-realtime-gui.bat启动独立实时 GUI加载已训模型后以麦克风为输入实时输出。注意端到端延迟取决于声卡驱动ASIO 设备可以显著压低延迟出现杂音时先降低处理块长。场景三批量转换 人声分离先在伴奏人声分离标签页用 UVR5 把歌曲拆成人声与伴奏再对整条人声做批量推理。注意分离残留会直接影响转换质量建议先用短片段试一版再跑全曲。训练坑位现象到解法速查现象转换后提示找不到 ffmpeg、音频无法读取。原因大概率不是 ffmpeg 缺失而是路径含中文或特殊字符。解法把项目目录和音频路径整体改为纯英文短路径。现象一键训练结束但没有added开头的索引文件。原因训练集过大内存内建索引卡住。解法重新点击训练特征索引项目已改用批处理方式建索引见 docs/cn/faq.md 对应条目。现象训练中途报 out of memory。原因显存不足。解法batch_size 降到 2 并关闭其他占显存程序小显存卡会在 configs/config.py 中自动切 fp32属正常现象。现象输出音色跑偏像底模或推理源音色泄漏。原因index_rate 过低推理源音色混入。解法把 index_rate 调到 0.7–1.0 重新推理训练集优质且时长足够时直接加总轮数从根上缓解。现象特征提取极慢甚至内存爆掉。原因CPU 进程开得过多。解法把提取音高和处理数据使用的 CPU 进程数降到 1–4。先拿手头 10 分钟录音把第一个模型跑通参数异常时按现象查 docs/cn/faq.mddocs/目录内还备有多语言版说明可对照阅读。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考