10 分钟录音训练专属音色模型:RVC 变声器从录制到批量换声的完整指南
10 分钟录音训练专属音色模型RVC 变声器从录制到批量换声的完整指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based Voice Conversion WebUI是一个开源的语音克隆与变声器工具。你给它 10 到 50 分钟的人声录音它训练出一个属于你的音色模型之后任何音频丢进去都会用那个音色重新输出。给视频配音、给游戏角色换声、做翻唱又不想碰音频工程细节的人用的就是它。要准备多少录音录的时候注意什么数据量决定效果上限这是整个流程里唯一不可逆的一步。官方 FAQ 的建议是总时长 10 到 50 分钟——因为模型靠这些样本覆盖你不同的发音状态样本越足音色还原越稳。如果你的录音干净、底噪低、音色有辨识度5 到 10 分钟也能训出可用模型但上限就锁住了。录的时候把握三件事环境安静。底噪会直接进模型训练轮次再高也压不下去语速、语调、情绪要有变化。别只念一种腔调模型靠这些样本学会不同的发音状态单条片段控制在几十秒到一两分钟。过长的录音在切分和内存占用上都是负担录完统一转成 WAV 即可。采样率不用纠结预处理阶段会自动重采样到训练时选定的档位。我的机器跑得动吗显存、内存和软件够不够先说结论4GB 显存的显卡可以完成训练和推理。程序启动时会自己读显存大小并调整内部参数4GB 以下会自动改用更保守的分块配置。但如果你只有 3GB、2GB 的老卡官方 FAQ 的建议是直接放弃只能换卡或租云 GPU。除了显存还有三样前提不能省系统内存。切分和音高提取吃 CPU 多进程内存不够时把CPU 进程数调低或手动把训练音频切短些ffmpeg。切分和重采样全靠它Ubuntu 上sudo apt install ffmpegmacOS 上brew install ffmpeg预训练底模。仓库里各平台的 dlmodels 脚本就是用来下载 assets 目录底模的缺了底模训练和推理都起不来最快跑通的路径从拉代码到一键训练接下来所有命令都在项目根目录执行。# 拉取仓库代码 git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI进入目录后建虚拟环境并按显卡装依赖# 建环境并安装依赖按 CUDA 版本选文件 python -m venv rvc-env # 激活 rvc-env 后执行 pip install -r requirments_cu118_py312.txt有 CUDA 11.8 的卡选requirments_cu118_py312.txtCUDA 12.8 选requirments_cu128_py312.txt纯 CPU 选requirments_cpu_py312.txt仓库里三个文件都在根目录。然后启动训练网页# 启动 WebUI浏览器自动打开 7865 端口 python webui.py7865 是 configs/config.py 里写死的默认端口被占用时可以用--port换。Windows 用户也可以直接双击 go-webui.bat 走整合包路线。打开训练页后值得动的数字就三个其余保持默认参数英文 / 中文设置建议这样设的理由batch size批次大小用页面默认值OOM 就往下调默认按显存大小自动估算约为显存 GB 数的一半是稳定起步值save epoch保存间隔每 10 轮存一个点间隔小才能逐个试听挑出最早达标的那个避免过拟合total epoch总轮数数据有底噪 20~30 轮干净且时长足可到 200 轮底噪大的数据训太多轮模型只会把噪音也学进去官方 FAQ另外两项影响明显顺手设一下采样率选 48k 对应 v2 底模这是官方配置里质量上限最高的一档配置见 configs/v2/48k.json音高提取算法选 rmvpe界面标注它效果最好且只占少量显存harvest 低音更好但极慢pm 适合歌声输入提速。确认训练集文件夹路径、填一个实验名后面找模型全靠它点一键训练。流程会依次执行切分、音高提取、特征提取、训练主逻辑在 train/train.py全程日志写在logs/实验名/下。为什么训练完声音不像两步没做对相似度就会打折。漏了索引训练相似度直接打折索引文件决定结果保留多少训练集的音色。跳过它推理出来的声音音质可能不错但音色对不上。在网页上点训练索引它会用 faiss 把训练特征聚成检索库产物是logs/实验名/下added_开头的.index文件。如果一键训练结束没看到索引多半是训练集太大卡住了索引添加步骤重按一次训练索引即可这是官方 FAQ 里明确说明的情况。index rate 没调对音色泄露或音质受限切到模型推理页点刷新音色选你的模型和索引上传一段音频转换。重点调的是检索特征占比index rate范围 0 到 1默认 0.75调高接近 1音色完全锚定训练集不会漏出输入源或底模的音色但音质上限被训练集锁死调低到 0不做检索保护音质可能更好但音色泄露问题会回来训练集本身优质且时长足时这个值反而不重要模型自己已经不太引用外部音色变调是整数半音12 升八度、-12 降八度。保护滑条protect默认 0.33专门防清辅音和呼吸声撕裂输出有电音时往高调。批量转换和实时变声能不能做能两个方向都有现成入口。批量转换不用开网页命令行直接跑tools/infer_batch_rvc.py# 批量转换 input 目录下每个 wav 到 output 目录 python tools/infer_batch_rvc.py --model_name 实验名 \ --input_path ./input --opt_path ./output \ --index_path logs/实验名/added_xxx.index \ --f0up_key 0 --f0method rmvpe目录里每个.wav会被逐个转换输出到--opt_path指定的文件夹。想说话实时变声双击 go-realtime_gui.bat 启动实时界面。官方给出的延迟数据是端到端 170ms——这是完整链路实测值换成 ASIO 输入输出设备可压到 90ms但后者非常依赖声卡驱动支持普通 USB 声卡别期待这个数字。30 秒自查清单训练跑完之后按这个顺序花 30 秒验证一遍全过就是通了✅ 录音总时长到了 10 分钟以上且底噪听感干净——数据量是效果上限先确认它✅logs/实验名/下有added_开头的.index文件——没有就回网页重按一次训练索引✅ 推理页 index rate 保持在 0.75 附近保护滑条protect没被乱调✅ 挑一个保存点模型把 10 分钟录音里没用过的一段音频扔进去转换听音色对没对对上了整个流程就通了。接下来可以试试批量脚本和实时界面把换声嵌进你的工作流里。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考