拓冰建站拓冰建站
首页 / 资讯中心 / 正文

从10分钟录音到可分享的音色:RVC变声器6步实践指南

从10分钟录音到可分享的音色RVC变声器6步实践指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI手里有几分钟干净的人声录音又想反复用这个音色做配音、翻唱而不必每次重新录这是 RVCRetrieval-based-Voice-Conversion-WebUI解决的实际问题在网页界面里用少量语音训练出一个语音转换模型再把任意输入音频转成该音色。底模由约50小时开源 VCTK 数据集训练而来官方口径是10分钟低底噪语音即可训出可用效果。本文不按功能逐条讲解而是按一条真实任务走完整流程从原始录音到能分享出去的模型文件再到批量转换结果。训练集准备10分钟音频与底噪的关系在动代码之前先判断素材是否够格。官方 FAQdocs/cn/faq.md给出的建议比较具体10~50 分钟可以放心推荐的区间音质高、底噪低且音色有个人特色时多多益善。5~10 分钟可行前提是素材精简、音色特征明显。1~2 分钟有人成功过但经验不可复现只适合特征极强如高频气声明显的音色且音质高的素材。1 分钟以下没有公开成功先例不建议尝试。同一环节还有两个会直接让第一次训练失败的坑路径含特殊符号 → ffmpeg 报错。训练集文件名或目录里的空格、括号、中文路径可能让 ffmpeg 读取失败或在写 filelist.txt 时出现 utf8 错误。做法素材统一放进纯英文数字路径的目录并重新命名。音频太长 → 预处理时内存炸掉。训练时出现文件页/内存错误先把提取音高和处理数据使用的 CPU 进程数拉低再手工把过长的音频切短。素材过关后环境才能真正开始搭。环境部署按显卡类型安装依赖环境要求 Python 3.8 以上NVIDIA 卡CUDA、A 卡Windows 走 DirectML、Linux 走 ROCm、Intel 核显/独显IPEX仅 Linux三选一。先取代码并装 N 卡依赖git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install torch torchvision torchaudio pip install -r requirements.txt换硬件时只改最后一行A/I 卡Windows用requirements-dml.txtAMD ROCmLinux用requirements-amd.txtIPEXLinux用requirements-ipex.txt。macOS 用户可以直接跑仓库自带的run.sh。还要补齐两样东西ffmpegUbuntu/Debian 执行sudo apt install ffmpegmacOS 执行brew install ffmpegWindows 把 ffmpeg.exe 和 ffprobe.exe 放到项目根目录。音高模型想用 RMVPE下一节说明为什么就把 rmvpe.pt 下载到项目根目录。RVC 推理和训练依赖的预训练模型hubert、uvr5_weights、pretrained 等放在 assets/ 目录可用 tools/download_models.py 批量下载。首次启动常撞的两个错Windows 报llvmlite.dll加载失败安装 VC 运行时库vc_redist.x64后重启 WebUI 即可WebUI 弹出 Expecting value: line 1 column 1基本是代理问题关掉局域网/全局代理包括服务端的 http_proxy 设置再试。环境通了就可以跑第一次训练。跑通第一次训练启动 infer-web.py 并一键训练python infer-web.py # Windows 直接双击 go-web.bat界面默认监听 7865 端口--port可改。启动时 configs/config.py 会把 configs/ 下的 v1/v2 配置32k/40k/48k自动拷贝到configs/inuse/之后只改 inuse 里的副本同时自动探测显卡——GTX 1060/1070/1080、P40、P10 这类老卡会强制切到 fp32显存 4G 及以下会把切分参数preprocess_per从 3.7 降到 3.0这些都不用手改。训练选项卡里填实验名、选 v2 48k、指定训练集文件夹一键训练会依次完成数据切分、特征提取、音高提取、训练、建索引。v2 48k 的默认参数见 configs/v2/48k.jsonbatch_size4、learning_rate1e-4、lr_decay0.999875、segment_size17280、采样率 48000Hz、128 维 mel 谱。最容易卡住的两个点CUDA out of memory。训练时把 batch_size 从 4 往下减最低 14G 显存还能跑4G 以下如 3G 的 1060官方建议直接放弃。total_epoch 填多少。训练集音质一般、底噪大时20~30 轮就够调太高只会放大噪声高音质、低底噪、时长多时可以放到 200。别照着配置里 20000 的上限填。训练完成后模型已能在推理选项卡使用但 logs 目录里的文件还不是该分享的那个。推理参数调优index_rate、protect 与音高算法各自的作用RVC变声器区别于普通转换的关键在检索机制推理时用 top1 检索把输入源特征替换为训练集特征从源头拦住源音频或底模的音色渗进结果。index_rate0~1控制这个替换的强度调到 1理论上无音色泄漏但音质向训练集靠拢——训练集音质低于源音频时调高反而降音质调到 0 则完全放弃检索保护。训练集优质且时长足够、训练轮数拉高后模型本身很少引用源音色索引甚至可以省掉。音高提取四种算法按条件选算法适用场景已知限制RMVPE默认选择InterSpeech 2023 方法效果最好且根治哑音无声问题需额外下载 rmvpe.pt 放到根目录缺文件不可用Harvest精度上限最高要求音高精确还原时使用速度慢、资源占用高Dio精度与速度的折中两侧无明显短板也无明显优势PM低配置设备首选CLI 工具的默认选项精度四者中最低另两个影响成品的参数protect默认 0.33防止气声部分被转成噪声转出来响度和源不一致时用rms_mix_rate默认 1微调。参数解释的完整版本在 docs/en/faq_en.md。参数调顺之后模型才谈得上交付给别人用。提取并分享 60MB 的正式模型logs/实验名下的 pth 是几百 MB 的实验状态文件用途是复现和继续训练不是给推理的。把它复制到 weights 目录强行推理会直接报 f0、tgt_sr 等 key 不存在的错误。正确交付流程用 ckpt 选项卡做小模型提取输入路径填 logs 下的 G 开头文件自动或手工选择是否携带音高、目标采样率输出为weights/下 60MB 以上的 pth。分享时把weights/exp_name.pth 与 logs/exp_name/added_xxx.index 一起打包索引是检索机制的依赖只发 pth 会丢失音色保护。想混合两种音色在同一选项卡用 ckpt-merge 合并两个权重即可。训练集中途要加数据新建一个实验名把上次最新的 G 和 D 文件拷进新实验目录再一键训练会从上次进度继续。模型可以交付后下一步是把它用进真实流程。脱离 WebUI批量转换与实时变声需要整文件夹批处理或实时变声时仓库有两个现成入口。命令行单文件转换tools/infer_cli.py参数全部可控python tools/infer_cli.py --f0up_key 0 --input_path input.wav \ --index_path logs/exp_name/added_IVF677_Flat_nprobe_7.index \ --f0method harvest --model_name exp_name \ --opt_path output.wav --index_rate 0.66 --device cuda:0常用参数--f0up_key升降调0 为不变--index_rate默认 0.66--filter_radius默认 3--resample_sr默认 0不重采样--protect默认 0.33。批量推理另有 tools/infer_batch_rvc.py。实时 RVC变声Windows 双击go-realtime-gui.bat进入实时变声界面官方实测端到端延迟 170ms换用 ASIO 输入输出设备可压到 90ms但非常依赖硬件驱动支持。要转换完整歌曲时可先用内置 UVR5 把人声和伴奏分离对人声单独推理后再与原伴奏混回。可以立即执行的下一步选一段 10 分钟低底噪录音把目录改成纯英文路径在训练选项卡完成一次切分→训练→建索引完整流程确认输出音色与素材一致。同一源音频分别用index_rate0 和 1 各推理一次对比哪次有音色泄漏、哪次音质下降据此定出适合自己训练集的取值。用 ckpt 选项卡提取小模型连同 index 打包发给另一台机器做一次往返验证。需要处理整文件夹素材时把第 6 节的单文件流程写成脚本用 infer_cli.py 批量跑并记录每次的参数与耗时。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门