拓冰建站拓冰建站
首页 / 资讯中心 / 正文

音频分离保姆级实战:5 步从一首歌里提取干净的人声与伴奏,全程免费

音频分离保姆级实战5 步从一首歌里提取干净的人声与伴奏全程免费【免费下载链接】python-audio-separatorEasy to use stem (e.g. instrumental/vocals) separation from CLI or as a python package, using a variety of amazing pre-trained models (primarily from UVR)项目地址: https://gitcode.com/gh_mirrors/py/python-audio-separator想做翻唱视频却找不到无损伴奏想给家人录一首卡拉OK却拿不到纯音乐别急着花钱买素材一个免费开源的音频分离工具就能帮你从任意一首歌里把人声分离出来、把伴奏单独提出来甚至把鼓、贝斯、吉他、钢琴一根根拆开。这个项目叫 python-audio-separatorPyPI 包名audio-separator纯命令行加 Python 双通道使用一次安装、终身受用。下面我就用 5 个实战步骤带你亲手完成一次完整的伴奏提取全程照着抄就行。动手前先弄明白音频分离到底在拆什么你可以把一首歌想象成一张合成照片——人声是前景人物鼓、贝斯、吉他是背景景物全部叠在一张底片上。音频分离要做的就是根据声音的频率特征用训练好的深度学习模型把这张底片重新分层。python-audio-separator 的核心是调用了终极人声移除UVR社区训练的几十个成熟模型你不需要懂任何声学知识它替你完成了一切。工具的公开文档在仓库根目录的README.md架构实现集中在audio_separator/separator/architectures/目录支持的模型清单和预设组合也都有现成文件可查。在动手之前先看一眼输入素材长什么样。下面这张是原始歌曲的频谱图人声、乐器全都混在一起第一步一分钟装好开源音频分离工具新手 CPU 也能跑安装没有想象中复杂核心依赖就一行命令pip install audio-separator[cpu]如果你的电脑有 NVIDIA 显卡把后缀换成[gpu]就能享受 CUDA 加速pip install audio-separator[gpu]如果你用的恰好是 Apple M1/M2 芯片的 Mac同一个[cpu]安装包会自动启用 CoreML 加速速度也很可观。装完跑一条自检命令确认环境没问题audio-separator --env_info如果日志里提示需要 FFmpeg根据你的系统装一下即可——在 Ubuntu 上是apt install ffmpegmacOS 上是brew install ffmpeg装好再跑一次自检就能通过。第二步准备一首歌记住这 3 个选歌小建议工具支持 WAV、MP3、FLAC、M4A 等几乎所有常见格式所以你手头有什么就能用什么。不过为了让分离效果达到最佳建议你优先用 WAV 或 FLAC这类无损格式信息保留得越多分离越干净采样率 44.1kHz 或 48kHz 是舒适区太低的采样率会让高频人声细节丢失先拿一首歌试手比如自己熟悉的流行歌方便你凭耳朵判断分离质量。把歌曲文件放在一个单独的文件夹里比如~/music/后面所有输出也会默认写到当前目录方便管理。第三步一条命令完成人声分离跑出第一对伴奏与人声这是最让人上瘾的一步。进入歌曲所在目录运行audio-separator song.wav就这么一句。工具会自动下载默认的分离模型一个经过验证的 BS-Roformer 模型然后开始处理。不需要你提前下载任何模型文件它会自己搞定并缓存到本地下次再用秒加载。处理完成后你会在当前目录看到两个新文件song_(Vocals)_model_bs_roformer_ep_317_sdr_12.flac song_(Instrumental)_model_bs_roformer_ep_317_sdr_12.flac命名规则很好懂原文件名 音轨名 模型名默认输出无损 FLAC 格式。这时候看一眼对比图就明白了。下面这张是分离出来的人声音轨频谱图可以看到中高频段呈现出规律的谐波结构这正是人声元音、辅音的能量分布特征人声分离后的人声音轨频谱图而另一张是提取出的纯伴奏波形图波形密集、几乎没有停歇说明鼓点、和声、垫底音全部被保留了下来伴奏提取后的纯伴奏波形图戴上耳机听一听只要人声那轨清唱基本干净、伴奏那轨听不到明显的人声残留第一次分离就算成功了。第四步换模型调参数让伴奏提取更干净默认模型对大多数歌都够用但不同歌曲、不同需求适合的模型也不同。你可以先看看工具里到底有多少武器audio-separator --list_models列表会按音轨类型和信噪比SDR评分排序。想专门找分离人声的强模型可以这样过滤audio-separator -l --list_filtervocals --list_limit5挑中了某个模型用-m指定即可audio-separator song.wav -m UVR_MDXNET_KARA_2.onnx常用参数我再列几个都是日常高频操作只输出一个音轨--single_stemVocals比如你只要清唱素材换个输出格式--output_formatMP3 --output_bitrate320k视频剪辑需要 MP3 时很好用指定输出目录--output_dir./separated别让文件散落一地一键组合多个模型--ensemble_presetvocal_balanced这是社区实测过的人声最优组合效果往往比单模型更稳。第五步不止人声与伴奏一次拆出鼓、贝斯、吉他、钢琴两轨只是开胃菜。换一个多音轨模型一首歌能直接拆成 6 条audio-separator song.wav -m htdemucs_6s.yaml运行之后你会得到Vocals、Drums、Bass、Guitar、Piano、Other六个文件。下面这张就是拆出来的贝斯音轨频谱图能量几乎全部集中在低频段——这就是贝斯的声音指纹音频分离提取的贝斯音轨频谱图拿到分轨之后你可以用来重新混音、做采样甚至给乐器单独做练习伴奏。接下来这几个场景也值得记下超长音频不怕内存爆一首歌可能很快跑完但如果你要处理一小时的播客记得加--chunk_duration 600工具会自动把音频切成 10 分钟一段处理再拼回去内存占用可控、质量无损批量处理直接传入多个文件或一个文件夹模型只加载一次省时省内存Python 集成想把这套能力装进你自己的脚本几行代码就够from audio_separator.separator import Separator separator Separator(output_diroutput, output_formatFLAC) separator.load_model(model_bs_roformer_ep_317_sdr_12.9755.ckpt) files separator.separate(song.wav) print(files)如果你更想跑最新源码而不是装稳定版可以克隆仓库自行开发git clone https://gitcode.com/gh_mirrors/py/python-audio-separator仓库里自带的tests/inputs/reference/目录存有一整套分离前后的对比素材audio_separator/ensemble_presets.json则是现成的预设组合想深入研究都可以直接翻源码。收尾清单与常见问题速答到这里你已经走完了选歌 → 安装 → 分离 → 调优 → 多音轨的完整链路。最后送你一份自查清单和几个高频问题的答案✅ 第一次分离就成功人声与伴奏两个文件都生成了吗✅ 是否试过--list_filter找到更适合这首歌的模型✅ 做视频时记得用--single_stem只导出需要的音轨省空间也省时间。✅ 处理长音频前养成加--chunk_duration的习惯。模型下载失败怎么办国内网络偶尔不稳定可以重试几次或者把模型文件提前手动放到模型缓存目录命令加--model_file_dir指定即可。分离出来人声有残留试试 SDR 评分更高的模型或者用vocal_clean、instrumental_clean这类针对性预设它们专门为减少串扰调过参。电脑配置低能跑吗完全能。CPU 模式下慢一些但照样能出活低配机器可以先从 2 音轨模型开始别一上来就跑 6 音轨。音频分离这件事以前是录音棚的专属技能现在一条命令就能在家复现。打开终端试一次你会发现翻唱、做伴奏、拆分轨真的只是几分钟的事。【免费下载链接】python-audio-separatorEasy to use stem (e.g. instrumental/vocals) separation from CLI or as a python package, using a variety of amazing pre-trained models (primarily from UVR)项目地址: https://gitcode.com/gh_mirrors/py/python-audio-separator创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门