【ComfyUI】ACE-Step v1 风格重置歌曲生歌曲
今天给大家演示一个ACE-Step V1 音频生成与重绘的 ComfyUI 工作流。这个流程结合了文本编码、潜空间操作、采样与解码的完整链路,可以将多语言歌词转化为可控的歌声与音频输出。通过加载ACE-Step 模型,再配合音频的 VAE 编码与解码,不仅能实现从文本到音频的合成,还能对已有音频进行“重绘”(repainting),比如修改歌词、调整音色或控制输出的差异度。最终结果支持多种格式导出(MP3、WAV、Opus),便于在不同平台应用。文章目录工作流介绍核心模型Node节点工作流程大模型应用TextEncodeAceStepAudio 多语言歌词语义编码与风格控制ConditioningZeroOut 语义清空与重绘纯净处理使用方法应用场景开发与应用工作流介绍这个工作流以ACE-Step v1.3.5b 模型为核心,结合 ComfyUI 的多种 Node 节点,实现了从文本/歌词输入,到潜空间音频生成,再到最终音频输出的完整链路。模型部分主要负责音色与生成逻辑,Node 节点部分则支撑了音频加载、潜空间变换、采样控制以及最终的音频保存。整体架构清晰,既能作为文本转音频的生成方案,也能作为音频编辑与重绘的实验工具。核心模型核心部分使用ACE-Step V1模型,它是一个支持多语言歌词输入的音频生成模型,能够把文本特征转化为音频潜变量,并通过 VAE 解码得到最终音频。其特点是多语言输入需通过手动标注语言代码(如[zh]中文、[ja]日语),从而实现跨语言的歌声生成。模型名称说明ace_step_v1_3.5b.safetensorsACE-Step V1 音频生成模型,支持多语言歌词输入,负责音频潜变量的生成与合成