第033章:ComfyUI视频制作LTX-2.3模型(图像音频转视频)

发布时间:2026/7/24 19:18:51
第033章:ComfyUI视频制作LTX-2.3模型(图像音频转视频) 特别说明本篇文章是建立在前期文章的基础上的有些前期文章已经讲过的细节问题本章内容可能不会重复若有看不懂的地方请先看前期文章。上一章我们实现了LTX-2.3模型首尾帧视频工作流的搭建。这一章我们将去实现LTX-2.3模型图像音频转视频工作流的搭建。图像音频转视频就是给一个人物的照片再给一段录音让图片中的人物把这段录音说出来。有的同学可能会说了LTX不是本身就能生成音频吗为啥还要单独去弄个录音因为如果我们要创建一个数字人模特除了外形好看他的声音也得有自己的特色就像我们人一样每个人都有自己的音色那么我们的数字人也是需要自己固定的音色的。你不能今天说话是这个声音明天又变成了另外一个声音。和前面一样我们先去看官方的图像音频转视频工作流是怎么搭建的。一、官方高度集成版工作流第一步进入模板第二步搜索“LTX-2.3”,选择“图像音频转视频”工作流先看看他所用到的模型这些模型文件我们前面已经下载好了这里重新选择一下改成自己的路径就ok了我们先用这个工作流试试效果这里有个小技巧大家看下图我给的这个音频是7s的时长我给的视频长度要求是8s。因为如果视频也要求7s的时长的话那么视频最后的一个字一般都不完整。二、图像音频转视频工作流详解这个工作流是做数字人很实用的工作流我们就参考官方工作流来一步一步的来自己搭建一个属于自己的工作流。1加载模型文件这里面用到的文件我们前面都已经下载过了直接用就行。lora是ltx官方替工的一个加速lora。2加载两个clip文版框用来输入提示词。3添加视频分辨率高、宽、帧率、时长这里需要注意LTX2.3要求视频分辨率的高、宽必须能比32整除因此其720P视频的分辨率为 横板1280 × 704 竖版704 × 1280、1080P视频的分辨率为横板1920 × 1056 竖版896 × 1536。4加载图片并对图像进行处理详细介绍请看前期文章5构建生成尺寸二分之一的图像潜空间缩小采样提升速度详细介绍请看前期文章6音频材料加载7音频裁剪由于有时候音频时长会比较长比如1分钟我们没法一次性生成一个1分钟的视频需要分段去生成因此需要对音频进行裁剪。设置一个起始时间裁剪一段和视频时长相同的音频。8构建音频的潜空间这里面我们需要主义的是这个“纯快遮罩”他的作用是生成一张纯色、无渐变、矩形整体遮罩图。明度 0.0全黑遮罩采样器看到这个 mask音频 latent 整片区域禁止添加噪声这样音频编码出来的特征全程被保护采样过程不会破坏音频信息保障音画联动、口型稳定不会出现音频条件失效。明度 1.0全白遮罩采样器允许对 audio_latent 正常加噪声。这样模型会改动音频潜空间容易破坏原始音频特征大概率导致音画脱节、口型乱掉。9汇总提示词条件和帧率10将视频和音频汇总到一个潜空间11实现初次采样详细介绍请看前期文章12对初次采样的结果进行二次放大因为我们在初次采样时是在原本设置的分辨率上缩小1/2进行采样的所以需要加一个二次放大再使图像恢复到原本的分辨率。我的电脑配置如果不加二次放大直接一次采样出结果720P的视频会比先一次缩小采样 加 二次放大采样多出来近1倍的时间。13对放大后的图像进行二次采样 并 输出视频。---------结束线---------到这里我们图像音频转视频的工作流就全部搭建好了。本篇文章发布后我会在我们的交流群把今天我们搭建好的工作流文件分享到群共享文件。有兴趣的朋友可以加一下交流群平时学习中有什么困惑也可以和群里的朋友们互相交流。如果大家在阅读文章的时候有什么困惑可以在文章的底部留言我看到的第一时间就会进行回复。再一个也可以在赞赏文章后针对所赞赏文章的内容有不明白的地方可以和我约个时间进行一对一的实时交流赞赏金额不限制多少都可以