【ComfyUI】SDXL + ControlNet 姿态搭配深度,涂鸦融合手办制作
今天展示的案例是一套Flux 参考图像生成人像手办工作流。它基于 ComfyUI 的模块化结构,通过引入 FLUX 模型与多种辅助节点,实现从参考图像到高质量人像手办的自动化生成。效果表现不仅体现在半身与全身视角的塑造,还能在细节控制、光影渲染与分辨率提升方面展现出强大的灵活性。从整体流程来看,工作流将图像预处理、特征提取、条件引导和放大优化紧密结合,使生成的结果在保留参考特征的同时更加符合手办的造型质感。文章目录工作流介绍核心模型Node节点全身生成工作流程半身生成工作流程大模型应用CLIPTextEncode(正向) 手办风格语义主导器CLIPTextEncode(负向) 质量约束与瑕疵抑制FluxGuidance 提示词影响力度强化IPAdapterFaceID 人脸特征对齐与语义融合ControlNetApplyAdvanced(三次串联) 结构保持与语义同步使用方法应用场景开发与应用工作流介绍该工作流依赖于多个关键模型,包括基础的 SD15 检查点模型、Flux 深度网络、CLIP 文本编码器、VAE 编码解码器以及 ESRGAN 超分模型等。它们分别承担了风格底座、深度信息融合、语义提示控制、潜空间转换与画质增强的任务。整体的核心思想是在 Flux 的架构中嵌入 IPAdapter 和 ControlNet,使参考图像能够精准地转化为目标手办形象。核心模型在核心模型的选择上,系统引入了 Flux1 深度开发版作为生成主干,通过 DualCLIPLoader 加载 T5 与 CLIP 组合模型来处理文本条件,同时配合 VAE 模块完成潜空间与图像的映射。为保障分辨率与画面细节,采用 ESRGAN 超分模型进行最终放大。每个模型的作用环环相扣,既有对图像整体风格的把控,也有对细节层面的增强。模型名称说明SD15 Checkpoint提供基础风格与训练底座,用于支撑整体视觉风格的生成Flux1-depth-dev-fp8核心 UNet 模型,结合深度信息进行人像生成