ComfyUI models 目录完整指南(31个文件夹全解析)
这是一份史上最全的 ComfyUI models 目录详解。31个文件夹逐个拆解英文全称、中文含义、命名由来、核心作用、存放什么模型、常见模型举例。让你从零基础到彻底搞懂每个文件夹的用途。 为什么需要了解这些文件夹ComfyUI 采用模块化设计不同类型的 AI 模型各司其职。这种目录结构并非随意设定而是 ComfyUI 核心代码通过folder_paths.py文件严格定义的标准路径。只有把模型文件放到正确的位置ComfyUI 才能在加载节点时自动识别它们。一句话放对位置才能正常工作。放错位置节点里根本看不到你的模型。️ 完整目录全景图31个文件夹ComfyUI/models/ ├── 1. audio_encoders/ # 音频编码器视频生成专用 ├── 2. background_removal/ # 背景移除模型 ├── 3. checkpoints/ # ⭐ 基础大模型最常用 ├── 4. clip/ # CLIP 文本编码器 ├── 5. clip_vision/ # CLIP 图像编码器 ├── 6. configs/ # 配置文件 ├── 7. controlnet/ # ControlNet 控制模型 ├── 8. detection/ # 目标检测模型 ├── 9. diffusers/ # Diffusers 格式模型 ├── 10. diffusion_models/ # 新一代扩散模型FLUX/WAN等 ├── 11. embeddings/ # Textual Inversion 嵌入 ├── 12. frame_interpolation/ # 帧插值视频补帧 ├── 13. geometry_estimation/ # 几何估计深度/法线 ├── 14. gligen/ # GLIGEN 布局控制 ├── 15. hypernetworks/ # 超网络微调 ├── 16. latent_upscale_models/ # 潜空间放大模型 ├── 17. LLM/ # 大语言模型 ├── 18. loras/ # ⭐ LoRA 微调模型 ├── 19. model_patches/ # 模型补丁 ├── 20. onnx/ # ONNX 格式模型 ├── 21. optical_flow/ # 光流估计 ├── 22. photomaker/ # PhotoMaker 人像定制 ├── 23. sams/ # SAM 图像分割 ├── 24. style_models/ # 风格迁移模型 ├── 25. text_encoders/ # 大语言文本编码器T5/Gemma等 ├── 26. ultralytics/ # YOLO 检测模型 ├── 27. unet/ # UNet 模型旧版目录 ├── 28. upscale_models/ # 超分辨率放大 ├── 29. vae/ # ⭐ VAE 图像编解码器 ├── 30. vae_approx/ # VAE 近似轻量版 └── 31. yolo/ # YOLO 专用目录第一部分核心生成模型最常用1.checkpoints/—— 基础大模型英文全称Checkpoint检查点中文含义AI 模型在训练过程中保存的“快照”包含完整的神经网络参数。简单说它就是生成图像的“大脑”决定了图像的基础画风、质量和内容范围。为什么这么命名在深度学习中“checkpoint”指训练到某个阶段时保存的模型状态方便后续恢复训练或直接使用。作用所有图像生成的起点。没有它其他模型都无法工作。这是你最常访问的文件夹。常见模型举例模型名称特点适用场景sd_xl_base_1.0.safetensorsSDXL 基础模型画质细腻写实、艺术创作v1-5-pruned-emaonly.safetensorsSD 1.5 经典模型生态丰富动漫、二次元Illustrious-XL-v0.1.safetensors高表现力 XL 模型高质量插画RealisticVision_xxx.safetensors写实风格人像摄影DreamShaper_xx.safetensors梦幻风格插画、概念艺术建议优先使用.safetensors格式它比.ckpt更安全、加载更快。2.loras/—— LoRA 微调模型英文全称Low-Rank Adaptation低秩适配中文含义LoRA 是一种轻量级微调技术通过额外的小文件通常几十到几百MB在不修改主模型的前提下注入特定风格、角色或特征。为什么这么命名“LoRA”这个名称来源于其核心数学原理——对权重矩阵进行低秩分解Low-Rank Decomposition从而大幅减少需要训练的参数数量仅为原始模型的 0.1%~1%。作用作为 Checkpoint 的“插件”用于调整特定特征。可以同时叠加多个 LoRA实现风格、角色、服装等多个维度的组合控制。常见模型举例角色 LoRAchara_xxx.safetensors固定特定动漫角色风格 LoRAwatercolor_style.safetensors水彩风格服装 LoRAsuit_armor.safetensors盔甲服装细节增强detail_enhancer.safetensors增强纹理细节建议LoRA 可以叠加使用权重通常设置在0.2~0.8之间。按功能建立子目录分类如loras/character/、loras/style/、loras/clothing/。3.vae/—— VAE 图像编解码器英文全称Variational Autoencoder变分自编码器中文含义VAE 由两部分组成——编码器Encoder将像素图像压缩成 AI 内部的“潜空间latent space”数据解码器Decoder负责将潜空间数据解码成我们能看到的像素图像。在图像生成中我们最常用的是解码器部分。为什么这么命名“变分”指其数学优化方式变分推断“自编码器”指其编码-解码的对称结构。作用直接影响生成图像的清晰度、色彩和细节表现。换一个更好的 VAE图像质量会有肉眼可见的提升。好的 VAE 能消除图像中的“色块感”让色彩过渡更自然。常见模型举例模型名称说明vae-ft-mse-840000-ema-pruned.safetensors最常用的高质量 VAESD1.5/SDXL 通用flux-ae.safetensorsFlux 模型专用sdxl_vae.safetensorsSDXL 优化版sdxl_vae_fp16.safetensorsSDXL 半精度版省显存建议有些 Checkpoint 已经内置了 VAE但如果单独加载 VAE 节点会覆盖内置版本通常能获得更好的效果。4.diffusion_models/—— 新一代扩散模型英文全称Diffusion Models扩散模型中文含义这是 ComfyUI 中较新的官方目录用于存放骨干扩散模型特别是那些按“模型家族”组织的模型如 FLUX、WAN、QWEN、HiDream、LTX 等。为什么这样命名和组织随着模型生态日益丰富FLUX、WAN 等新一代模型如果全放进checkpoints/会非常杂乱。按模型家族分类存放管理更清晰也便于维护。作用和checkpoints/功能类似都是基础生成模型但更强调按模型家族分类。如果你使用的是 FLUX、WAN 等新模型应该来这里找对应的子目录。常见模型举例子目录包含模型FLUX/flux1-dev.safetensors、flux1-schnell.safetensorsWAN/WAN 视频生成模型系列QWEN/Qwen 系列模型LTX-2/、LTXV/LTX 视频生成模型HiDream/HiDream 图像生成模型MiniMax/MiniMax H3 系列建议优先查看这个目录是否已有你需要的模型家族分类按分类放入对应的子目录。5.unet/—— UNet 模型英文全称U-NetU 形网络中文含义UNet 是一种经典的卷积神经网络架构因其网络结构呈“U”形而得名先下采样编码再上采样解码中间有跳跃连接。为什么这样命名UNet 最早用于医学图像分割因其 U 形架构图而得名。在 Stable Diffusion 中UNet 是扩散模型的核心组件负责“去噪”过程——从随机噪声逐步生成图像。作用在早期版本中unet/用于存放单独的 UNet 模型文件。现在已逐步被checkpoints/和diffusion_models/取代但仍被一些旧版插件或自定义节点使用。常见模型举例一些旧版 SD1.5 的 UNet 分离文件自定义训练的分割模型注意新用户建议优先使用checkpoints/或diffusion_models/除非你明确知道自己在做什么。6.configs/—— 配置文件英文全称Configurations配置文件中文含义存放 YAML、JSON 等格式的模型配置文件定义模型架构参数如层数、通道数、注意力头数等。为什么这样命名简单的英文直译表示“配置”文件。作用当模型文件本身不包含架构信息时需要配套的配置文件来告诉 ComfyUI “这个模型长什么样”。常见模型举例文件名对应模型v1-inference.yamlSD1.5 配置v1-inference-vae.yamlSD1.5VAE 配置sd_xl_base.yamlSDXL 配置建议一般情况下不需要手动修改但如果你下载了单独的模型权重文件非 safetensors 完整包可能需要配合.yaml文件使用。第二部分文本与图像编码器7.clip/—— CLIP 文本编码器英文全称Contrastive Language-Image Pre-training对比语言-图像预训练中文含义CLIP 模型由 OpenAI 开发包含文本编码器和图像编码器两个分支。这里的clip/存放的是文本编码器负责将你的文字提示词Prompt转换成 AI 能理解的向量表示。为什么这样命名“CLIP”既是缩写也形象地描述了其核心思想——通过对比学习将文本和图像“拉近”到同一个向量空间进行匹配。作用你的正向/负向提示词就是通过 CLIP 文本编码器处理后才能传递给生成模型。CLIP 的质量直接影响模型对文字的理解能力。常见模型举例文件名说明clip_l.safetensorsSD1.5 标配clip_g.safetensorsSDXL 使用的更大版本有更多参数longclip-L.safetensors支持更长文本输入最多 248 个 token⚠️ 重要区分clip/和text_encoders/是两个不同的目录clip/仅存放 CLIP 系列的文本编码器而text_encoders/用于存放 T5、QWEN、GEMMA、LLAMA 等大语言模型编码器。8.clip_vision/—— CLIP 图像编码器英文全称CLIP VisionCLIP 的视觉分支中文含义和 CLIP 文本编码器对应CLIP Vision 是 CLIP 模型的图像编码分支负责将图像转换成向量表示。为什么这样命名它是 CLIP 模型的一部分专门处理视觉Vision输入因此叫clip_vision。作用用于图生图img2img、IP-Adapter图像风格迁移、Redux图像重绘、ControlNet 的图像引导等需要理解图像内容的场景。简单说当你想让 AI “看懂”一张图时就需要用到它。常见模型举例文件名说明clip_vision_h.safetensors标准版本最常用sigclip_vision.safetensors更强大的变体SigLIPViT-H-14-378-quickgelu.safetensorsViT 架构的大尺寸版本9.text_encoders/—— 大语言模型编码器英文全称Text Encoders文本编码器中文含义存放用于理解文本的大语言模型LLM编码器。这些模型通常比 CLIP 更强大能处理更复杂的语义、更长上下文和更细致的描述。作用新一代模型如 Flux、MiniMax H3、LTX 视频模型常常使用 T5、Gemma、Qwen 等强大的文本编码器来解析提示词比传统 CLIP 理解更精准、更深入。常见模型举例文件名对应模型用途t5xxl_fp16.safetensorsT5-XXLFlux 系列常用gemma-3-12b-itGemma 3LTX 2.3 视频模型使用qwen3vl_32b_minimax_h3.safetensorsQwen3VLMiniMax H3 视频模型专用t5-v1_1-xxl-encoderT5 v1.1兼容多种模型⚠️ 重要不要把 T5、Gemma 等模型放到clip/目录否则 ComfyUI 无法正确加载。它们走的是不同的代码路径第三部分控制与引导模型10.controlnet/—— ControlNet 精准控制英文全称ControlNet控制网络中文含义ControlNet 是一种辅助控制模型通过输入额外的引导信息如线稿、深度图、姿态骨架、边缘图等来精确控制生成图像的构图、姿态和布局。为什么这样命名直译“控制网络”一语中的——它就是用来“控制”图像生成过程的额外网络。作用让 AI 生成符合你指定姿态、构图的图像。比如你可以先画一个简单的人体骨架OpenPoseControlNet 会强制生成的人物符合这个姿态。常见模型举例文件名控制类型用途control_v11p_sd15_canny.safetensorsCanny 边缘检测保持线稿轮廓control_v11p_sd15_openpose.safetensorsOpenPose 姿态人体姿态控制control_v11p_sd15_depth.safetensors深度图三维构图控制control_v11p_sd15_seg.safetensors语义分割区域颜色控制xinsir-controlnet-union-sdxl.safetensors多合一一个模型支持多种控制类型sai_xl_depth_256lora.safetensorsSDXL 深度控制SDXL 场景深度控制11.gligen/—— GLIGEN 布局控制英文全称Grounded Language-Image Generation基于语言的图像生成中文含义GLIGEN 是一种通过文字描述指定物体位置的控制模型。你可以说“在图片左侧有一只猫右侧有一只狗”GLIGEN 就会精确控制物体出现在指定区域。为什么这样命名缩写完整名称描述了其核心思想将语言“落地”到图像的具体空间位置。作用比 ControlNet 更直观——直接用坐标和文字控制物体位置。适合需要精确布局的场景如海报设计、产品展示。常见模型举例gligen_sd15.safetensorsSD1.5 的 GLIGEN 模型相关配置文件.yaml使用方式GLIGEN 需要配合 GLIGEN 节点输入类似(0.2, 0.3, 0.6, 0.8)的坐标框和对应的物体描述文字。12.photomaker/—— PhotoMaker 人像定制英文全称PhotoMaker照片制作者中文含义PhotoMaker 是一种人像生成技术输入几张不同角度的人脸照片就能在生成图像中保持该人物的身份特征。为什么这样命名直译“照片制作者”——用照片生成新的人物形象。作用实现人像一致性生成输入 3~5 张人脸照片输出同一人物的不同场景/姿态图像。常见模型举例photomaker-v1.safetensorsphotomaker_style.safetensors第四部分目标检测、分割与几何估计13.ultralytics/—— Ultralytics 检测模型英文全称Ultralytics公司名中文含义Ultralytics 是开发 YOLOYou Only Look Once目标检测系列的公司。这个目录存放 Ultralytics 格式的目标检测模型文件。为什么这样命名直接以开发公司名称命名因为 Ultralytics 生态庞大YOLO 系列在目标检测领域地位举足轻重。作用用于检测图像中的人脸、手势、人体姿态、物体等位置和类别。常见模型举例文件名检测类型yolov8n-face.pt人脸检测yolov8n-pose.pt人体姿态关键点检测yolov8x.pt通用目标检测80 类别yolov8m-seg.pt目标分割带掩膜yolov9c.ptYOLOv9 通用检测14.yolo/—— YOLO 专用目录英文全称You Only Look Once你只看一次中文含义YOLO 是一种经典的目标检测算法特点是速度快——只需“看一眼”就能同时检测出图像中所有目标的位置和类别。为什么这样命名这个名字有两层含义一是算法本身采用单阶段检测一次性完成所有目标的识别和定位区别于两阶段方法二是一种自豪的命名——“我只看一眼就能认出一切”。作用yolo/是用于存放 YOLO 模型的另一个目录。在部分 ComfyUI 版本或插件中会直接读取这里而非ultralytics/。两者功能重叠需要看具体插件读取哪个目录。常见模型举例yolov8n-face.ptyolov8n-pose.ptyolov8x.pt注意ultralytics/和yolo/功能重叠具体使用哪个取决于插件。建议两边都保留一份常用的 YOLO 模型确保兼容。15.detection/—— 检测模型通用目录英文全称Detection检测中文含义存放各类目标检测模型的通用目录不限于 YOLO。作用作为检测模型的补充存放位置容纳各种检测相关的模型文件。常见模型举例其他开源检测模型如 DETR、FCOS 等专用检测器如手部检测、人脸检测16.sams/—— SAM 图像分割英文全称Segment Anything Model分割万物模型中文含义MetaFacebook推出的图像分割模型可以精确分割图像中的任何对象无需额外训练。用户可以通过点击/框选指定要分割的区域。为什么这样命名直接沿用 Meta 的官方名称 “Segment Anything”分割万物体现了其强大的通用分割能力。作用用于精准抠图、物体分离、背景移除等任务。是 ComfyUI 中图像编辑工作流的利器。常见模型举例文件名说明sam_vit_h_4b8939.pthSAM 基础版ViT-H最大版本sam_vit_l_0b3195.pthSAM 大版本ViT-Lsam_vit_b_01ec64.pthSAM 小版本ViT-B最快sam2_hiera_large.ptSAM2 最新版本mobile_sam.pt移动端轻量版 SAM17.background_removal/—— 背景移除英文全称Background Removal背景移除中文含义专门存放用于移除图像背景的模型。作用一键抠图去除背景保留前景主体。常见模型举例u2net.pth最常用的背景移除模型u2netp.pth轻量版birefnet系列建议常用模型u2net.pth也可以放在这里配合 RMBG、BRIA 等插件使用。18.geometry_estimation/—— 几何估计英文全称Geometry Estimation几何估计中文含义存放用于估计图像几何信息的模型如深度图Depth Map、法线图Normal Map等。作用从 2D 图像中提取 3D 几何信息用于 ControlNet 的 depth、normal 控制或用于 3D 重建。常见模型举例文件名估计类型depth_anything_v2_vits.pth深度估计MiDaS系列多版本深度估计normal_estimation模型法线估计第五部分视频与序列处理19.frame_interpolation/—— 帧插值英文全称Frame Interpolation帧插值中文含义用于在视频的两帧之间生成中间过渡帧提升视频流畅度如从 15fps 提升到 60fps。作用视频生成后的后处理让生成的视频看起来更流畅、更自然。常见模型举例文件名说明film_net_fp16.ptFILM 模型Google 出品rife-v4.safetensorsRIFE 模型高质量补帧gma-sintel.safetensorsGMA 光流模型20.optical_flow/—— 光流估计英文全称Optical Flow光流中文含义光流是计算机视觉中的一个重要概念指图像中像素的运动轨迹和速度场。通过分析连续两帧图像计算每个像素点的运动方向和速度。作用用于视频生成、运动分析和帧插值等任务。光流信息可以帮助模型理解视频中的“运动规律”。常见模型举例文件名说明raft-things.pthRAFT 光流模型gmflow系列GMFlow 光流模型gma-sintel.pthGMA 光流模型21.audio_encoders/—— 音频编码器英文全称Audio Encoders音频编码器中文含义专门用于将音频信号转换为向量表示的编码器使得 AI 模型能够“理解”音频内容。作用用于视频生成模型中需要根据音频生成画面的场景如 MiniMax H3、WAN 等视频模型可根据音频生成对口型视频。常见模型举例文件名对应模型minimax_h3_audio_vae_fp32.safetensorsMiniMax H3 专用音频 VAEwav2vec系列通用音频特征提取第六部分图像增强与风格22.upscale_models/—— 超分辨率放大英文全称Upscale Models超分辨率模型中文含义用于将低分辨率图像放大到更高分辨率同时尽可能保持清晰度和细节。作用提升图像分辨率用于最终输出高清大图或修复模糊图像。常见模型举例文件名说明RealESRGAN_x4plus.pth通用超分效果优秀4倍放大RealESRGAN_x4plus_anime.pth动漫专用超分4x-UltraSharp.pth清晰度极高Real_HAT_GAN_sharper.pth更锐利的超分ESRGAN_4x系列经典 ESRGAN 系列建议如果有多个放大倍数需求可以用子目录分类如upscale_models/2x/、upscale_models/4x/。23.latent_upscale_models/—— 潜空间放大英文全称Latent Upscale Models潜空间放大模型中文含义在 AI 的**潜空间latent space**内直接对图像进行放大而不是在像素空间。这种方式速度更快但对放大质量有一定要求。作用用于图像生成的放大阶段在图像完全“解码”之前就进行放大效率更高。常见模型举例文件名说明x4-upsampler-ema.safetensorsSD 潜空间放大模型区分latent_upscale_models/是在潜空间放大更快配合采样流程upscale_models/是在像素空间放大更精细作为后处理。两者定位不同。24.style_models/—— 风格迁移模型英文全称Style Models风格模型中文含义存放用于风格迁移的模型可以将一种图像的风格“迁移”到另一张图像上。作用实现图像风格转换比如将写实照片转换成梵高画风。常见模型举例各种风格迁移模型如 AdaIN、Fast Style Transfer 等ComfyUI 部分风格插件的专用模型第七部分微调与嵌入25.embeddings/—— Textual Inversion 嵌入英文全称Embeddings嵌入中文含义存放Textual Inversion文本反转的嵌入文件。这是一种通过 3~5 张图片“教会”模型特定概念或物体的技术生成的文件通常只有几十 KB。作用让模型“认识”某个特定物体、角色或概念。使用时在提示词中输入对应的触发词即可调用。常见模型举例文件名对应触发词用途my-cat.ptmy-cat让模型认识“我的猫”sks-style.ptsks-style自定义风格avatar.ptavatar固定角色特征注意Textual Inversion.pt和 LoRA.safetensors是不同的技术虽然都是微调方式但文件大小和原理不同。26.hypernetworks/—— 超网络英文全称Hypernetworks超网络中文含义Hypernetwork 是另一种微调技术通过一个较小的“超网络”来修改主模型的行为。在 Stable Diffusion 早期版本中较流行目前已逐渐被 LoRA 取代。作用调整生成图像的风格、构图或特定特征。和 LoRA 功能类似但实现方式不同。常见模型举例各种风格 Hypernetwork.pt文件建议如果你有 LoRA 可用优先用 LoRA。Hypernetwork 的支持已不如 LoRA 广泛。27.model_patches/—— 模型补丁英文全称Model Patches模型补丁中文含义存放用于修补或扩展模型功能的补丁文件通常用于修复模型的特定问题或添加新功能。作用灵活扩展模型功能无需重新训练完整模型。常见模型举例特定模型的补丁文件功能扩展插件生成的补丁第八部分大语言模型28.LLM/—— 大语言模型英文全称Large Language Model大语言模型中文含义存放完整的大语言模型。注意这里是包含完整权重和架构的 LLM而非仅仅是编码器与text_encoders/区分。作用用于高级提示词理解、图像描述生成如 BLIP、自动提示词优化等需要完整自然语言理解/生成能力的任务。常见模型举例模型用途Florence-2图像描述生成、物体检测Qwen系列中文/多语言理解LLaMA系列通用语言模型第九部分格式与平台相关29.diffusers/—— Diffusers 格式模型英文全称Diffusers扩散器中文含义Hugging Face 的diffusers库定义了一种标准的模型组织格式以完整文件夹包含多个子文件而非单个文件的形式存放模型。为什么这样命名直接采用 Hugging Facediffusers库的名称。该库已成为扩散模型社区的事实标准。作用以 Hugging Face 标准格式加载模型支持从 Hugging Face Hub 直接下载和使用。常见模型举例runwayml/stable-diffusion-v1-5的 diffusers 版stabilityai/stable-diffusion-xl-base-1.0的 diffusers 版区别checkpoints/放.safetensors或.ckpt单文件diffusers/放多个文件的文件夹。30.onnx/—— ONNX 格式模型英文全称Open Neural Network Exchange开放神经网络交换格式中文含义ONNX 是一种开放的模型格式标准可以在不同的深度学习框架PyTorch、TensorFlow 等之间进行模型转换和部署。为什么这样命名直接使用该格式标准的官方名称。作用存放 ONNX 格式的模型通常用于推理加速配合 TensorRT、OpenVINO 等或在资源受限的设备上部署。常见模型举例转换后的 ControlNet ONNX 版本轻量化推理模型注意ONNX 模型的加载路径在部分 ComfyUI 变体中可能是**硬编码hardcoded**的不要随意移动此目录。31.vae_approx/—— VAE 近似轻量版英文全称VAE ApproximateVAE 近似中文含义存放VAE 的近似模型通常是用更小、更快的网络来“近似”完整 VAE 的功能。作用在低显存设备上作为完整 VAE 的轻量替代方案。牺牲少量质量换取更快的速度和更低的内存占用。常见模型举例taesd_encoder.safetensors/taesd_decoder.safetensorsTiny AutoEncoder极度轻量taesdxl_encoder.safetensors/taesdxl_decoder.safetensorsSDXL 版的 tiny VAE建议如果你的显存充足8GB直接使用vae/中的完整模型。显存紧张的设备4GB 以下vae_approx/是不错的备选。✅ 完整速查表31个目录总览#目录名核心作用关键提醒1audio_encoders/音频→向量视频生成MiniMax专用2background_removal/背景移除抠图用3checkpoints/⭐ 基础大模型最常用放 SD/XL 等4clip/CLIP 文本→向量别和 text_encoders 搞混5clip_vision/CLIP 图像→向量IP-Adapter 等需要6configs/模型配置文件配合 .ckpt 使用7controlnet/精准姿态/构图控制配线稿/深度图等8detection/目标检测检测物体/人脸9diffusers/Diffusers 格式Hugging Face 标准10diffusion_models/新一代扩散模型FLUX/WAN 等放这里11embeddings/Textual Inversion几十 KB 的 .pt 文件12frame_interpolation/视频补帧提升视频流畅度13geometry_estimation/深度/法线估计ControlNet 深度控制用14gligen/坐标布局控制精确控制物体位置15hypernetworks/超网络微调已逐渐被 LoRA 取代16latent_upscale_models/潜空间放大采样流程内放大17LLM/大语言模型完整 LLM不只是编码器18loras/⭐ LoRA 微调最常用放风格/角色 LoRA19model_patches/模型补丁扩展功能用20onnx/ONNX 格式推理加速/跨框架21optical_flow/光流估计视频运动分析22photomaker/人像定制保持人物身份一致23sams/SAM 图像分割精准抠图神器24style_models/风格迁移图像风格转换25text_encoders/LLM 文本编码器T5/Gemma/Qwen 放这里26ultralytics/YOLO 检测Ultralytics 官方格式27unet/UNet 模型旧版目录部分插件仍用28upscale_models/超分辨率放大最终高清输出29vae/⭐ VAE 编解码器影响画质关键30vae_approx/VAE 轻量近似低显存用31yolo/YOLO 专用部分插件读取此目录 最后的小贴士文件格式优先使用.safetensors格式比.ckpt和.pt更安全、加载更快。子目录分类在loras/、checkpoints/等目录中建立子目录进行分类管理。命名规范避免中文字符、空格及特殊符号防止编码错误。硬编码警告onnx/、tensorrt/等目录路径是硬编码的不要随意移动。双目录注意ultralytics/和yolo/功能重叠具体看插件读取哪个clip/和text_encoders/也完全不同。掌握了这 31 个文件夹的用途你就能在 ComfyUI 的模型海洋中游刃有余了