拓冰建站拓冰建站
首页 / 资讯中心 / 正文

(论文速读)DECO:用于端到端图像生成的频率解耦像素扩散

论文题目DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image GenerationDECO用于端到端图像生成的频率解耦像素扩散会议CVPR 2026摘要像素扩散的目标是以端到端的方式在像素空间中直接生成图像。该方法避免了VAE在两阶段潜扩散中的局限性提供了较高的模型容量。现有的像素扩散模型存在训练和推理速度慢的问题因为它们通常在单个扩散转换器(DiT)内对高频信号和低频语义进行建模。为了追求更有效的像素扩散范式我们提出了频率解耦的像素扩散框架。凭借分离高频和低频分量的直觉我们利用一个轻量级像素解码器来生成高频细节条件是来自DiT的语义指导。这样DiT就可以专门为低频语义建模。此外我们引入了频率感知的流匹配损耗它强调视觉上显著的频率而抑制不显著的频率。大量实验表明在像素扩散模型中DECO具有较好的性能在ImageNet上的FID分别为1.62(256×256)和2.22(512×512)缩小了与潜在扩散方法的差距。此外我们的预先训练的文本到图像模型在系统级比较中获得了领先的总体分数0.86。代码可在https://github.com/Zehong-Ma/DeCo.上公开获取DeCo 关注的是Pixel Diffusion。与主流 Latent Diffusion 先通过 VAE 将图像压缩到 latent space 再进行扩散不同Pixel Diffusion 直接在像素空间完成生成因此能够避开 VAE 重建质量和 latent distribution 带来的限制。不过直接在高维像素空间建模也会带来明显问题现有方法通常让一个 DiT 同时学习低频语义和高频信号而复杂的高频信息尤其是高频噪声不仅难学还会干扰 DiT 对低频语义的建模。针对这一问题论文提出DeCoFrequency-DeCoupled Pixel Diffusion让 DiT 主要负责低频语义建模再使用一个轻量级 Pixel Decoder 根据 DiT 提供的语义条件恢复高频细节。同时作者提出 Frequency-aware Flow-Matching Loss利用 JPEG Quantization Table 提供的视觉先验对不同频率赋予不同权重。最终DeCo 在 ImageNet 256×256 和 512×512 上分别取得 FID 1.62 和 2.22Text-to-Image 模型在 GenEval 上取得 Overall 0.86。论文 Figure 1DeCo 在 512×512 Text-to-Image 任务上的生成结果。1. 论文解决的问题Latent Diffusion 的优势是将图像压缩到低维 latent space 后再进行扩散能够显著减少计算量但最终生成质量会受到 VAE 重建能力限制。Pixel Diffusion 则完全去掉 VAE直接从像素空间学习数据分布Noise → Pixel Diffusion Model → RGB Image这种方式更加直接但像素空间的维度非常高。作者进一步指出问题不仅是“输入维度高”而是DiT 同时承担了两类性质不同的任务低频部分主要表示物体、布局、形状和全局语义高频部分包含纹理、边缘、局部细节以及大量高频噪声。传统 Pixel Diffusion 通常将单尺度输入 patchify 后直接送入 DiT因此低频和高频都需要由同一个 Transformer 建模。高频信号尤其是高频噪声比较难学习同时会分散 DiT 的模型容量使其难以专注于更重要的低频语义。论文 Figure 2传统 Pixel Diffusion 与 DeCo 的对比。Baseline 使用单个 DiT 同时学习低频语义和高频信号DeCo 将二者交给不同模块处理。论文的核心思路因此很直接DiT → Low-Frequency Semantics Pixel Decoder → High-Frequency Signals2. DeCo 方法2.1 整体框架DeCo 对不同频率采用不同分辨率的输入。首先当前 diffusion state经过下采样和 patchify 后输入 DiT。由于下采样本身会抑制一部分高频信息因此 DiT 更容易专注于低频语义。论文中 Baseline 和 DeCo 的 DiT input patch size 都设置为 16。DiT 输出为其中t为 diffusion timey为类别标签或文本条件表示 DiT 输出的低频语义特征。随后Pixel Decoder 同时接收完整分辨率的和来自 DiT 的预测最终的 pixel velocity这样DiT 不再需要直接承担高频细节建模而 Pixel Decoder 可以利用 full-resolution input 恢复纹理和局部信息。论文 Figure 3DeCo 完整框架。DiT 对低分辨率输入建模低频语义Pixel Decoder 在 DiT 语义条件下利用完整分辨率输入预测 Pixel Velocity。2.2 Lightweight Pixel DecoderPixel Decoder 是一个attention-free的轻量网络由多个 Linear、MLP 和 AdaLN 模块构成不使用高分辨率 self-attention。首先将完整分辨率的与位置编码pos拼接得到 dense query其维度为默认情况下 d32。随后将 DiT 输出上采样到与 Pixel Decoder 相同的空间尺寸并通过 MLP 生成 AdaLN 的调制参数Decoder Block 的更新形式为这里 DiT 的输出并不是简单与 Pixel Decoder 特征相加而是作为语义条件通过 AdaLN 调制高频特征。论文默认 Pixel Decoder 的 hidden size 为 32、depth 为 3总参数量仅约 8.5M。3. Frequency-aware Flow-Matching Loss除了从网络结构上完成频率解耦论文还认为传统 Flow Matching 对所有频率一视同仁并不合理。标准 Conditional Flow Matching 中x0表示真实图像x1表示噪声其线性轨迹为对应的真实 velocity 为标准 Flow-Matching Loss 为问题是这种 pixel-level MSE 默认所有频率的误差同样重要。DeCo 借鉴 JPEG 的 Quantization Table。JPEG 的量化规则本身包含视觉先验人眼对不同频率的敏感程度不同。因此作者先将 predicted velocity 和 ground-truth velocity 从 RGB 转换到 YCbCr然后执行 8×8 block-wise DCT随后根据 JPEG Quantization Table 生成不同频率的 a daptive weight当 JPEG qualityq位于 50 到 100 时最终 Frequency-aware FM Loss 为最终训练目标为其中L_REPA来自论文 Baseline 使用的 REPA representation alignment。简单来说DeCo 的 Loss 设计就是更重视视觉上重要的频率同时适当减弱不重要高频噪声对训练的影响。4. DeCo 是否真的完成了频率解耦作者进一步分析了 DiT Output 和 Pixel Velocity 的 DCT energy distribution。论文 Figure 4Baseline 与 DeCo 的 DCT Energy Distribution。统计基于 10K images、所有 diffusion steps并使用 8×8 DCT。可以看到与 Baseline 相比DeCo 的 DiT Output 中高频 energy 明显降低最终 Pixel Velocity 中仍然保留了较强的高频 energy。这说明 DeCo 并不是直接删除高频信息而是成功将高频建模任务从 DiT 转移到了 Pixel DecoderBaseline DiT → Low Frequency High Frequency DeCo DiT → Low Frequency Pixel Decoder → High Frequency这也是论文对 Frequency Decoupling 最直接的实验验证。5. 实验结果5.1 与 Baseline 的对比论文首先在 ImageNet 256×256 上进行 200K iterations 的对比实验。DeCo 的关键结构修改是使用 Pixel Decoder 替换 Baseline 最后的两个 DiT Blocks。论文 Table 1DeCo 与 Baseline、PixDDT、PixNerd、PixelFlow、JiTREPA 等方法的比较。Baseline 的 FID 为 61.10、IS 为 16.81。仅加入 frequency-decoupled architecture、但不使用后FID61.10 → 34.12 IS16.81 → 46.44加入 Frequency-aware FM Loss 后完整 DeCo 达到FID31.35 sFID9.34 IS48.35 Recall0.65可以看出架构上的 Frequency Decoupling 是最主要的性能增益来源Frequency-aware FM Loss 又在此基础上进一步降低 FID。5.2 训练效率论文 Figure 5DeCo 与 Baseline 的 FID-50K 随 Training Iteration 的变化。DeCo 在 400K iterations 时即可达到 FID 2.57而 Baseline 大约训练到 4.0M iterations 才达到相近的 FID 2.59。因此论文所说的10× faster主要指达到相近 FID 所需要的训练迭代数约降低 10 倍而不是单个 iteration 快 10 倍。实际上 Table 1 中 Baseline 为 0.22 s/itDeCo 为 0.24 s/it。5.3 ImageNet Class-to-Image论文 Figure 6DeCo 在 ImageNet 256×256 上的 Class-to-Image 生成结果。论文 Table 2ImageNet 256×256 和 512×512 上的 Class-to-Image 结果。在 ImageNet 256×256 上DeCo-XL/16 训练 800 epochs、使用 250×2 NFE 时取得FID1.62 sFID4.41 IS301 Precision0.80 Recall0.62在 ImageNet 512×512 上DeCo-XL/16 取得FID2.22 sFID4.67 IS290.0 Precision0.80 Recall0.60其中 256×256 的 FID 1.62 和 512×512 的 FID 2.22 都是论文重点强调的 Pixel Diffusion 结果使端到端 Pixel Diffusion 与 Two-Stage Latent Diffusion 的差距进一步缩小。5.4 Text-to-Image论文 Table 3DeCo 在 GenEval 和 DPG-Bench 上的 Text-to-Image 结果。DeCo-XXL/16 参数量为 1.1B在 512×512 Text-to-Image 上取得GenEval Overall0.86 DPG-Bench81.4GenEval 各子项为Single Object1.00 Two Object0.92 Counting0.72 Colors0.91 Position0.80 Color Attribution0.79其中 GenEval Overall 0.86 高于论文表中 SD3 的 0.68、FLUX.1-dev 的 0.67、BLIP3o 的 0.81 和 OmniGen2 的 0.80。需要注意的是DPG-Bench 的 81.4 并不是表中最高结果因此这里更适合描述为“有竞争力”而不是 SOTA。6. 消融实验论文 Table 4Pixel Decoder 结构以及 Frequency-aware FM Loss 的消融实验。Pixel Decoder hidden sized16FID 37.63 d32FID 34.12 d64FID 35.88最佳为 d32。Pixel Decoder depthN1FID 37.10 N3FID 34.12 N6FID 35.46最佳为 N3。Pixel Decoder patch sizePatch Size1FID 31.35 Patch Size4FID 34.39 Patch Size16FID 55.59这一组实验非常关键。Pixel Decoder 使用 full-resolution、pixel-level input 时效果最好而使用与 DiT 类似的大 patch 后性能明显下降验证了 Multi-Scale Input Strategy 对高频建模的重要性。DiT 与 Pixel Decoder 的交互AdaLNFID 31.35 AddFID 36.02说明将 DiT Output 作为 semantic condition 进行 AdaLN modulation比简单的 feature addition 更有效。对于 Frequency-aware FM Lossloss weight1 时结果最好JPEG quality 的实验中q50FID 31.54 q85FID 31.35 q100FID 33.84论文最终使用 q85。7. 总结DeCo 解决 Pixel Diffusion 问题的思路并不复杂不要再让一个 DiT 同时负责所有频率。传统 Pixel Diffusion 中DiT → Low-Frequency Semantics High-Frequency SignalsDeCo 则将任务拆开DiT → Low-Frequency Semantics Pixel Decoder → High-Frequency SignalsDiT 使用低分辨率输入专注语义建模轻量 Pixel Decoder 直接使用 full-resolution noisy image 恢复局部高频信息随后再使用基于 JPEG perceptual prior 的 Frequency-aware FM Loss对视觉上更重要的 frequency component 给予更高权重。从消融实验来看论文最主要的提升来自frequency-decoupled architectureFID 从 Baseline 的 61.10 直接下降到 34.12Frequency-aware FM Loss 进一步将 FID 降到 31.35。最终 DeCo 在 ImageNet 256×256 和 512×512 上分别达到 FID 1.62 和 2.22并在 GenEval 上取得 Overall 0.86。个人认为这篇论文最值得关注的点不是 DCT 或 JPEG 本身而是它重新分配了 Pixel Diffusion 中不同模块的任务让 Transformer 做更擅长的全局低频语义建模让轻量 Pixel Decoder 处理局部高频细节。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门