拓冰建站拓冰建站
首页 / 资讯中心 / 正文

ACM MM 25 | DSDNet:Raw 域双色空间协同去摩尔纹网络,单阶段双流架构让屏幕翻拍告别彩虹纹

这篇论文最有意思的地方,不是简单地把去摩尔纹搬到 raw 域,而是在 raw 与 YCbCr 两个色彩空间之间架了一座"双向桥":让 YCbCr 流专职去摩尔纹、校正亮度,让 raw 流专心做颜色映射,最后用动态门控注意力把两者拧成一股绳——单阶段跑完,速度还比第二名快 2.4 倍。论文: DSDNet: Raw Domain Demoiréing via Dual Color-Space Synergy作者: Qirui Yang, Fangpu Zhang, Yeying Jin, Qihua Cheng, Pengtao Jiang, Huanjing Yue, Jingyu Yang发表单位: 天津大学、腾讯、vivo、深圳比特微电子发表: ACM Multimedia (MM '25), Dublin, Ireland, 2025论文链接: https://doi.org/10.1145/3746027.3754698代码链接: 论文提供匿名在线 Demo(官方代码待开源)一、引言用手机翻拍屏幕早就成了网课、会议录屏、资料采集的日常操作,但拍出来的照片总带着一圈圈彩色波纹——这就是摩尔纹(moiré)。它的根源是显示器像素阵列与相机传感器之间发生频率混叠,更糟的是,ISP 里的去马赛克(demosaicing)过程会把摩尔纹进一步放大,形成复杂的非线性失真。现有的去摩尔纹方法分成两派,各有硬伤:sRGB 域方法(DMCNN、WDNet、ESDNet 等):图像经过 ISP 后已经丢失了不可逆的物理信息,而且方法本身忽视了"去马赛克放大摩尔纹"这一物理过程;两阶段 raw 域方法(RDNet、RawVDemoiré 等):第一段学 raw→干净图、第二段学 raw→sRGB,图像级别的级联数据流导致信息瓶颈和误差逐级累积,且每级子网络都要额外开销,推理慢、成本高。本文提出了DSDNet(Dual-Stream Demoiring Network),一个单阶段raw 域去摩尔纹框架,核心贡献有三点:双流解耦设计:raw 流负责颜色映射,YCbCr 流提供相对抗摩尔纹的结构与亮度先验;SADM 模块(Synergic Attention with Dynamic Modulation):对称跨域注意力 + 动态门控融合,让 raw 特征和 YCbCr 特征充分交换上下文;LCAT 模块(Luminance Chrominance Adaptive Transformer):解耦亮度与色度表示,用可学习权重引导色彩保真。在 TMM22 与 RawVDemoiré 两个基准上,DSDNet 的 PSNR 分别提升0.47 dB和0.79 dB,推理速度比第二名快2.4×。二、核心动机论文先给了两个关键观察:观察一:亮度差异是主要失真来源。由于手机自动曝光调整和屏幕亮度波动,拍到的摩尔纹输入与真实场景辐射度存在明显偏差,且主要作用于亮度分量(Y 通道),如图 1(a) 所示。观察二:raw 直接转 YCbCr 比 sRGB 转 YCbCr 更"干净"。因为 raw→YCbCr 映射受 ISP 谐波放大的影响更小,而且色度通道(Cb/Cr)对中性色摩尔纹不敏感。如图 1© 所示,第一列(raw 转 YCbCr)的 Y 通道摩尔纹明显少于第二列(sRGB 转 YCbCr)。图 1(c):raw-to-YCbCr 映射(第一列)比 sRGB-to-YCbCr(第二列)含更少摩尔纹,Y 通道对比尤明显基于这两点观察,思路就很自然了:用 raw 直接映射出的 YCbCr 作为先验来引导亮度校正和去摩尔纹,raw 流专管颜色映射。但直接把 raw 映射到 YCbCr 会产生颜色失真,所以需要一个自适应的机制来融合两条流——这正是 SADM 的职责。三、方法3.1 模块整体设计DSDNet 的整体架构如图 3 所示:输入是 Bayer 排列的 raw 图Iraw∈R2H×2W\mathbf{I}_{raw} \in \mathbb{R}^{2H \times 2W}Iraw​∈R2H×2W,先整理成 4 通道 RGGB 格式I^raw∈R4×H×W\hat{\mathbf{I}}_{raw} \in \mathbb{R}^{4 \times H \times W}I^raw​∈R4×H×W送入颜色映射流;同时把 Bayer 的绿色双通道取平均,用标准变换矩阵转成Iycc∈R3×H×W\mathbf{I}_{ycc} \in \mathbb{R}^{3 \times H \times W}Iycc​∈R3×H×W送入引导流。两条流各自经过编码器和特征提取块后,进入 SADM 充分交换跨域信息,最后 YCbCr 流的亮-色度特征再通过 LCAT 引导 RGB 重建。图 3:DSDNet 整体架构,紫色区域为 SADM,绿色区域为 LCAT前向过程可以概括为四步:raw 流经CMB(Color Mapping Block)建模 raw→sRGB 映射关系;YCbCr 流经CGB(Color Guidance Block)提取抗摩尔纹的先验引导特征;SADM 对两条流的特征做双向交叉注意力 + 动态门控融合;LCAT 解耦亮度/色度,输出最终 sRGB 图像。3.2 关键操作:GMLP 与 CMBCMB 采用状态空间模型(SS2D)+ Gated MLP(GMLP)。SS2D 逐行模拟图像传感器的物理行扫描,捕获行间相关性;而针对传统通道注意力的缺陷(作者分析发现通道冗余可忽略,通道注意力反而会破坏去摩尔纹必需的空间细节),GMLP 改为同时建模空间与通道模式:把特征扩维后一分为二,一半走3×33\times33×3深度卷积,再门控乘回去:F1,F2=Split(Linear(Fa)),F_1, F_2 = \text{Split}(\text{Linear}(F_a)),F1​,F2​=Split(Linear(Fa​)),Fa′=Linear(F1⊙DConv3×3(F2)),F'_a = \text{Linear}(F_1 \odot \text{DConv}_{3\times3}(F_2)),Fa′​=Linear(F1​⊙DConv3×3​(F2​)),F^rawt=CMB(Frawt)=GMLP(SS2D(Frawt)).\hat{F}_{\text{raw}}^t = \text{CMB}(F_{\text{raw}}^t) = \text{GMLP}(\text{SS2D}(F_{\text{raw}}^t)).F^rawt​=CMB(Frawt​)=GMLP(SS2D(Frawt​)).其中⊙\odot⊙为逐元素乘法,SS2D(⋅)(\cdot)(⋅)为二维状态空间算子。同时,CGB 用[27]中的空洞通道注意力提取全局-局部依赖:F^ycct=CGB(Fycct).\hat{F}_{\text{ycc}}^t = \text{CGB}(F_{\text{ycc}}^t).F^ycct​=CGB(Fycct​).3.3 核心子机制一:SADM(协同注意力与动态调制)SADM 的任务是让 raw 特征与 YCbCr 特征进行双向交互。先看注意力通路:raw→YCbCr 方向上,QrawQ_{raw}Qraw​来自 raw 特征,KYCC,VYCCK_{YCC}, V_{YCC}KYCC​,VYCC​来自 YCbCr 特征;YCbCr→raw 方向则完全对称:QYCC=Conv1×1(F^YCCi),Kraw,Vraw=Split(Conv1×1(F^rawi)),Q_{YCC} = \text{Conv}_{1\times1}(\hat{F}_{YCC}^i), \quad K_{raw}, V_{raw} = \text{Split}(\text{Conv}_{1\times1}(\hat{F}_{raw}^i)),QYCC​
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门