2025——Retinex - RAWMamba:为低光照 RAW 图像增强架起去马赛克与去噪的桥梁
原文标题Retinex-RAWMamba: Bridging Demosaicing and Denoising for Low-Light RAW Image Enhancement摘要低光照图像增强尤其是在从原始域raw domain到 sRGB 域等跨域任务中进行映射时仍然是一项重大挑战。近年来为解决这一问题人们开发了许多基于学习的深度方法并且这些方法展现出了有前景的结果。然而试图统一跨域复杂映射的单阶段方法往往会导致有限的去噪性能。相比之下现有的两种主流方法通常在图像信号处理ISP流水线内执行去马赛克操作这会在不同光照条件下导致颜色失真在低光照场景中情况尤为严重。为了解决这些问题我们提出了一种名为 RAWMamba 的新颖 Mamba 基方法以有效处理具有不同颜色滤波阵列CFAs的原始图像。此外我们引入了一个基于 Retinex 理论的 Retinex 分解模块RDM该模块将光照从反射率中分离出来以实现更有效的去噪和自动非线性曝光校正减少手动光照调整的影响。通过连接去马赛克和去噪过程实现了对低光照原始图像更好的增强效果。在公共数据集 SID 和 MCR 上进行的实验评估表明我们提出的 RAWMamba 在跨域映射任务中实现了最先进的性能。代码可在https://github.com/Cynicarles/RetinexRawMamba获取。1.引言现有深度学习方法尤其是那些专注于低光照增强任务的方法主要在 sRGB 域中操作。然而RAW 图像通常比其 RGB 对应图像具有更高的位深这意味着它们保留了更多的原始细节。因此从 RAW 到 RGB 的处理通常更有效。然而RAW 和 RGB 是不同的域具有针对其特定特征定制的图像处理算法。例如在 RAW 域中算法优先进行去噪而在 RGB 域中它们专注于颜色校正。这种差异通常会使单阶段端到端方法失效。去马赛克算法在将 RAW 转换为 sRGB 方面起着关键作用大多数传统方法依赖于邻近插值。尽管一些研究人员探索了基于 CNN 的方法来将有噪声的 RAW 图像映射到干净的 sRGB 输出但卷积神经网络固有的有限感受野往往会阻碍它们在去马赛克任务中的有效性。为了解决这个问题已经采用视觉 TransformerViTs来扩大感受野但 ViTs 中的注意力机制计算量很大。而 Mamba 的引入在这些权衡之间提供了更有效的平衡。然而现有的 Mamba 扫描机制无法充分解决具有不同颜色滤波阵列CFAs的 RAW 图像的多样特征突出了需要针对各种 CFAs 专门定制 Mamba 扫描方法。图 1. a一种针对 RGGB 拜耳模式的去马赛克插值方法bRAWMamba黑色虚线和基础 Mamba紫色虚线中的扫描方式。需注意仅绘制了 RAWMamba 的四个方向将其反转可得到另外四个方向共八个方向 。因此我们为 RAW 格式图像RAWMamba设计了一种新颖的 Mamba 扫描机制该机制具有全局感受野和注意力机制以及可以更好地适应此任务数据的线性接收场。更重要的是如图 1b所示简单的 Mamba 扫描机制没有考虑成像特性导致在使用 CFA 进行特征提取时受到限制。相比之下我们的 RAWMamba 引入了八个不同的扫描方向在保留图像空间连续性的同时充分考虑了给定像素的直接邻域中的所有像素。具体来说扫描方向包括水平、垂直、从左上到右下的斜向扫描以及从右上到左下的斜向扫描。这四个主要方向被镜像以产生另外四个方向总共八个扫描方向。此外以前处理短曝光 RAW 图像的方法通常依赖于简单的线性乘法先验进行曝光校正。具体来说短曝光 RAW 图像包含显著的噪声会乘以相应长曝光图像的曝光时间比。这种方法假设整个图像的曝光均匀这通常不现实可能导致次优的去噪和不准确的亮度。通过利用 Retinex 理论在 RGB 图像低光照增强任务中的成功我们引入了一种基于 Retinex 的双域辅助曝光校正方法即 Retinex 分解模块RDM该模块将光照和反射分离实现自动非线性曝光校正。同时我们有效地融合基于多尺度生成的先验以实现更有效的去噪效果和更准确的亮度校正。此外鉴于不同 RAW 域和 sRGB 域之间噪声分布的显著差异我们基于将任务分解为子任务的想法RAW 域上的去噪和跨域映射。图 2. 我们提出的 Retinex - RAWMamba 的整体架构以及aRetinex 分解模块、b简单去噪块和c域自适应融合 。总的来说我们提出了一个基于 Retinex 的解耦网络Retinex-RAWMamba用于 RAW 域去噪和低光照增强如图 2 所示。我们的方法将去噪和去马赛克任务分解为两个不同的子任务有效地将有噪声的 RAW 图像映射到干净的 sRGB 图像。具体来说对于去马赛克子任务我们引入 RAWMamba通过利用八方向机制充分考虑某个像素的直接邻域中的所有像素。对于去噪子任务我们提出了 Retinex 分解模块该模块同时增强去噪性能和亮度校正。此外我们引入了一个双域编码阶段增强分支旨在利用从 RAW 域精心保留的细节特征从而补偿在去噪阶段发生的信息损失。最后我们观察到以前工作中使用的门控融合模块GFM在我们的框架内导致训练不稳定。为了解决这个问题我们提出了域自适应融合DAF以更稳定和高效地执行自适应特征融合。我们的主要贡献总结如下我们提出了一个基于 Retinex 的解耦 Mamba 网络用于 RAW 域去噪和低光照增强Retinex-RAWMamba。据我们所知这是首次尝试将 Mamba 机制引入低光照 RAW 图像任务。我们设计了一种新颖的八方向 Mamba 扫描机制以充分考虑 RAW 图像的内在属性并开发了一个 Retinex 分解模块以连接去噪能力和曝光校正。我们在两个基准数据集上定量和定性地评估了所提出的方法。全面的实验表明所提出的方法在参数数量相当的情况下在 PSNR、SSIM 和 LPIPS 方面优于其他最先进的方法。2.相关工作A. 原始域的低光照增强原始图像Raw image相较于对应的 RGB 图像包含多得多的细节在原始域对低光照图像进行增强效果会优于在 RGB 域进行增强比如一些同态滤波方法就给了我们很大的启发可用于原始域的低光照增强任务。由于该任务可拆分为两个子任务即原始域去噪和跨域映射研究人员提出了一些创新方法。例如在原始域去噪任务中有结合深度学习的噪声建模方法最终在原始域计算评估指标。自陈等人 2018 年发布 SID 公共数据集后研究人员提出了许多同时解决这两个任务的工作。这些工作可进一步分为单阶段方法和多阶段方法。单阶段方法旨在通过训练单个模型将有噪声的原始图像映射为干净的 sRGB 图像。例如SID 仅使用简单的 U-Net 完成该任务。DID 提出了基于残差学习的深度神经网络用于端到端的极暗光照图像去噪。SGN 引入了自引导网络采用 top-down 自引导架构以更好地利用图像多尺度信息。由于图像信号处理ISP涉及诸多非线性变换仅用单个神经网络学习这些变换仍较为困难而且这种方式需堆叠大量参数会导致效率低下因此多阶段方法应运而生。多阶段方法通过解耦任务更有效地减少了不同域间的模糊性取得了更好的结果。例如黄等人在原始域提出了中间监督董等人则在单色域开展相关工作。DNF 引入了解耦的两阶段方法采用权重共享编码器在减少参数数量的同时取得了不错的结果。然而跨域使用的权重共享模块可能会引入跨域模糊性导致性能欠佳。B. 用于图像信号处理的深度学习用深度学习方案取代基于硬件的图像信号处理ISP系统其动机在于深度学习在重建丢失的图像信息方面能力更优同时还能减轻传统多阶段 ISP 流水线中固有的累积处理误差。该领域近期的进展通过多样的方法创新展现出了显著的进步。CycleISP 框架提出了包含互补的 RGB2RAW 和 RAW2RGB 转换分支的双向架构由自适应颜色校正模块增强以模拟相机成像流水线并生成用于双域去噪的配对数据。针对去马赛克优化徐等人开发了一种分层处理架构 DemosaicFormer先进行 coarse reconstruction再开展像素级细化。为解决跨设备适应性问题Perevozchikov 等人开创了一种针对 RAW 到 RAW 转换的无配对学习范式支持在未见过的设备上灵活部署神经网络 ISP。苏扎等人的 MetalISP 框架引入了元数据感知的域自适应利用 EXIF 参数和光照估计实现跨设备的特性对齐。在计算效率优化方面关等人创新了分组可变形卷积机制用于联合去噪和去马赛克通过在核组间策略性分配独立偏移参数平衡准确率和延迟。总体而言这些进展通过涵盖数据合成、架构设计和部署优化的全面技术探索验证了基于深度学习的 ISP 解决方案的可行性。C. 视觉任务中的 Mamba状态空间模型SSM近年来被引入深度学习因其能有效建模长程依赖。例如有研究提出了结构化状态空间序列S4模型近期又提出了 Mamba在多种序列任务的大规模真实数据上其表现优于 Transformer且线性缩放序列长度时效率更高。除了在自然语言处理NLP任务中表现出色研究人员也在视觉任务中进行了诸多尝试并取得良好成果如分类、分割、异常检测、点云学习、生成以及图像恢复等。EfficientVMamba 提出了高效二维扫描ES2D方法利用对特征图块的空洞采样来加速训练。VMamba 集成了交叉扫描模块CSM将输入图像转换为沿水平和垂直轴的块序列能够在四个不同方向扫描序列即每个像素整合周围四个像素的信息。V MambaIR 提出了一种选择性扫描机制通过为 RGB 图像高效建模六个方向的信息流克服了状态空间模型的单向建模限制还沿通道维度添加了两个更多方向。相比之下我们结合 AI ISP 任务的特点提出了八方向扫描机制和 Retinex 分解模块以克服低光照 RAW 图像的不均匀光照问题。FreqMamba 引入了互补的三重交互结构包括空间 Mamba、频率带 Mamba 和傅里叶全局建模利用空间 Mamba 和频率分析的互补性进行图像去雨。类似地WalMaFa 提出了一种基于傅里叶调整的新型小波 Mamba 模型。Retinex-Mamba 直接将 Mamba 集成到 RetinexFormer 中用于低光照 RGB 图像增强且未对 Mamba 本身做任何改动。李等人结合对比学习和 Mamba 实现半监督学习。然而上述提及的 Mamba 相关机制存在局限性。原始 Mamba 中用于序列预测任务的单方向扫描机制在视觉任务中通常表现不佳因为图像是二维的每个像素通常与其周围像素相关而非仅与序列中的下一个像素相关。因此大多数 Mamba 采用四方向扫描机制。李等人在水下图像增强中使用四方向扫描策略但仅考虑了上下左右像素忽略了空间连续性并非本任务的最佳方案。因此提出 RetinexRawMamba 来解决该问题通过考虑八个扫描方向。为应对低光照 RAW 图像的不均匀光照我们引入了 Retinex 分解模块估计光照分量通过多尺度融合自适应校正光线这也能补充 Mamba 捕捉局部信息的能力 。三、方法A. 预备知识状态空间模型SSM 是一种线性时不变系统可将输入映射到输出。SSM 可通过线性常微分方程ODE形式化表示SSM 是连续时间模型集成到深度学习算法中时面临重大挑战。为解决该问题离散化成为关键步骤。记为时间尺度参数。通常使用零阶保持ZOH规则进行离散化将式1中的连续参数和转换为离散参数和定义如下对、离散化后式1的离散版本使用步长可重写为最后模型通过全局卷积计算输出形式如下其中L 是输入序列的长度是结构化卷积核。B. 整体流程整体流程如图 2 所示。首先我们通过将低曝光噪声单通道原始图像与长曝光真实图像GT的曝光时间比相乘来进行预处理。然后基于颜色滤波阵列CFA模式将其打包为多通道输入。具体而言对于拜耳格式我们将输入打包为 4 通道输入对于 XTrans 格式我们将输入打包为 9 通道输入。Retinex-RAWMamba 的两个阶段均基于 U-Net 架构的编码器 - 解码器构建。虽然 U-Net 架构仍是密集预测任务的简洁选择但我们的研究引入了一种特定领域的架构创新超越了传统设计首次将 Mamba 与 Retinex 引导的多尺度先验融合用于低光照 RAW 图像增强。这种方法解决了一个关键的研究空白 —— 现有的 Mamba 应用在 2024 年忽视了 RAW 数据的独特挑战我们的综合文献调研第二节 C 部分验证了这一点。此外实验结果第四节 B 部分也证明这种架构设计相较于基准架构有显著的性能提升。整体框架的第一阶段致力于原始域去噪。最初RDM 模块处理输入以生成两个特征图和将与原始输入相乘得到稍后会用到。将经过去噪阶段并生成第一个输出。然后会进入去马赛克阶段以生成第二个输出。随后针对真实 RAW 图像和真实 RGB 图像计算整体损失函数为两个域都提供监督并指导整个模型的优化。C. RAWMambaRAWMamba 的细节如图 3a所示。RAWSSM 借鉴了 MambaIR 中的基础视觉 Mamba采用创新的扫描机制。在从 RAW 到 RGB 的图像信号处理ISP过程中去马赛克通常采用邻近插值往往需要考虑给定位置周围所有紧密连接的位置图 1a给出了拜耳模式原始图像的示例b展示了 RAWMamba黑色虚线和基础 Mamba紫色虚线中的扫描情况。基础扫描方法未考虑扫描的连续性导致每行 / 列末尾与其底部 / 右侧之间缺乏连续性这会造成图像语义 gap阻碍图像重建。为解决此问题我们提出使用 Z 扫描即扫描到每行 / 列末尾时从与最后一个像素紧邻的下一行 / 列立即开始反向扫描。然而这种扫描方法在某些像素处于上下左右位置且彼此靠近时仍未考虑到周围所有八个像素。考虑到该任务的特点引入八方向 Mamba。图 3. aRAWMamba、bRAWSSM 和cSS2D 的细节 。我们提出的扫描机制细节如图 3c所示。首先获得八个方向的扫描特征 。扫描完成后进行SSM得到然后通过相加合并它们并将这八个特征重塑为原始形状以得到单个特征即对于 RAWSSM给定输入可公式化表示为其中out 是 RAWSSM 的输出LN 是层归一化是核大小为 3×3 的卷积操作SiLU 是激活函数。对于提出的 RAWMamba给定输入可简单公式化表示为其中out 是 RAWMamba 的输出和是可学习参数CA 是通道注意力 。D. Retinex 分解与双域编码阶段增强分支基于 Retinex 理论的低光照增强方法在 RGB 域已取得成功因此我们提出双域 Retinex 分解模块RDM。我们的 RDM 借鉴 RetinexFormer通过几个卷积来估计光照图和反射图。先前基于 Retinex 的方法是单阶段网络先验特征在编码和解码阶段都会用到而在我们的两阶段网络中去除了解码阶段的先验融合以降低计算复杂度。RDM 可将原始图像分解为反射分量和光照分量。RDM 的细节如图 2a所示。该模块首先在通道维度上取输入图像的平均值得到在通道维度上拼接后经过几个卷积和 GELU 激活函数得到第一个输出然后经过卷积得到光照图它将与原始输入相乘对光线进行预调整。具体来说其中cat 表示在通道维度拼接特征图表示一系列核大小为 1、5、3 的卷积。考虑到从 RDM 得到的特征包含大部分在第一阶段后可能丢失的细节为了充分利用这些特征并减少计算量我们提出双域编码阶段增强分支该分支在解码阶段不使用。具体而言得到后我们在每一层简单下采样得到是第 i 层用于后续融合的特征图。在去噪阶段的自适应光照曝光校正层去噪特征会先与融合再传入 SDB。类似地在去马赛克阶段的编码层去马赛克特征会先与融合再传入 RAWMamba。这种仅在编码阶段进行融合的方法能够在减少计算量的同时提升恢复细节的能力。E. 域自适应融合域自适应融合DAF的细节如图 2c所示。先前的特征图会先与同层级的当前特征图拼接拼接结果经卷积后与先前特征图相乘再通过带残差加法的卷积。这样经过最终卷积就能得到融合后的特征图。具体来说对于两个特征图和融合方式如下F. 损失函数传统低级视觉任务通常使用 L1 损失我们也沿用这种方式。但由于我们的任务涉及原始域和 sRGB 域两个域的不同子任务所以对每个域都使用 L1 损失以更好地指导模型学习。总损失可表示为其中是去噪后的原始图像是第二阶段后的 sRGB 图像是经 Rawpy 后处理得到的真实 sRGB 图像如先前工作所述。实验中和默认设为 1.0 。四、实验A. 数据集与实验环境SID 数据集索尼子集的训练集中共有 1865 对原始图像。每对图像包含一张短曝光和一张长曝光图像短曝光图像作为含噪原始图像长曝光图像作为真实原始图像。所有图像的原始尺寸为 2848×4256 。受 GPU 内存限制训练前需对数据预处理先将其打包为 4×1424×2128 再随机裁剪出形状为 4×512×512 的图像块作为输入同时进行水平 / 垂直翻转等随机数据增强。测试集参考 DNF 的设置删除三张错位场景图像 。 富士子集与索尼子集类似训练集和测试集分别有 1655 和 524 对原始图像对。原始尺寸为 4032×6032 因采用 X - Trans而非拜耳颜色滤波阵列将其打包为 9×1344×2010 并随机裁剪出形状为 9×384×384 的图像块作为输入 。MCR 数据集MCR 数据集包含 4980 张分辨率为 1280×1024 的图像其中有 3984 张低光照 RAW 图像和 498 张单色图像暂不用于实验以及 498 张 sRGB 图像。涵盖室内外场景室内场景曝光时间设为 1/256 秒到 3/8 秒室外场景为 1/4096 秒到 1/32 秒 。像 DNF 那样获取原始图像和真实图像的 ground truth 。预处理与 SID 数据集类似但不随机裁剪图像块作为输入 。ELD 数据集ELD 数据集包含 10 个室内场景和 4 种来自不同品牌的相机设备如索尼 A7S2、尼康 D850、佳能 EOS70D、佳能 EOS700D、索尼 A7S2、尼康 D850 。选用常见的索尼 A7S2 和尼康 D850设置三种 ISO800、1600、3200 和两种低光照系数100、200 用于验证共产生 1203×2×10×2 对原始图像对。选用 SID、MCR、DNF 数据集进行对比使用在索尼 - SID 数据集上预训练的模型评估泛化性 。LOL 数据集LOL 数据集有 v1 和 v2 版本 。LOL - v2 分为真实和合成子集。训练集和测试集按比例划分LOL - v1、LOL - v2 - real、LOL - v2 - synthetic 的划分比例分别为 485:15、689:100、900:100 。实现细节训练时批次大小为 1初始学习率为 1e - 4 采用余弦退火策略在第 200 个 epoch 时降至 1e - 5 。总 epoch 数为 250 。使用 AdamW 优化器beta 参数分别设为 0.9、0.999 动量为 0.9 。训练和测试分别由 NVIDIA 309024G 、A4048G 完成受 GPU 内存限制。提供合并测试的代码因合并测试结果比整图测试略小。使用 PSNR、SSIM、LPIPS 作为定量评估指标 。B. 与现有先进方法对比在 SID含索尼和富士子集 、MCR 数据集上开展实验与 SID、DID、SGN、EEMEFN、LDC、LLPackNet、RRT、MCR、RREnet、DNF、Ma 等人的方法对比 。表 1基于 RAW 的低光照图像增强LLIE方法在 SID 数据集的索尼和富士子集上的定量结果。表现最佳的结果以粗体突出显示第二好的结果以下划线显示。标记为的指标表示值越高越好标记为的指标表示值越低越好。“-” 表示结果不可用 。结果如表一和表二所示。可见多数单阶段方法性能不及多阶段方法体现出多阶段方法处理含噪 RAW 到 sRGB 跨域映射的可行性与有效性。与最新方法相比索尼数据集上 PSNR 提升 1.38、SSIM 提升 0.017 富士数据集上 PSNR 提升 1.62、SSIM 提升 0.021 。总体而言在 SID 数据集上所提方法在多阶段方法中性能最优参数更少。索尼和富士子集上PSNR 分别提升 0.14 dB、0.31 dB SSIM 分别提升 0.011、0.017 LPIPS 分别降低 0.015、0.009 。表 2. MCR [5] 数据集上的定量结果。表现最佳的结果以粗体突出显示第二好的结果以下划线显示。标记为的指标表示值越高越好标记为\(\)的指标表示值越低越好。推理时间为整个 MCR 测试集的计算结果 。MCR 数据集上SSIM 提升幅度小但 PSNR 显著提升 1.14 dB 较次优方法高 3.6% 。因部分方法无公开代码且未在 MCR 数据集上评估未直接对比。为进一步验证泛化性在 ELD、LOL 数据集上开展实验 。就所提模型效率而言4×512×512 输入时为 113.6 GFLOPs MCR 测试集整体耗时 147 秒。虽未针对实时应用优化但在照片编辑、专业成像系统等场景图像质量更关键后续会探索轻量设计平衡性能与质量 。图 4. 我们的方法与现有先进方法的可视化结果对比红色和绿色框选区域为便于对比而截取建议放大查看最佳效果 。此外在 SID 索尼数据集上可视化对比如图 4 前两个场景中其他方法使图像呈绿色调第三个场景中其他方法细节保留不足。所提方法在颜色和细节上更贴近 ground truth 有效实现原始域去噪和颜色增强。MCR 数据集可视化结果如图 5 中MCR 方法颜色偏差大整体偏红 DNF 方法中心下区过曝所提方法关键指标PSNR、SSIM 提升显著。图 5. MCR 数据集的可视化结果每张可视化图像下方数值的格式为 “PSNR / SSIM”建议放大查看最佳效果 。图 6. 更多可视化结果建议放大查看最佳效果 。图 7. 更多可视化结果放大查看效果最佳 。为探索泛化性在 ELD 数据集上实验用 SID、MCR、DNF 预训练模型和所提模型结果如表四所示。索尼 A7S2 数据集上所提预训练模型 PSNR 最高与 DNF 相当尼康 D850 数据集上ratio 100 时 SSIM 最高ratio 200 时 PSNR 提升。因 SID - 索尼和 ELD - 索尼 A7S2 由同一型号相机拍摄可知所提方法对不同相机输入图像的泛化性优于其他端到端模型 。表 4ELD 数据集上的定量结果。表现最佳的结果以粗体突出显示第二好的结果以下划线显示。比值越高代表噪声越多 。为验证模型对低光照 RGB 图像的泛化性在 LOL 数据集上实验结果如表三所示。因所提方法训练策略不同针对 RAW 输入 对三个 LOL 数据集设不同实验“Two - Stage” 用原始两阶段模型无中间监督 “Second Stage Only” 移除第一阶段仅用第二阶段GFLOPs 和参数更少。三种数据集上所提方法性能与先前方法相当。“Second Stage Only” 参数更少性能却更优说明第一阶段监督作用减弱。虽 LOL - v1、LOL - v2 - real 数据集上 PSNR、SSIM 不及 MIRNet但 LOL - v2 - syn 数据集上 “Second Stage Only” 的 PSNR、SSIM 更高分别提升 3.42、0.053 GFLOPs 和参数仅为 MIRNet 的 6.9%、9% 。但所提方法专为低光照 RAW 图像设计应用于 RGB 图像值得后续研究 。表 3LOL 数据集上的定量结果。表现最佳的结果以粗体突出显示第二好的结果以下划线显示 。最后分析 LOL 数据集增强过程中细粒度细节和纹理的保留情况如表三 。用 “Second Stage Only” 模型将增强图像E 、低光照图像L 、正常光照图像H 输入 SSD 预训练检测模型提取特征图计算余弦相似度结果如表五所示。增强后与正常光照特征的平均余弦相似度为 0.9774 高频纹理保留提升 2.036% 。浅层中的余弦相似度远高于说明模型保留高层特征良好深层中增强图像与低光照图像的余弦相似度更高因预训练检测模型对低光照图像也有效且深层元素更少。合成数据集上表现更好因真实数据集存在错位 。表 5LOL 数据集的特征分析。层数越大代表网络层越深。结果以的余弦相似度呈现B、O 分别代表 “基准方法” 和 “我们的方法” 。C. 消融实验1)所提模块的消融实验为验证所提方法的有效性我们在 SID 索尼数据集上开展消融实验。首先构建仅由 SDB、MambaIR 中未修改的基础视觉 Mamba 以及 DNF 中的 GFM 组成的基线模型。表 Ⅵ 展示了替换相应模块后的结果其中 RAWM 代表用 RAWMamba 替换基础 MambaRDM 代表添加 RDM 模块DAF 代表用 DAF 模块替换 GFM。所有消融实验均在相同环境下进行。表 6SID 索尼数据集上的消融实验结果 。我们首先用所提 RAWMamba 替换基线模型中的基础 Mamba结果显示 PSNR 提升 0.41 dBSSIM 提升 0.012这表明我们的 RAWMamba 及其八方向扫描机制在去马赛克任务中表现出色。接着我们引入用于去噪和自动曝光校正的 RDM结果显示尽管 SSIM 未提升但 PSNR 额外提升 0.27 dB这说明图像初始曝光确实存在问题而我们的 RDM 有效增强了去噪和曝光校正。最后我们用所提 DAF 替换网络中的所有 GFM 组件以提升训练过程的稳定性这带来了进一步的增益PSNR 和 SSIM 分别提升 0.16 dB 和 0.001且模型效率也有所提高如图所示。我们的 DAF 与 GFM 相比表现更优参数更少、GFLOPs 更低却能取得更好的结果。此外我们研究了在 DAF 中添加额外 1×1 卷积拼接的效果结果第二行所示显示与 DAF 相比PSNR 下降 0.24SSIM 下降 0.011。此外我们对消融实验进行了直观可视化如图 8 所示。将 RAWMamba 纳入基线模型有效减少了噪声并减轻了绿色色调失真。相比之下Retinex - RawMamba 方法在颜色校正方面表现更优取得了最高的 PSNR 和 SSIM 分数这清楚地表明我们提出的方法在细节保留和颜色准确性方面均优于其他方法。图 8. 消融实验的可视化结果放大查看效果最佳 。此外在 DAF 模块中考虑了两种不同的注意力机制通道注意力和像素级空间注意力。消融实验结果如表 Ⅶ 所示。使用空间注意力机制时因参数更少PSNR 略有下降0.19但 SSIM 略有上升0.002。这表明空间注意力在感知质量用 SSIM 衡量方面有一定益处但在像素级准确性用 PSNR 衡量方面略有牺牲。未来工作中我们计划探索结合通道注意力和空间注意力的混合注意力机制利用两种方法的优势有望在两个指标上都取得更好的性能。表 7特征融合方法的消融实验为进一步评估 RDM 对输入质量和校准的影响我们在 ELD 数据集上进行了移除 RDM 的消融实验结果如表 Ⅷ 所示。我们观察到当包含 RDM 时模型在与训练数据集如索尼使用相同相机类型拍摄的图像上取得了更好的结果这表明它在已知数据分布中学习结构化光照和反射先验的有效性。然而在不同相机传感器如尼康 D850拍摄的数据上性能下降这表明 RDM 可能因过度适配训练数据的特征而引入域过拟合。这些发现凸显出虽然 RDM 有助于在熟悉的域内更好地识别但也会增加模型对输入域偏移的敏感性如传感器响应变化、校准或噪声分布变化。表 8RDM 的消融实验。“Ours wo RDM” 表示从 “我们的模型” 中移除 RDM 以及 L/R 特征 。2)不同扫描方向的 RAWMamba 消融实验为评估 RAWSSM 中八方向扫描机制的有效性我们进行了 1、2、4 个扫描方向的实验结果如表 Ⅸ 所示。从单一水平 Z 形扫描方向从上到下、从左到右开始我们观察到 PSNR 和 SSIM 分别下降 0.42 和 0.012这表明单一扫描方向不足以捕捉图像中的复杂模式和细节会导致重建质量下降。引入垂直扫描方向共两个方向略微提升了性能因为额外的方向有助于捕捉更多结构信息。进一步引入这两个方向共四个方向以创建四条路径结果有所改善但仍不及八方向机制。八方向扫描机制覆盖了更广泛的方向更好地捕捉了图像中的复杂细节和纹理从而显著增强了去马赛克性能。此外我们分析了不同扫描方向对推理时间的影响正如预期方向越多性能越好但推理时间也会增加这反映了深度学习中典型的权衡。表 9不同扫描方向的 RAWMamba 消融实验3)双域编码阶段增强分支的消融实验为研究哪个阶段使用 RDM 的特征来增强性能更有效我们将编码阶段的融合操作转移到解码阶段。由于融合操作数量不变整体模型参数和 GFLOPs 也不受影响结果如表 Ⅹ 所示。我们观察到性能略有下降因此我们选择在两个域的编码阶段使用 DAF 进行融合操作。表 10双域编码阶段增强分支的消融实验4)RAW 域监督和损失函数的消融实验为评估 RAW 域监督的有效性我们进行了移除 RAW 域监督、仅使用 RGB 域监督且采用不同损失函数的消融实验结果如表 Ⅺ 所示。仅使用 L1 损失进行 RGB 域监督第二行时PSNR 和 SSIM 均显著下降这表明 RAW 域监督的重要性。我们进一步探索 L1 和 L2 损失的组合仅使用 L2 损失进行 RGB 域监督第一行时PSNR 下降 0.49SSIM 下降 0.018这表明仅使用 L2 损失是不够的。然后我们分别对 RAW 和 RGB 域使用 L1 和 L2 损失性能有所提升凸显了 RAW 域监督的益处。有趣的是交换两个域的损失会带来进一步的提升这表明在我们的任务中 L1 损失更适合 RGB 域。总体而言尽管有这些改进性能仍落后于两个域都使用 L1 损失的组合。因此我们最终为我们的方法选择 RGB 域和 RAW 域监督均使用 L1 损失的组合。表 11RAW 域监督与损失函数的消融实验五、局限性与未来工作尽管我们提出的 RAWMamba 在 RAW 图像去噪和去马赛克方面展现出良好性能但仍存在一定局限性。该模型相较于现有先进方法在性能更优的同时参数和推理时间也略有增加。虽然参数增加在可接受范围内但对于智能手机等计算资源有限的边缘设备而言较长的推理时间可能会带来问题。我们的框架包括 Retinex 分支依赖于传统方法仍有优化空间。此外探索在不显著损失质量的前提下减少扫描方向以进一步提升效率是值得开展的工作。六、结论针对低光照条件下 RAW 图像的去噪和增强任务我们提出了 Retinex - RAWMamba这是一种新颖的两阶段跨域网络。我们的方法通过融入 RAWMamba拓展了传统视觉 Mamba 的能力RAWMamba 利用了 ISP 中去马赛克算法的固有特性以实现更好的色彩校正和细节保留。此外我们通过 Retinex 分解模块整合 Retinex 理论助力自动曝光校正生成光照和亮度保真度更高的 RGB 图像。全面的理论分析和实验验证凸显了我们方法的有效性和巨大潜力 。