图像融合综述整理指南:从经典论文到深度学习方法全解析
图像融合这四个字在学术检索里一直是个长青标签这几年又因为深度学习重新热了一轮。我自己在写方法论文和整理文献的时候光是“从哪篇综述开始读、哪些经典论文必须精读、测试用哪几个数据集、指标怎么配”这套问题就来回折腾过好几轮。这篇东西就是把我整理图像融合综述论文时踩过的路、筛出来的核心文献以及一套可以直接复制的文献管理流程完整写成一份可参考的操作笔记。如果你刚进入这个方向想快速梳理脉络或者你已经做了几年想查漏补缺这篇整理应该能帮你省下不少时间。1. 先摸清地图图像融合综述论文的几个主要脉络1.1 图像融合到底在研究什么、解决什么问题图像融合的核心任务很简单把多幅来自不同传感器或不同拍摄条件的图像合并成一幅信息更完整、更符合人类感知或后续任务需求的图像。最常见的例子是红外与可见光融合白天可见光图像纹理清楚晚上或雾天则依赖红外图像里保留的热辐射信息多聚焦融合则是把同一场景里聚焦在不同深度的多张照片合成一张全清晰的图多曝光融合处理的是同一场景不同曝光度的照片目标是不过曝也不欠曝。医学影像里也常用比如把MRI的软组织分辨率和CT的骨骼信息结合或者把PET的功能信息叠加到MRI解剖图上。遥感里面还有个专门叫“全色锐化”的方向用高分辨率全色图像给低分辨率多光谱图像补细节。理解这个范围之后再去看论文你会发现这个领域其实不是一个单一问题而是一族问题按融合层级、传感器组合、应用场景、方法流派可以分成很多条子脉络。整理综述论文的第一件事不是急着收藏几十篇PDF而是先把地图画出来知道自己要整理的是哪一小块。1.2 按融合层级划分像素级、特征级、决策级经典教科书里会把图像融合分成三个层级。像素级融合直接对原始像素或变换域系数做合并保留的信息最完整也是论文数量最多的一类。先对图像做小波、金字塔之类的变换然后在系数层面做融合最后重建出融合图这也算像素级融合只是操作空间从像素换到了变换域。特征级融合则是先从每幅源图中提取边缘、区域、显著性目标等特征再把这些特征合并成统一的表示很多多模态目标检测里的“特征融合模块”就属于这个层级但要注意它和图像融合论文里的“特征级融合”并不完全是一回事。决策级融合最接近人类判断每个传感器先独立完成检测或者分类再通过投票、D-S证据理论等方式做最终决策雷达与红外目标识别系统里很常见。整理文献的时候我建议先按这个层级把论文分成三堆因为不同层级的评价方式和下游任务完全不一样。像素级融合有标准的图像质量指标可以直接量特征级和决策级往往要挂到检测率、识别率这类任务指标上去混在一起整理很容易把评价体系搅乱。1.3 按方法演进划分传统方法与深度学习方法按时间线和方法流派划分是另一条很实用的脉络。2016年前后是个明显的分水岭。那之前的主流方法是多尺度变换、稀疏表示、优化模型这类传统思路理论分析扎实解释性好但在复杂场景下的泛化能力有限。那之后CNN、GAN、Transformer、Mamba陆续进入图像融合特征表达能力和端到端优化能力大幅提升论文数量也爆炸式增长。我的经验是整理传统方法时重点看设计动机和数学框架整理深度学习方法时重点看网络结构、损失函数和训练策略。两者不是割裂的很多深度学习工作都在模仿经典方法里的融合规则比如DenseFuse里用L1范数选择特征和二十年前小波系数取绝对值最大化是一个思路只是从手动设计变成了网络自适应。2. 经典方法阶段的代表性综述与论文2.1 多尺度变换与金字塔路线经典方法里最先要读的是多尺度变换家族。1983年Burt和Adelson提出的拉普拉斯金字塔本来是用来做图像压缩编码的后来被跨界用到了融合上。核心思路是把图像分解成一层一层的带通细节每一层各自融合再逆变换重建。这种“分解—融合—重构”的三段式框架奠定了后面几十年的基本范式直到今天的深度网络里还能看到它的影子。1989年Toet又提出了基于低通比率金字塔的融合方法专门针对可见光与红外图像用对比度作为融合权的依据在视觉效果上比直接拉普拉斯金字塔更自然。到了1995年Li、Manjunath和Mitra把小波变换引入多传感器图像融合相比金字塔小波分解在频域和空间域都有定位能力方向性也更好融合时保留边缘和纹理的能力更强这篇文章也成为这个方向被引次数极高的经典。整理这段历史时我建议不要纠结于复现每一种金字塔而是抓住两条演变线索第一分解工具从金字塔到小波再到轮廓波、剪切波越来越稀疏、方向性越来越强第二融合规则从简单的系数取大、加权平均发展成基于区域能量、对比度、梯度等更复杂的策略。这条线索会帮助你理解为什么后来稀疏表示能火起来。2.2 稀疏表示与低秩路线稀疏表示在2010年前后是图像融合里的一个重要流派。Yang和Li在2010年前后发表的多聚焦图像融合与重建工作算是代表性起点。思路是把图像小块用字典原子的稀疏线性组合来表示稀疏系数越大说明对应的字典原子越能代表该块的结构融合时比较稀疏系数的活跃度来选块或加权。字典可以从自然图像里用K-SVD这类算法训练出来而不是手工设计。这类方法的优点在于有比较清晰的数学解释而且在噪声环境下比金字塔和小波更稳健。缺点是字典训练耗时滑动窗口处理速度慢稀疏系数的求解也需要迭代优化。后来李树涛团队和杨斌等人的一系列工作把稀疏表示扩展到多模态图像融合甚至用联合稀疏表示去处理不同传感器之间的相关性和差异性这些论文在整理时可以作为“稀疏表示子方向的复习主线”。还有一条线是低秩矩阵表示认为源图像可以看成低秩背景加稀疏噪声或显著细节的结构分别融合后再重建。这类方法在医学图像融合里比较受欢迎因为医学图像背景相对平稳低秩假设成立得比较好。整理时可以把稀疏表示和低秩归为一类来读因为它们的数学工具有很多相通的地方。2.3 遥感全色锐化里的经典方法遥感子方向的做法和通用图像融合差别很大建议单独整理。全色锐化最经典的方法是IHS变换把多光谱图像转到亮度、色调、饱和度空间然后用高分辨率全色图像替换亮度分量逆变换回来这样既提升了空间分辨率又大致保住了颜色。后面又有基于主成分分析的替代法思路和IHS类似只是换了个线性变换空间。再后面Gram-Schmidt正交化方法在商业软件里被广泛使用它比IHS更稳光谱失真更小。2015年Vivone等人的论文对主流全色锐化算法做了一次系统比较用了降分辨率实验和多种指标是我见过遥感融合综述里比较扎实的一篇。如果你要接触遥感融合这篇综述可以当入口。遥感子方向还有一个特点是评价协议特殊常用ERGAS、SAM、QNR这类面向光谱保真的指标和自然图像里的SSIM、PSNR不是一个体系整理时一定要注意区分。3. 深度学习阶段的核心论文与综述脉络3.1 CNN路线从二分类到统一无监督框架深度学习方法里CNN路线是最庞大的一支。2017年Liu等人在Information Fusion上发表的“Multi-focus image fusion with a deep convolutional neural network”把CNN当成一个二分类器来用。输入是多聚焦图像的小块网络输出该块来自哪张源图的概率图再通过一致性验证生成最终决策图。这个思路很巧妙把融合问题转化成了分类问题避开了手工设计融合规则。2019年Li和Wu提出DenseFuse改用编码器—解码器结构编码器用密集连接提取特征融合层用L1范数对特征做选择解码器重建融合图像。相比分类思路这已经是端到端的特征融合范式对红外和可见光融合特别有效。2020年前后出现了两个影响力很大的通用框架Zhang等人的IFCNN提出一个不用训练的通用融合框架用ImageNet预训练网络提取多尺度特征再按固定策略融合Xu等人提出的U2Fusion则用无监督方式训练一个可以同时处理红外可见光、多曝光、多聚焦等多项任务的统一网络靠信息量测量来动态分配融合权重。如果说DenseFuse让很多人第一次感觉到深度学习在融合上的甜头U2Fusion则把“设计一个通用融合网络”这个目标推到了前台。整理CNN路线时我习惯按“决策图—特征融合—统一框架”三个阶段去归档。这三个阶段不是严格的时间先后但能帮你理解问题建模的演进从判断像素属于哪张源图到从深度特征里重新组合信息再到让网络自己决定从每张源图里取多少信息。3.2 GAN路线让融合图更像真的GAN在图像融合里的代表作是2019年Ma等人提出的FusionGAN。生成器负责把红外和可见光图像融合成一张图判别器则被训练去区分融合图和可见光源图。生成器为了骗过判别器会努力让融合图的可见光纹理部分更逼真同时通过内容损失保住红外显著目标。这种对抗训练方式对解决传统方法容易出现的边缘模糊、纹理丢失问题很有效。后续的DDcGAN采用了双判别器结构一个判别器区分融合图和可见光图另一个区分融合图和红外图两个判别器共同约束让融合图同时兼顾两个源模态的特性。还有工作把注意力机制引入生成器针对不同光照条件动态调整融合权重。整理GAN路线时重点不是看谁的图像更漂亮而是看对抗损失、内容损失、感知损失这三类损失函数怎么配比以及判别器的设计如何影响融合图的模态倾向。GAN训练不稳定是公认的问题所以很多文章在实验里会特别展示不同训练轮次下的稳定性这个在复现时值得留意。3.3 Transformer与状态空间模型长距离依赖下的新变化2022年Ma等人在ICCV上发表的SwinFusion把Swin Transformer引入通用图像融合用跨域长距离学习来捕捉源图像之间非局部的依赖关系。相比CNN只能建模局部感受野Transformer的注意力机制天然适合建模图像中距离较远的语义对应比如红外里的热目标与可见光里对应位置的轮廓这种跨模态长距离匹配对融合质量有明显帮助。2024年以后基于Mamba的状态空间模型也开始进入图像融合领域。Mamba的结构复杂度随序列长度线性增长比Transformer的二次复杂度省资源在一些高分辨率遥感融合任务上优势明显。不过这个方向还比较新目前还没有形成像DenseFuse、U2Fusion那样公认的必读基准建议用“image fusion Mamba”作为关键词做持续追踪看到结构和损失函数上有意思的工作再精读。3.4 综述论文里反复出现的“基准框架”怎么看深度学习图像融合的综述论文很多我实际整理时反复对照的主要有这几类。第一类是全景式综述比如Liu等人在Information Fusion上发表的深度学习图像融合综述把方法按网络结构、损失函数、融合策略做了完整梳理适合建立整体认知。第二类是任务限定综述像红外可见光融合综述会给出这个子方向特有的难点、数据集和评价方式。第三类是遥感方向的比较综述Vivone那篇就是典型实验设计非常完整适合学习怎么设计公平的实验对比。读综述的正确姿势我个人的经验是不要只看文字结论一定要把综述里那些对比表格当作“索引地图”。每次看到一张好的对比表就把表里的方法名、数据集、指标、代码链接全部摘到自己的笔记里这样综述读完你自己的文献清单也就初步成型了。4. 数据集与评价指标整理论文时最容易漏掉的一块4.1 主流数据集速查整理综述论文时数据集这块特别容易被忽略但恰恰是决定论文能不能复现、结论有没有说服力的关键。下面这些是我整理时用得最多的数据集。红外可见光方向TNO是最经典的数据集来自荷兰应用科学研究组织包含各种战术场景下的长波红外与可见光配对图像图像已经配准缺点是规模很小只有几十对。RoadScene是从FLIR公开数据里切出来的道路场景红外可见光对分辨率更高、目标更小更密集更贴近自动驾驶。KAIST多光谱数据集原本是做行人检测的包含大量白天夜晚、城市道路场景的配准图像对融合社区也常拿来当评测集。LLVIP则是弱光可见光和红外的配对数据集挑战主要体现在极低照度下的可见光几乎不可用。多聚焦方向Lytro数据集用光场相机拍摄同一个场景可以生成多个聚焦位置不同的图像是评测多聚焦融合的传统选择。MFI-WHU则来自武汉大学相关工作分辨率更高聚焦区域更不规则比Lytro更有区分度。医学图像融合常用Harvard医学院的脑部影像图谱可以在MRI T1、T2、CT、SPECT、PET之间自由组合成测试对。遥感全色锐化则常用QuickBird、IKONOS、WorldView-2/3等卫星影像通过Wald协议先把原始图像降分辨率再模拟测试这样可以拥有参考图来计算定量指标。4.2 评价指标的选择与对比注意事项图像融合的评价指标一直是个争论不休的话题。有参考图的场景下PSNR、SSIM、MS-SSIM用得最多多聚焦融合因为可以用全清晰原图做参考基本都走这一套。无参考场景下信息熵EN、平均梯度AG、空间频率SF、标准差SD等用来衡量信息量和清晰度互信息MI衡量融合图像保留了多少源图像信息QAB/F是Xydeas和Petrovic在2000年前后提出的梯度信息保真度指标在红外可见光融合里几乎是标配视觉信息保真度VIF则从信息论角度评估融合结果保留的视觉信息。使用这些指标时要注意三个坑。第一不同论文对同一指标的具体计算可能不同比如SSIM的窗口大小、通道处理方式、动态范围归一化方式都会影响数值直接从原文抄表格对比很容易出错最好下载作者公开的指标计算代码重新算。第二指标之间可能存在矛盾一张融合图像可能熵很高但QAB/F很低这时候需要结合主观视觉评估和下游任务指标一起判断。第三深度学习方法常用COCO等自然图像预训练如果测试数据分布和训练数据高度重合指标优势可能有水分整理时要留意训练集和测试集的划分方式。5. 一套直接可复用的综述整理流程5.1 从关键词到引文网络的操作步骤我整理一个子方向综述时基本步骤是固定的。第一步确定范围把“图像融合”这个大标签缩小到具体任务比如“红外可见光融合的深度方法”。第二步写检索式在学术数据库里跑推荐在Web of Science、Scopus和Google Scholar分别执行检索式可以这样写TITLE-ABS-KEY( (image fusion) AND (infrared OR visible) AND (deep learning OR CNN OR GAN OR Transformer) )如果只是想找综述论文在标题里把review、survey、overview加进去一起搜能快速得到一批综述文献。第三步用Connected Papers或ResearchRabbit这类引文网络工具基于一篇核心综述生成引文关系图。它的妙处在于能让你找到综述正文里可能没提但被大量引用的“隐藏关键节点”也就是那些从侧面支撑了领域发展的论文。第四步把选出来的30到50篇论文按方法族分组分完组就按照“传统多尺度—稀疏表示—CNN—GAN—Transformer—Mamba”的顺序去读而不是按发表时间读。第五步读的过程中持续更新一个总对比表等到对比表里的信息足够密集综述的轮廓也就自然出来了。5.2 文献管理工具与笔记模板工具我用的是Zotero加Better BibTeX插件免费跨平台标签体系足够灵活还能直接导出bib文件给LaTeX用。目录结构我建议按照“子方向—方法族—具体工作”三级来建比如“红外可见光融合—GAN—FusionGAN”。每一篇核心论文都做一条结构化笔记我用的模板大致如下。字段内容方法名称DenseFuse作者/年份/发表地Li Hui2019IEEE TIP融合层级/任务像素级红外与可见光核心思想编码器—解码器结构密集连接提取特征融合策略/损失函数特征L1范数选择SSIMMSE损失数据集与指标TNO、RoadSceneSSIM、AG、MI复现信息官方代码是否有环境版本与其他工作的关系承接CNN特征融合后续被U2Fusion扩展备注/个人评价结构简单适合当基线复现这套模板里我最看重“与其他工作的关系”这一栏因为它能强迫你每次读论文都把这篇放回到整个脉络里去看而不是孤立地记摘要。时间长了你会发现自己对领域里“谁启发谁、谁比较谁、谁补谁的坑”会形成非常清晰的认知。5.3 整理过程中常见的坑与排查办法整理过程里我踩过的坑有不少挑几个典型的说说。第一个坑是搜索词太宽把“image fusion”不加引号直接搜会混进大量关于“数据融合”“特征融合”甚至“传感器融合”的不相关论文解决办法是给关键词加引号或者限定标题字段。第二个坑是版本混乱同一篇工作可能有会议版、期刊版、arXiv预印本好几个版本内容还经常不一样引用时尽量以最终发表的期刊或会议版为准。第三个坑是数据集不可得有些论文用了私有数据集或者只给了下载链接但链接已经失效整理时一定要在笔记里标记是否可复现否则可能看完方法却跑不了实验。第四个坑是指标计算版本不一致前面已经说过不同论文的指标实现细节差异很大对比前一定要统一计算代码。还有一个比较特殊的坑是搜索引擎和数据库里会出现不规范的联想词。最近检索“图像融合”时我见过“emma图像融合”这样的搜索联想组合听起来像某个具体模型但在学术数据库里并没有对应的正式定义大概率是EMMA缩写、某个项目名或者语言模型生成的噪音关键词。遇到这类词我的处理方式是回到正规术语去检索不要被带偏否则会在无效关键词上浪费大量时间。6. 整理过程中必备的经验技巧6.1 如何判断一篇论文值不值得精读图像融合领域的论文数量增长很快如果不做筛选每天都可能有新预印本出现。我常用的筛选标准有三个。第一看发表的期刊会议是否靠谱Infomation Fusion、IEEE TIP、TCYB、CVPR、ICCV、AAAI这些地方的工作整体质量有保障ArXiv上的工作则要结合代码质量、后续引用情况来看。第二看有没有官方代码和实验配置一个完整公开的代码库比十页公式更有说服力也直接决定你能不能复现和对比。第三看实验对比是否充分如果一篇论文只在两三个数据集上和两三个方法比较没有消融实验也没有指标细节那么它的结论可信度就要打折扣。6.2 维护自己的方法对比表我最终整理出一份比较理想的方法对比表一般会包含方法名称、年份、方法类别、融合层级、核心技术、公开代码、测试数据集、主要评价指标、论文中报告的大致结论、我的个人备注这十栏。这个表不一定一次写完读一篇补一行过一两个月回看时你会明显感到对整个研究地图的理解比开始清晰了很多。它最大的价值不在表格本身而在推动你以“对比和归纳”的方式去读文献而不是一篇一篇孤立地读完就忘。6.3 用arXiv动态追踪新工作综述整理是一个持续过程不是一次性任务。我的习惯是定期去arXiv上搜索“image fusion”按提交时间排序只扫一眼标题和摘要遇到值得关注的工作就丢进Zotero待读文件夹。这样做的好处是能在正式期刊出版之前就了解最新动态尤其是像基于状态空间模型的融合这类短时间快速发展的方向动态追踪必不可少。追新时一定要在笔记里标注“待验证”还是“已精读”避免把未复现工作的结论当成既定事实写进自己的综述里。7. 如果你准备进入这个方向一个小建议做综述整理的根本目的不是把文献塞进文件夹然后产生一种“我已经读了很多”的幻觉而是通过系统化的对比和记录真正把领域的发展逻辑装进自己脑子里。我的建议是无论你的最终目标是做研究还是做工程都把“先复现一个经典基线”放在第一步。DenseFuse、U2Fusion这类工作结构清晰、代码公开、数据集好找是很好的入门起点。跑通一个基线以后再去看其他论文的改进点你会发现原来那些概念很快就能对上号。写论文时也不要一味追求方法花样先把某个任务场景下的评测体系做扎实。图像融合的论文虽然多但很多实验对比并不公平数据集的划分、指标的计算、参数的选择都可能影响结论。如果你能在某个子方向里建立一套合理的评价流程把主流方法统一复算一遍这本身就是很有价值的贡献。我自己的体会是整理综述的过程比成果更重要。坚持一段时间之后最初需要花一晚上才能理清的一堆文献到后来基本看一遍摘要和模型图就能判断该不该精读。这个能力不靠天赋靠的就是持续的结构化积累。希望这一套整理思路能帮你在图像融合这个方向起步得更顺一些。