
这篇论文最有意思的地方,不是"把注意力范围扩大"这么简单,而是让图像里的每个像素都独立地、不对称地去寻找自己最需要的"援军"——就像每个学生自己组队,而不是全班按座位分组。论文标题:From Local Windows to Adaptive Candidates via Individualized Exploratory: Rethinking Attention for Image Super-Resolution作者:Chunyu Meng, Wei Long, Shuhang Gu(电子科技大学)发表时间:ECCV 2026原文链接:https://arxiv.org/abs/2601.08341开源代码:https://github.com/CVL-UESTC/IET.git超分任务的老问题:注意力到底该看多远?图像超分辨率(Super-Resolution,SR)这件事,表面看是"把模糊图变清晰",实际上是一场精细的"信息拼图"——模型得从低分辨率输入的每个像素出发,推测出缺失的高频纹理细节。Transformer-based 的方法在这方面做得不错,因为它们能用自注意力(Self-Attention)让每个像素看到其他所有像素,建立全局依赖。然而问题也出在这里:如果让每个像素和所有其他像素都做交互,计算量会炸——复杂度是 O(N²),图像的像素数 N 一上来,显卡直接冒烟。那怎么办?目前主流做法就两条路:窗口注意力(Window-based):把图像切成固定大小的方块,每个像素只看自己窗口里的邻居。代表作 SwinIR。问题?窗内像素都是空间上挨着的,但超分任务里,真正有用的信息可能远在天边——一个纹理像素最需要的"队友"可能在图像的另一头。类别注意力(Category-based):先把像素按纹理相似性分类,然后在同类内部做注意力。代表作 ATD。听起来合理,但分类边界很难划准,而且一个像素如果和另一类里的某些像素更相似,它也没法跨类去交互。这两种方法本质上是同一个问题:它们都是"分组式注意力"——先画好圈,再让圈里的人互相看。但问题在于,超分场景下,相似性关系是天然不对称的。这里要顺手解释一个概念:什么叫"不对称"?简单说就是——像素 A 可能需要从像素 B 那里借纹理信息来重建自己,但像素 B 根本不需要 A。如果强行让它们对称交互,A 的信息流里就掺进来了不需要的东西,反而添乱。那有没有一种办法,让每个像素自己决定"我要看谁",而且只看那些它真正需要的,同时那些被看的像素不需要反过来看它?这就是这篇论文要解决的问题。核心创新:让每个像素自己组队,不对称探索最靠谱的"援军"这篇论文提出了In