拓冰建站拓冰建站
首页 / 资讯中心 / 正文

边界越复杂、光谱越难分,越值得优先标注:IDAL-FIM如何解释洪水深度主动学习

为什么主动学习总挑这些洪水影像IDAL-FIM论文通俗解读一句话读懂主动学习可以帮我们少标一些遥感影像但它为什么偏偏挑中某些样本往往像一个黑箱。本文提出IDAL-FIM用两个很直观的“类别模糊度”指标解释这一过程BPR看洪水边界有多复杂MDF看洪水与非洪水在光谱上有多像。实验发现表现最好的Margin和Entropy策略确实更偏爱“边界复杂、光谱难分”的影像因此主动学习不只是“挑模型最没把握的图”还可以进一步解释为“优先挑真正难标、难分、信息量大的图”。洪水深度学习有一个很现实的问题模型可以越来越复杂但高质量标注依然很贵。一景遥感影像要做洪水语义分割不只是给整张图贴一个“有洪水”的标签而是要逐像元勾出洪水边界。面积一大、事件一多人工成本就会迅速增加。主动学习Active Learning的想法很自然既然不可能把所有影像都标完那就让模型先告诉我们“下一批最值得人工标注的影像是哪几张”问题是模型选出来了我们却常常不知道它为什么选。2024年Hyunho Lee和Wenwen Li在Remote Sensing of Environment发表论文Improving interpretability of deep active learning for flood inundation mapping through class ambiguity indices using multi-spectral satellite imagery论文提出IDAL-FIMInterpretable Deep Active Learning for Flood Inundation Mapping重点不是重新发明一个洪水分割网络而是尝试回答一个更少有人研究的问题主动学习到底喜欢选择什么样的洪水影像一、主动学习解决的是“标哪些”不是“怎么标”普通监督学习通常是收集影像 → 全部人工标注 → 训练模型。主动学习则多了一个“挑样本”的过程先标少量数据 → 训练模型 → 从未标注数据里挑最有价值的样本 → 人工标注 → 加回训练集 → 再训练。它的目标并不是取消人工标注而是把有限的人工时间花在最值得标的影像上。论文采用的是典型的pool-based active learning。开始时有一个很大的未标注影像池只随机标100个样本随后每一轮再选100个新样本进行“人工标注”连续进行4轮最终训练样本从100增加到500。作者比较了5种选样策略选样方法通俗理解Random随机挑K-Means挑具有代表性的不同类型影像BALD挑模型自身最不稳定、不同推理结果分歧大的影像Entropy挑预测概率最模糊的影像Margin挑“洪水/非洪水”两个类别最难决断的影像真正需要解释的是这些方法最后挑出来的影像究竟有什么不同二、IDAL-FIM不是新分割网络而是一套“主动学习解释框架”论文仍然使用经典的U-Net做洪水分割并通过MC-dropout估计预测不确定性。IDAL-FIM的整体流程可以概括为五步。第一步建立全球未标注数据池并准备少量初始标注数据。第二步用已有标注训练U-Net。第三步在目标区域测试模型性能。第四步用不同主动学习策略从未标注池中挑选新的影像再假定由专家完成标注并加入训练集。第五步也是本文真正新增的部分分析被选中的影像究竟有什么特征从而解释主动学习为什么选择它们。作者为此设计了两个类别模糊度指标BPRBoundary Pixel RatioMDFMahalanobis Distance for Flood-segmentation。需要特别注意BPR和MDF不是用来直接挑选未标注样本的。因为计算这两个指标本身需要像元级标签。它们是在样本已经被选中并完成标注之后用来解释主动学习策略“刚才为什么会挑中这些图”。真正负责无标签选样的仍然是Margin、Entropy、BALD、K-Means等acquisition function。三、BPR一张图里的洪水边界到底有多复杂BPR可以理解成BPR 洪水/非洪水边界像元数量 ÷ 总像元数量。如果一张影像里只有一大片形状规则的洪水边界占比通常不高。但如果洪水呈现大量细碎斑块很多弯曲边缘洪水与陆地交错狭窄水道和复杂岸线那么边界像元会明显增加BPR就会变高。作者认为BPR反映的主要是空间分辨率造成的类别模糊。边界越多10 m像元越容易同时包含水和非水模型越难判断。所以BPR越高通常说明这张影像在空间结构上越“难分”。这也是一个非常直观的可解释指标不需要分析神经网络内部特征只需要看洪水边界本身是否复杂。四、MDF洪水和非洪水在光谱上到底像不像有些洪水影像难不是因为边界复杂而是因为洪水和周围地物在光谱上太像。例如浑浊水体、阴影、湿土、某些植被区域都可能降低洪水与非洪水之间的光谱区分度。作者用Mahalanobis Distance构造MDF衡量一张影像中洪水类与非洪水类平均多光谱特征之间的距离。这里不用记复杂公式只需要记住方向MDF大两类光谱差异明显比较容易分MDF小洪水和非洪水光谱接近更难区分。因此高BPR 低MDF 一张真正“难”的洪水影像。前者代表空间边界复杂后者代表光谱特征相似。这两个指标刚好从空间和光谱两个角度解释“类别模糊”。五、实验数据怎么设计其实是在测试“全球样本怎么选”论文使用Sen1Floods11数据集。原始数据包括446组Sentinel-1、Sentinel-2和对应洪水标签覆盖2016—2019年的11场洪水。本文没有使用SAR作为模型输入而是使用Sentinel-2多光谱影像并采用Red、NIR、SWIR2转换得到的HSV特征。原始512×512影像进一步切成4个不重叠的256×256 tile。11个地区被分成两部分。未标注数据池来自8个地区Ghana、India、Pakistan、Paraguay、Somalia、Spain、Sri Lanka和USA共1532个样本。目标测试地区有3个Bolivia、Nigeria和Vietnam共252个样本。其中目标区域的数据只用于验证和测试主动学习选择的新样本来自前面的全球未标注池。所以这篇论文研究的并不是“洪水发生以后从这场灾害现场挑几张图来标。”而更接近“面对一个全球洪水影像库应该优先标哪些样本才能让模型更好地泛化到新的地区”这个定位非常重要。六、Margin和Entropy为什么表现最好论文最直接的结果是Margin表现最稳定Entropy总体排名第二。整个未标注池有1532个样本而主动学习最多只使用500个样本。实验显示Margin和Entropy选出的子集模型性能能够接近使用全部1532个样本训练的模型。更有意思的是它们在样本数量明显更少时就已经超过随机选择。例如Bolivia中Margin和BALD使用比Random少约300个训练样本时平均F1仍能超过Random-500Nigeria中Margin和Entropy少约300个样本仍优于Random-500Vietnam中Margin少约200个样本仍超过Random-500。论文第9页图5非常直观Random的F1曲线波动较大甚至出现“增加训练数据以后平均F1反而下降”的情况Margin和Entropy则更快接近使用全部数据训练的上限。这说明一个很实际的问题训练样本不是越多越好关键是新增的样本有没有信息量。七、为什么Margin选出的影像更“值钱”这正是BPR和MDF发挥作用的地方。作者计算每一轮主动学习中BPR/MDF与不同不确定性选样分数之间的Spearman秩相关。结果非常清楚BPR与Margin、Entropy分数呈明显正相关MDF与Margin、Entropy分数呈明显负相关BALD与这两个类别模糊指标的相关性明显弱一些。翻译成直白的话就是Margin和Entropy越认为一张影像“值得标”这张图往往边界越复杂、洪水与非洪水光谱越相似。也就是说模型的不确定性不是完全不可解释的黑箱它确实对应着输入影像中可以理解的真实困难。论文第11页图8中Margin和Entropy的BPR相关系数整体约在0.6附近而MDF相关性多在约-0.6到-0.7附近BALD的关系明显更弱。作者据此认为BPR和MDF能够作为解释predictive uncertainty的重要变量。不过更严谨地说这些结果证明了显著相关关系并提供了合理机制解释但仅靠Spearman相关和不确定性传播理论并不能严格完成统计因果识别。论文讨论中使用了“strongly support a causal relationship”的表述阅读时应理解为作者的机制性解释而不是随机实验意义上的因果证明。八、最直观的一组数字Margin到底挑了什么样的图论文第13页给出了Bolivia第一轮选样的一个非常直观对比。Random随机选出的样本平均BPR约0.03MDF约3.89。Margin选出的样本平均BPR约0.10MDF约2.34。也就是说Margin选出的图边界复杂度是随机样本的3倍左右同时洪水与非洪水之间的光谱距离明显更小。这基本把Margin的行为解释清楚了。它不是在随机找“奇怪影像”而是在主动寻找边界更多 光谱更难分的洪水场景。这类样本虽然更难却往往包含更多模型尚未学会的信息。九、主动学习为什么还能顺便缓解类别不平衡论文还引入了第三个指标FPRFlood Pixel Ratio 洪水像元数 / 总像元数。它不是类别模糊度指标而是用来衡量一张影像里洪水占多少。作者发现一个有意思的空间规律当FPR小于0.5时FPR与BPR呈正相关超过0.5后两者转为负相关。换句话说当洪水和非洪水大约各占一半时边界通常最丰富BPR也更容易达到高值。在整个未标注池中96.4%的样本FPR小于0.5说明数据明显偏向“非洪水占多数”。而Margin和Entropy因为偏爱高BPR影像会间接把选中的FPR推向0.5附近。在Bolivia第一轮中Margin和Entropy选择样本的平均FPR约为0.45而Random只有约0.07。这意味着主动学习不仅在寻找难样本还在无形中减少“全是背景”的训练数据让洪水/非洪水比例变得更均衡。十、Random、K-Means和BALD分别有什么特点论文的二维密度图把五种策略的区别画得非常清楚。Random基本复制未标注池原来的数据分布。池子里什么最多它就大概率选什么因此很容易继续选到大量普通、低洪水比例样本。K-Means虽然追求特征多样性但结果仍明显受到原始数据池分布影响。如果未标注池本身极不均衡密度型选样不一定能主动找到最难的洪水样本。Margin和Entropy的行为最鲜明。它们明显向高BPR、低MDF移动也就是主动偏向类别模糊度更高的样本。BALD介于两者之间。它能选出较高BPR的样本但在寻找低MDF样本方面不如Margin和Entropy。原因在于BALD关注的是模型不确定性也就是多次MC-dropout推理之间有多大分歧Margin和Entropy更直接关注当前预测概率是否接近“50对50”。在二分类洪水分割中洪水/非洪水光谱接近和边界混合恰好更直接反映在predictive uncertainty上因此Margin和Entropy与BPR、MDF关系更紧密。十一、这篇论文真正的创新是什么这篇论文最大的贡献不是U-Net也不是提出一种新的主动学习打分函数。真正有特色的是三个方面。第一把“主动学习为什么选这张图”变成了一个可以量化的问题。以前通常只比较哪种acquisition function最终F1最高本文进一步追问它挑出来的影像在空间和光谱上到底有什么共同特征第二用BPR和MDF把黑箱不确定性翻译成遥感人员能理解的语言。高BPR意味着边界复杂低MDF意味着洪水与非洪水光谱相似。相比直接告诉标注人员“这张图Entropy0.62”这种解释明显更有实际意义。第三把主动学习和数据集管理联系起来。随着迭代增加高信息量样本会逐渐被“挑空”Margin和Entropy选中样本的分布开始慢慢回到整个数据池的平均状态。所以主动学习不是永远重复运行就有效。当优质难样本被耗尽后应该考虑继续补充新的地区、新事件和新类型影像而不是只在旧数据池里反复挑。BPR和MDF因此还可以作为观察“未标注池里还有没有值得标的数据”的一种诊断工具。总结主动学习真正值得标的不是“模型随便觉得难”而是边界复杂、光谱难分的洪水影像这篇论文可以压缩成一个很简单的逻辑。洪水深度学习最大的成本之一是人工标注。主动学习希望少标数据但优先标最有价值的数据。IDAL-FIM进一步追问“最有价值”到底是什么意思作者给出的答案是两个非常直观的维度BPR高洪水和非洪水交界复杂空间混合严重MDF低洪水和非洪水光谱相近语义更难区分。实验中表现最好的Margin和Entropy恰恰更偏爱这类样本。因此这篇论文真正带来的不是又一个更高F1的网络而是让主动学习从“模型说这张图值得标。”进一步变成“因为这张图洪水边界特别复杂而且洪水和非洪水光谱非常接近所以它值得优先标。”对于遥感数据集建设这种解释非常有价值。未来如果进一步加入SAR、DEM、地形、云遮挡、植被洪水以及真实标注耗时就可以把主动学习从“减少样本数量”进一步推进到真正减少标注成本同时主动构建更有信息量、更具代表性的洪水训练集。论文信息论文题目Improving interpretability of deep active learning for flood inundation mapping through class ambiguity indices using multi-spectral satellite imagery作者Hyunho Lee、Wenwen Li期刊Remote Sensing of Environment卷与文章号3092024114213在线发表时间2024年5月25日DOI10.1016/j.rse.2024.114213数据集Sen1Floods11核心模型U-Net MC-dropout
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门