089、YOLOv11改进-无人机航拍场景下的密集小目标检测——结合SAHI与超分辨率增强的即插即用方案,小目标AP提升7.2%
089、YOLOv11改进-无人机航拍场景下的密集小目标检测——结合SAHI与超分辨率增强的即插即用方案,小目标AP提升7.2%踩坑实录:无人机航拍数据集上的惨痛教训去年接了个无人机巡检项目,客户要求检测输电塔上的螺栓松动——螺栓在航拍图像里也就十几个像素。我一开始天真地以为YOLOv11的C2f模块能搞定,结果在VisDrone数据集上跑完,mAP@0.5:0.95只有可怜的11.3%。小目标AP更是惨不忍睹,0.8%。当时我盯着TensorBoard上那条几乎贴着x轴的曲线,心想这模型怕不是把螺栓当成了噪声。后来翻了一周论文,试了各种trick:多尺度训练、Mosaic增强、注意力机制堆叠,效果都像隔靴搔痒。直到我把SAHI(Slicing Aided Hyper Inference)和超分辨率增强组合在一起,小目标AP直接从0.8%跳到了8.0%。这个7.2%的提升不是玄学,是实打实的工程优化。问题本质:为什么YOLOv11在无人机场景下会失效YOLOv11的backbone在ImageNet上预训练时,特征图的分辨率设计是针对常规尺寸目标(32x32像素以上)的。当目标缩小到10x10像素以下,经过几次下采样后,特征图上可能只剩1-2个激活点。C2f模块虽然通过跨层连接保留了部分细节,但深层特征图的感受野过大,小目标的响应被背景淹没。更致命的是,无人机航拍图像中目标分布极度不均匀——密集的车辆、行人、螺栓挤在一起,常规的NMS后处理会把相邻的小目标当成重复检测直接干掉。我调试时发现,有些场景下GT框之间的