TopoPerception: A Shortcut-Free Evaluation of Global Visual Perception in Large Vision-Language M...

发布时间:2026/7/26 9:27:41
TopoPerception: A Shortcut-Free Evaluation of Global Visual Perception in Large Vision-Language M... 文章总结与翻译一、主要内容研究背景:大型视觉语言模型(LVLMs)通过视觉编码器将视觉特征与预训练语言模型对齐,但其视觉感知模块存在瓶颈,且传统评估基准因含局部捷径易高估模型感知能力,无法准确衡量全局视觉感知水平。核心方案:提出TopoPerception基准,基于拓扑学特性(连通性、孔洞数量、内外关系)设计任务,拓扑特性依赖图像全局结构且不受局部特征影响,实现无捷径评估。该基准采用固定文本问题与选项、合成图像数据集,支持多粒度感知难度调节。实验结果:在最简单难度级别(29×29分辨率)下,主流LVLMs(如GPT-4o、Claude 4系列、Gemini 2.5系列)表现接近随机猜测(准确率约20%),无法有效捕捉全局视觉特征;同一模型家族中,推理能力更强的大型模型准确率反而更低,表明单纯扩大模型规模可能加剧全局感知缺陷。研究结论:当前LVLMs的架构设计(视觉编码器压缩、跨模态对齐等)导致全局视觉信息丢失,训练目标侧重语义描述而非全局结构保留。未来需优化模型架构(如迭代式视觉编码器)、平衡推理与感知能力,以提升全局视觉感知水平。二、创新点无捷径评估范式:首次利用拓扑学特性构建基准,彻底规避传统语义任务中的局部捷径,直接孤立衡量全局视觉感知能力,而非语义理解或推理能力。可控难度设计/