Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Langu...
文章核心内容与创新点总结一、主要内容本文针对指代多目标跟踪(RMOT)任务中静态语言参考与动态视觉模态存在时间差异的问题,提出了一种名为VMRMOT的视觉-运动-参考对齐框架。该框架通过多模态大语言模型(MLLMs)引入运动模态,填补静态参考与动态视觉之间的鸿沟,提升跨模态跟踪性能。核心背景RMOT在传统多目标跟踪(MOT)基础上引入自然语言参考,实现以人为中心的指令驱动跟踪,但现有方法依赖静态参考描述(仅包含外观、相对位置和初始运动状态),无法捕捉物体速度变化、运动方向转换等动态行为,导致假阳性(FP)和假阴性(FN)问题,限制了跟踪性能。框架结构运动特征提取:从物体历史轨迹中提取位置、运动方向、距离趋势和速度趋势四大关键线索,生成运动感知描述,再利用MLLMs(采用Qwen2.5-Omni-3B)的时序推理能力提取运动特征,形成运动模态。视觉-运动-参考对齐(VMRA)模块:通过分层跨注意力机制,将视觉查询与运动特征、参考特征依次对齐,增强跨模态一致性。运动引导预测头(MGPH):融合运动模态与参考特征,优化目标类别预测、边界框回归和参考对齐置信度评估,提升轨迹预测的准确性和一致性。实验验证:在Refer-KITTI和Refer-KITTI-V2数据集上进行大量实验,VMRMOT在HOTA、DetA、AssA等核