拓冰建站拓冰建站
首页 / 资讯中心 / 正文

终极指南:Accuracy与MRA双指标如何量化大模型的空间理解力?VSI-Bench评测体系全解析

终极指南Accuracy与MRA双指标如何量化大模型的空间理解力VSI-Bench评测体系全解析【免费下载链接】thinking-in-spaceOfficial repo and evaluation implementation of VSI-Bench项目地址: https://gitcode.com/gh_mirrors/th/thinking-in-space大模型真的能看懂一个房间并记住空间布局吗为了量化这个问题CVPR 2025 Oral 论文Thinking in Space提出了VSI-Bench 空间理解力评测基准并引入了Accuracy 与 MRA 双指标评估体系。本文将用通俗易懂的方式为你拆解这套评测体系的设计思路、双指标的计算逻辑以及如何用它检验任意多模态大模型的空间理解力。VSI-Bench 是什么一套专测空间智商的题库VSI-BenchVisual-Spatial Intelligence Benchmark是专为衡量多模态大语言模型MLLM视觉空间智能而设计的评测基准。它包含超过 5000 个问答对全部来源于288 段第一视角室内视频这些视频取自 ScanNet、ScanNet 与 ARKitScenes 三个公开 3D 场景重建数据集的验证集覆盖家庭、办公室、实验室等多种真实环境。与普通的视频问答不同VSI-Bench 的问题不会在画面中直接给出答案——模型必须像人类一样在看完整段视频后建立一张认知地图再回答关于空间关系、物体数量、距离与路线的问题。8 大任务如何划分为什么单一指标不够用VSI-Bench 的 8 个任务被划分为三大类别这正是双指标存在的根本原因布局类任务Configurational物体相对方向易/中/难、物体相对距离、路线规划、物体出现顺序测量估计类任务Measurement Estimation物体绝对距离、物体计数、物体大小估计、房间大小估计时空类任务Spatiotemporal在视频中判断物体出现的先后顺序。可以看到布局与时空类任务的答案通常是明确的选项比如水壶在沙发的哪一侧而测量类任务的答案则是连续的数值比如床与沙发的距离是多少米。选项题可以用答对与否来打分数值题却无法用简单的对错衡量——因此 VSI-Bench 设计了 Accuracy 与 MRA 两套指标分工协作。Accuracy 指标选择题的标准答案判分法对于多选题MCAMultiple-Choice Answer类任务VSI-Bench 使用Accuracy精确匹配准确率作为核心指标。模型输出经过简单的模糊匹配处理后与标准答案做精确比对——完全一致记 1 分否则记 0 分最后按任务类型取平均。这一指标直观易懂它衡量的是模型能否在给定候选中精准命中正确选项对应我们在 lmms_eval/tasks/vsibench/utils.py 中看到的exact_match实现。随机猜测的基线得分会远低于人类水平Human Level 约 79.2%这让 Accuracy 成为衡量模型空间推理正确性的可靠标尺。MRA 指标数值题的容差打分妙招数值估算题最棘手的地方在于模型回答2.9 米而标准答案是3.2 米这算对还是算错VSI-Bench 提出了MRAMean Relative Accuracy平均相对准确率指标来解决这个问题。MRA 的核心思想是按误差容限分层打分。它会在置信阈值区间0.5 到 0.95步长 0.05内逐层判断预测值与真实值的相对误差是否在可接受范围内。模型预测越接近真实值通过的置信层就越多MRA 得分越高。例如误差在 50% 以内算合格、30% 以内算良好、5% 以内算优秀最后取所有层级的平均表现。这一设计既惩罚离谱的猜测又不会因为微小偏差否定模型的合理估算能力。双指标如何统一从 Overall 到排行榜在 vsibench_aggregate_results 中VSI-Bench 将每个任务的 Accuracy 与 MRA 得分统一为百分比并求平均得到Overall 综合得分用于模型间的横向排名。值得注意的是开源模型与商业 API 模型在同一套规则下零样本zero-shot评测保证公平可复现。评测覆盖了 Gemini、GPT-4o 等闭源模型以及 InternVL2、VILA、LongVA、LLaVA-OneVision、LLaVA-NeXT-Video 等主流开源模型——这也是 GitHub 加速计划镜像的 thinking-in-space 仓库中附带完整评测代码的原因。如何亲手运行 VSI-Bench 评测想验证自己模型的空间理解力项目的 evaluate_all_in_one.sh 提供了一键评测脚本支持批量指定模型与并行评测bash evaluate_all_in_one.sh --model all --num_processes 8 --benchmark vsibench评测配置位于 vsibench.yaml其中为数值题与选择题分别指定了不同的提示词模板确保模型输出格式可解析各场景的元信息房间大小、物体包围盒等也随仓库一并开放位于 data/meta_info 目录。总结双指标背后的评测哲学Accuracy 与 MRA 双指标的巧妙之处在于它承认了空间理解力的多样性选择题考验定性判断的精确度数值题考验定量估算的稳健度。两者结合才构成对多模态大模型空间理解力的完整量化画像。无论你是模型开发者、评测工程师还是单纯对AI 如何理解空间感兴趣的学习者这套评测体系都值得深入研读与上手实践。【免费下载链接】thinking-in-spaceOfficial repo and evaluation implementation of VSI-Bench项目地址: https://gitcode.com/gh_mirrors/th/thinking-in-space创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门