拓冰建站拓冰建站
首页 / 资讯中心 / 正文

定义篇:在评价大模型的空间能力之前,先说清什么是空间能力

系列第 7 篇。整个系列都在问现在的模型空间能力到底如何——但如果说不清空间能力是什么这个问题就没法严肃回答。本篇不给自创答案只做一件事把心理学、AI 学界、产业界三方的定义摆出来找公约数也指出分歧。一、心理学的答案一个有五十年积累的概念空间能力不是 AI 圈的发明。加德纳Howard Gardner1983 年的多元智能理论就把空间智能列为人类八种智能之一在脑中形成外部世界的模型并运用它的能力。认知科学随后把它拆得更细。目前引用最广的是 Newcombe Shipley (2014) 的 2×2 分类静态动态物体内intrinsic物体自身的形状、部件关系识别形状、部件结构心理旋转、折叠想象物体间extrinsic物体之间、物体与参照系的关系位置关系、地图理解视角采择、导航这个分类有演化依据人类的两大空间功能——使用工具物体内关系和导航物体间关系——有各自独立的演化与神经基础Frontiers 综述。记住这张 2×2 表后面会发现 AI 的考卷惊人地落在同样的格子里。二、AI 学界的答案从操作性定义到宏大叙事操作性定义来自李飞飞、谢赛宁团队的 VSI-Bench“Thinking in Space”CVPR 2025一句话视觉空间智能是感知一个空间、记住其布局、并按需检索这些空间信息来回答问题的能力。它落成 3 类 8 项任务构型类数物体、认相对位置、测量类估距离、尺寸、房间面积、时空类回忆物体出现顺序。宏观定义来自李飞飞 2025 年 11 月的长文 From Words to Worlds“空间智能是我们认知赖以构建的脚手架”它是语言之外的前沿——连接想象、感知与行动的能力。文中给出实现空间智能的载体——世界模型——的三项核心能力生成造出符合几何与物理的世界、多模态吃下图像/视频/深度/动作、交互预测行动之后世界怎么变。注意这个定义把行动正式纳入了空间智能的范畴比 VSI-Bench 的看-记-答宽了一大圈。CVPR 2026 不分论文中的空间智能基准实际上是在这两层定义之间做细化。把它们的能力拆解对齐到 Newcombe 的 2×2 表上对齐是本文的综合各家拆法出自论文原文基准能力拆解落在 2×2 的哪里SpatialScore (2505.17012)10 大类 30 任务计数、深度、距离、相机位姿、心理动画等四格都有重心在物体间-静态SenseNova-SI (2511.13719) 的 EASI 分类度量测量、空间关系、心理重建、视角采择、综合推理心理重建/视角采择即物体内-动态、物体间-动态OpenBench (2512.19683)三层级关系推理→度量推理→运动学推理从静态到动态的难度阶梯SpatialSky (2511.13269)无人机 13 子能力高度感知、可降落判断等物体间两格的领域特化收敛点很清晰AI 的考卷没有发明新的空间能力概念它在逐格填认知科学的表——而且填到动态两格运动、视角变换时模型成绩最差。三、产业界与常识的答案一个应用台阶李飞飞长文同时给出了产业视角的能力台阶也是她创办的 World Labs 的路线图现阶段——创意工具生成空间一致的 3D 世界其 Marble 平台已面向创作者中期——机器人感知-行动循环对应自动驾驶、具身智能的现实需求长期——科学、医疗、教育以空间精确性做仿真与推理。常识层面的空间能力——认路、停车入位、看图组装家具、打包行李箱——恰好分布在这个台阶的底部而它们对应的机器能力导航、度量、操作规划正是目前考卷上分数最低的部分。四、综合一个有出处的工作定义三方对比之后共同点与分歧如下。共同点三方都包含感知空间结构物体的形状与位置关系在心中表征与变换它记忆布局、心理旋转、换视角想象依据它输出判断定性关系与定量度量。分歧点决定你怎么评价现状要不要包含行动VSI-Bench 式的操作定义不含李飞飞的宏观定义和整个机器人产业含。要不要包含生成世界模型定义把造出一个物理一致的世界算作空间智能的一部分评测类论文几乎都不考这个。所以本系列的贯穿问题严格说要拆成三问答案各不相同感知与表征层2×2 的静态格模型勉强及格但掺着语言先验的水分评测篇的盲测证据变换与度量层2×2 的动态格 测量普遍不行——原文的措辞是最先进的多模态模型在估计距离、朝向、尺寸上很少比瞎猜好“rarely perform better than chance”行动与生成层模型几乎空白靠外挂系统在补Agent 篇世界模型路线刚起步。一句话版本按最窄的定义模型能答对多数定性判断题但结果不稳定、定量估计大多失败按李飞飞的完整定义包含行动与生成它还在起点附近。这也是为什么空间智能是 AI 下一个前沿这个判断2025 年由李飞飞提出TIME 也刊发了此文2026 年就变成了 CVPR 上几百篇论文的集体行动。五、延伸思考个人观点非文献结论把上文各家的能力拆解并排看会发现它们都绕着同一组要素转而这组要素恰好接近知识工程里本体ontology这个专有概念的构成对象物体、属性长宽高、形状、颜色、关系上下左右这类空间关系、动作移动、旋转、交互。空间智能的考题几乎都是在这四个要素上出的认对象是感知估属性是度量判关系是空间推理预测动作后果是交互。照这个视角让模型获得空间智能与让模型内化一个关于物理世界的本体可能是同一件事的两种说法——评测在检查本体的每个要素是否齐全注入在把要素写进模型世界模型在让整个本体能随动作演化。至于认知科学四格表里的动态格心理旋转、导航是否能严格对应到动作关系的组合上这一步推得比较远可能是过度联想仅记录为待检验的想法。引用来源Fei-Fei Li, From Words to Worlds: Spatial Intelligence is AI’s Next Frontier, 2025-11TIME 版本中文译介量子位Yang et al., Thinking in Space: How MLLMs See, Remember, and Recall Spaces (VSI-Bench), CVPR 2025代码开源Newcombe Shipley, Thinking About Spatial Thinking: New Typology, New Assessments, 20142×2 分类实证检验Gardner, Frames of Mind: The Theory of Multiple Intelligences, 1983本语料内SpatialScore (2505.17012)、SenseNova-SI (2511.13719)、OpenBench (2512.19683)、SpatialSky-Bench (2511.13269)
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门