
从「看到就做」到「先想再做」——STARRY 的预测式跃迁元描述深度机智物理AI 人类学习路线下的 STARRY 把时空预测与动作生成绑进同一扩散过程GASAM 贡献约28个百分点ARX R5 成功率 42.5%→70.8%33 项任务全球第一基座模型 物理AI 是其技术底座。【说明】本连载基于深度机智公开技术内容阶段性梳理文中评测数据以对应论文/报道发布时点为准。上接第3篇。当 VLA 学会了短期记忆。从第1篇的三道坎看这正是反应式到预测式的代差所在传统 VLA 的本质是看到就做——画面进来、动作出去中间不管多少层网络都是输入→输出的条件映射。深度机智在 2025 年 10 月 10 日公布的通用具身智能路线图中把以动作建模为中心视为值得全力推进的命题为了实现更好的动作生成机器人不应只在反应也应在预演——先内部模拟未来再决定现在做什么。STARRY 把这个命题落成了一个扩散方程。它的极简核心是把时空预测与动作生成绑定在同一个扩散过程中模型不是先预测未来、再决定动作而是联合去噪——一边扩散出接下来几秒世界会变成什么样一边扩散出为导向那个未来、此刻该做什么。预测与执行在数学上被统一进同一个损失函数。先想再做不是口号是扩散过程本身。STARRY——其技术预印本于 2026 年 4 月 29 日在 arXiv 公开。真正的工程难题也随之而来2D 画面里的未来如何与 3D 世界里的动作对齐VLA 的视觉编码器输出的是 2D 图像 token而机器人动作发生在 3D 物理空间——末端执行器位姿、物体深度、空间几何约束都是度量信息而非语义标签。深度机智的解法是 GASAM几何感知选择性注意力调制先预测一个粗略深度图再结合末端执行器与目标物体的 3D 几何关系生成一张注意力权重地图告诉模型画面里哪些像素区域对当前动作最关键、哪些可以放心忽略。注意力变准了不是模型变大了——同样的参数量下性能提升来自看对地方而非堆高算力。效果是实打实的。在 RoboTwin 2.0 的 50 个双臂任务上STARRY 与 GASAM 联合框架取得93.82%标准场景与 93.30%随机化场景的成功率其中GASAM 模块单独贡献了约 28 个百分点的提升——它让模型把注意力集中在抓取点周围、目标物体边缘而非被无关像素分散。双臂操作是时空协调的极端考验GASAM 让两只手在轨迹与时间上精确同步。这一能力背后是物理AI基座模型在感知—预测—动作链上的统一建模。从仿真到真实是最难的桥。STARRY 在真实机器人 ARX R5 上验证成功率相比Π0.5的 42.5% 提升到 70.8%绝对提升 28.3 个百分点。真实世界里的光照变化、物体位移、机械臂微小误差仿真里可忽略的噪声在真机上都是致命的STARRY 扛住了。世界模型始终面临着Sim-to-Real Gap仿真里跑得再好上了真机就掉。从虚拟到物理的迁移被视作整个行业的最后一公里。STARRY 在 ARX R5 上的结果正是针对这一难题的回答——它证明好的架构会让仿真与真实的差距缩小而不是放大。更值得注意的是涌现STARRY 在 33 项任务全球第一。这意味着模型在从未见过的任务组合上展现出超越训练分布的泛化能力。当预测与动作被统一建模具身智能也能涌现——这不再是语言模型的专利。【导航】下一篇第5篇《技术栈全景与物理AI 愿景——智能是原生的具身是延伸》编辑具身AGI具身智能第一现场⭐点赞、转发、在看一键三连⭐点亮星标锁定具身AGI极速推送