拓冰建站拓冰建站
首页 / 资讯中心 / 正文

从看到想再到做:世界模型、WAM 与 VLA 技术解析

1. 为什么机器人「会看不会做」从感知到行动的鸿沟说起前阵子有朋友问我现在的机器人视觉模型不是已经挺强了吗物体检测、分割、姿态估计都很成熟为什么做出来的机械臂抓个杯子还是笨手笨脚这个问题其实切中了当下机器人学习领域最核心的矛盾——感知强行动弱。你看传统机器人系统里的视觉模型解决的是「看」的问题它告诉你桌子上有一个红色马克杯在三维空间里大概什么位置朝向如何。但下一条信息是断裂的这个杯子是易碎的陶瓷还是摔不坏的塑料我该用多大的力去握是先抬高再平移还是直接弧形轨迹过去如果杯子后面有障碍物我该绕哪边这些问题没有一个能被目标检测模型的输出直接回答。所以行业内这些年陆续长出了三条技术路线试图把这条断裂的链补上WMWorld Model世界模型、WAMWorld and Action Model世界与动作联合模型以及VLAVision-Language-Action Model视觉-语言-动作模型。粗看它们都是「大模型 机器人」但各自解决的问题层级完全不一样。用一个不太严谨但很容易理解的说法来概括WM负责「看」懂世界的运行规律WAM负责「想」清楚行动带来的后果VLA负责把指令「做」出来。这篇文章就围绕这三种模型做一个深入拆解包括它们各自的机制、适合用在哪、实际评测时容易踩什么坑以及最终落地时该怎么选型。我会尽量少堆术语把关键逻辑讲透——毕竟理解一件事「为什么这么设计」比记住它的结构图重要得多。2. WMWorld Model让机器人先学会「预判会发生什么」2.1 世界模型到底在建模什么世界模型这个词最早火起来跟基于模型的强化学习Model-Based RL有直接关系。它的基本定义是让模型学习环境的状态转移规律——给定当前状态和动作预测下一个状态是什么。打个比方。你开车经过十字路口余光扫到右侧一辆车正在减速。你不会等它真冲过来才踩刹车而是在零点几秒内「脑补」出它继续减速、还是突然加速的场景然后据此决定脚是放在油门上还是移到刹车上。这个脑补能力就是人脑里的世界模型在起作用。在机器人领域世界模型的输入通常是历史观测序列 动作序列输出是未来的观测或观测的表征。所谓历史观测可以是多视角视频帧、关节角度、末端执行器位姿等输出可以是直接预测下一帧像素视频预测也可以是预测一个低维隐向量embedding。早期比较有代表性的工作是DeepMind的Dreamer系列它把高维图像输入压缩到隐空间里在隐空间里做想象 rollout大幅提升了样本效率也让「用想象来训练策略」成为可能。2.2 为什么「预判」本身就是一种能力这里要厘清一个常见误解世界模型不是用来直接控制机器人的它更像是给机器人装了一个低成本试错模拟器——只不过这个模拟器不在实体环境里跑而是在模型的参数里跑。以此为前提世界模型有三大实际应用方向第一训练策略时生成想象样本。把真实交互消耗的几千小时压缩成模型里的虚拟交互策略模型可以在想象数据上做强化学习大幅减少真实机器人运行时间。第二作为规划器。先用人脑或启发式方法提出若干个候选动作序列用世界模型展开每个候选序列看哪条路径导致的结果最接近目标状态把它挑出来执行。第三作为异常检测器。如果真实观测和世界模型预测的未来差别很大说明环境里出现了模型没见过的情况此时应该停下并寻求人工介入。说它是「看」的能力是因为它本质上回答了一个问题这个世界接下来会怎样演化它不关心你要不要喝这杯水但它知道水杯被碰倒后水会洒出来。2.3 训练与部署的常见坑世界模型听上去很美好真正用起来有几个坑是普遍存在的。第一是预测误差随步长爆炸。一步预测误差可能很小但迭代预测十步、百步之后预测的未来会迅速失真。在实践中要么把预测步数压短要么引入不确定性建模要么干脆只做隐空间预测而不做像素级别重建因为像素级重建消耗大量容量在纹理细节上对决策帮助有限。第二是真机数据的熵太高。真实世界里有太多不可预测变量线缆的柔顺形变、光照变化、物体的轻微滑动。世界模型在仿真环境里往往能学到很好的物理规律一旦换到真机数据分布一变预测就飘。一个工程上的做法是混合训练——仿真数据铺量真机数据精修并时刻监控真机场景下的预测误差。第三是评估困难。你训出来一个世界模型怎么算好预测帧的PSNR、SSIM这些指标跟操控任务成功率之间没有稳定的单调关系。我的体会是不要只看重建指标要直接把它接进规划或策略训练流程里以最终任务成功率作为金标准。凡是脱离下游任务去调世界模型的最后都容易调出一个「画得漂亮但没用」的模型。3. WAM把「世界会怎样变」和「我该怎么做」绑在一起想3.1 为什么不能只有世界模型纯世界模型有一个很别扭的地方它预测世界会怎么变但不告诉你该采取什么动作。实际使用时你得在它外面另外套一层规划器或策略模型两个模型之间还得商量好接口处理起来相当繁琐。而且世界模型往往只学会了环境规律并没有把「好的行为」和「坏的行为」编进表征里——它能预测水杯会倒但不知道「不能让水杯倒」这件事优先级更高。于是就有了WAMWorld and Action Model这类思路把世界模型和动作生成放到同一个模型里去学。它的核心变化在于模型不再是单纯预测未来的被动推演器而是条件化在动作上的双向推理器——给一段历史观测和动作它预测后续观测给一段历史观测它也能直接生成接下来该执行的动作。这个设计思路在英伟达推出的WAM相关工作里体现得比较典型面向辅助驾驶场景的开源推理模型也有类似的影子。它跟纯世界模型的本质区别在于模型的输出分布里同时包含「世界」和「动作」两个头并且在训练时让这两个头共享一套时空表征。3.2 共享表征到底共享了什么你可以这么理解WAM的技术内核。传统做法是一条流水线感知模块把图像提成特征预测模块在特征上做前向推演决策模块再基于推演结果输出动作。每个模块是独立的特征格式也是各自的。而WAM想让三个模块尽量融合于是干脆用一个大Transformer把观测token和动作token混在一起建模。具体到实现上一般会对历史观测做视觉编码或者直接用embedding把动作拼成token序列一起喂进Transformer。训练目标分两类一类是重建/预测下一帧观测教模型理解物理规律另一类是模仿人类演示或强化学习数据中的动作教模型输出合理的动作分布。两个目标在同一个模型里联合优化共享注意力层。学出来的效果是模型在隐空间里既知道「现状」又能在脑海中翻看「如果这么做会怎样」还能直接吐出一个动作建议。3.3 WAM 的优势与目前瓶颈优势非常直接少了一道接口的组装成本训练和部署都更干净。你不再需要给世界模型单独设计奖励函数或规划成本函数让它直接对着数据学就行。推理的时候也不需要先跑一遍世界模型、再跑一遍策略模型一次前向推理既能得到未来预测也能得到动作建议。但瓶颈也很明显。首先联合建模让模型容量被两套目标瓜分一不小心就会出现「世界也预测不好、动作也做不好」的尴尬局面。其次动作空间的定义本身是个大坑——连续关节角度、笛卡尔空间位姿还是宏观操作原语会直接决定模型学出来的行为风格。再次真实世界数据里动作和观测的分布往往纠缠在一起训练时容易让模型学会抄近路直接忽略视觉输入只根据动作历史预测动作在数据规模不够时这种现象尤其明显。我的经验是想训好WAM动作空间的设计优先级应排在模型结构之上。如果动作维度太高、序列太长对数据量需求的增长是指数级的。预训练阶段不如先用离散化的宏观动作比如「向前推进5厘米」「闭合夹爪」把模型对物理规律的表征能力逼出来之后再在具体任务上精调连续动作层。4. VLA语言做指挥、视觉当眼睛、动作当手脚4.1 把语言搬进来的动机VLA是过去两年机器人领域热度最高的方向代表作包括RT-1、RT-2、OpenVLA以及最近讨论很多的π0以及各种基于VLM改造的变体。它做的事可以一句话概括接受自然语言指令 视觉观测直接输出动作。为什么非得引入语言因为语言是机器人通往「开放世界语义理解」最廉价的桥梁。一个传统操控模型往往只能在固定任务集合里打转「抓红色杯子」训练过就能做「抓你右边那个不锈钢碗」没训练过就抓瞎。而语言指令配合视觉编码可以让模型利用互联网图片和文本预训练时学到的语义知识把「没见过的组合任务」也cover住。打个比方VLA像是一个同时懂外语、看得懂图纸、又经过工厂实习的老师傅。你说「帮我把桌上那个金属保温杯放到充电底座上」它不是靠死记这个任务的动作轨迹而是靠理解「金属保温杯」「充电底座」这两个概念以及在实习期学到的「拿起、对齐、放下」这些基础操作技能现场编排出一条合理轨迹。4.2 训练流程不是「一步到位」而是「两步走」VLA的主流训练范式是先做视觉-语言预训练再做机器人动作微调。第一步用海量的互联网图文数据或现成的视觉-语言模型VLM权重让模型学会把图像内容和语义描述对齐。这一步几乎不涉及动作目的是把「看」和「懂」的能力磨锋利。第二步把机器人演示数据转成序列——图像token、语言token、动作token按顺序拼接——让模型在冻结大部分参数的情况下学习从语言和视觉到动作的映射。为什么要两步走而不是直接拿机器人数据训一个大模型因为机器人操作数据的规模跟互联网图文压根不在一个量级。公开数据集中最大的机器人操作数据集也就百万条到千万条量级但互联网图文是几十亿量级。如果从头训模型连「杯子长什么样」都学不明白更别说操控了。借用预训练视觉-语言模型相当于直接让机器人站在了人类对世界的常识理解之上只需要补上「动作」这门专业课。4.3 实操中的三类痛感VLA看着热闹实际部署时的痛点也很真实我按踩坑频率排个序。第一是推理速度。VLA的骨干模型通常是大规模视觉-语言Transformer一次前向推理动辄几百毫秒但很多真机操控任务需要控制频率达到10Hz甚至30Hz。一个直观的解决办法是把VLA用来做上层任务规划每秒调用一次甚至更低频底层用传统的轨迹规划器或轻量策略模型来执行高频控制。这叫「高频执行、低频认知」是目前相对靠谱的工程架构。第二是动作表示的粒度。动作是输出笛卡尔空间的末端位姿增量还是输出各个关节角度是连续数值还是离散成token不同表示学出来的行为平滑度差别很大。实测下来在局部操作任务上笛卡尔空间的位置增量表示通常更稳因为它天然和视觉感知的坐标系对齐关节空间表示则更适合需要精细力控的场景。没有银弹得按任务来挑。第三是数据分布倾斜。机器人演示数据往往来自少数几个场景、少数几个操作者学出来的策略对场景变化非常敏感——换个光照、换个背景、甚至换个桌布花纹成功率可能断崖下跌。缓解办法没有捷径就是尽量增加场景多样性反而不必在单个场景里堆太多演示多样性的收益远大于重复性的收益。5. 三者对比什么时候用哪个能不能混着用5.1 一图流核心差异先把三种模型放在一张表里做硬碰硬对比方便你建立整体印象对比维度WM世界模型WAM世界与动作模型VLA视觉-语言-动作模型核心问题接下来会发生什么这个动作会导致什么我该怎么做听懂指令做出动作主要输入历史观测 动作历史观测 动作可选语言条件视觉 语言指令主要输出未来观测/隐状态未来观测 动作建议动作序列训练数据大量无标签交互数据交互数据 演示数据互联网图文 演示数据对语言的支持弱中等强实时控制能力无直接控制中可输出动作但通常不用于高频控制低到中取决于模型大小和推理优化强项物理规律建模、想象推演行动后果建模、感知运动联合表征语义理解、任务泛化、指令跟随短板无法直接产出动作动作空间设计难、数据要求高推理慢、对场景变化敏感典型落地角色仿真训练的数据引擎、规划器内部的推演器中高层决策的联合推演与动作建议任务规划的语义大脑 底层策略的监督信号表格看下来你会发现三者其实不是替代关系而是分工不同。WM更像一个「物理常识库」WAM更像一个「推演决策器」VLA更像一个「语义到动作的翻译官」。5.2 实际项目里怎么选我个人的选型建议是这样的。如果你做的任务是固定场景、固定动作类别比如分拣流水线上的标准件那WM的价值最大——你可以用它在仿真里生成海量交互数据把底层策略训扎实上线时WM已经不在推理链路里了它是个训练阶段的红利。如果你的任务在中等复杂度、需要先后验推演比如机械臂需要绕过障碍把杯子放到目标点那么WAM的「动作条件化世界预测」会非常有用。它能在真机执行前先把动作序列在隐空间里过一遍筛掉那些会导致碰撞或失衡的候选动作相当于一个智能的安全过滤器。如果任务是开放语义、多指令组合比如家庭服务场景用户会说出意想不到的组合描述那就绕不开VLA。它负责把语言和视觉翻译成高层任务意图再由底层的运动规划模块去落实。5.3 混着用的架构思路上面说的是单个模型直接用但行业里越来越趋向于把它们组合成一套完整的机器人学习系统。我目前比较看好的组合方式是VLA做人机接口和任务规划WAM或WM做行动推演和安全校验底层轻量策略做高频执行。顺序就是标题里说的——从「看」到「想」再到「做」。实际操作中数据流是这样VLA接收到自然语言指令并输出高层意图比如「把桌上的马克杯放到托盘」WAM接上当前视觉观测和候选动作序列在隐空间里推演一遍若预测的未来状态里有碰撞风险或未到达目标就拒绝执行并让VLA重新规划通过校验的意图再交给底层策略以较高频率控制机械臂完成精细动作。这套架构的好处是每一层只做自己最擅长的事出错时可以逐层定位。「做」错了查底层执行器「想」错了查WAM的推演逻辑「看」错了查VLA的语义理解。坏处也很直接——工程量大链路过长延迟叠加。真机上想要跑顺必须每一层都做延迟优化和降级方案。6. 我在实际评测与部署中的几个重要结论6.1 数据质量永远排在模型结构前面只要是做这三种模型的评测有一个结论反复被验证数据分布的决定性作用远大于模型结构的差异。同一个VLA骨干网络在数据多样性高的数据集上训练的版本跨场景泛化能力能比在单一场景堆数据训练的版本高出好几倍哪怕参数量还更小。这一点在视觉变化换背景、换光照上尤其明显。所以我的建议是项目启动的第一周不要急着搭模型先盘点数据数据里有几种场景有几种物体类别演示者风格是不是过于单一动作范围覆盖得够不够广如果这些不达标再好的模型结构也白搭。6.2 评测环境比模型本身更容易骗人部署过机器人的同学应该都有同感仿真里成功率90%真机一跑掉到30%。这里的问题往往出在评测协议上——仿真里固定初始位置、固定路径、固定障碍布置策略早就通过训练记住了这些固定模式的解法而不是学到了真正的规律。有一次我在评测一个基于VLA的抓取方案时训练和测试用了同一批物体但不同摆放角度表面看起来泛化设置没问题结果发现测试时不换纹理、不换光照、不换相机视角。模型其实是在靠视觉捷径记忆场景而不是理解「抓取」这个任务。后来把场景随机化拉满之后成功率一下子跌到脚踝但这时暴露出来的问题才是真问题。更靠谱的评测方式是设定多个不同复杂度的场景变体由易到难分别打分而不是只报一个平均成功率。这样才能分辨出模型到底是在「理解」还是在「记忆」。6.3 算力规划要按「推理频率」来做而不是按模型大小很多同学一开始容易陷入「模型越大越好」的误区真跑到部署阶段才发现模型再强推理频率跟不上就是废品。机械臂的一个日常操作流程可能包含几十个关键步态每一步都需要视觉反馈做闭环如果VLA推理需要1.5秒整个动作就会像慢动作回放。我自己的教训是做算力规划时先把「动作闭环需要的控制频率」确定下来然后反推模型的延迟预算再去选模型尺寸和量化方式。如果你的控制频率需求是10Hz那么留给单次模型推理的预算最多100毫秒这时候与其强行上一堆7B参数的大模型不如拆成好多小型专用模型或者用一个大模型做低频规划、用轻量策略保证高频反馈。6.4 未来方向VLA与WM/WAM的融合可能会加速从近期发布的一些工作可以看出来VLA正在内部化原本属于世界模型的能力。比如在VLA的序列建模目标里加入未来观测预测任务让模型在训练时逼着自己理解物理规律而不只是做视觉-语言的表面匹配。反过来世界模型也越来越多地以辅助头的形式出现在VLA架构里用来过滤语义上做了但物理上离谱的预测。我觉得这个趋势还会继续。当VLA内部学会了对未来做想象推演它就不再只是一个语言翻译器而是一个真正在交互中理解世界的智能体。而WAM这种同时建模世界与动作的路线可能会成为VLA和WM融合的桥梁结构——它的表征既服务于预测也服务于决策天然适合做中间层。6.5 给不同团队的最后建议如果你在高校或研究机构有充足的数据和算力可以大胆探索WAM这类融合架构因为它离学术前沿近、能发的东西多而且你对失败有一定容忍度。多花时间在动作表示的设计上这个方向的上限很值得期待。如果你在企业做产品落地我更建议先用成熟的VLA负责语义理解用传统或轻量的轨迹规划做底层执行同时把世界模型用在离线数据生成上——这个组合最成熟、出错最容易定位、上线周期也最短。等团队在真实场景里攒够了交互数据再逐步向WAM或VLA世界模型融合的方向演进。回头再看标题里那句「从看到想再到做」其实不只是技术路线的递进也是机器人学习系统从碎片化走向整体化的一种必然。把「看」「想」「做」三层能力真正打通这条路还有不少坑要踩但对这个领域的从业者来说也正是最有意思的地方。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门