
26年7月来自阿里高德视觉实验室AMAP CV Lab的论文“ABot-M0.5: Unified Mobility-and-Manipulation World Action Model”。移动操作mobile manipulation是通用机器人的一项关键能力但对于当前的具身学习方法而言它仍极具挑战性。VLA策略通常是反应式的缺乏显式的世界建模而现有的世界动作模型WAMs与移动操作的结构特征匹配度不高它们基于粗粒度的视频片段进行操作将导航与操作动作混合建模且其逆动力学训练方式与自回归推理过程不匹配。因此这些模型往往无法捕捉细粒度的接触动力学面临动作分布冲突问题并在长时程推演中累积误差。ABot-M0.5是一种基于以下洞察构建的 WAM移动操作需要在时间粒度、动作空间和训练-推理一致性这三个层面上实现对齐为了对齐时间粒度引入中间潜动作intermediate latent actions用于捕捉局部视觉状态转换并作为连接视频潜表征与具身特定控制指令的桥梁为了对齐动作空间设计一种双层混合TransformersMoT架构实现模态表征与异构动作子空间如底盘移动与机械臂操作的解耦为了对齐推理条件提出“梦境驱动”dream-forcing训练策略即在模型预测的视频序列上逐步训练逆动力学从而提升训练与推理的一致性以及自回归预测过程中的鲁棒性。如图1 所示在具有挑战性的移动操作与细粒度操作基准测试中ABot-M0.5 均展现出最先进SOTA的性能无论是在长时程任务成功率还是细粒度控制精度方面。1 问题设定本文研究的是受语言指令驱动的移动操作任务其中机器人需要在视觉复杂的环境中通过协同执行导航与物体交互动作来完成长时程long-horizon任务 [32, 60, 74]。在每个时间步 t智体接收语言指令 l、多视角视觉观测 o_t以及可选的过往观测与动作历史。其目标是生成底层的可执行动作从而在较长的时间跨度内完成任务同时保持与未来环境演变的一致性。给定观测历史 o_{t}、动作历史 a_{t} 和语言指令 l策略的目标是预测时间跨度 H 内的未来行为。在反应式策略中这通常被表述为针对长度为 H 动作序列片段的直接条件映射。当所需动作主要取决于当前观测且时间跨度较短时这种表述方式是有效的。然而在移动操作mobile manipulation场景中这种方法变得愈发脆弱因为在此类场景下未来的决策不仅取决于当前状态还取决于环境在机器人自身未来动作影响下预期的演变情况。世界动作模型World Action Models简称 WAMs通过联合建模未来观测和未来动作来解决这一局限性 [3, 33, 71, 73, 76]。令 z_{t1:tH} 表示时间跨度 t1 至 tH 内未来观测的压缩视频潜表示latent。WAM 不直接根据当前观测预测动作而是对结构化的未来轨迹进行建模。这种表述引入了显式的未来世界建模并为长时程推演rollout提供一种自然的接口因为未来状态预测和动作预测被整合在同一个自回归过程中。然而将现有的世界-动作模型WAM直接应用于移动操作mobile manipulation尚显不足。移动操作与固定式操作至少在三个方面存在差异。首先由于机器人的移动未来的世界演变涉及更大的视角变化和更多样化的场景转换。其次动作空间变得异构因为移动和操作指令必须由同一策略生成。第三推演的鲁棒性变得至关重要因为在长时程移动任务中微小的预测误差会随时间推移而累积放大。这些差异表明不应仅仅将移动操作视为固定式操作的放大版。相反应将其视为一个“世界-动作学习”问题该问题对表征、控制和推演的结构有着更严格的要求。具体而言移动操作的核心挑战在于连接两个本质上截然不同的空间一是捕捉全局世界演变的粗粒度、长时程未来视频隐变量 z_{t1:tH}二是细粒度、异构的可执行机器人动作 a_{t:tH-1}。由于两者之间存在巨大的粒度和语义鸿沟将视频隐变量直接映射为可执行的机器人动作极具挑战性。理想情况下一个成功的移动操作策略应当学习一种连贯的分层过程首先预测视觉世界的演变z_{t1}然后将这种宏观演变提炼为捕捉局部视觉状态转换的帧级中间运动意图最后将这些意图落实为针对具体机器人形态的底层控制指令a_t。然而如何有效地定义、学习并对齐这一中间空间仍是一个悬而未决的问题。下面通过引入“潜动作”latent actions来具体实现这一桥梁空间并结合专门设计的架构与训练策略以实现完全对齐。2 移动操作任务中的核心瓶颈基于上述表述现有方法的主要局限性不仅仅在于模型规模不足更在于当前世界模型WAMs的训练方式与移动操作任务的需求之间存在结构性不匹配 [3, 73, 76]。本文归纳出三个核心瓶颈时间粒度不匹配。现有的世界模型通常以时间上“压缩的分块chunk”为单位来建模未来观测。这种设计虽然计算效率高且适用于长时程视频预测却导致了世界建模的时间粒度与控制生成的时间粒度不匹配。在实际应用中未来的视频潜表征latent representations可能概括片段内的多个帧而机器人动作往往需要在每一帧或每一个控制步长上生成。这种不匹配在移动操作任务中尤为棘手因为该类任务的成功往往取决于细粒度的交互。诸如抓取闭合、接触发生、物体释放、精细对齐以及局部避障等行为通常发生在极短的时间窗口内。若仅在粗略的片段层级进行世界建模这些局部状态转换可能会被平滑处理或遗漏导致策略难以恢复执行所需的精确运动意图。动作结构不匹配。移动操作引入一种异构动作空间这与固定式操作的动作空间截然不同。机器人既要控制全局移动又要控制局部操作而这两种行为遵循完全不同的动力学规律。底盘移动往往具有低频、平滑和全局导向的特点相比之下机械臂操作则具有高频、局部化以及对接触密集型动力学敏感的特性。若将二者视为一个耦合的动作空间模型便被迫在单一共享表征内针对相互冲突的模式进行优化。这种不匹配带来了两个后果。首先它增加了优化难度。源自移动主导轨迹和操作主导轨迹的梯度可能会相互干扰阻碍模型有效地针对任一模式进行特化。其次它削弱了组合性。在许多移动操作任务中底盘控制与机械臂控制既需要在结构上保持独立又必须相互协调配合。推演条件不匹配。第三个瓶颈源于逆动力学inverse dynamicsID的训练方式与推理阶段实际生成动作的方式之间的差异。在训练过程中逆动力学通常以真实的未来观测或其潜表征为条件然而在推理阶段此类真实的未来信息是不可获取的。相反该模型必须基于其自身预测的视觉演变过程visual rollouts来采取行动这些预测不可避免地包含噪声、不确定性有时甚至会出现严重的错误如图像模糊、物体漂移或产生“幻觉”内容。这种训练与测试阶段的不匹配在“世界-动作”学习中引发一种“暴露偏差”exposure bias这与序列预测及模仿学习领域所研究的“分布偏移”distribution shift问题相关 [2, 56]。逆向动力学模型是在理想的未来条件下进行优化的但在实际部署时面对的却是模型自身生成的、存在缺陷的未来状态。在长时程移动操作任务中这种偏差会随时间推移而累积最终可能导致执行失败。总结。这三大瓶颈揭示一个共同特征现有方法与移动操作任务的结构特性之间缺乏足够的适配性。粗略的视觉预测与精细控制不匹配耦合的动作学习与异构的机器人行为不匹配而基于真值ground-truth条件的训练则与自回归部署模式不匹配。ABot-M0.5 的设计正是基于这一观察结果。其完整的模型包括用于时间对齐的潜动作latent actions、用于结构化动作建模的双层混合Transformer架构以及用于实现演变过程对齐的逆向动力学学习方法——Dream-Forcing。1 整体架构与符号表示ABot-M0.5 是一种基于 Wan2.2 视频扩散主干网络 [66] 构建的视频-动作WAM。给定语言指令 l 和多视角观测序列该模型在一个统一的生成框架内联合建模未来的视频潜表示latents、帧级潜动作以及可执行的机器人动作。在感知阶段3D VAE 将连续的视频观测 o_t {I(1)_t, . . . , I(N_c)_t} 压缩为紧凑的时空视频潜表示 z_t同时文本编码器如 UMT5将 l 映射为条件特征。关键在于其引入帧级潜动作 m_t 来捕捉局部视觉状态转换作为粗粒度视频潜表示与细粒度控制之间的桥梁表征。生成过程遵循针对无噪clean变量的结构化级联方式z_t1 → m_t → a_t其中 z_t1、m_t 和 a_t 分别表示干净的未来视频潜变量、干净的潜动作和干净的可执行动作。这种分解将直接的视频-到-动作预测分解为三个不同的阶段世界建模、运动抽象和控制生成。为了优化这种分层级联采用条件流匹配 (CFM) 作为所有阶段的统一生成目标。以第一阶段世界建模为例给定真实干净的视频潜变量 z_t1 和标准高斯噪声 ε ∼ N (0, I)在时间步 τ ∼ U(0,1) 构建一个条件概率路径。关键在于用于条件化 z_t1 的上下文严格仅包含历史状态z_≤t, m_t, a_t及语言指令 l。后续阶段预测 m_t 和 a_t遵循类似的 CFM 目标但其感受野会逐步扩大并以级联序列中先前生成的变量作为条件例如基于预测出的 z_t1 来条件化 m_t。这种设计在数学上确保训练时的信息流与推理阶段的自回归生成顺序完全一致。在架构层面该模型处理三条并行的 Token 流Xz_{t1}、Xm_t 和 Xat 分别对应视频潜表征tokens、潜动作tokens和动作tokens。为了体现上述条件目标所规定的因果依赖关系强制实施一种非对称的信息流视频潜tokensXz{t1}被屏蔽无法关注潜动作tokensXm_t这是因为在视频预测过程中未来的动作本质上是未知的。相反动作tokensXa_t显式地关注 Xm_t从而确保最终控制建立在细粒度动作意图的基础之上。为了实现这种对齐该架构整合三个关键机制(1) 弥合时间粒度差异的“中间潜动作建模”模块(2) “双层混合 Transformer”D-MoT它在结构上解耦异构动作子空间例如基础移动与手臂操作同时保持针对模态的特定优化以及 (3) “梦境驱动机制”Dream Forcing Mechanism该机制使动作流能够接触到自生成的视觉预测从而从根本上解决训练与测试阶段的分布偏移问题。图 2 展示 ABot-M0.5 的整体架构表 1 总结核心符号2 中间潜动作建模将粗粒度视频潜表征直接映射到底层动作会导致严重的时间和结构不匹配。为解决这一问题ABot-M0.5 引入帧级潜动作 (m_t) 作为一种与具体具身形态无关的中间表征。该设计将生成过程分解为结构化的三阶段级联流程。具体而言模型首先预测未来的视频潜表征 z_t1以捕捉宏观的环境演变阶段 1随后将这些粗粒度动态细化为帧级潜动作 m_t以表征细粒度的运动意图阶段 2最后将这些意图转化为特定具身形态下的可执行动作 a_t阶段 3。通过显式建模这种层级结构系统实现与具身形态无关的物理先验和特定硬件运动学特性的解耦从而支持在异构机器人平台间实现稳健的泛化。潜动作提取与对齐。潜动作的一个关键优势在于它们仅依赖于视觉状态的转换因此无需机器人运动学标签即可从大规模、不含动作标注的视频数据集中进行提取 [34, 62, 72]。给定连续帧 (I_t, I_t1)用一个冻结的预训练潜动作编码器 E_m 来提取局部运动表征。在多相机设置中从每个视角提取潜动作并将其组织成统一的时空张量。对于包含 H 个控制步长和 N_c 个相机视角的片段聚合后的潜动作张量结构表示为 M {m_view}。基于这种表述无论底层的机器人形态如何相似的物理交互例如抓取物体都会被映射到共享潜动作空间 M 中的相近区域。这种对齐对于在不同具身形态embodiments之间迁移物理先验至关重要。面向潜动作的条件流匹配。将潜动作的生成建模为条件流匹配CFM问题这是一种无需仿真的目标函数正日益广泛地应用于连续动作机器人策略中 [4, 37, 52, 53]。损失函数 L_m 引导模型通过迭代去噪过程合成高保真潜动作。通过仅基于预期世界动态条件下的视觉状态转移进行训练模型能够捕捉到细粒度且与具体具身形态无关的运动意图从而稳健地指导下游的控制解码器。3 双层混合Transformers尽管潜动作latent actions解决了世界建模与控制之间的时间粒度不匹配问题但移动操作任务还需要对异构动作动态进行结构化处理。为此ABot-M0.5 引入双层混合Transformer 架构D-MoT旨在模态层面和动作层面分别实现异构性的解耦。模态层面的解耦。D-MoT 的第一层级作用于三条并行的 Token 流视频潜表示Xz、潜动作Xm和可执行动作Xa。尽管这些流共享同一个 Transformer 主干网络以进行跨模态推理但它们在语义和时间角色上存在本质差异。为了防止表征坍缩representational collapse每种模态都配备专用的输入投影层、时间步嵌入层和输出头。这种设计确保模型为世界动态、运动意图和硬件控制维持各自独立的表征空间同时通过共享的自注意力层实现灵活的信息交互。动作层面的解耦。D-MoT 的第二层级严格作用于可执行动作流Xa。在移动操作中动作向量本质上包含移动mobility和操作manipulation两个维度它们表现出截然不同的时间频率特征和物理损失函数形态。若使用单一的同构输出头同时预测这两者往往会导致梯度干扰问题即高频的操作信号会主导或破坏低频移动预测的稳定性。为应对这一挑战将动作空间显式解耦为两个独立的子空间操作空间amanip和移动空间amove。具体而言如图 3 所示实施严格的通道-到-子塔channel-to-subtower分配策略使每个子塔都拥有专用的前馈网络FFN和预测头。这种设计使每个子塔能够专注于其特定的动作空间从而确保底盘移动与机械臂操作之间的学习动态实现严格解耦。结构化联合注意力。尽管在前馈层中实现严格解耦模型仍需支持移动与操作之间的协同推理例如底盘位置的调整会直接影响抓取的可行性。为此D-MoT 在每一层对拼接后的 Token 流采用联合自注意力机制。在设计的因果掩码与条件掩码机制下潜-动作latent-action、移动-动作mobility-action和操作-动作manipulation-action的 Token 共同参与统一的注意计算而其后续的前馈网络FFN变换则保持分支特异性。这种设计在不牺牲跨子空间协同能力的前提下实现结构化的功能特化。子空间-觉察 CFM 监督。通过条件流匹配CFM监督最终动作生成阶段。为了稳定学习并防止级联中的错误累积在训练期间采用教师强制的上游调节协议其中动作解码器接收真实视频潜变量 z_≤k1 和潜动作 m_≤k。此外使同一块内的噪声动作相互可见以实现跨子空间协调。为了保持训练-测试一致性并提高推理效率两个子空间共享单个去噪时间步长与推理时的并行联合去噪程序保持一致并消除对单独噪声调度的需要。这种子空间-觉察的 CFM 监督机制完善 z_t1 → m_t → a_t 级联过程的最后阶段。通过将动作去噪过程建立在预期的世界动态与细粒度运动意图之上同时保持跨子空间的信息流动该模型能够生成在时间上连贯且符合物理规律的动作片段。4 面向训练-推理对齐动作预测的梦境驱动方法动作预测中的训练-推理差异。现有的世界动作模型WAMs主要遵循两种训练范式。第一种是教师强制teacher-forcing范式 [17, 33, 50]即在给定真值GT视频 Token 的条件下对动作 Token 进行去噪。第二种是扩散强制diffusion forcing范式 [3, 71, 73]即在统一的扩散过程中对视频和动作的 Token 进行联合去噪。尽管这些方法行之有效但这两种范式在动作预测方面都存在根本性的训练-推理差异如图 4 所示。在教师强制范式图 4(a)中动作模型的训练依赖于干净的 GT 视频潜表示latents[17, 33, 50]。然而在推理阶段无法获取此类 GT 潜表示模型必须转而基于自身生成的视频潜表示进行预测而这些表示不可避免地包含预测误差和视觉伪影。这种不匹配导致严重的暴露偏差exposure bias[22, 46, 57]动作预测器从未接受过解读或补偿其自身“梦境”视觉状态即自生成状态的训练从而导致动作生成质量显著下降。扩散强制范式图 4(b)通过在训练期间让动作预测接触带噪视频潜表示部分缓解这一问题 [3, 71, 73]。然而它引入另一种形式的差异。在训练过程中视频和动作 Token 可能出现在多样且独立采样的噪声时间步timesteps下而推理过程则遵循特定的去噪轨迹其精确的时间步构成难以复现。因此模型必须在广泛的人工噪声配置下学习动作预测这不仅增加优化复杂度而且在训练分布与实际推理时的条件上下文之间仍然留下不匹配。为了解决这些局限性其提出扩散强制Dream Forcing这是一种旨在直接对齐训练与推理条件上下文的训练范式。如图 4© 所示扩散强制不再基于 GT 视频潜表示或任意加噪的潜表示来设定动作 Token 的条件而是利用模型自身生成的“梦境”视频潜表示self-dreamed video latents来训练动作预测器。该设计使动作模型接触到其在推理阶段会遇到的那种不完美的视觉状态从而使其能够学习在模型产生的预测误差下生成稳健的动作进而大幅缩小训练与测试之间的差距。两-阶段前向传播策略。为了实现扩散强制Dream Forcing训练范式摒弃在单次前向传播中联合优化多模态 Token 的传统方法。取而代之的是引入一种两-阶段前向传播策略将“梦境”潜变量dreamed latents的生成阶段 A与动作预测的优化阶段 B解耦。如图5所示阶段 A 的目标是合成作为条件的“梦境”潜变量。与视频生成领域中必须按顺序展开roll out多个未来片段的自回归强制autoregressive forcing方法 [13, 22, 39, 81] 不同闭环机器人场景仅需生成或“梦境化”最近的未来片段。这是因为在部署过程中历史片段会不断地基于现实世界的真值GT观测进行校准 [33]。因此不依赖耗时的顺序展开而是采用并行生成策略在单次前向传播中为一批数据生成所有所需的“梦境”潜变量。此外由于标准步数较多的扩散采样在训练期间进行实时潜变量生成时计算成本过高借鉴自强制Self Forcing [22] 的做法采用少步去噪过程以确保训练效率。在阶段 B 中模型执行第二次前向传播基于阶段 A 合成的“梦境”潜变量来预测动作。具体而言这将动作预测分布从标准的“教师强制”Teacher Forcing形式转变为“梦境强制”Dream Forcing形式即仅将未来的条件潜变量 z_t1, m_t 替换为模型自身生成的对应变量zˆ_t1, mˆ_t。通过让动作预测模型接触不完美的、由模型生成的视觉上下文“梦境强制”有效消除训练与测试之间的分布差异。综上所述这些组件构成 ABot-M0.5 的核心模型设计。中间潜动作建模Intermediate Latent Action Modeling解决世界建模与控制之间的时间跨度问题双层 MoT 解决模态与动作结构的异构性问题而梦境强制则实现逆向动力学学习与自回归展开过程的对齐。为了充分发挥 ABot-M0.5 在表征与生成方面的潜力采用一种从大规模世界建模过渡到具备轨迹一致性的动作学习的渐进式训练范式。这一总体策略的设计深受模型自身结构的启发。鉴于 ABot-M0.5 依赖于未来视频预测、帧级潜动作抽象以及可执行动作生成这三者的协同作用有效的训练必须分阶段构建这些能力而非直接在最具挑战性的轨迹生成设定下从零开始进行全盘优化。因此将训练过程划分为三个阶段用于世界建模的大规模预训练、用于潜动作提取的自监督预训练以及用于逆动力学学习的渐进式监督微调。此外还引入系统级优化措施以支持高效的长序列视频-动作训练。1 预训练数据ABot-M0.5 的预训练语料库由大规模公开机器人数据集与合成机器人数据组合而成。其目标是涵盖广泛的具身形态embodiments、环境、任务结构及操作动力学从而使模型在下游微调之前能够习得可迁移的先验知识。所有数据集均被标准化为统一格式以便进行一致的处理、训练和评估。沿用此前 ABot 工作中建立的数据流水线整合来自以下来源的数据• OXE [11]一个大规模多具身机器人数据集涵盖了多样的场景、任务和平台。它提供了广泛的视觉与行为多样性构成了具身经验的基础来源。• OXE-AugE [25]OXE 的增强扩展版本旨在提升具身形态的多样性特别是针对单臂形态。• Agibot-Beta [1]一个高质量数据集具有结构化的任务设计、连贯的动作序列以及长程操作轨迹。• RoboCOIN [69]一个跨具身数据集侧重于双臂操作和分层任务结构。• RoboMind [68]一个涵盖单臂和双臂平台、具有强大跨平台多样性的长程操作数据集。• Galaxea [26]一个包含丰富传感器信号和细粒度子任务标注的数据集适用于复杂长程操作。• InternData-A1 [64]一个在仿真环境中构建的大规模合成机器人数据集涵盖了多样的具身形态、操作技能和场景配置。这些数据集在多个维度上互为补充。OXE 和 OXE-AugE 提供规模和具身形态的多样性Agibot-Beta 和 Galaxea 提供更高质量的长程任务结构RoboCOIN 和 RoboMind 丰富跨具身和双臂操作的覆盖范围InternData-A1 则引入合成数据的规模优势和更广泛的场景变化。Galaxea 不仅限于机械臂操作还纳入多样的底盘移动任务通过臂与底盘的协同配合来完成长程移动操作任务。综合来看这些数据使 ABot-M0.5 能够在接触特定任务的动作监督之前学习到鲁棒的视觉动力学和可迁移的运动先验。为了增强多样性与鲁棒性还纳入大规模公开机器人数据集包括 RoboNet [15]、BridgeData V2 [65] 和 DROID [27]。同一套数据基础设施也支持潜动作latent action的预训练。由于帧级潜动作仅依赖于视觉帧对而非控制标签因此海量的无标签或弱标签视频也能助力运动抽象的学习。这使得模型可利用的有效监督信号不再局限于标准的动作标注机器人数据集。2 世界模型预训练训练的第一阶段侧重于预训练框架中的视觉世界模型组件。该模型基于预训练的 Wan2.2 5B 权重 [66] 进行初始化并以自回归AR方式训练为无动作条件的未来视频预测器。执行全参数微调以使互联网规模的时空先验适应机器人环境。这一阶段具有多重关键作用它赋予模型稳健的场景与物体表征能力提升未来潜状态预测的质量这些预测随后将作为动作生成的条件信号并将视觉世界建模与逆动力学学习解耦从而显著减轻下游微调任务的负担。在异构具身数据上进行训练时一个主要挑战在于不同机器人平台和数据集之间各异的相机配置所带来的巨大语义鸿沟当相机语义相互交织时视频生成模型难以学习到一致的空间表征。为解决这一问题引入一种固定的语义槽位分配策略。具体而言定义四个具有预设语义角色的标准视频槽位前两个槽位用于第三人称视角以捕捉全局场景和机器人本体构型后两个槽位则用于腕部安装的视角以提供手部与物体交互的精细细节。对于包含超过四个相机视角的数据集随机采样一个子集来填充可用槽位从而引入视角层面的数据增强并防止模型过拟合于特定的相机布局。对于视角数量少于可用槽位的数据集则对未使用的槽位进行零填充zero padding。为了防止零填充视图干扰计算缺失视图被表示为全零潜张量并在自注意层中被屏蔽使其对所有有效视图不可见。训练目标仅在有效视图上计算。具体而言用潜空间中的条件流匹配损失来优化视觉世界模型。对零填充区域的损失进行掩码处理以确保梯度不会从人为填充部分传播。这保证了优化过程完全由真实的视觉观测驱动并使模型能够无缝整合来自不同机器人具身形态及各异的相机配置的多视角数据。预训练的世界模型在移动操作任务中尤为关键。与固定式操作相比移动操作任务因底座移动、场景变换及相机视角的改变而呈现出更剧烈的视觉变化。若世界模型能力较弱其生成的未来预测往往不稳定或质量低劣从而严重制约下游动作学习的效果。通过大规模预训练世界动态特性ABot-M0.5 在进行微调时已具备了关于具身智体未来演变更为强大的表征基础。3 潜动作模型预训练第二阶段旨在预训练用于构建帧级运动监督信号的潜动作编码器。与可执行的机器人动作不同潜动作是基于连续帧之间的视觉转换来定义的这使得它们非常适合在海量视频数据上进行自监督训练。为了获取潜在动作编码器 E_m采用 ALAM [62] 中提出的训练框架如图 6 所示。给定一组按时间顺序排列的观测三元组 (o_i, o_j, o_k)其中 i j k潜动作模型学习能够捕捉观测随时间变化特征的转换嵌入transition embeddings。为了促使这些嵌入形成结构化的运动空间对学习的转换施加代数一致性约束。除了这些关系约束外该模型还结合重构和向量量化目标进行训练以确保潜在编码既包含丰富信息又保持紧凑。完整的预训练目标受到结构化潜动作学习及基于流的策略生成 [37, 62, 63] 的启发。在预训练之后仅保留潜动作编码器 E_m并舍弃解码器及向量量化模块。随后该编码器被冻结作为离线特征提取器用于生成机器人轨迹的潜动作标签。通过这种方式ABot-M0.5 所使用的潜动作监督信号是基于大规模视觉运动数据学习得到的而非根据机器人控制信号人工构建的。这一阶段至关重要原因有二。首先它提供一种细粒度的中间表征弥补未来视频潜表征在时间维度上较为粗糙的不足。其次它使得来自未标注视频的运动知识能够迁移到机器人动作学习中从而将预训练的有效范围从单纯包含动作标注的机器人数据集扩展到了更广泛的领域。4 渐进式监督微调在完成世界模型预训练和潜在动作预训练后ABot-M0.5 进入针对下游机器人数据的监督微调阶段。该阶段引入显式的动作监督并使模型与特定任务的控制分布相适配。并未直接在最终的实际运行rollout模式下进行训练而是采用一种渐进式策略首先在理想的未来条件下稳定世界模型与动作模型的学习随后逐渐过渡到与实际运行模式一致的条件设定。阶段 I世界模型与逆动力学模型的联合微调。在监督微调初期预训练的世界模型相对于目标数据集仍存在域偏移domain shift。尽管它已编码有用的时空先验信息但其对未来的预测精度尚不足以作为下游动作学习的可靠条件。若直接基于预测的未来状态训练逆动力学模型视觉预测误差将干扰动作学习过程因为此时模型尚未适应新的数据分布。因此首先进行一个稳定的微调阶段在此阶段中潜动作预测和可执行动作预测均以真值ground-truth未来视频潜表征为条件。在此设定下模型联合预测未来的视频潜在表征、潜动作以及可执行动作。该阶段为动作学习提供一个稳定的环境。由于作为条件的未来视觉信息是准确无误的逆动力学模型能够专注于学习从“未来世界演变”及“潜运动意图”到“可执行控制”的映射而无需去补偿噪声干扰或不准确的预测结果。实际上阶段 I 在受控条件下建立世界模型与动作模型之间的交互机制。阶段 II用于推理对齐微调的“梦境驱动Dream Forcing”策略。当模型达到初步收敛状态后转入“推理对齐微调”阶段。在推理阶段模型无法获取真实的未来视频潜表示latents而必须完全依赖其自身预测的未来潜表示。为了减少这种训练与测试之间的差异在预测动作时将真实的未来条件输入 z_t1 和 m_t 替换为模型预测的未来条件输入 zˆ_t1 和 mˆ_t。该阶段实现“梦境驱动dream-forcing”机制。此时未来的潜动作和可执行动作是基于模型生成的未来状态而非完美的未来观测进行预测的。因此逆向动力学模型学会适应视频预测噪声、轻微的物体漂移以及不完美的未来推演条件。训练原理。完整的微调策略可以理解为一个渐进式对齐过程。第一阶段在下游领域对齐世界模型和动作模型同时避免逆向动力学模型受到早期预测噪声的干扰。第二阶段则将动作学习的条件输入模式与自回归推演的实际部署模式进行对齐。通过这种方式模型的优化目标不再仅仅是单步预测的准确性而是确保在自身生成的未来状态下实现稳定的长程性能。5 高效结构化注意与潜空间增强上述训练流程涉及对多个 Token 流和多种模态进行长序列联合建模。若无额外优化此类训练的计算成本将高得难以承受。因此引入两种实用技术旨在提高效率和数据利用率同时保持模型预期的语义特性。高效结构化注意。ABot-M0.5 采用一种结构化稀疏自注意模式用于编码 Token 序列间的因果顺序、模态分离及条件可见性。若在完整注意矩阵上直接使用显式分块掩码block masks进行简单实现会造成巨大的计算浪费尤其是在处理长序列时。为解决这一问题将结构化注意模式重新表述为一系列稠密子问题并利用变长 FlashAttention [14] 进行实现。具体而言针对每个样本、帧和 Token 类别预计算由结构化注意掩码所定义的 Query 和 Key 索引的有效范围。随后这些有效范围被打包成连续的 Query-Key-Value QKV片段并在单个变长 FlashAttention 核函数kernel中执行多个注意子问题。这种实现方式在数学上与原始结构化注意力模式等价但在 GPU 上的执行效率却大幅提升。与 FlexAttention 风格的基线方法相比该设计显著降低核函数开销避免不必要的分块填充block padding并减少内存占用。在实际应用中针对长序列视频动作建模任务该方法在“前向-反向”联合计算过程中实现约 5 倍的加速。基于偏移量的潜特征增强。为了降低训练期间重复编码原始视频的计算成本以固定的时间步长 H 预计算视频的潜特征latent features。传统实现方式通常从第一帧开始划分视频并将帧区间 [tH, (t1)H] 映射到第 t 个潜特征。这种刚性对齐方式虽然简单却未能充分利用原始视频信息且限制了训练过程中潜特征划分的多样性。因此引入一种基于偏移量的索引策略。不再固定从第一帧开始而是允许起始偏移量 s 在以下范围内变化s ∈ {0, 1, . . . , H − 1}。在给定偏移量 s 的情况下帧区间 [s tH, …, s (t 1)H] 被映射到第 t 个潜特征。由于存在 H 种可能的偏移量该方法将有效潜特征划分的数量增加 H 倍。由此产生的增强效果提升时间维度的多样性并经实验证明增强模型对微小时间偏差的鲁棒性。在完整训练流程中的作用。这些优化并非孤立的工程细节。高效的结构化注意机制使得 ABot-M0.5 的多流架构能够支持大规模视频-动作联合训练而基于偏移量的潜空间增强offset-based latent augmentation则提升数据效率与时间维度上的鲁棒性。两者的结合使得渐进式训练流程能够扩展至长时程移动操作任务且无需牺牲模型原有的结构设计。综上所述ABot-M0.5 的训练范式融合大规模世界建模、自监督运动抽象、渐进式动作对齐以及高效的系统级优化。这种融合对于将模型的架构优势转化为移动操作基准测试及实际部署中的优异性能至关重要。实验设置基准测试。在以下基准测试上评估 ABot-M0.5• RoboCasa365 [45]一项具有挑战性的移动操作基准测试涉及包含原子级和复合级子任务的家庭场景任务。它是评估长程long-horizon移动操作的主要基准。• RoboTwin 2.0 [9]一项多任务双臂操作基准测试包含“干净”clean和“随机化”randomized两种设置用于评估模型在场景变化下的泛化能力。• LIBERO / LIBERO-Plus [16, 38]组合式操作基准测试用于评估多任务和长程桌面操作能力。• 真实世界任务一组真实的机器人任务旨在测试所学习的世界-动作策略world-action policy能否从仿真环境迁移到现实世界。基准测试的实现遵循 RoboCasa365、RoboTwin 2.0 和 LIBERO/LIBERO-Plus 的官方设置。基线方法。将本文方法与现有的视频-语言-动作VLA模型及世界动作模型WAMs进行比较。为了确保评估的全面性和客观性挑选基线方法涵盖最广泛采用的、最先进的SOTA、最新的以及与本文方法最相关的研究工作。具体而言在 LIBERO-Plus 基准测试中将比较范围从标准的 VLA 模型扩展到混合式 VLAWM 架构和纯 WAM 架构重点突显其方法相比现有 WAMs 的独特优势。评估指标。对于每个基准测试遵循官方协议并报告标准的评估指标。主要的评估指标是任务成功率。对于 RoboCasa365额外报告在“原子级已知”atomic seen、“复合级已知”composite seen和“复合级未知”composite unseen任务类别下的性能表现。对于 RoboTwin 2.0报告在 50 个任务中于“干净”和“随机化”场景下的平均成功率。对于 LIBERO 和 LIBERO-Plus报告跨任务平均的标准成功率指标。对于真实世界实验在 5 个任务上进行评估并同时报告成功率和过程得分。实现细节。除非另有说明ABot-M0.5 均采用渐进式流水线进行训练。在该训练范式下视频潜主干网络、潜动作编码器及逆动力学组件进行联合微调。针对移动操作任务动作头同时对移动控制和操作控制进行建模对于非移动操作基准测试则保留相同的整体架构仅针对相应的具身形态和控制维度对动作路由进行专门调整。