拓冰建站拓冰建站
首页 / 资讯中心 / 正文

【CVPR 2026】Motus:一个模型贯通理解、预测与控制|从统一世界模型架构视角

摘要本文解读 CVPR 2026 论文《Motus: A Unified Latent Action World Model》。该论文提出统一潜在动作世界模型 Motus通过融合三专家 Mixture-of-Transformers 架构、光流潜在动作表示与UniDiffuser 式模态时间步调度让一个网络同时覆盖 VLA、世界模型、IDM、VGM 与联合视频动作预测五种模式其特别之处在于以共享注意力连接专长模型、以统一运动表示连接异构数据。实验表明在 RoboTwin 2.0 上平均成功率 88.66%Clean/ 87.02%Randomized相比 X-VLA 提升约 16 个百分点、相比 $\pi_{0.5}$ 提升约 45 个百分点并在 AC-One 与 Agilex-Aloha-2 双真实平台验证了跨本体泛化为具身智能的统一世界模型与跨本体学习提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机为什么具身智能需要统一模型研究主线从问题到结论基准/方法设计三专家 MoT 与统一条件生成分类全景一个网络的五种模式方法细节模态时间步调度与光流潜在动作实验设计与结果仿真、真实平台与跨基准评测结果对比总结关键发现局限性常见问题FAQMotus 是什么一个网络如何切换五种模式光流潜在动作解决了什么问题Motus 在 RoboTwin 2.0 上表现如何真实机器人上的表现如何Motus 与 UWM、$\mathcal F_1$ 的区别参考链接论文基本信息项目内容标题英文Motus: A Unified Latent Action World Model标题中文统一潜在动作世界模型一个模型贯通理解、预测与控制作者Hongzhe Bi, Hengkai Tan, Shenghao Xie, Zeyuan Wang, Shuhe Huang, Haitian Liu, et al.机构清华大学、北京大学、地平线机器人会议CVPR 2026arXivhttps://arxiv.org/abs/2512.13030项目网站https://motus-robotics.github.io/motus背景与动机为什么具身智能需要统一模型具身智能的完整决策闭环包含五步理解场景对象、空间关系与状态、解释指令语言目标落到视觉情境、预测后果给定动作推演世界变化、想象未来生成可能的任务进程与输出动作生成精确连续控制块。传统做法为每一类能力训练独立模型其代价在于独立模型难以共享跨模态先验也无法闭合感知–行动循环。Motus 面对两个统一挑战。其一是模型不兼容VLM、VGM、动作专家结构各不相同从零训练会丢失互联网规模预训练的通用先验其二是数据异构动作空间随机器人本体变化而海量第一视角视频没有动作标签。相关工作各有缺口UWM 耦合视频与动作扩散但从零训练且预训练先验有限$\mathcal F_1$ 连接 VLA 与 IDM却未覆盖 WM 与 VGMVideo policy / VLA 分别强调未来视觉或静态视觉–动作映射Latent action 用重构运动缓解标签稀缺但 RGB 目标容易混入外观干扰。从历史脉络看附录 9.5这条线从 2018–2019 年 Rybkin、Edwards 等用 IDM FDM 学习 latent policy 起步2024 年 Genie 用 latent action 驱动生成式交互环境LAPO、Moto 推进无动作视频策略预训练2025 年 LAPA、UniVLA、CoMo 把任务中心或连续运动表示用于机器人学习也暴露了 RGB 外观干扰与跨本体对齐难题。Motus 的定位是复用强 VGM/VLM以光流压缩运动再由统一调度器切换任务。统一训练还带来了跨基准泛化收益附录 D 基准对比表基准$\pi_{0.5}$X-VLAMotusLIBERO-Long—97.697.6VLABench ID0.43—0.48VLABench Cross-Category0.22—0.25AC-One 方块入盘 OOD28.125—75.0统一训练保持了跨基准的策略质量并支持类别迁移与真实 OOD 对象说明“统一 预训练”的路线不牺牲专项能力。研究主线从问题到结论图 10Motus 研究主线流程图从五套割裂模型到统一世界模型的完整推理链条Mermaid 流程图。基准/方法设计三专家 MoT 与统一条件生成Motus 的核心设计是三专家 Mixture-of-TransformersMoT生成专家采用 Wan 2.2 5B提供视频动态与物理交互先验理解专家取 Qwen3-VL-2B 最后一层 token提供 3D grounding、空间理解与目标定位动作专家与 Wan 同深度每层含 AdaLN、FFN 与共享注意力。Tri-model Joint Attention让各专家保留独立 Transformer/FFN仅把多头注意力上下文拼接实现跨模态信息交换而不抹平专长——复用强预训练权重而非从零训练互联网规模统一模型。图 1Motus 完整架构生成、动作、理解三专家通过 Tri-model Joint Attention 连接。五种生成分布共享同一个 Rectified-Flow 目标模式目标分布作用VLA$p(a\mid o,\ell)$由视觉语言生成动作WM$p(o\mid o,a)$预测动作后果IDM$p(a\mid o,o)$从变化反推动作VGM$p(o\mid o,\ell)$想象任务未来Joint$p(o,a\mid o,\ell)$联合生成视频动作训练目标统一为 $ \mathcal L^\theta \mathbb E\lVert v_a^\theta - (\epsilon_a - a)\rVert_2^2 \mathbb E\lVert v_o^\theta - (\epsilon_o - o)\rVert_2^2$其中时间步 $\tau_a,\tau_o \sim \mathcal U(0,T_\tau)$——视频与动作共享网络却拥有独立时间步与噪声尺度这是统一的关键。分类全景一个网络的五种模式图 11Motus 五种推理模式分类树同一条件生成框架下的 VLA、WM、IDM、VGM 与 JointMermaid 结构图。方法细节模态时间步调度与光流潜在动作UniDiffuser 式调度把“模式切换”转化为“模态时间步配置”问题干净模态作为条件持续噪声模态被边缘化逐步去噪模态成为输出。五种推理模式只需设置视频时间步 $\tau_o$ 与动作时间步 $\tau_a$附录 A 完整配置表模式视频 $\tau_o$动作 $\tau_a$输出VGM$T\rightarrow0$固定 $T$视频WM$T\rightarrow0$固定 $0$视频IDM固定 $0$$T\rightarrow0$动作VLA固定 $T$$T\rightarrow0$动作Joint$T\rightarrow0$$T\rightarrow0$视频动作推理时视频与动作采用不同的采样密度Action-Dense Video-Sparse配置下视频 8 帧5 Hz动作 48 步30 Hz。图 2Action-Dense Video-Sparse视频 8 帧5 Hz动作 48 步30 Hz。光流作为像素级 Delta Action是连接无标签运动与可执行控制的桥梁。为何不直接重构 RGB因为 RGB 同时包含外观、背景与运动低容量 latent 仍可能编码任务无关纹理。Motus 的做法是DPFlow 计算相邻帧光流并编码为 RGB flow imageDC-AE 重构像素位移只保留运动再用少量真实动作与 task-agnostic 动作把视觉运动空间锚定到控制分布。训练损失为 $ \mathcal L \mathcal L_{\rm recon} \lambda_a\lVert a_{\rm real} - a_{\rm pred}\rVert_2^2 \beta\mathcal L_{\rm KL}$。光流不依赖关节定义却保留物体与机械臂共享的运动结构因此天然是跨本体桥梁。图 3潜在动作 VAE完整光流重构与动作对齐路径。表示路径上光流经 DC-AE 得到 $4\times512$ 个 token再由轻量编码器压成14D 潜在动作。数据配比上约 90% 无标签 10% 有标签自监督重构吸收具身相关视频运动机器人示范和 task-agnostic 交互提供弱动作监督。三阶段训练附录 A 训练计算表依次为Stage 1用多机器人轨迹与人类视频继续预训练 VGMStage 2冻结 VLM以视频、语言、潜在动作联合训练Stage 3在目标机器人真实动作本体上微调。规模上总参数约8BVGM 5.00B、VLM 2.13B、动作专家 641.5M、理解专家 253.5MFlow Matching 推理 10 步阶段BatchLearning rateGPU hoursStage 1256$8\times10^{-5}$$\sim8000$Stage 2256$5\times10^{-5}$$\sim10000$Stage 3256$1!\sim!5\times10^{-5}$$\sim400$数据侧六层数据金字塔从 Web 数据、第一视角、仿真、task-agnostic、多机器人直到目标机器人数据逐层收窄让预训练先验逐步落到目标本体分布。图 4六层数据金字塔Web、第一视角、仿真、task-agnostic、多机器人与目标机器人数据。设计原则上附录 9.4P5 强调统一跨模态表示三专家 MoT 对齐视频、语言、动作时间步配置让同一参数化表达边缘、条件与联合分布P7 强调自监督信号光流潜在动作把 90% 无标签具身视频转为运动监督10% 标注轨迹对齐控制VGM/VLM 复用 Web 预训练先验。实验设计与结果仿真、真实平台与跨基准评测RoboTwin 2.0 评测协议50 个代表性任务Clean 2,500 条示范、Randomized 25,000 条示范Clean 每任务 50 条Randomized 每任务 500 条并含背景、杂物、桌高、光照扰动所有模型从各自 checkpoint 出发仅允许 40k 次微调每任务执行 100 次分别报告 Clean / Randomized 成功率采用单模型、多任务联合训练直接考察预训练与分布偏移泛化。图 5AC-One 与 Agilex-Aloha-2空间理解、柔性操作、液体控制、视觉理解与长程规划按 Partial Success Rate 评测。仿真结果50 任务平均成功率方法Clean%Randomized%$\pi_{0.5}$42.9843.84X-VLA72.8072.84Motus88.6687.02精确表值显示 Motus 在 Clean 提升15.86、Randomized 提升14.18均相对 X-VLA相对 $\pi_{0.5}$ 的 Randomized 提升43.18论文正文使用约 $15/45$ 个百分点的概括且随机化优势接近 Clean。真实机器人双平台 Partial Success Rate平台$\pi_{0.5}$w/o PretrainMotusAC-One9 任务14.7925.8663.22Agilex-Aloha-25 任务48.6026.6059.30细项上AC-One 方块入盘 100、磨咖啡豆 92、OOD 方块入盘 75Aloha-2 饮水机取水 96、按指定键 80每任务 100 条训练轨迹。平均分双平台领先但 Aloha-2“面包入烤箱”34低于 $\pi_{0.5}$ 的 36。长程任务按完成子目标计分完整成功得满分。五模式各自的证据一个网络确实服务五种模式模式证据结论VGM双平台条件视频想象未来WMFID/FVD/SSIM 等预测动作后果IDM动作 MSE0.014优于专训 IDMVLARandomized83.90直接控制JointRandomized87.02联合预测增益Joint 模式87.02高于单独 VLA 模式83.90说明联合预测带来真实增益附录 9.4 执行支撑RoboTwin Randomized 87.02、LIBERO-Long 97.6、真实 OOD 75.0且 Stage 2 消融优于无预训练与仅视频预训练。消融验证预训练配方完整 Stage 2 潜在动作预训练优于无预训练与仅 Stage 1。图 6RoboTwin Randomized 消融完整 Stage 2 潜在动作预训练优于无预训练与仅 Stage 1。定性案例九项真实任务执行序列覆盖两类双臂机器人VGM 模式还能在 Agilex-Aloha-2 上生成与指令一致的条件未来视频IDM 反推动作 MSE 低至 0.014。图 7两类双臂机器人九项真实任务执行序列完整保留全部时间步与面板。图 8VGM 模式在 Agilex-Aloha-2 上的条件视频生成完整保留输入、语言与全部未来帧。图 9IDM MSE 0.014RoboTwin Randomized 上 VLA / Joint 成功率 83.90 / 87.02。世界模型质量附录 D双平台平均指标数值FID $\downarrow$11.209FVD $\downarrow$61.20865SSIM $\uparrow$0.8661LPIPS $\downarrow$0.063645PSNR $\uparrow$25.0700结果对比总结图 12仿真与真实平台结果对比总结从 π0.5 到 Motus 的成功率提升路径Mermaid 流程图。关键发现一个网络贯通五模式RoboTwin 2.0 上 Motus 平均成功率 88.66%Clean/ 87.02%Randomized比 X-VLA 高 15.86 / 14.18 个百分点比 $\pi_{0.5}$ 高 43.18 个百分点Randomized。双真实平台验证跨本体泛化AC-One9 任务Partial Success Rate 63.22远超无预训练基线的 25.86 与 $\pi_{0.5}$ 的 14.79Aloha-25 任务59.30超过 $\pi_{0.5}$ 的 48.60。联合预测带来真实增益Joint 模式 Randomized 成功率 87.02高于单独 VLA 模式的 83.90IDM 动作 MSE 仅 0.014优于专训 IDM。90% 无标签数据被转化为运动监督光流潜在动作 三阶段训练中完整 Stage 2 预训练优于无预训练与仅 Stage 1 视频预训练。跨基准与 OOD 泛化LIBERO-Long 97.6、VLABench ID 0.48对比 $\pi_{0.5}$ 0.43、真实 OOD 方块入盘 75.0对比 28.125。世界模型质量扎实双平台 FID 11.209、FVD 61.21、PSNR 25.07配合 8B 参数与 10 步 Flow Matching 推理验证生成先验在统一架构中没有被削弱。局限性论文陈述的边界包括结论未列显式失败案例未来工作反向指出三方面仍有限——互联网规模潜在动作从通用视频学习当前尚未完成、更普适运动先验覆盖更复杂接触与更大本体差异、更强统一架构提升跨专家协同并降低功能干扰。此外同网可用不等于所有模式都达到专用模型的全域最优Aloha-2“面包入烤箱”34 分低于 $\pi_{0.5}$ 的 36 分即是实例。总体判断Motus 证明“统一 预训练”可行尚需扩展为互联网规模的跨本体基础设施。常见问题FAQMotus 是什么Motus 是 CVPR 2026 提出的统一潜在动作世界模型一个三专家 MoT 网络同时覆盖 VLA、世界模型WM、逆向动态模型IDM、视频生成模型VGM与视频–动作联合预测五种模式总参数约 8B。一个网络如何切换五种模式通过 UniDiffuser 式独立模态时间步调度视频时间步 $\tau_o$ 与动作时间步 $\tau_a$ 的不同配置$T\rightarrow0$ 去噪、固定 $T$ 保持、固定 $0$ 条件决定输出是视频、动作还是联合结果模式切换被转化为模态时间步配置问题。光流潜在动作解决了什么问题它把相邻帧光流经 DC-AE 压缩为 14D 潜在动作只保留运动、剔除外观干扰从而把约 90% 无标签具身视频转化为运动监督并用少量真实动作把视觉运动空间锚定到控制分布成为跨本体桥梁。Motus 在 RoboTwin 2.0 上表现如何50 任务平均成功率 88.66%Clean/ 87.02%Randomized相比 X-VLA 提升约 16 个百分点、相比 $\pi_{0.5}$ 提升约 45 个百分点且仅允许 40k 次微调。真实机器人上的表现如何AC-One9 任务Partial Success Rate 63.22、Agilex-Aloha-25 任务59.30均领先 $\pi_{0.5}$ 与无预训练基线长程任务按完成子目标计分。Motus 与 UWM、$\mathcal F_1$ 的区别UWM 耦合视频与动作扩散但从零训练、预训练先验有限$\mathcal F_1$ 未覆盖 WM 与 VGMMotus 复用强 VGM/VLM 预训练权重以光流作为跨本体运动表示并通过统一调度器覆盖全部五种生成分布。参考链接Motus arXiv 论文arXiv: 2512.13030Motus 项目主页Motus 代码仓库thu-ml$\pi_{0.5}$: Open-World GeneralizationCoRL 2025Genie: Generative Interactive EnvironmentsICML 2024Unified World Models: Coupling Video and Action Diffusion给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门