拓冰建站拓冰建站
首页 / 资讯中心 / 正文

【arXiv 2026】世界行动模型即零样本策略|从视频扩散世界模型视角

摘要本文解读 arXiv 2026 论文《World Action Models are Zero-shot Policies》。该论文提出DreamZero——一个 14B 参数的世界行动模型WAM通过融合预训练视频扩散骨干 Wan2.1、flow matching 联合去噪与自回归分块生成让机器人在异构非重复数据上同时学习未来帧预测与动作生成其特别之处在于视频作为世界演化的稠密表示直接决定动作天然继承物理动力学先验。实验表明零样本泛化 2 倍以上超越最先进 VLAAgiBot unseen 任务 39.5% vs 16.3%仅需 10–20 分钟视频即可跨本体迁移相对提升 42%并经 38× 推理加速实现 7Hz 实时闭环控制为具身智能基础模型提供了从预测世界到直接行动的重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机为什么 VLA 学不会怎么做研究主线从问题到结论基准/方法设计什么是世界行动模型分类全景机器人策略学习的三大路线方法细节自回归分块扩散与闭环 KV 缓存实验设计与结果零样本泛化如何验证结果对比总结关键发现局限性常见问题FAQDreamZero 是什么WAM 与 VLA 有什么区别为什么视频数据能跨本体迁移DreamZero 训练需要多少数据7Hz 实时控制是怎么实现的DreamZero 的主要局限是什么参考链接论文基本信息项目内容标题英文World Action Models are Zero-shot Policies标题中文世界行动模型即零样本策略作者Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang, Ayaan Malik, Kyungmin Lee, William Liang, Nadun Ranawaka, Jiasheng Gu, Yinzhen Xu, Guanzhi Wang, Fengyuan Hu, Avnish Narayan, Johan Bjorck, Jing Wang, Gwanghyun Kim, Dantong Niu, Ruijie Zheng, Yuqi Xie, Jimmy Wu, Qi Wang, Ryan Julian, Danfei Xu, Yilun Du, Yevgen Chebotar, Scott Reed, Jan Kautz, Yuke Zhu, Linxi Jim Fan, Joel Jang机构NVIDIA GEAR Lab会议arXiv 2026arXivhttps://arxiv.org/abs/2602.15922项目网站https://dreamzero0.github.io背景与动机为什么 VLA 学不会怎么做核心矛盾现有 Vision-Language-ActionVLA模型如 RT-2、OpenVLA、GR00T N1.6、$\pi_{0.5}$具备强大的语义泛化理解这是什么、任务是什么但缺乏物理运动泛化不知道手该怎么动、物体会怎么倒。原因在于它们学习的是观测→动作的直接映射而动作监督信号稀疏、重复示范成本高物理动力学先验只能从有限的动作标注中隐式习得。关键差异DreamZero 属于 World Action ModelWAM家族——学习视频动作的联合分布动作由预测的视觉未来隐含决定。与视频模型机器人策略UniPi、RoboDreamer、DreamGen——视频生成指导动作动作仍需逆动力学模型提取不同WAM 把视频预测与动作生成端到端联合建模天然继承网络级视频数据中的物理动力学先验。WAM 的历史演进附录 H从 2020–2023 的潜空间世界模型Dreamer、V-JEPA需测试时规划/搜索到 2024–2025 的生成式视频世界模型UniSim、Genie、DreamGen动作仍需逆动力学提取再到 2026 年 2 月 DreamZero 首次实现视频动作联合端到端建模14B 模型实时 7Hz 控制2026 年 3–7 月 GigaWorld、MotuBrain、Wall-WM、ABot-M0.5 等 1B–14B 多模态变体相继涌现WAM 家族全面爆发。为何 WAM 对机器人基础模型至关重要一是物理先验复用——网络级视频数据蕴含动力学动作学习只需逆映射二是数据宽容度——异构非重复数据即有效采集成本数量级下降三是跨本体通道——视频是本体无关表示人类视频可直接迁移到机器人。研究主线从问题到结论图 9研究主线 Mermaid 流程图从纯动作模仿缺乏物理泛化的问题出发经视频物理先验动机、WAM 联合设计、自回归分块方法到 2 倍超越 VLA 的实验与结论基准/方法设计什么是世界行动模型DreamZero 的核心设计是端到端联合建模视频与动作单模型同时输出未来视频帧与动作序列覆盖 AgiBot G1 双臂移动机器人与 Franka 单臂DROID两个本体。它基于预训练视频扩散骨干 Wan2.114B DiT冻结文本/图像编码器与 VAE仅训练 DiT 块与新增的状态/动作编解码器——视频生成质量即策略上限视频预测扮演隐式视觉规划器动作从看得见的未来中提取。图 1DreamZero 总览联合预测视频与动作继承世界物理先验实现异构数据学习、开放世界泛化、视频跨本体迁移与 few-shot 新本体适配分类全景机器人策略学习的三大路线图 10机器人策略学习分类树VLART-2/OpenVLA/GR00T N1.6/π0.5、视频模型策略UniPi/RoboDreamer/DreamGen与 WAM 联合视频-动作Cosmos/Genie/MIMICDreamZero 是 14B 端到端 WAM 代表方法细节自回归分块扩散与闭环 KV 缓存联合目标flow matching 同时去噪视频与动作隐变量通过共享去噪时间步保证模态对齐学习目标为 $p(\mathbf{o}{l:lH}, \mathbf{a}{l:lH} \mid \mathbf{o}_{0:l}, \mathbf{c}, \mathbf{q}_l)$——给定历史观测、语言指令与本体状态联合预测未来视频帧与动作。图 2模型架构视觉上下文VAE 编码、语言指令文本编码器、本体状态状态编码器经自回归 DiT 与 flow matching 联合预测未来视频帧与动作自回归分块每块 $K2$ 个隐帧、$M4$ 块teacher forcing 用干净历史块条件化当前噪声块。闭环推理时执行后把真值观测注入 KV 缓存替换预测帧消除自回归误差累积。为何自回归优于双向KV 缓存加速推理 3–4 倍保留原生帧率避免双向模型 FPS 扭曲带来的模态错位。消融附录 B显示 AR 与双向精度相当均 50%但 AR 动作更平滑且推理更快。DreamZero-Flash解耦视频/动作噪声调度视频 $t \sim \mathrm{Beta}(7,1)$ 偏向高噪声支持单步去噪单步去噪任务进度 74% vs 朴素 52%4 步 83%速度提升 2.33 倍。实时优化套件附录 A 全景CFG 双 GPU 并行、DiT 缓存16→4 步、torch.compile CUDA Graph、kernel/scheduler 优化、NVFP4 量化叠加 Flash 单步去噪总延迟从 5.7s 降至 150ms支撑 7Hz 闭环控制优化累积H100GB200基线1×1.1×CFG 双 GPU 并行1.9×1.8×DiT 缓存16→4 步5.5×5.4×torch.compile CUDA Graph8.9×10.9×kernel/scheduler 优化9.6×14.8×NVFP4 量化—16.6×DreamZero-Flash4→1 步—38×实验设计与结果零样本泛化如何验证评测协议默认unseen 环境 unseen 物体——训练与评估站点地理隔离天然检验分布外OOD泛化任务粒度 运动方式 × 物体类型。AgiBot 上评估 10 seen 10 unseen 任务DROID 上 2020 任务。基线为 GR00T N1.6 与 $\pi_{0.5}$各含 from-scratch / from-pretrained 两策略相同数据与算力预算。图 3AgiBot 评估设定默认 unseen 环境与 unseen 物体训练与评估站点地理隔离天然检验分布外泛化主表零样本评估零样本评估DreamZero最佳预训练 VLA提升AgiBot seen平均进度62.2%27.4%2.3×AgiBot unseen39.5%16.3%2.4×DROID unseen进度/成功率49% / 22.5%31% / 12.5%18pp跨本体 unseen9 任务基线视频迁移提升机器人→机器人YAM20 分钟38.3%55.4%44.7% 相对人类→机器人12 分钟38.3%54.3%41.8% 相对任务/数据规模AgiBot G1 使用约 500 小时遥操作数据22 个真实环境7.2K 幕每幕约 4.4 分钟、42 个子任务FrankaDROID使用开源异构数据集验证可复现性。图 4Seen 任务评估DreamZero 有效利用异构数据并泛化到新环境from-scratch VLA 接近零分预训练 VLA 仅中等表现图 5Unseen 任务零样本泛化解鞋带、熨衣、画画、握手等训练外任务DreamZero 在两个本体上均显著领先Q1 异构数据学习from-scratch VLA 在异构数据上几乎失败1%DreamZero 达到 62.2%——视频先验弥补了动作监督的不足。消融附录 B显示异构数据较重复数据 17pp33%→50%模型规模 14B 较 5B 29pp21%→50%而 VLA 从 5B 扩到 14B 仍为 0%。Q2 unseen 任务AgiBot 上 39.5% vs 16.3%DROID 上 49% vs GR00T 31% / $\pi_{0.5}$ 33%——VLAs 过度拟合 pick-and-place 主导行为遇到训练外任务解鞋带、熨衣、画画、握手表现骤降。Q3 后训练保持任务特化微调后环境泛化不损失fruit packing 任务显著优于 VLA。图 6后训练结果WAM 在三个下游任务上匹配或超越 VLA 基线环境泛化能力在微调后保留Q4 跨本体视频迁移视频是本体无关表示——仅 20 分钟 YAM 机器人视频44.7% 相对提升或 12 分钟人类视频41.8% 相对提升即可显著提升 unseen 任务表现。图 7跨本体迁移YAM→AgiBot 与人类→AgiBot 视频-only 数据均显著提升 unseen 任务表现Q5 few-shot 本体适配仅 30 分钟 play 数据55 幕适配全新 YAM 机器人保持语言跟随与零样本泛化。图 8Few-shot 本体适配AgiBot 预训练模型用 30 分钟 play 数据适配 YAM泛化到南瓜、泰迪熊等训练外物体Oral 信号验证附录 C范式级创新有完整证据链——替换算子/表示视频骨干替代 VLM 图文骨干unseen 任务 2.4× 于最佳 VLA、14B vs 5B 29pp制造监督信号联合视频-动作 flow matching异构数据 17pp、from-scratch VLA 同类数据上仅 1%解放固定生成组件Flash 解耦噪声调度单步去噪 74% vs 朴素 52%4 步 83%、速度 2.33×。结果对比总结图 11结果对比总结DreamZero 零样本 seen 62.2% vs 27.4%2.3×、unseen 39.5% vs 16.3%2.4×、跨本体视频迁移 44.7% 相对提升、38× 加速实现 150ms 7Hz 闭环控制关键发现零样本泛化 2 倍以上超越最先进 VLAAgiBot seen 任务 62.2% vs 27.4%2.3×、unseen 任务 39.5% vs 16.3%2.4×DROID unseen 进度/成功率 49%/22.5% vs 31%/12.5%18pp。异构数据即可学习from-scratch VLA 在异构非重复数据上几乎失败1%DreamZero 达 62.2%消融显示异构数据较重复数据 17pp。规模效应显著14B 较 5B 任务进度 29pp21%→50%而 VLA 即使扩到 14B 在异构数据上仍为 0%。视频是跨本体通道20 分钟 YAM 视频跨本体迁移 44.7% 相对提升12 分钟人类视频 41.8%视频-only 数据即可用。30 分钟 play 数据 few-shot 适配新本体55 幕数据适配 YAM保持语言跟随与零样本泛化泛化到南瓜、泰迪熊等训练外物体。38× 推理加速实现 7Hz 实时闭环CFG 并行 DiT 缓存 NVFP4 量化 Flash 单步去噪延迟从 5.7s 降至 150ms单步去噪 74% vs 朴素 52%。局限性算力门槛高7Hz 实时控制需 2× GB20038× 加速后对比 VLA 在消费级 GPU 上可达 20Hz边缘部署仍远。短视界视觉记忆仅 6.6 秒本质是 System 1 模型长程任务需 System 2 规划器配合。高精度任务欠拟合亚厘米级操作插钥匙、精细装配表现不足异构数据策略牺牲了稠密示范覆盖。缩放规律未明缺少模型/数据/算力的 WAM 缩放定律最优配置未知。作者展望大规模第一视角人类视频Ego4D、EgoDex 等有望带来比 VLA 更强的迁移更小但泛化强的视频骨干可实现边缘端 System 1 部署。常见问题FAQDreamZero 是什么DreamZero 是 NVIDIA GEAR Lab 提出的 14B 世界行动模型WAM用预训练视频扩散模型 Wan2.1 同时预测未来帧与动作让机器人在异构数据上学到可泛化的物理技能实现 7Hz 实时闭环控制。WAM 与 VLA 有什么区别VLA 学习观测→动作的直接映射动作监督依赖大量重复示范WAM 学习视频动作联合分布动作由预测的视觉未来隐含决定天然继承视频数据中的物理动力学先验因而在异构非重复数据上也能学习。为什么视频数据能跨本体迁移视频是本体无关的稠密世界表示——它描述世界如何演化而非某条机械臂怎么动。因此 YAM 机器人的视频20 分钟甚至人类视频12 分钟都能迁移到 AgiBot提升 unseen 任务表现 42% 以上。DreamZero 训练需要多少数据AgiBot G1 使用约 500 小时异构遥操作数据22 个环境、7.2K 幕跨本体迁移只需 10–20 分钟视频示范适配全新机器人只需 30 分钟 play 数据55 幕无需重复示范。7Hz 实时控制是怎么实现的通过系统级优化套件CFG 双 GPU 并行、DiT 缓存16→4 步、torch.compile CUDA Graph、NVFP4 量化加上 DreamZero-Flash 解耦噪声调度实现单步去噪总加速 38×延迟从 5.7s 降至 150ms。DreamZero 的主要局限是什么需要 2× GB200 级算力边缘部署远、视觉记忆仅 6.6 秒System 1 模型、亚厘米级高精度任务欠拟合且 WAM 的缩放规律尚未明确。参考链接arXiv 论文页World Action Models are Zero-shot Policies (arXiv:2602.15922)DreamZero 项目网站WanOpen and Advanced Large-Scale Video Generative ModelsGR00T N1.6NVIDIAπ0.5: Vision-Language-Action ModelPhysical IntelligenceDreamGen: Unlocking Generalization in Robot Learning through Video World Models (CoRL 2025)Cosmos: World Foundation ModelsNVIDIA给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门