Qwen-RobotWorld:通过语言条件视频生成统一具身世界建模

发布时间:2026/7/26 7:05:58
Qwen-RobotWorld:通过语言条件视频生成统一具身世界建模 26年7月来自阿里千问的论文“Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation”。QWEN-ROBOTWORLD是一个面向具身智能、由语言驱动的视频世界模型。该模型以自然语言作为统一的动作接口能够基于当前观测预测符合物理规律的未来视觉轨迹涵盖机器人操作、自动驾驶、室内导航及人机动作迁移等多种场景。这种统一的建模方式带来三个极具前景的应用方向用于增强策略训练的合成数据生成、用于策略评估的可扩展虚拟环境以及为下游机器人控制提供语言引导的规划信号。该模型通过以下三部分设计实现a) 结合 MLLM 动作编码的双流 MMDiT 架构利用 60 层双流扩散 TransformerDiffusion Transformer通过逐层联合注意机制将冻结的 Qwen2.5-VL 语义与视频 VAE 潜表征进行耦合b) 具身世界知识EWK数据集这是一个包含 860 万个视频-文本样本超过 2 亿帧的语料库涵盖 20 多种具身形态和 500 多种动作类别以及 c) “通用专家”渐进式课程学习策略即先学习通用视觉先验随后在统一语言接口下注入具身领域的专业知识。大量实验结果显示该模型极强的竞争力在 EWM-Bench 和 DreamGen Bench 上综合排名第一在 WorldModelBench 和 PBench 上超越所有开源模型。此外在 RoboTwin-IF 基准测试上的零样本zero-shot分析进一步验证其稳健的泛化能力和多视角一致性。训练通用具身世界模型的核心挑战不仅仅在于数据规模更在于表征的异构性机器人操作动作表现为关节角度或末端执行器航点驾驶任务涉及转向指令与速度曲线而导航则体现为航向向量——这些形式各异的动作通常需要针对不同领域设计专门的模型或接口。通过一个“动作-语言”映射框架解决这一难题该框架将来自20多种机器人形态和500多种动作类别的异构动作转化为统一的自然语言接口。在此统一接口下来自Franka机械臂、自动驾驶车辆及室内导航智能体的视频数据均被视为同一类“语言条件视频生成任务”的实例这样能够在无需特定领域控制接口的情况下利用单一模型实现跨场景、跨任务的联合训练。如图1所示该框架生成了约600万组高质量的跨场景、跨任务具身视频-文本对进一步结合通用视频数据占总量的30%构建了“具身世界知识”EWK数据集——这是一个包含860万组视频-文本对及超过2亿帧观测图像的大规模语料库。1 动作-语言映射动作-语言映射框架旨在解决具身数据中存在的一个根本性不对称问题视觉状态视频帧处于统一的像素空间中而动作表征则分散在互不兼容的模态里。其框架通过将所有动作信号映射到一个共享的自然语言空间来解决这一问题从而使得同一个扩散Transformerdiffusion transformer模型能够学习 s_{t1} f(s_t, a_t) 的映射关系而无需考虑底层的物理形态domain。为何选择语言作为统一的动作接口与关节角度、末端执行器航点waypoints或力/力矩指令等低级动作表征不同——这些表征通常依赖于特定硬件且每种具身形态都需要独立的控制接口——自然语言提供了一种通用的、与具体具身形态无关的动作接口。诸如“抓住红色杯子并垂直提起”这样的一条指令便隐含了完整的动作序列、目标状态及物理约束信息且无需了解底层的运动学链结构。通过训练模型仅根据语言动作 a_t 来预测下一个视觉状态 s_{t1}其获得一个能够跨具身形态泛化的仿真骨干模型——无论是Franka夹爪、Aloha双臂系统还是人形机器人均无需针对特定机器人重新训练或重新设计接口。然而这种通用性对标注质量提出了极高要求每条描述caption都必须作为完整且自包含的动作规范其精确度需足以让模型仅凭 a_t 和 s_t 即可预测 s_{t1}而无需依赖任何机器人元数据或本体感知信号。分层五级标注体系。为了在涵盖20多种机器人具身形态和500多种动作类别的场景下始终如一地生成包含丰富动作信息的描述其设计一个包含五个递进层级的层级化标注框架。前三个层级构成一个结构化的“思维链”chain-of-thought将每一次视觉状态转换分解为可解释的组成部分任务目标层Task Goal Layer——推断状态转换的高层意图即 s_t 与 s_{t1} 之间应发生何种变化结合外部指令与观测到的视频内容动作细节层Action Detail Layer——将动作 a_t 分解为时空轨迹、微动作、速度及力等要素并强制明确标注视角信息如以自我为中心的主视角、腕部视角、外部视角或拼接的多视角组合物理反馈层——描述动作对环境产生的可观测后果如物体位移、形变、接触状态变化将每一次状态转换都建立在可验证的物理结果之上。基于上述分析生成两种粒度的动作描述详尽描述50–100词——完整定义“视角-智能体-动作-反馈”四元组为精确的状态转换预测提供丰富的动作信号简洁描述15–30词——仅保留“视角-智能体-关键动作”等核心要素使模型能够在推理阶段处理简短的高层指令。其实施四项质量控制原则操作聚焦仅限智能体动作与物体交互、视角定义明确视角类型与语义角色、客观性仅描述可见动态以及物理可验证性仅描述视觉上可验证的结果。在训练过程中以等概率各50%从详尽描述和简洁描述中进行采样从而使模型既能执行详细的轨迹规范也能执行简短的任务级指令。覆盖范围20多种机器人形态500多种动作类别。该框架适用于所有数据域。在机器人形态维度上涵盖了人手、七种机械臂配置单臂夹爪、双臂夹爪、单臂灵巧手、双臂灵巧手、移动双臂、半人形及全人形机器人、自车环视相机、行人/无人机以及移动导航智体——总计代表20多种不同的机器人形态数据源自RoboCoin涵盖三大结构类别的15种机器人模型、Robomind4种形态、InternData-A14种机器人模型、Groot-XE及其他各类数据集。在动作维度上该体系涵盖了源自训练数据集的 500 多种动作类别——仅 Agibot-World 就定义了 84 种不同的操作基元如抓取、推、倾倒、折叠、擦拭、切割等——并辅以来自其他操作数据集的独特基元以及移动与导航动作如转向、变道、航点追踪、避障等。这些动作被组织为四个层级(1) 操作基元(2) 长时程动作组合(3) 移动与导航以及 (4) 针对动态与可变形物体的交互。这种系统性的覆盖确保了由此生成的具身视频-文本对能够涵盖一个语义丰富且物理形态多样的动作空间这是单一领域数据集无法提供的。2 数据收集通用数据通用世界数据为模型掌握基本物理规律及构建精确的视觉表征奠定了基础。该类别涵盖了来自互联网的各类视频与静态图像。视频数据统一标准化为 24 FPS并支持多种分辨率及长宽比如 1:1、2:3、3:2、3:4、4:3、9:16、16:9 等。图像数据整合了高质量的静态照片作为视觉质量的基准确立了物体外观、材质纹理及空间构图的精确表征。所有通用数据均附有由 Qwen2.5-VLBai 等人2025生成的自然语言描述标注内容剔除了特定视角的细节信息以保持数据的灵活性与通用性。值得注意的是我们对人工智能生成内容AIGC持审慎态度通用数据不包含 AI 生成的图像或视频因为这类内容往往带有视觉伪影、物理不一致性及隐性偏差可能削弱模型的泛化能力。具身操作数据为了使世界模型能够在各种场景与任务中获得基于物理现实的理解其构建一个涵盖操作、驾驶、导航及跨具身迁移领域的数据集锦如表 1 所示。针对核心的操作领域从多具身Multi-Embodiment、多任务Multi-Task、多场景Multi-Scenario及多视角Multi-View四个维度对数据进行组织。多具身。操作数据涵盖了多种具身形态——包括人手、单臂夹爪、双臂灵巧操作系统、移动操作臂以及全身人形机器人——从而使模型能够学会将任务层面的意图与特定具身的运动学特性区分开来。人类操作数据如 EgoHOD [Pei2025]、EPIC-Kitchens [Damen2018]确立灵巧操作的性能上限模型通过观察具备物理交互能力的操作过程学习流畅的手眼协调与工具使用相关的先验知识。随后机器人数据则教导模型如何将同样的意图映射到各种不同的机械形态之上。通过让模型接触针对重叠任务的人类演示和机器人执行数据例如 Robomind [Wu et al., 2025a] 和 RoboCoin [Wu et al., 2025b]模型能够学习到“具身无关”的动作语义——即无论执行者是双指夹爪还是七指灵巧手都能预测“接下来会发生什么”的能力。多任务。操作数据集涵盖从原子级接触动作到长程多步流程的技能层级从而训练模型在多种时间粒度上进行操作。短程数据集如 Bridge V2 [Walke et al., 2023] 和 RH20T [Fang et al., 2024]提供了对基础交互原语如抓取、推动、插入的密集覆盖这些原语构成了模型对接触物理特性和物体affordance理解的基础。长程数据集如 Agibot-World [AgiBot-World-Contributors, 2025] 和 Galaxea [Galaxea AI, 2025]将这些原语串联成连贯的序列迫使模型在数十个步骤中保持状态追踪和因果推理能力。此外动态交互数据集如 Humanoid Everyday [Zhao et al., 2025]引入高速全身运动旨在测试模型在显著动量和平衡约束下预测结果的能力。这些数据的综合应用确保模型既能推理“在此处按压会发生什么”也能推理“在连续做出十个决策后会发生什么”。多场景。多场景覆盖沿着两个互补的维度推进1真实环境中的广度以及2向模拟器渲染场景的扩展。在第一个维度上物理交互的表现形式因环境而异——例如厨房台面在光照、杂物密度和表面特性方面与工厂车间或户外作业现场截然不同。因此操作数据主要来自真实世界涵盖了家庭厨房、车间、实验室和非结构化户外环境使模型能够接触到光照、遮挡、材质外观和背景复杂性等方面的真实变化从而避免模型因过度拟合单一环境而变得脆弱。在第二个维度上将照片级逼真的模拟数据如 InternData-A1 [Tian et al., 2025]作为一种同等重要的补充纳入其中。这一研究的背景源于 VLA领域的现状相当一部分策略模型是在仿真器中训练的且几乎所有模型都使用标准化基准如 LIBERO [Liu et al., 2023]、SimplerEnv [Li et al., 2024] 和 RLBench [James et al., 2020]在仿真环境中进行评估。因此旨在作为通用仿真底座的世界模型必须能够忠实地生成符合仿真器风格的外观与物理特性从而弥合真实观测与合成观测之间的视觉域差异以同时支持“从仿真-到-现实”sim-to-real的迁移和闭环评估流程。仿真部分还提供光照、物体姿态和摄像机位置的精确可控变化从而进一步增强视觉鲁棒性。多视角。单视角数据训练模型从固定视角预测合理的未来状态但许多对物理交互至关重要的事件在单一摄像机视角下往往会被部分或完全遮挡。同步多视角记录如 Agibot-World (2025) 和 Robomind Wu et al. (2025a)让模型能够同时从头戴式、腕戴式和外部视角观察同一事件。这具有双重作用在训练阶段跨视角的对应关系充当几何正则化项隐式地让模型学习物体的形状、深度及空间关系在推理阶段模型既可以基于任意单一视角生成内容也可以生成相互一致的多视角输出。在总计 600 万个具身智能样本中约有 160 万个包含 2 到 4 个视角的同步拼接数据这在不主导整个数据集的前提下提供了丰富的多视角监督信号。自动驾驶数据虽然操作类数据捕捉的是受限工作空间内细粒度的物体交互但自动驾驶数据则让模型接触到范围大得多的运动空间涵盖了各种驾驶动作如转弯、变道、加速以及更广泛的速度和轨迹范围。驾驶场景还包含丰富的多智体动态交互——即周围车辆、行人和骑行者在交通规则下的相互作用——这要求世界模型学习多个物体如何随时间推移进行移动、相互遮挡以及相互影响。此外摄像机的大幅度位移通过视差和透视变化为 3D 场景几何结构提供了密集的监督信号从而增强了模型的视角合成与空间推理能力。其从四个大规模数据集中精选了多视角驾驶视频Waymo E2E (Waymo Team, 2024)真实驾驶场景8个环视摄像头7,044个片段/11.3小时、NVIDIA PhysicalAI-AD (NVIDIA, 2025b)真实驾驶场景5个视场角为30°–120°的摄像头1,342,418个片段/1,715.9小时、Bench2Drive (Jia et al., 2024)CARLA模拟驾驶涵盖9,881种多样化交通场景6个摄像头384,948个片段/511.2小时以及 Sekai (Sekai Team, 2025)以自我为中心视角的行人步行及无人机视频9,995个片段/166.6小时包含场景与天气标注。这些驾驶数据总计包含1,744,405个片段时长达2,405小时。其采用统一的三阶段处理流程(1) 帧提取并将轨迹统一转换为通用的路点格式(2) 基于自车机动动作的转换将视频分割为动作片段时长2–8秒(3) 生成描述文字结合结构化轨迹描述与可选的视觉语言模型VLM增强。以自我为中心的室内导航数据以自我为中心的室内导航数据为操作数据和驾驶数据提供了互补的视角。操作任务侧重于有限工作空间内细粒度的物体交互驾驶任务则在室外大规模环境中进行相比之下室内导航要求模型理解房间尺度的空间布局、进行具备避障意识的路径规划并实现从文本导航指令到空间连贯视觉轨迹的映射。参考 VLNVerse (Lin et al., 2025) 的做法利用支持照片级真实感渲染和连续控制的 NVIDIA Isaac Sim (NVIDIA, 2022) 平台采集基于物理环境的以自我为中心的导航数据。收集了涵盖134个室内场景的6,064个成功导航片段每个片段包含一段以自我为中心视角的RGB视频分辨率256×256帧率10 FPS以及相应的自然语言导航指令。这些轨迹的平均长度约为8.2米范围在4至17.5米之间总行程距离约为49.8公里包含约5.8小时的连续第一人称导航视频。指令采用两种形式单字符串的分步指示3,031个片段平均长度67.2词以及涵盖正式、自然和口语化风格的多粒度描述3,033个片段。基于此类遍历数据训练出的视频生成模型能够展现出跨帧的涌现式3D一致性与空间连贯性Gao et al., 2026; Bar et al., 2025同时每个序列所具备的物理真实性与动作条件特性促使模型内化深度推理、几何一致性以及具备障碍物感知能力的规划能力Shang et al., 2025; Han et al., 2025; Zhen et al., 2025。通过将语言指令与连续的自我中心视角遍历过程相结合该数据集使世界模型能够在室内环境中协同学习语言理解、3D空间推理及具身动作预测。人机迁移数据为了在无需物理机器人采集的情况下训练模型学习跨形态cross-embodiment的视觉对应关系整理两类互补的人机迁移数据。第一类是基于第一人称双臂操作录像通过自动化流程构建的大规模人机配对数据集利用 MANORomero2017模型重建并提取 3D 手部关键点将其重定向为机器人末端执行器的轨迹通过视频修复技术去除画面中的人手利用 MuJoCoTodorov2012的逆运动学将 14 种机器人手臂模型渲染到修复后的场景中。由此每个操作片段episode生成四路对齐的视频流原始人类视频、去手场景、纯仿真场景以及机器人叠加场景。在同一场景下涵盖 14 种不同机器人形态的多样性确保了编辑能力能够泛化至各种机器人构型。第二类数据旨在解决直接渲染的一个根本局限简化渲染器往往忽略场景光照、投影以及与材质相关的镜面反射导致渲染图像与真实观测之间存在光度学差异。为弥合这一差距基于开源的 InternA1 数据集Tian2025进行构建该数据集利用 NVIDIA Isaac SimNVIDIA2022生成包含环境光照和精确阴影的光影逼真photorealisticRGB 观测数据。用相同的动力学参数和机器人 URDF 模型在 MuJoCoTodorov2012中渲染匹配的第一人称视角图像不含光照或阴影效果从而生成几何结构与视角完全一致、但在光度学逼真度上存在差异的配对样本。此类配对数据使模型能够学习简化渲染与光影逼真观测之间的视觉映射关系。该数据集涵盖 Franka Emika Panda、AgileX Split Aloha、ARX Lift2 和 AgiBot Genie1 等多种机器人涉及单臂、双臂、移动双臂及人形机器人等构型包含约 8 万个操作片段任务类型涵盖抓取放置、铰接物体操作及多物体重新排列。3 数据处理其设计一套统一的数据处理流程将来自各种具身智能平台及通用视频源的异构原始数据转化为高质量且格式统一的训练样本。如图2所示该流水线包含四个阶段(1) 原始数据采集(2) 视频预处理(3) 分层标注以及 (4) 结合提示词迭代优化的字幕质量筛选。第2和第3阶段根据源数据特性采用领域自适应操作而第4阶段则构成一个闭环反馈机制将质量不佳的字幕重新送回进行针对性重标注。阶段1原始数据采集该流水线首先从涵盖通用领域和具身智能领域的五类来源中获取原始视频数据。“通用视频”类数据提供了互联网规模的视觉多样性涵盖纪录片、专业素材库及精选网络片段。“操作数据”类涵盖了广泛的机器人形态——包括单臂夹爪、双臂系统、灵巧手、移动平台及人形机器人——数据源自EgoHOD、Bridge V2、DROID、RoboMind、Agibot-World等数据集。“自动驾驶”类数据提供了大规模的自车运动ego-motion及多智能体动态信息源自Waymo、Bench2Drive、NVIDIA PhysicalAI-AD及Sekai。“室内导航”类数据提供了基于语言引导的空间推理片段源自涵盖134个室内场景的VLNVerse。“人机迁移”类数据提供了成对的人类演示与机器人执行数据这些数据是通过我们自动化的MANO到机器人映射流水线构建的涵盖了14种机器人类型。阶段2视频预处理原始视频需经过领域自适应预处理以生成适合训练的统一结构化片段。根据源数据特性采用五种互补的操作帧提取。针对短时程任务视频通常为持续2–8秒的单步操作以特定目标帧率提取帧以捕捉交互的关键阶段——接近、接触、操作及结果——从而确保每个样本都包含原子动作的完整因果链。帧插值。当源视频帧率不足以支持平滑运动学习时采用时间插值来增加帧密度从而保留连续的运动轨迹这对建模细粒度接触动力学及物体状态转换至关重要。子任务切分。针对涉及多步骤流程的长时程片段例如连续的抓取与放置、复杂装配将视频分解为语义连贯的子任务片段。每个片段都涵盖一个具有明确起始与结束状态的完整原子动作从而避免因简单的均匀截断而产生的不完整执行伪影。主视图选择。对于仅需单一主要视角的“多机位”录制内容例如单视角操作训练选择信息量最丰富的摄像机流——通常是能最佳捕捉交互区域的第一人称视角egocentric view或外部视角external view——并舍弃冗余角度。多视图拼接。反之对于多视图联合训练将来自 2–4 个摄像机视角的同步片段拼接成单一的水平布局同时保持各视图间的时间对齐。这使得模型无需修改架构即可学习跨视图的几何一致性及同步的状态转换。阶段 3分层标注------分层标注提示词模板作为一位具身智能Embodied AI领域的专家级标注员。针对一段由 {{viewpoint_type}} 视角拍摄的、展示 {{embodiment_type}} 执行操作任务的视频片段需要生成以下五层标注内容。— 分析阶段 —第 1 层 – 任务目标识别此次交互的高层意图。智体agent试图实现什么目标请用一句话描述从当前观测状态到目标状态的预期状态转换。第 2 层 – 动作细节将智体的动作分解为分步序列。针对每一步明确说明(a) 运动轨迹与方向(b) 微动作如靠近、抓取、抬起、旋转、释放等© 预估速度与力度等级。必须明确指出所依据的视角第一人称 / 腕部 / 外部 / 多视图拼接。第 3 层 – 物理反馈描述每个动作对环境产生的可观测物理后果物体位移、形变、接触状态变化以及任何次生效应如液体晃动、布料折叠。仅包含视觉上可验证的结果。— 生成阶段 —第 4 层 – 综合描述50–100 词将第 1–3 层的内容整合为一段连贯的文字全面阐述“视角-智体-动作-反馈”这一四元组信息。内容应涵盖摄像机视角、智能体身份、完整动作序列及物理结果。第 5 层 – 简明描述15–30 词将其浓缩为指令式摘要仅保留“视角-智体-关键动作”这一核心要素使其适合作为世界模型的直接语言指令。质量约束• 操作重点仅描述智体动作及物体交互省略背景叙述。• 视角定义明确标明视角类型及其语义角色。• 客观性仅报告可见的动态变化不推断隐藏状态。• 物理可验证性所述的每一个结果都必须能从视频画面中直观确认。预处理后的视频将通过该五层分级标注框架的处理生成两种粒度的视角感知描述——详尽描述50–100 词和简明描述15–30 词——并在训练过程中以等概率进行采样。标注模型所使用的提示词模板如上所示。阶段 4描述质量筛选为了确保语料库中涵盖的各种场景、任务和具身形态下的标注质量实施一套结合自动评估与人工监督的闭环质量筛选系统。未通过质量检查的描述会被送回阶段 3 进行针对性重标从而形成一个迭代优化循环。评估流程Judge Pipeline。基于大语言模型LLM的自动评估器会从多个维度对每条描述进行评估包括事实准确性、具体程度、指令清晰度以及视角一致性。具体而言它会评估描述是否准确反映了视频内容、是否提供了超越笼统表述的充分细节、是否能作为可执行指令以及空间参照是否与摄像机视角保持一致。未能满足上述任一标准的描述将被标记以待进一步审查。人工评估。部分描述——特别是那些处于评估阈值边缘或来自样本稀缺领域的描述——将由人工标注员进行复核。他们负责验证准确性、识别系统性错误模式并提供作为“真值ground-truth”的修正内容从而指导后续的提示词优化工作。提示词迭代优化。当“评判流水线”judge pipeline识别出特定类别中持续表现不佳的情况时其会针对三个维度启动定向提示词prompt重构特定场景重试如户外光照条件、厨房环境、特定任务重试如关节物体操作、液体倾倒以及特定具身形态重试如人形双臂协同、灵巧手操作。每次重试均采用针对特定失败模式定制的提示词模板并由评判流水线对优化后的描述caption进行重新评估直至其达到质量标准。这种迭代循环机制确保了不会因采用“一刀切”的提示词策略而导致任何场景、任务或具身形态类别出现系统性的标注质量低劣问题。最终语料库统计。在完成四个阶段的处理流程后最终训练语料库包含约 860 万个视频-文本对涵盖超过 2 亿帧观测图像其中具身智能数据占比 70%通用数据占比 30%。在具身智能数据部分单视角操作数据占据主体约为 430 万个样本其次是约 160 万个多视角拼接样本包含 2 至 4 个同步摄像机视角以及约 20 万个导航与驾驶样本。1 模型架构如图3所示该模型由三个组件构成作为动作编码器action encoder的MLLM、作为状态编码器/解码器state encoder/decoder的VAE以及作为状态转移函数transition function的MMDiTEsser2024并采用双流double-stream设计。MLLM — 动作编码器。用冻结参数的Qwen2.5-VLBai2025将用户输入编码为条件信号。对于给定的输入文本S它提取最后一层的隐藏状态h φ(S)作为动作条件。VAE — 状态编码器/解码器。VAE将视频帧编码为潜表示z E(x)并将预测出的潜表示解码回视觉观测。采用Wan-VAEWan2025架构该架构同时支持图像和视频模态。MMDiT — 状态转移函数。MMDiT采用双流架构理解流understanding stream接收MLLM的编码h经由可训练连接器投影而生成流generation stream接收来自VAE的带噪状态潜表示。在每个模块block中两个流通过联合注意机制joint attention进行交互。主干网络包含60个双流模块具有24个注意头头维度为128、3072的隐层维度以及2×2的Patch大小。总参数量MLLM为7BVAE为127M编码器54M 解码器73MMMDiT为20B。上下文长度支持高达48,360个视频Token。2 3D旋转位置编码3D RoPE采用3D RoPESu2024Heo2024来独立编码时间、空间高度和空间宽度维度。不采用均匀分配维度的方式而是使用非对称划分时间轴分配16个维度高度和宽度各分配56个维度总计128个维度pe_axes_dim [16, 56, 56]。时间轴分配较少的维度是因为相邻帧之间存在强相关性空间轴分配了更多资源以捕捉物体位置和场景布局的高度多样性。还应用 Scalable RoPEWan2025以支持在推理阶段泛化至不同的分辨率和时长。3 Scene2Robot基于双流 MMDiT 架构和非对称 3D RoPE 编码其设计 SCENE2ROBOT。这是一种多片段条件控制机制旨在复用同一主干网络来实现跨具身cross-embodiment视频合成如图 4 所示。首帧条件控制TI2V 基线。对于标准的“文本图像转视频”任务首帧作为固定的视觉条件其 VAE 潜变量latents在生成流中被指定为时间步 t0 且不参与去噪损失计算同时冻结参数的 Qwen2.5-VL 将文本指令编码至理解流中。由于双流联合注意力机制在每一层融合了这两种信号生成 Token 能够同时关注视觉锚点和语义动作规范从而生成基于语言指令且在时间上连贯的后续视频内容。面向“人-到-机器人”迁移的多片段扩展。从人类到机器人的迁移构成了一个视频编辑问题模型既需要参考场景上下文背景、物体布局、光照也需要参考来自模拟演示的目标机器人运动轨迹。通过将首帧条件控制扩展为三片段输入序列来解决这一问题所有片段均在同一个 VAE-MMDiT 流水线中处理无需修改架构1. 场景条件F 帧原始人类演示视频已遮挡人类手部经 VAE 编码以提供外观、空间布局和物体状态信息。2. 机器人参考F 帧通过 MuJoCo 渲染的模拟机器人执行过程经 VAE 编码提供目标具身的运动学轨迹和形态特征。3. 生成片段F 帧待去噪的噪声潜变量最终生成逼真的机器人执行视频。片段 (1) 和 (2) 采用与首帧条件控制相同的 t0 设置且不参与损失计算仅片段 (3) 在训练过程中接收梯度更新。 3D RoPE 编码为每个片段分配了独立的时序索引范围使模型能够区分不同片段间的时序位置。随后每个 MMDiT 模块中的联合注意机制joint attention使得生成 Token 能够同时关注来自片段 1) 的场景外观、来自片段 (2) 的机器人运动以及来自理解流understanding stream的 MLLM 动作语义。这种三方条件约束使模型能够合成逼真的机器人执行动作并忠实地保留场景上下文与指令所要求的操作行为。1 训练策略提出一种联合训练范式将通用场景生成与机器人操作预测统一为同一个基于自然语言接口的条件视频生成任务使模型在整个训练过程中持续接收来自两类数据源的梯度更新。这种统一的表述方式允许通用世界先验与具身动作先验通过共享的主干网络相互增强从而实现跨场景、跨任务的稳定联合训练。训练过程分为两个渐进阶段预训练阶段建立广泛的世界知识基础而监督微调SFT阶段则在保持通用能力与专家能力平衡的同时深化具身领域的专业化能力。预训练阶段建立通用世界基础通用世界先验。从14个高质量视频平台精选超过2亿个真实世界观测样本涵盖自然场景、日常生活及体育运动等领域。这种广泛的数据覆盖使模型能够内化与特定领域无关的世界先验知识——如物体运动、光照变化及碰撞动力学——从而构成了后续具身泛化能力的通用主干。此外引入多相机同步观测数据并结合3D RoPE空间编码建立了初步的跨视角几何一致性为多视角具身生成奠定了空间基础。人类交互先验。引入大规模的第一人称手部操作数据如Ego4D、EPIC-Kitchen等。人类演示充当通用能力与具身能力之间的天然桥梁通过学习日常生活中的抓取、工具使用及物体操作模型构建动作先验和对物体affordance的理解这些能力可直接迁移至后续阶段的机器人操作任务中。多任务联合训练。T2I文生图、T2V文生视频和TI2V图文生视频任务在共享主干网络上进行联合训练这是实现通用能力与具身能力在单一模型中共存的核心机制。T2I任务利用通用图像数据学习清晰的视觉表征作为视觉质量的基准其习得的物体形态知识通过共享主干网络自动迁移至视频生成任务从而有效避免了物体变形及身份特征不一致的问题。任务配比从纯T2I训练逐渐过渡到三项任务的全面联合训练确保模型在预训练结束时能够稳定地在多种生成模式下运行。SFT 阶段具身专用化SFT 阶段在每个训练批次中保留通用世界数据的同时逐步深化具身专业知识确保具身专用化能力与通用世界建模能力协同提升而非此消彼长。渐进式具身知识注入。采用四阶段数据混合策略。在训练初期多具身机器人数据与人手操作数据共同占据主导地位人类动作先验引导模型学习跨具身操作的共性而机器人数据则强化具体的执行表征。随后逐渐增加腕部视角和第三人称视角的数据以扩大视角的覆盖范围。在此基础上引入多视角拼接训练将来自多个摄像头的同步首帧在空间上拼接为单一输入要求模型同时生成所有视角的后续帧从而迫使注意力层建立跨视角的空间对应关系实现几何一致的多视角生成。在最后阶段针对稀缺的高复杂度任务如倾倒、折叠、双臂协作、多材质交互及长程推理数据进行补充以拓展具身能力的边界。在整个过程中通用世界数据持续参与每个训练批次与具身数据共同作用于同一主干网络确保具身专用化与通用世界建模能力同步发展。2 训练目标与基础设施采用流匹配flow matching目标函数Lipman et al., 2023; Liu et al., 2022其中输入视频通过 VAE 编码器编码至潜在空间噪声则从标准正态分布中采样。Qwen2.5-VL 将文本输入编码为引导信号。时间步长采样自对数正态分布并根据视频序列长度进行自适应偏移调整Esser et al., 2024。对于 TI2V 任务首帧的时间步长固定为 0以确保生成过程基于给定的观测帧进行条件化。训练基于 Megatron-LMShoeybi et al., 2019采用混合并行策略进行并对部分双流dual-stream模块应用选择性激活重计算selective activation recomputationKorthikanti et al., 2023以平衡显存占用与训练吞吐量。基准测试EWMBenchYue2025从三个维度评估具身世界模型场景一致性SceneC、运动正确性HSD、Dyn、nDTW以及语义对齐多样性、BLEU、CLIP、逻辑性。该基准测试包含 7 个任务下的 21 个样本这些任务具有明确的动作顺序约束。DreamGen BenchZhou2025评估由视频世界模型生成的机器人视频质量针对 GR1 机器人具身形态的三个子集——环境泛化GR1-Env、物体泛化GR1-Object和行为泛化GR1-Behavior——衡量指令遵循IF和物理对齐PA能力。其中IF 评估采用 Qwen2.5-VLBai2025作为评估器。PBenchNVIDIA2025a从两个互补的方面评估模型(1) 领域得分Domain Score通过 Qwen2.5-VL 评估的问答QA对衡量模型对六大领域自动驾驶、机器人、工业、物理、人类、常识中物理行为的理解(2) 质量得分Quality Score利用 VBenchHuang2024的八项指标包括图-视频一致性、美学质量、运动平滑度、主体一致性等衡量视觉质量。综合得分Overall Score为上述两项得分的平均值。WorldModelBenchLi2025从三个维度评估模型指令遵循0–3 分制、常识帧质量与时间质量以及物理规律遵循涵盖 5 种违规类型牛顿定律、质量守恒、流体动力学、穿模现象、重力。该基准测试包含 7 个领域及 56 个子领域下的 350 个实例。