
从视频模型到决策世界模型进入 Agent 与机器人闭环前的证据门槛TL;DR场景视频模型能生成逼真、连贯、可控的画面但要把它放进 Agent / 自动驾驶 / 机器人决策闭环并称为可用于决策的世界模型需要的是另一组证据。结论本文提出 L0—L5 的工程证据梯子视觉可接受 → 状态可读 → 动作敏感 → 持久与反事实一致 → 不确定性可用 → 闭环决策增益 五项核心测试 校准与失效检测硬门槛 谨慎的公开写作表述。产出三类世界模型表示/预测/决策的最低可检验要求表 6 级证据梯子 5 项核心测试动作交换 / 实体持久 / 多步误差 / 反事实排序 / 闭环规划 Sora / GAIA-1 / GAIA-2 / Cosmos / Genie 证据阅读指南 4 类常见误判 7 行避免 / 建议表述对照。版本矩阵维度状态说明经典世界模型定义表示 / 预测 / 决策✅ 已验证三类定义并不共享同一验收口径只有决策型对本文问题必需动作条件化L0 视觉可接受✅ 已验证样本在目标分辨率、时长、场景下无明显崩坏只证明可生成L1 状态可读且非平凡✅ 已验证需时间打乱 / 标签泄漏 / 浅层特征 / 等容量基线对照探针强不等于状态完整L2 动作敏感且方向正确✅ 已验证固定历史与随机因素只替换动作定义动作影响比 I d(ŝ) / (d(a) ε)L3 持久 / 多步 / 反事实一致✅ 已验证实体保持率、状态事件 F1、Spearman / Kendall、Top-k 命中率、选择后悔值L4 不确定性可用✅ 已验证Brier Score / NLL / 可靠性曲线 / ECE / 预测区间覆盖率 / coverage-risk 曲线L5 闭环决策增益✅ 已验证固定预算下与无模型 / 规则 / 其他预测模型 A/B多个随机种子与扰动下成立OpenAI Sora 技术报告✅ 已验证描述为大规模视频模型通向物理世界模拟器的有前景路径定性评估为主列出基础物理 / 状态改变 / 长时一致性 / 物体凭空出现等限制Sora 提供的能力证据✅ 已验证三维一致性 / 遮挡后物体保持 / 简单状态变化 / Minecraft 控制Wayve GAIA-1✅ 已验证视频 文本 动作输入生成驾驶场景报告对自车行为细粒度控制Wayve GAIA-2✅ 已验证多视角 / 多摄像头 / 多道路状况 / 极端案例条件包括自车行为 / 环境 / 道路配置视频标记器 潜变量扩散世界模型NVIDIA Cosmos✅ 已验证定位为 World Foundation Model 平台提供视频整理 / 预训练模型 / 后训练示例 / Tokenizer可后训练适配 Physical AIDeepMind Genie 2✅ 已验证由图像 文本生成可交互 3D 世界键盘 / 鼠标动作可控可记忆视场外部分Genie latent action✅ 已验证从无动作标签互联网视频学习潜动作但 latent action 未必与真实执行器一一对应“视频逼真 决策准确”❌ 不成立视觉分布与决策效用是两套证据必须分别测候选排序与闭环收益“支持相机控制 理解动作后果”❌ 不成立相机轨迹改变观察坐标不一定改变环境状态判定物理动作敏感性时必须固定或显式建模相机“能生成一分钟长视频 持久世界状态”❌ 不成立长度只说明输出范围必须验证遮挡后身份、不可逆事件和状态账本“加入 Action Token 模型使用了动作”❌ 不成立接口存在不代表信息被利用动作交换 / 动作屏蔽 / 梯度归因对照才能验证“多 Seed 不确定性覆盖”❌ 不成立采样产生多个候选候选频率是否校准、是否覆盖危险模式需要另测“样片物理感强 可规划”❌ 不成立规划需要候选排序、概率校准和闭环增益单条成功样片无法估计失败概率摘要视频模型能生成可控画面只说明它学到部分视觉统计规律。要成为决策世界模型还需证明动作会改变预测、任务状态可持续、反事实可比较、失效可校准并在固定预算与安全约束下改善真实决策。关键词World Model、Video Model、Action Conditioning、Counterfactual、Decision Utility目录核心结论三类世界模型必须先分开为什么视觉逼真度不构成决策证据从视频质量到决策效用本文的工程证据梯子五项核心测试校准与失效检测是硬门槛如何阅读 Sora、GAIA、Cosmos 与 Genie 的证据四类常见误判适合公开写作的谨慎表述结语FAQ核心结论视频模型能生成逼真、连贯、可控的画面只能证明它学到了一部分视觉统计规律。要把它放进 Agent、自动驾驶或机器人决策闭环并称为可用于决策的世界模型还需要另一组证据模型对真实动作语义敏感能维护与任务相关的持久状态能在多步反事实中比较动作后果知道预测何时不可靠并且在固定资源与安全约束下确实改善规划或控制结果。这不是给整个世界模型领域制定唯一词典。不同研究传统对 world model 的定义并不相同有些关注内部状态表示有些关注未来预测有些直接服务强化学习。本文只解决一个更窄的工程问题当团队准备让视频模型参与动作选择时怎样避免把视觉能力误当成决策能力。三类世界模型必须先分开类型最低可检验要求动作是否必需典型用途不能由什么单独证明表示型世界模型网络内部存在可检验、非平凡的环境状态表示计算确实经由该表示完成不必需表征分析、状态抽取、迁移一段逼真视频或一个高探针分数预测型世界模型根据历史状态或观察预测未来状态、观察或事件分布不一定被动环境也可无动作预测预测、模拟、异常预警单帧重建或只会复制最近帧决策型世界模型建模候选动作的后果并使策略评估、规划或控制获得可测收益对本文问题而言必需Model-based RL、机器人规划、自动驾驶决策仅有动作输入接口、相机控制或长视频生成[F-P01] Li、Viégas 与 Wattenberg 提出一组操作性标准用来判断神经网络是否形成并使用了世界状态的潜表示该工作明确把动作效果留给后续研究。这正好说明不能断言所有世界模型定义都要求动作条件化。[F-P02] Ha 与 Schmidhuber 的 World Models 学习环境的压缩时空表示并可让策略在模型生成的梦境中训练后迁回环境。这里的世界模型价值不只在生成画面而在于它成为策略学习的环境接口。[F-P03] MuDreamer 进一步展示像素重建并不等同于任务相关表征重建目标可能迫使模型编码无关视觉信息在干扰背景下反而遗漏任务关键要素。由此不能用重建更清晰直接推导决策状态更完整。为什么视觉逼真度不构成决策证据视频生成目标通常要求从条件分布中产生看起来合理的样本。对开放世界而言同一历史之后可能有许多合理未来一个样本只要视觉上成立并不需要准确回答动作 A 与动作 B 的后果差多少。决策系统却必须比较候选动作并在代价、风险和不确定性之间排序。这里至少存在五个缺口。第一相关性不等于动作因果性。训练数据中方向盘左转常与画面左移共现模型可能依赖背景、路线或相机信号而没有学到可迁移的车辆动力学。第二局部连贯不等于持久状态。物体在十几帧内外观稳定不代表它在遮挡、出画、碰撞或状态改变后仍保持身份、位置、库存、开关或损伤状态。第三一个合理样本不等于正确分布。规划器需要知道失败概率、尾部风险和多个可能结果而不是只看到最顺眼的一条未来。第四生成可控不等于控制可执行。相机平移、文本指令或抽象 latent action 能改变画面不代表条件与真实执行器命令具有稳定对应关系。第五离线预测分数不等于闭环收益。即使模型在数据集上预测准确规划器也可能利用其系统性偏差挑出在模型里得分高、现实中却失败的动作。从视频质量到决策效用本文的工程证据梯子以下阶梯是本文提出的工程验收框架不是对整个学术领域的唯一分类。每一级都回答一个不同问题不能跨级替代。L0视觉可接受。样本在目标分辨率、时长和场景中没有明显崩坏。它只证明模型可生成不证明内部状态或动作语义。L1状态可读且非平凡。从内部表示可恢复任务状态如对象身份、姿态、可见性、接触、门是否打开。必须设置时间打乱、标签泄漏、浅层特征和等容量基线避免探针很强只是探针自己完成任务。L2动作敏感且方向正确。固定历史和随机因素只替换动作预测应在合理延迟后沿正确方向变化无关动作维度不应制造大幅变化动作也不能被模型忽略。L3持久、多步、反事实一致。模型能维护实体状态长 Rollout 的任务误差可测且增长受控并能对多个候选动作给出稳定后果排序。L4不确定性可用。预测概率经过校准分布外输入能触发拒绝、降级或扩大安全裕度模型知道没有证据与确定安全的差别。L5闭环决策增益。在同等数据、计算、候选数、控制周期和安全门禁下使用该模型的规划器比无模型或替代模型更成功、更安全或更高效且收益在未见场景中保持。团队若只通过 L0应称视频生成模型通过 L1 或部分 L3可以谨慎称形成了某些世界状态表示或具有预测性只有对目标动作空间完成 L2—L5才有充分工程理由称其为用于该任务决策的世界模型。这个称呼必须绑定任务、动作接口和评测分布不能写成无条件身份认证。五项核心测试一、动作交换测试构造相同历史 (h_t)、相同随机噪声或采样轨迹只替换候选动作 (a_t)。动作必须来自真实控制合同例如转向角、末端位姿增量、关节目标或离散技能而不是模糊文本向左一点。对每对动作记录三类量预测状态差是否出现、出现方向是否与动力学或真实数据一致、响应延迟是否合理。可以定义动作影响比[I\frac{d(\hat{s}_{tk}{a_i},\hat{s}_{tk}{a_j})}{d(a_i,a_j)\epsilon}]但单一数值不足以判定好坏影响过小可能表示动作被忽略影响过大也可能表示模型对微小控制过敏。还要加入无效动作、相同动作不同历史、只改相机参数和只改执行器命令的对照排除模型把视觉控制当物理控制。二、实体持久测试选择需要记忆的实体和属性物体身份、相对位置、是否已抓取、容器内容、门锁状态、车辆损伤等。让实体短暂遮挡、离开视野或跨镜头后重新出现比较预测与真实状态。指标应包含身份保持率、状态事件 F1、重现位置误差、非法状态逆转率。例如杯子已被放入封闭抽屉后模型不能因为画面看不见就让它在桌面重新出现。视觉相似度高但状态账本错误对规划仍是致命失败。三、多步误差曲线从真实历史启动连续 Rollout 多个决策步分别在每一步使用真实观察纠正与完全开环两种模式。按预测步长绘制位置、姿态、接触、事件、占用和任务进度误差而不只用像素指标。需要报告平均误差之外的分位数、灾难事件率和误差增长形态。一个模型可能前三步准确、之后突然身份交换另一个模型像素稍模糊却能保持可用于规划的占用和接触状态。对决策而言后者可能更有价值。四、反事实排序测试对同一状态给出候选动作集合用模型预测成功率、代价或风险再与真实执行、可信仿真或离线反事实近似比较。重点不是每条视频是否逼真而是动作排序是否正确。可报告 Spearman 或 Kendall 排名相关、Top-k 命中率、选择后悔值和危险动作漏判率。必须覆盖接近决策边界的候选而不是明显正确对明显错误的简单样本。若模型能生成每个候选的漂亮视频却把碰撞动作排在安全动作之前它不能承担规划评分器。五、闭环规划测试把模型接入真实规划器或严格的闭环仿真固定候选预算、规划频率、传感器输入、控制器、安全层和计算资源与无模型策略、规则模型、其他预测模型进行 A/B 对比。记录任务成功率、碰撞与近失、人工干预、超时、规划耗时、重规划次数、分布外拒绝率和恢复成功率。特别防止规划器钻模型漏洞候选在模型内得分持续升高但真实回报下降。只有闭环收益在多个随机种子、场景和扰动下成立才能把预测能力转化为决策证据。校准与失效检测是硬门槛决策模型必须输出或派生可检验的不确定性。对离散事件可用 Brier Score、NLL、可靠性曲线和 ECE对连续状态可检查预测区间覆盖率对风险选择可画 coverage-risk 曲线随着模型拒绝更多低置信样本剩余样本风险是否确实下降。生成多个 Seed 不能自动视为概率校准。样本可能高度相关、漏掉关键模式或因采样器温度产生与现实随机性无关的变化。需要验证样本频率是否对应真实事件频率并区分数据随机性、模型无知与采样噪声。分布外检测也不能只用一个置信度字段必须测试新对象、新动力学、新天气、传感器异常和动作越界时系统是否可靠转入拒绝、保守规划或人工接管。如何阅读 Sora、GAIA、Cosmos 与 Genie 的证据[F-O01] OpenAI 的 Sora 技术报告把结果描述为大规模视频模型通向物理世界模拟器的有前景路径并明确说明报告以定性评估为主、未给出完整模型与实现细节。报告展示了部分三维一致性、遮挡后的物体保持、简单状态变化和 Minecraft 控制同时也列出基础物理、状态改变、长时一致性和物体凭空出现等限制。准确结论是Sora 提供了规模化视频学习可能产生模拟能力的证据不是面向机器人规划的决策世界模型验收。[F-P04] GAIA-1 使用视频、文本和动作输入生成驾驶场景并报告对自车行为的细粒度控制GAIA-2 进一步使用自车动力学、其他交通参与者、环境和道路语义等结构化条件生成多视角场景。[F-P05] 这些工作比纯文本视频模型更接近动作条件预测但是否可用于具体规划仍应按动作交换、反事实排序、校准和闭环收益逐项验证不能仅凭论文自称 world model 就跳过验收。[F-P06] Cosmos 将 World Foundation Model 定位为可经后训练适配到具体 Physical AI 场景的平台并同时提供视频整理、预训练模型、后训练示例和 Tokenizer。它说明通用视频基础模型与下游定制世界模型之间仍有适配层而不是下载权重即可承担决策。[F-P07] Genie 从无动作标签的互联网视频中学习潜动作并允许用户逐帧控制生成环境。这证明无监督视频中可以提取交互结构但 latent action 未必与真实机器人的关节、力、速度或安全约束一一对应。把 latent action 映射到执行器仍是独立问题。四类常见误判“支持相机控制所以理解动作后果。”相机轨迹改变观察坐标不一定改变环境状态。判定物理动作敏感性时必须固定或显式建模相机。“能生成一分钟长视频所以有持久世界状态。”长度只说明输出范围必须验证遮挡后的身份、不可逆事件和状态账本而不是只看局部连贯。“加入 Action Token所以模型使用了动作。”接口存在不代表信息被利用。动作交换、动作屏蔽和梯度归因对照才能发现条件被忽略或被捷径替代。“样片物理感很强所以可以规划。”规划需要候选排序、概率校准和闭环增益。单条成功样片无法估计失败概率更无法说明模型不会被规划器利用。结语世界模型不应成为视频模型升级后的营销后缀。对表示研究内部状态是否可检验是核心对预测研究未来分布是否准确是核心对决策系统唯一有工程意义的问题是模型能否在真实动作合同下可靠比较后果并让闭环系统做出更好的决定。因此视频质量只是起点。动作交换检验因果敏感性实体持久检验状态账本多步误差检验 Rollout 稳定性反事实排序检验规划价值闭环 A/B 检验最终收益校准与失效检测决定系统是否知道何时退出。只有这些证据被限定在具体任务、动作空间和风险预算内团队才有资格把会生成世界的画面升级为能参与世界中的决策。FAQ世界模型一定要有动作输入吗不一定表示型和部分预测型定义可以不含动作但面向决策的模型必须证明动作条件具有可用语义。FVD 或视觉相似度高为什么还不够它们主要衡量视觉分布不能证明模型保留了任务状态、反事实排序或控制收益。先做哪组最小实验固定同一初态只改变动作并检查未来变化是否稳定、可解释且与真实环境一致。错误速查卡症状根因定位修复模型生成画面很逼真就宣布可用于决策视觉分布与决策效用被等同未做 L2—L5 验收检查证据梯子L0 通过但 L1 探针、L2 动作交换、L3 持久、L4 校准、L5 闭环是否独立完成按 L0—L5 逐级验收通过 L0 只应称视频生成模型加入 Action Token 后未做动作交换就直接用接口存在 ≠ 信息被利用模型可能把动作当捷径忽略固定历史与随机因素只换动作记录预测状态差、方向、响应延迟增加无效动作、相同动作不同历史、只改相机参数对照用动作影响比 I d(ŝ) / (d(a) ε) 配合把高 FVD / 高视觉相似度当决策证据FVD 主要衡量视觉分布与任务状态、反事实排序、控制收益无直接关系检查指标FVD 高但 L1 状态保持、L3 反事实排序、L5 闭环增益是否独立通过把指标拆为视觉分布 状态保持 反事实排序 闭环增益按任务相关测“支持相机控制 理解动作后果”相机轨迹改变观察坐标不一定改变环境状态判定物理动作敏感性时是否固定或显式建模相机固定相机参数重复动作交换测试把相机控制与执行器命令分开对照“能生成一分钟长视频 持久世界状态”长度只说明输出范围状态账本未验证实体保持率、状态事件 F1、重现位置误差、非法状态逆转率加入遮挡 / 出画 / 跨镜头重现检查不可逆事件是否被覆盖“样片物理感强 可规划”单条成功样片无法估计失败概率规划需排序、校准、闭环模型能生成每个候选的漂亮视频但 Spearman / Kendall 排名相关差、Top-k 命中率低、选择后悔值高用反事实排序测试 闭环 A/B不要只比较单条视频“多 Seed 不确定性覆盖”采样产生多个候选样本可能高度相关、漏掉关键模式、采样温度无关验证样本频率是否对应真实事件频率区分数据随机性、模型无知、采样噪声用 Brier Score / NLL / 可靠性曲线 / ECE / 预测区间覆盖率 / coverage-risk 曲线规划器挑出在模型里得分高、现实中失败的动作离线预测分数 ≠ 闭环收益规划器可能利用模型系统性偏差闭环 A/B 任务成功率、碰撞与近失、人工干预、超时、重规划次数、分布外拒绝率固定预算下多随机种子、场景、扰动 A/B防钻模型漏洞探针很强但状态完整度其实很差探针很强只是探针自己完成任务未设置时间打乱 / 标签泄漏 / 浅层特征 / 等容量基线L1 状态可读是否设了对照加入时间打乱、标签泄漏、浅层特征、等容量基线避免探针自完成任务模型前三步准确之后突然身份交换持久 / 多步误差增长未受控分位数与灾难事件率未报告多步误差曲线是否包含分位数、灾难事件率、误差增长形态报告分位数 灾难率 增长曲线必要时降任务或换模型OOD 输入下模型仍给高置信预测不确定性未被使用分布外检测只用一个置信度字段测试新对象 / 新动力学 / 新天气 / 传感器异常 / 动作越界时是否触发拒绝失效门禁OOD 识别 → 概率校准 → 不可靠时拒绝 → 退回真实观测或保守控制反事实排序把碰撞动作排在安全动作之前模型生成每个候选的漂亮视频但动作排序错误排名相关、Top-k 命中率、选择后悔值、危险动作漏判率复盘是否覆盖接近决策边界的候选不只测明显正确对明显错误把 Sora / Genie 演示当作规划器验收依据演示是定性评估不证明动作合同下的稳定对应报告是否给出完整模型 / 实现 / 量化指标 / 闭环 A/B把演示当规模化视频学习可能产生模拟能力的证据不是决策世界模型验收把加入动作接口等同于决策型世界模型表示型 / 预测型 / 决策型验收口径不同只有决策型对本文问题必需动作三类世界模型最低可检验要求是否分别通过按表示 / 预测 / 决策三类分别验收只通过表示型不应称决策型Cosmos 等通用 WFM 被直接接入规划器通用视频基础模型与下游定制世界模型之间仍有适配层是否经过后训练适配具体 Physical AI 场景适配层不能跳过用业务数据后训练并按 L2—L5 逐级验收latent action 被直接映射到执行器命令latent action 未必与真实机器人关节、力、速度或安全约束对应映射关系是否经过显式测试与安全门禁把 latent action 映射视为独立问题不能默认其可执行闭环收益只在一个场景 / 随机种子下成立闭环 A/B 未在多随机种子、场景和扰动下复测闭环测试矩阵是否覆盖未见场景与扰动在多个随机种子 场景 扰动下做闭环 A/B不通过不能称决策增益公开写作用理解物理世界 / 通用世界模型视频质量 ≠ 决策效用用词超出证据是否引用证据梯子中具体证据改用在若干样例中表现出 X范围仍需任务化评测 / “通过了哪些门槛” 等表述作者武子康的个人博客