
写在前面【从零走向AGI】旨在深入了解通用人工智能AGI的发展路径从最基础的概念起逐步构建完整的知识体系。项目地址https://github.com/AI-mzq/From-Zero-to-AGI.git魔方AI空间猫先生从零走向AGI面试面经AIGC算法岗/开发岗面试面经交流社群涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源欢迎大家加入https://t.zsxq.com/YtJ09导读具身任务同时需要两种节奏低层控制要快速、连续地生成动作长程任务又要求机器人理解场景、规划步骤、发现失败并回应人类。常见双系统方案把两者交给不同模型VLM 负责慢速推理VLA 负责快速执行。两个模型彼此不了解能力边界高层可能给出低层无法执行的指令云端 VLM 的延迟还会让指导落后于现场状态。OneTwoVLA把 System One 与 System Two 放进同一个模型。它先预测一个决策 token[BOA]表示直接生成动作[BOR]表示更新自然语言推理。大部分时间走 acting mode只在子任务完成、动作失败或需要人类输入等关键节点进入 reasoning mode。最新推理内容会继续作为后续动作的条件。训练侧同样分成两部分机器人轨迹被切成 reasoning interval 与 acting interval并补上场景描述、整体计划、历史摘要和下一步动作另一条自动化管线用 Gemini 2.5 Pro、FLUX.1-dev 合成 1.6 万条带具身推理的视觉语言数据与机器人数据共同训练。实验覆盖长程任务、错误恢复、人机交互和开放世界视觉指代。猫先生认为OneTwoVLA 的技术重点不是让 VLA 输出更多思维文本而是让推理发生的时机也成为策略要学习的决策。统一模型减少了高低层之间的接口错位但[BOR]何时出现仍依赖人工设计的训练区间这也是它离真正自主分配计算量还差的一步。论文标题OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive ReasoningOpenReviewhttps://openreview.net/forum?idtWMfhoP3asarXivhttps://arxiv.org/abs/2505.11917项目主页https://one-two-vla.github.io/GitHubhttps://github.com/Fanqi-Lin/OneTwoVLA数据集https://huggingface.co/datasets/Richard-Nai/onetwovla-dataset图 1原论文 Figure 1。OneTwoVLA 在长程执行中多次生成动作只在场景变化、子任务边界等节点更新场景描述、计划、历史摘要和下一步指令。原文脉络第 1 节从双系统的协同与延迟问题出发第 2 节将工作放在 VLA、机器人推理和视觉语言共同训练三条研究线上。第 3 节依次介绍统一框架、带具身推理的机器人数据整理以及可扩展的视觉语言数据合成管线。第 4 节沿四种能力展开真实机器人实验长程规划、错误检测与恢复、人机交互、视觉指代。第 5 节总结方法并把人工推理区间、推理暂停和规模化推理效率列为主要限制。1-2. 背景与相关工作双系统的接口为何会失配平坦式 VLA 可以根据图像和指令直接生成动作但缺少显式任务状态容易在长程执行里重复步骤或忘记进度。双系统方案用 VLM 生成子任务再让动作模型执行显式规划能力更强却引入了两个独立模型之间的语义接口。接口失配包含两类问题。其一高层模型不知道动作策略的训练分布可能要求不存在的物体或低层没学过的技能。其二高层推理存在时延等新指令返回时机械臂可能已经进入不同状态旧计划因此变成分布外输入。固定频率调用 VLM 还会在无需重新规划的动作阶段浪费时间。π₀.₅ 等统一模型会在动作前预测子任务ECoT-Lite 则尝试在测试时省去推理。OneTwoVLA 选择保留显式语言推理同时让同一模型判断何时更新它从模型边界和计算频率两侧处理失配。3. 方法与核心架构同一个模型学会[BOR]与[BOA]3.1 统一策略先决定模式再生成推理或动作每个时间步的输入包括当前多相机图像、最近一次推理时刻的参考图像、任务指令和最新推理内容。acting mode 还会接收机器人本体状态。模型先预测决策 token[BOR]Beginning of Reasoning自回归生成新的推理文本直到[EOS]同时把当前图像保存为新的参考图像[BOA]Beginning of Action调用 action expert 生成一个 action chunk并在环境中执行。推理文本包含场景描述、计划、已完成步骤和眼前该做的动作。参考图像与这段文字属于同一时刻可以缓解旧描述与当前画面不一致的问题。任务结束由推理内容中的Task Finished表示。图 2原论文 Figure 3。VLM 分支同时负责模式决策和文字推理选择[BOA]后action expert 根据图像、状态和最近推理生成连续动作块。具体实例以π₀为基础。VLM 用交叉熵学习决策 token 与推理文本action expert 延续 π₀ 的 flow matching 损失来建模连续动作分布。两种输出共享视觉语言主干因此推理内容与动作模型不再通过外部 API 拼接。猫先生认为[BOR]/[BOA]把“是否值得重新思考”转成了一个轻量分类问题而昂贵的文本生成只在[BOR]后发生。这个接口很简洁但动作仍会忠实服从错误推理统一性提高了推理对动作的约束力也放大了错误推理的后果。3.2 自适应推理如何获得监督普通机器人数据只有 observation-action 对没有“应该何时思考”的标签。作者先把专家轨迹切成两类区间Reasoning interval位于任务开始、子任务完成、失败恢复或人机交互附近。旧推理失效时监督[BOR]和新推理推理更新后再监督[BOA]与动作。Acting interval覆盖连续执行阶段主要监督[BOA]和动作。由于 acting 区间远多于 reasoning 区间训练中还可补充部分“旧推理应触发[BOR]”的样本缓解二分类不平衡。推理内容固定为四部分与任务相关的场景描述、分解后的高层计划、记录已完成步骤的历史摘要、当前的下一步指令。错误恢复数据额外说明失败状态与纠正策略交互数据把机器人的提问和人的回答追加到指令上下文。标注管线分两阶段运行。Gemini 2.5 从每条轨迹均匀抽取的 32 帧中识别子任务边界再以区间中点图像生成四类推理字段。Tomato-Egg 任务的人工抽查中81.5% 的区间标注被判为正确83.3% 的场景描述被判为合理。自动标注降低了成本但仍保留约两成可见噪声。3.3 合成 1.6 万条具身视觉语言数据机器人示范可以教会模型执行已有任务却很难覆盖开放世界物体和新指令。合成管线先让 Gemini 2.5 Pro生成多样的桌面场景描述再由 FLUX.1-dev 生成图像图像随机加入鱼眼畸变、机械夹爪合成和亮度适配缩小与腕部相机画面的外观差异。Gemini 最后为每张图生成任务指令与推理答案。图 3原论文 Figure 15。每行依次为原始合成图、另一合成视角、加入鱼眼畸变与夹爪后的图像以及二者共同使用的版本。1.6 万条样本分为两类。视觉指代要求从空间关系、属性或语义描述中定位对象并在推理里明确对象名称与位置长程规划给出多步目标要求生成逐步计划部分样本还加入人机交互。OneTwoVLA-VL 将这些数据与原子技能机器人数据共同训练用视觉语言监督激活预训练主干中的常识与开放词汇能力。这条数据路线并不教连续控制合成图也没有真实动力学。它提供的是“看懂场景—明确目标—形成计划”的监督动作落地仍依赖真实机器人示范。3.4 推理时延是否破坏闭环控制图 4原论文 Figure 2。OneTwoVLA 的 Tomato-Egg 总时长为 184 秒接近无语言推理的 π₀176 秒明显短于固定调用 Gemini 的双系统260 秒。acting mode 在 RTX 4090 上约需 0.102—0.104 秒低于 0.2 秒的动作生成周期。reasoning mode 会随文本变长20、100、200 个输出 token 分别约需 0.853、2.346、4.361 秒。Tomato-Egg 的一个 rollout 中模型推理 5 次、合计 16 秒占总时长 8.7%Mountain Fuji 的推理占比约 10.4%。自适应触发降低了总开销但每次长推理仍会让机器人原地暂停数秒。4. 实验结果推理、恢复、交互与开放世界泛化4.1 长程任务规划三项真实任务覆盖不同难点Tomato-Egg 包含舀取等接触密集动作Hotpot 要根据随机食材位置完成多步涮煮Cocktail 要从近十种相似原料中调制三种饮品。每种方法在每项任务上测试 20 次。图 5原论文 Figure 6 左。OneTwoVLA 在 Tomato-Egg、Hotpot、Cocktail 上分别达到 85%、80%、95%平均 87%。OneTwoVLA 平均成功率为87%高于 π₀ 的57%和双系统的63%。平坦式 π₀ 会丢失任务进度或重复步骤双系统的 Gemini 2.5 Pro 有时提出动作策略没学过的原子命令延迟也会使低层进入分布外状态。泛化规划使用从未出现在机器人数据中的指令包括打开冰箱找冰可乐、移开水果后取空盘、用杆子把远处物体扫近以及根据“帮我保持清醒”准备咖啡。仅用机器人数据的 OneTwoVLA 平均成功率为10%π₀ 为6%加入合成 VL 数据后OneTwoVLA-VL 达到70%。图 6原论文 Figure 6 右。VL 共同训练在四项未见任务上带来 60 个百分点的平均提升证据集中指向合成推理数据的作用。4.2 错误检测与恢复Hotpot 中的主要错误是夹爪与滤网错位Tomato-Egg 中则包括倒油时瓶子滑落。作者分别收集恢复示范让模型看到失败状态、纠正推理与后续动作。方法HotpotTomato-Egg总计OneTwoVLA5/63/48/1080.0%π₀3/75/78/1457.1%Dual-System4/53/77/1258.3%OneTwoVLA 能在抓取失败后后退、重新对齐并重试。双系统的失败常来自响应过晚高层发现瓶子未抓住时机械臂已经到达倾倒姿态。样本量只有 10—14 次错误事件80% 的结果说明机制可行还不足以给出稳定的恢复率估计。4.3 自然人机交互OneTwoVLA 可以在歧义指令下提问也能在执行中接受修改。例如人类临时要求改用柠檬伏特加模型先更新计划再放下原瓶并继续后续调制。Hotpot 与 Cocktail 共 20 次子任务级交互中OneTwoVLA 完成20/20双系统完成13/20。加入 VL 数据后20 种训练中未出现的交互场景成功率为72.5%。未共同训练的 OneTwoVLA 难以理解这些新表达说明统一架构解决了交互接口语言覆盖面仍主要来自视觉语言数据。4.4 视觉指代与开放世界目标定位图 7原论文 Figure 7。指令不直接给出对象名称而是通过用途、属性或空间关系描述目标模型需要先在推理中明确对象再生成动作。Single-Env 在同一环境、四个物体上测试空间、属性和语义指令Open-World 使用 16 个环境、933 条有效示范和约 180 个物体训练再到 8 个未见环境评测。测试对象还细分为机器人数据见过、仅合成 VL 数据见过、两类数据都没见过。方法Single-EnvOpen-Worldπ₀5%3%OneTwoVLA78%8%OneTwoVLA-VL88%73%显式推理把 Single-Env 从 5% 提升到 78%合成数据再把 Open-World 从 8% 提升到 73%。OneTwoVLA-VL 还能处理 Sprite、GoPro 等两类训练数据都未出现的物体。论文把它解释为合成 VL 数据重新激活了预训练 VLM 的 Web 知识由于缺少更细的对象分组成功率这项解释仍带有推断性质。猫先生认为最强的实验证据来自两组对照统一推理将长程任务从 57% 提到 87%VL 共同训练将开放世界指代从 8% 提到 73%。前者说明显式任务状态有价值后者说明开放世界语义主要来自数据覆盖。两种收益不能全部归因于“自适应推理”这一个因素。5. 局限与可复现性[BOR]的训练标签来自人工设定的候选节点与 Gemini 标注模型学到的是监督数据中的推理时机。作者明确提出未来需要用强化学习优化“什么时候想、想多久、想什么”而非继续依赖启发式区间。推理仍会造成 2—3 秒暂停长文本甚至超过 4 秒。静态桌面操作可以容忍动态环境和人机共域任务可能在暂停期间发生状态变化异步推理与动作生成是更现实的后续方向。失败案例还包括夹持不牢、倒液体洒出、食材位置识别错误以及面对机器人数据和合成数据都未覆盖的玩具时持续指向错误对象。推理与动作高度一致并不保证任务正确一旦推理选错目标动作会稳定执行错误计划。复现条件较重。每项任务训练 3 万步使用 8 张 H100 约 10 小时推理还依赖 π₀、Gemini 2.5 Pro、FLUX.1-dev 与真实机器人数据。官方已开放训练代码、Cocktail / Open-World 数据和部分合成数据有利于复现核心管线但论文全部长程任务数据与硬件评测仍难完整复制。总结自适应推理是一项策略能力也是一项计算分配能力OneTwoVLA 将推理、动作和模式决策统一到一个 VLA 中。[BOR]/[BOA]让模型在关键节点更新文字化任务状态其余时间继续快速输出动作带推理的机器人轨迹建立推理—动作对应关系1.6 万条合成 VL 数据扩展了新任务和开放世界对象的覆盖面。读者应带走的判断有三点统一模型缓解了高低层能力错位显式任务状态显著帮助长程执行与恢复开放世界泛化仍依赖更广的数据而不是推理格式自动产生。OneTwoVLA 把“何时使用慢思考”纳入了策略学习下一步则要让这种计算分配摆脱人工区间在动态环境中异步、可验证地运行。推荐阅读► 技术资讯 魔方 AI 新视界► 项目应用开源视界► 技术专栏 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列