GigaBrain-0.7:三系统架构驱动的具身智能新范式
基于异构数据扩展与涌现能力的具身基础模型探索论文来源GigaBrain Team | arXiv:2608.15875v1近年来视觉-语言-动作Vision-Language-Action, VLA模型已成为构建通用具身智能体的重要技术路径。然而如何在更大规模、更加异构的数据体系下实现有效的预训练并在理解、预测与执行之间建立深度协同仍是该领域面临的核心挑战。GigaBrain-0.7 通过引入三系统架构将多模态理解、世界模型预测与连续动作生成有机整合在超过 37000 小时的异构具身数据上展现出强劲的零样本能力与跨本体泛化性能。一、研究背景与核心挑战随着预训练数据规模与模型容量的持续扩展VLA 模型在复杂长程任务中的执行能力显著提升。然而现有的多数 VLA 系统仍以感知-动作的直接映射为主缺乏对未来状态的显式预测能力也难以在行为执行过程中评估自身进度。这种架构层面的局限性使得模型在面对需要多阶段推理、动态环境交互以及跨本体迁移的场景时表现往往难以达到预期。具体而言当前 VLA 研究主要面临三方面挑战其一机器人数据在本体形态、动作空间与执行条件上差异显著未经恰当对齐的数据扩展可能引入干扰而非迁移知识其二多数模型以反应式观测到动作的预测为中心缺少对未来状态的预判机制其三理解规划、预测评估、动作执行与经验驱动的持续改进在整个学习生命周期中尚未形成有效闭环。针对上述问题GigaBrain-0.7 提出了一种统一的三系统架构通过 System 2理解与规划、System 3预测与评估与 System 1动作与控制的协同配合构建了从高层语义理解到低层连续控制、再到经验反馈增强的完整链路。该模型基于 PaliGemma23B视觉-语言主干配合专用的动作专家Action Expert0.5B与世界价值模型GigaWorld-15B在 16 种机器人本体与约 2.7 亿视觉-语言样本上完成了联合预训练。图 1GigaBrain-0.7 整体架构概览。模型通过三系统协同实现理解与规划、预测与评估、动作与控制的有机统一并支持基于人机交互经验的持续强化学习。二、数据基石三万七千小时的异构具身数据高质量、大规模的异构数据是具身基础模型能力涌现的前提。GigaBrain-0.7 的预训练语料由两大核心部分构成一是包含 37256.98 小时的具身轨迹数据二是包含 271976674 条样本的视觉-语言VLM图文问答数据。前者提供状态-动作序列与交互过程监督后者则用于保持模型的通用视觉-语义能力并强化空间关系推理、物体定位与可供性预测等机器人任务所需的核心技能。在具身轨迹数据方面研究团队构建了覆盖多源异构数据的数据金字塔。其中真实机器人轨迹占比 55.12%涵盖 Maker H01、Maker M01、Agibot-G1、AgileX、Franka、UR5 等 16 种机器人平台总计超过 20000 小时通过 Universal Manipulation InterfaceUMI采集的近手视角人类演示数据占比 22.15%补充了精细手眼协调与局部空间几何的监督信号第一人称EGO人类操作视频占比 7.68%用于增强语义理解与时间建模基于物理的仿真数据与世界模型生成数据分别占比 3.90% 与 11.15%用于扩展长尾场景与视觉多样性。图 2GigaBrain-0.7 训练数据组成全景。具身轨迹数据涵盖真实机器人、UMI、EGO、仿真及世界模型生成数据VLM 数据则覆盖图像描述、视觉问答、空间推理与机器人任务理解等任务类型。为确保异构数据能够稳定地参与联合训练研究团队开发了一套统一的数据处理流水线。该流水线首先将原始数据转换为 LeRobot v3.0 统一格式随后建立跨本体的状态-动作标准化表示维度顺序遵循左臂、右臂、头部、腰部与底盘/腿部的结构缺失维度通过掩码处理避免为每种机器人形态维护独立的数据格式。在语言指令层面团队采用大语言模型辅助的指令重写与原子子任务标注消除不同数据源在命名习惯、描述粒度与语言上的不一致性。此外多阶段质量控制系统通过极端值过滤、静止段检测、末端执行器位姿一致性校正与训练损失异常过滤进一步保障了数据质量。**数据扩展的核心发现**论文中的系统性扩展研究表明在固定模型配置下预训练数据规模的持续增加能够一致性地降低验证损失。更重要的是这种优化层面的改善能够转化为物理执行层面的可靠提升——特别是在折叠衣物等复杂可变形物体操作任务中数据规模的扩大呈现出近乎涌现式的能力跃升。三、三系统架构深度解析GigaBrain-0.7 的核心创新在于将具身智能分解为三个既专业化又紧密集成的子系统。这种分工并非简单的模块堆叠而是通过结构化的语义、视觉与价值接口实现的深度协同。3.1 System 2理解与规划System 2 基于 PaliGemma23B视觉-语言模型构建负责接收当前视觉观测与高层任务指令并输出链式思维Chain-of-Thought推理过程与可执行的子任务指令。例如面对将物品挂在衣架上的指令System 2 会首先识别场景中的相关物体如帽子、包袋进而将任务分解为拿起红帽子等具体子任务。这种分解为 System 1 的动作生成与 System 3 的未来预测提供了显式的任务上下文从而在高层语义理解与低层运动控制之间建立了桥梁。3.2 System 3预测与评估System 3 是基于 GigaWorld-15B的世界价值模型World Value Model也是 GigaBrain-0.7 区别于传统 VLA 模型的关键组件。该模型接收当前具身上下文包括视觉观测、本体状态与 System 2 输出的子任务提供两类互补信号未来观测预测基于当前上下文与子任务指令模型生成与动作块时域对齐的未来视频预测并提取末帧作为子目标图像subgoal image。该视觉预测为 System 1 提供了关于预期物理状态的显式表征。价值评估模型估计标量价值value反映当前执行状态相对于子任务完成的进度。该价值经离散化后转换为二元优势条件advantage用于在训练与推理阶段区分推进任务进度的有效行为与无效行为。System 3 在 VLA 后训练阶段保持冻结其输出作为额外的条件信号接入 System 1。这种设计既保留了世界模型的预测表示又允许动作生成模块学习如何有效利用这些预测信号。3.3 System 1动作与控制System 1 是 GigaBrain-0.7 的执行核心采用基于 Mixture-of-TransformersMoT的视觉-语言-动作架构。该模型以 PaliGemma23B为视觉-语言主干并联一个专用的连续动作专家0.5B。两者通过联合注意力机制交互视觉-语言流保持因果自注意力以维持预训练语义能力动作专家则双向关注两个流的联合表示从而在不影响 VLM 计算的前提下实现语义引导的动作生成。图 3GigaBrain-0.7 三系统架构详图。System 2 负责视觉-语言理解与任务分解System 3 提供未来状态预测与价值评估System 1 整合多源信号生成连续动作并支持离线/在线经验强化学习。System 1 支持双路径动作表示一是基于下一令牌预测NTP的离散动作路径用于训练阶段桥接语言理解与运动控制二是基于流匹配Flow Matching的连续动作路径通过去噪过程生成精确的动作块用于实际部署。为解决连续动作学习对预训练视觉-语言表示的潜在干扰研究团队引入了软知识隔离Soft Knowledge Insulation机制——流匹配梯度在动作专家内部完整传播但进入视觉-语言主干时按系数衰减从而在保留通用多模态能力的同时允许适度的具身适应。此外System 1 集成了短时视觉记忆机制通过时序-空间块对历史帧进行因果聚合。该设计使当前帧表示能够捕捉任务相关区域的时序演化且无需将大量历史视觉令牌输入主干网络在提供时序上下文的同时控制了计算开销。四、四阶段训练体系GigaBrain-0.7 的训练流程分为四个递进阶段形成从通用先验到任务专精、再到经验驱动的完整模型生命周期。4.1 联合 VLA 预训练在第一阶段System 1 与 System 2 在完整的异构语料上进行联合预训练。与分阶段训练不同该阶段同时优化视觉-语言理解、层次化任务预测、离散动作表示与连续动作生成。对于连续动作模型采用流匹配目标对于语言与离散动作则采用下一令牌预测目标。异构本体数据通过统一的状态-动作表示与本体感知掩码实现对齐确保不同自由度的机器人能够共享核心的操作知识。4.2 世界模型预训练第二阶段专注于构建 System 3 的预测与评估能力。该阶段首先在机器人操作数据上对 GigaWorld-1 进行视频预训练使其适应机器人操作特有的状态转移与接触交互模式随后扩展为混合架构的世界价值模型在保持未来视频生成能力的同时引入基于轨迹完成标注的价值估计路径。完成该阶段后System 3 参数冻结作为稳定的预测与评估接口服务于后续阶段。4.3 世界模型驱动的 VLA 后训练第三阶段面向特定任务进行适配。在此阶段System 3 生成的子目标图像与价值衍生条件被接入 System 1 的上下文System 1 与 System 2 则在下游演示数据上联合优化。为防止对 System 3 信号的过度依赖训练过程中以一定概率随机丢弃子目标图像概率 0.5与价值条件概率 0.15使模型能够适应四种不同的条件组合。4.4 经验驱动的强化学习第四阶段旨在突破演示数据的分布限制。研究团队采用离线-在线渐进式强化学习管线首先基于部署策略收集的 rollout 数据通过优势加权回归AWR进行离线策略优化使模型从成功与失败经验中习得进度感知与错误恢复能力随后将优化后的策略重新部署在困难状态引入人工修正并通过轻量化的演员-评论家Actor-Critic框架进行在线优化。这一闭环使模型能够在自身执行产生的状态分布上持续改进。图 4经验强化学习管线。包含监督微调、离线强化与在线强化三个阶段通过 rollout 数据与人工修正实现策略的持续迭代优化。五、实验验证与能力涌现为全面评估 GigaBrain-0.7 的能力边界研究团队在真实机器人、仿真环境及多模态理解基准上开展了系统性实验涵盖从零样本泛化到任务专精、再到经验驱动的持续学习。5.1 数据扩展与架构选型在模型架构层面研究团队对比了 PaliGemma2、Qwen3.5 与 Gemma 4 等视觉-语言主干以及双路流Dual Stream、末层交叉注意力与多层交叉注意力等动作专家耦合方案。实验结果表明基于 PaliGemma2 的双路流架构在结构化操作、语言条件交互与可变形物体操作等任务上取得了最佳平衡尽管推理延迟略高但其动作生成能力显著优于耦合更松散的方案。在数据扩展方面验证损失随数据规模增加呈现单调下降趋势。更具启发性的是在真实机器人执行中简单任务如水果抓取随数据扩展平稳提升而复杂任务如混乱衣物折叠则表现出对数据规模的强依赖性——较小规模下几乎无法完成的行为在数据量达到一定程度后变得可靠。这一现象被研究者视为异构预训练下能力涌现的直接体现。图 5数据扩展实验结果。验证损失随预训练数据规模增加而持续下降真实机器人任务成功率随数据扩展稳步提升复杂任务表现出更显著的规模敏感性。5.2 时序上下文与预测评估的作用实验进一步验证了时序视觉上下文与 System 3 预测信号的关键作用。在存在视觉相似但时序位置不同的重复状态时缺乏历史信息的单帧策略容易陷入重复动作循环而引入短时视觉记忆后模型能够依据前置交互历史正确解歧当前状态继续推进任务。System 3 的消融实验显示子目标图像条件与价值条件均能对任务执行产生积极影响。在礼品包装等挑战性任务中基础模型完全无法完成而引入 System 3 的预测与评估信号后成功率分别提升至 20% 与 60%两者结合后进一步达到 80%。同时任务评分与完成时间也同步优化表明预测性指导不仅提升了任务完成率也改善了执行过程的流畅度与效率。图 6System 3 预测与评估信号的消融实验。基础模型Base、子目标图像SubImage、价值条件Value及两者结合SubImageValue在多项任务上的成功率、平均得分与完成时间对比。5.3 基础模型的零样本能力在未经任何任务特定适配的情况下GigaBrain-0.7 展现出显著的零样本执行与泛化能力。在 AgileX PiPER 与 Maker H01 两种差异显著的本体上预训练策略能够直接执行语言条件的多项操作任务包括基于颜色、物体身份与空间关系的指令跟随。在分布外Out-of-Distribution测试中面对训练数据中未出现的物体实例、未观测过的场景布局以及未组合过的任务配置模型仍能保持可执行的行为输出体现出目标理解、空间定位与组合泛化的基础能力。图 7GigaBrain-0.7 零样本能力评估。涵盖 AgileX PiPER 与 Maker H01 上的语言条件任务跟随与复杂长程操作包括分布内In-Domain与分布外Out-of-Domain设置。在复杂操作层面预训练策略在可变形物体折叠、多阶段整理等需要持续接触与多步执行的任务上表现出非平凡的零样本能力。值得注意的是面对训练时未见的衣物实例与高度非结构化的初始状态模型能够通过反复建立适当接触、响应不断变化的物体几何形状来维持折叠行为而非依赖固定的物体形状或记忆轨迹。5.4 后训练与跨本体迁移经过任务特定的监督微调后GigaBrain-0.7 在语言跟随与复杂操作任务上均取得显著提升。在 AgileX PiPER 的六项语言条件任务中模型在颜色辨识、目标选择与方向推理上达到或超过现有先进基线在 Maker H01 人形平台上平均成功率从上一代模型的 69.6% 提升至 84.2%。在复杂操作任务中GigaBrain-0.7 在桌面整理、橡皮泥揉捏、物品收纳与餐具洗涤等多任务上均展现出跨本体的稳健性能。图 8后训练复杂操作任务对比。上排为 AgileX PiPER 平台结果下排为 Maker H01 平台结果涵盖物体排序、可变形物体操作、餐具整理与清扫等任务。5.5 仿真基准评测在标准化仿真评测中GigaBrain-0.7 同样表现出色。在 RoboTwin 2.0 双臂操作基准的 Co-Train 协议下模型在困难的域随机化Hard设置中取得 67.9% 的成功率显著优于对比方法在 EBench 移动操作与长程交互基准上模型在公开可比的 VLA 模型中取得了最高的整体成功率33.30%与综合得分46.1在 RoboColiseum 的四个评测维度指令跟随、空间推理、鲁棒性、通用操作中GigaBrain-0.7 均位列开源模型首位尤其在空间推理维度优势突出。5.6 经验驱动的持续改进在经验强化学习阶段研究团队选取了四项具有代表性的真实机器人任务进行评估礼品盒包装、轴承安装、连杆安装与扎带插入。结果显示从监督微调SFT基线到离线强化学习再到在线强化学习模型成功率呈现持续的阶段式提升。SFT 基线的平均成功率为 30.0%离线强化后提升至 57.5%而经过在线强化学习后四项任务的成功率均达到 100%。特别是在连杆安装与扎带插入等需要高精度对齐与穿引的任务中在线阶段通过人工在困难状态的精准修正实现了从 40% 到 100% 的跨越。图 9经验驱动强化学习的代表性真实机器人任务。包括礼品盒包装A、轴承安装B、连杆安装C与扎带插入绑扎D覆盖长程序列执行与高精度接触操作。六、总结与展望GigaBrain-0.7 通过三系统架构与大规模异构数据预训练为具身基础模型的发展提供了一条可扩展的技术路径。其在理解、预测与执行层面的深度协同不仅提升了模型在单一任务上的执行精度更重要的是赋予了模型跨本体、跨任务与跨场景的通用性与适应性。从 37000 小时异构数据中的预训练到世界模型驱动的后训练再到基于 rollout 经验的持续强化GigaBrain-0.7 展示了一个具身智能模型从通用先验到持续进化的完整生命周期。展望未来随着异构具身数据的进一步扩展、跨源对齐技术的完善以及长程预测与自主闭环学习能力的持续增强具身基础模型有望在更加开放、动态的真实世界环境中展现出更为广泛的通用性与鲁棒性。GigaBrain-0.7 的相关训练代码与预训练模型权重将公开发布为学术界与产业界的后续研究提供基础支撑。**参考资料**GigaBrain Team. GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture. arXiv:2608.15875v1, 2026.论文项目主页https://gigaai.cc/blog/gigabrain07具身智能世界模型blog https://jinxindeep.github.io/blog/blog2026.html