WRC上听了三小时!越发感觉具身的ChatGPT时刻正在逼近。
19号WRC第一天就去各种探展。当天下午银河通用举办了一场叫“具身智能大模型的进化之路”的论坛。现场来的嘉宾很重磅有银河通用创始人王鹤、王晓刚大晓机器人、王仲远北京智源人工智能研究院院长、朱军老师生数科技、卢宗青老师智在无界、弋力老师清华叉院等。看他们的背景就知道具身基座模型方向的大佬都来了。这也是这个论坛吸引我的点因为具身的下半场竞争主线一定是大脑。原文链接WRC上听了三小时越发感觉具身的ChatGPT时刻正在逼近。上次waic26姚卯青和徐丹飞他们给的共识是具身智能大模型的ChatGPT时刻正在逼近。忙完waic之后好久没来参加论坛了这次完整地听了3个小时。本次论坛形成的共识和waic类似并强调了以物理世界数据飞轮和世界动作模型为代表的技术手段正在开辟出全新的增长曲线。期间还发布了一个《具身智能大模型白皮书》和《具身智能产业指数》。01 共识被一台机器人具象化了共识大家都可能很熟悉。但论坛现场银河最新的双足人形机器人 Galbot ET-1把它具象化了。它给人的第一印象是动作很顺听到语言指令后ET-1会根据环境变化生成身体动作交流时伴随眼神、头部和躯干的细微反馈少了机器人常见的机械停顿。这种丝滑背后对应的是本次同期发布的AstraBrain-Agent。后面是王鹤老师对银河通用技术路线的完整介绍了。他先谈到一个判断当人形机器人在复杂任务中表现出接近人类的能力时具身智能可能迎来自己的AlphaGo时刻。而这个事情上银河选择的测试不是围棋而是网球也就是上面视频开头部分。相比规则明确、状态相对稳定的围棋网球发生在不断变化的物理世界。机器人要实时判断球的速度、旋转和落点同时调整身体姿态、规划击球动作并维持全身平衡。这也是网球比较有意思的地方。它考验的已经不只是某个动作能不能做出来而是视觉感知、环境预测、决策规划和全身控制能否在极短时间内形成闭环。王鹤表示AstraBrain-Agent也是全球首个具备学习能力的智能体边看、边学边做。视频开头的打网球就是ET-1正在学习的任务之一。AstraBrain-Agent在工作时需要同时调用大脑和小脑大脑判断球从哪里来、应该打向哪里小脑则将决策转化为实时、连续的全身动作。击球过程中任何一处延迟都会直接反映在结果上。现场还有一个信息8月22号7点半银河将会是机器人运动会开幕式首个表演网球人机大战。02 当前机器人的能力到哪里了现场王鹤老师把银河的完整技术路线分享了出来。1AstraBrain-WAM 0.5负责理解环境、预测变化并规划动作2AstraBrain-WBC 0.5负责全身实时运动控制3AstraBrain-Dex面向灵巧操作4AstraData承担数据采集和处理5新发布的AstraBrain-Agent则试图让机器人在真实交互中边观察、边学习、边执行。想要判断能力的丝滑度除了高动态的打网球任务银河还展示了转笔和盘核桃。目前转笔已经可以做到将笔抛向空中、接住后继续转动这个是很细致的灵巧任务很多成年人都没法很好完成。盘核桃则依赖多指协调、连续接触和细粒度力控用力大了核桃会碎用力小或者不对核桃可能掉了。这些能力的背后是AstraBrain-Dex灵巧手世界模型通过强化学习和Sim2Real具体完成部署的。王鹤也表示这类任务只能通过强化学习和sim2real之前figure拧瓶盖是遥操但很多动作遥操做不了天花板高度可能就被限制了。03 什么样的模型会是大脑的终局这是论坛最值得讨论的问题之一。VLA是目前具身智能的主流路线。它把视觉、语言和动作放进统一模型让机器人可以根据图像与语言指令直接输出动作。但王鹤认为VLA仍然受到动作数据的限制。模型输出的是Action训练数据也需要包含与机器人本体对应的动作标签。任务和本体一旦变化数据很难直接复用。世界模型解决的是另一个问题。它让模型通过观察环境变化预测接下来可能发生什么。但只会预测未来并不意味着模型知道应该采取什么动作来完成任务。所以银河选择了WAM也就是世界动作模型。WAM把理解、预测和行动放进同一套模型既学习物理世界如何变化也学习为了完成任务应该采取什么动作。而之前Jim Fan给红杉讲的机器人大脑的终局也是WAM。这一点王鹤表示“银河是全球第一个提出WAM概念的arxiv上可以看到首篇论文我还是通讯作者。现在我们用AstraBrain-WAM 0.5验证跨任务、跨场景和跨本体能力”。朱军则从通用世界模型的角度给出了另一套表达通用世界模型理解×预测×行动。他认为技能的形成可以理解为持续预测、行动和修正的过程并将通用世界模型的演进分成生成、交互、行动、自主和组织五个阶段。虽然两种表述使用的概念不同方向却很近。04 数据飞轮对模型能力增长的贡献是怎么样的架构决定模型怎样学习数据决定模型能够学到多少。生数科技的朱军老师在现场展示了一座数据金字塔。越接近真实任务的数据往往价值越高但规模化能力越弱越容易大规模生成的数据又可能与真机部署存在更大距离。所以数据飞轮的价值不能只用“采了多少小时”衡量。真正重要的是仿真、真机和人类视频能否被组织进同一条训练链路并推动机器人完成更多真实任务。银河通用在这个问题上给出的答案则是“虚实融合”。在数据端AstraData银河自己的基础设施负责承接仿真数据、真实机器人数据和Ego数据。模型端WAM-TTT尝试从无标注人类视频中学习任务经验再通过后训练完成具体场景适配。王鹤说通过真机强化银河在全球率先攻克了10分钟超长程做早餐任务的公司。AstraBrain-WAM 0.5和AstraBrain-WBC 0.5也分别在大脑与全身运控方向验证了Scaling Law。相比于dyna-2王鹤说他们在今年2月份就验证了数据与模型的scaling law。之外现场银河还展示了最新的第一视角数据采集方案Astra Set。05 具身大模型的GPT时刻什么时候会来到这个问题上次waic上我们分享过徐丹飞他们给的预测。但这次王鹤现场给出了一个相对具体的判断标准在不依赖额外工程开发的情况下机器人能够对人类级任务实现零样本泛化并达到70%至80%的成功率剩余部分再通过客户侧的轻量适配继续提升。这个标准里关键不只是成功率。ChatGPT带来的变化是普通用户面对一个新问题时不需要重新采集数据、训练模型和开发系统。放到机器人上也应该意味着换一个任务、物体或环境机器人仍然能够调用已有经验解决问题。漂亮Demo是起点真实场景中的持续运行才是答案。真正的ChatGPT时刻需要同时满足泛化能力、任务成功率、部署成本和长期稳定性。至于未来具身可能的市场规模王鹤给了一个描述手机数量 x 汽车价格 x 大模型模式计费倍率。06 其他嘉宾在工程和产业上的分享海外的嘉宾Wolfram Brugard概率机器人的奠基者等分享的技术路线和国内还存在一定的差异他们更关注工业。王田苗教授北航机器人研究所名誉所长带来的主题分享也比较有意思“具身智能下半场如何穿越分化周期”。他指出具身发展刚开始最大瓶颈不仅仅是AI而是核心零部件跟不上大脑与数据的迭代进化。现在行业很多公司都进入了POC阶段但具身大模型解决不了所有case只能处理容错率高一点的场景。07 没有battle圆桌上的一问一答在多位嘉宾分享过之后最后一个环节是圆桌。张直政博士是主持人其他几个嘉宾也都是熟人了可以看下图的介绍。圆桌没有出现预想中的路线battle主要收敛到三个问题上世界模型应该学习什么、预测怎样帮助机器人行动以及模型从实验室走向真实场景还缺哪些关键环节。1世界模型究竟应该学习什么样的表征又怎样从数据中获得因果能力卢宗青老师认为当前大模型对视觉世界的理解仍然不够扎实。视觉表征做不好模型的通用性也很难建立至于因果关系现阶段仍需要依靠更大规模的数据逐渐逼近。王仲远也提到世界模型要预测物理世界前提是从海量数据中学习稳定的环境表征。但数据并非简单地越多越好。王晓刚老师的观点是世界模型仅有生成能力还不足以在物理世界中行动。电影、生成视频以及部分互联网内容并不严格遵循真实世界的物理规律。机器人需要学习真实生活中的视频还需要引入相机位姿等信息才能进一步理解空间与运动之间的关系。弋力老师则把交互和多模态放到了更重要的位置。机器人面对的世界不仅有图像还有动作、触觉和状态变化。如果目标是让机器人真正参与物理交互模型表征就需要包含这些信息并在不同模态之间协同学习。换句话说世界模型需要学习的不是“画面长什么样”而是物体怎样变化、动作会造成什么结果。2预测为什么能够帮助策略学习王晓刚老师认为VLA比较擅长处理目标和环境相对稳定的操作任务。一旦周围环境持续变化或者任务中存在博弈模型就很难及时调整。世界模型的价值在于能够提前展开多个可能的未来机器人可以先“想象”不同动作可能造成的结果再对候选策略进行评价和选择。弋力则进一步给出了三种可能路径1图像生成等优势模态可以带动动作预测2模型也可以在执行动作前先对未来状态进行预判3从长期来看世界模型还能帮助机器人在环境变化中不断修正行为。卢宗青老师后面补充触觉也可以成为重要的监督信号。通过联合建模动作与状态机器人能够更准确地理解一次接触之后会发生什么。3从实验室到真实场景我们需要面对什么挑战研究方向需要对准什么切入点现场嘉宾提到B端和C端面对的是两套不同的评价逻辑。工业场景会把效率、精度和成功率算到小数点后几位有时甚至需要在智能化方案和传统工程方案之间做取舍C端环境更加开放机器人能否持续学习和进化会更重要。弋力老师认为持续学习不只是“继续收集数据”。机器人应该从什么数据中学习、在什么时候学习、用什么方式学习都需要被重新设计。机器人执行失败后系统还要判断问题来自感知、规划、控制还是环境变化并区分任务中不变的规律和不断变化的因素。王仲远老师的判断是具身智能也会经历从专用小模型走向通用大模型的过程。当前专用模型已经能把部分技能做得很好真正缺少的是跨任务和跨场景的泛化能力。卢宗青老师则给出了一个很工程的观察行业对数据的重要性已经形成了基本共识但对训练范式还没有统一答案。不过这并不意味着产业落地必须等待“终局模型”出现。眼下更直接的障碍是行业还缺少一套足够成熟的工具链把模型稳定地部署到不同机器人和真实场景中。这可能也是圆桌最终留下的共识表征、预测能力、持续学习和部署工具链已经成为任何一条技术路线都绕不开的问题。08 写在最后三个小时听下来一个变化已经很明显。具身智能正在进入大脑竞争更为集中的阶段。行业不再满足于让机器人完成一个预先训练好的任务而是开始追问同一个模型能否控制不同机器人已有经验能否迁移到新场景部署产生的数据能否继续推动模型增长。具身智能的ChatGPT时刻大概率不会由某一段突然走红的视频宣布。它更可能出现在这样一个节点机器人进入新场景后不需要重新启动一套完整的工程项目模型能够利用已有经验理解任务通过少量适配完成部署再把执行结果送回数据飞轮。重磅全网首个具身智能开源知识库来啦技术/产业/投融资/上下游推荐阅读真机强化入门的一套完整教程pi*0.6复现方案我们用低成本的机械臂完成pi0/pi0.5/GR00T/世界模型等VLA任务具身智能的WAM与世界模型一份完整指南一览具身智能的行业全局从产品经理的角度出发VLARL方向首个系统教程来啦Online RL/Offline RL/test time RL等好用高性价比面向具身科研领域打造的轻量级机械臂VLA/VLA触觉/VLARL/具身世界模型等具身大脑小脑算法与实战全栈路线来啦~从零训练你的足式机器人让你的足式机器人真正动起来~1v1 科研论文辅导来啦重磅具身智能之心论文辅导来啦近20方向顶会/顶刊/SCI/EI/中文核心/申博等