拓冰建站拓冰建站
首页 / 资讯中心 / 正文

机器人为什么学不会“通用“这件事

你有没有想过为什么家里的扫地机器人很聪明但你没法把它的大脑直接装到炒菜机器人身上这背后藏着一个机器人研究领域一直没解决好的难题不同的机器人身体结构差太多了。一个单臂机械手有7个自由度一个双臂机器人可能有14个而人形机器人轻松突破29个自由度。它们的动作语言完全不同,就像让一个只会说中文的人突然要指挥法语、德语、日语三个团队同时干活,你得先解决翻译问题,才能谈协作。过去几年,机器人学界一直在尝试训练通才型的机器人策略,也就是用一套模型控制多种不同身体的机器人。这类模型现在有个专门的名字。**VLA模型Vision-Language-Action视觉-语言-动作模型**一种能同时理解画面、听懂指令、并输出机器人动作的AI模型是当下机器人智能的主流架构。但做通才远比做专才难。今天要说的这篇论文,来自香港科技大学广州和COCO Matrix团队的DyPES-VLA,就是冲着这个难题去的。它在三个仿真测试平台上都拿到了当前最好的成绩还真机测试了三种完全不同的机器人身体效果相当亮眼。在往下讲之前先说说这件事到底卡在哪儿。核心问题训练一个通才机器人到底难在哪假设你现在要训练一个AI让它同时会开单臂机械手、双臂协作机器人、还有一个有手有脚的人形机器人。你手头有三种机器人产生的示范数据怎么把它们捏合到一个模型里过去的方法基本分成两条路。第一条路是统一动作格式。简单说就是不管机器人长什么样先把它们的动作都翻译成同一种标准语言比如统一用末端执行器的位置和姿态来表示动作。这条路听起来挺合理,但代价不小,你需要做坐标变换、逆向运动学计算工作量随着机器人种类增加会指数级上升。更麻烦的是这种强行翻译会把两件本该分开的事情搅在一起机器人之间共享的交互规律和每个机器人身体特有的控制细节。这就好比你要给三个不同乐器的演奏者写同一份乐谱。小提琴、钢琴、鼓的发声方式天差地别如果你硬要发明一种通用记谱法逼着所有乐器按同一种符号演奏最后可能三种乐器都没法把自己的特长发挥出来。如果不统一格式呢那乐队就没法合奏各自为战。这就是过去方法面临的两难。第二条路更基础的问题是现有方法几乎只靠动作标签来学习。就是说模型只从机器人做了什么动作这一件事上学东西而完全没有利用海量的人类操作视频、机器人操作视频里蕴含的规律比如物体是怎么被碰到的、抓取瞬间发生了什么、场景是怎么随着交互变化的。这些视频数据不需要标注机器人的具体动作指令却包含着大量关于物理世界如何运作的免费知识,现有方法基本没有把这块蛋糕吃干净。DyPES-VLA就是针对这两个问题给出了自己的解法。拆开看DyPES-VLA的设计思路DyPES-VLA这个名字本身就是答案的浓缩DyPES代表Dynamics Priors and Embodiment-Specific control翻译过来就是共享的动力学先验加上针对具体身体的专属控制。这两句话拆开来看其实回应的正是刚才说的两个问题。**动力学先验Dynamics Priors**指的是不同机器人、不同场景下都反复出现的物理规律比如物体如何运动、接触瞬间会发生什么、交互后场景怎么变化。这些规律是跨身体通用的不管是人手还是机械爪抓起一个杯子后手会往哪个方向使力规律是一样的。那怎么让模型学到这些通用规律研究者的思路是用预测未来画面这件事来倒逼模型理解物理世界。用预测未来来学会看懂物理世界DyPES-VLA的第一阶段训练做的事情听起来有点绕给模型看当前的画面、听懂指令然后让它去预测几步之后会发生什么画面变化而不是直接去学动作指令。具体的流程是这样的。模型先用一个预训练好的视觉语言模型把当前的摄像头画面、语言指令、还有机器人身份信息比如这是哪种机器人、控制频率是多少一起编码同时还塞进去一批可学习的查询令牌。**查询令牌Query Tokens**一组可学习的、类似占位符的向量它们和视觉、语言信息一起被处理最终携带的信息会成为整个模型的共享接口后续所有任务都从这批向量里提取信息而不是直接从原始画面或文字里取。这批查询令牌输出后得到的结果论文管它叫查询状态。接下来关键的一步来了有一个专门的未来生成头它接收的输入只有查询状态不接触当前画面本身任务是根据这个查询状态重建出未来某一帧画面。**未来生成头Future Generation Head**这里用的是一种叫SANA的图像生成模型作用是根据查询状态生成经过压缩编码的未来帧图像用生成质量来倒逼查询状态记住足够多关于物体运动和场景变化的信息。为什么这个设计很巧妙因为生成器完全被断了后路它看不到当前的原始画面只能靠查询状态里携带的信息来猜未来会发生什么。如果查询状态里没有存住关于接触运动因果的信息生成器根本没法把未来画面画出来。这就相当于逼着查询状态必须成为一个信息瓶颈所有跟动态变化有关的知识都得被压缩进这几十个向量里。这个设计让我想起小时候玩的传话游戏。一群人排成队第一个人看一张图然后只能用嘴描述给下一个人一个个传下去最后一个人要根据听到的描述把图画出来。如果传话的人说得含糊最后画出来的东西肯定跑偏。这个游戏逼着每个传话者必须把最关键的信息说清楚废话越少越好。DyPES-VLA里的查询状态就是那个传话中间人它被逼着必须把物体怎么动、怎么碰、场景怎么变这些核心信息浓缩进有限的向量里因为生成器完全靠它才能画出未来。如果不这样设计直接让生成器看到原始画面那查询状态就可能变成打酱油的摆设学不到真正有用的东西。这一步训练用的数据很有意思既包括没有动作标注的人类操作视频来自一个叫EgoDex的第一视角人类操作数据集也包括三个仿真环境自己产生的视频。因为这个预测任务不需要动作标签所以海量的、便宜的视频数据都能被利用上这正好补上了前面说的浪费视频数据的漏洞。第二根柱子专属身体的动作头学完了共享的物理规律接下来的问题是怎么把这些规律翻译成每个机器人具体该怎么动这就是Embodiment-Specific专属身体要解决的事。DyPES-VLA用了一个叫MoE的结构来处理这件事。**MoEMixture-of-Experts混合专家模型**一种神经网络设计网络内部准备了多组专家模块根据输入的不同动态选择用哪一组专家来处理而不是让所有输入都走同一条计算路径。在DyPES-VLA里这个动作头是一个16层的扩散变换器术语上叫DiT里面每一层都分成两部分注意力层是所有机器人共享的负责处理动作序列里这个时刻和那个时刻怎么关联这种跨时间的结构规律而前馈网络部分则是按机器人类型路由的专家模块单臂机器人走一组专家双臂机器人走另一组人形机器人再走第三组。**扩散变换器Diffusion Transformer, DiT**结合了扩散模型从噪声逐步还原出目标数据的生成方式和Transformer架构的一种网络结构这里被用来从随机噪声出发逐步去噪生成出真实可执行的机器人动作序列。这个设计的巧妙之处在哪儿它把通用的东西和专属的东西精确地分了工。时间上的规律比如一个动作序列前后应该怎么衔接这种结构性的东西是跨机器人共享的,不管是单臂还是双臂动作片段内部的时间连贯性道理是相通的。但具体到这个关节该转多少度这只手爪应该张多大这就完全是每种机器人独有的物理约束了必须用专属的模块来处理。这就好比一个连锁餐厅的中央厨房体系。所有分店共用同一套采购流程、同一套食材品控标准这是共享的部分但到了具体炒菜环节川菜馆有专门的川菜师傅粤菜馆有专门的粤菜师傅因为口味和火候的讲究完全不一样硬让川菜师傅去掂勺粤菜是要出问题的。如果不设置这层区分让所有机器人的动作都挤在同一个前馈网络里学会发生什么论文的实验数据给出了答案换成一个大家共用一个动作头的版本后RoboTwin这个双臂机器人任务上的成功率从89.02%掉到了87.85%RoboCasa人形机器人任务上更是从59.25%掉到57.17%足足少了两个多百分点。这说明硬挤在一起确实会造成互相干扰。而更妙的地方是每个机器人还配了一对专属的编码器-解码器负责把这个机器人的原生动作格式不管是7维还是14维还是29维转换成模型内部统一处理的宽度处理完了再转换回去。这意味着整个流程压根不需要提前手动把不同机器人的动作格式统一起来每个机器人保留自己的母语翻译工作被丢给了模型自己去学。再说一个细节机器人的身份信息不是随便塞进去的而是被翻译成了一段文字描述比如数据来源是libero机器人型号是Franka Panda单臂夹爪控制频率20赫兹动作维度7这段文字和视觉、语言信息一起被丢进视觉语言模型里处理。这样做的目的是让模型能明确区分这条数据到底是哪个机器人产生的避免不同来源的数据互相搞混。实验也验证了这一点去掉这段元数据描述后模型在几个任务上都出现了小幅下滑最多掉了0.5个百分点说明这个设计确实在帮模型分清楚我现在是在控制哪个身体。两阶段训练先学道理再学手艺整个训练过程分成两个阶段逻辑很清晰。第一阶段叫动力学先验预训练只用动作无关的视频数据训练视觉语言模型、查询令牌还有那个未来生成头让模型先把物理世界的基本规律摸透。这个阶段跑了十万步。第二阶段叫跨身体协同训练这时候才引入真正带动作标签的机器人示范数据同时优化未来预测目标和动作预测目标两者的损失函数按一个系数加权组合起来这个系数论文里设成了0.05意思是动作学习是主线未来预测是辅助的正则化项帮着让共享表示保持住之前学到的物理规律不跑偏。这个阶段跑了二十万步。到了真正部署使用的时候那个负责预测未来画面的生成头会被直接砍掉不参与推理只留下动作头根据查询状态直接吐出可执行的动作。这个设计也挺聪明的训练时靠预测未来这个额外作业来强化学习效果但真正上岗干活时不需要真的去画一张未来的图直接省了这一步的计算开销。这就像运动员的训练和比赛。平时训练时教练会让运动员做很多辅助性的力量练习、专项技巧练习这些练习本身不是比赛项目但能强化比赛时需要的核心能力。真正上场比赛的那一刻运动员不会再做那些辅助动作他直接调用练出来的能力去完成比赛任务。DyPES-VLA里那个预测未来画面的环节就是训练阶段的辅助练习比赛也就是实际执行动作时用不上但它锻炼出来的能力已经融进了查询状态里。三个仿真战场上的成绩单论文在三个业界公认的仿真测试平台上验证了效果这三个平台代表了三种截然不同的机器人身体。RoboTwin 2.0是一个双臂机器人ALOHA-AgileX14个自由度的测试平台覆盖50种不同任务测试环境分干净和随机化两档随机化档会打乱背景、光照和物体摆放位置来增加难度。RoboCasa-GR1模拟的是一个29自由度的Fourier GR-1人形机器人在厨房场景里干活比如把奇异果放进篮子、把面包放进烤箱。LIBERO则考验一个7自由度的Franka Panda单臂机器人在桌面上完成各种拿取任务。DyPES-VLA用同一个训练好的模型业内叫单一检查点意思是不针对每个测试平台单独微调去同时打这三个平台成绩如下表| 测试平台 | DyPES-VLA成绩 | 对比最强基线 ||---|---|---|| RoboTwin 2.0双臂 | **89.02%** | Qwen-VLA 86.65% || RoboCasa-GR1人形 | **59.25%** | ABot-M0 58.3% || LIBERO单臂 | **98.0%** | X-VLA 98.1%微调后专才 |在RoboTwin上超过同类通才模型Qwen-VLA整整2.37个百分点在RoboCasa人形机器人任务上甚至超过了专门为这个任务单独训练调优的专才模型ABot-M0在LIBERO上虽然比经过专门微调的X-VLA低了0.1个百分点但要知道X-VLA是每个任务单独训一个模型的打法而DyPES-VLA是一个模型打天下这个差距几乎可以忽略。真实机器人上的表现更能说明问题仿真测试固然重要但机器人研究最终要落地到真实世界。论文团队用三种真实物理机器人做了测试7自由度的Franka Research 3单臂机械手、14自由度的AgileX COBOT Magic双臂机器人、还有配备了灵巧手的Unitree G1人形机器人。三个任务分别是把奇异果放进篮子、把杯子里的水倒进碗里、把书放到书架上。团队用同一个在仿真环境训练好的模型再拿真实机器人采集的1800条示范数据做了联合微调只微调了5000步相对轻量最后得到一个能同时操控三种机器人身体的统一策略。对比结果很直观| 方法 | 平均成功率 ||---|---|| ACT每种机器人单独训练9个模型 | 32.4% || GR00T-N1.6联合微调的通才模型 | 59.6% || DyPES-VLA联合微调的通才模型 | **75.6%** |倒水这个任务在人形机器人G1上表现最能说明差距的显著性。ACT这个需要单独训练的方法在G1倒水任务上的成功率是0%完全失败GR00T-N1.6提升到32%而DyPES-VLA达到52%。把书放到书架上这个任务上ACT在G1上也是0%成功GR00T-N1.6是24%DyPES-VLA是36%。这些数字背后说明的是人形机器人的控制难度天然比单臂、双臂高得多因为自由度更多、平衡要求更复杂而一个能学到跨身体共享规律的模型在最难啃的那个身体上反而拉开了更大的相对优势。拆解每个部件到底有没有用消融实验论文还专门做了消融实验一块块拆掉某个设计看看性能会掉多少这样才能确认每个部件真的在起作用而不是碰巧凑效果。| 去掉的部件 | RoboTwin | RoboCasa-GR1 | LIBERO ||---|---|---|---|| 完整DyPES-VLA | **89.02** | **59.25** | **98.0** || 去掉未来预测目标 | 86.67 | 56.75 | 96.1 || 去掉第一阶段预训练 | 87.76 | 58.33 | 96.7 || 换成共享的动作头去掉MoE | 87.85 | 57.17 | 96.8 || 去掉机器人身份元数据 | 88.50 | 58.75 | 97.6 |从数字上看去掉未来预测这个目标掉分最狠RoboTwin掉2.35分RoboCasa掉2.5分LIBERO更是掉了1.9分。这说明预测未来这件事确实是整个方案里最有含金量的一步不是可有可无的装饰。去掉MoE换成共享动作头损失也不小尤其在人形机器人任务上掉了2.08个百分点验证了前面说的不同身体的动作确实需要专属处理硬挤在一起会互相打架。为了进一步证实未来预测这一步到底学到了什么论文还做了一个挺有意思的探针实验。他们训练了一个简单的线性分类器专门去检测查询状态里到底能不能读出接触即将开始或结束的信息也就是判断机器人手爪是否快要碰到物体、或者快要松开物体。结果显示完整版模型在这个判断任务上的AUPRC指标一种衡量分类效果的指标数值越高说明区分能力越强在接触即将开始这一项上达到86.3%而去掉未来预测目标的版本只有70.8%差了整整15.5个百分点。这个数字挺让人意外的说明未来预测这个训练目标真的在查询状态里埋下了关于接触因果这类物理规律的信息而不只是一个听起来好听但实际没什么作用的花架子。写在后面读完这篇论文让我印象最深的其实不是那个98%的成功率数字而是那个接触检测探针实验。因为它做的是一件很朴素的事直接打开黑箱去验证未来预测这个训练目标到底有没有在模型内部留下痕迹。很多论文里的辅助训练目标效果好可能只是碰巧但这个探针实验用一个具体的、可量化的方式证明了因果关系,不是加了这个loss效果变好了而是加了这个loss之后模型内部确实多了一种可以被读出来的、关于物理接触的知识。这种验证方式比单纯堆砌成功率数字更让人信服。另一个值得琢磨的地方是论文里提到的三种机器人身体单臂、双臂、人形覆盖的自由度跨度从7一路到29几乎是四倍的差距但整个框架没有为每种身体单独设计任何手工规则的坐标变换这在工程上其实是个挺大的取舍。省去了大量人工对齐的工作量但代价是模型必须自己学会翻译训练数据的规模和质量要求会更高。论文没有细讲万一遇到第四种、第五种完全陌生的机器人身体时这套MoE专家系统要怎么扩容,是重新训练一个新专家还是能靠已有专家插值出来这个问题留在了论文之外倒是挺值得追问的。QAQ1DyPES-VLA是什么ADyPES-VLA是香港科技大学广州团队提出的一种跨身体机器人操控模型核心思路是先用预测未来画面的方式学习不同机器人通用的物理动态规律再用专属的混合专家MoE动作头把这些规律翻译成每种机器人自己的动作指令不需要手动统一不同机器人的动作格式。Q2DyPES-VLA在哪些机器人平台上做了测试A仿真环境测试了三个平台RoboTwin 2.014自由度双臂机器人、RoboCasa-GR129自由度人形机器人、LIBERO7自由度单臂机器人单一检查点分别拿到89.02%、59.25%、98.0%的成功率。真实机器人测试用了Franka Research 3单臂、AgileX COBOT Magic双臂、Unitree G1人形三种物理平台联合微调后平均成功率达到75.6%。Q3DyPES-VLA为什么不需要手动统一不同机器人的动作格式A因为它把共享的物理规律和专属身体的控制细节拆开处理了。共享部分靠未来预测任务训练出的查询状态来承载专属部分靠MoE动作头里针对每种机器人的专属编码器、解码器和前馈专家来处理每个机器人保留自己原生的动作空间不需要提前做坐标变换或逆向运动学计算。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门