【CoRL 2025】Long-VLA:长时程机器人操作,把“移动—交互“分相掩码装进端到端 VLA|从长时程机器人操作统一范式视角
摘要本文解读 CoRL 2025 论文《Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation》。该论文提出Long-VLA通过融合移动—交互分相数据分解、输入级注意力掩码与统一端到端训练让视觉-语言-动作模型在十连操作任务上仍保持可用成功率其特别之处在于分相先验不改动输入结构、只改注意力的可见性因此可以像插件一样插进任何已有 VLA。实验表明L-CALVIN 十连任务平均完成数达到 4.75GR-1 只有 2.96、RoboVLMs 2.88第 10 个任务成功率 0.20、是同类基线 0.03–0.04 的五倍以上真机清洁任务在四个时程上相对提升 50%–226%为长时程具身操作提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQLong-VLA 与两阶段训练的本质区别是什么为什么用掩码而不是直接删掉一路相机输入这个方法能直接插到我现有的 VLA 上吗L-CALVIN 和原版 CALVIN 有什么不同长时程任务的收益主要来自哪里有哪些需要留意的细节参考链接论文基本信息项目内容标题英文Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation标题中文长时程机器人操作把移动—交互分相掩码装进端到端 VLA作者Yiguo Fan, Pengxiang Ding, Hongchao Lu, Fengqi Dai, Shuanghao Bai, Wei Zhao, Yang Liu, Badong Chen, Xinyang Tong, Yuyang Zhu, Siteng Huang, Zhaoxin Fan, Donglin Wang机构西湖大学机器智能实验室MiLAB· 浙江大学 · 西安交通大学 · 北京航空航天大学会议CoRL 2025第 9 届 Conference on Robot Learning首尔arXiv2508.19958项目网站arXiv 摘要页与项目页背景与动机视觉-语言-动作模型VLA这几年的主线是规模换能力用海量机器人数据预训练一个统一策略让它听懂语言、看懂画面、直接输出动作。但现有 VLA 框架几乎都是为短时程任务设计的——单步抓取、推拉、开关语义空间和动作空间都相对受限。一旦把任务拉长成连续五到十个步骤性能就会明显崩塌。崩塌的根因在论文里被明确命名为skill chaining技能链问题。主流做法是把长任务拆成若干子任务、每个子任务配一个局部策略这确实降低了单步学习难度但子任务之间的交接与依赖没有人建模动态耦合和误差传播会在任务边界上累积越往后越难恢复。已有的三条补救路线都各有一处硬伤——Plan-Seq-Learn 这类在线自适应优化依赖奖励信号与 VLA 典型的大规模离线训练范式对不上模块化架构把运动规划与执行拆成两段破坏了联合训练只做视觉表征或视觉规划的方法又缺少直接的执行接口。论文的核心洞察是换相时刻真正的敌人不是能力不足而是初始状态的分布漂移。既然每一相都有自己最依赖的观测移动阶段依赖第三人称导航视角交互阶段依赖腕部近距离视角那么只要在切换时改变模型该看哪一路相机就能在不新增模块、不引入奖励的前提下缓解漂移。这个先验最终被压缩成一条注意力掩码——代价几乎为零却让长时程任务第一次在端到端框架内变得可解。图 1论文原图Figure 1四栏并列对比四种范式——(a) 朴素端到端 VLA统一模型、仅短任务、不解决 skill chaining(b) 两阶段模型移动与交互分别训一个策略仍不解决 SC(c) 两阶段 输入级自适应用不同模态应对不同阶段但两阶段无法联合训练(d) 本文 Long-VLA统一模型 输入级掩码同时解决长时程与 SC。右下角给出 L-CALVIN 10 任务成功率曲线与消融雷达图。研究主线从问题到结论图 9Long-VLA 的研究主线Mermaid 流程图长任务一连 10 步就崩 → 根因是换相时刻的状态漂移 → 设计上把数据拆成移动/交互两相 → 方法上用注意力掩码控制可见性 → 在 L-CALVIN 10 连与真机 8 连上验证 → 平均完成数 4.75 对基线 2.88。基准/方法设计论文同时交付了两样东西一个新基准L-CALVIN和一套把分相先验写进网络的机制。L-CALVIN 的改动点原版 CALVIN 只评测五连任务并把 34 个任务归成 11 个大类同一大类不能出现在同一序列里序列长度和生成效率都被卡住更关键的是现有模型在更长序列上的性能会收敛到相似水平说明这是模型无关的共性问题必须显式测量。L-CALVIN 因此把序列长度从 5 扩到 10解除类别约束、让 34 个任务各自独立成类可行动序列组合大幅增加方块操作类任务数量约翻三倍并把序列生成从随机采样 事后校验换成增量式可行任务选择无需校验即可构造长序列。轨迹随后按物体位移切成移动段与交互段切点取物体状态变化前 10–15 帧窗口长度 64 帧移动阶段指令由模板自动增广最终得到覆盖 34 个任务、共 372 条语言指令的数据集。分相先验如何写进网络每个 token 分配一个二值开关 $m_i$两个 token 的掩码相乘得到注意力可见性 $M_{ij} m_i m_j$注意力权重随之改写为 $A_{ij} \frac{\exp(P_{ij})M_{ij}}{\sum_k \exp(P_{ik})M_{ik}}$。这样做的关键在于输入结构完全不变所有 token 依然在序列里只是被看不见了。相比之下直接删掉整条模态会让输入分布发生跳变换相瞬间反而更难适应。相位信息则通过动作向量末尾追加的一维标识 $s_p \in {-1, 1}$ 传入推理时从 $-1$ 起步。图 2论文原图附录 Figure 9(a) Independent 设置下每个子任务都从训练分布内的状态出发Continuous 设置下子任务串行执行导致分布漂移(b) 即使剔除前序任务干扰单个子任务的成功率仍随任务序号持续下降(c) 在推、抬、旋转三类任务上对比 Independent 与 Continuous连续执行后单任务性能被明显拉低——这三组实验共同证明长时程退化是模型无关的共性问题。分类全景图 10长时程操作的四条路线Mermaid 分类图分层分解CALVIN / HULC、规划执行解耦Plan-Seq-Learn、统一输入调制MDT / 本文 Long-VLA、在线自适应依赖奖励信号、难与离线训练兼容——Long-VLA 属于“统一输入调制”一路。方法细节Long-VLA 的整体管线可以按数据—编码—解码三段来看。数据侧每条轨迹被切成 moving 段与 interaction 段切点取物体状态变化前 10–15 帧移动阶段指令用模板自动增广例如move to the top side of the red block交互阶段保留原始指令。动作向量扩成 $[x, y, z, eu_r, eu_y, eu_z, s_g, s_p]$其中 $s_p -1$ 表示移动相、$s_p 1$ 表示交互相。编码侧腕部相机与静态相机各用一个可训练的 ResNet-18 编码目标用冻结的 CLIP 编码——有语言指令时用文本只有无标注 play 数据时用未来帧充当视觉目标检测模块在 CALVIN 子集上用 LoRA 微调 Grounding DINOSwin-OGC 变体输出的检测框经可学习位置编码后通过 FiLM 机制注入静态视角特征。所有模态特征拼接后送进 GPT-2 风格的多模态 Transformer。解码与损失动作由条件扩散模型生成推理用 DDIM 采样总损失为扩散损失加零点一倍的目标对齐损失即 $\mathcal{L} \mathcal{L}{\text{diff}} 0.1\,\mathcal{L}{\text{goal}}$。训练细节上仿真部分从零训练 40 个 epoch、学习率 $1\times10^{-4}$、批大小 128在 4 张 80 GB 的 A100 上约 18 小时真机每个任务单独训一个模型、各训 800 个 epoch约 28 小时。真机数据为每任务 200 条遥操作演示采集时按键即时完成相位标注外加约 2 小时无标注探索数据。图 3论文原图Figure 2(a) 数据与相位分解——轨迹按物体状态变化切成 moving / interaction 两段视觉观测与语言标注同步对齐(b) 输入级掩码——$M_{ij}m_i m_j$ 让注意力只在活跃 token 对之间计算不改动输入结构(c) 端到端训练——分解后的数据经多模态 Transformer 编码器送入扩散策略动作头同时输出位置增量 $\Delta T$、朝向增量 $\Delta R$、夹爪状态 $s_g$ 与相位标识 $s_p$。实验设计与结果评测分仿真与真机两部分。仿真用 L-CALVIN 的 D$\to$D 与 ABCD$\to$D 两个划分序列长度 5 到 10骨干选用 MDT真机用一台 UR5e 机械臂配两路相机斜前方 RealSense L515 提供第三人称视角腕部 USB 相机用于近距离操作设计两个任务Sorting要求按 CORL 顺序把四个方块放进碗里序列长度 8Cleaning要求按键、抓玉米、放入水槽序列长度 4。真机每个任务 20 次试验分位置、光照、视觉干扰三种条件统计成功率。方法任务 1任务 5任务 10平均完成数GR-10.830.240.042.96RoboVLMs0.810.280.032.88Base Policy (MDT)0.860.370.114.11Long-VLA0.920.430.204.75在更难的 ABCD$\to$D 划分上差距进一步放大VLAS 平均完成数 5.00、GR-1 5.68、RoboVLMs 6.04而 Long-VLA 达到 8.24接近八连任务全部完成第 10 个任务的成功率是 0.56为 RoboVLMs 0.34 的 1.6 倍。真实世界的一致性同样明显。Sorting 任务上基础策略从第 7 个任务起成功率归零Long-VLA 在全部 8 连任务上仍保持接近 25% 的完成率Cleaning 任务的四个时程则从 12/20→18/20、8/20→14/20、5/20→13/20、3/20→11/20相对提升 50% / 75% / 160% / 226%。消融配置Dec. 分解 / Inp. 输入自适应 / Uni. 统一模型真机 Sorting仿真 D$\to$D✗ / ✗ / ✓2.34.11✓ / ✗ / ✓3.61.34.420.31✓ / ✓ / ✗4.11.84.760.65✓ / ✓ / ✓5.53.24.810.70图 4论文原图Figure 3左侧为真机平台——Universal Robots UR5e 机械臂 斜前方 RealSense L515 第三人称相机 腕部 Microdia USB 相机桌面含碗、方块、玉米与水槽右上为 Sorting 任务按 CORL 顺序依次抓起 C/O/R/L 四个方块放入碗中8 步右下为 Cleaning 任务按下蓝色按钮、抓起玉米、放入水槽、按下黄色按钮4 步。图 5论文原图Figure 4上方是 L-CALVIN 任务链缩略图推红块、开抽屉、推滑块等下方表格每格代表完成连续 k 个任务的累计成功率两行分别为 Base Policy 与 Long-VLA括号内是相对提升——到第 8、9、10 个任务相对提升分别达到 42% / 100% / 81%。图 6论文原图Figure 5上方是 8 帧连续演示Lift the C cube → Put in the bowl → … → Lift the L cube下方表格给出随机位置、未见光照、视觉干扰三种条件下 Base Policy 与 Long-VLA 的累计成功率——基础策略第 7 个任务后归零Long-VLA 全 8 连仍保持约 25%。图 7论文原图附录 Figure 10在 Sorting 第 2 步、Cleaning 第 1 步之后分别对下一目标位置、光照与视觉干扰做扰动再评估后续任务的成功率。结果为基础策略掉约一半、Long-VLA 稳定在 80% 左右Sorting 12/20→15/20、8/20→17/20、14/20→17/20Cleaning 10/20→14/20、8/20→18/20、13/20→17/20。图 8论文原图附录 Figure 11左为 Cleaning、右为 Sorting各分未见光照与视觉干扰两组柱状图比较 Long-VLA 与 $\pi_0$——在两类域外条件下 Long-VLA 在每个时程上都保持领先。结果对比总结图 11长时程完成数的对比路径Mermaid 流程图GR-1 2.96 / RoboVLMs 2.88 → 同骨干 Base Policy 4.11 → Long-VLA 4.75第 10 个任务优势放大到 0.20 对 0.03真机 Cleaning 最低时程从 12/20 提至 18/20。关键发现差距全部出现在第 6 个任务之后前 3 个任务各方法都接近饱和Long-VLA 0.92、GR-1 0.83、RoboVLMs 0.81真正的分水岭在第 10 个任务——0.20 对 0.03–0.04相差 5 倍以上。相对增益随任务序号单调上升L-CALVIN 上第 8、9、10 个任务的相对提升分别为 42%、100%、81%说明子任务越靠后、初始状态漂移越严重分相掩码的作用越大。真机清洁任务的收益高于排序4 个时程相对提升 50%–226%而排序任务的绝对完成率约为 25%——动作类型与视觉干扰越多换相鲁棒性的价值越高。受控扰动实验给出因果证据人为扰动下一个目标的位置/光照/干扰后基础策略成功率掉约 50%Long-VLA 稳定在 80% 附近Cleaning 光照条件下相对提升达 125%。掩码学到的正是人工先验可学习掩码下移动阶段有 86.71% 的样本屏蔽腕部视角交互阶段有 87.78% 屏蔽静态视角说明模型自发复现了分相设计而非拟合噪声。架构无关性经过双骨干验证换成 HULC 骨干平均完成数从 2.65 升到 3.300.65MDT 骨干上从 4.11 升到 4.810.70——收益来自掩码本身而不是某个特定骨干。局限性分相标注依赖人工训练数据的分相目前靠人工设计与采集时按键标注完成作者认为未来可交给视觉语言模型自动处理。任务面偏窄验证的都是桌面操作类长时程任务对于障碍规避这类更复杂的场景分相掩码是否仍然有效并未验证作者在附录中将其列为 open concern。更长序列仍会失败模型能缓解初始状态差距但面对执行失败、或精确初始条件下的失败仍需要进一步改进。迁移性待扩展目前只验证了 MDT 与 HULC 两个骨干更多模型框架的可迁移性被列为未来工作。评测规模有限真机每个任务 20 次试验、两个任务统计粒度仍是论文级而非产线级。常见问题FAQLong-VLA 与两阶段训练的本质区别是什么两阶段做法让移动与交互各训一个模型数据被切成两半、容量也不共享Long-VLA 用一条掩码把两相数据合进同一个策略因此数据规模不减半。消融显示分解 输入自适应但不统一在真机上是 4.1统一之后跳到 5.5。为什么用掩码而不是直接删掉一路相机输入直接删除会让输入分布在换相瞬间跳变模型需要重新适应掩码保留全部 token只把不需要的 token 从注意力中隐藏因此换相是平滑的。这也是它被称为输入级自适应而非模态裁剪的原因。这个方法能直接插到我现有的 VLA 上吗可以。掩码只作用于注意力可见性不改输入输出接口因此论文用两个不同骨干MDT 与 HULC验证了架构无关性两者都获得了稳定提升。L-CALVIN 和原版 CALVIN 有什么不同序列长度从 5 扩到 1034 个任务不再归成 11 个大类而是各自独立成类可行动序列组合大幅增加序列生成从随机采样 事后校验改成增量式可行任务选择轨迹额外按物体位移切成移动与交互两相。长时程任务的收益主要来自哪里来自换相时刻的鲁棒性而不是单步能力。前 3 个任务上各方法几乎打平差距全部出现在第 6 个任务之后受控扰动实验也显示基础策略掉约 50%而 Long-VLA 稳定在 80% 附近。有哪些需要留意的细节论文中存在若干笔误与未完成项例如摘要里的模型名写作 Long-WLA、正文有一处未解析的交叉引用、摘要末尾的项目页链接仍是占位文本这些不影响方法本身但阅读原文时容易困惑。参考链接Long-VLA 论文arXiv:2508.19958MDTMultimodal Diffusion TransformerRSS 2024CALVIN 长时程语言条件操作基准RA-L 2022GR-1大规模视频生成预训练用于视觉机器人操作ICLR 2024RoboVLMs构建 VLA 的关键要素研究arXiv:2412.14058Plan-Seq-Learn语言模型引导 RL 解决长时程任务ICLR 2024给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件