Command Palette
Search for a command to run...
超越数据扩展:面向视觉-语言-动作模型的表征中心持续预训练
超越数据扩展:面向视觉-语言-动作模型的表征中心持续预训练
摘要
扩展机器人数据对于构建通用视觉-语言-动作(VLA)模型至关重要,然而机器人轨迹本质上比网络规模的图像-文本数据更难扩展,因为它们需要具身采集且对物理世界的覆盖十分稀疏。这使得表征质量成为核心瓶颈:在固定的机器人数据预算下,VLA 持续预训练必须将有限的轨迹转化为可迁移的视觉-动作知识,而非仅仅拟合动作。我们提出 VLAct,一种面向 VLA 的 VLM 主干网络,采用表征中心的持续预训练方案进行训练,从预训练 VLM 出发,在广泛、异构、多具身机器人数据上进行训练,再进行下游任务特定的微调。VLAct 保留了广泛的 VLM 先验,避免主干网络过度特化于单一动作头,并通过 VLM 先验保持、多头连续动作协同监督以及部分统一的跨具身动作布局来促进跨具身的共享动作语义,同时允许下游用户在微调阶段自由附加任务特定的动作头。在多具身仿真基准、真实世界机器人实验和未见具身迁移中,VLAct 在固定微调协议下持续提升下游性能。在 LIBERO-Plus 和 RoboTwin 2.0 上,VLAct 超越了 ABot-M0 和 LingBot-VLA 等大规模工业 VLA 系统,分别达到 82.6% 和 92.5% 的成功率。在最近发布的 RoboDojo 仿真基准上,VLAct 取得了 10.66 的平均分和 7.60% 的成功率,按成功率在所有策略中排名第六。它在两项指标上均优于所有明确标注为世界-动作模型(WAM)的参赛系统以及多个工业开发的系统。最值得注意的是,在 RoboCasa-GR1 这一持续预训练阶段从未见过的仿人具身上,仅使用 20% 下游轨迹的 VLAct 就已超越使用全量数据的 GR00T-N1.6 基线。这些结果完全基于开源数据和仅 16 块 GPU 的训练配置获得,表明表征中心的持续预训练能够在适度的计算预算下提供极具竞争力的性能,是超越数据扩展之外推动 VLA 进步的重要独立维度。所有模型和训练流程均已开源。
一句话总结
作者提出了 VLAct,一种以表征为中心的视觉-语言-动作模型持续预训练方案,该方案保留 VLM 先验,并采用多头连续动作协同监督与部分统一的跨具身动作头,实现了最先进的多具身性能,包括在 LIBERO-Plus 上达到 82.6%,在 RoboTwin 2.0 上达到 92.5%,且仅使用 20% 的数据就在未见的人形机器人具身上超越了 GR00T-N1.6。
核心贡献
- VLAct 是一个面向 VLA 的 VLM 骨干网络,采用以表征为中心的持续预训练方案进行训练,从预训练的 VLM 出发,使用广泛异构的多具身机器人数据;该方案结合了 VLM 先验保护、多头连续动作协同监督以及部分统一的跨具身动作布局,同时允许下游用户在微调阶段附加任务特定的动作头。
- 受控探测实验表明,离散 FAST-token 预训练会丢弃细粒度的时间和幅度信息,而单头连续监督可能导致特定头的表征坍缩,这促使 VLAct 采用多头连续协同监督。
- 在固定的微调协议下,VLAct 在 LIBERO-Plus 上达到 82.6% 的成功率,在 RoboTwin 2.0 上达到 92.5%,超越了 ABot-M0 和 LingBot-VLA,在 RoboDojo 上获得 10.66 的平均分和 7.60% 的成功率。在未见的人形机器人 RoboCasa-GR1 基准上,使用仅 20% 下游轨迹的 VLAct 超越了使用全量数据的 GR00T-N1.6 基线,且完全基于开源数据和 16-GPU 训练设置。
引言
视觉-语言-动作(VLA)模型旨在将网络规模的表征学习引入机器人控制,但机器人轨迹必须通过物理执行来采集,且仅为跨越场景、物体、任务、具身和接触动力学的组合交互空间的稀疏样本。此前的 VLA 持续预训练通常将该阶段视为大规模动作拟合,这可能会侵蚀通用的视觉-语言先验,使骨干网络过度特化以适应某个动作头的解码几何,并通过孤立的机器人特定头削弱跨具身共享。作者提出了 VLAct,一种以表征为中心的持续预训练方案,通过浅层保护和标注数据混合来保留 VLM 先验,应用多头连续动作协同监督使动作特征保持广泛可解码,并使用部分统一的跨具身动作布局和针对周期性关节的环绕感知损失。这些组件在下游任务特定的微调之前塑造了一个可迁移的骨干网络。
方法
作者提出了 VLAct,一种以表征为中心的视觉-语言-动作(VLA)模型,该模型对从视觉-语言模型(VLM)初始化的可复用 VLA 骨干网络进行持续预训练。整体流程包含一个持续预训练阶段以塑造骨干网络,随后是一个微调阶段,在该阶段中预训练头和标注流被丢弃。在微调期间,附加一个全新初始化的任务特定动作头,确保下游性能提升源于学习到的骨干表征,而非预先适配的动作头。
为防止朴素的以动作驱动的持续预训练覆盖从广泛网络规模数据中学到的强视觉-语言表征,作者实现了两种保护机制。首先,通过在预训练期间冻结整个视觉编码器和 LLM 层的下半部分,应用浅层保护。这保护了低层视觉处理和早期视觉-语言对齐,同时允许上层适配动作条件推理。其次,采用标注混合预训练,将机器人轨迹与标注数据混合。标注数据提供了对物体、属性和空间关系的密集监督,用鲁棒的视觉-语言监督锚定可训练层。
为确保骨干网络支持头的迁移并学习高质量的动作特征,而非过拟合到特定的头几何结构,作者引入了协同监督的多头预训练。三个有代表性的连续动作头(OFT、PI 和 GR00T)并行附加到共享的 VLA 骨干网络。给定相同的视觉-语言输入,骨干网络产生一个共享的潜在表征 z,每个头预测相同的地面真值动作块 a。训练目标被公式化为:
Laction=LOFT+LPI+LGR00T.这种多头监督迫使骨干网络以头无关的形式编码动作信息,防止表征朝向单个解码器几何结构坍缩,并提高了跨不同下游头的迁移能力。
为处理不同机器人具身之间的变化,同时不将不兼容的自由度强制纳入同一坐标,VLAct 采用部分统一的跨具身动作空间。作者不是使用孤立的具身特定头或朴素的完全统一空间(对低维机器人进行填充),而是使用单一个共享的动作头,其中动作空间仅在物理上可比的维度上统一。
具体而言,夹爪维度在具身之间共享,因为打开和关闭命令具有可比拟的语义,而当机器人具有不同运动学时,手臂维度保持具身特定。在训练期间,每个样本仅在其特定具身的活跃维度上贡献损失,非活跃维度被遮盖。此外,为解决绝对关节角度的参数化问题(标准回归将 179∘ 和 −179∘ 视为相距很远),作者在周期性关节角度维度上应用环绕感知损失,以 360∘ 为模度衡量角度残差。
实验
初步研究通过固定 Qwen3-VL-4B 骨干网络并变化离散和连续头,孤离了动作头轴,表明明示离散监督粗略地迁移但丢失了细粒度动作信息,而单头连续监督可能导致特定头的表征坍缩。主要实验在开源 Franka 和 AgilX 数据上预训练 VLAct,并附加标注以保护 VLM,然后在 LIBERO-Plus、RoboTwin 2.0、DOMINO、真实世界 Franka 任务以及保留的 GR-1 和 ARX X5 具身上进行评估。VLAct 在相相同骨干网络的基线上提升了鲁棒性和真实世界泛化能力,在跨下游动作头中保持稳定,并以数据高效的方式迁移到未见机器人,支持了其学习可复用动作表征而非头特定或具身特定特征的结论。
在 LIBERO-Plus 鲁棒性基准上,VLAct 报告了最高的整体成功率达 82.6%,超过 Qwen3VL-OFT 7.6 个百分点和 Abot-M0 2.1 个百分点。提升集中在相机、机器人、噪声和布局扰动上,表明持续预训练带来了更强的视觉空间鲁棒性。在列出的先前方法中,OpenVLA-OFT 以 69.6% 的总成功率排名最高,其次是 π0-FAST 的 61.6%。VLAct 实现了 82.6% 的最佳整体成功率,分别优于 Qwen3VL-OFT 和 Abot-M0 7.6 和 2.1 个百分点。相比 Qwen3VL-OFT 的增益在相机、机器人、噪声和布局扰动上最大,表明视觉空间表征得到改进。
在 RoboTwin 2.0 上,VLAct 在比较的方法中建立了最强的 Base 设置结果,并在 Data Scaling 设置中保持竞争力。其 VLAct-OFT 配置达到 92.5% Clean 和 90.8% Random 成功率,超越了多个更大规模的 VLA 和世界-动作-模型基线,同时接近顶级系统。仅在干净的 Base 微调后的强劲 Random 表现表明预训练骨干网络同时提升了采样效率和对视觉分布偏移的泛化能力。VLAct 在比较的方法中实现了最强的 Base 设置表现。在 Data Scaling 中,VLAct-OFT 超越大规模系统如 InternVLA-A1、Being-H0.7、Motus、LingBot-VLA、ABot-M0 和 π,同时接近 HoloBrain-0 和 Fast-WAM。仅在干净的 Base 轨迹上微调后,VLAct 仍在随机化评估集上表现强劲,表明在视觉和场景变化下改进了干净到随机的泛化。在 Data Scaling 设置中附加随机专家演示,相比已发布的基线,产生较高的 Clean 和 Random 成功率。
VLAct 在 RoboDojo 排行榜上按平均分和成功率均位于前四分之一,并且其跨具身迁移超越了所有被明确标注的世界-动作-模型条目。尽管完全使用开源数据和 16-GPU 持续预训练设置,它也超越了若干个业界开发的系统。最大优势出现在 Precision 和 Long-Horizon 任务上,而 Memory 仍是一个相对弱点。VLAct 在 35 个策略中平均分排名第八,成功率排名第六,两项指标均位于前四分之一。在两项综合指标上,它超越了每一个明确标注的世界-动作-模型条目,包括最强的 WAM。相比基于 Qwen3-VL 的条目,最大增益出现在 Precision 和 Long-Horizon 任务上,而 Memory 是一个明显的限制。
评估涵盖鲁棒性、泛化性和跨具身技能迁移。在 LIBERO-Plus 上,持续预训练增强了视觉空间表征,最大鲁棒性增益出现在相机、机器人、噪声和布局扰动下。在 RoboTwin 2.0 上,VLAct 实现了最强的 Base 设置结果,并在仅使用干净轨迹微调后保持了强劲的干净到随机的泛化。在 RoboDojo 上,VLAct 排名前四分之一,并超越了世界-动作-模型基线,尤其在 precision 和 long-horizon 任务上,而 memory 仍是相对限制。