Command Palette
Search for a command to run...
迈向可预测、对齐且可扩展的机器人学习
迈向可预测、对齐且可扩展的机器人学习
摘要
学习的核心不仅在于记忆,更在于通过探索可能性空间进行推理并应对新问题。本文提出Lumo-2,一种潜在世界-动作模型,通过在潜在空间中推理世界动态来生成动作。学习到的潜在世界动态捕捉了基于物理的视觉转换,自然编码了可由动作引发的未来可能性,并为跨模态对齐提供了统一基础。该框架实现了类似世界模型的预测推理,同时保持轻量级并专注于与控制相关的物理动态演化。我们方法的核心假设是动作生成质量由潜在空间的几何结构决定。我们观察到,标准的基于重建的动作分词目标会导致表征偏向低级信号保真度,容易使重建质量与下游控制性能之间出现错位。为解决这一局限,我们提出了一种多阶段模态预对齐策略,逐步将动作表征与潜在世界动态、视觉和语言对齐。这一过程强化了跨模态一致性,促进了抽象化,并诱导出语义结构化的潜在空间,有利于预测推理并改善扩展特性。我们对潜在世界建模和模态对齐进行了系统的实证研究,分析了它们在扩展规律和分布外泛化中的作用。结果表明,Lumo-2在强视觉-语言-动作模型和世界-动作模型基线上取得了持续提升,在需要时序推理、物理理解或高控制复杂度的挑战性现实任务中表现尤为突出,例如长时程和灵巧操作。这些发现表明,结构化的多模态对齐与预测推理相结合,是推进通用具身智能的基本原理。
一句话总结
Astribot团队提出了Lumo-2,一种潜在世界-动作模型,采用多阶段模态预对齐策略,将动作表示与潜在世界动态、视觉和语言对齐,克服了基于重建的tokenization的错位问题,并实现了对需要时序推理和物理理解的挑战性现实世界任务的预测推理和可扩展控制。
核心贡献
- Lumo-2是一种潜在世界-动作模型,通过在紧凑的潜在空间中基于学习到的世界动态进行推理来生成动作,从而在推理时无需显式的像素级推演即可实现未来感知决策。
- 多阶段模态预对齐策略逐步将动作表示与潜在世界动态、视觉和语言对齐,强化跨模态一致性,并诱导出具有语义结构的潜在空间,改善扩展特性。
- 在现实世界操作任务上的系统实验表明,Lumo-2在视觉-语言-动作和世界-动作模型基线之上取得了持续的优势,尤其是在长时程和灵巧任务上改进显著,分析揭示了更好的扩展行为与分布外泛化能力。
引言
作者们致力于构建能够主动预测未来物理可能性而非仅记忆训练数据的通用机器人策略。先前如Lumo-1等视觉-语言-动作(VLA)模型采用显式文本推理链,但灵活性有限、可扩展性差且推理延迟高。更广泛地说,对齐异构模态——连续动作、高维视觉观测、抽象语言和潜在世界动态——十分困难,因为简单的联合训练会导致不稳定和泛化性差。作者引入了Lumo-2,一种潜在世界-动作模型,用紧凑的、物理基础的潜在动态空间取代显式推理。三阶段渐进式训练范式将动作 tokens 与潜在世界动态、视觉和语言对齐,将动作模态视为一等公民。这使得无需昂贵的像素级推演即可进行未来感知推理,并改善了端到端机器人控制的扩展行为。
数据集
作者构建了一个异质多源数据集用于训练Lumo-2模型,涵盖机器人操作、自我中心人类视频、通用互联网视频和大规模视觉-语言语料库。
机器人操作数据
- 自行采集的Astribot S1数据,动作速度与人类演示相当。
- 来自不同平台的跨形态数据集:双臂人形机器人(AGIBot Genie-1、Galaxea R1 Pro、RealSource RS-02)和桌面双臂机器人(ARX、Agile X、YAM)。
- 对跨形态数据应用分布去偏方法,以缓解动作速率歧义。
自我中心人类视频数据
- 来源于EgoTaskQA、EPIC-KITCHENS和Ego4D。
- 在第一阶段训练中,这些视频仅通过视觉分支处理,提供丰富的世界动态而没有动作标签。
通用互联网视频
- 在第三阶段用于从自然场景中学习世界动态。
视觉-语言数据(VLM语料库)
- 通用多模态理解:FineVision数据集(2430万图像-文本样本)作为主要的指令微调集,并辅以大规模视频理解语料库用于时空动态。
- 定位:对象、区域、可供性定位以及带有标准化坐标输出的轨迹预测。
- 规划:来自先前Lumo-1数据和EO-Data1.5M数据集的机器人操作序列。
- 认知:对象属性描述、空间推理(大小、距离、视角)、计数和自我中心任务理解,基于ScanNet、ScanNet++和Molmo-2构建。
数据处理与使用
- 所有视觉输入均为5帧时间序列,调整尺寸为224×224,以30 FPS视频每隔8帧采样。
- 机器人数据使用多视图融合(头部视图查询腕部视图);自我中心人类视频仅使用头部视图。
- 动作数据被分解为8个语义组(躯干、双臂,每臂分为平移、旋转和夹爪组件),并从32帧压缩到4帧以匹配视觉分支的分辨率。
- 在第一阶段,采用混合批次策略:人类自我中心数据仅通过视觉分支流动,而机器人数据在视觉和动作分支上联合训练。
- 在第三阶段,VLM数据、视频数据和机器人数据共同训练,以整合世界知识、动态和机器人行为。
方法
Lumo-2是一个端到端、历史上下文感知的潜在世界-动作模型,联合建模潜在世界动态、动作块和文本输出的分布。模型并非直接从观测预测动作,而是首先推断潜在世界动态 ϕ,然后以该潜在表示为条件生成动作。高层潜在世界动态分布和低层动作分布均在一个统一的单一多模态Transformer中参数化。
从单时间步观测建模动作生成本质上是不适定的,因为部分可观测性和动作推断中的歧义。例如,在典型的“倒水”任务中,相同的瞬时观测可能对应不同的执行阶段。显示倒水前后的透明水环境面板具有相似的视觉观测,而正在倒水过程中的单次观测并不能表明动作是否应该继续。
为解决这种动作歧义并捕获时间一致的控制先验,作者引入了短期记忆机制。他们将观测增强为时间上下文缓冲区 ωt−H′:t,提供了近期历史的紧凑摘要,使模型能更好地推断潜在动态。模仿训练目标扩展到以该上下文缓冲区和指令为条件,加上观测。
为了应对动作tokenization中重建精度与下游控制性能之间的错位,作者提出了三阶段渐进式训练范式。
阶段1:将动作与潜在世界动态对齐 目标:构建物理基础的潜在世界动态空间,并获得具有全局上下文感知的动作编码器。作者采用联合训练范式,通过特征融合和双向约束,在动态潜在 ϕ 与动作潜在 A 之间实现早期对齐。他们强制视觉表示对动作重建做出贡献,保留预测物理运动的视觉成分,同时抑制干扰信号。
阶段2:将动作与视觉和语言对齐 在阶段1的动态-动作对齐基础上,阶段2明确纳入视觉和语言模态,将学习到的动作tokens转化为富含语义的表示。
作者为阶段1训练的动作编码器增加了一个语义模块,将原始动作潜在转化为由新码本表示的富含语义的潜在。该模块利用视觉动态作为先验约束,赋予动作tokens语义可解释性。为实现跨模态对齐,他们采用多任务学习,目标包括动作重建、行为理解、视觉-语言引导的动作生成、跨模态预测以及跨模态动作对比与判别。
阶段3:VLM、视频和机器人数据联合训练 为了构建一个保留丰富世界知识的通用机器人基础模型,作者构建了一个包含高质量视觉-语言数据的大规模数据集。该数据集特别强调定位、认知和规划,同时纳入多样化的通用多模态理解数据。
精心构建的数据集旨在增强核心具身推理能力,同时保留预训练VLM的通用多模态理解与推理能力。它包括通用多模态理解数据,定位数据涵盖对象、区域、可供性定位和轨迹预测,操作规划数据,以及认知数据,涵盖对象理解、空间推理、计数和自我中心任务理解。
最后,为提高实时机器人控制的推理速度,作者采用块式自回归(Block-wise Autoregression, BAR)。BAR不是标准的下一token预测,而是通过用允许块内注意力的块式因果掩码替换标准因果掩码,在单次前向传播中预测下一个token块,显著降低了端到端推理延迟,同时保持自回归一致性。
实验
实验从五个维度验证Lumo-2:通过VLM基准和联合训练评估具身推理,通过探测和泛化任务评估潜在世界动态的效用,在多样化操作挑战上进行少样本后训练,异构数据中涌现的人机迁移,以及模态对齐与扩展分析。多阶段训练在空间感知、未来状态预测和时间推理上带来持续改进,潜在动态捕获了语义上有意义的轨迹,增强了分布外泛化能力。在具有挑战性的操作套件中,Lumo-2在物理理解、长时程执行和灵巧控制方面优于强基线,而结合人类演示的协同微调为未见对象提供了明显增益,模态预对齐改善了动作重建质量和下游扩展性。
Lumo-2的多模态数据语料库被组织为四个类别:通用理解、定位、规划、认知。它依赖于公开可用的数据集,其中一些经过筛选或清理,并强调定位、认知和规划,同时仍涵盖通用多模态理解。与Lumo-1相比,该数据集大幅扩展了用于空间推理和自我中心理解等任务的视频数据,并丰富了FineVision语料库以保持基础模型的通用视觉-语言能力。该数据集特别强调定位、认知和规划,以及通用多模态理解。Lumo-2大幅扩展了视频数据,重点关注通用多模态理解、空间推理、自我中心理解和定位,并使用更丰富的FineVision语料库保留通用视觉-语言技能。
Lumo-2的视觉-语言模型(VLM)在具身理解基准测试上相对于Qwen-3.5 4B骨干网取得了持续提升,在VSIBench和MindCube等任务上提升尤为显著。与动作数据联合训练(阶段3)保留了这些视觉-语言技能,甚至与仅VLM版本相比,在BLINK-Mean、CV-Bench和Ego-Plan2上提升了性能,表明没有灾难性遗忘。该模型还与其它40亿参数规模的具身系统保持竞争力。Lumo-2 VLM将VSIBench准确率从21.73(Qwen-3.5 4B)提升至52.34,凸显了精心构建的具身多模态数据集的有效性。在多模态联合训练后,阶段3在BLINK-Mean、CV-Bench和Ego-Plan2上优于仅VLM版本,表明整合动作信号不会削弱视觉-语言能力。
VLWA微调在时序推理任务上始终优于VLA微调。它在传送带任务上取得完美成功,并在旋转架任务上具有显著优势,表明VLWA范式产生了更强的时序推理能力。VLWA微调在“从传送带收集鸡蛋”任务上达到100%成功率,高出VLA微调8个百分点。在“将方块放在旋转架上”任务上,VLWA微调成功率为81.67%,明显优于VLA微调的74.17%。
评估任务被组织为三个能力维度:时序推理、物理理解和控制复杂度。时序推理包括反应性、预测性和记忆性子类别,每个子类别都要求特定的时序处理技能。控制复杂度涵盖长时程执行和灵巧操作,强调鲁棒性和精度。时序推理和物理理解任务使用完整的VLWA范式训练,而静态操作任务仅使用动作监督。长时程任务使用两种互补的时间上下文方案来缓解感知混淆:紧凑的历史动作tokens和视觉轨迹痕迹。
评估套件包含旨在测试灵巧操作的真实世界任务,每个任务分解为一系列元子任务。评分基于完成各个子步骤,因此最终任务分数反映的是完成程度而非二元成功或失败。所有任务都要求精细运动技能,如拾取、插入、切割、拉链和处理柔性物体。每个任务都被归类为灵巧操作,需要多步骤协调精确的手部动作。每完成一个元子任务得一分,提供了对部分任务进度的细粒度测量。
Lumo-2的多模态数据集,强调定位、认知和规划,并扩展了视频数据,在具身理解基准上相对于Qwen-3.5 4B骨干网取得了显著提升。与动作信号联合训练保留了视觉-语言能力,甚至在某些视觉-语言任务上提升了性能,而VLWA微调范式在真实世界任务上展示了比VLA微调更强的时序推理能力。评估框架涵盖时序推理、物理理解和灵巧操作,长时程任务使用互补的时间上下文方案,真实世界任务则通过细粒度子步骤的部分完成度进行评分。