HyperAIHyperAI

Command Palette

Search for a command to run...

DREAMGEN:通过视频世界模型解锁机器人学习的泛化能力

GR1-100 机器人操作演示数据集

前往数据集

摘要

我们提出了 DREAMGEN,一种简单而高效的 4 阶段流水线,用于训练能够跨行为和环境泛化的机器人策略,其关键在于神经轨迹——由视频世界模型生成的合成机器人数据。DREAMGEN 利用最先进的图像到视频生成模型,并将其适配到目标机器人形态,以生成多样环境中熟悉或新颖任务的高保真合成视频。由于这些模型仅生成视频,我们通过潜在动作模型或逆动力学模型(IDM)恢复伪动作序列。尽管方法简单,DREAMGEN 在行为和环境泛化方面表现出色:一个人形机器人能够在已见和未见环境中执行 22 种新行为,而仅需在一个环境中收集单一拾取-放置任务的遥操作数据。为系统评估该流水线,我们引入了 DreamGen Bench,一个视频生成基准,其性能与下游策略成功率呈强相关。我们的工作为扩展机器人学习规模开辟了新的途径,远超手动数据收集的当前局限。

一句话总结

来自NVIDIA、华盛顿大学、KAIST和UCLA的研究人员提出了DREAMGEN,这是一个4-stage4\text{-stage}4-stage流水线,通过图像到视频世界模型生成的合成神经轨迹来训练可泛化的机器人策略,利用潜在动作模型或逆动力学模型恢复伪动作,使类人机器人仅凭单任务遥操作数据即可执行222222种新行为。此外还发布了DreamGen Bench基准,其视频生成质量与下游策略成功率高度相关。

核心贡献

  • 提出了DREAMGEN,一个四阶段流水线,将图像到视频生成模型适配到目标机器人本体,生成多样化环境中熟悉或新颖任务的光照真实合成视频,然后利用潜在动作模型或逆动力学模型恢复可执行的伪动作序列。
  • 展示了强大的行为和环境泛化能力,证明类人机器人能够执行22种新行为,覆盖已知和未知环境,同时仅需在一个环境中采集单一抓取放置任务的遥操作数据。
  • 提出了DreamGen Bench,一个视频生成基准,建立了基准性能与下游策略成功率之间的强相关性,提供了一种低成本、诊断性的方式来评估用于机器人的视频世界模型,无需物理机器人参与。

引言

在大规模人类遥操作数据上训练的机器人基础模型展现出在真实世界中进行灵巧操作的巨大潜力,然而该范式受制于为每个新任务和新环境手动采集示范数据的高昂成本。仿真环境中的合成数据生成提供了一种替代方案,但通常需要大量人工工程,并且在物理机器人上部署视觉运动策略时存在仿真到现实的差距。以往通过扩散模型或视频到视频模型增强现有示范数据的生成方法产生的运动多样性有限,且大多数视频世界模型研究聚焦于实时规划而非可扩展的数据生成。

作者提出了DREAMGEN,这是一种将最先进的视频世界模型重新定位为数据生成器而非规划器的合成数据流水线。该流水线遵循四步方案:在目标机器人上微调视频世界模型以捕获其特定动力学,用初始帧和语言指令提示模型生成大量机器人视频,通过潜在动作模型或逆动力学模型提取伪动作,最后在生成的视频-动作对上训练下游视觉运动策略,作者称之为神经轨迹。该方法只需极少的人工劳动,并且适用于不同的机器人本体、环境和任务。

作者在RoboCasa仿真基准上验证了DREAMGEN,合成数据量达到原始示范数据的333倍,实现了对数线性的策略改进。在真实世界中,他们在Fourier GR1、Franka Emika和SO-100机器人上展示了9项任务的一致改进,每个任务仅需10至13条真实轨迹。更值得注意的是,DREAMGEN实现了真正的泛化:它使仅经过抓取放置训练的GR1类人机器人能够执行22种新行为(倒水、工具操作和打开铰接物体),并能在10种未见过的环境中运行,其中基线成功率接近0%,而DREAMGEN在已知环境中的新行为成功率达到43.2%,在未知环境中达到28.5%。作者还发布了DreamGen Bench,这是一个评估视频世界模型适应新型机器人本体能力的视频生成基准,提供了一种与下游策略性能相关的低成本诊断工具。

数据集

作者提出了DreamGen Bench,这是一个评估视频生成模型作为机器人世界模型的基准。它衡量现有视频生成模型在多大程度上能适应特定机器人本体、内化刚体物理规律,并泛化到新的物体、行为和环境中。

数据集构成与来源

  • 该基准涵盖两种训练和评估设置:Franka Emika机械臂上的仿真环境和Fourier GR1类人机器人的真实世界数据。
  • 视频数据来自机器人环境,包括RoboCasa(多视角仿真环境)和其他多样化机器人环境。
  • 四个视频世界模型被纳入基准:Hunyuan、CogVideoX、WAN 2.1和Cosmos。

关键指标与评估细节

  • 指令遵循(IF):生成的视频被输入到Qwen-VL-2.5并附带特定提示,产生二值评分(0或1),用于判断视频与任务指令之间的一致性。同时提供人类评估,显示与基于模型的评分的平均皮尔逊相关性超过90%。
  • 物理一致性(PA):视频由VideoCon-Physics评分,这是一个为物理一致性训练的VLM,给出0到1之间的分数。由于VideoCon-Physics未在多视角RoboCasa数据或多样化机器人环境上训练,作者还使用Qwen-VL-2.5对每个视频评分,然后取两个分数的平均值。

数据使用方式

  • 四个模型在零样本模式(无本体适配)和适配设置中进行评估,结果和数据集统计信息报告在表2中。
  • 为测试DreamGen Bench能否代理下游机器人策略性能,作者仅使用每个视频世界模型生成的神经轨迹训练RoboCasa策略,每个模型使用7K条轨迹。DreamGen Bench评分是IF和PA分数的平均值,结果显示与RoboCasa性能呈正相关。
  • 对于GR1类人机器人,作者使用机器人的数字孪生在仿真中回放逆动力学模型(IDM)动作,以实证评估IDM动作的质量。

方法

作者提出了DREAMGEN,这是一个利用视频世界模型为视觉运动机器人策略生成合成训练数据的综合流水线。如概述所示,整体框架由四个顺序阶段组成:微调视频世界模型、生成合成视频轨迹、提取伪动作以形成神经轨迹,以及训练最终策略。

该过程首先将预训练的视频世界模型适配到目标机器人本体,通过在人类遥操作机器人轨迹上微调模型来实现。为缓解对先验互联网视频知识的灾难性遗忘,作者采用了低秩适配(LoRA)。在此阶段,模型学习机器人的具体物理约束和运动能力。对于包含多视角的数据集(如RoboCasa和DROID),帧会在微调前拼接为网格格式。

模型适配完成后,被用于生成合成数据。模型以初始帧和语言指令作为提示,生成描绘预期行为的视频轨迹。这允许生成大量数据,涵盖微调阶段的熟悉行为和未知环境中的新行为。

由于生成的视频缺少动作标注,第三步涉及提取伪动作以创建"神经轨迹"。作者为此利用了两种不同的架构,详见下方架构图。

第一种方法采用逆动力学模型(IDM)。IDM架构利用带有SigLIP-2视觉编码器的扩散Transformer,并以流匹配目标进行训练。它以两个图像帧(当前帧和未来帧)为条件,预测它们之间的动作块。该模型仅专注于捕获机器人动力学,不包含显式语言或本体感觉输入。为生成标签,采用滑动窗口方法:模型预测一个窗口的HHH个动作,然后滑动一帧预测下一个序列。

第二种方法采用潜在动作模型(LAPA)。该模型采用Transformer编码器-解码器架构,以VQ-VAE目标进行训练。它捕获帧之间的视觉增量信息。为提取潜在动作,模型以生成轨迹中的当前帧和未来帧(提前一秒)为条件。输出是表示潜在动作的预量化连续嵌入。该方法的一个关键优势是训练时不需要目标机器人的真实动作。

最后,在这些神经轨迹上训练视觉运动策略。策略以图像观察和语言指令为条件,由于神经轨迹缺乏显式状态数据,状态信息被置零。作者使用三种不同的策略架构演示了这一训练过程:Diffusion Policy、π0\pi_0π0和GR00T N1。训练可以仅在神经轨迹上进行,或以1:1采样比例与真实世界轨迹共同训练。对于GR00T N1等特定本体,使用独立的动作编码器和解码器来处理不同类型的轨迹。

实验

DREAMGEN在三个应用场景中进行了验证:数据增强、行为泛化和环境泛化。与神经轨迹共同训练在仿真和真实世界场景中持续提升了下游策略性能,增益随轨迹数量呈对数线性增长。仅使用生成视频训练的策略学习了全新的行为,并在无需物理数据采集的情况下迁移到新环境,远超基线。新基准DreamGen Bench量化了视频世界模型的指令遵循和物理一致性,并显示与下游机器人策略性能呈正相关。

DreamGen Bench在仿真和真实机器人设置中评估视频生成模型的指令遵循和物理对齐性能。微调变体持续优于零样本基线,且基于模型的评估与人类判断高度一致。该基准还与下游机器人策略性能呈正相关。与零样本推理相比,在特定本体数据上微调可提升指令遵循和物理对齐的得分。人类评估与基于模型的评估高度一致,平均相关性超过90%。在DreamGen Bench上得分更高的模型往往能产生更好的下游机器人策略性能。

DreamGen Bench在仿真和真实机器人设置中评估视频生成模型的指令遵循和物理对齐性能。微调变体持续优于零样本基线,基于模型的评估与人类判断高度一致,平均相关性超过90%。更高的基准得分还与下游机器人策略性能呈正相关,表明在特定本体数据上微调可同时改善这两项指标。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供