Command Palette
Search for a command to run...
Hydra-0:面向通用世界建模与控制的动作流
Hydra-0:面向通用世界建模与控制的动作流
摘要
我们提出了 Hydra-0,一种以动作流为条件的通用世界模型,该模型将机器人动作表示为像素运动。这种共享的视觉接口通过跨具身、任务、环境和视频生成骨干学习动作后果,实现了通用世界建模与控制。我们的最佳配置相比基于动作条件的基线,将机器人运动误差降低了 90.4%,物体运动误差降低了 60.2%,同时支持零样本组合和数据高效的适应。在 RoboLab 基准上,Hydra-0 的重放成功率与参考成功率之间的 Pearson 相关系数达到了 ?? = 0.96。最后,我们发现了该接口的一种涌现逆模式:一个世界动作模型,能够根据从人类演示中迁移的期望物体流预测兼容的机器人运动。经过训练的动作头将所得潜在特征映射为可执行动作,无需特定任务的专业机器人演示。综合这些结果,展示了动作流作为连接异构训练数据、开环策略评估和机器人控制的共享控制接口的潜力。
一句话总结
来自NVIDIA、布朗大学、哥伦比亚大学和哈佛大学的研究者提出了Hydra-0,一种以动作流为条件的通用世界模型,将机器人动作表示为像素运动,从而在不同本体和任务间统一建模与控制,相比以动作条件为基线的模型,机器人运动误差降低90.4%,物体运动误差降低60.2%,在RoboLab基准上达到Pearson相关系数??=0.96,并展现出一种逆模式,可从期望的物体流预测兼容的机器人运动,无需特定任务专家示范。
核心贡献
- 提出Hydra-0,一种通用世界模型,将机器人动作表示为像素级动作流,为跨本体、任务、环境和视频生成主干的条件视频预测提供共享视觉接口。
- 相比以动作条件为基线的模型,机器人运动误差降低90.4%,物体运动误差降低60.2%,同时支持零样本组合和数据高效适应。
- 在RoboLab基准上,重放成功率与参考成功率之间的Pearson相关系数达到r = 0.96,并展示了一种逆模式,其中世界动作模型可从人类示范中的期望物体流预测兼容的机器人运动,训练好的动作头将潜在特征转换为可执行动作,无需特定任务专家示范。
引言
在物理世界中运行的机器人受益于能够预测场景或物体在其动作下如何演变的世界模型。然而,现有的世界模型和以动作条件为条件的视频模型往往与特定机器人本体绑定,限制了其在不同机器人、任务和环境间的泛化能力。一个关键挑战在于,原生机器人指令(如关节空间或末端执行器指令)编码了机器人特定的结构和运动学,迫使模型学习从指令到视觉动态的依赖本体的映射。尽管以运动和轨迹为条件的视频模型已表明图像平面运动可作为共享视觉条件,但在将这种视觉表示落实到跨本体的可执行机器人指令方面仍存在空白。
为解决这一问题,作者引入了动作流,一种支持前向动态预测和逆运动预测的共享图像平面运动表示。动作流表示可见机器人或物体点的稀疏轨迹,使同一格式能够描述本体运动和任务意图。在前向方向上,候选电机指令通过机器人控制器和物理仿真执行,由此产生的可见机器人表面轨迹通过机器人几何和相机标定投影到图像平面。这提供了与可执行指令直接关联的视觉条件。在逆方向上,同一接口用于机器人控制:给定期望物体流作为任务意图,模型推断兼容的机器人运动,目标本体读出模块将潜在运动特征解码为可执行动作。作者在不同视频生成主干上实例化了该模型,证明动作流是一种可移植的条件接口。其最佳配置相比以动作条件为条件的Cosmos 2.5基线,机器人运动误差降低90.40%,物体运动误差降低60.16%。他们还展示了零样本和数据高效迁移到可变形物体机器人交互、在RoboLab策略上以Pearson相关系数0.96进行开环策略评估,以及通过将人类示范中的物体流转换为可执行动作实现真实机器人控制。
数据集
作者从七个来源构建了多本体训练语料库,涵盖机器人和人类交互。表1总结了该语料库,包括过滤前后的规模以及每个来源的许可证。DROID提供大规模、场景多样的单臂Franka操作数据,是主要的机器人来源。ABC-130k和MolmoAct2提供双臂遥操作数据。EgoDex提供使用Apple Vision Pro采集的以自我为中心的人类手部操作数据,而Deform360提供使用UMI夹爪进行可变形物体操作的手持夹爪示范。XVLA-Soft-Fold和H1-Fold-Clothes贡献了规模较小的双臂和类人布料折叠数据集。交互世界模拟器(IWS)任务仅用于数据效率评估,不包含在训练语料库中。
-
预处理与标注:由于论文聚焦于可变形物体交互,作者主要保留可变形物体交互数据(布料、线缆、绳索、袋子和纸张)。主要语料库来源被转换为共享的逐回合、逐相机布局:帧被重采样为480p、16 fps,并切割为不重叠的81帧窗口,包含密集点轨迹、语言描述、预计算的VAE潜变量,以及来源相关的本体和物体标注(如有)。密集轨迹来自AllTracker,在每个窗口的128 x 128查询网格上计算。根据来源不同,本体掩码来自标定机器人渲染、投影手部几何、SAM 3细化或文本提示。物体掩码使用来源提供的细化掩码或文本提示的SAM 3,在DROID和EgoDex中不可用。描述使用数据集提供的描述或视觉语言模型按回合生成。
-
过滤:在任务级可变形子集划分之外,作者应用了来源特定的三种窗口级过滤器组合,阈值根据运动分数直方图调整。静态窗口过滤器丢弃90百分位可见轨迹路径长度低于480p下50像素的窗口。冻结夹爪过滤器丢弃本体轨迹低于同一50像素下限的窗口。无内容描述过滤器丢弃语言标注未描述可操作内容的DROID回合。为覆盖腕部视角,他们添加了独立的DROID腕部相机流,使用17帧窗口,仅限于从语言标注中识别的可变形物体回合;该流作为独立视角使用,不与外部相机视角组合。
-
动作流构建:作者不是直接以依赖本体的指令为条件,而是将指令映射为动作流,即描述可见机器人本体受指令运动的一组相机平面轨迹。对于预测范围H未来步骤中的N个跟踪点,点n在时间t的图像平面位置记为x(n,t) = (u(n,t), v(n,t)),其可见性记为m(n,t) ∈ {0, 1},因此共享轨迹条件为F = {tau_n}(n = 1到N),其中tau_n = {(x(n,t), m(n,t))}(t = 0到H)。由于F在观测平面中表示,同一接口可以表示机器人手臂、夹爪甚至人类手部,而无需向视频模型暴露其原生动作空间。作者考虑了两种互补的构建场景:几何感知和纯视频。
-
几何感知构建:当机器人几何和相机标定可用时,作者在初始观测中可见的机器人表面采样点,并获得机器人状态和连杆变换序列。部署时,Isaac Lab通过机器人控制器和物理仿真执行候选指令来生成该序列。作者使用这些连杆变换传播采样的表面点,并将所得运动投影到相机平面。对于跟踪点n,时间t的图像位置使用机器人配置、连杆变换、相机外参和内参以及透视投影计算。仅当投影点具有正相机深度、位于图像边界内,并在小容差范围内与渲染深度缓冲一致时,可见性设为1;3 x 3邻域避免在轮廓边界处产生错误拒绝。投影的可见轨迹构成部署动作流。中等标定误差会扰动二维运动条件而不改变目标视频,而较大的投影误差可能降低空间对应性。
-
纯视频构建:许多大规模交互数据集提供视频但缺少机器人描述文件或相机标定。对于这些数据,作者首先使用光流跟踪器恢复密集图像平面轨迹和可见性标签,然后使用可见本体和操作物体的接地掩码分割轨迹。这为训练产生相同的轨迹表示,无需特权元数据。跟踪的未来仅用于构建训练条件;部署时,机器人动作流从相应物理仿真器指令滚动中因果计算。
-
训练时流采样:训练期间,作者采样多个流条件,而非依赖单一轨迹类别。这使模型能够在不同应用中利用不同运动线索。在每个训练步骤中,他们从接地轨迹集中采样四种条件策略之一:本体、物体、全部或无。采样模式不生成单独的学习token,仅决定哪些轨迹填充共享运动张量。本体选择作用体上的轨迹,是主要的动作条件策略;包括可见机器人连杆和夹爪或人类手部。物体在训练期间选择操作物体上的观测未来轨迹;当推理时显式提供物体轨迹时,同一模式可改为提供期望运动条件,通过世界模型引出兼容的机器人运动。全部在接地和未分配轨迹上采样,使训练在语义接地不完整时保留近似运动对应性。无移除轨迹条件并充当条件丢弃,使模型仅基于文本和图像条件进行预测。如果策略所需的轨迹不可用,作者从其余有效策略中采样。
方法
作者提出了一种运动学接地的世界模型,在部分可观测设置中运行。该框架将初始RGB观测o0编码为空间潜状态s0=eϕ(o0),并以动作流F为条件预测未来潜状态s^1:H=gθ(s0,F)。解码器随后生成对应的RGB序列o^1:H=dψ(s^1:H)。
作者不是直接以依赖本体的指令为条件,而是将指令映射为动作流,即描述可见机器人本体受指令运动的相机平面轨迹集。这一共享接口使模型能够处理机器人手臂、夹爪和人类手部,而无需向视频模型暴露原生动作空间。对于离线训练,动作流通过密集跟踪和本体及操作物体的接地掩码从交互视频构建。训练期间,模型从四种条件策略中采样:本体、物体、全部或无,以支持不同应用中不同运动线索的使用。
对于在线部署,当机器人几何和相机标定可用时,系统通过物理仿真执行候选指令以获得机器人连杆变换。可见机器人表面点使用这些变换传播并投影到相机平面,形成部署动作流。
以动作流为条件的视频预测模块保留初始编码状态的空间结构。作者将每个图像空间轨迹与时间压缩的视频潜变量对齐,通过池化图像帧上的位置和可见性实现。他们双线性采样源特征hn=s0(x~n,0),并使用高斯权重沿时间维度传播。潜时间k和归一化潜网格位置p~处的运动特征计算为:
Mk(p~)=n∈NK(p~,k)∑w~n,k(p~)hn,其中权重定义为w~n,k(p~)=m~n,0m~n,kexp(−β∥p~−x~n,k∥22)。同时计算存在门gk(p~),指示视觉条件中包含轨迹传播外观的位置。完整运动条件Cmotion=(M,g)在DiT块处理之前与噪声视频潜变量拼接。
为优化模型,作者使用标准流匹配目标:
L(θ)=Eo0:H,F,t,ϵ[∥vθ(Zt,t,c,Cmotion)−vt⋆∥22].为高效机器人部署,该框架将自回归转换用于因果长时程生成,并结合改进的分布匹配蒸馏实现少步采样。潜序列被划分为时间块,生成的块替换干净历史并通过KV缓存复用。
系统还通过构建世界动作模型支持逆控制模式。通过以期望物体流为条件而不提供夹爪流,模型在潜动态中编码兼容的机器人运动。轻量动作头和状态头被训练用于读取干净DiT token特征,并学习依赖本体的逆映射到可执行指令,使用包含流匹配、动作、状态和速度平滑项的联合损失函数进行优化。
实验
实验评估了动作流作为视频世界模型条件接口在Cosmos 2.5和Wan2.2主干上的表现,显示其在可变形物体交互的保真度和运动指标上优于原生相对6D动作。使用动作流的多本体中期训练改善了零样本迁移并减少了任务特定数据需求,大部分增益在20%训练数据时即可实现。带蒸馏的缓存因果自回归采样实现16倍生成速度提升,而RoboLab中的开环策略重放保持了与参考结果高度相关的成功率。流条件世界动作模型在真实管道弯曲任务中定性地将期望物体运动转换为可执行机器人指令。
语料库结合了七个机器人和人类交互来源,DROID是最大的单臂机器人来源,ABC-130k是最大的双臂来源。过滤移除了静态窗口、冻结夹爪窗口和无内容描述,减少了多个来源的回合和窗口数量,同时保留了其他来源的大部分数据。来源涵盖多种本体,包括单臂机器人、双臂、人类手部和手持夹爪,重点关注可变形物体交互。DROID贡献的回合最多,但过滤后损失超过一半窗口,而ABC-130k保留了几乎所有窗口。EgoDex提供人类手部数据,过滤后无窗口损失,Deform360保留约69%的窗口。语料库包括以可变形物体为重点的来源,如Deform360、XVLA-Soft-Fold和H1-Fold-Clothes,以及通用操作数据。
可操作流条件一致地改善了跨多种本体的视频生成保真度和运动精度,优于原生动作表示。Wan2.2 A14B 4步变体实现了最佳整体性能,尤其在PSNR、SSIM、FID和FVD方面,同时降低了夹爪和物体运动误差。零样本基线普遍表现不佳,VLM评分因侧重于定性方面而非精确轨迹跟随而表现不一。在Cosmos 2.5主干中用可操作流替换原生相对6D动作,在所有数据集上改善了PSNR、SSIM、夹爪EPE、FID和FVD,以及报告中的物体EPE。Wan2.2 A14B 4步模型在大多数指标上显示出最佳点估计,PSNR和SSIM显著更高,FVD低于其他变体。零样本基线(ATI和Wan-Move)表现出更高的物体和夹爪EPE以及更低的保真度分数,表明缺乏多本体中期训练时处于劣势。VLM评分与基于流的指标不一致,因为它们评估物理合理性和时间一致性而非精确轨迹遵循。
该表比较了三个模型阶段的推理速度:双向教师模型、自回归教师模型和少步学生模型。自回归教师模型快于双向基线,少步学生模型实现了显著进一步加速,达到约每秒62帧。这些测量仅包括生成部分,排除引导和VAE解码,基于短时程和单块H100 GPU。缓存因果自回归转换比全序列双向采样快约1.68倍,尽管使用更多网络评估。少步学生模型将网络评估减少到15次,相比自回归教师模型实现约9.5倍的进一步加速。少步学生模型达到约每秒62帧,相比双向教师模型实现16倍生成速度提升。
评估涵盖多样化多本体语料库,包括单臂、双臂、人类手部和可变形物体来源,过滤在保留大部分数据的同时修剪冗余窗口。在所有数据集中,用可操作流条件替换原生动作表示一致地改善了视频保真度和运动精度,Wan2.2 A14B 4步变体实现最佳整体性能,零样本基线因缺乏多本体训练而落后。推理速度测试表明,基于缓存因果自回归转换构建的少步学生模型相比双向教师模型实现16倍生成速度提升,达到约每秒62帧。