HyperAIHyperAI

Command Palette

Search for a command to run...

GaussianDream++:面向机器人操作的高效 3D 高斯世界建模

摘要

视觉-语言-动作(VLA)策略已推进了语言条件下的机器人操作,然而动作模仿目标仅对度量 3D 结构和短时物理演化提供弱监督。几何增强策略主要改善当前场景的接地,而预测策略通常在 RGB 或潜在空间中建模未来动态,并可能产生显著的部署成本。GaussianDream 表明,训练时的当前高斯重建和未来高斯预测提供了有效的 3D 监督,但其基于 VGGT/TGE 的密集前缀共同承载了状态、动态和动作条件信息。我们提出 GaussianDream++,一种紧凑的、策略原生的扩展,将世界状态令牌和世界预测令牌直接插入 VLA 主干。一个仅用于训练的世界表示头将这些令牌解码为共享高斯原语上的当前世界和耦合的未来预测,而静态-动态分解保留了持久结构并将残余运动聚焦于交互相关区域。在推理时,头部、渲染器、辅助目标和 VGGT/TGE 路径被移除,仅留下 20 个世界令牌,无需在线高斯解码或展开。GaussianDream++ 在 LIBERO 上达到 98.6%,在 LIBERO-Plus 上达到 87.8%,在相机和布局偏移下具有明显优势。真实机器人实验进一步将平均成功率从复现的 π0.5 的 29.2% 提升至 52.5%,同时保持高效的闭环控制。

一句话总结

拓境智能、中国科学院大学、中国科学院自动化研究所、清华大学等机构的研究人员提出了 GaussianDream++,这是对 GaussianDream VLA 策略的精简扩展。该方法在骨干网络中插入世界状态 Token 和世界预测 Token,利用仅训练阶段使用、带有静态-动态分解的世界表示头来监督 3D 结构和未来动态,在 LIBERO 上达到 98.6%98.6\%98.6%,在 LIBERO-Plus 上达到 87.8%87.8\%87.8%,并在真实机器人上相较 π0.5\pi_{0.5}π0.5 将成功率从 29.2%29.2\%29.2% 提升至 52.5%52.5\%52.5%,同时在推理时移除所有辅助组件。

核心贡献

  • 提出 GaussianDream++,一种策略原生的扩展方法,将 GaussianDream 中基于密集 VGGT/TGE 的前缀替换为 20 个直接嵌入 PaliGemma VLA 骨干网络的世界状态 Token 和世界预测 Token,从而在不依赖专用运行时通路的情况下实现紧凑的当前几何和未来动态监督。
  • 采用仅训练阶段使用、基于共享高斯原语的世界表示头,将这些 Token 解码为当前世界和耦合的未来预测,通过静态-动态分解保留持久结构,同时将残余运动集中在与交互相关的区域;推理时移除该头、渲染器、辅助目标和 VGGT/TGE 通路。
  • 在 LIBERO 上达到 98.6%,在 LIBERO-Plus 上达到 87.8%,在相机和布局偏移下均有明显提升;相较复现的 π₀.₅ 基线,将汇总的真实机器人成功率从 29.2% 提升至 52.5%,同时保持高效的闭环控制。

引言

通用机器人操作要求 Agent 理解语言目标并将视觉观测转换为精确动作,近年来视觉-语言-动作(VLA)策略通过将大规模视觉-语言预训练中的语义先验迁移到机器人控制中,推进了这一能力。然而,这些策略面临三个关键挑战:场景几何和接触相关的空间关系通常隐式编码在 2D 特征中;机器人轨迹包含丰富的物理证据,而行为克隆在很大程度上未加以利用;当前状态理解和未来演化通常通过分离或纠缠的目标进行学习,而非联合结构化。先前的方法要么添加几何锚定(如深度、点云、3D 表示)来改善当前场景锚定而不监督物理状态演化,要么使用预测性策略和世界模型在 RGB 或潜在空间中建模未来状态,但这些方法无法保证度量一致的转换,且可能增加部署成本。

作者提出 GaussianDream++,一种紧凑的、策略原生的 GaussianDream 升级方案,将密集的外部高斯前缀替换为 20 个直接嵌入 VLA 骨干网络的世界状态 Token 和世界预测 Token。世界状态 Token 重建当前物理场景,而世界预测 Token 在共享高斯原语上建模短时演化,通过静态-动态分解保留持久结构并将残余运动集中在交互引起的变化上。训练期间,轻量级世界表示头将这些 Token 解码为可渲染的当前和未来高斯状态,通过 RGB、深度、可见性和运动目标提供密集监督;但在部署时,所有辅助头均被移除,仅保留紧凑 Token 用于动作生成。实验表明,GaussianDream++ 在 LIBERO 上达到 98.6% 的成功率,在 LIBERO-Plus 上达到 87.8%,相较 GaussianDream 总体提升 0.8 个百分点,在相机和布局偏移下分别提升 2.8 和 1.6 个百分点,同时真实机器人成功率相较复现的 pi_0.5 基线从 29.2% 提升至 52.5%。

方法

作者提出 GaussianDream++,一种将高斯监督直接集成到原生视觉-语言-动作骨干网络中的框架,而非依赖专用的时间几何通路。该系统通过 PaliGemma 处理多视角观测和语言指令,同时处理两组不同的可学习 Token。整体架构如下图所示:

这些 Token 包括编码当前物理场景的世界状态 Token,以及捕获短时演化的世界预测 Token。它们的上下文化隐藏状态构成统一的模态前缀,直接条件化流匹配动作专家。

oto_tot 为当前多视角观测,\ell 为语言指令,rtr_trt 为机器人状态。策略预测动作块 AtA_tAt。作者用世界状态 Token ZSRNs×dZ^S \in \mathbb{R}^{N_s \times d}ZSRNs×d 和世界预测 Token ZPRNp×dZ^P \in \mathbb{R}^{N_p \times d}ZPRNp×d 增强模态前缀。在主配置中,模型使用 Ns=16N_s = 16Ns=16 个状态 Token 和 Np=4N_p = 4Np=4 个预测 Token。PaliGemma 将这些世界 Token 与原始视觉和语言 Token 联合上下文化以产生隐藏状态。动作专家直接基于这一完整增强前缀生成动作,无需额外的世界到动作投影器。

在训练阶段,轻量级世界表示头解码相同的隐藏状态以生成显式高斯监督。该辅助解码路径将机器人轨迹转换为几何、外观、可见性和运动的密集监督。关键在于,未来观测仅用作监督目标,从不进入策略前向传播,确保渲染图像和显式高斯原语均不被动作专家消费。

为约束状态表示,作者强制执行当前世界重建。世界状态 Token 的上下文化隐藏状态保留粗略的空间组织,并被扩展为密集高斯特征场。该方法通过分离的分支解码几何和外观。几何分支预测度量深度和非外观高斯属性,而外观分支基于停止梯度的几何特征操作,以防止光度捷径改变度量场景结构。高斯中心通过使用标定相机参数反投影预测的度量深度获得。得到的当前世界通过可微高斯泼溅进行渲染,并使用光度、结构相似性、深度和覆盖损失的组合进行监督。

对于短时预测,模型将重建的当前世界保留为共享模板,仅预测与时间范围相关的几何变化。对于给定的预测范围,对应的世界预测表示与当前世界特征和可学习的时间范围嵌入相结合,以预测运动系数和几何位移。尺度、旋转、不透明度和外观继承自当前世界。这种共享原语构造保留了当前到未来的对应关系,并将预测能力严格分配给几何变化。每个未来世界使用与其特定预测范围关联的相机参数进行渲染,以防止视角变化被吸收到预测的物理运动中。未来监督结合了渲染、度量深度、三维运动和静态一致性项。

作者联合优化动作生成和高斯世界监督。完整目标结合了原始流匹配动作损失与当前世界和未来预测损失:

L=Lact+λcurLcur+λfutLfut\mathcal{L} = \mathcal{L}_{\mathrm{act}} + \lambda_{\mathrm{cur}} \mathcal{L}_{\mathrm{cur}} + \lambda_{\mathrm{fut}} \mathcal{L}_{\mathrm{fut}}L=Lact+λcurLcur+λfutLfut

这确保了世界 Token 增强前缀保持物理结构化,并防止其坍缩为无约束的动作专用特征。训练和部署路径刻意不对称。训练期间,世界表示头、高斯渲染器和所有辅助目标将轨迹转换为密集的几何和时间监督。部署时,这些组件被完全丢弃。部署策略仅保留 PaliGemma 骨干网络、世界状态和预测 Token 以及动作专家。因此,推理不需要在线高斯解码、渲染、未来 rollout 或专用前缀构建通路,额外策略计算量极小。

实验

GaussianDream++ 在 LIBERO 和 LIBERO-Plus 上评估了操作性能、空间/视觉/语言/具身偏移下的零样本鲁棒性、真实世界迁移和设计贡献。它在 LIBERO 上达到 98.6% 的平均成功率,在 LIBERO-Plus 上达到 87.8% 的总体成功率,在相机和布局扰动下增益最大,并将汇总的真实世界成功率从复现基线的 29.2% 提升至 52.5%。消融实验确认,结构化高斯世界监督而非额外 Token 容量驱动了性能提升,其中度量深度、3D 流和静态-动态分解各自对鲁棒性有所贡献。该策略通过移除运行时几何通路,相较基线仅增加 44 ms 推理延迟;定性可视化表明,紧凑世界 Token 保留了可解码的场景几何和粗略的未来演化。

GaussianDream++ 在标准 LIBERO 和零样本鲁棒性基准 LIBERO-Plus 上均取得强劲性能,在相机和布局扰动下增益最大。性能提升归因于结构化高斯世界监督和角色分离的世界 Token,这有助于在分布偏移下保留场景几何和布局。GaussianDream++ 在 LIBERO-Plus 总体指标上优于复现基线,在相机和布局偏移下增益显著。该模型还提升了对噪声扰动的鲁棒性,表明密集高斯监督在局部图像证据退化时有所帮助。在机器人偏移下的性能仍低于复现基线,表明所提方法未改善具身层面的泛化能力。

在真实世界操作试验中,GaussianDream++ 在两个任务和所有条件组中均持续优于复现基线,在标准条件下增益最大,在相机偏移下增益最小。汇总所有任务和条件后,该方法的总体成功率比基线高出约 20 个百分点。GaussianDream++ 在包括标准、布局和相机变化在内的每个任务和条件下均取得高于基线的成功率。GaussianDream++ 与基线之间的性能差距在标准条件下最为显著,在相机偏移下最小。在所有任务和条件下,GaussianDream++ 相较复现基线将总体成功率提升了约 20 个百分点。

GaussianDream++ 通过在 VLA 骨干网络内部直接形成紧凑世界表示,避免了运行时的显式高斯解码或渲染,因此延迟低于 GaussianDream 的参考值。GaussianDream++ 的实测延迟为 330 ms,而复现基线为 286 ms,报告的 GaussianDream 参考值为 531 ms,但后者是在不同条件下测量的。GaussianDream++ 移除了专用运行时几何通路,而 GaussianDream 仍使用 VGGT 和 TGE 构建 1024 Token 前缀。GaussianDream++ 的延迟低于报告的 GaussianDream 参考值,但直接的加速对比受限于不同的测量环境。GaussianDream++ 的开销来自处理额外的 20 个世界 Token,而非在线高斯构建或渲染。

消融研究表明,结构化高斯世界监督而非仅增加 Token 容量驱动了 GaussianDream++ 的性能提升。逐步添加当前世界重建、未来预测、耦合解码和静态一致性均改善了鲁棒性,完整模型取得最佳结果。移除任何单一监督目标,尤其是度量深度,都会降低性能,确认了外观、几何、覆盖和运动约束的互补作用。在无高斯监督的情况下添加世界 Token 仅略微提升 LIBERO-Plus 总体指标,仍低于完整模型,表明仅靠容量不足。用当前世界重建约束世界状态 Token 可改善鲁棒性,尤其在相机和布局偏移下。在共享高斯原语上耦合当前和未来预测进一步提升了性能,静态一致性则带来最终增益。移除度量深度造成最大下降,尤其影响相机和布局鲁棒性。移除度量 3D 流削弱了噪声和布局鲁棒性,表明仅靠渲染不够。RGB 和 alpha 监督互补,RGB 影响光照和背景,alpha 影响对可见性敏感的偏移。

GaussianDream++ 在标准 LIBERO 和零样本鲁棒性基准 LIBERO-Plus 上均优于复现基线,在相机和布局扰动下增益最大,而在机器人偏移下的性能仍低于基线。在真实世界试验中,它在所有任务和条件下持续提升成功率,总体成功率比基线高出约 20 个百分点。该方法还通过避免显式高斯解码降低了运行时延迟,但直接的加速对比受限于不同的测量环境。消融研究确认,结构化高斯世界监督而非仅增加 Token 容量驱动了鲁棒性提升,其中度量深度是最关键的监督目标。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供