HyperAIHyperAI

Command Palette

Search for a command to run...

多模态
Agent

GigaBrain-0.7:通过三系统架构扩展具身基础模型以实现涌现能力

摘要

视觉-语言-动作(VLA)模型已成为通用具身智能体的主流范式,在结构化环境中展现出强大的复杂长程任务完成能力。然而,当前的 VLA 系统能否受益于更有效的架构设计、扩展到更大且更异构的数据体系,并实现跨任务和跨具身形态的更广泛泛化,仍是一个悬而未决的问题。为此,我们提出了 GigaBrain-0.7,这是一个在多种机器人具身形态上泛化能力显著提升的具身基础模型。具体而言,GigaBrain-0.7 通过三系统架构统一了理解、预测与动作,将预训练规模扩展至超过 37,000 小时的异构具身数据,并引入单阶段对齐训练,联合优化视觉-语言理解与多具身动作生成。与此前的 GigaBrain-0 系列以及包括 π0.5\pi_{0.5}π0.5 在内的先前最优模型相比,GigaBrain-0.7 在基础零样本能力、语言条件指令遵循以及后训练任务成功率方面均取得了显著提升。特别是在我们自研的 Maker H01 平台和主流机器人具身形态上,GigaBrain-0.7 在家庭和工业场景中均展现出强大的任务适应性与完成能力。所有训练代码和预训练模型权重将予以开源。

一句话总结

GigaBrain 团队推出 GigaBrain-0.7,这是一种具身基础模型,采用三系统架构,统一理解、预测和行动,将预训练扩展到超过 37,000 小时的异构具身数据,并采用单阶段对齐训练联合优化视觉语言理解和多具身动作生成,从而在基础零样本能力、语言条件指令跟随以及家庭和工业场景下的任务成功率方面超越 π0.5\pi_{0.5}π0.5 和此前最先进模型。

核心贡献

  • GigaBrain-0.7 作为三系统架构被提出,协调视觉语言理解、未来状态预测和多具身动作生成。系统3单独预训练用于未来状态预测和任务进度估计,其预测的子目标图像和由价值导出的进度信号为任务特定后训练和推理提供条件。
  • 预训练扩展到超过 37,000 小时的异构具身数据,覆盖 16 种机器人形态,并结合大规模视觉语言监督。
  • 单阶段对齐训练流程联合优化多模态理解、分层任务预测、离散动作监督和跨异构具身的连续动作生成。

引言

视觉-语言-动作(VLA)模型将预训练视觉语言模型用于机器人控制,但扩展到多样化具身和动作空间时,往往引入干扰而非可迁移知识。大多数 VLA 仍是反应式的,缺乏预测未来状态或评估任务进度的机制,并将理解、预测和动作视为分离而非协调的过程。作者提出 GigaBrain-0.7,这是一种具身基础模型,将异构多具身预训练与三系统架构相统一:系统1用于连续动作生成,系统2用于分层理解和规划,系统3用于未来状态预测和价值估计。GigaBrain-0.7 在超过 37,000 小时的机器人数据(覆盖 16 种形态)和 2.7 亿个视觉语言样本上预训练,在单阶段中联合优化多模态理解和动作,然后利用预测的子目标和进度信号为策略后训练提供条件,并实现经验驱动的改进。

数据集

作者为视觉-语言-动作(VLA)模型构建了多源训练语料库,结合具身轨迹数据和视觉语言数据,在预训练期间提供互补监督。

  • 具身轨迹数据(清洗后 37,256.98 小时)

    • 真实机器人数据(20,535.65 小时): 来自 16 种机器人类型(如 Maker H01、Maker M01、Agibot-G1、AgileX、Franka、UR5)的 1,810,101 个片段。提供主要的连续动作监督。
    • UMI 演示(8,251.83 小时): 自研 Maker U01 和 Jianzhi 10K。提供近操作视角,用于手眼协调和局部空间几何。
    • EGO 人类演示(2,862.36 小时): Maker E01、EgoDex、EgoVerse、WiYH。提供第一人称操作先验和更广泛的对象交互类别。
    • 仿真数据(1,453.92 小时): 基于物理的环境,具有可配置任务和场景,针对物理采集成本高或不安全的配置。
    • 世界模型生成数据(4,153.22 小时): 由筛选后的真实交互生成的条件提示视频,扩展视觉和场景多样性,同时保留交互上下文。
  • 视觉语言数据(271,976,674 个图像文本/问答样本,其中 15,234,327 个为自行采集) 涵盖图像描述、通用 VQA、多图推理、区域定位、点预测、空间关系推理、可供性理解和机器人任务理解。保留基础视觉语言能力,并增强用于具身任务的空间、定位和可供性推理。

处理流程

  • 统一具身格式: 所有轨迹来源被转换为 LeRobot v3.0,具有标准化元数据、机器人状态/动作表示(按左臂、右臂、头部、腰部、基座/腿排序)和相机定义。缺失的运动分量使用掩码或占位符。
  • 指令重写: LLM(GLM-5.1)将原始指令规范化为标准任务描述;多模态模型为长时程任务添加子任务级标注。
  • 多阶段清洗:
    • 按机器人类型和动作维度进行 q01/q99 极端值过滤,以避免归一化不稳定。
    • 使用帧间 L2 变化幅度移除长时间静止片段。
    • 通过 URDF 对齐和参考点配置进行末端执行器位姿一致性校正。
    • 异常训练损失过滤:对持续高损失的轨迹进行回溯,若损坏或未对齐则移除。
  • UMI 特定处理: 多相机同步、针对平滑性和跨模态一致性的质量筛选、重定向到机器人 TCP 坐标系,以及通过逆运动学和真实机器人回放进行可执行性验证。
  • EGO 特定处理: 视频级过滤以获得清晰的手-物交互;标准化时间戳、相机参数和手部轨迹;使用姿态估计或已有标签标注手部位置、物体接触和空间关系。
  • 仿真/生成数据: 基于物理的仿真运行可配置任务;世界模型生成使用来自真实交互的条件提示视频扩展。两条流程均扩展长尾覆盖。
  • VLM 数据处理: 所有来源被统一为多模态对话格式,并进行图像质量控制和结构验证。具身 VLM 标注使用 Qwen3.6-27B 从轨迹关键帧生成,为可供性预测、空间理解和高层任务规划提供监督。自动和人工抽查质量控制会过滤低置信度或模糊样本。

训练中的使用

两个数据族在预训练期间联合使用。具身轨迹提供状态-动作监督和交互动力学,而 VLM 数据保留通用视觉语义能力,并注入空间、定位和可供性推理。语料库未指定显式混合比例;两个组成部分被结合用于训练 VLA 模型,而不因纯动作数据降低视觉语言性能。

方法

作者将 GigaBrain-0.7 设计为一个综合的视觉-语言-动作框架,连接语义理解与连续机器人控制。为应对长时程物理交互的复杂性,该架构被组织为三个逐步耦合的系统,分别处理理解、预测和动作生成。

如下图所示:

系统2充当理解和规划模块。它作为 PaliGemma2(3B)视觉语言模型运行,结合任务指令解释当前视觉观测。通过生成思维链推理,它识别相关物体及其空间布局,随后将高层任务分解为即时子任务指令。这种分解在高层语义推理与低层运动控制之间提供了关键的中间接口。

系统3充当预测和评估组件,构建在 GigaWorld-1(5B)世界价值模型之上。它接收当前具身上下文和来自系统2的子任务描述,对未来的任务演变进行建模。该系统提供两个互补信号。第一,它生成与子任务时间范围一致的短未来视频,提取最后一帧作为表示预期物理状态的子目标图像。第二,它估计一个反映当前任务进度的标量值。该值被转换为二值优势条件,指示任务进度是否在增加,从而提供对执行状态的紧凑评估。优势条件被离散化为:

At=1[Vt+δtVt>0]{0,1}A_{t} = \mathbb{1} [ V_{t + \delta_{t}} - V_{t} > 0 ] \in \{0, 1\}At=1[Vt+δtVt>0]{0,1}

系统1充当作动和控制核心,将多模态上下文整合为可执行的机器人命令。它通过专用的动作专家(Action Expert,0.5B)扩展 PaliGemma2(3B)视觉语言骨干,采用 Mixture-of-Transformers 设计。设 HlVLH_{l}^{VL}HlVLHlAEH_{l}^{AE}HlAE 分别表示第 lll 层视觉语言流和动作专家流的隐藏状态。两个流的耦合方式如下:

OlVL=CausalAttnl(HlVL;HlVL)\mathbf{O}_{l}^{\mathrm{VL}} = \mathrm{CausalAttn}_{l} \big ( \mathbf{H}_{l}^{\mathrm{VL}}; \mathbf{H}_{l}^{\mathrm{VL}} \big)OlVL=CausalAttnl(HlVL;HlVL) OlAE=Attnl(HlAE;[HlVL,HlAE])\mathbf{O}_{l}^{\mathrm{AE}} = \mathrm{Attn}_{l} \big ( \mathbf{H}_{l}^{\mathrm{AE}}; [ \mathbf{H}_{l}^{\mathrm{VL}}, \mathbf{H}_{l}^{\mathrm{AE}} ] \big)OlAE=Attnl(HlAE;[HlVL,HlAE])

其中 Attn(Q;C)\mathrm{Attn}(\mathbf{Q};\mathbf{C})Attn(Q;C) 表示以 Q\mathbf{Q}Q 为查询、以上下文 C\mathbf{C}C 为键/值的注意力。视觉语言流采用因果自注意力以保留预训练的自回归接口,而动作专家对两个流的并集进行双向注意力,以生成有依据的动作。为平衡预训练表示与机器人特定学习,作者引入软知识隔离(Soft Knowledge Insulation)。该机制在连续动作通路的梯度进入视觉语言骨干之前对其进行衰减:

θVLLVLA=θVLLNTP+αKIθVLLFM\nabla_{\theta_{\mathrm{VL}}} \mathcal{L}_{\mathrm{VLA}} = \nabla_{\theta_{\mathrm{VL}}} \mathcal{L}_{\mathrm{NTP}} + \alpha_{\mathrm{KI}} \nabla_{\theta_{\mathrm{VL}}} \mathcal{L}_{\mathrm{FM}}θVLLVLA=θVLLNTP+αKIθVLLFM

其中 0<αKI<10 < \alpha_{\mathrm{KI}} < 10<αKI<1。这在适应具身控制的同时保留通用能力。

为处理时间依赖,系统1在视觉编码器中通过时空块(Temporal-Spatial Blocks)引入短期视觉记忆。这些块将视觉聚合分解为时间处理和空间处理,在不增加上下文长度的情况下将历史信息融合到当前帧表示中。此外,具身感知状态接口将本体感受状态和机器人 ID 投影到共享表示空间,并利用有效性掩码处理异构机器人形态。系统1既支持用于符号化动作的离散下一 token 预测通路,也支持用于精确轨迹生成的连续流匹配通路。

训练过程分为四个不同阶段。在 VLA 预训练阶段,系统1和系统2在异构语料库上联合优化。作者同时优化自回归下一 token 预测目标和连续动作的流匹配目标。时间上下文通过随机丢弃历史观测进行监督,分层任务监督将高层推理与低层控制耦合。

在世界模型预训练阶段,系统3通过以机器人为中心的视频预训练以及随后的价值学习进行开发。模型学习生成未来观测,并基于轨迹级完成标注估计任务进度。训练完成后,系统3的参数被冻结。

在世界模型驱动的 VLA 后训练阶段,冻结的系统3向系统1提供子目标图像和由价值导出的优势条件。作者应用随机条件丢弃,以防止过度依赖这些预测信号。随后在增强上下文下使用流匹配目标优化策略,使模型学习预测信号如何影响任务特定的动作生成。

最后,经验驱动的强化学习阶段利用策略自身的部署经验对其进行优化。作者首先使用优势加权回归目标进行离线经验强化,以对成功 rollout 片段进行加权。随后进行带人工纠正的在线强化,采用 actor-critic 框架。在困难状态下,人类操作员进行干预以提供纠正演示,策略通过持续的 rollout、纠正、更新循环迭代更新。

实验

实验在真实机器人平台上评估 GigaBrain-0.7,包括 AgileX PiPER/PiPER-X 和 Maker H01 人形机器人,以及具身视觉语言和仿真基准。架构对比验证了 PaliGemma2 双流系统1设计,而规模扩展研究表明更大且更多样化的预训练数据(尤其是增加人类演示后)能改善复杂操作。时间上下文解决了模糊重复状态问题,系统3的未来状态和价值条件提升了鲁棒性和执行效率。该模型展现出开箱即用的语言跟随和复杂操作能力,并具有一定的分布外泛化能力,在任务特定后训练后有所提升,并通过分阶段离线和在线强化学习获得进一步改进。

清洗后的具身轨迹语料库总计 37,257 小时,其中真实机器人数据占比最大,为 55.1%。UMI 演示贡献 22.2%,而自我中心人类演示、世界模型生成数据和仿真数据合计占剩余 22.7%,为机器人控制监督提供了多来源基础。真实机器人轨迹在语料库中占主导地位,超过总时长的一半。UMI 演示是第二大组成部分,约占总小时数的五分之一。仿真数据占比最小,不到语料库的 4%。世界模型生成数据提供的小时数高于自我中心人类演示,分别为 11.2% 和 7.7%。

在所列机器人类型中,真实机器人数据高度集中,Maker H01 贡献了最大比例的片段和帧。Agibot-G1 和 AgileX 是重要的第二来源,而 Ark、Galaxea R1 Lite、Franka 和 UR5 各只占很小比例。该分布反映出少数主导平台以及有限的跨具身覆盖。按片段数和帧占比,Maker H01 都是最大贡献者,接近真实机器人帧的 44%。Agibot-G1 和 AgileX 构成下一层级,其余所列平台各只贡献少量份额。

UMI 数据集贡献 8,251.83 小时的操作演示,其中自研 Maker U01 占绝大多数。EGO 数据集增加 2,862.36 小时的自我中心人类演示,来自四个来源,以自研 Maker E01 和 EgoVerse 为主。这些集合为具身学习提供了多样化的视觉动作监督。UMI 演示总计 8,251.83 小时,其中自研 Maker U01 为 6,876.25 小时,Jianzhi 10K 为 1,375.58 小时。EGO 数据总计 2,862.36 小时,其中自研 Maker E01(1,136.37 小时)和 EgoVerse(835.77 小时)是最大组成部分。

在比较的视觉语言模型骨干中,更大模型规模并未持续提高真实机器人任务成功率。Gemma 4 在清理桌面和水果抓取等结构化任务上表现强劲,而 PaliGemma2 是唯一在叠衣服上取得非零成功率且水果操作仍具竞争力的候选模型。Gemma 4 在比较的骨干中拥有最高的清理桌面和水果抓取成功率,但其清理桌面结果来自有限范围的位置泛化设置。PaliGemma2 是唯一在叠衣服上取得非零成功率同时水果操作仍具竞争力的骨干。Qwen3.5 在清理桌面上表现相对较好,但在水果抓取上大幅下降,并在叠衣服上没有成功记录。

在固定 PaliGemma2 骨干的情况下,视觉语言模型与动作专家之间的双流耦合在所有三个任务上都产生最强的真实机器人结果,包括唯一的非零叠衣服成功率。最后一层和多层交叉注意力变体在推理时成本较低,但在清理桌面和水果抓取上表现差得多,并且都在叠衣服上失败。多层交叉注意力还增加了训练成本,却没有比最后一层变体带来性能提升。双流耦合在清理桌面、水果抓取和叠衣服上取得最高成功率。交叉注意力变体相对于双流降低了推理成本,但在每个任务上表现显著更差,叠衣服成功率为零。多层交叉注意力的训练成本高于最后一层交叉注意力,却没有带来更好的任务表现。

实验评估了大型多来源具身轨迹语料库和多种真实机器人策略配置。语料库以真实机器人数据为主,并集中在少数平台上,UMI 和自我中心人类演示提供了额外的视觉动作监督。在真实机器人任务评估中,更大的视觉语言骨干并未持续提高成功率,PaliGemma2 是唯一在叠衣服上非零的骨干,视觉语言模型与动作专家之间的双流耦合在各任务上表现最强,而成本较低的交叉注意力变体表现差得多。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供