Command Palette
Search for a command to run...
ZimaBlue:通过可扩展视频预训练演化通用世界动作模型
ZimaBlue:通过可扩展视频预训练演化通用世界动作模型
摘要
机器人操作面临一个根本性的扩展挑战:鲁棒的泛化需要广泛的物理经验,但带有动作标签的机器人轨迹采集成本高昂,且多样性天然受限。以自我为中心的视频提供了一种可扩展性远更强的具身经验来源,它们捕捉了跨多样环境的物体交互、接触动力学、工具使用和长程行为。核心挑战在于如何将这种丰富但无动作信息的经验转化为有效的机器人控制。我们提出了 ZimaBlue,一个从大规模视频中学习通用世界动作模型(WAM)的可扩展框架。ZimaBlue 遵循三阶段训练课程:首先,在大规模人类和机器人自我中心视频上进行因果具身视频预训练;随后,通过采用统一动作表示的视频-动作中期训练,将学到的视觉动力学锚定在异构机器人轨迹中;最后,将模型特化至目标机器人以供部署。为使生成式 WAM 能够用于实时控制,ZimaBlue 进一步采用了一种异步的慢-快双系统架构,其中高容量慢世界模型提供可泛化的时空表征,而轻量级快分支在 NVIDIA RTX 4090 上实现 30 Hz 的动作预测。在真实机器人零样本评估中,将数据从仅目标机器人数据扩展至超过 12 万小时的具身视频,成功率从 36.1% 提升至 77.8%。ZimaBlue 在多个基准测试中均展现出强大性能,在未见任务上的增益尤为显著。
一句话总结
Joy Future Academy 的研究者提出 ZimaBlue,一个可扩展框架,通过三阶段训练课程和异步 Slow-Fast 架构,从大规模自我中心视频中学习可泛化的世界动作模型,实现 30Hz 实时控制,并利用超过 120,000 小时的具身视频,将零样本机器人操作成功率从 36.1% 提升至 77.8%。
核心贡献
- ZimaBlue 遵循三阶段训练课程:在大规模自我中心视频上进行因果具身视频预训练,使用统一动作表示的视频-动作中期训练以对齐异构机器人轨迹,以及目标机器人特化。
- 为实现实时控制,ZimaBlue 采用 Slow-Fast 双系统架构,其中高容量 Slow 世界模型提供可泛化的时空表示,轻量级 Fast 分支在 NVIDIA RTX 4090 上以 30 Hz 提供动作预测。
- 零样本真实机器人评估显示,将预训练数据从仅目标机器人数据扩展到超过 120,000 小时的具身视频,成功率从 36.1% 提升至 77.8%,且该方法在多个基准上表现强劲,在未见任务上增益尤为显著。
引言
作者应对扩展通用机器人策略的挑战,这些策略需遵循开放式语言指令并适应新场景、动力学和形态。尽管视觉-语言-动作模型继承了强大的语义先验,但其泛化仍受限于有限的动作标注机器人数据,而近期利用视频进行物理理解的世界动作模型往往依赖不适合序列化、动作相关控制的通用视频生成器。作者提出 ZimaBlue,一个三阶段训练框架,首先在超过 120,000 小时的自我中心视频上预训练因果世界模型以学习物理动力学,然后通过统一表示将其与多形态机器人动作对齐,最后在目标机器人数据上微调。进一步引入 Slow-Fast 架构,将高层世界推理与快速反应控制解耦,实现 30 Hz 闭环部署,并证明扩展视频预训练能显著提升零样本操作泛化能力。
数据集
作者构建了一个两阶段训练数据集,首先建立视频世界模型,然后引入动作监督。
阶段 I:视频预训练
- 阶段 1 – 广泛混合: 结合自我中心人类视频(EPIC-KITCHENS、Egocentric-100K、EgoDex、HOT3D-Aria)、仿真操作轨迹(DreamDojo、GenRobot)和真实机器人演示(RoboCOIN、DROID、AgiBot、Galaxea、RoboMIND2、InternData-A1)。人类来源提供多样的手-物交互模式,仿真数据提供干净的运动序列,机器人数据引入类似部署的视角和物体动力学。
- 阶段 2 – 精选具身子集: 过滤掉嘈杂的网络规模来源,仅保留以操作为中心的视频:DreamDojo、RoboCOIN、DROID、AgiBot、Galaxea、RoboMIND2、InternData-A1,以及一个大型专有人类自我中心数据集。此步骤移除低分辨率片段和缺乏详细任务指令的片段,将分布转向高质量机器人视角和指令遵循。
- 处理: 保留原始 RGB 流,标准化时空尺度,将长记录分割为可训练的片段。片段经过随机裁剪、缩放和光度抖动后,再进行 VAE 编码。每个样本包含固定长度的视觉轨迹(K 个时间块共 8K+1 帧;K=4 时产生 33 帧)、可用的语言指令,以及空的 state/action 占位符。一个虚拟动作流覆盖 24 步时间范围,但不携带语义监督。
阶段 II:视频-动作中期训练
- 形态家族: 选择四个代表性家族——DROID、AgiBot、Galaxea 和 RoboMIND2-Franka——涵盖单臂和双臂操作。所有数据被投影到标准化接口,同时保留形态特定的动力学。
- 样本结构: 每个训练样本锚定在一个关键时间步,捆绑四种同步模态:多视角视频上下文、本体感知 state、未来动作块(24 步)和语言指令。视觉上下文和动作块覆盖完全相同的时间范围,视频帧按均匀间隔采样。语言监督来自原始标注(任务指令、相机视角描述)。时间采样窗口严格限制在语言一致的片段内,避免混合不相交的子目标。
- 视觉布局: 每个形态根据其传感器配置映射到共享的三行垂直画布:
- DROID:两个外部相机 + 腕部相机。
- AgiBot:头部相机 + 左/右手相机。
- Galaxea:头部相机 + 左/右腕部相机。
- RoboMIND2-Franka:顶部相机 + 左/右腕部相机。 共享流水线应用裁剪、缩放、光度增强和画布打包以标准化输入几何。
- 本体感知和动作统一: 原生 state 和 action 被映射到统一的 100 维空间。子向量按形态填充(例如,DROID 使用单臂子集;AgiBot 和 Galaxea 填充双臂、手/夹爪、躯干和移动底座槽位;RoboMIND2-Franka 使用双 Franka 末端执行器、夹爪和关节槽位)。每个 state 和 action 张量附带二值有效性掩码以处理非活跃维度。
方法
作者通过将原生接口映射到 100 维语义 state-action 空间,解决不同机器人数据集控制接口不兼容的挑战。这确保每个坐标在不同形态间保持一致的物理含义。state 和 action 共享相同的槽位布局,其中 state 描述当前机器人配置,action 表示未来控制块。每个末端执行器姿态占用 9 维,使用 3D 平移和连续 6D 旋转表示。额外槽位涵盖夹爪、手臂关节、躯干、移动底座和灵巧手,每个形态仅激活其原生接口定义的槽位。
为改善跨机器人和场景的对齐,作者将末端执行器 action 表示为相对于每个动作块第一帧的本体感知 state。记锚点姿态为 (p0,R0)∈R3×SO(3),在时间范围 h 的目标姿态为 (ph,Rh)∈R3×SO(3),相对姿态变换为:
Δph=R0−1(ph−p0),ΔRh=R0−1Rh.这里,Δph 和 ΔRh 表示相对平移和旋转,后者以 6D 旋转格式参数化。关节目标遵循类似的相对定义。未定义的槽位用零填充,并附带有效性掩码以在训练中排除非活跃坐标的监督。
为实现低延迟控制,作者设计了 Slow-Fast 双系统架构,将高容量世界建模与高频动作生成分离。
如下图所示:
Slow DiT 保持强大的以视频为中心的世界模型。它处理 RGB 观测、本体感知 state st 和文本指令 ℓ,将其编码为视觉 latent token、state token 和语言嵌入。训练时,它还摄入带噪的未来视频和 action token,以建模因果视觉动力学并预测未来视频 latent。辅助 action 监督附加到 Slow 分支,以强制预测的视频动力学与动作序列之间的语义对齐。
Fast DiT 作为实时执行的专用动作生成模块。Fast DiT 不在每个控制步运行沉重的世界模型,而是重用 Slow 分支前 12 层的逐层视频键值(K/V)缓存作为条件引导。它利用更新的观测 latent、当前 state token、语言条件和带噪 action token 来预测最终动作序列。耦合发生在自注意力层内,其中 Fast DiT 的 action 查询交叉关注缓存的 Slow 视频 token,有效传递视觉动力学而无需生成完整未来视频序列。
模型使用三级数据金字塔训练,逐步将预训练的文本到视频扩散 transformer 适应到具身智能。
如下图所示:
课程包含三个阶段。阶段 I,视频预训练,使用大规模异构视频将视觉生成先验适应到因果具身动力学,无需动作标注。作者采用统一的三视图视觉接口处理异构相机可用性,填充缺失视图并通过有效性掩码将其排除在流匹配损失之外。视频损失在有效视觉 token 上使用块因果教师强制注意力方案计算。
阶段 II,视频-动作中期训练,引入带有同步观测、本体感知 state、语言指令和 action 的机器人轨迹。Slow 世界模型使用统一流匹配目标联合预测未来视频 latent 和动作块:
LsupS=λvidLvid+λactLact.这种联合预测将预训练的视觉动力学与跨形态动作语义相结合。视频和动作噪声水平在去噪步内耦合,以对齐视觉展开不确定性与电机命令不确定性。
阶段 III,后训练,将模型特化到目标形态。作者首先将 Slow 分支特化到目标域,保留其统一 state 和 action 接口或附加轻量级形态特定编码器。然后,冻结 Slow 分支,使用仅动作流匹配目标训练 Fast 分支。为模拟异步闭环执行,Fast 分支使用实时分块(RTC)训练,接收前一个动作序列的短前缀,并基于最新观测和 Slow 引导预测剩余后缀。
为加速闭环控制,作者采用异步 Slow-Fast 推理和扩散步蒸馏。
如下图所示:
Slow 和 Fast 分支以不同频率运行。Slow 流作为低频世界模型预测器,执行长时展开并导出逐层视频 K/V 缓存。Fast 流以高频运行,持续使用最新观测和可用的 Slow 引导优化动作,无需等待下一次 Slow 展开。时间一致性通过 RTC 推理机制保持,每个 Fast 请求使用前一个动作序列的前缀来锚定转换。
后训练后,分布匹配蒸馏(DMD)依次应用于两个分支。Slow 分支从每次展开的八次 DiT 评估蒸馏到两次,保留其联合视频-动作预测。随后,Fast 分支从每次请求的八次 DiT 评估蒸馏到两次,条件于蒸馏后 Slow 分支的逐层视频 K/V 引导。这种两阶段蒸馏显著降低推理延迟,同时保留原始模型架构和异步闭环执行协议。
实验
评估涵盖真实机器人零样本任务(标准套件和扰动套件)和仿真基准(LIBERO-Plus、RoboTwin 2.0、RoboCasa365),以分离自我中心视频预训练、多形态动作数据和双系统架构的影响。多形态轨迹主要增强接触密集型操作技能,而大规模自我中心视频预训练显著改善视觉泛化和对环境扰动的鲁棒性。Slow-Fast 双系统设计进一步提升需要频繁视觉反馈的闭环执行,基准结果证实视频预训练对于泛化到未见组合任务和在视觉域偏移下保持性能至关重要。
统一的 100 维 state–action 空间将多样的机器人控制接口映射到一致的语义布局。每个形态仅激活与其物理能力对应的槽位,未使用的坐标用零填充并掩码。动作相对于每个动作块的第一帧表示,以改善跨不同机器人和场景的对齐。像 DROID 这样的单臂机器人仅激活 100 维中的 17 维,覆盖左末端执行器、左夹爪和左臂关节,而双臂系统可额外启用右侧槽位以及可选的躯干、底座和手部槽位。末端执行器动作被转换为块相对坐标系:目标姿态相对于块起始时的本体感知 state 表示,后者作为跨形态的稳定参考锚点。
扰动评估套件引入两种视觉扰动类型,以测试策略在标准实验室条件之外的鲁棒性。动态光照施加眩光和闪烁灯光并伴有周围干扰物,场景外观使用桌布背景和未见干扰物。每种扰动类型搭配两个操作任务。动态光照扰动包括眩光、闪烁灯光和周围干扰物。场景外观扰动引入桌布背景和未见干扰物。
渐进式预训练数据扩展在零样本真实机器人成功率上带来单调增益。完整的 ZimaBlue 模型,结合多形态和 120K 小时自我中心视频,在标准套件上达到 87.9%,在扰动套件上达到 57.5%,大幅超越外部基线。自我中心视频对视觉泛化特别有效,当从 60K 扩展到 120K 小时时,在扰动套件上带来 22.5 个点的提升。添加 6K 小时多形态动作数据将总体成功率从 36.1% 提升至 46.1%,主要通过增强接触密集型任务的可执行控制。将自我中心视频从 60K 扩展到 120K 小时,扰动套件成功率提升 22.5 点,所有四个扰动任务在视觉变化下均有改善。
双系统架构显著提升需要空间定位、关节物体操作和多物体运输的任务成功率,但在少数简单堆叠任务上性能略有下降。DMD 蒸馏变体保留了大部分增益,仅有轻微下降,提供了更快的推理替代方案。这揭示了一种权衡:快速反应分支有助于接触密集和动态场景,但可能干扰精确的慢速运动。双系统将篮子空间定位的 6/10 低分变为完美的 10/10,并将微波炉关节物体操作成功率从 6/10 提升至 9/10。在碗和积木等简单堆叠任务上,Slow 基线优于双系统,表明快速分支可能破坏精确堆叠动作。DMD 蒸馏模型仅使用 2 个推理步,紧密跟随完整双系统,在篮子和空气炸锅上达到 9/10,在玩具上达到 27/30。
在 LIBERO-Plus 的零样本迁移中,ZimaBlue 取得最高总体成功率,超越 InternVLA-A1.5。它对机器人初始状态和光照变化表现出强鲁棒性,而相机视角变化仍是主要弱点。监督微调将总体性能提升至 92.0%,主要得益于相机视角泛化的显著改善。ZimaBlue 以 86.7% 的平均成功率领先零样本迁移,比 InternVLA-A1.5 高 0.9 个百分点。零样本性能在光照和机器人状态扰动上最强,但相机视角准确率是瓶颈,为 58.1%。通过监督微调,总体成功率升至 92.0%,相机视角鲁棒性跃升至 95.4%。微调带来的 5.3 点总体增益主要归因于相机视角的改善,突显零样本视角泛化受限于预训练数据多样性。
评估使用统一的 100 维动作空间和包含动态光照与场景外观变化的扰动套件来测试策略鲁棒性。预训练数据扩展揭示自我中心视频极大改善视觉泛化,而多形态动作数据增强接触密集型任务的执行。双系统架构增强空间定位和关节物体操作,但可能干扰精确堆叠,蒸馏变体保留了大部分增益。在 LIBERO-Plus 的零样本迁移显示对光照和机器人状态变化的强鲁棒性,但相机视角泛化有限,这通过监督微调基本恢复。