Command Palette
Search for a command to run...
DreamX-Phi 1.0:面向机器人操作的动作条件视频世界模型
DreamX-Phi 1.0:面向机器人操作的动作条件视频世界模型
Rui Chen Xiangxiang Chu Geng Li Jifan Li Qingfeng Shi Datao Tang Jing Tang Jun Wang Pengfei Zhang
摘要
我们提出了 DreamX-Phi 1.0,一个面向机器人操作的动作条件视频世界模型。给定一帧观测图像、一条语言指令以及由末端执行器位姿和夹爪状态组成的指定动作序列,该模型能够预测未来的观测结果。然而,仅凭真实感并不能保证忠实性:一段看似逼真的推演仍可能移动错误的手臂或丢失被操作物体。为确保预测遵循每只手臂的指令路径,我们通过 PRoPE 风格的几何编码将逐臂 SE(3) 变换注入注意力机制,从而保留手臂身份与刚体运动结构。仅靠动作控制不足以完全约束场景几何以及小型被操作物体的演化。为此,我们引入了一个轻量级深度分支以获取场景级几何信息,并使用 SAM3 掩码与冻结的 V-JEPA 教师模型在抓取过程中保持物体一致性。我们进一步通过分布匹配蒸馏将多步生成器蒸馏为少步学生模型,以实现高效部署。截至撰写本文时,DreamX-Phi 在 WorldArena 2.0 挑战赛的第一赛道中排名第一,在第二赛道中排名第二。我们的模型与代码将公开发布。
一句话总结
DreamX 团队提出 DreamX-Phi 1.0,一种用于机器人操作的动作条件视频世界模型,可从观测帧、语言指令以及给定的末端执行器位姿与夹爪状态预测未来观测。该模型使用逐臂 SE(3) 几何注意力编码、轻量深度分支、SAM3 掩码与冻结 V-JEPA 教师,并采用分布匹配蒸馏,在 WorldArena 2.0 挑战赛 Track 1 获得第一名、Track 2 获得第二名。
核心贡献
- DreamX-Phi 1.0 是一种用于机器人操作的动作条件视频世界模型,可根据观测帧、语言指令以及给定的双臂末端执行器位姿与夹爪状态动作序列预测未来观测。
- 该模型通过 PRoPE 风格的几何编码将逐臂 SE(3) 变换注入注意力,以保留每个臂的指令路径,并加入轻量深度分支、SAM3 掩码和冻结 V-JEPA 教师来监督场景几何与物体一致性。
- 多步生成器通过分布匹配蒸馏被蒸馏为少步学生模型,以便高效部署;在 2026 年 8 月 12 日的 WorldArena 2.0 快照上,该提交在 Track 1 的 31 个参赛方案中排名第一,EWMScore-P 为 60.65,并在 Track 2 的 Adjust Bottle 任务上以 67.19% 成功率并列第二。
引言
世界模型通过让机器人在候选动作下想象未来观测来支持规划,但忠实的动作条件建模仍然困难。现代视频生成器提供了强大的外观和运动先验,然而现有动作接口通常将指令编码为紧凑 token 或特征调制,缺乏显式的 SE(3) 刚体几何信息,也未指示被指令的运动应出现在图像中的哪个位置。因此,一次推演可能看起来逼真,但仍会显示错误的臂部运动、遗漏物体或混淆抓取与释放。作者提出 DreamX-Phi 1.0,一种几何感知的动作条件视频世界模型,通过基于 PRoPE 的注意力保留 SE(3) 末端执行器轨迹,利用图像空间运动线索将其接地,并加入深度和以物体为中心的监督来改善场景几何与被操作物体的一致性。
数据集
作者从三个互补来源构建数据集:
- 无动作自我中心视频
- 真实机器人演示
- 仿真机器人轨迹
整体规模见论文表 1。提供文本中提到的具体规模细节包括:
- 过滤后的 AgiBot 模仿学习划分:178.7 小时
- 动作条件池中的 RoboTwin 部分:25,000 个双臂片段,涵盖干净与随机化变体
- WorldArena 2.0 Track 1 评估集:1,000 个回合
- WorldArena 1.0 Track 1 评估集:Clean-50 协议,包含 50 个操作任务,每个任务 10 个留出回合
数据集处理
作者应用了若干过滤与归一化步骤:
- 移除由移动基座运动、灵巧手操作或静止片段主导的机器人轨迹
- 有意保留失败任务执行,因为失败可暴露失败模式和非理想交互动态
- 将观测、指令、机器人状态和动作归一化为统一的 LeRobot v2.1 表示
- 保留原始相机结构:单视角记录仍为单视角样本
- 将同步多视角流在空间上进行拼接,形成统一的多视角视频
- 对动作条件池中的 RoboTwin 视频,应用 DreamX-Refiner 将片段超分辨率重建为高分辨率视觉数据
所提供章节中未描述明确的裁剪策略。
数据使用方式
数据集被划分为两个训练池:
动作无关预训练
- 使用每个保留的视频,无论其来源是否提供动作标注
- 包括自我中心视频、真实机器人操作和仿真
- 通过视图自适应组织支持单视角和多视角下游设置
动作条件微调
- 仅限具有同步动作标注的视频
- 每个视频与其对应的机器人轨迹配对
- 视觉流与控制流保持时间一致
- 包括经 DreamX-Refiner 超分辨率处理后的 25,000 个 RoboTwin 双臂片段
在评估方面,作者使用基于 RoboTwin 2.0 轨迹构建的 WorldArena 数据集:
- WorldArena 2.0 Track 1 提供初始 RGB 观测、语言指令和机器人动作轨迹;模型在任一信号条件下预测后续推演
- WorldArena 1.0 Track 1 使用 Clean-50 协议
- WorldArena 2.0 Track 2 使用提交的世界模型作为推演环境,用组织者提供的初始化和固定奖励模型优化策略,在 RoboTwin 2.0 中留出的 Adjust Bottle 回合上进行评估
方法
作者提出一种动作条件视频预测框架,对给定观测帧 x0、语言指令 c 和给定双臂动作轨迹 a1:T 时未来 RGB 帧的条件分布 pθ(x1:T∣x0,a1:T,c) 进行建模。该架构构建于 Wan2.2-TI2V-5B 视频扩散 Transformer 之上,其中第一帧的潜变量提供视觉上下文,未来帧潜变量在流匹配目标下学习。整个系统组织为三个主要部分:动作条件视频预测、训练监督和少步后训练。
在动作条件视频预测模块中,模型将结构化动作条件与生成路径集成。与将动作视为低维 token 不同,作者采用位姿-旋转位置嵌入(PRoPE)机制。该方法将已知的相对 SE(3) 变换直接插入自注意力机制。双臂动作轨迹通过按臂分组的 PRoPE 流处理,对查询、键和值投影施加几何变换,同时配合独立的夹爪偏置注入。与这种 3D 几何条件互补,仅机器人的光流线索提供图像平面运动信号。这两条流在视频扩散 Transformer 内通过联合注意力交互,以预测未来 RGB 视频。
为确保训练中的物理与几何一致性,作者引入多方面监督策略。首先,为防止静态背景主导损失,使用 SAM3 派生的物体掩码计算掩码加权 RGB 损失,使流匹配目标聚焦于被操作物体。其次,加入辅助深度监督分支以强制 3D 一致性。由 Depth Anything 3 生成的深度图被编码为潜变量目标,轻量深度分支使用潜空间均方误差损失预测这些目标。第三,为规范被操作物体的时空演化,冻结 V-JEPA 教师提供物体关系监督。通过对掩码物体 token 上的学生与教师特征 Gram 矩阵进行对齐,鼓励模型在接触区间内保持一致的物体身份和状态。
最后,为实现高效推理,作者应用少步后训练蒸馏过程。遵循 DMD2 方法,多步教师模型被蒸馏为少步学生模型。这通过结合分布匹配目标与带噪非饱和 GAN 目标实现,前者最小化学生分布与真实数据边缘分布之间的 KL 散度。学生模型使用分布匹配损失和对抗损失共同优化,使其能在显著更少的去噪步骤中生成高质量未来视频。
实验
DreamX-Phi 1.0 在 WorldArena 2.0 上沿两个轴进行评估:Track 1 衡量语言或动作条件视觉推演的保真度,Track 2 测试该模型作为学习推演环境,在留出的 Adjust Bottle 回合上训练策略。该模型在 Track 1 排行榜上以 EWMScore-P 60.65 排名第一,在 Track 2 上取得 67.19% 成功率并并列第二,在随机化背景、纹理、光照和干扰物布局下定性保持了连贯的臂部、夹爪和被操作物体。离线 WorldArena 1.0 评估进一步达到 76.88,超过领先官方参赛方案,不过评估仍局限于 WorldArena 和 RoboTwin,且仅覆盖视频预测而非闭环控制。
精选语料来自自我中心视频、真实机器人演示和仿真机器人轨迹,以支持动作无关和动作条件学习。自我中心视频和仿真机器人数据按时长贡献最大份额,而真实机器人来源提供数百到近两千小时的实际执行操作。RoboTwin 以动作标注片段而非时长报告,并增加仿真双臂覆盖。自我中心视频按时长是最大单一来源,仿真机器人数据构成最大的动作标注池。在真实机器人来源中,AgiBot World 最大,其他真实机器人集合相对较小。RoboTwin 贡献仿真双臂片段而非小时数,其动作标注用于动作条件微调。
在 2026 年 8 月 12 日快照上,DreamX-Phi-1.0-FDM-0730 在 31 个参赛方案的 Track 1 排行榜上以 EWMScore-P 60.65 排名第一,领先 Alpha-World 和 FlowWAM-FiveAges。前三个系统在大多数报告的组件指标上接近,DreamX-Phi 显示最强的背景一致性和运动平滑性,而 Alpha-World 和 FlowWAM-FiveAges 在视觉质量和光度一致性上领先。选定的开源参考模型通常落后于领先组,在主体一致性、光度一致性或 JEPA 相似性方面存在明显弱点。DreamX-Phi-1.0-FDM-0730 以报告参赛方案中最高的总体 EWMScore-P 领先 Track 1。Alpha-World 和 FlowWAM-FiveAges 位列前三,并在大多数组件指标上接近 DreamX-Phi,具有更好的图像或美学质量与光度一致性。DreamX-Phi 在前三名中显示出最佳背景一致性和运动平滑性,而动态程度和光流分数差异仍然较小。GigaWorld-0、Vidar 和 WoW 落后于前三名,在 JEPA 相似性、主体一致性或光度一致性方面差距尤其大。
在 2026 年 8 月 12 日快照上,WOVR-PLUS 在所显示系统中拥有最高的 Adjust Bottle 成功率,领先并列第二的 DreamX-Phi-1.0-FDM-0730 和 Lute。其余开源参考模型得分均更低,其中 OpenSora 在该组中成功率最低。WOVR-PLUS 以 68.75% 领先,比 DreamX-Phi-1.0-FDM-0730 和 Lute 共享的第二名得分高 1.56 个百分点。CtrlWorld、IRASim、RoboScape 和 OpenSora 落后领先组约 6 到 8.6 个百分点,其中 OpenSora 最低,为 60.16%。
将离线 DreamX-Phi-1.0-FDM-0730 评估与 WorldArena 1.0 官方排行榜前列和选定的开源参考系统进行比较。DreamX 系统在所显示模型中记录最高总分,达到 76.88,超过领先官方快照参赛方案 3.24 分。在报告的组件指标中,相对于官方前三名,它在若干视觉和运动质量度量上表现出有竞争力或领先的结果。DreamX-Phi-1.0-FDM-0730 达到 76.88 的总分,在所显示系统中最高,比领先官方快照参赛方案高 3.24 分。官方前三个系统紧密聚集,而离线 DreamX 结果高于它们全部。在报告的组件指标中,DreamX 在比较系统中记录了最高的视觉质量、运动质量和美学质量。
实验评估了精选训练语料,并在 Track 1 世界生成、Adjust Bottle 操作任务和离线 WorldArena 比较上进行了基准测试。DreamX-Phi 系统凭借背景一致性和运动平滑性优势领先 Track 1,而接近的竞争者在视觉质量和光度一致性上得分更高。在 Adjust Bottle 上,WOVR-PLUS 记录最高成功率,领先 DreamX-Phi 和 Lute,其余参考模型落后。在离线 WorldArena 评估中,DreamX-Phi 在所比较系统中取得最高总分,并在视觉、运动和美学质量上领先。