Command Palette
Search for a command to run...
将智能体式游戏开发作为可验证的轨迹数据引擎以扩展世界模型
将智能体式游戏开发作为可验证的轨迹数据引擎以扩展世界模型
Pengfei Zhou Hexin Wang Zhengfeiyang Zhang Yixing Ma Zhenglin Wan Kaipeng Zhang Wangbo Zhao Yang You
摘要
扩展世界模型的一种常见策略是使用更多算力在更多爬取视频上进行训练。我们认为这种策略效率低下:扩展世界模型还需要一个能够提供可靠奖励信号的递归数据引擎。代码智能体的成功说明了这一点的重要性。由于代码是可执行的,编译器和运行时可以为大语言模型的强化学习(RL)后训练提供高质量奖励。相比之下,空间生成仍然主要依赖模糊的代理指标,如 CLIP 分数。这些信号模糊且有偏,难以支持 RL 后训练。与此相对,游戏开发为空间世界模型提供了一种缺失的奖励环境。由游戏引擎编码的场景是一种可执行的世界规范:引擎可以高效地检查碰撞、物理、可导航性和有界可玩性,而开发者则通过判断场景是否应被接受来提供全局验证信号。游戏开发还为 RL 后训练提供了真实世界的长程轨迹数据。因此,我们提出了基于人-引擎验证的强化学习(RLHEV),这是一种将密集的引擎信号与开发过程中隐含的人类接受反馈相结合的后训练范式。我们将这一训练目标应用于所提出的智能体世界模型(AWoMo):一个世界构建智能体,它提出场景编辑建议,观察人-引擎验证,并将接受或修复后的多模态轨迹转化为训练数据。我们通过受控实验评估了所提出的方法。在包含 200 个 Unity 资源编辑评估样本的 UnitySceneBench 上,我们的 RLHEV 获得了最高分。在泛化方面,迁移学习有助于应对分布外偏移,并在 Unreal 和 Godot 跨引擎实验中给出了积极信号。AWoMo 增强的训练还提升了策略在 R2R、Gymnasium MuJoCo 和 D4RL Gym-MuJoCo 上的具身表现。智能体工件已发布以供复现:https://github.com/LanceZPF/cardinal-preview。
一句话总结
新加坡国立大学、加州大学伯克利分校及其合作者提出人机验证强化学习(Reinforcement Learning with Human-Engine Verification, RLHEV),这是一种后训练范式,将密集的游戏引擎信号与隐式人类接受相结合,训练用于场景生成的 Agentic World Model (AWoMo),从而为空间世界模型提供有根据的奖励信号,并提升在 R2R 和 MuJoCo 上的具身策略表现。
核心贡献
- RLHEV 是一种后训练范式,将密集的引擎验证信号(碰撞、物理、可导航性)与来自游戏开发的隐式人类接受反馈相结合,为空间世界模型提供有根据的奖励。
- AWoMo 是一个 agentic 世界模型,它提出场景编辑,观察人机验证,并将被接受或修复的多模态轨迹转化为训练数据。
- 在 UnitySceneBench 上,RLHEV 取得了最高分。在 Unreal 和 Godot 跨引擎实验中,迁移学习产生了正向信号,并且 AWoMo 增强的训练提升了在 R2R、Gymnasium MuJoCo 和 D4RL Gym-MuJoCo 上的具身策略表现。
引言
视频生成、3D 合成和世界建模等空间智能任务缺乏可扩展且可靠的验证,而这种验证曾加速了代码和推理 agent 的进步。先前的工作依赖于模糊的代理指标,如 FVD 和 CLIP 相似度,以及昂贵、低带宽的人类评分,这引入了噪声和偏差,将后训练限制在模仿而非正确性上。作者认为,游戏开发提供了一种实用的递归数据引擎:游戏引擎自动验证结构属性(碰撞、导航、脚本完整性),而人类开发者提供最终的接受判断,从而产生密集、有根据的反馈。他们提出了 Agentic World Model (AWoMo),一个以开发者为中心的 agentic 工作流,捕捉完整的世界构建轨迹,并使用人机验证强化学习(Reinforcement Learning with Human-Engine Verification, RLHEV)进行训练。这种双重验证循环将世界构建转变为自我改进的过程,为空间模型提供了一条类似于代码领域成功的后训练路径。
方法
作者提出人机验证强化学习(RLHEV)来解决空间生成中模糊、主观奖励代理的局限性。RLHEV 并非仅依赖昂贵且嘈杂的最终输出人类标注,而是利用游戏引擎作为廉价、有根据的结构属性验证器,同时将人类判断保留用于最终接受和意图对齐。
如框架图所示:
这种方法将范式从高成本、低质量的主观标注转变为递归、不断演进的循环。核心系统名为 AWoMo,围绕一个全模态世界模型组织,具有四个不同的接口。意图接口接收任务简报和设计约束。动作接口发出场景程序、资产编辑和修复动作。验证接口记录引擎检查,如碰撞、物理稳定性和导航网格可达性。最后,审查接口捕捉开发者的接受、拒绝和批评。执行循环遵循提出、渲染、验证、修复和审查的周期,生成结构化轨迹作为训练数据。
参见下图:
底部管线展示了这一人机反馈循环。原始输入由 Agentic World Model 处理,该模型与游戏引擎和游戏开发者交互。引擎通过涉及用户意图、物理、多模态大语言模型和 agent 的递归反馈循环提供局部失败信号。这与顶部管线形成鲜明对比,在顶部管线中,合成和人工标注导致模糊的奖励和过度优化的陷阱。
该架构的核心是共享的可执行场景程序表示。
如下图所示:
由 RLHEV 训练的世界模型通过该场景程序桥接理解与生成。生成过程(前向映射)将文本意图、设计目标和任务规范映射到场景合成,产生实体、变换、材质、物理和行为脚本。理解过程(逆向映射)对图像、视频和 3D 高斯泼溅进行场景推理,以逆向工程场景程序。模型由引擎原生标签(空间、接触、可供性、物理)和人类世界知识对齐(开发者验证)所 grounding。
为了规范化数据收集,作者引入了统一世界开发协议(Unified World-Development Protocol, UWDP)。这种类型化的多模态协议将普通的游戏开发工作转化为状态-动作-检查-审查轨迹。一个紧凑的实例定义为 ut=(b,ot,st,at,gt,vt,ht,ρt),其中 b 是设计意图,ot 是对象标识符,st 存储空间和语义场,at 是编辑动作,gt 是引擎输出,vt 是渲染证据,ht 是审查者决策,ρt 关联修复和风险。该协议确保用于构建世界的工作流同时发出其自身可验证的训练数据。
实验
评估使用人机验证工作流,其中世界模型生成或编辑游戏资产,接收来自引擎检查和人类审查者的反馈,并在该信号上进行后训练。在 UnitySceneBench 上的实验表明,结合人类和引擎奖励实现了最佳的资产分类性能,而在源数据上预训练改善了 Unity 内的分布外泛化,并对 Unreal 和 Godot 引擎产生了正向迁移增益。具身诊断运行进一步证明,AWoMo 增强的训练提升了导航和运动任务上的策略表现。总体而言,试点研究支持人机验证作为一种实用的反馈来源,在双重验证下观察到最强的增益,但需要更大规模的研究来确认泛化性。