Command Palette
Search for a command to run...
单桌面 GPU 上的无限交互世界推演
单桌面 GPU 上的无限交互世界推演
摘要
我们提出 ABot-World-0,一个面向实时、长时域闭环交互的动作条件视频世界模型,并构建了涵盖 AAA 游戏、仿真引擎和互联网视频的多源数据基础设施,以学习可控的世界动态。WorldExplorer 根据训练反馈进行智能体驱动的数据采集,同时通过统一流水线执行 14 项确定性质量检查、基于 VLM 的评估以及同步的动作与文本标注。我们通过教师强制和 ODE 蒸馏,逐步将双向动作条件教师模型蒸馏为因果学生模型,并引入 LongForcing 技术,使学生的长程自推演与扩展时域的教师模型对齐,从而缓解累积的分布偏移和自回归漂移。原始键盘动作提供了统一的控制接口,用于场景漫游和第三人称角色交互,而参考角色记忆则为第三人称推演中的身份一致性提供持久的视觉线索。在部署方面,我们协同设计了流式推理栈,包含轻量级 VAE 解码器、高效注意力机制、内存感知调度和低比特 DiT 推理。在多种优化的低比特配置下,ABot-World-0 在单块 NVIDIA RTX 5090 桌面 GPU 上以最高 16 FPS 的帧率流式生成 720P 视频,动作到首帧延迟为 1.2 秒,峰值显存占用约 19 GiB。在 WorldRoamBench 和扩展交互推演上的实验表明,该模型具有竞争力的可控性和连贯的长时域世界演化能力。
一句话总结
ABot-World团队提出ABot-World-0,这是一个以动作为条件的视频世界模型,其训练基于跨AAA游戏、模拟引擎和网络视频的多源数据基础设施,并通过WorldExplorer在训练反馈引导下进行agent驱动采集,以及应用14项确定性质量检查、基于VLM的评估和同步动作与文本标注的统一流程。该流程通过teacher forcing和ODE蒸馏,逐步将双向动作条件教师模型蒸馏为因果学生模型,并引入LongForcing将学生模型的长时自回归rollout与扩展时间范围的教师模型对齐,以缓解分布偏移和自回归漂移。模型采用原始键盘动作作为统一控制接口,用于场景漫游和第三人称角色交互,并配以参考角色记忆提供持久的角色外观线索。同时,协同设计了流式推理栈,包含轻量级VAE解码、高效注意力机制、内存感知调度和低位DiT推理,在单个NVIDIA RTX 5090桌面GPU上实现最高16 FPS的720P视频流式生成,动作到首帧延迟为1.2秒,峰值显存约19 GiB,在WorldRoamBench上实现了具有竞争力的可控性和连贯的长时世界演化。
核心贡献
- 一种渐进式蒸馏流程,通过teacher forcing和ODE蒸馏将双向动作条件教师模型转换为因果学生模型,并通过LongForcing将学生模型的长时自回归rollout与扩展时间范围的教师模型对齐,以缓解分布偏移。在60秒rollout上的评估显示,相对于因果forcing基线,视觉误差累积有所减少。
- 与轻量级VAE解码器、高效注意力机制、内存感知调度和低位DiT推理协同设计的流式推理栈,在单个NVIDIA RTX 5090上实现最高16 FPS的720P流式生成,动作到首帧延迟为1.2秒,峰值显存低于19.3 GiB,从而实现实时桌面部署。
- 统一交互控制使用原始键盘动作进行场景漫游和第三人称角色操控,并由参考角色记忆支持以提供持久的角色外观线索。在WorldRoamBench和扩展rollout上的结果表明,其具有竞争力的可控性和连贯的长时世界演化。
引言
人工智能正从生成静态片段转向构建持久的、可交互的世界,其中动作不断改变状态,且视觉响应必须在长时rollout中保持连贯。Genie、GameNGen和Oasis等先前系统已证明视频模型可由用户输入操控,但仅扩展视频生成规模未能解决四个相互关联的瓶颈:获取具有可靠、同步动作标签的大规模数据;在单一接口中同时表示摄像机导航和具身角色控制;防止生成输出成为下一输入时累积的视觉漂移;以及在实用硬件上以交互速度部署完整的生成与解码流程。作者提出了ABot-World-0,这是一个统一的动作条件世界模型,构建于多源数据基础设施之上,该设施结合了AAA游戏、模拟和网络视频数据,并通过agent驱动的采集和严格的质量检查。该模型使用原始键盘输入进行场景漫游和角色控制,并采用渐进式训练流程,将双向教师模型蒸馏为因果学生模型,随后应用称为LongForcing的技术来监督长时自回归rollout并减少分布偏移。优化的流式推理栈协同设计轻量级解码、低位推理和内存感知调度,在单个RTX 5090上以最高16 FPS的速率、1.2秒的动作到首帧延迟输出720P画面,将交互式世界建模作为一个全栈系统挑战来解决。
数据集
作者从三个互补的数据源构建训练语料库,通过统一流程处理,并用于动作条件和文本条件的世界模型训练:
-
数据源概览
- AAA游戏数据:捕获高保真、同步的动作和观测信号,带有真实的控制标签。
- 模拟引擎数据:提供几何精确、照片般逼真的合成场景,带有确定性的动作标签。
- 真实世界网络数据:通过姿态估计的伪标签引入自然的摄像机动态、光照变化和领域多样性。
-
游戏数据详情
- 由WorldExplorer agent在多个AAA游戏(开放世界、驾驶、马术)中以第一和第三人称视角采集。
- RGB视频,分辨率1920×1080,与逐帧摄像机姿态、控制输入和环境元数据同步。
- 控制信号直接从游戏运行时API捕获,产生无噪声的动作标签,并转换为规范表示。
-
模拟数据详情
- 使用Unreal Engine和专有街道航拍及街道扫描资产的ABot-3DGS重建,创建大型室外和室内环境。
- 轨迹通过程序生成(带插值的几何模式)或从真实世界设备运动路径导入,以保留真实的浏览行为。
- 动作标签通过将平移/旋转位移投影到摄像机基向量并二值化来确定性推导。
-
网络数据详情
- 被动来源于驾驶、步行和航拍视频;片段根据场景连贯性进行分割。
- 为每个片段(根据室内/室外、静态/动态和纹理丰富度选择)估计6自由度摄像机姿态,然后通过位移投影和阈值处理推导动作意图标签——产生虽存在估计噪声但扩展了多样性的伪标签。
-
质量过滤
- 所有原始数据通过一个包含文件完整性、视觉有效性、几何一致性、游戏状态正确性、动作标签对齐和元数据质量的三阶段、14项检查流程。
- 基于VLM的语义过滤可移除UI叠加层、加载画面、弹窗和渲染异常。后续检查中产生的软信号用于训练时样本加权,而非硬性剔除。
-
标注与使用
- 动作标签在所有数据源间统一为规范格式,支持联合模型训练。
- 一个大型VLM生成结构化的场景描述(游戏数据带有游戏标识token)作为文本条件输入,同时有意省略摄像机运动信息,以将控制与场景描述解耦。
- 每个片段接收语义标签(室内/室外、天气、时间、车辆类型、视角),用于分层采样和针对性微调。
- 对于第三人称片段,从四个视角裁剪人物身份缩略图,并通过基于图像的人脸补全合成规范的正面肖像,以支持身份条件生成。
-
闭环数据生产
- WorldExplorer根据训练反馈调整采集比例:监控模块跟踪各类别表现,诊断弱点,并调整任务模板——使数据集成为模型开发周期中的一个演进部分,而非一次性预处理步骤。
方法
作者将交互式世界建模任务形式化为基于过去帧、用户动作和多模态条件预测未来视觉观测。形式化地,给定视觉历史v0:t−1,未来动作序列at:t+L−1和多模态条件c,模型旨在预测长度为L的下一个视频块vt:t+L−1。整体训练流程包含两个主要阶段:将预训练视频生成器适配为双向教师模型,并逐步将其蒸馏为用于高效rollout的因果自回归学生模型。
双向教师模型训练 为使预训练视频生成器具备动作条件动态知识,作者将原始键盘输入和参考图像注入骨干网络。原始键盘动作表示为每帧一个8维多热向量。为对齐视频tokenizer的时间压缩,每4个连续帧级动作沿通道维度打包,产生一个32维的动作token序列。这些打包的动作token由动作控制适配器处理,该适配器使用PixelUnshuffle和卷积块来匹配VAE的空间压缩比。随后,动作条件化的潜在token被加法注入DiT骨干网络。
为防止长时第三人称rollout期间的身份漂移,引入了参考角色记忆模块。角色的规范参考图像被编码并转换为身份记忆token,这些token被前置到视频token序列中。非对称注意力模式允许视频token关注记忆token,同时保持记忆token隔离,确保持久的身份检索。
因果渐进式学生蒸馏 由于双向教师模型依赖全序列生成和迭代去噪,无法部署用于实时自回归rollout。作者采用三阶段渐进蒸馏流程将教师模型转换为因果学生模型。
第一阶段,Teacher Forcing,因果学生模型由双向教师模型初始化,并在因果注意力掩码下训练。历史帧作为干净的真实潜在变量提供,而目标块则被破坏用于扩散训练。这使模型适配因果生成,同时保留教师模型学到的视觉先验。
第二阶段,ODE蒸馏,作者将多步自回归去噪过程压缩为少步推理。一个冻结的第一阶段因果模型定义了一条概率流ODE轨迹。蒸馏模型被训练为在相同因果上下文中,直接从中间噪声潜在变量预测干净的端点,显著降低推理延迟。
第三阶段,LongForcing,作者解决长时rollout期间分布误差累积问题。通过将学生模型暴露于扩展的自回归rollout上下文,并应用来自扩展时间范围教师模型的分布级校正监督,LongForcing减轻了渐进式退化和自回归漂移,而无需显式帧级轨迹匹配。
面向实时Rollout的全栈协同设计 为在单个消费级GPU上实现实时交互生成,作者实施了全栈协同设计。轻量级VAE解码器降低了首帧延迟和峰值内存使用。内存感知运行时调度根据模块执行顺序对其进行分级,以最小化显存压力。Fast-RoPE在局部注意力窗口内重新锚定时间位置编码以减少计算开销。此外,对DiT骨干网络应用低位混合精度推理,高效注意力内核加速transformer运算。带有滚动淘汰的有界KV缓存防止了无界上下文增长,确保可扩展的长时生成。
实验
端到端系统分析表明,在单个桌面GPU上实现实时、高分辨率世界rollout需要对VAE解码、transformer量化、注意力机制和运行时调度进行全栈协同优化,而非孤立的算子加速。在WorldRoamBench上,ABot-World-0实现了强大的动作可控性和视觉质量,而定性压力测试则揭示了在小时级rollout中持续的的场景连贯性、域外泛化能力和涌现的物理合理性。LongForcing消融实验表明,扩展时间范围的教师监督能减少视觉伪影的累积,在长自回归生成期间保持更高的HPSv3评分以及更低的模糊度和重复度。这些结果共同验证了蒸馏模型学到了适用于实用交互式世界模拟的持久、有状态的交互动态。
ABot-World-0在单个消费级GPU上以流式推理交互运行,以适中的显存占用提供最高16 FPS的帧率和1.2秒的动作到首帧延迟。该模型将动作条件的角色运动泛化到域外场景-角色组合,并自发产生碰撞、持久痕迹和环境阻挡等物理交互,而无需显式物理规则。借助LongForcing,长时rollout在60秒内更好地保持视觉质量,相比短时基线显示更少的误差累积。单个NVIDIA RTX 5090以最高16 FPS运行模型,延迟为1.2秒,峰值显存低于19.3 GiB。动作条件的运动迁移到新场景和角色,而碰撞、水痕和雪地脚印等物理效果在无符号化物理标注的情况下涌现。
在单个RTX 5090上,以1280×704分辨率和批次大小1运行时,Base模型和仅使用SageAttention2的变体出现内存不足,表明仅靠更快的注意力内核是不够的。用LightVAE替换默认VAE提供了第一个可行配置,进一步的推理栈优化——DiT量化、Fast-RoPE和激进的低位格式——逐步将吞吐量从9.1 FPS提升至15.8 FPS,峰值显存由完整运行时决定,而非单一算子。Base配置和仅带SageAttention2的变体均因内存不足而失败,表明仅加速注意力无法实现高分辨率部署。引入LightVAE产生了第一个可行配置,达到9.1 FPS和20.5 GiB峰值显存,揭示了原始VAE是关键的内存瓶颈。将DiT骨干网量化为FP8,每个块的DiT时间从1191毫秒降至845毫秒,吞吐量提升至12.4 FPS,峰值内存从20.5 GiB降至15.9 GiB。添加Fast-RoPE进一步将DiT时间削减至786.9毫秒,FPS提升至13.3,但峰值显存升至19.3 GiB,表明峰值内存取决于完整运行时配置。使用MXFP6或MXFP4精度并配合Fast-RoPE,吞吐量分别推至14.1和15.8 FPS,同时峰值内存分别降至18.3 GiB和17.1 GiB,实现了最佳帧率和最低内存使用。
ABot-World-0,这款最小的、仅5B参数的模型,在报告的七个子维度中的五个上取得了最高或第二高的分数,大幅优于更大的LingBot-World (14B) 和 HY-World 1.5 (8.3B)。HappyOyster在严格准确度、部分准确度、轨迹得分、美学和记忆方面整体领先,而Genie 3在成像质量和物理机制方面表现出特别优势。ABot-World-0 (5B) 在严格准确度、部分准确度、轨迹得分、美学和成像方面排名第一或第二,仅在这些类别中落后于HappyOyster。HappyOyster在严格准确度、部分准确度、轨迹得分、美学和记忆方面取得了最高分。Genie 3记录了最佳的成像质量和物理机制,其记忆得分接近HappyOyster。LingBot-World (14B) 和 HY-World 1.5 (8.3B) 在所有子维度上均被小得多的ABot-World-0超越。
