Command Palette
Search for a command to run...
可编程世界模型
可编程世界模型
摘要
近期的视频世界模型能够生成日益逼真且可交互的视觉体验,但缺乏在长时间交互中维持持久世界状态并执行可编程规则的可靠机制。我们提出可编程世界模型(Programmable World Model),这是一个将世界状态演化与视觉观测生成解耦的框架。一个智能体将自然语言指令翻译为可执行程序,这些程序指定实体状态和状态转移规则,从而实现对单个实体及其交互的直接控制。一个轻量级引擎执行这些程序,以更新并维护一个显式的、持久的全局世界状态,包括屏幕外的实体和非视觉属性。为连接世界状态与视觉生成,我们引入状态增强的三维有向包围盒(OBB)作为中间表示。该表示与目标相机轨迹一起,被确定性地编译为像素对齐的时空条件信号,供作为生成式渲染器的预训练视频模型使用。这一设计使用户能够创建具有预定义机制、可对单个实体进行直接控制并在整个游戏过程中保持持久世界状态的可玩游戏。我们进一步引入 Combat-StateBench,一个用于评估可编程世界模型的基准。在 Combat-StateBench 上,我们的方法实现了 94% 的计数准确率和 98% 的状态准确率,大幅优于现有的交互式视频世界模型,同时支持连贯的长程生成。这些结果证明了将显式状态演化与生成式渲染分离,对于构建持久、可编程世界的有效性。
一句话总结
Alaya Lab 提出可编程世界模型(Programmable World Model),该框架将持久的世界状态演化与视觉生成解耦,通过将自然语言指令转化为可执行程序,利用状态增强的 3D 有向包围盒维护显式状态,并借助预训练视频渲染器,在 CombatStateBench 上达到 94% 的计数准确率和 98% 的状态准确率。
核心贡献
- 论文提出可编程世界模型,将显式世界状态演化与视觉观察生成解耦。一个 agent 将自然语言指令转化为可执行程序,这些程序指定实体状态和状态转换规则,而一个轻量级引擎维护持久的全局世界状态,包括屏幕外实体和非视觉属性。
- 论文提出状态增强的 3D 有向包围盒作为连接显式世界状态和视觉生成的中间表示。这些包围盒与目标相机轨迹一起,被确定性地编译为像素对齐的时空条件信号,用于作为生成渲染器的预训练视频模型。
- 论文提出 CombatStateBench,一个用于评估可编程世界模型的基准。在该基准上,该方法达到 94% 的计数准确率和 98% 的状态准确率,显著优于现有交互式视频世界模型,同时支持连贯的长时域生成。
引言
近期的视频世界模型旨在通过从过去帧和用户动作预测视觉观察来构建交互环境,但将其转变为可靠的世界引擎仍然具有挑战性。现有系统提供的实体级控制有限,缺乏跟踪屏幕外对象和非视觉信息的持久全局状态,并且无法执行用户定义的规则来一致地支配世界行为。先前工作要么依赖像素级生成中的隐式状态,要么学习可能累积错误的状态转换。作者提出可编程世界模型,将世界状态演化与视觉生成解耦。一个编码 agent 将指令转化为定义实体状态和规则的可执行程序,而一个确定性状态编译器将状态增强的 3D 有向包围盒转换为像素对齐的时空控制信号,供生成渲染器使用,从而实现实体级控制、持久状态管理和用户可编程的世界规则。
数据集
作者从未标注的游戏视频中构建训练数据集,并构建一个受控基准用于评估,两者均通过自动数据引擎处理。
-
训练数据来源
- 来自三款游戏的无 HUD 原始画面:《赛博朋克 2077》(第一人称)、《极限竞速:地平线 6》和《侠盗猎车手 V》(第三人称,多种相机角度)。
- 未公开视频的确切数量和总时长;数据集由视角和游戏内环境的多样性定义。
-
自动标注流水线(数据引擎)
- 该引擎将原始视频转化为结构化的、与相机对齐的条件图,无需人工标注。
- 相机估计:ViPE 恢复内参、每帧位姿和度量深度,将观察提升到 3D 并建立共享的世界坐标系。
- 语义发现:一个基于 Qwen3-VL 的 agent 生成全局描述并识别场景中离散、可计数的对象类别。该词汇表可替换为领域特定的预定义集合。
- 实例分割与跟踪:SAM3 生成时间一致的实例掩码、2D 框、语义标签和跟踪 ID。可见面积过小的掩码被丢弃,以抑制不可靠的极小或严重遮挡对象。
- 对象轨迹恢复:对于每个被跟踪实例,Wild-Det3D 估计每帧的 3D 有向包围盒(中心、尺寸、朝向、语义标签、跟踪 ID)。利用相机位姿将包围盒变换到世界坐标系,形成时间一致的轨迹。对象运动由世界空间位移计算,旋转到当前相机坐标系,并量化为七种状态:静止、左、右、上、下、前、后。一个较小的位移阈值用于识别静止对象。
- 条件图生成:投影的 3D 包围盒逐帧光栅化,并利用 z 缓冲进行可见性解析,生成身份、语义和方向图。由此构建最终的身份、语义和对象运动图,用于模型条件。
-
训练数据构成与使用
- 处理后的视频产生成对的视频-控制训练样本:每帧关联身份、语义和对象运动图。
- 数据用于训练视频生成模型;未给出显式的混合比例或划分细节。
-
评估基准:CombatStateBench
- 50 个精心挑选的片段,旨在测试生成的视频是否忠实地反映引擎维护的世界状态。
- 对每个片段,数据引擎从第一帧重建初始 3D 布局(实体、3D 框、语义、相机参数)。然后一个 AI agent 演化一个简短的战斗场景,生成包含相机和实体运动、与屏幕外实体的交互以及持久死亡状态的完整基于包围盒的世界状态序列。
- 每个序列包含同步的 3D 框、实体状态、相机参数、投影实体控制和实例掩码。
- 自动验证器检查重投影、度量深度一致性、框几何、地面接触、时间连续性、规定运动和状态转换;仅保留通过所有检查的序列。
-
处理细节(裁剪/过滤)
- 未描述显式的帧裁剪;流水线在全帧上操作。
- 过滤:跟踪过程中移除可见面积过小的实例掩码;运动量化中使用位移阈值标记静止对象。
方法
作者将任务形式化为一个交互式生成世界循环。从初始视觉观察 I0 开始,玩家在每个步骤提供动作 at。系统维护一个规范世界状态 st,记录执行交互所需的持久信息。整体循环定义为
stFatst+1PCt+1Mt+1ctrlGIt+1,其中 F 是转换状态的轻量级引擎,Ct+1 是目标相机,P 是将更新状态投影为相机对齐空间控制的确定性状态编译器,G 是合成视觉观察 It+1 的生成渲染器。以下小节详述每个组件。
Agent 编排的包围盒世界。 可编程世界表示为一组嵌入 3D 空间的持久实体。每个实体由一个 3D 有向包围盒(OBB)定位,该包围盒指定位置、尺寸和朝向,并与身份、语义类别和功能属性等状态变量关联。步骤 t 的规范状态为
st=(Et,At,Qt;Rt),其中 Et 包含实体及其 3D 位姿,At 持有语义和功能属性,Qt 捕获实体间关系,Rt 表示可执行的世界规则。一个现成的 3D 检测器从 I0 恢复可见实体及其 OBB,初始化几何组件。然后,一个 agent 编排器将该布局与自然语言世界描述结合,生成一个引擎可读的程序,指定初始状态、属性、关系、支持的动作和转换规则。引擎执行该程序:在每个步骤,给定 st 和动作 at,它评估有效性、应用效果、解析触发器,并生成更新后的规范状态 st+1。该状态可能包含不可直接可见的潜在变量(如生命值、库存),但仍会影响未来的转换。
控制编译。 状态编译器 P 将更新后的规范状态转换为面向渲染器的空间表示,而不改变世界状态。它在目标相机 Ct+1 下投影实体 OBB,并用身份、语义和对象运动属性增强投影区域。构建三个空间对齐的控制图:
-
身份图 Mt+1id: 维护一个包含 K 个可学习身份嵌入的固定库 Eid={qjid}j=1K。每个持久实体分配一个唯一槽位,对应的嵌入被光栅化到其 OBB 的可见投影上。这为跨帧的持久实例对应提供了空间键,即使存在遮挡或重新进入。
-
语义图 Mt+1sem: 对每个实体,预训练的文本编码器根据其类别标签 yi 生成语义嵌入 qisem=Etext(yi)。该嵌入被光栅化到可见 OBB 区域,提供与实例特定身份图互补的类别级指导。相同类别的实体共享相同的语义表示,但通过身份槽保持可区分。
-
方向图 Mt+1dir: 实体的世界空间速度旋转到目标相机坐标系,并量化为七种状态之一(前、后、左、右、上、下、静止)。一个可学习嵌入库 Edir={qℓdir}ℓ=17 被光栅化到投影 OBB 上。由于方向由世界空间速度而非图像空间位移计算,它明确地将对象运动与相机运动引起的表观运动分离。
三张图在通道维度拼接,形成结构化的投影包围盒控制:
Mt+1ctrl=Concat(Mt+1id,Mt+1sem,Mt+1dir).这些图与投影 OBB 几何和目标相机轨迹一起,为渲染器提供显式的空间、身份、语义和对象运动指导。
生成渲染器。 渲染器 G 构建在一个预训练的相机控制视频生成骨干之上。附加一个可训练的结构化空间 ControlNet 以整合编译的控制。对于具有相机轨迹 C={Ct}t=1T 的 T 帧渲染窗口,状态编译器生成控制序列 M1:Tctrl。控制序列在视频潜在分辨率下编码,并由 ControlNet 处理,该网络将逐层特征 r(ℓ) 注入冻结骨干的主模块:
hmain(ℓ)←hmain(ℓ)+r(ℓ).相机条件通路控制全局视点演化,而空间控制分支约束每个实体出现的位置、其持久身份、语义类别和相机相对运动。训练期间,预训练骨干(包括其相机模块)被冻结,仅优化空间控制分支参数 ϕ。一个片段的渲染过程为
I1:T=Gθ,ϕ(I0,C,M1:Tctrl),其中 θ 表示冻结的骨干参数。
对于长时域生成,渲染器以块自回归方式运行。去噪在每个块内是双向的,而信息跨块边界因果传播。除第一个块外,每个块接收时间历史 Htemp(n) 和几何对齐的空间记忆 Hspa(n):
I(n)=Gθ,ϕ,ψ(C(n),Mctrl,(n),Htemp(n),Hspa(n)),n≥2.时间历史是先前完成块的多尺度潜在表示,组织为近期、中程和远程上下文。它在训练期间被随机退化,以容忍不完美的自回归展开。几何对齐的空间记忆利用估计的深度和相机参数将过去的 RGB 帧提升到世界空间记忆,然后检索相关观察并将其重投影到新块的目标视图。这提供了超出有限时间窗口的持久全局视觉记忆,减轻了大相机运动或视点重访下的漂移。为跨块条件引入的额外参数 ψ 与空间控制分支联合训练。
自动训练数据流水线。 训练渲染器需要相机几何、持久实例身份、语义和对象运动的结构化标注,这些对于野外视频很少可用。作者开发了一个自动数据引擎,从未标注视频中恢复这些信息。首先,使用 ViPE 估计每帧的相机内参、位姿和度量深度图。一个基于 Qwen3-VL 的 agent 分析每个视频,发现一组离散、可计数的对象类别。然后 SAM3 执行视频实例分割和跟踪,生成时间一致的实例掩码、边界框、语义标签和跟踪身份。对于每个被跟踪实例,Wild-Det3D 根据 2D 框、RGB 帧、深度图和内参估计每帧的 3D OBB。利用估计的相机位姿将每帧包围盒变换到共享世界坐标系,形成对象轨迹。对象运动由世界空间包围盒中心位移导出,旋转到相机坐标系,并量化为七种方向状态。最后,将 3D OBB 投影到每帧以生成身份、语义和方向图,作为渲染器的条件。该流水线能够以所需的结构化标注大规模创建训练数据。
实验
评估使用来自多个游戏的游戏视频,经数据引擎处理创建成对的视频-控制数据,并使用包含 AI 生成战斗场景的受控基准,测试生成的视频是否忠实地反映引擎维护的世界状态。与提示切换基线的定量比较表明,具有结构化空间控制的外部状态管理在实体计数和死亡事件的保持上显著更可靠,同时改善了感知和时间视频质量。定性结果确认,该方法在相机运动和交互中一致地维护世界状态,泛化到未见角色、类型和异构对象类别,并支持复杂的自回归序列而不牺牲视觉真实感。
所提方法在视频质量和一致性指标上与基线持平或略优,具有最高的主体一致性、背景一致性和时间稳定性。其最显著的优势在于世界状态评估,计数准确率和状态准确率均远高于两个对比的交互式视频世界模型。基线难以维持实体计数和死亡状态,而所提方法更可靠地反映引擎维护的状态。所提方法在所有对比方法中实现了最佳的主体、背景和时间一致性。计数准确率和状态准确率相对于基线有大幅提升,所提方法在死亡事件上达到近乎完美的状态跟踪。
评估考察视频质量和世界状态一致性。所提方法在视觉一致性指标上与基线持平或更优,实现了最高的主体、背景和时间稳定性。其最显著的优势在于世界状态跟踪,在计数和状态准确率上大幅超越交互式视频世界模型,包括近乎完美的死亡状态检测,而基线难以维持实体计数和死亡状态。