Command Palette
Search for a command to run...
AlayaWorld:交互式长程世界建模——完整技术报告
AlayaWorld:交互式长程世界建模——完整技术报告
摘要
传统电子游戏开发依赖劳动密集型的资产生产、动画、物理和编程管线,而视频世界模型则能根据用户输入即时生成交互式环境,使我们能够从文本、图像或视频创建可定制、可探索且持续演进的虚拟世界。实现这一愿景需要四项紧密耦合的能力:交互性、持久的时空一致性、稳定的长程生成以及高效响应。我们提出 AlayaWorld,一个交互式长程视频世界模型,可生成 540p 和 720p 分辨率、24 fps 的视频。AlayaWorld 基于 15B 参数的视频扩散 Transformer,在相机轨迹和可切换文本提示下,以自回归方式生成短时潜变量片段。其有界视觉上下文结合了持久锚定帧、压缩时序历史、几何对齐的空间记忆以及近帧条件。为减少长期漂移,模型使用从自身推演中收集的损坏历史和预测残差进行训练。我们进一步引入一种离散自回归蒸馏形式,融合了分布匹配蒸馏、self-forcing++ 和一致性蒸馏,将推理从每片段约 30 个采样步骤降至 4 步。在 iWorld-Bench 上,AlayaWorld 在长程生成方面取得了最佳性能。AlayaWorld 被构想为一个全栈、开源且长期的项目,旨在为交互式视频世界模型的未来研究提供一个可扩展的基础。
一句话总结
Alaya Lab 推出 AlayaWorld,一个开源的 15B 参数交互式视频世界模型,在相机轨迹和可切换文本提示下,以 540p 和 720p 分辨率自回归地生成长时域 24-fps 视频,使用有界视觉上下文,结合持久锚定帧、压缩时序历史、几何对齐的空间记忆以及近期帧条件,通过来自自身 rollout 的损坏历史和预测残差进行训练以减少漂移,并通过离散自回归蒸馏(分布匹配蒸馏、self-forcing++ 和一致性蒸馏)蒸馏至 4 步推理,在 iWorld-Bench 上达到最优性能。
核心贡献
- AlayaWorld 是一个 15B 视频扩散 Transformer,在相机轨迹和可切换文本提示下,通过自回归地生成短潜在块,产生 24-fps、540p/720p 的交互式视频,并通过结合全局场景锚点、压缩时序历史、几何对齐的空间记忆和近期帧条件的有界视觉上下文来维持时空一致性;在 iWorld-Bench 上,它在生成质量、轨迹跟随和记忆能力方面均取得最佳整体性能。
- 通过使用来自自身 rollout 的损坏历史和预测残差训练模型,减少了长期漂移,使模型学会从不完美的上下文中恢复,并提高长序列的稳定性。
- 一种离散自回归蒸馏方法结合了分布匹配蒸馏、self-forcing++ 和一致性蒸馏,将推理从每块约 30 个采样步减少到 4 步,在保留完整控制和记忆栈的同时实现低延迟交互。
引言
视频世界模型有望直接从用户输入生成交互式虚拟环境,从而绕过现代游戏开发中昂贵且紧密耦合的制作管线。然而,将视频生成器适配为真正的世界模型需要同时满足四个相互竞争的需求:对相机轨迹和不断变化意图的准确响应(交互性)、在视角变化中保持空间结构和视觉一致性(一致性)、在长 rollout 中保持稳定而无漂移,以及低延迟效率。这些属性无法独立处理,因为更广泛的交互会加剧一致性问题,而更长的生成会放大残差误差。本文提出了 AlayaWorld,一个基于 15B 视频扩散 Transformer 的统一自回归框架。它在连续相机控制和可切换文本提示下生成短潜在块,同时维持一个结合全局场景锚点、压缩历史、几何对齐的空间记忆和近期帧条件的有界视觉上下文。漂移感知训练和离散自回归蒸馏过程进一步提高了长时域鲁棒性并降低了推理延迟,从而在多样化场景中实现稳定、可控且具备记忆感知的导航。
数据集
作者构建了一个包含 222,147 个视频片段的单一训练语料库,来自七个不同来源,有意混合了真实世界拍摄和合成渲染。所有来源均被标准化为统一记录,包含视频、每帧相机内参和位姿(缺失时进行恢复),以及与片段时间线对齐的分层标注。
真实世界来源
- Sekai-Real – 第一人称城市行走轨迹。
- SpatialVid – 具有密集室内相机运动的短片段。
- RealEstate10K – 房地产漫游,具有广泛的室内覆盖。
- DL3DV – 真实环境的长连续多视角漫游,作为独立来源保留。
- MUGEN – 内部从 YouTube 视频中精选,具有多样的相机轨迹和准确的标注。 对于没有相机元数据的真实世界片段,使用 ViPE 恢复每帧内参和位姿。
合成来源
- GameVerse – 内部大规模游戏语料库,包含 124,116 个片段,每个约 66 秒。
- GenEvent – 6,490 个以事件为中心的片段(平均 10.6 秒),由生成式视频模型合成,使模型接触开放域、动作触发的事件。
统一过滤管线 所有片段必须通过六个强制性关卡,阈值根据每个来源在小规模分析切片上进行校准:
- 技术验证:解码完整性、分辨率 ≥720p、时长 ≥3 s、帧率 24–65 fps、编解码器 H.264/HEVC/AV1。
- 光度验证:拒绝极端曝光和黑边(最大黑边比例 0.10)。
- 镜头边界过滤:确保每个保留的片段是单一连续镜头。
- 运动分析:移除静态片段,评分时序一致性,分配相机运动桶,并检测无位姿抖动。
- 文本/界面抑制:基于 EasyOCR 的文本检测和像素稳定性 UI 掩码(最大覆盖比例 0.04)。
- 人物控制:YOLO11 检测器限制前景人物数量和屏幕占比。 对于具有估计相机轨迹的来源,额外的位姿稳定性关卡评估抖动、峰值加速度、重建残差和漂移。最终训练片段是通过所有活跃关卡的片段。
标注说明 每个片段接收由视觉语言模型(默认 Kimi-K2.6)使用 1–2 fps 的时间戳帧生成的两级标注。
- 视频级上下文:全局属性(天气、时间、位置类型、相机视角、相机运动、视频风格)来自 26 个值的精简词汇表。
- 片段级轨道:片段被划分为时间戳段落,每个段落具有独立的语义轨道,用于主体运动、环境动态、静态场景属性和相机视角/运动。这些轨道融合为 full_prompt(5–9 句现在时句子)和 short_prompt(15–45 词),用于文本丢失和多文本增强。
数据使用方式 整个过滤后的 222,147 个片段语料库用作视频世界模型的训练混合。真实和合成数据的异构混合,加上显式的相机元数据和分层标注,教会模型逼真的场景演化和可控的相机条件导航。训练利用 short_prompt 进行文本丢失,分离的主体/相机轨道使模型能够区分例如行走主体与推进式相机运动。
方法
作者提出了 AlayaWorld,一个基于 LTX-2.3 架构的交互式视频世界模型。通过从原始 22B 多模态检查点中移除音频模块,保留了 13B 视频扩散 Transformer(DiT)作为核心骨干。该模型设计为在 VAE 潜在空间中逐块自回归地生成视频,从而实现可控的相机条件导航和逼真的场景演化。
为了将模型锚定在多样化的视觉域和运动几何中,作者构建了一个结合真实世界拍摄和合成渲染的异构训练语料库。
如下图所示:
这种混合使模型接触到各种相机运动,如向前行走、室内穿越和全景扫视,涵盖从拥挤街道到游戏引擎渲染的多个领域。
自回归形式化和条件化 因果视频 VAE 将一个片段编码为潜在序列,划分为 K=4 个潜在帧的块。在每个步骤 i,模型以过去潜在 z<i、目标相机轨迹 π≤i 和可选文本提示 yi 为条件,生成目标块 zi。生成以因果方式分解为:
pθ(z1:N∣π1:N,y1:N)=i=1∏Npθ(zi∣z<i,π≤i,yi)作者没有使用单独的交叉注意力库,而是通过上下文前缀注入条件。对于块 i,模型将四个干净的条件流前置到 K 个加噪目标帧之前,形成由全自注意力处理的单一 token 序列:
Si=[sinks;temporal memoryhi;spatial memorygi;nearby / I2Vni;targetziτ]锚定 s 作为全局身份锚点,固定在时间位置 0。时序记忆 hi 是最后 L=6 个潜在帧的压缩嵌入。邻近条件 ni 是最近的潜在帧,提供帧到帧的连续性。空间记忆 gi 为查询的视角提供几何对齐的视觉证据。
空间记忆构建 为了维持长范围空间一致性,空间记忆维护一个显式缓存,存储先前生成的帧及其单目深度和相机位姿。为了将此缓存渲染到当前目标视角,作者通过贪婪最大覆盖选择检索最多 10 帧。每个选中帧通过前向投影变换到目标视角:
u′=πi(πj−1(u,Dj(u)))变换后的图像经过 VAE 编码形成 gi,覆盖掩码用作自注意力键偏置以忽略未观测区域。
训练管线 训练过程分为三个不同的阶段。
阶段 1:双向预训练 作者首先通过全参数微调将通用视频先验适配到其领域。模型保持完全双向,在场景和相机位姿语料库、游戏录像和事件片段的加权混合上进行训练。自适应 sigma-shift 调度根据片段长度缩放流匹配时间步偏移。
阶段 2:自回归模型训练 此阶段将双向生成器转变为可控的世界模型。它从历史预训练开始,其中历史压缩模块 Hϕ 通过 LoRA 适配器训练,将近期帧历史压缩为轻量级嵌入,在流匹配目标下优化:
L2a=E∥vθ(zΩτ,τ∣Hϕ(z~))−(ϵ−zΩ)∥22随后,全栈微调解冻骨干并训练专用模块。相机控制通过 AdaLN 模块注入,使用傅里叶嵌入的相对位姿增量:
ccam=MLP(k=1⨁6PE(Δπk))next-forcing 头通过从中间特征预测下一个块来强化因果连续性,在偏移噪声水平 τ~=1+9τ10τ 下监督:
Lnf=∥fψ(F,z0+,τ~,τ~)−(ϵ−z0+)∥22为了对抗长 rollout 期间的误差累积,作者采用了抗漂移训练策略。这包括 Helios 漂移模拟,通过加性噪声、模糊或饱和度偏移来退化上下文 token,以及一个错误库,将模型自身的重建残差回放到上下文中。
阶段 3:后训练加速 为了实现交互式生成,作者将多步教师蒸馏为 4 步学生。他们利用分布匹配蒸馏(DMD)来匹配教师的输出分布。学生被训练以最小化分数差梯度:
∇θDKL(pθ,τ∥pdata,τ)=−E[(sreal(z^iτ,τ∣ci)−sfake(z^iτ,τ∣ci))∂θ∂z^i]Self-forcing++ 被纳入,通过让学生 rollout 自己的多块轨迹并与教师进行评分,缩小训练-推理差距。最后,一致性蒸馏损失强制输出相对于 EMA 目标的轨迹不变性,以抑制块边界处的闪烁:
Lcm=E[d(Gθ(ziτ,τ∣ci),Gθ−(ziτ′,τ′∣ci))]组合目标使蒸馏后的模型能够在每块 4 个采样步下生成,同时保留完整的相机控制和记忆能力。
实验
AlayaWorld 在 iWorld-Bench 和 WorldMark 测试套件上与开源模型进行了评估,在轨迹跟随和长期记忆方面表现领先,同时展现出强大的视觉一致性。定性实验展示了其执行相机可控导航、动态提示驱动动作和一致性世界生成的能力,在长自回归 rollout 中退化有限。总体而言,空间和时序记忆机制被证明对稳定、连贯的交互式生成是有效的。
训练语料库包含来自七个来源的 222,147 个片段,混合了真实世界拍摄(91,541 个片段)以获得真实感和几何结构,以及合成渲染(130,606 个片段)以获得可扩展的相机和动作可控性。内部精选来源占主导:GameVerse 贡献了 124,116 个合成游戏片段,MUGEN 添加了 21,436 个真实第一人称片段,合计提供了超过 65% 的数据。这种混合使模型能够在长自回归 rollout 中实现强大的轨迹跟随和记忆保持,同时维持视觉质量。来自五个来源的真实世界片段,包括第一人称行走和室内导航,提供了真实感和场景布局先验。来自 GameVerse(124k)和 GenEvent(6.5k)的合成片段数量超过真实片段,并提供了对受控相机运动和动作驱动动态的可扩展访问。内部精选的 MUGEN 和 GameVerse 合计占 145k 个片段,确保了混合中一致的质量和相机运动覆盖。在此混合上训练的 AlayaWorld 取得了最佳的轨迹平滑度和准确性,以及领先的记忆能力,展示了真实和合成数据的有效整合以实现稳定的长时域生成。
每个视频片段都标注了段落级轨道,这些轨道解耦了主体运动、环境动态、静态场景属性和相机描述。自由文本描述轨道融合为文本编码器的 full prompt 和用于文本丢失的 short prompt,而独立的 16 值 camera_path 枚举提供了独立于主体运动的离散相机轨迹控制信号。主体运动和相机运动在独立轨道中标注,使模型能够区分诸如推进式相机下的行走 agent 或平移视角下的静态主体等情况。camera_path 轨道使用一组固定的 16 个离散值作为直接控制信号,与描述性文本轨道解耦。所有描述性轨道均为自由文本,合并为 5–9 句 full_prompt 和 15–45 词 short_prompt 用于训练。
AlayaWorld 在减少采样预算下在大多数指标上取得了最佳整体性能。它提供了比所有竞争对手都显著更高的亮度一致性、色温约束和清晰度保持,同时在图像质量方面具有竞争力。AlayaWorld 还记录了最高的运动平滑度,并在两个记忆能力指标上领先,反映了强大的视觉稳定性、轨迹控制和长期记忆。亮度一致性和色温约束远高于任何其他模型,AlayaWorld 几乎达到最高分。清晰度保持相比次优方法有显著提高,表明在自回归生成过程中有效缓解了模糊和清晰度退化。AlayaWorld 未取得最高的图像质量分数,但与现有视频和交互式世界模型保持竞争力。运动平滑度在所有评估方法中最佳,表明生成的观测以高时序连贯性跟随动作轨迹。AlayaWorld 在两个记忆能力指标上持续领先,展示了在重新访问先前区域时对视觉外观和空间结构的强大保持能力。
AlayaWorld 在混合数据上训练