HyperAIHyperAI

Command Palette

Search for a command to run...

Alaya-EVOKE:从线性扩展监督到无尽世界

Yuanyang Yin Gongxuan Wang Yifan Zhan Chuanhao Li Kaipeng Zhang Feng Zhao

摘要

交互式世界模型必须同时支持持久记忆、响应用户交互和长时程生成,然而这些需求对底层模型提出了相互冲突的要求。在去噪器上下文或键值缓存中维护历史会随时间产生不断增长的开销,迫使在会话长度与保留记忆之间进行权衡;而低延迟交互通常依赖少步生成,其能力最终受限于其教师模型。Evoke 通过将持久世界状态外部化并重新设计用于长时程交互生成的教师模型来同时解决这两个局限。场景几何被维护在一个外部的、以相机为索引的世界状态库中,仅从中检索与当前视图相关的信息,使去噪器上下文在会话增长时保持有界。教师模型不再被视为固定的高质量生成器,而是被明确设计用于长时程监督。其稀疏注意力方案结合了分块分组、对选定远距离帧的检索以及线性注意力全局状态,使激活内存和计算量呈线性增长,同时支持在长时间跨度上进行监督。这种监督暴露了在短窗口内局部看似合理的内容漂移,而逐块条件化则支持整个序列中的提示变化和事件控制。一个 30 秒的长时程分布匹配目标在自强制展开下应用,将这两种能力迁移到一个不使用无分类器引导(CFG)的三步学生模型中,在保持响应式条件化的同时提升了对长期内容漂移的抵抗能力。凭借有界上下文和循环外部记忆,Evoke 支持开放式、持续演化的生成;在单张 H200 上以 384 × 640 分辨率运行时,每个 1.5 秒的片段生成耗时 2.11 秒。作为一个三步世界模型,Evoke 在 WBench 上取得了最先进的性能,同时在 VBench-Long 和 VBench-2.0 上保持了具有竞争力的视觉质量。

一句话总结

来自 USTC 的 MoE Key Lab of BIPC、上海创新研究院和 Alaya Lab 的研究人员提出 Alaya-EVOKE(Evoke),一种交互式世界模型,将持久化的相机索引世界状态外部化,并使用具有稀疏分块分组、选定远帧检索和线性注意力全局状态的长时域教师;该教师通过自我强制 rollout 迁移到三步无分类器引导(CFG-free)的学生,该学生在单个 H200 上以 384 × 640 分辨率在 2.11 秒内生成 1.5 秒片段,并在 WBench 上达到最先进性能,同时在 VBench-Long 和 VBench-2.0 上保持竞争力。

核心贡献

  • Evoke 是一个三步交互式视频世界模型,将持久场景几何外部化到相机索引的世界状态库中,并带有有界的读取、写入和淘汰机制,仅检索与视图相关的信息,使去噪器上下文在会话增长时保持有界。
  • 其长时域教师使用稀疏注意力方案,结合分块分组、选定远帧检索和线性注意力全局状态,使激活内存和计算量线性增长,同时支持长时域监督以及逐片段 prompt 和事件控制。
  • 在自我强制 rollout 下的 30 秒长时域分布匹配目标将这些能力迁移到无分类器引导的三步学生;Evoke 达到最先进的 WBench 性能,在 VBench-Long 和 VBench-2.0 上保持竞争力,并在单个 H200 上以 384×640 分辨率在 2.11 秒内生成每个 1.5 秒片段。

引言

交互式世界模型必须同时支持持久记忆、响应式交互和长时域生成,这对连续相机控制探索和不断演变的文本驱动场景等应用很重要。先前系统通常将持久状态和快速推理都放在去噪器上,因此保留的历史信息会随会话长度增长,或者必须通过窗口化和缓存淘汰被丢弃。蒸馏得到的少步模型进一步受限于教师监督时域短和固定的 prompt,削弱了长期一致性和会话中期控制。作者引入 Evoke,将持久状态与生成解耦,将相机索引的几何记忆存储在外部有界世界状态库中,并重新设计教师,采用分块稀疏注意力和逐块条件,实现长时域交互监督。这些能力通过长时域分布匹配迁移到三步、无分类器引导(CFG-free)的学生,实现有界成本的、小时级生成,并具有响应式相机和文本控制。

方法

作者利用具有外部化世界状态的有界循环学生和为长时域交互监督设计的教师来实现长时域交互生成。在每个循环步骤,三步学生从短局部历史、从外部相机索引世界状态库检索的与视图对齐的几何信息以及逐片段文本条件生成一个视频片段。该设计确保任意单个生成步骤的上下文长度或位置跨度不随会话增长而增加。

如下图所示:

循环接口将瞬时去噪器上下文与持久几何世界状态分开。在循环步骤 kkk,学生生成包含 F=9F=9F=9 个潜在帧的片段 xkx_kxk。每一步以相机轨迹 Pk\mathcal{P}_kPk 和文本条件 ckc_kck 为条件,这些在不同步骤中可能变化。令 hkh_khk 表示有界局部历史,MkM_kMk 表示世界状态库。每一步首先从 MkM_kMk 渲染与当前相机轨迹相关的几何信息,然后从渲染的几何信息、局部历史和文本条件生成下一个视频片段,最后将所得观测写回存储:

rk=Read(Mk,Pk),xkpθ(rk,hk,ck),Mk+1=Write(Mk,xk,Pk).r_k = \operatorname{Read}(M_k, \mathcal{P}_k), \qquad x_k \sim p_\theta(\cdot \mid r_k, h_k, c_k), \qquad M_{k+1} = \operatorname{Write}(M_k, x_k, \mathcal{P}_k).rk=Read(Mk,Pk),xkpθ(rk,hk,ck),Mk+1=Write(Mk,xk,Pk).

局部历史和世界状态库都在固定预算下运行。因此,延长会话只增加循环调用次数,而不增加单次调用的上下文长度、位置跨度或计算开销。作者证明,在该公式下,长达一小时的会话保持有界,而不会退化。

如下图所示:

有界循环公式使每次推理步骤与会话时长无关,但其本身并不能防止误差在循环步骤之间累积。为约束长程行为,作者在 WWW 个连续片段的窗口上采用自我强制分布匹配:

LW(θ)=Ek[D(qθ(k:k+W1)p(k:k+W1))],\mathcal{L}_W(\theta) = \mathbb{E}_k \left[ D \left( q_\theta^{(k:k+W-1)} \| p^{(k:k+W-1)} \right) \right],LW(θ)=Ek[D(qθ(k:k+W1)p(k:k+W1))],

其中 DDD 表示散度,其梯度由教师和 critic 分数估计。长时域监督有两个互补作用:扩大循环生成器在 rollout 扰动下保持稳定的范围,并暴露仅从局部轨迹统计无法识别的长程不一致。作者表明,学生从长时域教师继承了光度稳定性,与短时域对应模型相比,在较长 rollout 中表现出显著更高的稳定性。

如下图所示:

Evoke Teacher 构建在 14B Wan2.2 A14B 扩散 transformer 之上。为让长窗口监督在计算上可行,教师将序列划分为每块包含九个潜在帧的片段,并应用分块稀疏注意力。每个查询片段访问一组有界来源:首帧全局 sink token、具有一帧重叠的局部上下文、空间压缩的邻近帧、少量选定远帧,以及通过线性注意力累积的全局状态。由于每个片段访问的信息量保持有界,注意力计算随序列长度近似线性增长,而不是二次增长。相同的分块划分还为每个片段提供独立的文本条件上下文,使 prompt 变化可在单个长序列中表示。

如下图所示:

作者通过全窗口分布匹配蒸馏(DMD)将这种长时域监督迁移到少步学生。训练从一个真实前缀片段开始,随后是 20 个生成片段的自我强制 rollout,得到 189 个潜在帧。教师和 critic 联合对所有 189 个潜在帧评分,因此监督时域覆盖完整的自我强制 rollout。分数差 Δs=sfakesreal\Delta s = s_{\mathrm{fake}} - s_{\mathrm{real}}Δs=sfakesreal 在接收分布匹配梯度的区域 Ω\OmegaΩ 上按 ν\nuν 归一化:

Lgen=12x^0(x^0Δsν)detach22.\mathcal{L}_{\mathrm{gen}} = \frac{1}{2} \left\| \hat{x}_0 - \left( \hat{x}_0 - \frac{\Delta s}{\nu} \right)^{\mathrm{detach}} \right\|_2^2.Lgen=21x^0(x^0νΔs)detach22.

在连续 rollout 片段之间历史被 detach,使每个反向图限制在单个片段内,并允许逐片段梯度独立计算。这缩短了梯度时域,但不缩短监督时域。

教师还必须表达部署中遇到的时变条件。作者将文本条件分配在片段级别,并在训练序列中包含 prompt 切换。这允许在正在进行的会话中引入或撤销文本驱动元素,这种能力称为 evocation。定时 prompt 切换可以修改诸如天空等元素,同时保留锚定的场景结构。

如下图所示:

为将无法保留在有界去噪器上下文中的持久世界状态外部化,作者维护一个外部世界状态库 MkM_kMk,将相机位姿既作为生成的控制信号,也作为检索先前观测场景内容的地址。在每个循环步骤,新生成的观测作为世界空间几何写入 MkM_kMk。单目深度模型在已知相机轨迹下为生成片段的 12 帧估计深度。所得深度图使用对应的相机内参和外参进行反投影,并追加到世界状态库。为读取存储,当前相机位姿直接决定哪些存储观测在几何上相关。存储的源视图按与目标视图的共视程度排序,最多选择八个足够不同的源,通过批量投影和 z-buffering 进行渲染。

可见性掩码控制渲染状态如何进入去噪器。由存储几何支持的区域保留有用的 warp 条件,而未支持的区域通过增加 warp 噪声水平被抑制。同样的可见性信号在每个历史层级的 patch 分辨率下被池化,并用于从去噪器序列中移除未支持的历史 token。

在推理中,作者使用三次无分类器引导(CFG-free)去噪评估生成每个片段,采用由粗到细的潜在金字塔,分辨率分别为 12×2012 \times 2012×2024×4024 \times 4024×4048×8048 \times 8048×80。几何条件仅在最低分辨率阶段注入,在那里建立大尺度空间结构,然后由更高分辨率阶段细化外观和细节。基于可见性的剪枝进一步移除未支持的几何 token,因此额外的条件成本取决于世界状态库的覆盖范围,而不是会话时长。与有界局部历史、有界几何检索和局部位置索引一起,每次循环调用都在与会话无关的上下文和位置范围内运行。

实验

Evoke 在通用世界模型和视频质量、长会话稳定性和运行时间、长时域教师监督的作用,以及定时文本控制与持久几何记忆之间的交互方面进行评估。少步学生在与多步系统相比时保持竞争力,同时小时级 rollout 保持计算有界,并且未表现出渐进视觉退化,长时域教师蒸馏提高了光度稳定性。位姿寻址召回在保留窗口覆盖重新访问时将先前观测恢复到可识别的保真度,而定时文本成功控制未锚定内容,但会受到已锚定几何的抵抗。

在 WBench 导航划分上,Evoke 在审美质量、成像质量和动态行为上获得最高分,在 HPSv3-Norm 上获得第二高。LingBot-World v2 fast 在 HPSv3-Norm 上领先,并且在审美和成像质量上也接近前列,而其他系统仅在闪烁和平滑度等孤立指标上领先。总体而言,Evoke 在视觉和运动质量上展示广泛优势,而非在每个单项指标上占优。Evoke 在所有比较系统中创下 Aesthetic、Imaging 和 Dynamic 的最佳得分。LingBot-World v2 fast 在 HPSv3-Norm 上领先,并在 Aesthetic 和 Imaging 上是最接近的对手,但 Evoke 在两个视觉质量指标和 Dynamic 上保持领先。Genie 3 在 Flickering 上领先,Matrix-Game 2.0 在 Smoothness 上领先;Evoke 在这些指标上接近前列,但不是第一。

Evoke 在 VBench-2.0 排行榜上位居前十名同行之首,略微领先最接近的竞争者;在 VBench-Long 上排名第七(共十个),落后于领先者,但仍略高于最接近的同行。这些排行榜位置并非步骤匹配:Evoke 以三步采样且无分类器引导运行,而同行使用各自的多步默认采样器。Evoke 在 VBench-2.0 的前十名同行中排名第一,与最接近同行的差距很小。在 VBench-Long 上,Evoke 排名第七(共十个),落后于领先者,但略高于最接近的同行。比较并非步骤匹配;Evoke 使用三步采样且无分类器引导,而同行运行多步默认采样器。

在 WBench 导航划分上,Evoke 在视觉和运动质量上展示广泛优势,在审美质量、成像质量和动态行为上排名最高,而其他系统仅在闪烁和平滑度等孤立指标上领先。在 VBench 基准上,Evoke 在 VBench-2.0 的前十名同行中排名第一,但在 VBench-Long 上排名第七,仍略高于最接近的同行。这些结果是在 Evoke 仅使用三步采样且无分类器引导的情况下获得的,而竞争系统使用多步默认采样器,表明在显著较低的计算预算下实现了高效采样。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供