Command Palette
Search for a command to run...
生成式世界渲染器,以游戏速度运行
生成式世界渲染器,以游戏速度运行
Guixu Lin Zheng-Hui Huang Siqi Yang Ming-Hsuan Yang Kaipeng Zhang Zhixiang Wang
摘要
生成式世界渲染器 AlayaRenderer 接收物理引擎导出的结构化世界状态并合成 RGB 帧。与从文本或控制提示生成帧的模型不同,AlayaRenderer 在保留场景结构的同时不改变底层世界动态,这为交互式世界建模和用户可控的游戏体验开辟了另一条路径。然而,原始的 AlayaRenderer 计算开销过高,无法实时部署。本技术报告介绍 AlayaRenderer-Flash,一个面向实时的生成式前向世界渲染器,它将 AlayaRenderer 的帧率从 0.56 FPS 提升至 31.54 FPS,达到了游戏运行速度。AlayaRenderer-Flash 将原始渲染器重构为少步自回归流式模型,并引入轻量级蒸馏编解码器以实现高效的潜在编码与帧重建。它保留了教师模型的 G-buffer 和文本提示接口,同时支持对无限长输入流进行连续渲染。我们在 G-buffer 流上评估了 AlayaRenderer-Flash 的内容保持性、时序一致性、跨窗口稳定性、提示可控性及运行时效率。结果表明,AlayaRenderer-Flash 大幅降低了推理成本,同时保留了教师模型的核心渲染能力。通过将 AlayaRenderer-Flash 与物理引擎集成,我们构建了一个以 30 FPS 运行的完全可玩的生成式世界。
一句话总结
Alaya Lab 和加州大学默塞德分校的研究人员推出 AlayaRenderer-Flash,一种实时生成式前向世界渲染器。该方法将原始 AlayaRenderer 重构为带有轻量级蒸馏编解码器的少步自回归流式模型,在保留来自物理引擎 G-buffer 和文本提示接口的场景结构的同时,达到 31.54 FPS(从 0.56 FPS 提升),并实现 30 FPS 下可完全交互的生成式世界。
核心贡献
- AlayaRenderer-Flash 采用自回归流式建模形式,跨窗口传播渲染历史,支持在无界 G-buffer 序列上进行连续生成,消除了原始模型的固定窗口限制。
- 轻量级蒸馏编码器和解码器网络替代了计算开销大的 G-buffer 编码器和 Wan VAE 解码器,减少潜在编码和帧重建的延迟。
- 渐进式 4 步蒸馏将 50 步去噪调度压缩为紧凑渲染器,速度从 0.56 FPS 提升至 31.54 FPS,并实现与物理引擎集成的实时、可提示控制的 30 FPS 渲染。
引言
作者基于引擎加生成式渲染器范式进行构建,其中游戏引擎模拟物理并产生 G-buffer(深度、法线、反照率等),生成模型替代着色阶段,根据文本提示生成外观。这种方法保留场景结构和游戏逻辑,同时支持可提示控制的视觉风格重塑。此前的领先方法 AlayaRenderer 在复杂的 AAA 级场景上提供高质量渲染,但作为离线渲染器运行:其 50 步去噪、沉重的 G-buffer 编码器和 VAE 解码器导致推理过慢,其双向固定窗口设计阻止在无界 G-buffer 序列上进行自回归流式处理。作者推出 AlayaRenderer-Flash,通过三项关键改进将该模型转变为实时流式渲染器:跨窗口传播渲染历史的自回归生成、将 50 步去噪蒸馏为 4 步过程,以及用轻量级蒸馏网络替换昂贵的编码器和解码器。这些改变保留了渲染质量和可控性,同时降低了推理成本,从而支持交互式、可提示控制的游戏体验。
方法
作者提出 AlayaRenderer-Flash,一种实时风格化渲染管线,将来自游戏引擎的同步 G-buffer 流转换为风格化 RGB 帧。
参考下方框架图:
该系统集成了自回归流式处理、分层历史压缩、四步扩散和轻量级蒸馏编解码器,以实现播放速率渲染。
G-Buffer 条件潜在渲染 基础渲染器基于 Wan 2.1,一种潜在视频扩散模型。游戏引擎提供五个同步的物理缓冲区:反照率、深度、金属度、法线和粗糙度。每个 G-buffer 通道被视为视频流,由 Wan causal 3D VAE 编码,生成帧对齐的潜在表示。这些特征沿通道维度拼接形成 G-buffer 条件 gk,在第一个 3D patch embedding 之前与带噪声的 RGB 潜在表示拼接:
hk=PatchEmbed([xk,gk]),其中 xk 表示块 k 的带噪声 RGB 潜在表示,gk 为相应的 G-buffer 条件。该策略仅需拓宽第一个 3D patch embedding 的输入投影,扩散 transformer 的其余部分保持不变。
自回归流式处理 为支持无界实时渲染,作者将潜在视频划分为固定长度块,并在块级别上进行自回归操作。先前生成的块被保留为历史,根据时间距离组织为三层压缩层次结构。近期历史以全保真度保留,而远期历史则被逐步压缩。第一个生成的潜在帧作为全局外观锚点保留。在去噪过程中,所有保留的历史作为干净潜在 token 与当前块一起插入自注意力。为在任意长度的 rollout 上保持提示可控性,每个自注意力层都增加了一个专用文本槽,包含从风格提示嵌入投影得到的持久键值条目。编码和解码管线以因果方式实现,跨块传递时序特征缓存。
少步蒸馏 为加速推理,作者采用四步去噪调度。他们使用三级蒸馏管线,包括引导蒸馏、渐进步数缩减和均值流蒸馏(MFD)。 首先,在引导蒸馏中,学生模型保留原始的 50 步调度,同时学习用单次网络评估复现教师模型的分类器自由引导组合速度场。 其次,渐进步数缩减将去噪预算从 32 逐步减少到 16、8,最终到 4 步,提供稳定初始化。 最后,基于自 rollout 的 MFD 对四步学生模型进行精炼。学生模型仅以自身先前生成的块为条件,与部署设置一致,减少训练和自回归推理之间的差异。为补偿因激进步数缩减导致的高频细节损失,轻量级 GAN 模块被附加到中间 transformer 特征和最终潜在预测上。
蒸馏微型编解码器 为进一步降低由 VAE 模块主导的延迟,作者将编码器和解码器均蒸馏为轻量级替代方案。微型解码器采用 TAEHV 架构,使用像素重建和感知损失从冻结的 Wan VAE 解码器进行蒸馏。微型 G-buffer 编码器用单次共享前向传递替代五次单独的 VAE 编码传递,以预测 G-buffer 条件 gk。它首先被蒸馏以匹配冻结的 Wan VAE 编码器,然后与整个渲染器联合微调。
实时部署 在推理过程中,输入的 G-buffer 流由蒸馏微型编码器持续编码,由四步扩散模型渲染,并由有状态微型解码器解码为 RGB 帧。所有组件以自回归方式运行,同时在块边界之间保持持久时间状态,实现在无界输入流上的连续渲染。
实验
实验在带有同步 G-buffer 输入的《黑神话:悟空》数据集上进行,其中渐进式设计分析显示,自回归流式处理、少步蒸馏和轻量级编解码器共同实现实时渲染,同时保持内容相似性、时间稳定性和跨窗口一致性。与基线的比较表明,AlayaRenderer-Flash 是唯一同时支持因果流式处理、提示控制和少步推理的方法,在质量和部署效率之间取得了最佳平衡。定性结果展示了稳定的长程光照和几何、连续流式处理中无缝的提示切换,在 SuperTuxKart 上的端到端部署验证了在目标 30 FPS 下的实际交互游戏体验。
将原有的 50 步去噪替换为先自回归然后 4 步蒸馏的公式,将吞吐量从低于 1 FPS 提升至超过 30 FPS,同时轻量级蒸馏编码器和解码器将 GPU 内存几乎减半。质量指标在内容相似性、边界一致性、时间平滑度和提示对齐方面保持稳定或提升,最终紧凑模型在所有类别中取得最优分数。仅采用自回归流式处理可改善内容相似性和边界精度,但会降低时间稳定性,且吞吐量远未达到实时。切换到 4 步蒸馏扩散模型将帧率提高四倍以上,无额外内存开销,同时恢复时间一致性并保持渲染质量。采用轻量级蒸馏编码器和解码器将吞吐量进一步提升至交互速率,并降低峰值 GPU 内存,所有质量指标均达到最佳值。
该表比较了基于 G-buffer 条件渲染的方法在支持自回归流式处理、提示切换和少步推理方面的能力。AlayaRenderer-Flash 是唯一同时提供这三种能力并以实时速率运行的方法,而先前的方法缺乏提示控制或时间建模,并表现出较低的时空一致性。RGB↔X 逐帧使用 G-buffer 而没有时间建模,导致时空一致性最弱,FVD 在评估方法中最高。FrameDiffuser 添加了自回归时间建模,但不支持提示切换,并且时间稳定性明显较弱。AlayaRenderer-Flash 独有地支持自回归流式处理、连续渲染中的提示切换和少步推理,达到 31.54 FPS 的实时交互速率。
AlayaRenderer-Flash 在渲染质量和实时性能之间实现了最佳平衡,在流式方法中取得内容相似性(0.847)、时间稳定性(tLPIPS_warp 0.155)和帧率(31.54 FPS)的领先成绩。RGB↔X 缺乏时间建模,FVD 最高(1031.3),而 FrameDiffuser 降低了 FVD,但时间漂移最严重(0.440)且缺乏提示控制。重新训练的双向基线获得了更高的离线质量,但仅以 1.10 FPS 运行,证实 AlayaRenderer-Flash 独有地实现了可提示控制的实时交互渲染。AlayaRenderer-Flash 在提供最佳内容相似性(0.847)和时间稳定性(0.155 tLPIPS_warp)的同时,以 31.54 FPS 运行,在质量和速度上远超其他流式方法。FrameDiffuser 在 RGB↔X 的基础上提高了相似性(0.844 vs. 0.820),但产生了最差的时间漂移(0.440 tLPIPS_warp)且缺乏提示控制,而 RGB↔X 表现出严重闪烁和最高的 FVD(1031.3)。双向基线取得了更高的离线分数(S_CLIP-I 0.870,FVD 335.5),但限于 1.10 FPS,表明 AlayaRenderer-Flash 独有地将实时交互渲染与提示切换和流式支持结合在一起。
该评估通过逐步将缓慢的 50 步去噪管线替换为自回归流式公式、4 步蒸馏扩散模型以及轻量级蒸馏编码器/解码器组件来比较渲染方法。此组合将吞吐量从低于 1 FPS 提升至超过 30 FPS,将 GPU 内存减半,并在内容相似性、边界精度、时间平滑度和提示对齐方面保持或提高质量。与先前方法相比,最终模型独有地支持自回归流式处理、连续渲染中的提示切换和少步推理,达到了最佳的时空一致性和实时交互速率。