Command Palette
Search for a command to run...
EchoWM:开放可进入的全模态世界模型
EchoWM:开放可进入的全模态世界模型
摘要
我们提出 EchoWM,一种面向可进入生成式媒体的全模态世界模型,能够在响应连续导航的同时联合生成 720p 视频、环境声、音乐和语音。我们围绕相机意图组织交互:在第一人称场景中,它指定观察者运动;而在第三人称场景中,相机与角色的动态关系从数据中学习,无需视角专用控制器。离散命令和连续位姿被映射到共享的公制尺度相对 6-DoF 轨迹,并通过数据集级校准在异构数据中保持运动幅度一致。为联合学习视听生成与轨迹控制,我们构建了互补的数据引擎,并采用渐进式训练,随后进行自回归后训练以实现长时程生成。大量评估表明,EchoWM 在公开世界模型基准上实现了较强的轨迹跟随能力和较高的视觉质量,支持跨多种主体的第一人称和第三人称交互,并在长时程生成中保持环境声与语音的同步。
一句话总结
来自香港科技大学、北京大学等机构的研究者提出 EchoWM,一种面向可进入媒体的全模态世界模型,能够联合生成 720p 视频、环境声、音乐和语音,同时将相机意图映射为公制尺度的相对 6-DoF 轨迹;通过渐进式训练与自回归后训练,该模型在公开世界模型基准上实现了较强的轨迹跟随能力和跨第一人称与第三人称场景的同步长时程生成。
核心贡献
- EchoWM 是一种全模态世界模型,能够联合生成 720p 视频、环境声、音乐和语音,同时通过共享的公制尺度相对 6-DoF 轨迹以及第一人称或第三人称相机意图来响应连续导航。
- 一个互补的游戏、仿真与互联网数据引擎(带数据集级速度校准)支撑渐进式课程:音视频预训练建立世界先验,动作微调学习视觉导航,低学习率联合微调配合自回归后训练巩固长时程音视频生成与轨迹控制。
- 评估结果报告在公开世界模型基准上实现较强的轨迹跟随和高视觉质量,并支持第一人称与第三人称交互以及长时程生成中同步的环境声与语音。
引言
生成式视频模型正在成为强大的音视频媒体引擎,但用户交互在很大程度仍然由提示驱动且较为被动。生成未来状态以响应输入的世界模型通常只产生无声的视觉推演,或依赖特定主体的动作空间,从而缺失音频所提供的空间、环境和社交线索。作者提出 EchoWM,一种可进入的全模态世界模型,能够根据用户导航持续生成同步的视频、环境声和语音。作者围绕主体无关的相机意图组织交互,将多样输入映射到共享的相对 6-DoF 轨迹,并将多源数据引擎与渐进式训练课程相结合,先学习音视频先验,再分离轨迹控制,最后联合优化二者,从而在第一人称和第三人称场景中实现响应式、长时程生成。
数据集
作者构建了一个多源数据集,用于训练交互式世界模型。该数据集合并了四个互补数据源,因为没有单一数据源能够同时提供多样外观、自然音频、交互式运动和可靠的相机几何信息。
数据来源与组成
-
内部采集的游戏数据: 包括跨开放世界探索、城市驾驶和骑马穿越的第一人称与第三人称游戏。程序化脚本发出控制指令并生成干净的动作-观测对。ReShade 插件在采集前移除 HUD 和界面叠加层,保留原始视场而无需事后裁剪。录制内容包括高分辨率 RGB 视频、原生立体游戏音频、脚本发出的动作日志以及环境元数据。
-
真人游玩的互联网游戏数据: 以更自然的控制时机、更丰富的语音、玩家解说、游戏内对话以及随情境而变的反应来补充内部游戏数据。源数据中没有原生动作日志。能够可靠恢复相机轨迹的片段参与轨迹条件训练,而更广泛的片段池用于支撑音视频和语音建模。
-
Unreal Engine 仿真: 提供真值公制相机位姿、同步动作日志以及受控的平移与旋转覆盖,但没有自然音频。角色由局部坐标系下的导航命令和引擎物理驱动。每个角色携带一个第一人称相机和四个第三人称相机;训练时每个推演随机选择一个视角。UE 音频被视为缺失音频,而不是语义静音。
-
通用互联网视频: 以真实世界和影视内容、语音、环境声以及多样的相机-主体关系(如跟随、环绕和重新构图)扩展外观和声学多样性。这些数据没有原生动作日志或标准化导航。一个较小且经过公制位姿恢复成功和运动质量筛选的子集进入轨迹条件训练。
处理路径
-
音视频路径: 使用镜头边界检测来隔离互联网和影视素材中的连续片段。音视频合格的数据源被直接切分为短小的模型就绪片段,因为视觉、语音和环境声学习不需要长程几何重建。
-
几何路径: 对于非 UE 的轨迹条件数据,作者保留约一分钟的连续窗口后再切分。这使相邻片段共享一个共同的几何重建,并为位姿优化提供更长的时序支撑。
-
规范化: 所有保留的媒体都重新编码为规范化的视频和音频格式,以便稳定解码和批量训练,并在存在立体声通道时予以保留。
公制位姿恢复与筛选
- UE 直接提供以公制单位衡量的相机到世界位姿。其他具有轨迹资格的数据源需要从视频中恢复位姿。
- 作者使用 ViPE 和 VGGT-Omega 来获得时序连贯的长序列几何,并使用 MoGe-2 来获得逐帧公制深度约束。这支持逐帧内参优化,以应对互联网视频中的变焦、防抖、裁剪以及内参不完全已知的情况。
- 为提高效率,长窗口在位姿估计前先进行时序下采样。恢复的位姿随后通过旋转的球面线性插值和平移的线性插值对齐回原始时间戳。视频观测不被合成或修改。
- 轨迹质量筛选检查重建可靠性、内参标定稳定性、时序一致性、帧间抖动、突发的朝向变化、运动合理性、位移、退化轨迹以及极端尺度异常值。
- UE 轨迹跳过重建,但遵循相同的约定转换和运动范围检查。
结构化元数据与泄露控制
- Qwen3-Omni 和 Gemini-3-Pro 将同步视频和音频处理成统一 schema,字段包括:
scene、style、viewpoint、subject、narrative、speech和sound。 - 持续上下文字段为
scene、style、viewpoint和subject。时序音视频事件字段为narrative、speech和sound。 - 不同数据源的字段名称被归一化为这些规范字段。语音标记被归一化到
None、empty、null及等价值。 - 原始标注回复和生成元数据被保留用于溯源,但不会作为语义条件字段暴露。
- 对于轨迹条件的 Action-SFT,
narrative字段被移除以防止文本泄露主体运动或相机演化。AV-CPT 保留所有字段。Joint-FT 保留静态字段以及speech和sound,但仍然排除narrative。
训练混合与使用
-
音视频丰富混合: 合并内部采集的游戏数据、真人游玩的互联网游戏数据以及按视觉与声学质量挑选的通用互联网视频,并明确采样富含语音的样本。可靠的相机轨迹并非必需。该混合用于 AV-CPT,以建立广泛的音视频先验。
-
控制干净混合: 合并内部采集的游戏数据、真人游玩的互联网游戏数据、UE 仿真以及具有位姿资格的通用互联网视频,这些数据按可靠的公制轨迹和平滑、可解释的运动进行挑选。用于 Action-SFT,并移除承载运动的 narrative 字段。
-
均衡高质量混合: 一个更小的可靠轨迹监督与高质量音视频内容的交集,在可用时包括环境声和语音。用于 Joint-FT,以巩固轨迹跟随与音视频先验。
当前模型使用相机轨迹作为统一的运动条件。原生动作日志被保留为一种独立信号,用于对齐、数据分析和未来的交互建模。论文没有报告确切的片段总数或混合比例。为进行运动覆盖分析,作者从控制干净混合中采样了 28,605 条轨迹,示例包括直线、对角线、回环和环绕运动。
方法
世界数据引擎 训练一个可进入的全模态世界需要多样的外观、自然音频、交互式运动以及可靠的相机几何。作者组合了四个互补来源:内部采集的游戏录制、真人游玩的互联网游戏录制、Unreal Engine 仿真和通用互联网视频。这些来源经过两条互补路径处理:优先考虑外观和声音的音视频路径,以及保留长程时序连续性的几何路径,后者用于公制相机恢复。所得样本被组织成与 AV-CPT、Action-SFT 和 Joint-FT 三个阶段对齐的三个混合集合。
模型架构 作者基于一个预训练的联合音视频扩散 Transformer 构建模型,并扩展了公制相机轨迹条件。给定媒体上下文、结构化文本条件和用户控制序列,目标是联合生成同步的视频和音频,同时遵循所请求的相机运动。用户控制被转换为校准的相对 6-DoF 相机轨迹。
统一相机意图接口通过随时间变化的期望相机运动来表示用户导航。对于片段 i,帧 k 处的相对位姿表示为 ΔTi,k=T0−1Tt。为解决异构数据源之间的平移尺度差异,作者从公制训练轨迹中估计一个鲁棒的全局尺度 sglobal:
mi=kmax∥Δti,k∥2,sglobal=Q0.9({mi}i∈Dtrain)校准后的轨迹通过统一相机位置编码(UCPE)注入视频主干。对于帧 t 和空间单元 s 处的视频潜变量 token,参考空间中的光线方向计算为 dt,s=Rtnorm(Kt−1ps)。构建局部光线帧,并通过一个轻量的相机注意力分支与原视频自注意力并行注入几何信息。
渐进式训练 可靠的音视频监督和可靠的轨迹监督集中在训练数据的不同部分。如下图所示:
音视频丰富的样本提供更强的音频监督,但通常覆盖较窄的相机运动范围,而控制干净的样本包含更可靠、更多样的轨迹。训练分为三个阶段。阶段 1(AV-CPT)在音视频丰富混合上调整完整主干,不使用轨迹条件。阶段 2(Action-SFT)冻结音视频主干,只在控制干净混合上训练相机分支参数。为防止文本直接指定目标运动,narrative 字段被移除,使轨迹成为指定相机演化的唯一条件。控制干净混合让模型接触到多样化的已实现相机演化,而不是一组狭窄的离散命令模板。
阶段 3(Joint-FT)在均衡高质量子集上以降低的学习率更新两组参数。
流式音视频后训练 作者逐步将预训练的双向模型调整为流式自回归生成器。首先,音视频教师强制将双向时序注意力转换为因果自回归计算。因果注意力模式确保每个带噪块可以关注所有前面的干净音视频块以及当前块内的带噪 token,同时屏蔽干净目标和未来块。
为解决教师强制训练与推理之间的差异,作者引入自梯度强制(SGF)。短时程 SGF 在自生成的自回归历史上训练,同时通过重建的因果表示恢复梯度,并结合分布匹配蒸馏(DMD)将多步生成器转换为少步采样器。为实现持续的流式生成,长时程 SGF 使用 sink-plus-FIFO 缓存将有界因果上下文扩展到更长轨迹。
长时程掩码通过 sink-plus-FIFO 策略限制对干净历史的访问,而逐层传播允许梯度通过中间块到达更早的表示。
实验
评估结合了两个公开基准(WBench Navigation 和 SANA-WM-Bench)以及用户研究、定性分析和消融实验,以评估交互式世界建模。EchoWM 及其蒸馏的因果变体 EchoWM-Flash 在导航和长时程轨迹基准上取得领先结果,具备强可控性、视觉一致性以及在长推演中降低的漂移。主观结果在整体偏好和时空一致性上偏向 EchoWM,而定性实验展示了跨第一人称和第三人称视角的泛化、未见领域的泛化、连贯的 3D 重建、同步的音视频生成以及视觉记忆。消融实验进一步支持固定全局轨迹尺度和跨视角的共享相机意图建模。
具有代表性的生成式视频和世界模型一致报告了高分辨率视频输出以及第一人称和第三人称参与。多数模型支持基于连续轨迹的导航,而一个面向游戏的模型报告了离散键盘输入。所列模型均未报告对环境声、背景音乐或口语语音的原生音频反馈。多数对比模型支持连续轨迹交互,而一个面向游戏的模型支持离散键盘导航。所有列出的模型都缺少已报告的原生音频反馈,包括环境声、背景音乐和口语语音。
采集的游戏数据提供原生音频、语音和动作日志;互联网游戏数据增加了真人操作和更丰富的语音;Unreal Engine 渲染在无音频的情况下贡献了精确的位姿可靠性和动作清晰度;通用互联网视频将外观和音频多样性扩展到非游戏领域。这些数据在日志、真人操作和分布外覆盖方面的互补可用性共同支撑音视频世界建模和轨迹条件交互。动作日志存在于采集的游戏数据和 UE 渲染中,提供有监督的交互信号,而互联网游戏数据和通用视频缺少动作日志。通用互联网视频是唯一覆盖非游戏领域的数据源,显著扩展了游戏渲染场景之外的视觉和声学多样性。
EchoWM 及其蒸馏的四步因果变体 EchoWM-Flash 在 WBench Navigation 基准上排名第一和第二。未蒸馏模型取得最高的总体平均分和一致性,而 EchoWM-Flash 保留了大部分能力并取得最高的交互分数,略微超过原始模型。未蒸馏的 EchoWM 以最高一致性(89.8)领先,表明其具备较强的多轮场景和视角稳定性。EchoWM-Flash 取得最佳交互分数(87.9),并将设置遵循度从基础模型的 79.4 大幅提升至 88.3。
在前 241 帧中,EchoWM 在 Simple 和 Hard 两个划分上都取得了最佳视觉质量,创下最高的 VBench Overall 分数。在 Simple 轨迹上,该系统还取得了最低的平移误差和相机运动一致性误差,同时旋转精度接近 SANA-WM。在 Hard 轨迹上,SANA-WM 取得更低的位姿误差,但 EchoWM 保持了最强的视觉质量。EchoWM 在 Simple 和 Hard 划分上都创下最高的短时程 VBench Overall 分数。在 Simple 轨迹上,EchoWM 取得最低的平移误差和相机运动一致性误差,旋转精度接近 SANA-WM。在 Hard 轨迹上,SANA-WM 的位姿误差更低,而 EchoWM 保持最强的视觉质量。
长时程评估表明,EchoWM 在简单轨迹上保持较强的视觉质量和场景一致性,取得对比方法中最低的平移误差和相机运动一致性误差以及最高的重访 PSNR。LingBot-World 取得最高的总体 VBench 分数和最小的时序图像质量下降,但其位姿误差较大。累积旋转漂移仍然是 EchoWM 的主要弱点,从短时程到完整的 961 帧评估逐渐恶化,在困难轨迹上进一步加剧。EchoWM 在简单长时程轨迹上取得最佳的场景重访一致性和最低的平移误差与相机运动一致性误差。旋转漂移在长时程上累积并在困难轨迹上恶化,而 LingBot-World 在所报告方法中具有最小的时序图像质量退化。
实验首先对比现有生成式视频和世界模型在交互和音频支持方面的表现,并比较训练数据源,发现多数模型支持连续轨迹导航但没有一个提供原生音频,而游戏日志、互联网视频和 UE 渲染共同提供了互补的动作、位姿、语音和分布外监督。随后在导航以及短时程和长时程生成上评估 EchoWM 及其蒸馏版本 EchoWM-Flash,其中 EchoWM 一致地取得最佳的场景一致性和视觉质量,EchoWM-Flash 表现出最强的交互行为。长时程结果证实了 EchoWM 较强的视觉质量和重访一致性,LingBot-World 的时序质量退化较小,而累积旋转漂移仍然是 EchoWM 的主要弱点。