Command Palette
Search for a command to run...
H3-World:将语言理解转化为世界控制
H3-World:将语言理解转化为世界控制
Danze Chen Zeqing Wang Ziyue Lin Xingyi Yang Yeying Jin
摘要
我们提出 H3-WORLD,一个高效的框架,将 33B 参数的 MiniMax-H3 视频生成器转化为交互式世界模型。我们的核心发现是,随着大型视频生成器能力的增强,语言正逐渐成为一种自然的控制接口。例如,MiniMax-H3 已经支持通过自然语言指令对角色行为和摄像机运动进行零样本控制。在此基础上,H3-WORLD 将这种粗粒度的语言接口转化为精确、时间对齐的世界控制,且无需引入专用的动作模块。具体而言,我们将每个动作表示为角色指令与摄像机指令的结构化组合,并将其与对应的时间视频隐变量对齐。为实现时间上的精确控制,我们进一步引入了时间注意力路由机制,将每条指令限制在其预期的时间区间内,从而减少动作间的控制泄漏。重要的是,H3-WORLD 直接复用了大规模视频预训练中学习到的语义表征,仅需轻量级适配。仅使用 8,000 个游戏样本、10,000 步 LoRA 优化和 0.199% 的可训练参数,H3-WORLD 便实现了有效的角色与摄像机控制,同时保持了良好的生成质量,并能泛化到未见过的场景。这些结果表明,大型视频生成器中涌现的控制能力可以被高效地转化为交互式世界控制。
一句话总结
H3-WORLD 是腾讯、新加坡国立大学和香港理工大学提出的一种高效框架,通过将结构化语言指令与时间视频潜在变量对齐,并采用时间注意力路由防止控制泄漏,将 MiniMax-H3 视频生成器转变为交互式世界模型,仅用 0.199% 的可训练参数即可实现精确的角色和相机控制。
核心贡献
- 论文表明,像 MiniMax-H3 这样的大型视频生成器已经展现出基于语言的粗粒度控制,为交互式世界建模奠定了基础。
- H3-WORLD 被提出,通过将角色和相机动作表示为文本指令并应用时间注意力路由,将这种语言理解转化为精确的世界控制,无需专用的动作特定模块。
- 仅使用 8,000 个游戏样本和 0.199% 的可训练参数,H3-WORLD 实现了有效控制,保持了生成质量,并泛化到未见过的动作和视觉场景。
引言
预训练的视频生成器(如扩散 Transformer)已成为模拟视觉丰富世界的强大基础,但它们缺乏用于交互式控制的精确动作接口。先前工作通常添加专用控制模块,例如动作嵌入或相机几何信息,这些模块需要额外的监督,并可能破坏预训练能力。作者观察到,像 MiniMax-H3 这样的大型模型已经能够响应粗粒度的文本运动命令,并利用这一点构建了 H3-WORLD。该框架将角色和相机动作表示为与视频潜在区间对齐的组合文本指令,使用时间注意力路由来保持控制精度。这种轻量级适配(仅 0.199% 参数)实现了有效的交互式世界建模,同时保持了生成质量,并泛化到未见过的动作和场景。
方法
作者提出了 H3-WORLD,该框架旨在根据初始观测 I0、静态语义条件 s 和预定的动作序列 a1:K 生成未来的视频潜在变量 V1:K。该系统基于 MiniMax-H3,这是一个预训练的双向音视频基础模型,可联合去噪整个未来时间范围。骨干网络的预训练参数 θ 保持冻结,而轻量级适配参数 ϕ 则专门为动作控制学习。条件生成过程表述为:
V1:K∼pθ,ϕ(V1:K∣I0,s,a1:K)MiniMax-H3 在共享序列中处理文本、图像、音频和视频 token。H3-WORLD 保留了原生音频流,并将架构修改集中在视觉动作控制上。
如下图所示,整体架构包含三个主要组件。语义动作接口将角色和相机控制转换为组合文本指令。潜在对齐的时间绑定将每条指令与特定的视频潜在区间关联。最后,单出口路由在 H3 骨干网络中保持这种关联,同时低秩适配(LoRA)学习相应的动作条件视觉动态。
语义动作接口将外部离散控制状态转换为模型的原生文本条件空间。每个控制状态包含记录的角色和相机按键以及一个二进制相机速度标志。这些按键在每个原生 H3 视频潜在区间内聚合,形成潜在级别的状态。为了暴露控制空间的组合结构,作者将角色控制与相机控制分开。对于第 k 个视频潜在区间,动作定义为 ak=(uk,ck),其中 uk∈U 表示角色控制命令,ck∈C 表示相机控制命令。每个控制对通过子句拼接映射为简短的文本指令:
pk=Tchar(uk)∥Tcam(ck)这种表示保留了原始动作空间的因子分解。然而,训练数据仅覆盖了有效组合中的一个稀疏且高度不平衡的子集。
下图总结了训练集中角色和相机子句的联合分布,突出显示了前 20 种组合占所有动作提示的 71.4%,而 52 种结构上有效的组合在训练期间完全不可见。
为了在每条指令与生成的视频之间建立精确的对应关系,作者引入了潜在对齐的时间绑定。每个动作提示 pk 由共享的 H3 编码器 E 编码,并由共享的两层 token 精炼器 R 处理,生成动作 token Ak=R(E(pk))。token 精炼器采用块对角注意力,允许同一动作跨度内的 token 双向通信,同时将不同动作跨度作为独立序列处理。
初始观测 I0 和静态语义条件 s 联合处理生成静态语义 token S,而视觉 VAE 将 I0 映射为首帧条件 C0。这些视觉条件和生成目标被打包成一个单一序列:
X=[S;A1;…;AK;C0;V1;…;VK;P]其中 P 表示掩码填充 token。为动作跨度分配镜像时间位置,使得 τ(Ak)=τ(Vk)−Δ,其中 Δ>0。这种构造保留了预训练模型的文本先于视频的顺序,并提供了一致的时间对齐线索。
为了限制信息流并防止动作跨度在双向自注意力期间与不匹配的视频潜在变量直接通信,作者实现了单出口路由。确定性路由掩码确保当动作跨度 Ak 作为注意力键时,它只能被同一动作跨度内的 token 及其匹配的视频潜在变量 Vk 读取。当 Ak 作为查询时,它保留对静态上下文、首帧条件、原生音频上下文、自身 token 以及匹配的视频潜在变量的访问,而对其他跨度的访问被屏蔽。所有视频潜在跨度保留原始的双向注意力模式,允许视觉效果通过视频到视频的注意力传播,以保持运动连续性。
利用 LoRA 沿着这些允许的路由学习动作条件变换。低秩更新应用于 H3 自注意力块中的 QKV 和输出投影,以及两层 token 精炼器。H3 骨干网络、编码器、视觉 VAE 以及所有其他组件保持冻结,训练过程保留原生 H3 去噪目标,不为路由掩码或跨度划分引入额外的可学习参数。
实验
评估使用来自 ABot-World-Explorer-500h 的游戏片段,在 H3 上训练 LoRA 适配器,并与冻结的预训练版本和直接动作条件变体进行比较。实验表明,LoRA 适配能够实现对相机和角色运动的时间精确控制,而预训练的 H3 仅遵循粗粒度的全局指令,未经适配的每潜在接口仍然无响应。基于文本的动作接口优于直接特征条件,适配后的模型在组合上泛化到未见过的动作组合,在视觉上泛化到分布外场景,同时保留场景布局和风格。