Command Palette
Search for a command to run...
SolarWM:面向长时程视频世界模型的开放数据与可扩展训练
SolarWM:面向长时程视频世界模型的开放数据与可扩展训练
摘要
我们提出 SolarWM,一个从数据准备到长时程推理、用于构建交互式视频世界模型的完全开放基础。跨异构数据源和视频骨干网络进行训练充满挑战:数据集在时间尺度、相机几何、视觉质量、运动和标注风格上各不相同,而视频生成器则使用不同的表示和架构。因此,简单的数据混合和模型特定实现会产生不一致的监督信号,并使结果难以复现和比较。SolarWM 通过一个可重构的多源数据引擎和一个骨干原生适配框架来解决这一耦合问题。该引擎将来自 10 个数据集的 143 万个规范片段转换为统一的、帧对齐的约定,涵盖视觉观测、度量相机几何、标注、质量元数据、选择决策和数据来源,同时将源处理与混合构建解耦。在共享的相机条件、训练和推理接口下,我们基于 Wan2.2、LTX-2.5 和 MiniMax-H3 实例化了四个 5B–33B 模型,同时保留了它们原生的表示和目标。一个统一的三阶段方案结合了双向适配、教师强制自回归初始化和分布匹配蒸馏。由此产生的因果模型仅在 5 秒序列上训练后,便能在从数分钟到数小时的推演中实现实时交互。通过发布由此产生的数据、流程、方案、权重和框架,SolarWM 为交互式世界模型研究提供了一个可复现且可扩展的基础。
一句话总结
香港中文大学(深圳)、SLAI、新加坡国立大学等机构提出 SolarWM,这是一个面向交互式视频世界模型的开放基础框架,采用可重构多源数据引擎和主干原生适配,在统一的帧对齐数据上训练 5B–33B 参数的模型,并通过由双向适配、教师强制自回归初始化和分布匹配蒸馏组成的三阶段方案,使得模型仅在 5 秒训练序列上学习后,即可实现数分钟到数小时的实时交互推演。
核心贡献
- 一个可重构的多源数据引擎将来自 10 个异构数据集的 143 万条片段标准化为统一的帧对齐约定,将源处理与混合构建解耦,从而实现可复现且可审计的训练。
- 一个主干原生适配框架和统一的三阶段训练方案(双向相机条件适配、教师强制自回归初始化、分布匹配蒸馏)在 Wan2.2、LTX-2.5 和 MiniMax-H3 上实例化了四个支持相机控制的 5B–33B 参数的世界模型,同时保留了每个生成器的原生表示。
- 整个技术栈(处理后的数据、流水线、训练方案、模型权重和推理框架)完全开放发布;所得因果模型支持实时交互,且在仅用 5 秒序列训练后,即可实现长达一小时的连续推演,为交互式世界模型研究提供了可复现且可扩展的基础。
引言
交互式视频世界模型可以在给定相机运动或动作的条件下生成未来视觉观测,从而将被动视频生成器转变为可供仿真和内容创作使用的可探索环境。然而,现有系统难以从短视频片段扩展到长时间推演,因为它们必须在异构数据源和多样模型架构上保持视觉质量和时序一致性,而多数开放实现仍依赖于狭窄的数据集和特定主干的训练方式。作者提出 SolarWM,这是一个完全开放且统一的基础框架,通过可重构的多源数据基础设施、保留每个生成器原生表示的主干原生适配框架,以及简洁的三阶段训练方案解决了上述挑战。这产生了一系列参数规模从 5B 到 33B 的相机可控模型,在仅用 5 秒序列训练后即可支持从分钟级到小时级的开放式推演,为未来的世界模型研究提供了可复现且可扩展的基础。
数据集
作者将 SolarWM 数据集构建为一个灵活的开放数据引擎,而非固定的片段列表。语料库包含来自 10 个源数据集的 143 万条标准片段,并组织成 14 个可独立寻址的数据集所有者。每条片段都经过完备的处理和标注,过滤决策则通过可配置的方案在后期应用,使得被拒绝的片段仍保留完整的元数据。
数据集组成与来源
- 10 个源数据集为 ABOT-World、DL3DV、MiraData、RealCam、SpatialVID、Sekai-Game、Sekai-Walking、MIND、MultiCamVideo 和 OmniWorld。
- DL3DV 被划分为两个时长相异的视图(DL3DV-10s 和 DL3DV-60s),另外结合 MiraData、Sekai-Walking 和 SpatialVID 衍生出三个额外的 Clean Plate 所有者,共计 14 个所有者。
- Clean Plate 子集通过 LTX-2.3 Clean Plate 流水线生成,旨在移除人物和车辆,同时保留场景布局和相机运动。由此产生 54.3 万条干净片段(29.8 万 SpatialVID-Clean、13.5 万 MiraData-Clean、10.9 万 Sekai-Walking-Clean),每条都被视为一个独立的所有者并重新计算标注。
统一模式与处理
- 每个样本遵循统一的约定:视频、度量尺度的相机到世界位姿、逐帧内参、密集描述、元数据、质量指标和来源信息。
- 相机标注使用稳健的流水线(Pi3X、MoGe-2、VIPE SLAM)生成度量尺度的 6 自由度轨迹和逐帧内参。当存在真实位姿或 COLMAP 位姿时,会予以保留并通过 Sim(3) 拟合对齐到度量尺度。
- 所有 143 万条片段均使用 Kimi-K2.6 流水线进行描述。描述仅涉及持久的环境和稳定的场景内容,明确排除动态实体、相机运动以及推测性措辞,以避免泄露相机控制信息。
- 为每条片段计算一组质量与运动度量向量:相机完整性检查、视觉质量(DOVER 分数、饱和度)、运动(VMAF Motion、稠密对应幅度)、时序一致性(场景切换、转场)以及语义适配性(质量标志、实体密度、场景类型)。
筛选与质量层级
- 基于源数据的感知过滤策略将每条片段分配为三种物理标签之一:xhigh(同时满足保留和更严格的提升规则)、high(仅满足保留规则)或 rejected(记录失败原因)。
- 不同所有者的策略是非对称的。例如,Sekai-Game 保留高运动游戏片段而不使用通用的相机几何门控,而清洁源则需要进行后变换几何检查。
- 在 143 万条片段中,87.6 万条被保留:47.1 万属于 high 层级,40.4 万属于 xhigh。其余 54.9 万条片段保留在被拒绝分区中,并包含完整标注。
数据使用方式
- 作者将物理语料库与逻辑方案和模型视图分离。方案定义划分成员、层级策略、源权重和重复因子,而不复制视频数据。
- 一个短时域方案(81 帧)覆盖十个所有者,包含 600,320 行物理训练数据。源平衡对 ABOT、MiraData 和 Sekai-Game 应用 6 倍重复因子,每个 epoch 产生 870,210 个虚拟出现数。一个留出的测试视图包含 1,000 行数据。
- 短时域和长时域生成的时间视图由相同的物理片段构建,从而无需重新运行昂贵的预处理即可灵活设计方案。
关键统计
- 语料库总量:143 万条标准片段,2.9 万个分片,约 25.85 TB。
- 保留片段:87.6 万(47.1 万 high,40.4 万 xhigh);拒绝片段:54.9 万。
- 片段长度分布:大多数片段(85.8 万)处于 153–956 帧区间;所有短于 81 帧的 7.8 万条片段均被拒绝;8.2 万条保留片段至少包含 957 帧。
方法
作者提出 SolarWM,一个将多个视频生成主干统一在共享数据方案、处理约定和相机几何接口下的交互式世界模型框架。为实现跨架构的精确相机控制,该框架采用融合投影旋转位置嵌入(fused-PRoPE)。主干首先应用其原生视频 RoPE 来表示时间和空间位置。然后,相机位姿和内参确定投影旋转,并将其直接应用于现有自注意力路径中的查询、键和值张量。这种设计通过注意力计算本身注入相机运动,无需单独的控制分支或额外的注意力通道。
为确保相机控制生成的高质量监督,作者实施了严格的数据处理流水线。人物和车辆等动态实体常常引入既不被相机解释也无法一致控制的歧义运动。为解决此问题,作者采用 LTX-2.3 Clean Plate IC-LoRA 流水线来移除这些动态元素,同时保留静态场景布局和源相机轨迹。
如下图所示:
对于每个接受的源区间,转换使用 8 个去噪步骤,强度为 1.0,并采用特定的 Clean Plate 提示。输入按 1248×704 分辨率处理,输出保存为 1280×720、16 fps。由于移除过程可能引入纹理伪影或时序不连续性,每个输出窗口都会重新计算描述、视觉度量、语义度量和相机诊断,以保证数据质量。
世界模型通过一个结构化的三阶段流水线进行训练,旨在从预训练视频生成器过渡到因果的少步自回归模型。
第一阶段是双向适配。给定干净视频潜变量 z0 和由文本、图像、相机输入组成的条件 c,模型从噪声潜变量 zt 预测原生流目标 ut。目标最小化流匹配损失:
Lbid=Ez0,t,ϵ[∥fθ(zt,t,c)−ut∥22]使用跨整个训练窗口的双向注意力。这使得预训练的视觉先验适配到相机条件的世界数据,同时保留不受限的时序上下文。
第二阶段是教师强制 AnyFlow 初始化,它在保持优化目标完全监督的同时引入因果性。潜变量序列被划分为有序块。在预测当前块时,模型仅关注当前噪声状态和干净的真实历史,并隐藏未来的块。对于一对采样的噪声水平 (t,r),训练目标为:
LTF−AF=E[k∑ℓAF(fϕ;ztk,t,r,z0<k,c)]其中 ℓAF 监督任意噪声水平之间的流映射。此阶段以双向模型为初始化,作为一个短因果适配,直接产生少步自回归检查点,避免了需要单独因果 ODE 或因果一致性蒸馏的阶段。
最后阶段是基于 DMD 的因果训练,旨在解决教师强制训练与模型生成轨迹推理之间的曝光差距。一个因果学生模型使用分离的 rollout-and-replay 过程生成轨迹,以允许 KV 缓存梯度。一个冻结的双向教师模型估计目标分布,同时一个可训练的假分布模型跟踪学生不断演变的 rollout 分布。学生的分布匹配方向从它们的差异中导出。DMD 更新形式为:
∇ψLDMD=E[JGψ⊤w(t)(sfake(zt,t,c)−sreal(zt,t,c))]其中 JGψ 将信号映射回生成器参数,w(t) 控制其在不同噪声水平上的尺度。这种分离保持了稳定的质量参考,同时允许训练信号适应变化的学生分布。
实验
评估首先在来自外部生成器的域外初始图像上测试双向预训练模型,结果显示统一的数据和相机条件约定能够泛化到未见过的视觉域,同时保持每个主干的视觉先验。然后,在域内和域外评估蒸馏后的因果生成,证明模型可以遵循给定的相机轨迹、维持场景一致性,并从单张图像中合理地推断出新显现的内容。在长视频生成中,模型能够维持连贯的分钟级和小时级推演,小时级长序列尽管仅在 5 秒片段上训练,仍保持视觉连贯,突显了强大的泛化能力和持续的相机控制。
大多数交互式视频世界模型仅发布推理代码和部分权重,而训练代码、数据以及完整的可复现性仍然稀缺。在所调研的系统中,只有 DIAMOND 提供了可执行的训练方案,且没有一个系统提供完整的从数据到训练的流水线及确切数据混合配比。SolarWM 被定位为一个完全开放的训练框架,它提供跨多个视频主干的统一方案,旨在弥补这些缺口。下表中,DIAMOND 是唯一发布训练代码和确切方案的系统,但未提供数据或完整的源到训练流水线。所有其他列出系统将公开构件限制为推理代码以及完整或精简的权重,而省略训练、数据和可复现组件。SolarWM 承诺提供完全开放的技术栈,包括训练阶段、处理后的数据、确切方案以及对多个视频主干的支撑,与此前系统的部分发布形成对比。
Kimi-K2.6 描述流水线生成一段关于持久场景元素(如建筑、地形和光照)的密集英文描述,并明确排除动态实体、动作和相机运动,以防止控制信号泄露。模型输出一个严格的 JSON 对象,包含恰好六个字段,仅使用密集描述作为文本条件;其余字段作为结构化标注供下游使用。生成采用温度 0 并禁用思考模式,以强制确定性。描述仅涉及持久环境和稳定场景内容,明确排除人物、动物、车辆、动作和相机运动。响应是一个固定的 JSON 模式,包含六个字段,以温度 0 和禁用思考模式确定性生成。只有 dense_caption 字段成为文本条件;实体密度和视觉质量分数作为结构化标注存储。
每个数据集所有者使用固定的非对称策略,将样本分配至 xhigh、high 或 rejected 层级。这些策略在应用的视觉和几何门控上有所不同:游戏轨迹跳过相机几何和饱和度检查,而清洁源则强制执行后变换几何检查。xhigh 层级在质量分数、实体密度和运动限制等指标上施加更严格的阈值。Sekai-Game 接受低至 3 的质量分数,而所有其他源要求最低质量分数为 4。MiraData 独特地要求非空描述、至少 81 帧且固定分辨率为 1280×720。
发布的语料库包含来自七个数据集所有者的 140 万条片段,其中 87.6 万条保留在 high 和 xhigh 质量层级。不同所有者的贡献差异显著:MultiCamVideo 和 ABOT 被大量保留,而两个 MiraData 变体共同贡献了绝大多数的被拒绝片段。时序分析显示,所有短于 81 帧的片段均被拒绝,大多数保留片段落在 153–956 帧区间。MultiCamVideo 提供了最大份额的 high 层级片段,而 ABOT 几乎全部由 xhigh 片段组成。MiraData 和 MiraData-Clean 各有超过 85% 的片段分配至 rejected 分区。high 和 xhigh 层级对 87.6 万保留片段的贡献大致相当。所有 7.8 万条短于 81 帧的片段均被拒绝,而长尾的至少包含 957 帧的片段中包含 8.2 万条保留片段。153–956 帧区间拥有大多数片段以及过半的保留片段。
SolarWM 模型家族保留了每个主干的原生接口,同时标准化了数据和相机约定。图像条件、音频处理以及 VAE 压缩比在四条路线上各不相同,反映了底层视频生成模型的原始设计选择。5B 模型使用文本到视频的潜路径,没有单独的图像输入;14B 模型采用显式的掩码和潜变量图像条件;而更大的模型则适配或禁用了原生音频组件。图像条件方式差异显著:5B 模型没有单独的图像张量,将第一帧潜变量视为干净锚点;而 14B 模型使用 4 通道掩码加 16 通道图像潜变量作为显式输入。音频处理方面,Wan 系列模型没有,LTX 移除了其 3.69B 音频流和交叉注意力,Minimax 则保留音频目标行但禁用损失,从而使所有路线聚焦于视觉生成。
SolarWM 作为一个完全开放的训练框架被提出,它发布训练代码、处理后的数据以及跨多个视频主干的精确方案,直接弥补了先前系统通常只提供推理构件的可复现性缺口。一个确定性描述流水线生成密集的环境描述,同时明确排除动态实体以防止控制信号泄露,并生成结构化 JSON 标注供下游使用。数据集过滤采用针对所有者的非对称策略将片段分配到质量层级,最终产生一个由 87.6 万条片段组成的精编语料库,不同来源的贡献差异显著,绝大多数被拒绝片段来自 MiraData 变体。模型家族标准化数据和相机约定,同时保留每个主干的原生接口,通过不同的图像条件策略以及移除或禁用音频组件,使所有路线聚焦于视觉生成。