Command Palette
Search for a command to run...
PAWBENCH:我们离概率对齐的世界建模还有多远?
PAWBENCH:我们离概率对齐的世界建模还有多远?
摘要
近期的视频生成模型越来越多地被定位为世界模型。许多物理过程可能以不止一种有效方式展开。因此,一个世界模型不仅应再现一条合理的轨迹,还应再现相同初始观测和动作下可能行为的分布。我们将这种分布层面的要求称为概率对齐。然而,现有评估大多衡量单条视频的合理性,并未检验重复生成是否能恢复正确的分布。这引出了一个核心问题:当前的视频生成器距离概率对齐的世界建模还有多远?为回答这一问题,我们将概率对齐形式化为世界模型的一种分布性准则,并引入 PAWBench,一个用于评估视频生成器作为世界动态随机采样器的基准。我们进一步提出 PAWEval,一种结果层面的协议,将重复的视频推演转换为可能物理行为的经验分布。在 50 个场景和 11 个当前系统上,没有模型能在恢复有效行为范围的同时,一致地匹配参考概率。在确认这一差距后,我们测试了语言提示、初始噪声采样或模型训练是否能重塑模型的预测分布。我们相信,这项工作可以为未来迈向概率对齐的世界建模奠定基础。
一句话总结
来自上海交通大学、上海人工智能实验室及其合作者的研究人员提出了PAWBench和PAWEval,这是一个基准和协议,通过评估结果分布而非单视频的合理性,来评估视频生成器作为概率对齐的世界模型,并且在50个场景中,当前模型均无法持续匹配参考概率,揭示了关键差距。
核心贡献
- 概率对齐被形式化为一个分布准则,要求在同一初始观察和动作下,重复的视频生成能够重现可能物理未来的正确分布。
- 引入了包含50个受控随机场景的基准PAWBench,对11个视频生成器的评估表明,现有模型均无法持续匹配参考概率或恢复全部有效行为范围。
- 开发了结果级别的协议PAWEval,将重复的视频推演映射为经验结果分布,从而能够在校准和覆盖范围内进行可处理的分布比较。
引言
视频生成领域的最新进展使这些模型成为潜在的世界模型,能够从初始观察和动作模拟合理的未来。然而,真正的世界模型必须捕捉可能结果的完整分布,而不仅仅是单一合理的延续,作者将这一要求称为概率对齐。现有基准评估单个视频的质量和连贯性,但并未测试模型生成的分布是否与物理上有效的未来集合相匹配。作者引入了PAWBench,这是一个包含50个随机物理场景的基准,旨在衡量视频生成器恢复正确结果概率和有效未来覆盖范围的能力。他们发现,当前模型能生成看似合理的单次推演,但未能使其输出分布与底层物理过程对齐,揭示了世界建模能力中的关键差距。
数据集
作者引入了PAWBench,这是一个用于评估视频生成模型中概率对齐的基准。它包含50个手动策划的场景,每个场景提供一个源图像(初始观察)、一个动作提示、一组有效的最终结果,以及对于校准场景,一个参考分布。场景涵盖八个机制组:抛掷、旋转、路径选择、抽签式随机化、碰撞、稳定性、agent交互和材料转换。
该基准分为两个互补的子集:
- PAW-Calibration(25个场景):参考分布通过解析或物理对称性推导得出。它衡量模型的经验结果分布是否接近参考分布,检测概率分配错误。
- PAW-Coverage(25个场景):结果可枚举,但其概率无法可靠指定。它检查重复推演是否恢复所有不同的有效未来,检测遗漏的结果。
每个场景的构建遵循三个要求:随机性必须源自可见的物理机制,动作提示必须描述一个原子干预,最终结果必须构成一个有限且视觉上可区分的集合。作者手动生成源图像和动作提示,列出有效结果,定义失败标准,并为PAW-Calibration推导参考分布。一个基于评分标准的评判协议PAWEval将生成的视频映射到最终结果。
在评估中,模型被查询K次,使用相同的源图像和动作提示。生成的视频被映射到结果,产生经验结果分布。在PAW-Calibration中,该分布与参考分布进行比较;在PAW-Coverage中,评估结果集的覆盖范围。这种设计分离了单样本评估无法区分的校准和覆盖失败。
方法
作者提出了一个概率对齐世界建模框架,将世界模型视为给定初始观察x和动作a下未来轨迹τ的条件分布PM(τ∣x,a)。这一表述捕捉了物理过程的随机性,即相同的初始条件可能导致多个有效结果。作者定义了两个对齐级别:支持对齐,要求模型实现所有不同的可能结果;概率质量对齐,要求这些结果以正确的相对比例出现。
为了实现概率对齐,作者在塑造生成未来分布的三个接口上进行干预:语言提示、初始噪声采样和模型参数更新。
首先,作者探索了通过语言引导视频生成器的提示工程。他们评估了三种设置:直接视觉-语言模型采样,其中模型充当可能未来的采样器;标准提示工程,其中语言模型预测结果并编写相应的生成器提示;以及Oracle提示工程,其中目标结果在提示中明确指定以遵循参考分布。这种方法隔离了控制器选择错误分布与生成器未能产生所请求结果的错误。即使通过Oracle提示工程手动指定目标,生成器也难以实现所请求的结果。
如下图所示:
结果表明,当前基于语言的控制是有限的,因为生成器仅实现了所提供目标的一小部分,凸显了仅通过提示可靠地对齐输出分布的难度。
其次,作者研究了初始噪声采样,以确定观察到的分布差距是否源于有限样本探索失败。在固定动作提示和生成器的情况下,他们采用了Couple to Control,一种排斥性高斯耦合方案。该方法在初始噪声样本之间引入负相关性,同时保持每个样本的标准高斯边缘分布。通过这样做,作者测试了独立抽取是否反复访问相同的模式,以及噪声耦合能否在固定的推演预算内鼓励探索其他有效结果。
第三,作者研究了更新模型参数以改变学习到的概率质量分配。他们在具有不同特定结果比例的数据集上训练了LoRA适应的视频生成模型。通过在固定训练预算和配方的情况下调整训练数据组成,他们探究了全局结果频率如何影响模型的条件分布。作者发现,改变全局混合仅提供粗略控制,因为调整一个场景的权重往往会降低另一个场景的对齐度。这表明,真正的概率对齐要求模型学习可能未来的分布应如何根据每个特定场景的初始物理状态动态变化。
实验
PAWBench通过反复推演相同的初始观察和动作,然后测量两个轨道上的结果分布来评估视频生成模型作为概率世界模型:PAW-Calibration测试经验分布是否匹配已知参考,而PAW-Coverage检查是否出现所有有效结果。实验表明,当前模型既无法正确分配概率,也无法恢复完整的合理未来集合,并且它们无法可靠地区分物理因果干预和非因果输入变化。进一步分析显示,增加推演次数或使用基于语言的提示工程都无法解决这些缺陷,因为模型既难以选择正确的结果分布,也难以在视频中忠实地实现所请求的未来。
当前的视频生成器在概率校准和支持覆盖之间表现出明显的分离:校准误差最低的模型仅通过了部分场景,而平均覆盖率最高的模型同样留下了许多场景。即使在一个指标上通过所有场景的模型也并未在该指标上领先,这强调了场景级可靠性和条件对齐捕捉了不同的失败模式。校准最好的模型(Cosmos 3 Super I2V)仅通过了80%的校准场景,而覆盖率最高的模型(LTX-2.3)仅通过了72%的覆盖场景。Seedance 2通过了所有校准场景,但并未达到最低的校准误差,LingBot-Video-MoE通过了所有覆盖场景,但并未达到最高的覆盖率。恢复广泛支持(高覆盖率)的模型并非最匹配参考概率(低校准TVD)的模型,揭示了世界建模的这两个方面是解耦的。场景通过率差异很大,一些模型在相当大比例的场景中未能产生可读的结果,限制了其条件平均值的可靠性。
从视觉-语言模型直接采样未来结果得到的分布与参考概率不一致。在五个评估的VLM中,GLM-5V Turbo实现了最低的校准误差,而Gemini 3.5 Flash达到了最高的覆盖率,但没有模型同时在两个指标上表现良好。GLM-5V Turbo产生了最校准的结果分布,与参考的总变差距离最小。Gemini 3.5 Flash覆盖了最广泛的可能结果范围,实现了最高的覆盖率百分比。所有模型都在校准和覆盖率之间表现出权衡,没有模型在两方面都表现出色。
GPT-5.5的提示工程结果选择在生成任何视频之前就已与目标分布不一致。当这些选择传递给视频生成器时,所有模型的校准误差增加,而覆盖率仅对部分模型有所改善。手动指定的目标结果(Oracle PE)始终降低校准误差并提高覆盖率,但生成器仍未能实现所请求结果的很大一部分,揭示了控制器和生成过程两方面的缺陷。仅GPT-5.5 PE选择的结果校准TVD为44.3,覆盖率为35.0%,已经远离参考分布。将PE添加到视频生成器中,每种情况下都提高了校准TVD(例如,Cosmos 3 Super I2V从20.5升至31.6),并且仅对部分模型改善了覆盖率,而Wan2.2的覆盖率从63.4%降至61.9%。Oracle PE降低了每个生成器的校准TVD并提高了覆盖率,但即便如此,生成器仅实现了所请求结果的37.6–58.1%。
使用C2C将50次推演的噪声耦合,降低了所有三个测试视频生成器的平均校准误差并提高了平均覆盖率,表明对每个模型现有输出分布的更广泛探索。改进因机制而异,并且并未持续提高成功概率比,表明C2C使生成的未来多样化,但未改变底层学习分布。C2C降低了Wan2.2、LTX-2.3和Cosmos 3 Super I2V的平均校准TVD,其中LTX-2.3的降幅最大(从30.1降至19.9)。在C2C下,所有生成器的平均覆盖率均有所提高,Cosmos 3 Super I2V增益最大(从55.2%升至63.9%)。SPR变化不一致:Wan2.2的校准SPR从64%升至84%,而其覆盖率SPR从92%降至88%。
在具有递增比例的左倒铅笔示例的混合数据上训练视频生成器,会使直立和左倾场景的结果分布向同一方向移动。使用20%左倒视频训练的模型最接近直立铅笔的50/50参考分布,但使左倾场景处于随机水平,而使用80%或更多左倒视频训练则匹配左倾场景的100/0参考分布,但导致直立铅笔几乎总是向左倒。没有单一的训练混合能够同时满足两个参考分布。增加左倒训练视频的比例会使直立和左倾场景的结果质量向左移动,使它们的分布同步移动。在80%或100%左倒视频上训练完美匹配左倾参考(TVD 0.0),但直立场景随后几乎每次都向左倒(TVD 48.0–50.0)。
该评估衡量了视频生成器和视觉-语言模型在多样场景中产生与参考概率对齐的结果分布的能力,同时测量校准误差和覆盖率。在所有模型中,校准和覆盖率是解耦的:没有单一模型在两方面都表现出色,通过语言模型的提示工程始终恶化校准,而仅偶尔改善覆盖率。跨推演耦合噪声改善了两个指标,但未改变底层学习分布,而在倾斜数据混合上训练则均匀地移动结果分布,阻止了任何单一模型同时满足多个参考分布。