Command Palette
Search for a command to run...
PHIZERO:围绕物理语言构建的世界模型
PHIZERO:围绕物理语言构建的世界模型
Shuyao Shang Yuqi Wang Ruopeng Gao Xu Chen Tieniu Tan Lue Fan Zhaoxiang Zhang
摘要
我们提出 PHIZERO,一个围绕物理语言构建的物理世界模型。物理语言是对世界状态转移的一种紧凑离散表示。现有的物理世界模型通常直接在像素空间中预测未来视频,导致底层世界动态隐含在高维视觉预测器之中。受人类能够从视觉经验中抽象出预测结构并用自然语言组织起来进行显式推理这一能力的启发,我们通过自监督学习从自然场景视频中习得物理语言,并利用它来显式地推理物理世界的演化方式。相应地,PHIZERO 采用“先推理后渲染”的范式:它首先将未来世界的演化推断为物理语言序列,然后将推断出的状态转移渲染为视频。在生成和理解基准上的大量实验验证了 PHIZERO 对物理上连贯的世界演化进行建模的能力。我们进一步展示了它在逼真且可交互的世界建模、细粒度动作条件仿真以及零样本运动迁移方面的潜力。
一句话总结
中国科学院自动化研究所模式识别国家重点实验室的研究者提出PHIZERO,一种物理世界模型。与先前的像素空间预测器不同,该模型通过自监督学习从自然场景视频中习得一种紧凑的离散物理语言,在渲染为视频之前显式推理世界状态的转换,展示了连贯的生成、交互式模拟以及零样本运动迁移能力。
核心贡献
- 本文提出了物理语言,一种通过自监督学习从自然场景视频中大规模习得的状态转换模式的紧凑离散表示。
- 本文开发了PHIZERO,一种采用"先推理后渲染"范式的物理世界模型:未来的世界演化首先被推断为物理语言序列,随后渲染为视频。
- 大量实验验证了PHIZERO生成物理上连贯的结果并检测不合理事件的能力,并展示了其在交互式推演、动作条件模拟和零样本运动迁移方面的潜力。
引言
视频世界模型日益被视为物理AI的模拟器,但通过直接像素空间预测生成未来帧的主流方法通常会产生物理上不一致的结果。底层动力学仍然隐含在高维视觉特征中,使得以物理上有原则的方式推理世界如何演化变得困难。作者通过提出PHIZERO来解决这一问题,PHIZERO是一种学习紧凑离散表示(称为物理语言)的物理世界模型。这种表示通过自监督重建从未标注的自然场景视频中捕获状态转换模式,将动力学与视觉外观显式解耦。通过采用先推理后渲染的范式,PHIZERO首先在习得的物理语言空间中预测未来的世界演化,然后将结果渲染为视频,从而实现更物理上连贯的生成、交互式控制和零样本运动迁移。
数据集
作者在两个专门层次上构建了Physical Language Reasoner数据集,重用了最初为训练Physical Language Tokenizer而整理的视频片段。
-
通用预训练语料库(约500万个片段): 从真实世界和模拟来源中提取的四秒视频片段。每个片段配有VLM生成的字幕,该字幕仅描述高层级的初始动作或交互,从不描述细粒度的结果(确保文本不会泄露未来状态)。每个样本的目标是由冻结的Physical Language Tokenizer离线产生的完整的物理语言token序列。输入是第一帧和字幕;模型必须预测状态将如何演化。
-
运动丰富的SFT语料库(约100万个片段): 通用语料库的过滤子集,增加了经过整理的模拟器生成样本。作者应用了两个基于VLM的过滤器——运动丰富度过滤器和物理过滤器——以保留展示显著状态变化和物理上有信息交互的片段。最终得到的约100万个四秒片段作为高质量的专业化数据集。
-
数据使用方式: 训练分为两个阶段进行。在阶段1,模型在完整的500万通用语料库上进行持续预训练;这将预训练的VLM适配到自回归物理语言预测。在阶段2,模型在100万SFT语料库上进行微调,将学习重点放在运动丰富、物理上有意义的转换上。不应用混合比例;每个阶段使用其各自的完整数据集。
-
关键处理细节:
- 字幕生成的提示将描述限制在初始动作,防止文本泄露片段的结果。
- 冻结的tokenizer将每个4秒视频编码为离散的物理语言序列,该序列成为真值目标。
- 仅将第一帧作为视觉输入提供给推理器;除该单一初始状态外,不进行额外的帧裁剪或时间采样。
方法
作者提出了PHIZERO,一个将任务分解为物理语言推理和视频渲染的未来视频预测框架。形式上,令V表示未来视频,I0表示代表当前世界状态的第一帧,c表示文本动作意图,z表示描述从I0到V的转换的离散物理语言。联合建模分解为:
pθ,ψ(V,z∣I0,c)=pθ(z∣I0,c)pψ(V∣I0,z)其中Physical Language Reasoner在物理语言空间中推断状态演化,扩散解码器将推断出的转换渲染为未来视频。这种先推理后渲染的分解将状态转换推理与像素级合成分离。
参考框架图:
Physical Language Tokenizer将状态转换压缩为离散序列。给定视频V∈RB×3×T×H×W,时空编码器提取潜在特征x∈RB×C×t×h×w。作者没有提取全局表示,而是显式建模相邻潜在状态之间的转换以引入局部时间归纳偏置。对每一对(xi,xi+1),共享的Q-Former提取转换表示:
qi=QFormer(Q;xi,xi+1)其中Q∈RM×Dq包含M个共享的可学习转换查询。所得特征按时间顺序连接,并使用有限标量量化(FSQ)进行离散化:
z=FSQ(Projdown(q))量化后的表示z被投影到扩散Transformer的隐藏维度d,产生物理语言上下文Pc。
为了重建视频,作者采用预训练的视频扩散模型作为解码器。原始架构被保留,但文本条件被替换为Pc。第一帧I0作为干净的视觉条件提供,以直接提供静态外观信息。在Pc、I0、干净潜在变量x0以及扩散时间步τ∼U(0,1)的条件下,解码器优化标准的流匹配目标:
LFM=Ex,ϵ,τ[∥vψ(xτ,τ;I0,Pc)−(ϵ−x0)∥22],xτ=(1−τ)x0+τϵ,ϵ∼N(0,I)为防止预训练的解码器依赖其现有去噪先验而忽略物理语言上下文,纯噪声预热阶段从纯噪声初始化所有未来帧潜在变量。这强制解码器依赖Pc和I0重建未来视频,然后再恢复标准的流匹配噪声调度。
Physical Language Tokenizer的训练遵循两阶段方案,并结合联合时间和空间课程。
如下图所示:
对于预训练,作者从50万小时的真实世界视频池中筛选出1万小时未经标注的视频。视频以256x448分辨率处理,片段时长从1秒逐渐增加到4秒,使tokenizer首先学习局部状态变化。对于后续的SFT阶段,基于美学质量、运动幅度和状态转换可观察性进行更严格的过滤。这与1千小时的模拟视频相结合,产生500万个四秒片段。SFT的重建分辨率提高到512x896。最后,tokenizer被冻结,仅细化扩散解码器以提高重建质量。
Physical Language Reasoner从第一帧和文本意图中预测物理语言序列。该推理器从预训练的VLM初始化,其词表为每个FSQ索引扩展了一个独特的原子符号。给定I0和c,它自回归地预测长度为N的序列:
pθ(z∣I0,c)=j=1∏Npθ(zj∣I0,c,z<j)监督信号通过使用冻结的tokenizer离线编码训练视频生成。推理器使用自回归交叉熵目标进行优化:
LVLM=−j=1∑Nlogpθ(zj∣I0,c,z<j)训练分两个阶段进行,数据分布逐渐专业化。阶段1在500万片段通用语料库上进行持续预训练,将VLM适配到物理语言预测,并建立文本意图、当前视觉状态和结果状态转换之间的对应关系。阶段2在100万个运动丰富且物理上有信息片段的整理语料库上进行SFT(使用基于VLM的运动丰富度过滤器和物理过滤器进行筛选),以提高推断状态转换的物理合理性和精确性。
实验
PHIZERO在评估物理结果保真度和物理规律遵循性的视频生成基准上,以及在需要区分物理有效与无效场景的视频理解任务上进行了评估,展示了强大的物理连贯性和有竞争力的理解能力。消融研究证实了扩散解码器、转换级Q-Former和纯噪声预热对tokenizer至关重要,而提示增强、模拟数据和两阶段训练改善了推理器的转换预测。物理语言被证明可以将状态转换与视觉外观解耦,实现跨具身和跨视觉域的零样本迁移,并支持捕获细粒度动力学的可控、交互式世界模型。
在Physics-IQ Verified基准上,PHIZERO实现了最高的物理结果保真度,超越了所有对比模型。最大的模型(如Grok-Video和Cosmos3-Super)得分超过34 IQ-Score,而较小的模型(如Wan2.2-5B)仅达到21.2。结果表明,较大视频生成模型倾向于产生更物理上连贯的结果。PHIZERO获得最高的IQ-Score,超越了Cosmos3-Super(39.5)和Grok-Video(34.8)。较大的模型通常改善物理保真度:Wan2.2-14B(32.2)和Hunyuan-Video(33.4)优于Wan2.2-5B(21.2)。
在PhyGround上,较大的视频生成模型始终获得更高的总体质量和物理学分数,其中Veo3.1和Wan2.2-14B在评估的基线中领先。论文报告称PHIZERO超越了所有列出的模型,在该基准上获得了最高的物理学分数和总体分数。基线性能随模型规模而改善:LTX-Video-22B优于LTX-Video-19B,Wan2.2-14B在所有指标上超越Wan2.2-5B。Veo3.1在基线中实现了最高的总体质量,而Wan2.2-14B在表中获得了最高的物理学分数和总体分数。PHIZERO超越了最强的基线,在PhyGround的物理学分数和总体分数上均排名第一。
在WorldModelBench通用世界建模基准上,Runway实现了最高的总分和常识评分,而Wan2.2-5B在物理规律遵循性方面领先。Luma和Mochi也表现出有竞争力的性能,而较早的模型Pandora、OpenSora-Plan和CogVideoX在两个维度上均落后。Runway获得了最高的总体分数和常识评分,优于所有其他评估模型。Wan2.2-5B记录了最高的物理规律遵循性,在物理连贯性方面超越了所有其他模型。Luma和Mochi展现了总分超过7.6的强劲且均衡的性能,而Pandora、OpenSora-Plan和CogVideoX仍在6.8以下。
在IntPhys2直观物理理解基准上,Gemini-2.5 Flash以55.63%实现了最高的总体准确率,随后是一组并列53.75%的模型。性能因难度级别而异:Gemini-2.5 Flash在简单示例上表现出色,而V-JEPA在困难示例上领先。Gemini-2.5 Flash获得了最佳的总体分数,由简单实例上64.42%的强劲表现驱动。V-JEPA实现了最高的困难实例准确率(57.42%),在该子集上优于所有其他模型。
在LikePhys物理合理性判别基准上,较新的视频生成模型实现了较低的平均错误率。Wan2.1-1.3B以48.0的最低总体平均错误率,由非常低的刚性错误驱动,但流体错误相对较高,而CogVideoX-2B在流体和光学类别上表现最佳。较早的模型(如AnimateDiff-SDXL)在所有物理领域均显示显著更高的错误。Wan2.1-1.3B实现了最低的刚性错误(44.66)和最佳的总体平均错误(48.0),但其流体错误(57.10)是近期模型中最高的。CogVideoX-2B记录了最低的流体错误(42.00)和光学错误(25.15),导致接近最佳的总体平均错误48.2。
评估涵盖多个基准,这些基准探究视频生成中物理理解的不同方面,包括物理保真度和总体质量(Physics-IQ Verified、PhyGround)、结合常识和物理规律遵循性的世界建模(WorldModelBench)、直观物理准确率(IntPhys2)和物理合理性判别(LikePhys)。较大的模型通常产生更物理上连贯的结果,PHIZERO在面向物理的基准上领先,然而模型的优势是领域特定的:一些较小的模型在流体错误、物理规律遵循性或困难实例物理理解方面获得最高分,这突出了规模与架构设计在捕获物理真实性方面的互补作用。