Command Palette
Search for a command to run...
Apple-π:评估视频生成模型物理定律扎根能力的基准
Apple-π:评估视频生成模型物理定律扎根能力的基准
摘要
现代视频生成模型日益被誉为具备内化物理定律理解的新兴世界模型。然而,现有基准大多仅在输出层面评估物理合理性,而未验证模型是否通过忠实、扎根于定律的推理过程达成该结果。我们提出 Apple-π,这是首个将视频模型评估明确锚定于物理定律的基准。Apple-π 包含三个组成部分。1)Orchard:一个包含 400 个视频的数据集,覆盖经典力学中的十项典型任务。它将单一定律任务与多定律任务分离,前者用于无混淆因素诊断,后者用于探测泛化能力。2)基准协议:一个基于科学推理的三阶段协议,包括感知、形式化和演绎。该协议在信息图标注的首帧上使用帧链提示,将生成的视频视为模型可见的推理轨迹。3)评估套件:一个混合评估套件,将基于多模态大语言模型的主观评分与扎根于物理定律的客观度量相结合。这使得能够进行分阶段诊断,不仅判断模型是否失败,还能定位其失败环节。对 11 个模型的基准测试表明,当前视频模型距离可靠的、扎根于定律的世界模拟器仍相去甚远,表现最佳的模型得分仅为 0.473。我们的分阶段、分支柱和分来源分析进一步揭示了从感知到形式化再到演绎的瓶颈、薄弱的多定律状态迁移能力,以及持续存在的从模拟到现实的差距。这些发现将 Apple-π 确立为一种诊断基础,用以引导未来视频模型迈向具备扎根于定律的物理智能的世界模型。
一句话总结
南洋理工大学与香港中文大学提出了Apple-π,这是一个用于评估视频生成模型在物理定律基础方面的基准,它结合了一个精心构建的数据集与一个三阶段科学推理协议(感知、公式化、演绎),将生成的视频视为推理轨迹,并配以混合的物理定律基础评估套件,以揭示当前模型的失败之处并引导走向基于定律的世界模拟器。
核心贡献
- Orchard是一个包含400个视频的数据集,涵盖十个典型的经典力学任务,按单一定律和多重定律划分,以实现无混淆因素诊断和泛化能力测试。
- 一个三阶段基准协议(感知、公式化和演绎)采用基于信息图标注的首帧进行链式帧提示,将生成的视频视为可见的推理轨迹。
- 混合评估套件结合了基于MLLM的主观评分和基于物理定律的客观度量,能够对模型推理在哪个阶段出现故障进行分阶段诊断。
引言
作者研究了视频生成模型是否能够通过显式定律进行物理世界推理,而不仅仅是重现视觉上看似合理的模式。先前的基准仅评估最终输出,无法区分基于定律的演绎与直觉模仿。为了解决这一问题,作者提出了Apple-π,一个将物理推理分解为三个可审计阶段的基准:物理量的感知、主导定律的公式化以及定律一致动态的演绎。通过使用一个精心构建的经典力学场景数据集和一套混合评估指标,该基准表明当前视频模型具备有用的物理先验,但远未达到可靠的基于定律的世界模拟,特别是在需要组合性和真实世界迁移时。
数据集
作者引入了Orchard,一个用于物理推理评估的精心构建的视频数据集,采用定律优先的设计:每个案例都围绕显式的经典力学定律、指定的物理条件以及定律预测的运动构建。该数据集包含400个案例,来自三个来源。
- 模拟视频(243个案例) – 使用NVIDIA Isaac Sim生成,提供精确的物理参数和像素级精确的轨迹。这些作为评估套件的客观锚点。
- 自行录制的真实世界视频(121个案例) – 在受控实验室条件下拍摄,近似隔离主导定律,同时引入真实的光学和材质线索。
- 来自互联网的真实世界视频(36个案例) – 选自物理教育YouTube频道,以拓宽前两个来源之外的视觉多样性。
在所有来源中,物体词汇统一为四种基本立体形状:球体、立方体、圆柱体和圆锥体。这样将物体身份约束为一个干扰变量,确保定义良好的中心点、掩码、接触面和尺寸参数,并使物理状态能够一致地被标注。此设计减少了对物体特定语义先验的依赖,将焦点保持在基于定律的运动推理上。
Orchard遵循两级任务分类:
- 单一定律分支 – 任务按三个支柱组织:(i)万有引力定律(自由落体、抛体运动、斜面运动、重力驱动轨道上的圆周运动);(ii)动量守恒(由恢复系数参数化的弹性碰撞、完全非弹性碰撞和非弹性碰撞);(iii)牛顿第一定律(静止物体、匀速直线运动)。
- 多重定律分支 – 将跨支柱的任务组合起来(例如,斜面连接抛体运动,或圆周运动后接碰撞),以测试组合泛化能力。
该数据集用于分阶段评估,而非训练。作者利用单一定律案例进行受控诊断,利用多重定律案例评估组合推理能力。未描述训练集划分、混合比例或裁剪策略;数据作为一个固定的基准准备,包含一致的物理状态标注和元数据,包括物体几何形状、物理参数(在可用时)和运动轨迹。
方法
作者提出了Apple-π,一个诊断框架,旨在评估视频模型能否从表面上的物理合理性迈向基于定律的物理智能。Apple-π并不提出新的模型架构,而是作为一个结构化的评估协议运行,围绕三个紧密耦合的组件构建:一个物理指定场景的精心构建数据集、一个多阶段推理基准和一个混合评估套件。这些组件共同探测模型通过显式感知、数学公式化和逻辑演绎进行物理推理的能力。
第一个组件是Orchard,一个由定律推导出的、物理指定的场景数据集。每个场景都从显式物理定律构建,确保视频序列中的每一次交互都由明确定义的力学支配,而非启发式的外观。该设计迫使模型依赖于底层的物理原理,而非肤浅的视觉线索。数据集为基准提供了原始素材,提供了需要精确推理的多样化运动和碰撞事件。
第二个组件是一个基准协议,将推理任务结构化为三个有序阶段:感知、公式化和演绎。在感知阶段,模型必须从视觉输入中提取相关的物理量(如物体位置、速度、质量)。公式化阶段则要求将这些观察转化为相应的主导方程或物理定律。最后,演绎阶段要求模型应用这些定律来预测未来状态、回答反事实查询或解释观察到的结果。这一流程超越了简单的结果预测,测试模型能否产生一个连贯的、有原则的推理链,反映物理学家解决问题的方式。
第三个组件是一个评估套件,结合了两种互补的评分机制。主观指标利用基于MLLM的评判者来评估开放式推理轨迹的流畅性、连贯性和逻辑合理性。同时,客观指标直接基于定义每个场景的物理定律,从而能够进行精确的、基于规则的准确性验证。通过诊断模型在哪些地方失败——无论是在感知基础、定律公式化还是演绎推理方面——该套件提供了对视频基础物理推理的鲁棒性和局限性的细粒度洞察。
实验
Apple-π在一个三阶段物理推理基准上评估了视频生成模型和统一的理解-生成模型,结果表明强大的视频合成能力本身并不意味着基于定律的物理智能;在生成前具有显式理解能力的统一模型显著优于视频模型,但时间推理仍然是所有架构的核心瓶颈。该基准揭示了一个渐进的推理漏斗,感知和公式化的成功并不能可靠地转化为定律一致的动态,模型在跨定律转换以及从模拟到真实世界视觉的泛化方面存在困难。消融实验证实,信息图输入格式并非限制因素,协议主要标准化了输出格式,而定性失败表明复制标注并不等同于绑定物理意义。
现有的物理智能基准要么评估理解,要么评估生成,但没有一个将显式的物理定律基础与多阶段诊断推理和链式帧评估相结合。虽然少数基准部分支持基于定律的或客观的度量,但它们都缺乏将推理过程分解为感知、公式化和演绎阶段的可审计性。所有列出的理解基准(PhysBench、QuantiPhy、PhyX)和生成基准(VideoPhy-2、PhyWorldBench)均不支持多阶段评估或链式帧推理。只有QuantiPhy提供了客观的物理度量,并且仅对基于定律的评估提供了部分支持,限于运动学。像VideoPhy-2和PhyWorldBench这样的视频生成基准评估物理合理性,但不验证模型是否在内部分基于物理定律产生输出,使得推理过程不透明。
视频生成模型在Apple-π上仅达到中等性能,最佳视频模型平均得分为0.473,而统一的图像生成模型达到约0.70,表明显式的理解模块改善了物理推理。从感知到公式化,尤其是演绎,得分急剧下降,表明模型能够感知物理线索,但难以将其转化为以定律为条件的时间动态。多重定律和真实世界案例仍然困难得多,暴露出组合状态迁移和视觉泛化方面的弱点。像GPT Image 2和Nano Banana 2这样的统一模型在感知和公式化阶段显著优于所有视频模型,但即使它们的演绎得分也仍在0.40左右,使得时间推理瓶颈未得到解决。视频模型读取标注文本的能力远强于将物理量与物体区域建立联系,并且它们在多重定律场景上的得分始终较低,因为模型无法在定律转换中传递物理状态。
消融实验中,改变物理量呈现方式,将信息图标注切换为结构化文本提示对性能的影响可忽略不计,所有轨道的得分变化保持在±0.05以内。使用省略详细输出规格的简洁提示会略微降低总体得分,主要集中在图形输出轨道上,但它持续提高了公式文本选择,表明完整提示主要标准化了视觉答案格式,而非传达物理解决方案。通过结构化文本提示指定物理量几乎产生中性的配对差异,所有可用的轨道级变化都局限在±0.05的窄幅内,证实信息图标注的读取并非性能瓶颈。简洁提示降低了平均得分,下降集中在图形输出轨道(P-G和F-G),而公式文本轨道(F-T)在两个模型上均提高了+0.051,表明提示细节主要强制了视觉输出约束,而非辅助物理推理。
本文介绍了Apple-π,一个在感知、公式化和演绎阶段评估物理推理并具有显式定律基础的基准。具备理解模块的统一图像生成模型优于视频生成模型,然而所有模型从感知到演绎的得分均急剧下降,揭示了时间推理的瓶颈。多重定律和真实世界案例因组合状态迁移的失败而尤为困难。消融实验表明,信息图标注并非性能瓶颈,而精心设计的提示主要强制了视觉输出格式,而非提升物理推理能力。