HyperAIHyperAI

Command Palette

Search for a command to run...

4DCodeBench:面向动态场景逆图形的智能体基准测试

Ruihong Shen Žiga Kovačič Peter Kulits Xingrui Wang Zizhang Li Joshua B. Tenenbaum Alan Yuille Jieneng Chen Jiajun Wu

摘要

我们推出了 4DCodeBench,这是一个通过代码生成进行 4D 逆图形研究的基准测试,其中智能体将视频中的动态场景重建为可执行的图形程序。为此,智能体必须将视觉观察转化为场景结构和动力学的紧凑表示,通过实现诸如物理模拟等抽象来复现复杂行为。为了评估这一能力,我们精选了一组真实世界视频,并构建了涵盖多种物理现象(包括变形、流体流动和断裂)的合成场景。我们对前沿模型进行了广泛的基准测试,发现强大的静态重建能力尚不能转化为对复杂动力学的可靠重建。4DCodeBench 提供了一个测试平台,用于追踪智能体通过代码理解世界动力学方面的进展。我们的基准测试可在 github.com/4DCodeBench/4DCodeBench 获取。

一句话总结

马克斯·普朗克智能系统研究所和MIT的研究人员提出4DCodeBench,一个通过代码生成进行4D逆图形学推理的基准,要求agent从视频中重建动态场景为可执行的图形程序,覆盖形变、流体流动和断裂,他们对前沿模型的广泛评测表明,强大的静态重建能力尚未转化为可靠的动态重建,为追踪agent通过代码理解世界动态的进展提供了测试平台。

核心贡献

  • 提出4DCodeBench,一个通过代码生成进行4D逆图形学推理的基准,agent从真实视频和合成场景中重建动态场景为可执行图形程序,覆盖形变、流体流动和断裂等物理现象,在Blender中渲染,同时不依赖特定模拟器。
  • 将重建流程形式化为生成可执行代码,代码随时间暴露几何状态,并用指定的相机、光照和材质进行渲染,要求在执行时不能访问参考视频,从而同时测试静态外观和动态抽象能力。
  • 对前沿模型的广泛评测表明,强大的静态重建能力并不能可靠地迁移到动态重建,揭示了一个持续存在的差距,且自动排名与人类偏好高度一致,为追踪4D逆图形学进展提供了测试平台。

引言

逆图形学通常将预定义模型拟合到视觉观测上,但恢复可执行图形程序将模型指定本身转化为推理问题。动态场景使这一问题更加困难,因为流动、断裂和形变涉及形状与拓扑变化,且材料之间相互作用并影响彼此的运动。此前的基准如3DCodeBench和PhysCodeBench聚焦于静态物体或基于文本的模拟,而VisPhyWorld和MPMWorlds在2D中重建合成视频,BVB处理静态室内场景。这些方法通常假设固定相机运动或简化动力学,导致真实世界交互和3D真值未得到充分关注。

作者引入4DCODEBENCH,通过代码生成来评估4D逆图形学。给定参考视频,agent必须编写可执行代码,构建场景随时间的3D几何结构并在Blender中渲染,实现方式不受限制,允许关键帧动画或模拟动力学。该基准包含100个真实视频和100个带4D真值的合成场景,并分别评估外观、几何和动力学。在18个前沿模型上,作者发现动态重建始终落后于外观和静态几何,即使领先模型采用不同策略(如解析运动或自定义物理模拟)也是如此。

数据集

作者引入4DCOD EBEN CH,一个由200个场景组成的基准数据集,分为100个真实世界视频和100个通过物理模拟构建的合成场景。这种双来源设计具有互补作用:真实视频捕捉真实外观和复杂动力学,但缺少4D真值;合成场景则提供每一帧的完整真值几何和运动,支持在3D和4D空间中直接评估。

数据集组成与来源

  • 真实场景从现有的物理理解、视频生成和机器人数据集中精选,并补充网络来源的素材。
  • 选择标准优先考虑多样化的物理行为、固定相机、有限遮挡以及无剪辑的连续镜头。排除人物、动物和可见手部,以避免重建挑战。
  • 合成场景使用现有物理模拟器构建,并在需要时进行扩展。场景使用程序生成的几何体以及公开网格(如Stanford兔子与犰狳),由作者设计以变化几何、材质、初始条件和渲染设置。

场景本体与统计

  • 场景分为四大类:刚体和铰接体、可变形固体、共维结构(布料、绳索)和流动材料(颗粒、流体)。
  • 每个场景进一步按物体数量、材质组成和动力学模式进行刻画,区分被动动力学与外部驱动运动(如机器人操作)。
  • 83%的场景包含多个动态物体,66%的场景包含多种材质,包括刚体-可变形体、刚体-流体和流体-可变形体耦合等交互。
  • 视频帧率上限为60 fps,真实视频帧数上限为300帧。更高的源帧率会进行时间下采样,较低帧率则保留。

使用与评估

  • 数据集支持五类指标评估:感知、2D动力学和2.5D几何用于对照参考视频,以及3D几何和3D动力学用于合成场景对照参考世界。
  • 视频参考评估使用DINOv3相似度评估感知保真度,使用Dynamic IoU评估运动物体覆盖率,并使用现成模型进行真实视频的光流、轨迹和深度估计。
  • 合成场景支持直接3D评估,包括用于静态表面精度的Chamfer距离,以及用于运动比较的Lagrangian(轨迹DTW)和Eulerian(EMD步)两种视角。
  • 一个视觉语言模型作为裁判,负责四类VQA任务(初始状态、最终状态、关键事件、接触)和成对比较,并通过Bradley-Terry模型聚合为Elo评分。
  • 几何诊断检查开放边界、非流形边和物体穿插等结构缺陷,并与总体得分分开报告。

方法

作者将4D逆图形学框架化为程序合成问题。给定物理场景的参考视频 xref=(x0,…,xT−1)x_{\mathrm{ref}} = (x_0, \ldots, x_{T-1})xref​=(x0​,…,xT−1​),agent必须生成可执行图形代码 Γ=(γ1,…,γm)\Gamma = (\gamma_1, \ldots, \gamma_m)Γ=(γ1​,…,γm​),完整描述场景的3D几何结构及其时间演化。该形式化对单个程序的数量、组织或角色不施加任何约束;唯一要求是执行 Γ\GammaΓ 能在每个被评估的时间步暴露几何状态 sΓ(t)s_\Gamma(t)sΓ​(t),并通过渲染程序 RΓ\mathcal{R}_\GammaRΓ​ 在Blender中渲染该状态:

Γ=A(xref),x^k=RΓ(sΓ(k/r)),k=0,…,T−1,\Gamma = \mathcal{A}(x_{\mathrm{ref}}), \qquad \hat{x}_k = \mathcal{R}_\Gamma\left(s_\Gamma(k/r)\right), \quad k = 0, \ldots, T-1, Γ=A(xref​),x^k​=RΓ​(sΓ​(k/r)),k=0,…,T−1,

其中 A(⋅)\mathcal{A}(\cdot)A(⋅) 表示agent,rrr 是参考帧率。渲染程序使用 Γ\GammaΓ 指定的相机、光照和材质,输出必须匹配参考视频的分辨率、帧数和帧率。重要的是,Γ\GammaΓ 的执行不能进一步访问 xrefx_{\mathrm{ref}}xref​。虽然作者在Blender中渲染,但代码实现不依赖特定模拟器:动力学可以通过关键帧或任何工具(如Taichi或Warp)进行模拟。

为评估该任务,作者构建了一个基准,包含真实世界视频和合成场景,覆盖广泛的物理动力学,包括机器人操作、受控物理演示和日常活动。场景分为四大类:刚体和铰接体、可变形固体、共维结构(如布料和绳索)以及流动材料(如颗粒和流体)。在这些类别中,场景表现出碰撞、形变、流动和断裂。作者进一步按物体数量、材质组成和动力学模式刻画每个场景,区分被动动力学与外部驱动运动,如机器人操作或刚体的指定运动。

对于真实世界部分,视频从现有的物理理解、视频生成和机器人数据集中精选,并补充网络来源素材。选择强调多样化的物理行为,同时尽量减少重复场景,优先固定相机、有限遮挡和无剪辑或无编辑不连续的连续镜头。排除人类和动物,并尽量减少可见手部,因为重建其精细几何和关节结构会引入超出动力学核心的额外挑战。每个片段都经过人工选择和审查,以保证视觉质量和时间连续性。

对于合成部分,作者利用现有物理模拟器,并在需要时扩展其实现以支持额外材质模型。场景通过将程序生成的几何体与公开网格(如Stanford兔子和犰狳)相结合来设计。模拟器的选择与每个场景的目标材质和交互相匹配,用于计算物体随时间变化的几何和运动。场景设计刻意变化几何、材质类型和参数、初始条件以及渲染设置,以创建多样化的重建任务。具有物理模拟经验的作者对每个场景进行数值不稳定性、意外穿插和其他可见模拟伪影的审查。

实验

评估构建了一个包含200个场景的基准,覆盖刚体、可变形体、共维结构和流动材料的真实视频和合成模拟,然后测试18个多模态编码模型从单目视频重建4D世界的能力。一组涵盖感知、几何和动力学的自动指标与人类成对偏好高度一致,验证了其用于模型比较的有效性。结果显示,所有模型在运动方面都比外观方面更加吃力,真实场景和多材质场景难度更高,且推理时计算量的增加稳定地提升模型得分,而不同模型采用不同策略来实现动力学。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供