Command Palette
Search for a command to run...
Code-as-World:面向物理推理的可执行世界表征的智能体式发现
Code-as-World:面向物理推理的可执行世界表征的智能体式发现
摘要
物理理解与推理依赖于形成紧凑且可泛化的世界表征。尽管现代视觉-语言模型能够识别和解释多样的物理事件,但它们往往缺乏对底层机制的显式表征——例如物体状态、物理参数和支配性动力学——而这些机制对于可靠地推理世界如何演化以及如何响应干预是必需的。在本工作中,我们提出了 Code-as-World 范式,通过可执行世界表征来表示物理世界。通过将物理构成、动态演化和视觉外观表达为可执行代码,Code-as-World 提供了对物理世界的一种紧凑、定量且可控的抽象。为了从多模态观测(如自然语言描述或真实世界视频)中构建此类表征,我们开发了一个受溯因推理启发的智能体式发现循环,其中智能体提出、执行、渲染、验证并迭代优化可执行世界假设。作为一个具体应用,我们利用经过验证的可执行世界为视觉-语言模型提供可扩展的物理监督,用于定量物理推理训练。实验表明,Code-as-World-VL 在 QuantiPhy 上取得了最先进的性能,并超越了领先的专有模型,凸显了可执行世界表征作为物理智能可扩展基础的潜力。
一句话总结
来自 MirroS、清华大学、北京大学和南洋理工大学的研究者提出了 Code-as-World,一种将物理组成、动态演化和视觉外观编码为代码的可执行世界表示,并使用一个基于溯因的 agentic 发现循环,从多模态观测中提出、执行、渲染、验证并细化世界假设;利用经过验证的世界作为可扩展的物理监督,Code-as-World-VL 在 QuantiPhy 上取得了当前最优性能,并超越了领先的闭源模型。
核心贡献
- 论文提出了 Code-as-World,这是一种将物理世界表示为可执行代码的范式,代码编码了物理组成、动态演化和视觉外观,从而提供一种紧凑、具有定量依据且可控的抽象。
- 论文开发了一个受溯因推理启发的 agentic 发现循环,该循环通过提出、执行、渲染、验证和细化可执行世界假设,从自然语言描述或真实世界视频等多模态观测中构建可执行世界假设。
- 论文证明,经过验证的可执行世界能够为训练视觉语言模型生成可扩展的物理监督,Code-as-World-VL 在 QuantiPhy 上取得了当前最优性能,并超越了领先的闭源模型。
引言
理解物理场景不仅需要识别或描述事件,还需要恢复能够解释并预测行为的物体状态、物理参数和机制。此前的表示具有互补的局限:像素级视频模型预测视觉上合理的未来,却没有解耦底层原因;3D 重建保留几何结构,但不保留因果物理行为;自然语言抽象了语义,但难以表达连续的定量状态。作者提出了 Code-as-World,将任务相关的物理世界表示为覆盖物理组成、动态演化和视觉外观的可执行代码。作者还将世界获取形式化为一个 agentic 发现循环,该循环提出、实例化、执行、渲染并对照多模态证据验证可执行假设。这些经过验证的可执行世界随后为视觉语言模型提供可扩展的物理监督,从而改进从单目视频进行的定量物理推理。
数据集
作者从文本和视频输入构建监督,并基于现有视觉标注构建了一个像素级测量数据集。
来源与组成
- 文本输入被转换为结构化语义证据:显式实体、空间关系、物理事件和预期结果。
- 视频输入被转换为视觉证据:深度图、实例掩码和物体轨迹。分割出的物体还使用 3D 物体生成模型提升为网格。
- 像素级数据集 Dpix 来源于现有视觉数据集,将边界框、掩码和物体轨迹转换为定量 QA 对。
- 这些 QA 对覆盖物体范围、位置、位移、速度和加速度,且不需要世界空间标定。
- 摘录未报告确切的数据集规模或底层视觉数据集的名称。
处理与证据构建
- 对于文本驱动的世界构建,由于文本描述很少完整指定几何、物理参数或相机配置,作者将物理先验与默认条件结合,以初始化可执行世界假设。对于下游的仿真到真实迁移,视频生成模型在保持物理轨迹的同时丰富物体、材质、背景和光照。
- 对于视频驱动的抽象,深度图约束空间结构和相对距离,掩码识别物体边界和几何范围,轨迹捕捉时间对应关系和图像平面运动。网格结合深度和跟踪证据,用于恢复物体位置、尺度和动态状态。
- 对于图像空间测量,给定以间隔 Δt 采样的轨迹 {ct}t=1T,位移、速度和加速度按如下计算:
- d=ct2−ct1
- vt=2Δtct+1−ct−1
- at=Δt2ct+1−2ct+ct−1
- 物体范围和位置直接从边界框或掩码读取,而运动量由物体轨迹导出。
数据使用方式
- 像素级数据集 Dpix 用于监督微调,损失为:
- 该阶段训练模型定位、测量和跟踪物体,为后续世界空间物理推理提供视觉基础。
- 文本和视频证据约束可执行世界表示空间。候选世界推演结果被投影回输入视图,并通过检查与观测几何、深度、掩码和轨迹的一致性进行细化。
方法
方法
作者提出了 Code-as-World,一种通过可执行代码而非静态像素级描述来表示物理世界的范式。在该表述中,代码作为一种结构化且组合式的抽象:实体、关系、物理参数和事件被表示为对状态的操作,而偶然的视觉细节被抽象掉。该表示将物理过程的底层结构化状态与用于观察它的连续外观分离。结构化状态支持组合、编辑和显式约束,而外观组件保留视觉细节和不确定性。执行并渲染代码可以产生与所表示世界一致的观测,其中物理等价优先于像素级复制。
该想法的一种具体实现是可执行世界表示(EWR),并与物理仿真引擎的程序化接口耦合。EWR 定义为
p=(C,E,A)∈Pexec,其中三个组件共同指定了一个世界包含什么、如何演化以及如何呈现。物理组成 C 描述物体、其几何、度量尺寸以及质量、摩擦和重力等物理属性。地板、桌子和墙壁等静态环境结构也被视为能够参与支撑、接触和碰撞的物理实体。动态演化 E 编码初始状态、时间变化、关键事件和仿真时长,使组成能够展开为完整的状态轨迹。视觉外观 A 捕捉相机参数、背景、材质、光照、帧率、分辨率以及渲染或视频生成设置。该组件控制呈现,而不改变物理过程。由于 EWR 是可执行的,各组件可以被独立检查、修改和重新运行,从而允许改变一个物体、一个物理参数、一个动态条件或一个相机设置,同时保留世界其余部分。
从部分且异构的观测中恢复这样一个可执行世界的问题,被形式化为一个 agentic 发现过程,而不是直接预测任务。给定文本描述或真实视频等多模态输入证据,发现 agent 构建模态特定约束,并迭代搜索与证据一致的 EWR。共享流程是提出-实例化-执行-渲染-验证循环。所得 EWR 将底层物理机制外化为可查询、可修改的接口,供下游仿真、验证和数据生成使用。
证据构建因模态而异。对于文本输入,证据适配器提取显式实体、空间关系、物理事件和预期结果,并将其组织为结构化语义证据。由于文本很少完全决定几何、物理或相机设置,agent 将物理先验与合理默认值结合以初始化可执行假设,然后通过仿真和语义验证进行细化。对于下游应用,所得可执行世界可以传递给视频生成模型进行仿真到真实迁移,该模型在保留底层物理轨迹的同时丰富物体、材质、背景和光照。对于视频输入,适配器提取深度图、实例掩码和物体轨迹。深度约束空间结构和相对距离,掩码识别物体边界,轨迹捕捉时间对应关系和图像平面运动。分割出的物体通过 3D 物体生成模型转换为网格,这些网格结合深度和跟踪证据来恢复空间位置、尺度和动态状态。候选推演结果被投影回输入视图,并通过将其几何、深度、掩码和轨迹与观测进行比较来细化。
在发现循环中,agent 根据当前证据、现有假设和来自上一轮迭代的结构化反馈提出或更新 EWR。EWR 被实例化为仿真器就绪参数 θ,仿真器执行这些参数以产生状态轨迹 τ,记录物体状态、接触、碰撞和事件结果。该轨迹随后被渲染为预测观测;对于视频输入,仿真状态还被投影为深度图、实例掩码和图像平面轨迹。验证器在选定的关键帧上将预测与证据进行比较。对于文本输入,验证主要评估语义和物理约束;对于视频输入,验证联合比较 RGB 外观、深度、掩码和轨迹。差异被聚合为结构化反馈 Δ,用于指导相关 EWR 组件的局部修正。当当前 EWR 充分且简洁地解释输入,或迭代预算耗尽时,循环终止。
对于定量物理推理,方法使用经过验证的可执行世界来提供真实视频很少提供的物理监督。任务被定义为从单目视频 V 和定量物理问题 q 预测数值答案 y^=fθ(V,q)∈R。世界空间查询提供具有已知世界空间值 ρ 的参考量。给定像素空间目标测量 ypix 和参考测量 ρpix,相对尺度为
γ=ρpixρ,y=γypix.该流程使用两阶段训练过程。首先,在图像空间测量对齐中,现有边界框、掩码和物体轨迹被转换为像素级定量 QA 对,涉及物体范围、位置、位移、速度和加速度。对于以间隔 Δt 采样的轨迹 {ct}t=1T,位移、速度和加速度按如下计算:
d=ct2−ct1,vt=2Δtct+1−ct−1,at=Δt2ct+1−2ct+ct−1.模型在所得像素级数据集 Dpix 上进行监督微调,损失为
Lpix=−E(V,q,y)∼Dpixlogπθ(y∣V,q).该阶段训练模型定位、测量和跟踪物体。
其次,在世界空间物理校准中,方法从经过验证的可执行世界生成精确的世界空间标签。每个 EWR 提供同步的视频和仿真状态轨迹,包含物体几何、相机参数、时间戳和时变状态。agent 采样目标物体、时间戳、物理量和输出单位,可选地提供参考量作为尺度先验。物体尺寸从场景几何读取,位移、速度和加速度从状态轨迹计算。保留的实例形成世界级训练数据。文本驱动和视频驱动的可执行世界使用相同格式,产生 Dtext 和 Dvideo,它们被合并为统一的世界级训练数据。模型在这些样本上通过组相对策略优化(GRPO)进行优化。奖励将尺度归一化的数值准确性与单位正确性和响应格式的辅助奖励相结合:
rnum=exp(−∣y∣+ϵ∣y^−y∣),r=rnum+λurunit+λfrfmt.文本驱动的世界提供完全可观测的仿真器状态和数值精确的监督,而视频驱动的世界更匹配真实外观和运动分布。因此,联合训练将精确的物理监督与对真实视频的视觉泛化相结合。
实验
实验评估了 Code-as-World 从文本和视频输入构建可执行世界表示的能力,使用经过滤的视频观测和一个 agentic 发现循环,该循环根据独立的视觉和运动指标迭代细化世界。定性结果表明,恢复出的世界可作为可编辑程序,支持反事实物理编辑和相机变更,且 agentic 循环相比一次性生成和 Best-of-5 采样改善了重建。研究进一步训练了用于定量物理推理的 Code-as-World-VL 模型,发现世界空间监督保持了图像空间测量能力,并在 QuantiPhy 上取得强性能,从 4B 扩展到 9B,并进一步通过 27B 推理模型改进,不过评估仍限于单目尺度标定,且发现过程本身并未被内化。
在 QuantiPhy-validation 上,Code-as-World-VL 模型改进了从单目视频估计物体尺寸、位移、速度和加速度的定量物理推理。4B 直接回答变体优于更大的开放权重基线,并与领先闭源系统具有竞争力;9B 直接回答变体在直接回答模型中取得了最佳平均值。启用推理的 27B 变体进一步超过了直接回答 9B 和最强的闭源基线,平均 MRA 在三个 Code-as-World-VL 规模上逐步提升。Code-as-World-VL-9B 在 2S、2D、3S 和 3D 子集上的直接回答变体中取得了最佳平均性能。启用推理的 Code-as-World-VL-27B 超过了直接回答 9B 变体和最强的闭源基线。
在 QuantiPhy-validation 上的实验评估了从单目视频估计物体尺寸、位移、速度和加速度的定量物理推理。直接回答的 Code-as-World-VL 模型相比更大的开放权重基线有所提升,并与领先闭源系统具有竞争力,9B 变体在 2S、2D、3S 和 3D 子集上取得了最佳平均直接回答性能。启用推理的 27B 变体进一步超过了直接回答 9B 模型和最强的闭源基线,表明模型规模扩展和加入推理都能增强定量物理理解。