HyperAIHyperAI

Command Palette

Search for a command to run...

VideoCoCo:基于可执行代码思维链的智能体双引擎物理一致性视频生成系统

摘要

文本到视频模型已取得卓越的视觉质量,但在生成物理一致的动态场景方面仍面临挑战,因为场景的时间演化必须从高度压缩的文本提示中隐式推断。现有的思维链方法引入了中间规划或视觉状态,但这些表示通常不可执行或时间上过于稀疏,限制了它们实例化和控制完整时空过程的能力。为解决这一局限,我们提出 VideoCoCo,一个智能体双引擎框架,其中可执行的 Blender 代码充当过程级思维链。给定文本提示,编码智能体合成一个 Blender 程序,显式指定场景及其时间演化。可执行仿真引擎运行该程序,生成确定性的时空草稿,随后由生成式视频引擎通过草稿条件编辑将其转换为逼真视频。这种分解将过程级推理与高保真视觉实现分离开来。为使视频编辑器适应仿真草稿,我们构建了 VideoCoCo-3K,一个精心整理的草稿-指令-目标三元组数据集。VideoCoCo 将 OmniWeaving 基线在 PhyGenBench 上的得分从 0.475 提升至 0.558,在 VBench-2.0 上从 52.18 提升至 77.88,在两个基准上均取得了最佳平均分数。这些结果表明,可执行代码为物理一致的视频生成提供了一种有效、可控且可检查的中间表示。

一句话总结

来自香港中文大学、中国科学技术大学、华南理工大学等机构的研究人员提出了 VideoCoCo,一个 agent 双引擎框架,其中代码生成 agent 生成可执行的 Blender 代码作为思维链,仿真场景物理并生成确定性的时空草稿,再由生成引擎细化为真实感视频,在 PhyGenBench 和 VBench-2.0 上实现了最先进的物理一致生成。

核心贡献

  • VideoCoCo 是一个双引擎框架,利用可执行 Blender 代码作为过程级思维链,生成确定性的时空草稿,随后由生成编辑器细化为真实感视频,从而将物理推理与视觉保真度解耦。
  • 精心构建的数据集 VideoCoCo-3K 由草稿 - 指令 - 目标三元组组成,用于使视频编辑器适应仿真草稿。
  • 在 PhyGenBench 和 VBench-2.0 上,VideoCoCo 将 OmniWeaving 基准分数分别从 0.475 提升至 0.558、从 52.18 提升至 77.88,取得最高平均分,表明可执行代码是物理一致视频生成的有效中间表示。

引言

文本到视频生成是通向 AGI 世界建模的有前景的途径,但它面临一个根本性的不匹配:高度压缩的文本提示未能指定底层的物理动力学,作者将这一问题称为因果不透明性(Causal Opacity)。先前用于视频的思维链方法使用描述性或选择性的中间表示(文本计划、关键帧或学习的奖励信号),这些中间表示并未实例化一个完整、可执行的时空过程。作者引入 VideoCoCo,一个 agent 双引擎框架,通过将可执行 Blender 代码视为过程级思维链来弥补这一缺口。代码生成 agent 合成一个程序,显式模拟场景的演变并生成确定性的草稿视频;随后,生成视频引擎基于该草稿生成真实感视频。为训练该引擎,作者构建了 VideoCoCo-3K,一个由草稿 - 指令 - 目标三元组组成的数据集,将仿真草稿与真实视觉对齐。该设计将物理推理与视觉合成解耦,在 PhyGenBench 和 VBench-2.0 等基准上显著提升了物理一致性。

数据集

作者构建了 VideoCoCo-3K,一个包含 3000 个三元组的合成数据集,旨在学习基于草稿条件的视频编辑。每个三元组包含三个对齐的组件:

  • 草稿 – 对采样到的提示运行可执行仿真引擎后渲染得到的白色黏土视频。
  • 指令 – 由指令 agent 为该草稿撰写的自然语言编辑指令。
  • 目标 – 通过将草稿和指令输入教师编辑器(Seedance 2.0)生成的真实感视频。选用该教师编辑器是因为它能在生成真实感帧的同时保留草稿的运动。

构建流程。 从源分布收集提示开始,仿真引擎和指令 agent 生成草稿 - 指令对。然后教师编辑器生成相应的真实感目标,由此得到一个监督三元组,将基于物理的运动与其真实视觉实现联系起来。评估基准中使用的所有提示以及近似重复项均被排除。数据集保留原始提示和 Blender 程序作为元数据,以供检查和重新生成。

在模型中的用法。 VideoCoCo-3K 通过提供草稿 - 指令 - 目标监督来适配基于草稿条件的编辑引擎 GθG_{\theta}Gθ,这种监督是公开视频编辑数据集所缺乏的。全部 3000 个三元组用作训练数据;未提及进一步的数据划分或混合比例。

方法

作者将 Code-as-CoT 理念具体化为 VideoCoCo,一个 agent 双引擎框架,将过程级推理与视觉实现分离。如框架图所示,两个引擎承担互补角色,将忠实的动力学与真实感外观解耦。

第一个组件是可执行仿真引擎。文本提示将物理事件压缩为几个单词,迫使文本转视频模型仅从语言中重建整个时空过程。作者没有让视频模型隐式承担这一负担,而是让代码生成 agent AcodeA_{\mathrm{code}}Acode 合成一个自包含的 Blender Python 程序 c=Acode(p)c = A_{\mathrm{code}}(p)c=Acode(p),该程序指定场景、物体、物理属性和时间演化。该代码在隔离的 Blender 环境 B\mathcal{B}B 中执行,得到渲染草稿 d=B(c)d = \mathcal{B}(c)d=B(c)。沙箱提供标准基元并强制确定性行为。生成的草稿是一个低保真度的白色黏土仿真,在时间维度上密集,确定了发生何事与何时发生,而视觉外观留给下一个引擎处理。

第二个组件是生成视频引擎,将已实例化的过程转化为真实感视频。由于原始提示和渲染草稿以不同粒度描述目标,直接将提示传递给视频编辑器会导致外观信息不足。为解决这一问题,指令 agent AeditA_{\mathrm{edit}}Aedit 读取两种信号,撰写以外观为重点的编辑指令 e=Aedit(p,d)e = A_{\mathrm{edit}}(p, d)e=Aedit(p,d)。该指令描述目标主体、材质、光照和电影风格,而不重新定义运动。然后,这两个条件共同输入到基于草稿条件的视频编辑器 GθG_{\theta}Gθ 中,生成最终视频 v^=Gθ(d,e)\hat{v} = G_{\theta}(d, e)v^=Gθ(d,e)。草稿锚定时空结构,指令指定真实感外观。

为使编辑器 GθG_{\theta}Gθ 能够接受仿真草稿,作者构建了 VideoCoCo-3K,一个由草稿、指令和目标组成的三元组数据集。对每个提示 pip_ipi,可执行仿真引擎生成草稿 did_idi,指令 agent 撰写编辑指令 eie_iei。高保真教师编辑器 GTG_{\mathrm{T}}GT 生成真实感目标 yi=GT(di,ei)y_i = G_{\mathrm{T}}(d_i, e_i)yi=GT(di,ei),从而得到数据集 DVideoCoCo3K={(di,ei,yi)}i=13000\mathcal{D}_{\mathrm{VideoCoCo-3K}} = \{(d_i, e_i, y_i)\}_{i=1}^{3000}DVideoCoCo3K={(di,ei,yi)}i=13000

编辑器在这些三元组上使用标准的条件去噪目标进行适配。令 z0z_0z0 表示目标 yyy 的潜在表示,ztz_tzt 为其在扩散时间步 ttt 的加噪版本。训练损失定义为:

L(θ)=E(d,e,y),t,ϵ[ϵϵθ(zt,t,d,e)22]\mathcal{L}(\theta) = \mathbb{E}_{(d, e, y), t, \epsilon} \left[ \| \epsilon - \epsilon_{\theta}(z_t, t, d, e) \|_2^2 \right]L(θ)=E(d,e,y),t,ϵ[ϵϵθ(zt,t,d,e)22]

其中 ϵN(0,I)\epsilon \sim \mathcal{N}(0, I)ϵN(0,I)。作者从一个基础生成器初始化 GθG_{\theta}Gθ,并应用参数高效的 LoRA 适配,以学习从草稿到真实感的映射,同时保留强大的视觉先验。

在推理时,VideoCoCo 仅从文本提示端到端运行。代码生成 agent 合成 Blender 程序,沙箱渲染确定性草稿,指令 agent 撰写编辑指令,适配后的编辑器生成最终视频。整个过程无需真实草稿或人工标注,实现全自动、可检查且可复现。

实验

评估使用两个以物理为核心的基准 PhyGenBench 和 VBench-2.0,将 VideoCoCo 与闭源及开源生成器进行比较。实验表明,生成基于代码的可执行草稿并用视频编辑器对其进行细化,能够提升物理一致性,在纯外观驱动模型表现最差的类别中提升幅度最大。消融实验确认,仿真草稿提供了基本的物理动力学,而编辑器的轻量级 LoRA 微调在不覆盖这些动力学的前提下提升了真实感,优于全量微调。

将 VideoCoCo 添加到 OmniWeaving 视频生成器中,显著提升了力学、光学、热学和材料动力学方面的物理一致性和可信度。最大的提升出现在材料和热学类别中——这些正是外观驱动模型最难以处理的领域,证实可执行草稿提供了真正的物理动力学,而非仅仅是表面真实感。组合系统在 PhyGenBench 和 VBench-2.0 上均取得了最高或接近最高的总体分数,优于强大的开源和闭源基线。VideoCoCo 将 OmniWeaving 在 PhyGenBench 上的平均一致性分数提升至总体最佳,领先于最强的开源基线,其中材料与热学动力学的提升最大。在 VBench-2.0 上,VideoCoCo 大幅提升了基础模型的平均可信度,取得最高的力学和热学分数,并在材料方面排名第二。

即使不对编辑器进行微调,使用可执行草稿也能提升基础生成器的物理可信度,尤其是在热学和材料类别中。添加编辑器适配带来进一步的互补增益,其中 LoRA 微调取得了最高的总体平均分和最佳力学分数,同时更新的参数量远少于全量微调。这证实草稿提供了物理动力学,轻量适配器足以在不过拟合的情况下改善外观。无微调变体将平均分从 0.48 提升至 0.51,主要得益于热学(0.43→0.48)和材料(0.39→0.51)的显著改进。LoRA 微调获得最高平均分(0.56)和最佳力学分数(0.56),在这两项指标上均优于全量微调,且参数量更少。全量微调将光学分数提升至 0.61,并与 LoRA 在光学上持平,但 LoRA 的材料分数更高(0.53 vs 0.49),总体平均分也更好。无微调的增益单独反映了草稿对物理动力学的贡献;随后的编辑器微调,尤其是 LoRA,在外观方面提供了补充改进。

将 VideoCoCo 的可执行物理草稿集成到视频生成器中,显著提升了物理一致性,在材料与热学动力学上提升最大,而这些领域正是外观驱动模型最薄弱的环节。即使在无微调的情况下,单靠草稿也能提升可信度,而添加轻量级 LoRA 适配器则提供互补的外观改进,从而在 PhyGenBench 和 VBench-2.0 上取得最高的总体分数,优于强大的基线方法和全量微调。这些结果表明,草稿提供了超越表面真实的真正物理动力学,且高效的适配器足以弥合剩余的外观差距。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供