HyperAIHyperAI

Command Palette

Search for a command to run...

StateFlow:面向预可视化的三维世界状态构建、演化与访问

摘要

预可视化是电影、游戏、建筑与城市设计中连接创意与制作的中间层,使创作者能够迭代地完善场景、动作、相机和时空动态。然而,现有生成式方法依赖简单提示,通过一次性图像或视频合成来联合控制所有这些因素,可控性较弱且对迭代编辑的支持有限。从根本上说,一个世界由具备几何、外观及其他属性的多个元素以及相机共同构成。不同帧是通过对该共享状态进行局部修改或重组而产生的,其余部分则被大量复用。因此,我们认为缺失的组件是一个显式且持久的工作状态。为此,我们提出 StateFlow,一个以状态为中心的生成式预可视化框架。StateFlow 并非一次性生成视频,而是利用可编辑的三维世界来组织场景结构、演化过程和相机,同时在需要更高保真度时,借助现成的视频模型增强视觉质量。该世界被维护为一个由场景元素和相机配置构成的持久结构化三维状态,作为预可视化的核心工作表示。基于这一洞见,StateFlow 包含构建、演化和访问世界状态三个阶段。状态构建通过先验引导、冲突感知的双视图初始化,将生成的二维内容提升为一致的三维世界;状态演化则将用户意图转化为结构化的状态转换,同时保留世界记忆,避免每次编辑都重新生成整个场景。状态访问利用渲染反馈反射,将相机规划细化为视觉上可行的轨迹,避免仅依赖视觉语言模型的语义信息。实验表明,StateFlow 能够生成高质量的三维世界,用于视频创作和类游戏原型开发。

一句话总结

来自北京交通大学、Mootion AI 等机构的研究人员提出了 StateFlow,这是一个以状态为中心的预可视化框架,维护显式、持久、可编辑的 3D 世界状态,并通过先验引导的冲突感知双视图初始化、保留世界记忆的结构化状态转移和渲染反馈相机规划三阶段过程进行构建、演化和访问,从而支持面向视频创作和游戏原型设计的迭代式、可控场景编辑。

核心贡献

  • 论文提出了 StateFlow,一个以状态为中心的生成式预可视化框架,维护包含物体几何、位姿、语义和相机的持久、可编辑 3D 世界状态,而不是一次性生成视频。
  • StateFlow 贡献了一个三阶段流程:先验引导的冲突感知双视图初始化从生成的 2D 内容构建一致的 3D 场景;意图引导的状态转移在保留世界记忆的同时演化场景;渲染反馈反思将相机计划转换为视觉上可行的轨迹。
  • 实验表明,StateFlow 能够生成用于视频创作和类游戏原型设计的高质量 3D 世界,并具有一致的空间布局、稳定的场景结构和可编辑的物体级组织。

引言

预可视化是电影制作、游戏开发和建筑设计中的关键规划阶段,创作者会在最终制作前迭代探索场景布局、物体摆放、运动和相机设置,以传达创作意图。现有生成方法大多是一次性的:单个提示词必须同时指定所有场景内容、布局、运动和相机,没有持久状态支持局部编辑或一致的多视角访问,导致时空不一致和身份漂移。虽然 3D 场景装配方法可以构建一致的静态场景,但它们把构建当作终点,并未联合建模预可视化所需的世界演化或反复的相机控制访问。作者提出了 StateFlow,一个以状态为中心的框架,将生成式预可视化重新定义为构建和交互一个可编辑、可演化的 3D 世界状态。该框架使用先验引导的双视图初始化构建场景,使用意图引导的状态转移演化场景,并使用渲染反馈相机规划访问场景,从而支持视频创作和 3D 游戏原型设计等下游应用。

方法

作者提出了 StateFlow,一个以状态为中心的预可视化框架,将过程视为维护持久世界状态,而不是一次性输出生成。他们将预可视化形式化为一个基于状态的过程:系统根据输入条件构建初始世界状态,随时间更新该状态,并在可控访问下产生观测:

W0=Fbuild(C),Wt+1=Fevolve(Wt),yt=Faccess(Wt)\mathcal {W} ^ {0} = \mathcal {F} _ {\text {build}} (\mathcal {C}), \quad \mathcal {W} ^ {t + 1} = \mathcal {F} _ {\text {evolve}} (\mathcal {W} ^ {t}), \quad y ^ {t} = \mathcal {F} _ {\text {access}} (\mathcal {W} ^ {t})W0=Fbuild(C),Wt+1=Fevolve(Wt),yt=Faccess(Wt)

这里,Wt\mathcal {W} ^ {t}Wt 表示 ttt 时刻的世界状态,yty ^ {t}yt 是得到的观测。这种形式化将世界状态、其演化和渲染观测分离,这对需要反复修改同一世界并从不同视角查看的创作者至关重要。

StateFlow 将 Wt\mathcal {W} ^ {t}Wt 实例化为以物体为中心的结构化 3D 状态。在 ttt 时刻,世界表示为:

Wt={oit}i=1Nt,oit=(git,pit,sit)\mathcal {W} ^ {t} = \{o _ {i} ^ {t} \} _ {i = 1} ^ {N _ {t}}, \quad o _ {i} ^ {t} = (g _ {i} ^ {t}, p _ {i} ^ {t}, s _ {i} ^ {t})Wt={oit}i=1Nt,oit=(git,pit,sit)

这里,oito _ {i} ^ {t}oit 表示第 iii 个物体实体,由其几何 gitg _ {i} ^ {t}git、空间放置 pitp _ {i} ^ {t}pit 和语义属性 sits _ {i} ^ {t}sit 表示。基于该表示,框架包含三个阶段:状态构建、状态演化和状态访问。

如下图所示:

状态构建阶段通过估计物体几何和全局空间布局来初始化第一个世界状态 W0\mathcal {W} ^ {0}W0。为了结合互补线索,作者生成一张前视图图像作为物体资产,并生成一张鸟瞰图(BEV)图像用于空间布局。由于这些视图是独立生成的,作者使用视觉语言模型(VLM)通过先验引导的冲突感知双视图初始化过程来协调跨视图冲突。前视图作为外观来源,而 BEV 作为空间来源。为了将 BEV 布局提升为 3D 放置,VLM 为每个物体预测一个落地先验 γi{grounded, floating}\gamma _ {i} \in \{\text{grounded, floating}\}γi{grounded, floating}。给定 BEV 框 r^iBEV\hat {r} _ {i} ^ {\mathrm{BEV}}r^iBEV 和尺寸先验 sˉi\bar {s} _ {i}sˉi,作者使用落地感知提升算子初始化一个 3D 框:

bi(0)=Liftγi(r^iBEV,sˉi)b _ {i} ^ {(0)} = \mathrm{Lift} _ {\gamma_ {i}} (\hat {r} _ {i} ^ {\mathrm{BEV}}, \bar {s} _ {i})bi(0)=Liftγi(r^iBEV,sˉi)

最后,作者通过轻量级推理时目标优化保留的框:

B=argminBLfront+λbLbev+λvLvlm+λpLphys\mathcal {B} ^ {\star} = \arg \min _ {\mathcal {B}} \mathcal {L} _ {\text {front}} + \lambda_ {b} \mathcal {L} _ {\text {bev}} + \lambda_ {v} \mathcal {L} _ {\text {vlm}} + \lambda_ {p} \mathcal {L} _ {\text {phys}}B=argBminLfront+λbLbev+λvLvlm+λpLphys

该优化仅更新框参数,使构建保持轻量且无需训练。优化后的 3D 框与来自 image-to-3D 模型的几何以及语义属性相结合,形成初始世界状态 W0\mathcal {W} ^ {0}W0

状态演化阶段通过意图引导的结构化状态转移,根据用户意图将世界状态更新为 Wt+1\mathcal {W} ^ {t + 1}Wt+1。该方法不依赖视频渲染器幻觉动力学,而是由 VLM 查询结构化状态表,并预测一个紧凑的转移计划 Δt\Delta _ {t}Δt,指定要更新的物体或场景属性。在场景层面,这支持场景扩展和风格变化等全局演化。在物体层面,它对物体状态执行类别感知更新,处理角色姿态更新、刚体运动,或针对复杂形变的事件级资产替换。形式上,下一状态通过将该计划应用于结构化状态表得到:

Δt=PlanVLM(Wt,ut),Wt+1=Apply(Wt,Δt)={oit+1}i=1Nt+1\Delta_ {t} = \mathrm{Plan} _ {\mathrm{VLM}} (\mathcal {W} ^ {t}, u ^ {t}), \quad \mathcal {W} ^ {t + 1} = \mathrm{Apply} (\mathcal {W} ^ {t}, \Delta_ {t}) = \{o _ {i} ^ {t + 1} \} _ {i = 1} ^ {N _ {t + 1}}Δt=PlanVLM(Wt,ut),Wt+1=Apply(Wt,Δt)={oit+1}i=1Nt+1

状态访问阶段确定构建的世界如何用于下游任务,主要通过相机轨迹实现。作者提出了带渲染反馈反思的世界状态相机规划,将 VLM 语义推理与几何证据结合。对于每个片段,VLM 作为语义提议者,从世界状态、渲染观测 VVV 和导演意图 did _ {i}di 生成初始轨迹:

πi0=ProposeVLM(Wt,V,di)\pi_ {i} ^ {0} = \mathrm{Propose} _ {\mathrm{VLM}} (\mathcal {W} ^ {t}, V, d _ {i})πi0=ProposeVLM(Wt,V,di)

然后,作者在 3D 世界中通过低成本渲染执行该提案并评估结果:

Rik=Render(Wt,πik),eik=Eval(Rik,πik,di,Wt)R _ {i} ^ {k} = \mathrm{Render} (\mathcal {W} ^ {t}, \pi_ {i} ^ {k}), \qquad e _ {i} ^ {k} = \mathrm{Eval} (R _ {i} ^ {k}, \pi_ {i} ^ {k}, d _ {i}, \mathcal {W} ^ {t})Rik=Render(Wt,πik),eik=Eval(Rik,πik,di,Wt)

反思将意图不匹配或碰撞风险等差异转换为相机参数上的局部修复候选 Δm\Delta _ {m}Δm。这些修复生成紧凑的候选集,并从中选择最佳轨迹:

Pik={πik+Δm}m=1M,πik+1=argminπPikJ(π;di,Wt,Rik)\mathcal {P} _ {i} ^ {k} = \left\{\pi_ {i} ^ {k} + \Delta_ {m} \right\} _ {m = 1} ^ {M}, \quad \pi_ {i} ^ {k + 1} = \arg \min _ {\pi \in \mathcal {P} _ {i} ^ {k}} J \left(\pi; d _ {i}, \mathcal {W} ^ {t}, R _ {i} ^ {k}\right)Pik={πik+Δm}m=1M,πik+1=argπPikminJ(π;di,Wt,Rik)

这种局部提议与验证循环持续迭代,直到未检测到重大问题,从而为关键帧生成和自由视角探索提供状态访问,同时始终立足于持久的 3D 世界状态。

实验

系统通过与 3D 基线进行场景生成对比、与领先视频生成模型进行视频创建对比,以及基于 MLLM 评估的用户研究进行评估。消融研究进一步验证了鸟瞰图布局落地、冲突解决、结构化状态转移和渲染反馈相机规划的重要性。结果表明,构建持久的 3D 世界状态能够产生更一致的空间布局、更好的物体一致性和更稳定的相机轨迹,使 StateFlow 特别适用于预可视化任务。

所提出的方法获得了最高的平均 VBench 分数,优于所有比较的视频生成方法。它在主体一致性、背景一致性、运动平滑度和闪烁方面处于领先,表明其具有优越的时间稳定性和场景结构保持能力。虽然一些基线在美学和成像质量上得分更高,但这些指标反映的是低级视觉偏好,而该方法在对可控场景生成最关键的结构和时间性维度上表现出色。该方法取得了最佳平均分数(0.8484),并在主体一致性、背景一致性、运动平滑度和闪烁方面表现最佳。Animaker 在美学质量上得分最高(0.6795),但其主体一致性和背景一致性明显低于本方法。Wan2.2 和 Seedance2.0 表现出较强的背景一致性,但仍在该指标和运动平滑度上落后于该方法。成像质量在该方法和顶级基线之间相当,Seedance2.0 和 MovieAgent 仅略微领先。结果突显了一种权衡:与偏好美学或成像分数的基线不同,该方法优先考虑结构和时间一致性,而不是低级视觉吸引力。

StateFlow 获得了最高的 CLIP-I 和 CLIP-T 分数,表明其与提示词具有强视觉和文本对齐。SynCity 在 HPS 和 Q-Align Aesthetics 上领先,但论文指出这些指标可能偏向色彩丰富度和视觉风格。其他基线,特别是 SAM3D,尽管质量分数相对较高,但文本对齐较弱。StateFlow 取得了最佳 CLIP-I 和 CLIP-T,表明与所有基线相比具有更优的图像和文本对齐。SynCity 记录了最高的 HPS 和 Q-Align Aesthetics,这可能是由于这些指标偏好色彩丰富和风格化输出而被抬高。SAM3D 产生了相对较高的 Q-Align 分数,但 CLIP-T 最低,揭示了美学质量与文本对齐之间的差距。

StateFlow 在场景层面的提示词对齐、布局合理性、完整性、几何质量、连贯性、预可视化有用性和整体质量上均优于基线。在视频层面评估中,它也取得了最高的整体分数,并在空间一致性、身份一致性、相机质量和预可视化有用性方面具有明显优势。消融研究表明,BEV 布局落地、冲突解决、结构化状态更新和渲染反馈相机规划都有助于实现连贯、可控和面向制作的结果。StateFlow 在所有评估维度上均取得最佳场景级性能,包括布局合理性、连贯性和整体质量。视频级结果显示,StateFlow 在空间一致性、身份一致性、相机质量和预可视化有用性方面处于领先,而一些基线主要在提示词或故事对齐上保持竞争力。

实验使用自动化指标和人工评估,将所提出的 StateFlow 方法与视频生成基线进行比较。StateFlow 获得了最高的平均 VBench 分数和最佳的 CLIP-I 与 CLIP-T 结果,表明其具有强结构一致性、时间平滑性和视觉文本对齐,而一些基线在美学或成像质量上得分更高,但一致性和对齐较弱。场景级和视频级评估进一步显示,StateFlow 在布局合理性、连贯性、空间和身份一致性、相机质量和预可视化有用性方面处于领先。消融实验证实,BEV 布局落地、冲突解决、结构化状态更新和渲染反馈相机规划各自都对连贯且可控的生成有所贡献。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供