HyperAIHyperAI

Command Palette

Search for a command to run...

12 小时前
3D 生成
3D 模型

WorldClaw:面向大规模智能体式三维开放世界生成

Chunchao Guo Yang Li Jinpeng Li Zilong Huang

摘要

从开放式文本生成大规模、可自由探索的三维世界仍具挑战,因为系统必须同时保持全局空间一致性、丰富的局部内容以及便于下游编辑和复用的显式资产。我们提出 WorldClaw,一个完全由智能体驱动、从粗到细的开放世界三维场景生成框架。规划智能体将文本提示转化为包含区域、地形、资产、材质和空间关系的结构化规格。随后,WorldClaw 基于语义布局、可复用资产、生成式或程序化材质以及区域感知的高度场,构建全局一致的地形基础。对于细节要求高的区域,它生成地形条件下的组合,重建可编辑的带纹理网格,并恢复其在地形上的放置位置;基于渲染的智能体进一步优化地形、物体、外观和接触关系。在多样的开放世界提示下,WorldClaw 能够生成具有一致空间组织、视觉上引人注目的局部内容以及可编辑实例级资产的大规模场景,同时保持一致的全局地形结构。

一句话总结

腾讯混元提出 WorldClaw,一个完全基于 agent 的、由粗到细的大规模开放世界 3D 生成框架,利用规划 agent 将文本转换为结构化的区域和资产规格,使用区域感知高度场构建全局连贯的地形基础,并应用基于渲染的细化来生成可编辑的实例级资产和视觉引人注目的局部内容。

核心贡献

  • WorldClaw 是一个完全基于 agent 的、由粗到细的框架,使用规划 agent 将文本提示转化为开放世界 3D 场景生成所需的结构化区域、地形、资产和材质规格。
  • 它从语义布局和区域感知高度场构建全局连贯的地形基础,生成地形条件下的构图以及可编辑的带纹理网格,并使用基于渲染的 agent 来细化接触关系和外观。
  • 该框架将地形材质构建为可执行的 Blender 材质节点图和着色器脚本,在保持显式参数化和可编辑的同时,实现了视觉上引人注目的结果。

引言

从开放式文本生成可自由探索的 3D 世界,对视频游戏、虚拟现实、具身模拟和电影至关重要,这些场景需要为可步行、持久的环境保持连贯的几何、外观和语义。以往的工作涵盖程序化生成(受限于刚性的规则和内容多样性)、图像或视频提升方法(通常产生几何不一致、计算量大的结果)、原生 3D 扩散(受限于稀缺的大规模场景数据集)和多模态 LLM agent(缺乏精确的 3D 空间控制)。作者通过引入 WorldClaw 来解决这些差距,这是一个由粗到细的 agent 框架,首先建立全局语义地形基础,然后有选择地填充生成式 3D 对象的区域,最后应用基于渲染的 agent 细化来提高质量、规模和对象与地形的接触,从单一提示生成可编辑、全局连贯的 3D 世界。

方法

给定一个开放式用户提示 qqq,WorldClaw 旨在构建一个显式的 3D 世界 S\mathcal{S}S,其全局组织、地形几何、表面外观和对象组成与用户意图一致。作者不采用单次合成整个世界的方式,而是采用由粗到细、从全局到区域的构建策略。构建过程包含三个顺序阶段:

P=Fplan(q),T=Fterrain(P),O=Fregion(P,T),\mathcal{P} = F_{\mathrm{plan}}(q), \qquad \mathcal{T} = F_{\mathrm{terrain}}(\mathcal{P}), \qquad \mathcal{O} = F_{\mathrm{region}}(\mathcal{P}, \mathcal{T}),P=Fplan(q),T=Fterrain(P),O=Fregion(P,T),

其中 P\mathcal{P}P 表示结构化的场景规格,T\mathcal{T}T 表示全局地形表示,O\mathcal{O}O 表示生成并布置的区域对象实例集合。最终世界由 S=Compose(T,O)\mathcal{S} = \mathrm{Compose}(\mathcal{T}, \mathcal{O})S=Compose(T,O) 组合而成。

意图分析和规划阶段将开放式用户提示转换为结构化的场景规格 P\mathcal{P}P。该模块包含一个意图分析 agent 和一个场景规划 agent。意图分析 agent 提取并规范化提示中的显式约束,包括场景类型、主题、视觉风格、关键区域、对象和空间关系。在这些约束条件下,场景规划 agent 根据预定义模式解决模糊描述并补全未指定的信息。生成的场景计划组织为 P=(R,Cterrain,Cobject)\mathcal{P} = (\mathcal{R}, \mathcal{C}_{\text{terrain}}, \mathcal{C}_{\text{object}})P=(R,Cterrain,Cobject),其中 R\mathcal{R}R 描述主要场景区域及其空间关系,Cterrain\mathcal{C}_{\text{terrain}}Cterrain 描述地形类型和表面外观,Cobject\mathcal{C}_{\text{object}}Cobject 指定对象类别和密度。该规格作为后续模块的共享语义接口。

全局地形生成模块将结构化的场景规格 P\mathcal{P}P 转换为全局地形表示 T\mathcal{T}T。它包含三个子阶段:地形规划、地形资产生成和地形生成与细化。地形规划 agent 将地形相关约束转换为结构化的地形规格 Pterrain=(playout,passet,pmaterial,θterrain)\mathcal{P}_{\mathrm{terrain}} = (\mathbf{p}_{\mathrm{layout}}, \mathbf{p}_{\mathrm{asset}}, \mathbf{p}_{\mathrm{material}}, \boldsymbol{\theta}_{\mathrm{terrain}})Pterrain=(playout,passet,pmaterial,θterrain),详细说明区域类别、资产密度、表面类型以及世界尺度和噪声频率等数值参数。当文本约束不足时,agent 会生成场景概念图像 Iconcept\mathbf{I}_{\mathrm{concept}}Iconcept 作为视觉条件。

地形资产生成 agent 接收 Pterrain\mathcal{P}_{\mathrm{terrain}}PterrainIconcept\mathbf{I}_{\mathrm{concept}}Iconcept,生成中间资产包 Aterrain=(Ilayout,Iasset,Oasset,Mterrain)\mathcal{A}_{\mathrm{terrain}} = (\mathbf{I}_{\mathrm{layout}}, \mathcal{I}_{\mathrm{asset}}, \mathcal{O}_{\mathrm{asset}}, \mathcal{M}_{\mathrm{terrain}})Aterrain=(Ilayout,Iasset,Oasset,Mterrain)。这包括编码区域类别的全局语义布局图 Ilayout\mathbf{I}_{\mathrm{layout}}Ilayout、通过图像到 3D 转换生成的可重用 3D 资产原型 Oasset\mathcal{O}_{\mathrm{asset}}Oasset,以及通过生成式纹理合成和程序化材质生成构建的表面材质 Mterrain\mathcal{M}_{\mathrm{terrain}}Mterrain

最后,地形生成 agent 构建全局地形表示 T\mathcal{T}T

初始高度场生成通过解析布局图提取区域掩码并计算复合高度场:

H(x)=rm~r(x)[hr+kwr,kNr,k(x)+jαr,jGr,j(x)],H(\mathbf{x}) = \sum_{r} \widetilde{m}_{r}(\mathbf{x}) \left[ h_{r} + \sum_{k} w_{r,k} N_{r,k}(\mathbf{x}) + \sum_{j} \alpha_{r,j} G_{r,j}(\mathbf{x}) \right],H(x)=rmr(x)[hr+kwr,kNr,k(x)+jαr,jGr,j(x)],

其中 hrh_rhr 为基础高程,Nr,kN_{r,k}Nr,k 表示噪声分量,Gr,jG_{r,j}Gr,j 表示地貌算子。随后,全局地形资产散布根据区域语义和局部表面条件实例化可重用原型。地形细化 agent 随后迭代重新渲染并检查场景,以纠正几何过渡、材质尺度和资产分布。

为了在保持全局地形结构的同时填充选定区域,作者引入了区域对象生成与放置模块。区域规划 agent 联合检查 P\mathcal{P}PT\mathcal{T}T,选择一组要进一步开发的子区域 R+\mathcal{R}^+R+,将场景级约束细化为区域规格 Pregional\mathcal{P}_{\text{regional}}Pregional

对象生成与放置阶段分解为区域构图、对象生成和对象放置。对于每个区域,agent 渲染现有地形以生成地形图像 Irterrain\mathbf{I}_{r}^{\mathrm{terrain}}Irterrain,并在地形渲染和区域规格条件下生成区域构图图像 Ircomp\mathbf{I}_{r}^{\mathrm{comp}}Ircomp。文本引导分割提取出各个 2D 对象实例,随后使用单视图重建将其重建为 3D 网格 MiM_iMi。图像空间尺度校准确保大小一致。对象放置通过求交对象重建相机和区域地形相机的射线来恢复 3D 位置,计算放置变换 TplaceiT_{\text{place}}^iTplacei,使对象与地形表面对齐。

尽管前述阶段提供了独立的对象网格和初始放置,区域场景仍可能存在不一致的尺度、不足的几何质量或对象与地形接触缺陷。作者引入一个场景细化 agent,通过可执行接口连接到 3D 引擎。

该 agent 维护一个任务队列,依次执行对象细化和地形细化。对于对象细化,agent 评估姿态、网格质量和尺度。属性不一致的对象会被纠正,质量不足的重建通过以粗略网格和对象中心图像为条件的 3D 生成器进一步细化,以改善局部表面几何和纹理。对于地形细化,agent 评估地表质量和对象与地形的碰撞。当检测到诸如悬空或过度穿透等缺陷时,agent 在局部支持区域内执行对象-地形联合变形,重新定位对象或局部移动地形以符合对象足迹。此循环持续进行,直到场景通过诊断检查。

实验

该评估在多样的开放世界提示(热带岛屿、峡谷、沙漠战场、雪覆山谷)上测试 WorldClaw,使用基于 Claude Opus 4.8 构建的 agent 架构,并集成了基础模型用于场景构建、细化和渲染。定性结果表明,该方法生成了全局连贯的地形,具有显著的高程变化和区域特定内容,同时保持合理的对象尺度和地形接触,显式表示使地形和对象成为可独立管理的网格。在与 SynCity, Marble, MajutsuCity, WorldGen 和 GPT-5.6 Sol 的对比中,WorldClaw 产生了更具表现力的地形、更丰富且对齐更好的场景元素,以及稳定的自由视点外观和实例级可编辑性,而基线方法表现出较弱的长程组织、有限的内容多样性或在扩展视图下退化的几何。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供