Command Palette
Search for a command to run...
WorldSculpt:从有根据的视频生成组合式世界
WorldSculpt:从有根据的视频生成组合式世界
摘要
我们研究从包含数百个物体的杂乱场景中生成组合式三维表示的问题。目标是将场景表示为放置在共享世界坐标系中的单个物体网格的集合,这是游戏、增强现实/虚拟现实、仿真和机器人等下游应用所必需的。在物体相互严重遮挡且每个视角仅显示其几何形状一部分的密集杂乱场景中,此任务具有挑战性。基于几何的方法通常将场景重建为单一表示,并在遮挡区域留下不完整的几何形状,而现有的具有生成先验的组合式方法在很大程度上仅限于相对简单的场景。我们表明,通过将强大的单物体三维生成先验适应于多视角观测,可以组合式地生成包含数百个物体的复杂场景。我们以 Pixal3D 实例化这一范式,通过多视角条件路径扩展它,使物体生成基于多个有姿态的观测。尽管该模型完全在规范空间中的单个物体上进行微调,但它无需任何场景级训练即可推广到具有严重遮挡的大规模场景,展示了这一范式的可行性和可扩展性。我们进一步引入了 UE-MeshyScene,一个包含数百个物体、逐物体标注和真实网格的密集杂乱场景的光照逼真基准。在单物体、受控多物体和 UE-MeshyScene 评估中,我们的方法始终优于先前方法,并且随着场景复杂性和遮挡程度的增加,性能提升更大。最后,我们通过将生成的 3DGS 世界(如 Marble 和 HY-World 2.0)转换为组合式网格场景,展示了更广泛的适用性。
一句话总结
Alaya Lab 与东京大学的研究者提出了 WorldSculpt,该方法通过多视角条件路径适配单物体 3D 生成先验 Pixal3D,以组合方式重建包含数百个物体的杂乱场景,且无需任何场景级训练;同时提出了 UE-MeshyScene,一个带有逐物体标注和真实网格的照片级基准,在单物体、受控多物体和密集场景评估中展示了优越的性能与可扩展性。
核心贡献
- 提出 WorldSculpt,一个将单物体 3D 生成先验与多视角条件路径相结合、从带位姿观测生成组合式网格场景的框架,能够在无需场景级训练的情况下对遮挡几何进行合理的补全。
- 提出 UE-MeshyScene,一个照片级密集杂乱场景基准,每个场景包含 93 至 701 个物体,提供逐物体标注和真实网格,弥补了组合式场景生成评估数据的稀缺。
- 在单物体、受控多物体和 UE-MeshyScene 评估中持续优于先前基线,在密集杂乱和严重遮挡条件下提升最为显著,并展示了将现有 3DGS 世界转换为组合式网格场景的适用性。
引言
近期的生成式世界模型可以从单张图像或文本提示合成持久化的 3D 环境,但它们通常生成统一的场景表示,例如融合网格或一组高斯点,而不分离各个物体。这阻碍了游戏、AR/VR、仿真和机器人等下游应用独立选择、移动或重新模拟物体,因为这些应用需要将场景分解为不同的可用资产。先前的工作要么将场景重建为带有不完整遮挡区域的单体几何,要么从单张无位姿图像生成单个物体,缺乏多视角条件和场景坐标基准,而现有的组合式方法仅限于简单、单图像场景。
作者提出了 WorldSculpt,一个以 Pixal3D 为案例研究、适配强物体级生成先验以处理包含数百个密集遮挡物体的复杂场景的框架。他们通过多视角条件路径扩展了该先验,将每个物体的观测映射到锚点对齐的规范坐标系中,并通过置换不变聚合器融合来自多个视角的 DINOv3 特征。冻结的先验通过零初始化投影层和低秩适配器进行适配,在将形状锚定于可见证据的同时实现未观测几何的合理补全,且无需场景级训练。每个物体作为独立网格生成,并通过规范到世界的变换放置到共享世界坐标系中。为了在真实杂乱条件下进行评估,他们还提出了 UE-MeshyScene,一个包含每场景最多 701 个物体和精确逐物体真实数据的照片级基准,展示了相对于基线的持续改进,尤其在严重遮挡条件下。
数据集
作者在三个难度递增的设置中评估了他们的方法,每个设置由专门的数据集支持。这些数据集用于受控单物体生成、组合式场景生成以及密集杂乱环境中的大规模生成。
数据集构成与来源
- Toys4k:一组干净、孤立的物体模型集合,用于受控单物体评估。它不包含场景级因素,使作者能够隔离模型从部分多视角观测中恢复物体几何的能力。
- Toys4k-Scene:一个合成基准,通过将多个 Toys4k 物体放置在杂乱布局中并渲染短轨道序列构建。它保留了 Toys4k 的干净真实几何,同时引入了显著的物体间遮挡和具有挑战性的多物体配置。
- HouseCat6D:一个真实世界数据集,包含桌面场景的采集数据和单个物体的扫描真实网格。其布局相对稀疏,物体多为简单家居用品,物体间遮挡通常较轻。
- UE-MeshyScene:一个在 Unreal Engine 5.8 中创作和渲染的大规模基准,包含六个环境:飞机机库、废弃城市室内、古老教堂、建筑可视化办公室、日本学校和沙漠城镇。
每个子集的关键细节
- Toys4k:作者将输入视角数量从 1 变化到 16,每视角遮挡比例从 0 变化到 75%,衡量生成质量随观测减少和不完整程度增加的变化。
- Toys4k-Scene:许多物体包含细薄或复杂的结构,且排列密集,从典型视角只能观察到部分信息。这一设置对依赖单张图像的方法尤其具有挑战性。
- HouseCat6D:用于评估在合成渲染上训练的模型迁移到真实图像的效果。布局稀疏,与 Toys4k-Scene 相比物体间遮挡较轻。
- UE-MeshyScene:每个场景包含 93 至 701 个物体,总计 2,299 个物体。每个场景沿平滑相机轨迹以 2560 乘 1440 的分辨率渲染,每个场景产生 265 至 1758 个视角,总计 5,964 个视角。对于每一帧,数据集提供 RGB 图像、相机位姿、逐物体实例掩码、逐物体 3D 边界框和度量深度图。作者发布了完整的标注集,尽管他们的方法未使用深度信息。
数据的使用方式
- 作者在 Toys4k 上评估单个物体在规范空间中的生成,隔离从部分多视角观测中恢复物体几何的能力。
- 他们在 Toys4k-Scene 和 HouseCat6D 上评估组合式场景生成。
- 他们在 UE-MeshyScene 上评估大规模组合式生成,其中场景包含数百个严重相互遮挡的物体。
- 对于 UE-MeshyScene,每个资产都是已知的 3D 模型,以已知变换放置,提供完整的逐物体网格真实数据、精确的相机位姿和 3D 边界框。这使得能够在共同的世界坐标框架中直接评估,同时保留密集杂乱环境的复杂性。
指标与评估协议
- 对于每个物体,作者将预测解码为网格,并使用 Chamfer 距离(包括 L2 和 L1 距离)、推土机距离和 F-Score 与对应的真实几何进行比较。
- 对于规范空间中的单物体评估,预测和真实数据均相对于真实单位球进行归一化。由于不同基线采用不同的规范坐标约定,作者在计算指标前对每个实例执行 ICP 对齐。
- 对于组合式场景评估,每个生成的物体通过规范到世界的变换从其规范坐标系转换到世界坐标系。他们在共享世界坐标系中直接与真实网格比较,不进行逐物体 ICP 对齐。基于距离的指标通过每个物体的真实边界框对角线长度进行归一化,同时评估物体几何及其在组合场景中的放置。
方法
给定一组 N 张带位姿图像 {In}n=1N,以及已知的相机内参 {Kn}n=1N 和外参 {Tncw}n=1N,同时为每个物体 k 提供逐视角实例掩码 Skn 和粗略世界空间定位框 Bkloc,目标是生成组合式场景表示:
M={(Mkc,Tkow)}k=1K其中 Mkc 是物体 k 在规范坐标系中的独立网格,Tkow 将该坐标系映射到世界坐标系。该方法包含三个主要步骤:构建锚点对齐的虚拟规范坐标系、使用多视角条件的 3D 生成先验生成单个物体网格、以及将网格变换回世界坐标系。
参考框架示意图:
粗略定位框 Bkloc 不直接用作生成体积,因为其边长不相等,且其方向可能与预训练物体先验期望的相机相对规范方向不一致。相反,作者构建了一个锚点对齐的虚拟规范立方体。对于每个物体,他们选择一个锚点视角 ak(推理时物体被观测最完整的视角,训练时则为随机视角)。锚点相机方向诱导一个旋转 Rk∈SO(3),将锚点视角映射到规范前视方向。使用归一化立方体 V=[−21,21]3 作为规范空间域,以 Bkloc 的中心 ck 和其最大边长 sk,规范到世界的变换定义为:
Tkow=[skRk0ck1]该相似变换保持了物体比例。为处理不准确的定位框,sk 会增大,直到投影立方体覆盖所有选定视角中的物体掩码。
对于每个选定视角 n,锚点对齐立方体被投影到图像中,裁剪到其范围,使用 Skn 进行背景掩码处理,并缩放到生成模型输入分辨率,以产生物体中心图像 Iˉkn。调整后的相机内参为 Kˉkn=AknKn,其中 Akn 是裁剪和缩放变换。规范体素 x 通过以下方式投影到裁剪观测中:
πkn(x)=Π(Kˉkn[I30](Tncw)−1Tkowx~)其中 x~=[x⊤,1]⊤,Π 表示透视除法。
逐物体生成器 Φ 从 Pixal3D(一种原生 3D 生成模型)实例化。作者使用其前两个流匹配阶段(稀疏结构和形状)来确定几何。为了使用多个带位姿观测将生成锚定在锚点对齐的规范体积中,他们引入了多视角条件路径。每个规范观测 Iˉkn 使用 DINOv3 编码,产生密集特征图 Fkn=EDINO(Iˉkn)。对于每个体素 x,来自视角 n 的特征在其投影位置 gn(x)=Fkn(πkn(x)) 处采样,将 2D 特征提升到共享的 3D 特征网格中。
为了聚合这些提升的特征,使用了一种 IBRNet 风格的置换不变模块。对于每个体素 x,计算跨视角均值 μ(x) 和方差 σ2(x)。两个轻量级 MLP 细化特征并预测聚合 logits:
gn′(x)=MLPfeat([gn(x),μ(x),σ2(x)]) wn(x)=MLPweight([gn(x),μ(x),σ2(x)])最终体素特征是跨视角均值加上 softmax 加权的残差:
gout(x)=μ(x)+n∈Jk∑αn(x)gn′(x),αn(x)=∑m∈Jkexp(wm(x))exp(wn(x))MLPfeat 的最后一层为零初始化,因此聚合器开始时精确等于跨视角均值。得到的 3D 条件网格 Gk 被注入到 Pixal3D 的两个几何阶段中。全局图像 token 仅从锚点观测中提取,以保持预训练的单图像约定。聚合条件与 3D token 位置对齐、投影并添加到块特征中。原始 Pixal3D 参数被冻结,而注意力和投影层使用 LoRA 进行适配。
在训练期间,稀疏结构和形状阶段独立训练。对于每个物体,采样可变数量的条件视角,并随机选择一个作为锚点。仅优化多视角聚合器、条件注入层和 LoRA 参数。为弥合干净训练渲染与杂乱场景观测之间的差距,应用了条件视角增强课程。这包括通过 2D 掩码或 3D 一致的遮挡物模拟遮挡、扰动非锚点相机位姿、退化分割边界以及对观测进行降采样。增强强度在前 3k 次迭代中逐渐增加。
在推理时,锚点选择为物体观测最完整的视角。构建规范立方体,并选择有限数量的条件视角。通过运行两个 Pixal3D 几何阶段生成物体,生成的规范网格 Mkc 通过 Mkw=Tkow(Mkc) 放置到场景中。
如下图所示:
该流水线也可用于将生成的 3D 高斯泼溅世界转换为组合式网格场景,方法为渲染带位姿观测、恢复物体掩码和粗略 3D 定位,并应用标准推理流水线,无需额外训练。
实验
评估涵盖三个递增的难度级别:Toys4k 上的规范空间单物体生成、合成 Toys4k-Scene 和真实世界 HouseCat6D 上的组合式场景生成,以及新引入的 UE-MeshyScene 基准上的大规模杂乱场景。该方法在给定一个视角时与单视角基线保持竞争力,但随着输入视角的增加持续超越它们,多视角条件对部分观测和遮挡提供了强大的鲁棒性。在组合式设置中,该方法比基线恢复了更详细的几何和更准确的世界框架放置,在严重遮挡场景中增益最为显著。消融实验表明,学习到的多视角融合模块优于简单均值平均,其优势随场景杂乱和遮挡增加而增长,概念验证展示了无需重新训练即可将生成的 3DGS 世界转换为组合式网格。
UE-MeshyScene 是一个在 Unreal Engine 5.8 中以 2560x1440 渲染的大规模合成基准,包含六个场景中的 2,299 个物体,总计 5,964 个渲染视角。场景在物体数量和视角覆盖方面差异很大,物体数量从 93 到 701,视角数量从 265 到 1,758,反映了不同的复杂性和遮挡水平。数据集包含六个不同的场景,物体数量从废弃城市的 93 到沙漠城镇的 701 不等。每场景视角数量从废弃城市的 265 到日本学校的 1,758 不等,表明观测密度不同。按物体数量计算的最大场景是沙漠城镇(701)和办公室(678),最小的是废弃城市(93)。
该表在 Toys4k 上评估了不同输入视角数量和每视角遮挡水平下的规范空间 3D 物体生成,将所提模型与单视角基线和多视角变体进行比较。结果表明,所提模型在单视角时保持竞争力,并随视角增加持续改进,尤其在严重遮挡下,额外视角稳定了距离误差和 F-Score。学习到的多视角融合聚合器通常优于简单均值平均,差距随视角和遮挡增加而扩大。在干净输入下,模型在单视角时匹配专用单视角流水线,并随视角数量增加超越所有基线。性能在所有指标上随输入视角增加持续改进。在遮挡下,额外视角显著缓解退化;在 16 个视角下,指标在每视角遮挡高达 50% 时保持稳定。学习到的视角加权聚合器在单视角时与均值融合表现相当,但在更高视角数量和遮挡水平下显示出明显优势。学习融合的益处主要体现在具有许多相互遮挡物体的杂乱场景中,它改进了所有报告的指标。
所提方法在真实世界和合成组合式场景生成基准上均持续优于所有基线,在所有报告指标上取得最佳分数。最大的改进出现在合成 Toys4k-Scene 基准上,该方法将 Chamfer 距离相比最强基线降低了超过一个数量级。所提方法在 HouseCat6D 和 Toys4k-Scene 上均取得最低的 Chamfer 距离和 EMD,以及最高的 F-Score。在 Toys4k-Scene 上,该方法的 Chamfer 距离比最佳基线低 10 倍以上,表明场景几何显著更准确。该方法在 HouseCat6D 上的 F-Score 接近完美,而最接近的基线仍低于 0.98,显示了优越的重建保真度。
在 UE-MeshyScene 数据集上,所提方法在所有报告指标上持续优于 ShapeR 基线,中位数的增益大于均值,表明改进在典型物体上是一致的,而非少数困难案例。该方法在几何细节和世界框架放置方面表现更好,尤其对于小型和严重遮挡的物体。该方法在每个指标上均超越 ShapeR,包括 Chamfer 距离、EMD 和 F-Score。中位数改进比均值改进更显著,表明增益在典型物体上是一致的。该方法恢复了更详细的几何和更准确的共享世界框架放置,尤其对于小型和严重遮挡的物体。
学习到的 IBR 聚合器在大多数多视角设置中匹配或优于算术均值融合,差距随输入视角数量和遮挡水平的增加而扩大。在单视角下,两种方法表现几乎相同,而在更高视角数量和遮挡下,学习到的加权在距离和保真度指标上产生一致的改进。学习到的聚合器在高遮挡下显示出明显优于均值融合的增益,例如在 2 个视角和 75% 遮挡下将 CD-l2 从 12.91 降低到 10.03。在 16 个输入视角下,学习到的融合在所有遮挡水平上几乎改进了每个指标。在单个输入视角下,两种融合策略表现相似,因为没有额外的观测可供重新加权。均值平均仅在少数孤立设置中略微领先,主要在 8 个视角时,且差异很小。
评估引入了 UE-MeshyScene,一个具有多样场景复杂性和遮挡的大规模合成基准,并通过多个实验验证了所提模型。模型在单视角时保持竞争力,并随视角增加持续改进,尤其在严重遮挡下,学习到的多视角融合明显优于简单均值平均。在真实世界和合成组合式场景基准上,该方法在所有指标上取得最佳分数,在 Toys4k-Scene 上增益尤为显著,Chamfer 距离下降超过一个数量级。学习到的 IBR 聚合器在更高视角数量和遮挡水平下也显示出稳健的优势,而该方法在 UE-MeshyScene 上超越 ShapeR 基线,中位数改进更显著,表明对典型物体的一致增益。