HyperAIHyperAI

Command Palette

Search for a command to run...

Lucida:面向可组合真实到仿真场景建模的解析、生成与放置

Minghan Qin Yuang Wang Xiuyu Yang Yushi Long Yujian Zhang Ruihuan Wang Kai Ye Yangang Zhang Hang Li

摘要

可组合场景建模旨在将真实室内场景恢复为完整、可编辑且按观测方式排列的对象资产,从而为机器人仿真和具身智能提供一个仿真就绪的真实环境副本,使其中的对象能够被单独操控。现有流程将该任务分解为三个步骤——将观测解析为实例、为每个实例生成资产、再将每个资产放回原位——但每一步都预设了杂乱采集通常难以提供的输入:准确的实例几何、无遮挡视图以及与观测精确匹配的资产。我们提出 Lucida,它保持这一顺序但重新分配各项要求,使每一步只消费真实采集能够可靠提供的内容,并在流程末端而非起始阶段达到精度。Lucida 将视频解析为场景图,其节点携带逐实例的多视图证据,依据每个实例的证据为其生成完整资产,并利用 GizmoAct 放置资产。GizmoAct 是一种 VLM 策略,将放置转化为多轮 GUI 交互,在闭环中操控对象的 gizmo,并自行判断何时达到对齐。在场景级三维目标检测、物体位姿估计和场景重建方面,Lucida 在 R2S-Scene 上将 mAP 相对 Boxer 提升了 69%,在 CA-1M 上将 [email protected] 从 57.8% 提高到 83.4%,并将场景 F-Score 从 SAM 3D 的 0.794 提升到 0.924。

一句话总结

来自字节跳动 Seed、北京大学和浙江大学的研究者提出了 Lucida,一种可组合的真实到仿真场景建模管线,它将视频解析为逐实例多视图证据,生成完整的可编辑资产,并通过 GizmoAct 放置这些资产;GizmoAct 是一种使用闭环多轮 GUI gizmo 操作的 VLM 策略,在 R2S-Scene 上将 mAP 相对 Boxer 提高 69%,在 CA-1M 上将 [email protected] 从 57.8% 提升到 83.4%,并将场景 F-Score 从 SAM 3D 的 0.794 提升到 0.924。

核心贡献

  • Lucida 是一种可组合的场景建模系统,保持解析-生成-放置的顺序,但重新分配要求:解析阶段消费多视图实例证据,生成阶段补全 amodal 资产,精度在最终放置步骤实现。
  • GizmoAct 是一种视觉语言模型策略,将物体放置建模为多轮 GUI 交互,在闭环中操控 3D gizmo,自行决定对齐终止,并优化完整的 9-DoF 位姿和各向异性尺度。
  • 实验表明,Lucida 在 R2S-Scene 上将场景级 3D 物体检测 mAP 相对 Boxer 提高 69%,在 CA-1M 上将 [email protected] 从 57.8% 提升到 83.4%,并将场景 F-Score 从 SAM 3D 的 0.794 提升到 0.924。

引言

可组合场景建模将真实室内空间恢复为可分离、可编辑的物体资产,用于机器人仿真、具身智能、AR/VR 和内容创作。此前方法要么产生保真但整体式的重建,要么返回受 CAD 数据库覆盖限制的可仿真场景,要么合成不基于特定采集输入的合理房间;多阶段的解析-生成-放置管线还假设有干净的掩码和无遮挡视图,而杂乱的真实采集并不提供这些条件,因此早期误差会传播。作者提出 Lucida,该系统保持解析-生成-放置顺序,但将精度重新分配到闭环的最终放置阶段。解析阶段构建带有逐实例多视图证据的场景图,生成阶段以这些证据为条件补全被遮挡物体,GizmoAct(一种视觉语言模型策略)通过多轮 GUI 交互对生成资产进行对齐,能够容忍几何不匹配和粗略的初始位姿。

方法

作者提出 Lucida,一种将室内场景的带位姿 RGB-D 观测转换为可编辑、物体级副本的管线。整体框架遵循解析-生成-放置顺序,每个真实实例都会成为由 9-DoF 位姿放置并组织在场景图中的完整 3D 资产。

在解析阶段,系统将多视图观测整合为以物体为中心的场景图。给定带位姿的 RGB-D 观测,作者构建一个图,其中每个节点携带逐实例证据包 Eo\mathcal{E}_oEo。该证据包包含多视图观测、关联掩码、部分点云观测、代表性 3D 框以及类别名称。为了实现稳健的物体发现,方法采用基于共视性和时间间隔的几何感知关键帧选择,随后进行以物体为中心的全序列证据整合,以从整个序列中检索额外观测。接着应用关系感知场景精化,以纠正错误分组和空间不一致等场景级错误。

生成阶段将每个证据包转换为完整的独立物体资产。由于真实采集通常存在遮挡和深度噪声,作者首先使用多视图视觉证据合成完整、无遮挡的以物体为中心的图像。视觉语言模型将选定的可靠视图组织为锚点和参考视图,生成编辑指令。随后图像编辑模型合成隔离的物体图像,再通过图像到 3D 模型将其提升为 3D 资产 AoA_oAo

放置阶段称为 GizmoAct,通过闭环 gizmo 操作将生成资产对齐到场景中。作者将 3D 对齐重新表述为多轮 GUI 交互。物体状态定义为 xt=(pt,Rt,st)x_t = (p_t, R_t, s_t)xt=(pt,Rt,st),表示物体中心、旋转和各向异性尺度。每一轮中,当前状态被渲染为图形观测,视觉语言模型预测一个可执行的编辑。

图形观测界面将场景点云与界面元素配对,包括 3D 模型叠加、其 3D 框以及显示局部坐标系的 gizmo。为了提供全面的空间上下文,系统渲染主视图、用于补充多视图证据的辅助视图,以及沿局部轴的正交视图,以解决尺度-深度歧义。还叠加了遮挡提示,以明确模型与点云之间的深度关系。

核心动作空间由用于增量编辑的 update_pose 和用于结束回合的 stop 组成。update_pose 动作相对于当前物体尺寸和局部坐标系预测旋转、平移和尺度增量,避免绝对位姿预测的歧义。为处理仅靠增量更新难以解决的大幅初始旋转误差,作者引入了用于粗略旋转的扩展动作。

当初始旋转误差较大时,策略发出 switch_obs 动作,沿六个带符号轴渲染资产,暴露隐藏面。从这些正交观测中,策略预测 permute_axis 动作,选择 24 种轴对齐重定向之一,在单步中消除主要旋转残差,再通过 update_pose 进行精细调整。

GizmoAct 的训练过程分为两个阶段。首先,作者在合成专家轨迹上进行监督微调。为了教会策略进行误差恢复,他们在专家 rollout 中注入损坏命令,并监督后续的恢复动作。损失函数会屏蔽被注入的错误 token。其次,他们使用 GRPO 在在线 rollout 上通过强化学习优化策略。奖励设计将广义 3D IoU 和测地旋转误差量化为离散等级,提供联合成功奖励和优秀等级奖励,同时动态采样通过剔除奖励均匀的组来确保批次训练的信息量。最后,可选的后处理会施加场景级约束,如支撑关系和碰撞一致性。

实验

评估涵盖场景级 3D 物体检测、物体位姿估计与布局精化,以及完整场景重建,随后对解析管线和 GizmoAct 训练进行消融。检测实验表明,Lucida 比基线方法更准确地恢复物体实例和 3D 框,尤其是在使用关键帧提示并结合全序列证据整合时。位姿精化评估显示,GizmoAct 在不同数据集和初始化器上改善了对齐和定向框重叠,强化学习使其能从较大的初始化误差中更好地恢复。场景重建结果表明,完整系统产生更一致的物体几何和相对放置,消融实验确认几何感知关键帧选择、以物体为中心的证据整合和关系感知精化均对整体提升有贡献。

在 CA-1M 和 R2S-Scene 的所有四种评估设置下,Lucida 取得了最高的场景级 3D 物体检测 mAP。即使最强基线在每一帧上都使用提示,Lucida 仅从关键帧提示开始,仍然超越了该基线。最大提升出现在 R2S-Scene 的全部标注协议下,mAP 几乎翻倍。在 CA-1M 上,使用关键帧提示的 Lucida 在全部标注和过滤评估协议下均优于使用全帧提示的 Boxer。在 R2S-Scene 的全部标注协议下,Lucida 将 mAP 从此前最佳结果的 0.351 提升到 0.592。仅使用几何感知关键帧提示,Lucida 仍然击败了在每一帧标注帧上获得提示的 Boxer,表明全序列证据整合和关系感知场景精化带来的收益。

在 R2S-Object、CA-1M 和 ADT 上,GizmoAct 相比所有基线改善了严格表面对齐和 3D IoU。与单视图变体相比,使用最多四个视图进一步改善位姿估计。在 Boxer 初始化位姿上训练精化策略相比随机位姿扰动也提高了精度。GizmoAct 取得比 Any6D、SAM 3D 和 RecGen 更低的 ADD-SB,以及更高的严格 [email protected] 成功率和 3D IoU。最大 4 视图 GizmoAct 变体在 R2S-Object 上优于单视图变体,达到报告中最高的严格对齐和 3D IoU。将 RL 训练位姿分布与 Boxer 初始化匹配可改善跨数据集的 [email protected] 和 3D IoU。

同一个 GizmoAct 策略在三个数据集和三种位姿初始化器下进行评估。Boxer 初始化在 R2S-Object 和 CA-1M 上通常表现最强,而 SAM 3D 和 Any6D* 初始化在 ADT 的精确几何条件下更具竞争力。即使多视图精化预算固定,初始化器选择仍会影响表面误差、严格位姿成功率和 3D IoU。在 R2S-Object 和 CA-1M 上,Boxer 初始化在三种初始化器中取得最低 ADD-SB 和最高 3D IoU,尽管 SAM 3D 在 R2S-Object 上取得略高的严格成功率。在 ADT 上,SAM 3D 初始化取得最高的严格成功率和 3D IoU,而 Any6D* 取得最低 ADD-SB,表明在精确几何条件下初始化器排序有所不同。

所提方法在场景级和物体级指标上均优于所有基线。与 SAM 3D 相比,它使总场景 Chamfer 距离减少一半以上,同时将场景 F-Score 从 0.794 提升到 0.924,将边界框 IoU 从 0.396 提升到 0.495。物体级的提升幅度适度但一致,具有更低的无量纲 CD 和更高的 F-Score。总场景 Chamfer 距离从 0.022(SAM 3D)下降到 0.010,两个有向项均更低,表明虚假表面更少且对真值的覆盖更好。场景 F-Score 从 0.794 大幅上升到 0.924,边界框 IoU 从 0.396 增加到 0.495,反映物体尺度和相对放置更准确。物体级 Chamfer 距离(按物体归一化)从 0.038 改善到 0.034,物体 F-Score 从 0.704 改善到 0.736。SceneGen 产生高得多的场景 Chamfer(0.428)以及明显更低的 F-Score 和 IoU,远远落后于其他两种方法。

消融三个场景解析阶段中的任意一个,都会使场景级 3D 物体检测 mAP 和场景重建 F-score 相对完整管线下降。将几何感知关键帧选择替换为均匀采样会导致最大降幅,表明关键帧质量尤其重要。以物体为中心的证据整合主要影响场景覆盖,而关系感知精化改善检测和重建对齐,但对总场景 Chamfer 距离影响不大。所有三项消融都降低了检测 mAP 和场景 F-score。均匀关键帧选择产生最大下降,表明几何感知选择保留了更有用的视角。移除以物体为中心的全序列证据整合会增加 GT 到预测的 Chamfer 距离,与场景覆盖降低一致。禁用关系感知场景精化会降低检测 mAP 和场景 F-score,但总场景 Chamfer 距离几乎保持不变。

实验在 CA-1M、R2S-Scene、R2S-Object 和 ADT 上评估了一个统一场景理解管线,涵盖场景级检测、物体位姿精化、多视图重建和消融研究。Lucida 仅使用关键帧提示即可改善场景级 3D 物体检测,而 GizmoAct 增强位姿对齐,并受益于多视图精化和 Boxer 初始化的训练分布。完整方法在场景和物体重建上优于基线,消融实验确认几何感知关键帧选择、全序列证据整合和关系感知精化均有贡献,其中关键帧选择最为关键。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供