HyperAIHyperAI

Command Palette

Search for a command to run...

VIBEWORLDING:多模态智能体能否端到端地构建 3D 开放世界?

Yansong Ning Jingwen Ye Zhongkai Wu Yang Sun Yiqin Zhu Xingyi Li Weidong Zhang Hao Liu

摘要

根据用户查询构建可交互的 3D 开放世界对游戏、仿真和具身智能具有重要意义。然而,现有方法主要在理想化、简单的查询上进行评估,难以系统分析和比较多模态智能体如何理解用户意图、使用 3D 工具,以及如何基于文本和视觉的 3D 世界信息进行推理。此外,缺乏开源框架也阻碍了对训练(例如智能体强化学习后训练)能否提升这些底层能力的系统研究。为此,我们提出 VIBEWORLDING,一个用于基准测试和训练 vibe worlding 智能体的统一框架:该多模态智能体能够在多轮智能体-环境交互过程中自主推断用户意图、规划场景布局、调用 3D 工具(例如资产检索/编辑),并对多模态反馈(例如 3D 地图和渲染的 3D 世界图像)进行反思。为实现这一目标,我们首先构建了 VWE-BENCH(VibeWorlding 评估基准),包含 2,616 个高质量 3D 资产、323 个人工标注的种子 3D 世界,以及 6,828 个反向合成的多模态用户查询,并划分为带有真值标注的已验证查询和带有精心设计评分标准的未验证查询。此外,我们开发了 VIBEWORLDING-GYM,一个联合多模态强化学习后训练框架,集成了(1)一个将资产检索、编辑和图像渲染统一为 MCP 工具的沙盒环境,以及(2)一个基于评分标准的验证器,结合物理可行性(例如资产碰撞检测)和意图满足验证(例如用户意图),既支持公平的模型评估,也支持可扩展的多模态强化学习奖励服务。实验表明,当前前沿 MLLM 远未解决 vibe worlding 智能体任务,即便是 GPT-5.5 和 Qwen3.8-Max 的成功率也不足 60%,并将瓶颈追溯到精确的 3D 世界编辑。我们进一步发现,强化学习训练可以缓解这一弱点,并使开源 MLLM 甚至超越闭源前沿模型:我们的 VibeWorlder-8B 与前沿 MLLM 相当,而旗舰模型 VibeWorlder-30B-A3B 在所有评估模型中取得了最佳的总体 Pass@1。我们发布了数据、代码和模型,以促进端到端 3D 世界构建的研究。

一句话总结

来自香港科技大学(广州)AI Thrust 和腾讯 TEG AIPD 的研究者提出了 VIBEWORLDING,这是一个用于基准测试和训练多模态 agent 的统一框架,这些 agent 在端到端 3D 开放世界构建过程中推断用户意图、规划场景布局、调用 3D 工具并反思多模态反馈;该框架引入了 VWE-BENCH 和 VIBEWORLDING-GYM,具有基于评分标准的验证和 agentic RL 后训练,并使得 VibeWorlder-30B-A3B 超越前沿 MLLM。

核心贡献

  • 本文提出了 VIBEWORLDING,这是一个用于基准测试和训练多模态 vibe worlding agent 的统一框架,并引入了 VWE-BENCH,其中包含 2,616 个 3D 资产、323 个人工标注的种子世界以及 6,828 条逆向合成的多模态用户查询,并分为已验证和未验证集合。
  • 该工作开发了 VIBEWORLDING-GYM,一个联合多模态 RL 后训练框架,包括一个沙盒环境,将资产检索、编辑和图像渲染统一为 MCP 工具,并包含基于评分标准的验证器,该验证器将碰撞检测等物理可行性检查与意图满足验证相结合,用于评估和奖励生成。
  • 实验表明,GPT-5.5 和 Qwen3.8-Max 等前沿 MLLM 的成功率仍低于 60%,精确的 3D 世界编辑是主要瓶颈,而 RL 后训练产生了 VibeWorlder-8B 和 VibeWorlder-30B-A3B,后者在评估模型中取得了最佳整体 Pass@1,数据、代码和模型均已发布。

引言

从预定义资产构建交互式 3D 开放世界对于游戏、仿真和具身 AI 至关重要,多模态大语言模型(MLLM)使得通过 agentic 工作流自动化这一过程成为可能。然而,现有系统大多针对理想化查询,仍然闭源,并在碎片化资产库和不兼容工具上运行,同时缺乏对物理可行性、用户意图和美学一致性的可靠验证。作者提出了 VIBEWORLDING,一个统一的开源框架,用于基准测试和训练端到端 3D 世界构建 agent。它包括 VWE-BENCH,其中包含 2,616 个高质量 3D 资产、323 个人工标注的种子世界和 6,828 条查询,以及 VIBEWORLDING-GYM,一个多模态 RL 沙盒,统一了检索、编辑和渲染工具,并使用双重约束验证器来指导评估和训练。

数据集

作者通过多模态大语言模型(MLLM)、生成模型和人类美术标注者之间的三阶段协作构建了 VWE-BENCH。

  1. 数据集组成与来源
  • 3D 资产:基于艺术家定义的包含名称和类别的 3,148 个原生概念资产清单构建。对于每个资产,Gemini 3.1-flash-image 生成一张图像,然后 Hunyuan3D 3.1 将其转换为 .glb 格式的 3D 网格。
  • 经过质量过滤后,保留 2,616 个资产。这些资产涵盖 20 个语义类别,从小型道具到建筑和地形。每个资产在统一的真实世界尺度下标注沿 x/y/z 轴的中心和半长,以及语义描述、颜色、原生尺寸和面数。
  • 种子世界:专业美术标注者从合成资产中构建 323 个种子 3D 世界,共同覆盖完整的资产库。世界较为粗糙但可用,放置资产数量从 8 到 258 个不等。
  • 查询:逆向合成产生 6,828 条多模态查询,包括 1,364 条 3D 世界构建查询和 5,464 条 3D 世界细化查询。
  1. 关键子集与合成规则
  • 3D 世界构建查询:
    • 仅主题:仅包含高层次氛围。
    • 主题 + 元素:主题加上必需的元素和数量。
    • 完整蓝图:主题、元素和预期的空间组织。
    • 干扰项:包含不可行或说明不足的子请求,例如缺失资产、物理违规或矛盾。
  • 3D 世界细化查询:
    • 资产扰动:
      • 资产级精确编辑:带有真值地图的精确添加/删除/平移/旋转指令。
      • 资产级模糊编辑:模糊的资产级编辑,例如“稍微整理一下树木”。
    • MLLM-as-critic:
      • 场景批评:要求 agent 修复某个缺陷。
      • 场景引导:给出高层次的方向性意图。
      • 场景重述:在没有具体编辑的情况下重述期望的最终状态。
      • 复杂描述:多个协调编辑或丰富需求。
  • 只有资产级精确编辑查询经过验证。其他五种查询类型未经验证,并使用评分标准进行评估。
  1. 处理细节与元数据
  • 没有描述裁剪策略。处理过程包括图像到 3D 转换、过滤与概念图像差异较大的网格、真实世界尺寸标注以及原生边界框标注。
  • 种子世界被构建为粗糙但可用的场景,而不是高度精细的环境。
  • 查询构建使用 MLLM 读取种子世界或观察扰动,然后生成指令。人类标注者审查并过滤低质量的合成查询。
  1. 数据在模型中的使用
  • 数据集被划分为训练集和测试集,使用完全不重叠的种子 3D 世界,以衡量泛化能力而非记忆能力。
  • 划分保持了查询类型比例,但未报告确切的训练/测试数量和混合比例。
  • 训练使用 SFT 查询集进行冷启动数据合成,并使用 RL 查询集进行联合多模态强化学习。

方法

作者提出了 VIBEWORLDING-GYM,以支持可扩展的 agentic 强化学习(RL)训练,用于 3D 世界构建。给定多模态查询 qqq,agent 与沙盒环境交互 TTT 轮,以构建交互式 3D 世界。在第 iii 轮,以查询和交互历史为条件,agent 生成思考 τi\tau_iτi 和由工具调用组成的动作 aia_iai

{τi,ai}=πθ(q,{τ1,a1,o1,,τi1,ai1,oi1})\{\tau_i, a_i\} = \pi_\theta(q, \{\tau_1, a_1, o_1, \dots, \tau_{i-1}, a_{i-1}, o_{i-1}\}){τi,ai}=πθ(q,{τ1,a1,o1,,τi1,ai1,oi1})

其中 oio_ioi 是沙盒返回的观测,包含工具响应和当前 3D 地图以及渲染的多视角图像。该框架包含三个核心组件:用于 agent 交互的稳定 3D 沙盒、用于端到端评估的双重约束验证器,以及统一的后训练流程。

3D 沙盒构建

沙盒为 agent 提供一组统一的 3D 工具和渲染服务。工具集包括资产检索、添加、删除、旋转和平移。检索工具使用基于 Qwen3-Embedding-4B 构建的检索器,将自然语言意图映射到可放置的资产候选,该检索器在合成正负样本对上使用 InfoNCE 损失进行训练。其余工具根据提供的参数操作 3D 世界。为了支持这些操作,作者通过艺术家引导的合成流程构建了一个大规模、物理一致的资产库。如下图所示,该资产库涵盖多样的语义类别和物理尺寸,从小型道具到大型建筑,并作为构建不同复杂度种子 3D 世界的基础。

合成资产在语义类别和物理尺寸类别上的统计分布,以及种子世界的复杂度,如下图所示。

在渲染方面,沙盒在每轮 agent 操作后使用 Blender 从五个固定相机视角生成修改后 3D 世界的多视角图像,为后续动作提供视觉反馈。

双重约束验证器

为了评估构建的 3D 世界,作者设计了一个双重约束验证器,同时检查物理可行性和意图满足情况。物理可行性通过基于 Python 的几何检查验证,确保资产不会碰撞并且正确落地而不悬空。意图满足由基于 MLLM 的评判器评估,评判生态合理性、3D 理解、3D 推理和检索合理性。对于未经验证的查询,世界必须通过两项检查才被视为正确。对于具有真值地图的已验证查询,验证器根据正确修改资产的比例对世界评分。

联合多模态 RL 后训练

训练过程从用于监督微调(SFT)的冷启动数据合成开始。对于未经验证的查询,作者提示 MLLM 构建高质量 3D 世界,使用验证器进行过滤,并反向提示 MLLM 生成连贯的推理轨迹。对于已验证查询,轨迹直接从真值地图反向合成。全参数 SFT 赋予模型基本的 3D 工具使用能力和多轮推理能力。

在 SFT 之后,作者采用使用 Group Relative Policy Optimization(GRPO)的联合多模态 RL。agent 同时从纯文本查询(从零构建世界)和多模态查询(根据渲染结果细化现有世界)中学习。优化依赖于从双重约束验证器派生的基于结果的奖励:未经验证的查询使用二元奖励,已验证查询使用比例分数。该设计避免了与手工设计中间奖励塑形相关的奖励黑客问题。

实验

VWE-BENCH 使用不重叠的训练和测试世界评估 3D 世界构建与细化,自动验证器评分与盲测人类标签进行交叉核对。实验比较了前沿 MLLM、agent 脚手架基线以及后训练的 VibeWorlder 变体,结果表明冷启动 SFT 加多模态 RL 将开放基座模型的 Pass@1 从较低水平提升到最优水平,VibeWorlder-30B-A3B 超过 GPT-5.5 和 Qwen3.8-Max,尤其是在可规则检查的已验证编辑上。分析表明,SFT 主要提供物理和生态能力,而 RL 解锁了 3D 理解和推理能力,但无碰撞放置、精确距离编辑以及偶尔的过度编辑仍然是关键限制。一项真实世界 CLI 研究进一步证实,训练后的 agent 支持通过渲染在环验证进行交互式多轮编辑。

该基准定义了 3D 资产、3D 世界、多模态查询以及一组统一的 3D 工具。它包含数千个资产、数百个世界和数千条多模态查询,涵盖从零构建场景和细化现有场景。工具集支持资产检索以及对场景编辑的添加、删除、旋转和平移操作。资产库包含数千个 3D 资产,每个资产由 id、名称、类别、面数和边界框描述。多模态查询既包括根据文本指令构建世界,也包括使用文本和视觉输入细化现有世界。五个统一工具支持可放置资产的检索和操作,包括添加、删除、旋转和平移操作。

VWE-BENCH 包含超过五千条已验证查询,分为 3D 世界构建和 3D 世界细化。细化是更大的任务族,资产级编辑贡献最多查询,场景批评贡献最少。构建查询涵盖逐渐提高的具体性层级以及干扰项,其中主题 + 元素是最常见的子类型。细化查询数量是构建查询的两倍以上,主要由资产级编辑任务驱动。在构建中,主题 + 元素是最大的子类型,干扰项最小;在细化中,精确资产编辑最多,场景批评最少。

VWE-Bench 将数据集划分为训练集和测试集,且基于不重叠的种子 3D 世界构建,以支持泛化而非记忆。在所有划分中,细化任务明显比构建任务更常见,训练数据被分为较大的 SFT 冷启动集和较小的 RL 集。该划分还在训练和测试之间保持了查询类型比例。在每个划分中,3D 世界细化示例数量大约是 3D 世界构建示例的四倍。SFT 冷启动训练集是最大的子集,RL 训练示例较少,测试集更小。训练和测试示例使用完全不重叠的种子 3D 世界,防止跨场景泄漏。训练和测试之间保持查询类型比例,以支持平衡的策略学习。

Pass@1 在不同评估模型和查询子类型之间差异很大。从零构建以及较长或说明不足的细化查询仍然困难,而精确和模糊资产编辑以及场景批评在若干前沿模型上相对更强。多模态 RL 后训练显著改善开放基座模型,并取得最佳整体通过率,尽管人类判断仍然更严格。构建子类型的表现不均衡:一些前沿模型在主题和完整蓝图或干扰项提示上得分较高,而其他模型在相同类别上得分很低甚至为零。细化查询能更清楚地区分模型,复杂描述和场景重述即使对强模型也仍然困难,这些模型在这些子类型上得分低于 50%。RL 后训练在所有细化子类型上带来一致改进,并将开放 VibeWorlder-30B-A3B 模型提升到最高的整体通过率,超过前沿模型。人类整体通过率始终低于整体通过率,表明基准成功并不能完全反映人类对可行性和意图的判断。

该基准使用多模态查询以及统一的资产检索和编辑工具评估 3D 世界构建与细化。数据集划分使用不重叠的种子世界,以测试泛化而非记忆,并且细化任务明显比构建任务更常见。评估表明,从零构建和说明不足的细化仍然困难,而多模态 RL 后训练持续改善开放模型,并取得最佳整体通过率。人类整体判断比自动通过率更严格,表明基准成功并不能完全反映人类对可行性和意图的评估。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供