HyperAIHyperAI

Command Palette

Search for a command to run...

Hunyuan3D-Buffalo 1.0:面向可扩展 3D 生成、理解与编辑的统一多模态模型

摘要

图像生成领域的最新进展已展现出统一多模态模型在融合理解、生成与编辑方面的潜力。然而,统一的 3D 建模仍受限于多模态数据的稀缺,尤其是缺乏大规模且几何一致的编辑数据。为应对这一局限,我们提出 Hunyuan3D-Buffalo 1.0,一个在单一架构内支持 3D 理解、文本到 3D 生成、指令引导的 3D 编辑以及基于文本的部件生成的统一框架。为实现可扩展训练,我们构建了一个 87M 规模的 3D 多模态语料库,包含 2500 万理解样本、5000 万文本到 3D 配对数据以及 1200 万使用 Nano3D-v2 生成的编辑配对数据。在架构上,该框架将用于语义、结构与空间理解的 Hunyuan3D-VLM 与用于高保真 3D 合成的 Hunyuan3D DiT 相结合。VLM 为生成提供多模态语义条件,而编辑与部件生成则进一步将扩散过程建立在源物体表示之上,以保持其整体结构及未编辑区域。大量实验表明,Hunyuan3D-Buffalo 1.0 在文本到 3D 生成和 3D 编辑基准上达到了最先进或领先的性能,同时展现出强大的理解与部件生成能力。我们的分析进一步表明,生成与理解能力共同提升了编辑效果,验证了统一 3D 多模态训练的有效性。

一句话总结

腾讯混元提出 Hunyuan3D-Buffalo 1.0,一个统一框架,将负责语义、结构与空间理解的 Hunyuan3D-VLM 与用于高保真三维合成的扩散 Transformer(Hunyuan3D DiT)耦合,以实现三维理解、文本到三维生成、指令引导编辑和基于文本的部件生成,该框架在一个包含 8700 万样本的多模态语料库(2500 万理解样本、5000 万文本到三维对和 1200 万编辑样本)上训练,在文本到三维和编辑基准上取得领先性能,同时具备强大的理解和部件生成能力。

核心贡献

  • 提出 Hunyuan3D-Buffalo 1.0,一个统一框架,通过组合 Hunyuan3D-VLM 和 Hunyuan3D DiT,整合三维理解、文本到三维生成、指令引导三维编辑和基于文本的部件生成。
  • 构建了一个规模达 8700 万的三维多模态训练语料库,包含 2500 万理解样本、5000 万文本-三维对以及 1200 万经由 Nano3D-v2 生成的编辑对,以支持可扩展的统一训练。
  • 在文本到三维生成和三维编辑基准上取得最优或领先性能,并证明理解与生成的联合训练能提升编辑能力。

引言

作者针对三维理解、生成和编辑系统碎片化的问题,这源于缺乏大规模且几何一致的三维编辑数据以及由此导致的无法学习统一表示。为解决这一问题,他们利用基于 Agent 的编辑数据流水线构建了一个包含 8700 万样本的三维多模态语料库,并提出 Hunyuan3D-Buffalo 1.0,一种将自回归视觉-语言模型与基于扩散的三维生成器相结合的单一架构。该统一框架联合处理三维理解、文本到三维合成、指令引导编辑和基于文本的部件生成,达到最优性能,并揭示更优的生成和理解能力均可直接提升编辑效果。

数据集

作者构建了一个三维数据引擎,生成围绕三维理解、文本到三维生成和三维编辑的三个互补语料库。该引擎总共产生约 2500 万理解样本、5000 万文本-三维对和 1200 万编辑对,全部用于训练一个能够理解、生成和编辑三维资产的统一多模态模型。

三维理解数据(~2500 万样本)

  • 组成与来源:混合了纯文本、图像-文本和三维点云-文本对话。纯文本部分(≈7M)和图像-文本部分(≈3M)来自公开和内部的指令语料库;三维部分(≈15M)基于 Part-X-MLLM、ShapeLLM-Omni 和内部资产池构建。
  • 涵盖的任务
    • 三维描述(几何、结构和部件的多层次描述)
    • 三维问答(关于类别、属性、部件、空间关系的自由形式问题)
    • 三维定位(使用量化轴对齐边界框定位部件,输出为 <boxs>/<boxe> token 序列)
    • 编辑指令合成(生成基于对象几何结构的精确、可执行的编辑指令)
    • 编辑结果描述(描述编辑后产生的对象)
  • 部件生成数据(包含在理解语料库中):来自 HY3D-Bench 和 PartNeXt 的资产通过语义网格合并工具处理,将过度分割的原始网格组件合并为可用语言引用的宏部件。一个 VLM 验证部件一致性,并应用单一归一化变换导出三元组(完整对象、宏部件单独、剩余对象)。这些被转换为用于部件分割和部件移除(例如,“分割车轮”)的指令微调样本。
  • 用途:所有模态在训练期间交错使用,以保留语言推理和二维感知能力,同时适应三维任务。理解数据用于三维多模态模型的指令微调,涵盖描述、问答、定位、编辑指令合成和部件感知任务。

文本到三维生成数据(~5000 万对)

  • 流水线阶段:一个全自动五阶段流程:
    1. 构建四级分层提示词分类法(生成模式、20 个类别、子类型、细粒度类型),并包含受控属性词汇(风格、颜色、材质、状态、姿态)。移除了不适合图像到三维的样式。
    2. 合成式提示词生成:模拟用户自然请求,包含次要对象以构建混合组合,属性随机丢弃(30% 概率),并附加质量后缀。每条记录同时携带负向提示词。
    3. 图像到三维资产生成和多视角渲染(标准视角,白色背景);采样表面点云。对于编辑增强分割,使用差异检测模块和一致性检查丢弃变化不合理的样本。
    4. 多层级描述和几何质量评分:一个 VLM(Gemini)产出六个描述层级,仅描述几何结构(不含颜色、材质或渲染提及),并给出整数几何质量评分(0–10,惩罚截断、重复部件、破损拓扑等)。
    5. 质量过滤:仅保留几何质量评分 ≥ τ(τ=10 对应最纯净分割)的资产。保留的资产打包为(表面点云路径,描述字典,L1 类别)元组。
  • 格式:每个样本包含 {"L0", "L1", "L2", "L3", "attributes", "prompt", "negative_prompt", "secondary"?},并附有多层级描述和类别标签。
  • 用途:该语料库直接提供大规模文本-资产对用于文本到三维生成训练。

三维编辑数据(~1200 万对)

  • 流水线:Nano3D-v2,包含五个阶段:
    1. 锚点视图选择:一个 VLM 选择编辑最显著的视图,Qwen-Image 进行二维指令引导编辑。
    2. 编辑规划:一个学习到的自回归模型根据二维编辑掩码和源体素表示预测精确的三维边界框。
    3. 体素编辑:一个体素 Transformer 在预测的框内执行局部 FlowEdit;框外的体素替换为原始体素以强制局部编辑。
    4. 细粒度优化:LATTICE 在亚体素分辨率下细化几何;NaTex 通过沿 7 个体素边界的 alpha 混合进行纹理修补。
    5. 标注与过滤:一个 VLM 评估结构完整性,重新推导仅关注几何变化的编辑指令(添加/替换/移除),并验证对齐、未编辑区域一致性和编辑可见性。不合格的对被丢弃。
  • 输出:(源资产,编辑后资产,指令)三元组,包含简洁和详细两种指令,仅聚焦几何变化(颜色、材质、纹理被忽略)。
  • 用途:编辑对用于训练模型进行指令驱动三维编辑,同时保护非目标区域。

方法

为支持统一三维多模态建模,作者构建了一个全面的数据引擎。对于文本到三维数据,他们采用全自动五阶段流水线。过程开始于分层提示词分类法构建和合成提示词生成,接着是图像到三维资产生成和多视角渲染。然后应用多层级描述和几何质量评分,最后进行质量过滤。

如下图所示:

对于三维编辑数据,作者引入 Nano3D-v2,这是一个旨在生成高保真编辑对并保持几何一致性的框架。流水线包含五个阶段:使用视觉-语言模型进行锚点视图选择,通过因果 Transformer 预测三维边界框的编辑规划,使用体素 Transformer 结合 FlowEdit 采样的体素级编辑,利用 LATTICE 和 NaTex Transformers 进行详细几何与纹理编辑,最后进行编辑对标注与过滤。

如下图所示:

生成的训练语料库包含多样化且高质量的编辑对,涵盖单轮和多轮编辑场景。

如下图所示:

如下图所示:

所提出的架构协同两个专用模块:负责多模态理解和部件级推理的 Hunyuan3D-VLM,以及用于三维合成的 3D-DiT。为使 VLM 具备细粒度三维感知,Hunyuan3D-VLM 通过结构-外观表示编码三维资产。结构通路处理 XYZ 坐标和表面法线等几何信号,而语义通路编码 RGB 外观线索。这些表示通过 VecSet 编码器编码为 latent token,并由 Q-Former 压缩为固定长度的 512 token 序列。VLM 词汇表增加了 133 个特殊 token,以支持显式三维定位,包括点云 token 序列的分隔符和三维边界框的量化坐标 token。

为将 VLM 与生成模块集成,一个轻量级 MLP-Connector 将 VLM 隐藏状态对齐到 3D-DiT 的条件空间。对于三维编辑和部件生成,扩散过程同时以 VLM 派生的语义嵌入和原始对象表示为条件。源三维表示与噪声 latent map 串联作为 3D-DiT 自注意力层的输入,有利于保留未编辑区域。

框架分四个不同阶段训练,使用流匹配目标优化 3D-DiT。

如下图所示:

阶段 1:进行 3D-VLM 训练。这包含一个对齐阶段,训练三维 token 连接器将三维 latent token 与语言模型输入空间对齐,随后是指令微调阶段,整个模型在多种三维理解任务上联合训练。得到的 VLM 在后续阶段保持冻结。

阶段 2:文本到三维预训练将 VLM 与 3D-DiT 耦合。VLM 隐藏状态经 MLP-Connector 处理后注入 3D-DiT,通过交叉注意力为去噪器提供条件。3D-DiT 在大约 5000 万文本-资产对上训练。

阶段 3:全模态预训练统一文本到三维生成、三维编辑和部件生成任务。采样比例经过平衡,使得编辑能力显现且不牺牲生成质量。部件生成被视为一种特殊的三维编辑情况,目标区域为查询的部件。

阶段 4:持续预训练将三个任务解耦为任务特定路径。对于三维编辑和部件生成,混入一半的文本到三维数据以保持生成质量,而文本到三维训练仅使用文本到三维数据。

实验

评估涵盖 UniPart-Bench 上的三维理解、通过人工偏好研究的文本到三维生成、Edit3D-Bench 上的三维编辑以及开放词汇部件生成。Hunyuan3D-VLM 始终取得顶级结果,统一了部件级推理、高保真形状生成与强文本对齐,以及保留源几何结构的局部编辑。扩大预训练数据规模是质量的关键驱动力,统一多模态框架有效利用强大的文本到三维基础来实现精确编辑和部件提取。

在提供约 2500 万理解对话、5000 万文本-三维对和 1200 万编辑三元组的大规模数据引擎上训练统一的三维多模态框架。模型生成的局部化、指令引导几何编辑能忠实保留源形状,性能大幅超越基线。扩大文本到三维生成数据成为驱动编辑性能的关键且成本有效的因素,同一模型将开放词汇部件生成作为集成的子任务支持。文本到三维语料库规模约为编辑语料库的四倍,增加其规模可提升编辑能力而无需额外编辑样本。定性编辑评估显示局部变化(例如,添加一把剑、移除翅膀)保持整体结构不变,而基线方法往往过度平滑或扭曲源形状。该框架在统一多模态大语言模型内实现开放词汇、基于文本的部件生成,具有高几何保真度,并支持组合式重组。

数据集为每个三维资产提供六个描述层级,从详细的多句描述到紧凑的关键词列表。这种多粒度文本条件支持精确的局部几何编辑,同时保留整体形状和精细细节,还支持开放词汇部件提取。扩大底层文本到三维生成数据能同时增强编辑性能,无需额外编辑标注。详细描述使用 4–6 句(≤120 词),涵盖主体、部件、姿态和特征,而标签则缩减为至多 8 个解耦关键词。多层级描述允许局部编辑,如添加配件或移除组件,同时保持原始结构和精细几何。扩大文本到三维生成数据可改善三维编辑能力,即使没有额外编辑专用数据。模型能以高几何保真度提取开放词汇、文本指定的部件,并能将它们重组成组合输出。

Hunyuan3D-VLM 在所有评估的三维多模态模型中,在部件级问答和对象级描述上均达到最高性能。它在细粒度部件 QA 的语义相似度和词汇准确性上实现了大幅提升,对于整体对象描述也有同样大的增益,表明其具备鲁棒的部件感知和对象级三维理解。部件 QA 语义相似度(SBERT 和 SimCSE)跃升至 85.47 和 89.06,相较次优模型实现了明显飞跃。部件答案的词汇质量显著提高,BLEU-1 从 40.54 升至 49.95,METEOR 从 34.24 升至 45.79。对象描述 SBERT 增至 72.94,ROUGE-L 增至 52.84,分别比最强基线高约 19 和 14 个点。该模型统一了细粒度部件推理和全局语义描述,持续超越先前的三维多模态系统。

Hunyuan3D-VLM 在多种三维理解任务中表现一致,实现了精确的纯定位和强大的多部件定位,同时产生语义准确的描述。模型表现出清晰的权衡:细粒度部件描述提高了框到文本生成的语义相似度,但使单部件定位更具挑战性。纯框列表达到 0.864 的高 IoU,证明无需文本生成的精确部件定位。多部件定位对于粗糙(Q1)和细粒度(Q2)部件标签都保持鲁棒,IoU 分别为 0.880 和 0.844。单部件定位更困难:对于粗糙部件名称(Q1),IoU 从 0.626 降至细粒度描述(Q2)的 0.525,且 Q2 设置下未报告语言指标。在框到文本生成中,细粒度 Q2 描述比粗糙 Q1 标签产生更高的语义相似度(SBERT 74.13,SimCSE 72.99),而 BLEU-1 和 ROUGE-L 等词汇重叠指标较低,表明即使措辞不同也能捕捉语义。该模型在定位、生成和问答任务上取得有竞争力的分数,于单一框架内统一了部件定位、区域条件描述和部件感知推理。

在一项使用 100 个多样化文本提示的人工评估中,所提模型在四路比较中被明显多数选为最佳,在文本对齐、几何质量和综合偏好上大幅超越所有基线。基线在任何标准上的偏好率极少超过 21%,远低于 25% 的随机选择水平,证实了该方法的主导生成质量。所提模型综合偏好率为 56.6%,约为次优基线(18.4%)的三倍。在几何质量上,其被偏好率为 57.1%,是最强竞争对手(21.0%)的两倍多。所有基线在每个指标上均低于 21%,表明它们在四名候选中很少被选为最佳。

在大规模数据引擎上训练的统一三维多模态框架产生指令引导、局部化的几何编辑,忠实保留源形状并优于基线,而扩大文本到三维生成数据无需额外标注即成为编辑性能的关键、成本有效的驱动因素。多粒度描述支持精确的部件级编辑和开放词汇部件提取,同一模型在部件级问答、对象描述和多样化的定位任务上达到领先性能,统一了定位、描述和推理。人工评估证实,在文本对齐、几何质量和综合偏好方面,该方法被强烈偏好于基线。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供