Command Palette
Search for a command to run...
Meshy T2:基于流匹配的快速原生网格生成
Meshy T2:基于流匹配的快速原生网格生成
Jiale Xu Rendong Liang Yuhao Long Siyuan Shen Zangyueyang Xian Zeyi Xu Yuanming Hu
摘要
多边形网格是现代 3D 管线中的标准表面表示,生成具有艺术家风格拓扑的高质量网格对于电影、游戏和交互式 3D 应用至关重要。主流方法将网格序列化为 token 序列并自回归地解码,推理速度慢且对误差累积敏感,使其难以用于交互式资产创建。我们提出 Meshy T2,一个基于流匹配构建的快速原生网格生成框架。其核心是一个顶点集网格 VAE,它将网格编码为每个顶点一个连续的隐式 token,并在单次前向传播中解码出顶点、边连接和面环绕顺序,无需顶点量化或焊接即可保留高精度几何和艺术家创作的拓扑。生成过程以由粗到精的级联方式由两个流匹配模型完成:图像条件化的体素流首先将整体形状草绘为一个粗糙的占位骨架,随后网格流在该骨架中填充每个顶点的隐式 token,并以图像、骨架和请求的顶点预算为条件。这一设计提供了三项实用能力:通过并行流式合成实现交互式生成速度;通过请求的顶点预算实现有效的面数控制;以及对多部件资产的原生支持,其组件直接从生成的连接关系中产生。在我们的实验中,Meshy T2 实现了最先进的几何保真度,并在中位 6 秒内完成端到端的图像到网格生成,比自回归基线方法快一个数量级以上。代码和权重将在 https://github.com/meshy-dev/meshy-t2 上发布。
一句话总结
Meshy AI 提出 Meshy T2,一种快速的原生网格生成框架,将基于顶点集的网格 VAE 与从粗到细的级联图像条件体素流和网格流模型相结合,其中网格 VAE 在无需量化的前提下将网格编码为连续的逐顶点 latent token,从而实现了最先进的几何保真度和端到端图像到网格生成,中位耗时为 6 秒。
核心贡献
- 一种近乎无损的顶点集网格 VAE,可将完整网格编码为每个顶点一个连续 latent token,并在单次前向中解码出顶点坐标、边连接性和面环绕顺序,实现了高精度几何、艺术家创作的拓扑结构及部件结构,无需顶点量化或重合顶点焊接。
- 用于直接图像到网格生成的两阶段流匹配流程:图像条件体素流生成粗略的占位脚手架,网格流在其中根据最优传输分配的位置编码填充逐顶点 latent token,完成端到端合成,中位时间为 6 秒。
- 面数控制通过解码前指定顶点数预算实现,该预算通过三角网格的欧拉关系直接控制预期的面数,无需事后简化。
引言
多边形网格是实时 3D 应用的基石,然而,要生成兼顾几何保真度、低顶点预算和清晰、艺术家风格的拓扑结构且紧凑的资产,仍然是一个手动、缓慢的过程。现有的高质量 3D 生成器通常依赖隐式或体积表示,并通过等值面提取生成密集、近似均匀的网格;这些需要后简化,会扭曲锐利特征和部件边界。将直接网格生成为序列建模虽然能产生紧凑的拓扑,但强制了不自然的一维顺序,使推理成本高昂,并可能因序列错误而导致无效曲面。最近的扩散和基于流的方法通过并行生成解决了这一问题,但它们通常对顶点进行量化或启发式地重建面,导致伪影,并且它们主要针对已知曲面的重拓扑,而非图像到网格生成。作者提出了 Meshy T2,一种基于流的框架,通过定制的网格 VAE 保留了近乎无损的顶点集几何与连接性,支持十秒内完成直接的图像到网格创建,并赋予用户对顶点数预算的显式控制,无需事后简化。
方法
作者提出了 Meshy T2,这一系统在 latent 空间中生成网格,其中每个 token 恰好对应一个顶点。该表征通过顶点集网格 VAE 建立。生成本身是由两个流匹配模型组成的从粗到细的级联,并以 Rectified Flow 的线性插值方案实例化。给定一张参考图像,体素流首先将大体形状草绘为一个 643 的占位脚手架;然后,latent 流在该脚手架中填充逐顶点 latent token,并同时由图像、体素脚手架和请求的顶点数预算联合引导。使用 VAE 解码器解码生成的 latent 集即可得到最终网格。
VAE 将三角网格 M=(V,F) 编码为一个 latent 集 Z={zi}i=1V,其中每个顶点恰好有一个 token zi∈RC,并仅根据 z 解码出顶点位置和拓扑结构。与之前量化顶点坐标的网格生成器不同,该 VAE 连续地回归位置,并为重合顶点保留不同的 token,从而保留了高精度几何和艺术家创作的拓扑结构。
编码器根据两个输入为每个真实顶点生成一个 latent token:一个是总结曲面信息的稀疏体素上下文,另一个是逐顶点 query token。该上下文通过局部 PointNet 将曲面采样点汇集成特征,放置在 2563 稀疏体素网格上。每个顶点 query 由其连续位置的傅里叶特征初始化。这些 query 通过与体素上下文进行交叉注意力加以精炼,随后通过交替的图注意力和自注意力层进行加工。解码器是一个纯集解码器,在不使用位置编码的前提下消费 latent token。它为每个顶点预测连续位置 x^i、边嵌入 ei 和面嵌入 fi。边预测采用邻接关系的时空视角,使用一个 Minkowski 风格的对数几率对所有顶点对进行评分:
Aij=∥eitime−ejtime∥22−∥eispace−ejspace∥22面预测通过预测每个顶点三角扇的循环顺序来组装有向面,表示为邻居 N(i) 上的后继映射 πi。为处理开放边界,πi 的定义域通过 NULL 元素 ∅ 进行扩展。面预测头部利用 Sinkhorn 迭代预测 πi 的软版本 Pi。在推理时,解码器输出通过对边对数几率进行阈值处理,并将软后继映射舍入为硬排列,从而转换为显式网格。
为应对直接从单张图像生成逐顶点 latent 集的困难,作者将生成分为两个阶段。第一阶段合成一个粗略的几何脚手架:二值占位网格 O∈{0,1}64×64×64。生成在预训练 Voxel VAE 的连续 latent 空间中运行,以消除空间冗余。
Voxel VAE 是一个密集 3D 卷积 VAE。编码器通过两个步长为 2 的阶段将占位网格压缩成分辨率为 163 的空间因子化高斯后验。镜像解码器通过两个 3D pixel-shuffle 上采样阶段将 latent 网格映射回占位对数几率。训练完成后,VAE 被冻结,每个占位网格由其作为后验均值 zvoxel=muϕ(O)∈R8×163 表示。
脚手架生成器是一个作用于 latent 网格上的 Transformer 速度场 fθ。后验均值被展平为 163=4096 个 token,每个都保留其三维坐标。加噪后的 token 由一系列时间调制的 Transformer 块进行处理。结合 3D 位置编码的自注意力模型化空间单元间的依赖关系,而由冻结的 DINOv3 骨干网络编码的参考图像则通过交叉注意力注入。模型通过速度预测流匹配进行训练。在推理时,生成的 latent 网格由冻结的 Voxel VAE 解码,并阈值化为二值占位脚手架。
第二个生成阶段作用于由 Mesh VAE 生成的 latent 集。作者训练一个流匹配模型,在图像、体素和顶点数条件的作用下,将高斯噪声映射到纯净 latent 集 x0={zi}i=1N。
图像条件使用冻结的 DINOv3 图像编码器,体素条件则从 643 二值占位网格开始,由 Voxel VAE 编码器编码为 163 latent 网格。为间接控制面数,生成以顶点数为条件。由于精确的数量控制难以学习,作者通过在训练期间为 latent 集随机附加零值填充 token,将其放宽为范围控制。流模型是一个单流 DiT,其中 latent、图像和体素 token 被拼接在一起,并通过自注意力联合处理。为应对 latent token 的无序特性,作者为每个 latent token 分配一个来自确定性 Sobol 点集的位置。训练期间,真实顶点通过最小化平方欧氏代价的最优传输分配与 Sobol 候选点匹配。推理时,Sobol 点集本身直接提供 latent token 的位置。模型通过速度预测流匹配训练,并在训练中使用 classifier-free guidance 来丢弃条件。
实验
评估使用一个包含 115 个多样化资产的精选基准,在严格的面数预算和鲁棒性约束下,比较高面数重拓扑和图像到网格生成的流程。消融实验证实,与标准替代方案相比,最优传输位置编码(Sobol OT)极大地提升了几何保真度和网格拓扑,带来了最大的验证收益。在重拓扑方面,Meshy T2 实现了最佳的几何对齐和适应艺术家的拓扑,同时运行速度比竞争方法快一个数量级,且具有完全可靠性。对于图像到网格生成,它提供了领先的语义对齐,并在几秒内完成,成功率达到完美,在整体质量和交互式资产创建的实用性方面均超越扩散和自回归基线。
对顶点集网格 VAE 的位置编码策略进行消融实验表明,在 Sobol 候选点与顶点坐标之间求解完整的最优传输分配,可显著提升所有验证指标。与完全跳过传输相比,Chamfer 距离下降了 45%,与更廉价的 Morton 顺序配对相比下降了 23%,而 Hausdorff 距离缩小了超过三倍,证实了传输步骤(而非仅仅是 Sobol 采样)驱动了几何精度的提升。与基于索引的编码相比,完全 Sobol 最优传输将 Chamfer 距离降低了 45%,与按 Morton 顺序配对的 Sobol 候选点相比降低了 23%。Sobol OT 下的 Hausdorff 距离比无传输时低三倍以上,比 Morton 配对低 58%,显示了最差情况下曲面对齐的决定性改进。
Meshy T2 在高面数重拓扑中实现了最佳的几何保真度和拓扑结构,取得了最低的 Chamfer 和 Hausdorff 距离以及最高的法线一致性,同时以中位 3 秒的时间完成每个资产。MeshAnything V2 和 BPT 表现出具有竞争力的几何,但速度慢了一个数量级以上。DeepMesh 和 MeshSilksong 成功率低且几何一致性差,使得它们在此任务中不可靠。Meshy T2 仅用 3 秒即可将密集的 10 万面网格重拓扑为清晰的艺术家网格,在所有方法中具有最低的 Chamfer 距离(0.020)和最高的法线一致性(0.860)。鲁棒性差异很大:Meshy T2、MeshFlow、MeshAnything V2 和 FastMesh 在 100% 的测试资产上均成功,而 DeepMesh 和 MeshSilksong 在 20 分钟时限内对一半以上的资产未能产出有效输出。
原生图像到网格扩散方法实现了完美的成功率和比自回归两阶段流程更快的生成速度,其中 Meshy T2 在速度(6 秒)和感知对齐方面均领先。MeshFlow 在光度匹配方面最接近,但速度较慢,而 DeepMesh 和 MeshSilksong 成功率低且运行时间极长,使其不适用于交互式使用。扩散方法(Meshy T2、Tripo P1、MeshFlow)均达到 100% 成功率,Meshy T2 和 Tripo P1 的中位时间仅需 6 秒和 12 秒。MeshFlow 记录了最低的 Inception FD(254.06),而 Meshy T2 取得了最低的 DINOv2 FD(2312.01),表明其与源照片的语义对齐更强。自回归基线(MeshAnything V2、BPT)可靠(成功率 95.7–100%),但需要 49–210 秒,比最快的扩散方法慢一个数量级。DeepMesh 和 MeshSilksong 显示出最高的 FD 分数,成功率低于 50%,中位运行时间超过十分钟,使其无法用于交互式资产创建。FastMesh 在 DINOv2 FD(2405.57)上介于最佳自回归和扩散方法之间,而 DeepMesh 严重偏离参考分布(2752.54)。
对顶点集 VAE 的消融实验证实,与单纯排序或无传输相比,结合 Sobol 采样的最优传输极大地提高了几何精度。在高面数重拓扑中,Meshy T2 仅用 3 秒实现了最佳的保真度和拓扑,而竞争方法要么慢十倍以上,要么在许多资产上失败。对于图像到网格生成,像 Meshy T2 这样的原生扩散方法以 100% 的成功率提供了快速且感知对齐的输出,而自回归流程则更慢,且某些替代方案被证明不可靠。