HyperAIHyperAI

Command Palette

Search for a command to run...

用于生成建模的三体散射

Peng Sun Zhenglin Cheng Deyuan Liu Jun Xie Xinyi Shang Tao Lin

摘要

现代生成模型通常依赖对抗性判别器、预设的噪声到数据路径或自回归分解。与此不同,我们证明适当的分布能量可以诱导样本级运动,并为单步生成器提供直接的回归监督。用于生成的三体散射建模(TBSM)将能量距离转化为每个射弹的恒定规模相互作用:每个射弹被一个真实源吸引,同时被一个独立生成的源排斥。以射弹及其条件为条件,其期望等于 12DE2(Pθ,Q)\scriptstyle { \frac { 1 } { 2 } } D _ { E } ^ { 2 } ( P _ { \theta } , Q )21DE2(Pθ,Q) 的 2-Wasserstein 梯度流速度。一批 B 个冻结目标事件产生 O(B) 个样本级损失,每个损失使用一个参考作为其条件,而非像 Drifting Models 等方法所使用的整个小批量的全对场。在线跟踪此条件期望可以降低场噪声。利用冻结图像特征中的散射,TBSM 在 ImageNet-256 上训练单步生成器,在 NFE = 1 时,像素空间 PixelDiT-XL 达到 FID = 2.23,潜空间 DiT-XL 达到 FID = 1.63。我们提供了一个关联扩散相关监督、Drift 式动力学和 GAN 式目标的设计图谱。这些结果确立了跟踪散射作为实现高维单步生成的一条路径。

一句话总结

西湖大学、浙江大学和伦敦大学学院的研究者提出三体散射建模(Three-Body Scattering Modeling, TBSM),一种单步生成框架,利用每个弹体的吸引-排斥交互来诱导与 12DE2(Pθ,Q)\frac{1}{2} D_E^2(P_\theta, Q)21DE2(Pθ,Q)2-Wasserstein梯度流2\text{-Wasserstein梯度流}2-Wasserstein梯度流 对齐的运动,并通过在线跟踪该条件期望来降低场噪声,TBSM 在 ImageNet-256 上训练生成器,以单次采样步数使用 PixelDiT-XL 达到 FID 2.23,使用 DiT-XL 达到 FID 1.63。

核心贡献

  • TBSM 将能量距离转换为恒定规模的样本级监督,无需对抗判别器、预设的噪声到数据路径或自回归分解。每个弹体被吸引到真实样本,同时被排斥离开发一个生成样本,使得 PixelDiT-XL 在 NFE=1 时于 ImageNet-256 上达到 FID 2.23,DiT-XL 达到 FID 1.63。
  • 在线跟踪散射用学习到的条件期望跟踪器替代带噪的瞬时场估计,降低采样方差。在显式假设下,该方法提供了误差分解、有限误差平稳性和能量距离收敛,且匹配更新配置更倾向于跟踪散射而非瞬时散射。
  • 一个解释性设计图谱将 TBSM 与漂移式动力学、GAN 式位移类比以及通过输入和目标变化实现的扩散相关监督联系起来,将样本级散射定位为一个框架,连接显式分布运动、表示空间匹配和基于判别器的目标。

引言

旨在单步采样的生成模型通常依赖对抗训练、带教师网络的扩散蒸馏或小批量分布匹配,这些方法带来了判别器不稳定、昂贵的多步教师查询或大批量需求等挑战。作者引入三体散射建模(Three-Body Scattering Modeling, TBSM),它将能量距离转换为恒定规模的逐样本交互:每个生成样本被吸引到一个真实观测,同时被排斥离开一个独立生成的样本,在没有教师、对抗或去噪目标的情况下产生模型间的排斥。这种样本级监督自然地处理每个图像描述仅对应一张图像的图文数据集,并且当与对所得含噪向量场进行在线跟踪结合时,它在高分辨率 ImageNet 生成任务上仅需单次网络评估即可取得有竞争力的 FID 分数。

方法

作者将学习目标形式化为条件分布匹配,即最小化生成分布 Pθ(c)P_{\boldsymbol{\theta}}(\cdot \mid \mathbf{c})Pθ(c) 与真实分布 Q(c)Q(\cdot \mid \mathbf{c})Q(c) 之间的期望平方能量距离。该泛函的一阶变分给出一个总体向量场,它决定了生成粒子的散射向量场。该场定义为指向真实样本的期望源间方向向量与指向生成样本的期望源内方向向量之差。

为高效估计该向量场,作者引入三体散射估计量。对于给定条件,该方法从生成器采样一个弹体,从数据分布采样一个真实源,并采样一个独立生成的源。样本级散射估计量计算为源间方向向量与源内方向向量之差。

对于生成器更新,作者采用散射目标回归。他们将弹体沿采样的散射向量移动,构建一个分离的目标。然后训练生成器回归该固定目标。这种冻结目标回归充当局部损失替代,其在当前参数处的期望梯度与能量距离目标的梯度精确匹配。

由于单样本估计量可能噪声较大,作者引入一个跟踪器网络在线近似散射场的条件期望。跟踪器沿生成样本与真实样本之间的路径查询。最终的向量是瞬时随机向量与学习到的跟踪器场的混合,由跟踪监督权重 ρ\rhoρ 控制。这种混合使方法能够在瞬时方差与跟踪器误差之间权衡。

该方法组织在一个由 (ρ,λ)(\rho, \lambda)(ρ,λ) 参数化的生成设计图谱中,其中 λ\lambdaλ 联合设定散射估计量中的源内系数和跟踪器查询范围。

该图谱突出四种参考配置。在 ρ=0,λ=1\rho=0, \lambda=1ρ=0,λ=1 处,方法使用瞬时散射,类似于漂移式粒子动力学。在 ρ=1,λ=1\rho=1, \lambda=1ρ=1,λ=1 处,它在能量距离端点使用跟踪散射,通过用学习到的场替代源采样噪声,得到最佳样本质量。在 ρ=0,λ=0\rho=0, \lambda=0ρ=0,λ=0 处,更新退化为仅源间散射,这与扩散相关目标类似,但缺少完整的去噪结构。最后,在 ρ=1,λ=0\rho=1, \lambda=0ρ=1,λ=0 处,方法遵循从假到真的散射路径,连接到 GAN 式插值,其中跟踪器从沿假到真路径查询的单位方向目标中学习。

对于自然图像的实际部署,作者应用表示空间散射。他们将弹体、真实源和生成源通过一个冻结编码器,并在特征空间中计算散射损失。梯度通过编码器反向传播到生成器,而源特征保持分离。跟踪器被参数化为一个轻量级向量值网络,以避免保守标量势网络所需的高阶自动微分计算成本。

实验

评估聚焦于使用 TBSM 进行单步 ImageNet-256 生成,从预训练的多步模型初始化,并利用冻结编码器的表示场。多编码器场持续提升质量,该方法在像素和潜在空间骨干上取得了有竞争力的 FID 分数,调整 λ 产生类似无分类器引导的权衡。定性观察揭示,指标改善并不总是与视觉伪影减少一致,且该方法受限于编码器保留的信息和未经测试的随机初始化可扩展性。

下表沿着三个轴比较主要的生成范式:是否支持直接单次采样、其经验缩放证据的强度以及生成器监督的粒度。GAN 是唯一一个结合直接生成与逐样本反馈的成熟范式,但其缩放证据不一;扩散模型和自回归模型展现出强大的缩放证据,但需要迭代采样。直接分布动力学方法实现单步生成,且缩放证据在增长,但通常依赖批量估计的监督而非逐样本目标。GAN 独特地提供直接单次生成和来自学习判别器的逐样本监督,但其缩放证据不一。扩散模型和自回归模型具有强大的缩放证据,但需要迭代采样,无法单次生成。单步扩散加速方法表现出可变的采样效率和不断增长的缩放证据,其监督粒度取决于具体技术。直接分布动力学方法实现直接生成和不断增长的缩放证据,但其监督是批量估计的,而非样本级。

组合多个冻结特征空间相比任何单一编码器都能持续提升图像质量。任何包含 SigLIP2-B 的编码器组合在所有个体编码器上,在 FID、FDr⁶ 和 IS 指标上均表现更优。SigLIP2-B + MAE-B 配对在适中的每步成本下获得最佳的感知分数,而加入 ResNet-18 以更高计算代价取得最低的 FID。所有包含 SigLIP2-B 的编码器组合在 FID、FDr⁶ 和 IS 上均超越所有单一编码器。SigLIP2-B + MAE-B 配对在所有配置中给出最佳的 FDr⁶ (21.80) 和 IS (161.36),且每步运行时间低于三编码器场。三编码器场(ResNet-18 + MAE-B + SigLIP2-B)达到最低的 FID (8.29),但平均步时最高。在单一编码器中,MAE-B 产生最低的 FDr⁶ (27.74),SigLIP2-B 产生最高的 IS (131.49) 但最差的 FID,ResNet-18 介于两者之间。在 SigLIP2-B + MAE-B 基础上增加第三个编码器,以更高的每步成本换取 FID 的进一步降低,而 IS 略有下降。

单步 TBSM 生成器在 ImageNet 上接近多步扩散模型的质量,潜在空间 DiT-XL/2 优于像素空间 PixelDiT-XL。在固定散射半径 ρ 下降低源内权重 λ 模拟无分类器引导,同时在 JiT-B 和 PixelDiT-XL 骨干上同时改善 FID 和 Inception Score。TBSM 也支持紧凑像素架构,并借助高分辨率课程学习,在 512×512 分辨率下产生强劲的单步结果。使用 TBSM 的单次网络评估(NFE=1)达到有竞争力的 FID:潜在空间(DiT-XL/2)为 1.63,像素空间(PixelDiT-XL)为 2.23。在固定 ρ=0.9 时,将 λ 从 1.0 降至 0.9,可降低 FID(例如,JiT-B 上从 3.35 降至 2.92)并提升 Inception Score,这是一种类似无分类器引导的经验调参效应。小型的 JiT-B 像素骨干在 (ρ=0.9, λ=0.9) 下达到单步 FID 2.92,展示出与轻量级生成器的兼容性。高分辨率课程学习使得单步 TBSM 在 ImageNet-512 上,潜在 DiT-XL/4 达到 FID 1.92,PixelDiT-XL 达到 FID 3.84。TBSM 样本展现出比一些多步基线更少的块状和网格状伪影,尽管量化指标更差,这表明可能存在指标与伪影的错配。

呈现了三个实验:一个范式比较表、一项关于组合冻结特征编码器的研究,以及对单步 TBSM 生成器的评估。范式分析表明,GAN 独特地提供直接单次生成和逐样本监督,但缺乏强大的缩放证据,而扩散模型和自回归模型缩放良好,但需要迭代采样。编码器研究表明,包含 SigLIP2-B 的编码器组合相比单一编码器持续提升图像质量,SigLIP2-B + MAE-B 配对优化了感知分数,三编码器场以更高计算代价取得最低 FID。TBSM 实验表明,单步生成器可以达到多步扩散模型的质量,潜在空间模型优于像素空间模型,调整一个权重参数可模拟无分类器引导,同时在量化指标更差的情况下减少伪影。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供