HyperAIHyperAI

Command Palette

Search for a command to run...

无分类器引导调度表的对抗学习

Ashwini Pokle Arnaud Doucet Alexandre Galashov Mauricio Delbracio Valentin De Bortoli

摘要

现代文本到图像扩散模型依赖无分类器引导(CFG)来实现高图像保真度和文本对齐。然而,CFG 通常在所有时间步、样本和条件上施加静态的全局尺度——这一选择通常并非最优,并且可能引入伪影,因为不同状态可能受益于不同程度的引导。尽管已知随时间变化的调度表能够提升质量,但手工设计它们并非易事,且依赖于具体应用。在本文中,我们将引导调度表学习为扩散时间、条件以及当前含噪样本的函数,以便使采样图像与文本提示更好地对齐。我们将此问题构建为密度比估计问题:训练一个判别器来估计真实边际分布与受引导边际分布之间的时间相关对数密度比,同时由一个轻量级生成器网络预测最优的、依赖状态的引导尺度。实验表明,在文本到图像生成基准上,我们的方法优于启发式 CFG 调度表以及先前学习动态引导的方法。

一句话总结

来自 Google、Google DeepMind 和 Gatsby UCL 的研究者提出学习无分类器引导调度,将其作为扩散时间、条件信号和当前含噪样本的状态依赖函数,并将问题构建为密度比估计:判别器估计时间依赖的对数密度比,轻量生成器预测最优引导尺度;该方法在文本到图像生成基准上优于启发式 CFG 调度和先前的动态引导学习方法。

核心贡献

  • 本文提出一种用于文本到图像扩散模型的学习型引导调度,根据扩散时间、条件信号和当前含噪样本预测最优引导尺度,解决静态和手工设计的无分类器引导调度的次优性问题。
  • 所提方法将动态引导建模为密度比估计,并沿扩散采样轨迹施加边际一致性条件;判别器估计真实边际分布与引导边际分布之间的时间依赖对数密度比,轻量 MLP 生成器预测调度,保持推理开销可忽略。
  • 在 MS-COCO 512x512 上的实验表明,所学调度器在人类偏好和文本对齐指标上优于恒定 CFG、启发式动态调度以及先前的学习型引导方法。

引言

扩散模型和流匹配模型是高保真图像与视频生成的主流生成方法,无分类器引导(CFG)在实际文本到图像质量中起着核心作用。然而,恒定的 CFG 权重通常会导致伪影和过饱和,而启发式动态调度需要针对数据集进行调参,并且对提示词复杂度不敏感。先前的学习型引导调度可以适应条件信号和时间步,但一种基于自一致性的方法改善了样本质量,却未能在文本对齐上持续超越恒定 CFG。作者改为使用对抗式 GAN 风格框架施加更弱的边际一致性条件:判别器估计真实边际分布与引导边际分布之间的密度比,生成器学习依赖于时间步、条件信号和样本的引导尺度,从而获得比恒定引导和先前学习型引导基线更好的文本对齐与图像质量。

方法

作者提出一种学习扩散采样动态引导权重的方法,该方法将问题表述为基于密度比估计的生成对抗网络。其核心目标是施加边际一致性,确保在任何给定时间步上,引导粒子的分布与真实数据分布一致。

与使用静态标量进行无分类器引导不同,作者将引导权重 ω\omegaω 参数化为源时间步与目标时间步 (s,t)(s, t)(s,t)、条件信号 ccc 以及当前含噪样本 xsx_sxs 的函数。这使模型能够沿特定噪声轨迹精细调整引导强度。为了施加边际一致性 pts,ω(xt)pt(xt)p_t^{s,\omega}(x_t) \approx p_t(x_t)pts,ω(xt)pt(xt),作者最小化引导边际分布与真实边际分布之间的 Kullback-Leibler 散度。该散度被重写为密度比 rtω(xt)=pt(xt)/pts,ω(xt)r_t^\omega(x_t) = p_t(x_t) / p_t^{s,\omega}(x_t)rtω(xt)=pt(xt)/pts,ω(xt) 的形式。

为了估计该密度比并优化引导权重,作者使用一个判别器和一个生成器。判别器 dϕ(xt,s,t,c)d_\phi(x_t, s, t, c)dϕ(xt,s,t,c) 是卷积网络,被训练用于区分真实边际样本 xtrealpt(xt)x_t^{\text{real}} \sim p_t(x_t)xtrealpt(xt) 和引导边际样本 xtfake(ω)pts,ω(xt)x_t^{\text{fake}}(\omega) \sim p_t^{s,\omega}(x_t)xtfake(ω)pts,ω(xt)。判别器使用标准二元交叉熵损失进行优化,并辅以 R1R_1R1 梯度惩罚,以保证密度比估计平滑。收敛时,最优判别器的 logit 直接恢复对数密度比。

生成器以轻量级多层感知机实现,预测非负引导权重。为使预测在计算上高效且稳健,网络不直接以原始高维隐变量作为输入,而是基于摘要统计量向量进行运算,包括条件速度的对数范数、当前隐变量与引导方向之间的余弦相似度、到数据流形的对数距离,以及时间步的 Fourier 嵌入。生成器通过最小化判别器输出进行训练,并辅以 L2L_2L2 稳定惩罚和基于奖励的损失,以促进更好的对齐。

训练策略遵循对抗范式,采用双时间尺度更新规则(Two-Time-Scale Update Rule),交替更新判别器和生成器。训练循环的一个关键点是使用从数据集中抽取的独立图像-条件对。一对用于通过前向流生成真实边际目标,而完全独立的另一对用于定义假的引导样本。这种独立采样防止判别器简单记忆单条轨迹的噪声结构,迫使其评估在该特定时间步上引导粒子的全局分布是否与真实数据分布匹配。

实验

实验在 MS-COCO 512x512 分辨率上评估用于文本到图像生成的学习型动态引导调度,使用冻结的 740M 和 1.05B 参数 MMDiT 模型,基线包括无引导生成、恒定 CFG、启发式调度以及先前基于一致性的学习型引导。主要结果表明,所提出的对抗式边际一致性方法在两种模型尺寸上都改善了文本对齐、美学质量和人类偏好评分,同时以略微增加 FID 为代价。消融实验验证了将含噪隐变量作为引导网络的条件输入可在略微增加 FID 的情况下提升性能,并且结果对时间分布参数具有稳健性;还进一步研究了采样步数、架构和噪声。作者得出结论:该调度器有效,但训练成本高且依赖特定骨干网络,限制了对新模型的零样本迁移。

在较小的 MMDiT-XS 模型上,引导相比于无引导生成改善了 CLIP、美学评分、HPSv2 和 PickScore。据报道,对抗式边际一致性调度取得了最高的 CLIP 和美学评分,而 LIG 启发式以较低对齐为代价达到最低的 FID。这些对齐增益迁移到更大的 MMDiT-S 模型,FID 的适度增加被归因于对抗式优化和 CLIP 奖励优化。无引导生成在所有对齐和人类偏好指标上均落后于所有引导方法。所学边际一致性调度取得最高 CLIP 和美学评分,而 LIG 具有最低 FID,显示出真实性与提示词对齐之间的权衡。

边际一致性对抗调度在更大的 MMDiT-S 模型上改善了文本到图像对齐和人类偏好指标,同时仅带来适度的 FID 增加。增益从小模型迁移而来,说明所学动态引导随模型容量扩展。这一权衡反映了从低层 Inception-v3 统计特征转向语义和美学特征。所学调度在 CLIP、美学评分和 HPSv2 指标上优于恒定引导和人工调节的启发式调度。该方法引入适度 FID 增加,这被归因于对抗训练和 CLIP 奖励优化优先考虑语义对齐和视觉吸引力,而非 Inception-v3 统计特征。

在 MMDiT-XS 和 MMDiT-S 上,与仅以 s、t 和 c 为条件相比,为引导网络提供 x_s 改善了 CLIP、Aesthetic、HPSv2 和 PickScore。然而,这一额外信息在两种模型尺寸上都一致地恶化了 FID。结果表明,以 FID 衡量的保真度与文本对齐或人类偏好指标之间存在一致的权衡。为引导网络加入 x_s 在两种模型尺寸上都一致改善 CLIP、Aesthetic、HPSv2 和 PickScore。同样的条件变化一致增加 FID,表明可能存在保真度权衡。该趋势在 MMDiT-XS 和 MMDiT-S 上保持一致。

在 0.01 到 0.20 的 δ 值范围内,MMDiT-XS 性能大致保持稳定。测试中最大的 δ 给出最佳 FID,而中间 δ 给出最佳 HPSv2 以及接近最佳的 CLIP 和美学评分。随着 δ 增大,PickScore 仅略有下降。在 FID、CLIP、美学评分、HPSv2 和 PickScore 上,性能对 δ 基本不敏感。在测试值中,δ=0.20 达到最低 FID,而 δ=0.10 达到最高 HPSv2。CLIP 和美学评分在测试的 δ 值上几乎持平,PickScore 随 δ 增大小幅下降。

这些实验评估了使用 MMDiT-XS 和 MMDiT-S 模型的引导生成,比较无引导输出、恒定引导、所学边际一致性调度和启发式调度。引导一致地改善 CLIP、美学评分、HPSv2 和 PickScore,优于无引导生成,所学对抗式边际一致性调度将这些增益迁移到更大模型,仅带来适度 FID 增加。为引导网络提供 x_s 进一步改善对齐指标,但在两种模型尺寸上恶化 FID,显示出一致的保真度与对齐权衡。结果对测试的 δ 值基本不敏感,最大 δ 给出最佳 FID,中等 δ 给出最佳 HPSv2。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供