Command Palette
Search for a command to run...
GenFirst:先进行生成再进行重建,实现稳定的端到端潜在生成建模
GenFirst:先进行生成再进行重建,实现稳定的端到端潜在生成建模
Guangting Zheng Yiyuan Zhang Tao Yang Yunpeng Chen Rui Zhu Jiajun Deng Yanyong Zhang
摘要
潜在生成模型通常遵循两阶段流程:先训练变分自编码器进行重建,再在冻结的潜在空间上训练生成模型。由于以重建为优化目标的潜在表示未必适合生成,联合训练两个模型是一种有吸引力的替代方案。然而,直接的端到端训练仍然具有挑战性,因为它容易发生潜在坍缩,并面临生成与重建之间的冲突。本文通过分析不同目标如何塑造潜在空间来重新审视这一问题,并得出两个关键见解。第一,Kullback-Leibler 散度(KL)目标中的熵项对于防止坍缩至关重要:重建和先验拟合都倾向于收缩后验,而熵则保留了非退化的潜在不确定性。第二,重建与生成表现出不对称的学习动态:重建速度快且监督强,而生成速度较慢且更难优化。受这些见解的启发,我们首次实现了不发生潜在坍缩的直接端到端训练,并进一步提出了 GenFirst,一种简单的先进行生成再进行重建的策略。生成目标首先在较弱的重建压力下塑造潜在空间,随后逐步加强重建以恢复视觉细节。我们分别使用具有精确似然的连续自回归先验和具有隐式似然的 SiT 先验验证了这一策略。借助我们的端到端目标和 GenFirst,SiT 在 ImageNet 256 × 256 上使用 CFG 时达到 0.97 的 gFID,不使用 CFG 时达到 1.45,而 MMDiT 在文本到图像生成上达到 0.90 的 GenEval 分数。除图像生成外,我们进一步将该框架扩展到用于生成和表示学习的共享视觉潜在空间,以及连续的文本-图像统一生成。这些结果表明,稳定的端到端潜在学习在不同生成先验和模态之间具有通用性。
一句话总结
中国科学技术大学和字节跳动 Seed 的研究者提出 GenFirst,一种先面向生成再重建的策略,通过利用 Kullback-Leibler 散度目标中的熵项防止隐空间坍塌,并解决非对称学习动态问题,实现了稳定的端到端隐式生成建模,在 ImageNet 256×256 上取得了 0.97 的 gFID,在文本到图像生成上取得了 0.90 的 GenEval 分数。
核心贡献
- 指出先验-熵不平衡是直接端到端训练中隐空间坍塌的关键原因,并证明保留后验熵可防止隐空间退化。
- 揭示重建(快速、强监督)与生成(较慢、分布塑造)之间的非对称学习动态,并提出 GenFirst 策略:先在弱重建压力下塑造对生成友好的隐空间,再逐步加强重建以恢复视觉细节。
- 使用精确似然的连续自回归先验和基于 SiT 的流匹配先验验证 GenFirst,在 ImageNet 256×256 上使用 CFG 取得 0.97 的 gFID,在文本到图像生成上取得 0.90 的 GenEval 分数;进一步实验证实其跨目标和跨模态的适用性,包括共享视觉隐空间和统一的文本-图像建模。
引言
隐式生成模型使用变分自编码器(VAE)将图像压缩到低维隐空间,然后在该隐分布上训练生成模型,从而大幅降低建模复杂度。然而,仅针对重建优化的 VAE 通常会产生过于分散且难以被生成模型学习的隐空间,而直接端到端联合训练 VAE 和生成模型则会出现隐空间坍塌。作者将这种坍塌诊断为先验-熵不平衡:生成目标引入了强大的先验拟合力量,而从标准 VAE 训练中继承的小 KL 权重抑制了后验熵,将隐变量方差驱向零。他们进一步揭示了重建(快速、注重细节)与生成(较慢、塑造分布)之间的非对称学习动态,这造成了冲突。为解决这两个问题,作者引入了一个保留熵的端到端目标,并提出 GenFirst,一种先面向生成再重建的策略,让生成目标在弱重建压力下早期塑造隐分布,然后逐步加强重建以恢复视觉细节,从而产生对生成更友好的隐空间,并为稳定的端到端隐式生成建模提供了实用方案。
方法
标准的隐式生成模型通常分两阶段训练:首先训练变分自编码器(VAE)将图像编码到连续隐空间,然后在冻结的隐表示上训练生成先验。一种自然的替代方案是端到端地联合优化 VAE 和生成先验。然而,直接的端到端训练通常会导致隐空间坍塌。为理解这一点,作者将 VAE 目标中的 KL 散度项分解为先验拟合项和后验熵项。先验拟合项将隐样本拉向参考先验的高概率区域,而熵项通过防止后验退化为点质量来抵消这一作用。在直接端到端训练中,增加的生成目标引入了强大的先验拟合压力,但忽视了 KL 项中保留熵的作用,打破了平衡并将后验方差驱向零。
为解决此问题,作者在统一的端到端目标中明确分离先验拟合和后验熵:
LE2E=λrecLrec+λLPIPSLLPIPS+λGANLGAN+λpriorLprior−λentH(qϕ(z∣x))在此,熵项作为对学习到的先验拟合的关键制衡力量,防止隐空间坍塌。
如上图所示,不同目标将隐后验推向不同方向。当重建占主导时,后验均值分布广泛但方差减小,在隐空间中造成空隙。当先验拟合占主导且熵不足时,均值的标准差和平均方差均减小,导致后验坍塌至近乎常数的编码。添加显式熵项可增加后验方差和重叠,防止坍塌并提高可采样性。
即使有熵项防止坍塌,端到端训练仍面临生成-重建冲突。增加先验损失权重可提高生成质量,但会降低重建保真度,表明这两个目标偏好不同的工作点。作者研究了缩放隐维度、VAE 或生成模型是否能解决此冲突,但发现这些策略仅能转移权衡而无法消除它。类似地,标准损失平衡技术,如恒定权重、余弦衰减或自适应控制,均未能实现令人满意的平衡。
简单损失平衡的失败源于重建与生成之间的非对称学习动态。
如上图所示,重建是一个快速、强监督的映射问题,解码器能迅速从隐样本中恢复视觉细节。相比之下,生成是一个较慢的分布建模问题,需要更长的训练时间才能学习到可采样的隐分布。由于重建在远少于生成的步数内就能达到良好的图像保真度,将冲突视为纯粹的损失平衡问题是不够的。
上图展示了这种权衡,表明没有固定的先验权重能在生成和重建之间实现有利的平衡。为解决此问题,作者提出了一种先面向生成再重建的训练策略,将该冲突视为优化顺序问题。
基于此分析,作者联合优化 VAE 和隐生成模型。给定图像 x,编码器预测后验参数,从中采样隐向量 z,解码器重建图像。先验损失的形式取决于所使用的生成模型。
对于精确似然的连续自回归先验,作者最小化隐负对数似然:
LpriorAR=Ex,c,z∼qϕ(z∣x)[−logpθ(z∣c)],pθ(z∣c)=i=1∏Npθ(zi∣z<i,c)隐张量的空间维度被展平为连续 token 序列。使用带有高斯混合模型头的因果 Transformer 来预测每个连续 token 的条件密度。在端到端训练期间,此损失同时更新自回归先验和 VAE 编码器,重塑隐空间使其更易于先验建模。
对于 SiT 先验,训练的是速度场而非显式似然。给定噪声 ϵt 和时间 t,构造插值隐变量 zt 和速度 v,目标为:
LpriorSiT=Ex,z∼qϕ(z∣x),ϵt,t[∥vθ(zt,t)−(z−ϵt)∥22]由于 SiT 使用标准高斯噪声扰动 z,保留一个小的标准 VAE KL 正则化项以保持隐值尺度有界并防止捷径解。
先面向生成再重建策略基于统一的端到端目标采用两阶段调度。在整个训练过程中,重建、LPIPS 和 GAN 权重保持不变,熵权重与先验权重绑定。
在第一阶段,使用较大的先验权重。强大的生成目标塑造对生成友好的隐空间,同时重建保留图像信息,后验熵防止坍塌。在第二阶段,减小先验和熵权重。这使得重建获得更大的相对影响,恢复视觉细节而不会显著破坏第一阶段形成的对生成友好的隐空间。通过根据非对称学习动态明确分离隐空间形成与重建细化,该策略成功解决了生成-重建冲突。
实验
实验在类别条件的 ImageNet 和文本到图像生成上评估了使用自回归和扩散先验的 VAE 端到端训练。它们揭示了根本性的生成-重建权衡,即更强的先验拟合改善生成但降低重建,并表明简单的损失平衡策略无法解决此冲突。所提出的 GenFirst 策略,先优化生成再细化重建,学习到对生成更友好的隐空间,大幅加速收敛并提高生成质量。进一步的扩展表明,端到端框架可以联合支持表示学习和统一的文本-图像建模,同时提高生成性能和语义表示。
重建损失增加隐均值的散布并减小方差,改善重建但可能损害生成。先验损失同时减小均值散布和方差,增强生成直至坍塌发生。负熵项在不影响均值散布的情况下提高方差,防止坍塌。重建损失提高 Std(μ) 并降低 E[σ²],有助于重建但可能损害生成。负熵增加 E[σ²] 而不改变 Std(μ),防止隐空间坍塌。
带有熵保留和 GenFirst 策略的稳定端到端训练避免了直接端到端训练中出现的数值坍塌,并学习到对生成显著更友好的隐空间。冻结此端到端学习的 VAE 并从头训练新先验,在很大程度上保留了生成优势,证实了隐空间本身驱动了改进。更好的生成伴随着重建保真度的适度下降。直接端到端训练因 NaN 损失而坍塌,而稳定端到端训练保持稳定。在冻结的端到端 VAE 上训练的新先验,将 gFID 从重建训练 VAE 的 36.33 提高到 5.67,对于 SiT 则从 7.90 提高到 3.57。
稳定端到端训练防止了直接端到端目标中观察到的坍塌。冻结端到端训练的 VAE 用于 SiT 训练可获得最强的生成质量,相对于冻结的原始 VAE 和稳定端到端设置,均改善了 gFID 和 IS。在未坍塌的端到端配置中,重建质量保持相似,仅略低于冻结 VAE 基线。直接端到端训练坍塌,而稳定端到端变体避免了坍塌。冻结的端到端训练 VAE 实现了最佳生成性能,比冻结 VAE 基线具有更低的 gFID 和更高的 IS。稳定端到端和冻结端到端训练 VAE 设置的重建指标几乎相同,且接近冻结 VAE 基线。
简单的损失平衡策略,如恒定权重和余弦衰减,各自偏向一个目标而牺牲另一个,未能实现令人满意的生成-重建平衡。GenFirst 在重建解码器之前训练生成先验,在所有稳定方法中取得了最佳生成质量,同时保持重建具有竞争力。这些结果表明,通过优化目标顺序而非调整损失权重,能更好地解决冲突。恒定权重实现了合理的生成,但显著降低了重建。余弦衰减以明显更差的生成为代价改善了重建。PI 自适应控制在训练过程中变得数值不稳定并坍塌。GenFirst 在所有稳定策略中取得了最低的 gFID 和最高的 IS,且重建远强于恒定权重。冻结 VAE 基线显示最佳重建但最差生成,凸显了固有的权衡。研究结果表明,仅调度先验权重无法调和这两个目标;优化顺序至关重要。
在所有 VAE 初始化设置下,EiT 始终优于 REPA 和 REPA-E,取得了更低的 gFID 和更高的 IS。使用 VA-VAE 初始化获得了最佳生成质量,EiT 达到 2.79 的 gFID 和 175.40 的 IS,超越了相应的 REPA-E 配置。这些结果表明,稳定端到端训练学习到了对生成更友好的隐空间。使用 VA-VAE 初始化的 EiT 将 gFID 从 7.90(REPA)降至 2.79,并将 IS 从 122.60 提高到 175.40。在相同的 VA-VAE 初始化下,EiT 在 gFID 上比 REPA-E 改善了 0.67,在 IS 上提高了 15.6。
实验评估了用于平衡重建和生成的 VAE 训练策略,揭示重建损失增加隐均值散布并减小方差,而先验损失同时减小两者,负熵则提高方差以防止坍塌。带有熵保留和 GenFirst 策略(先优化先验再优化解码器)的稳定端到端训练避免了坍塌,学习到对生成友好的隐空间,并优于简单的损失加权,由此产生的 EiT 模型超越了 REPA。这些发现强调,优化顺序和熵控制对于调和重建-生成权衡至关重要。