HyperAIHyperAI

Command Palette

Search for a command to run...

重新审视在线策略扩散蒸馏中的无分类器引导

Bingnan Li Haozhe Wang Haozhong Xiong Fangtai Wu Jinpeng Yu Yang Shi Jiaming Liu Ruihua Huang

摘要

在线策略蒸馏(OPD)通过沿当前学生模型生成的轨迹查询教师模型来适配扩散模型,但它在无分类器引导(CFG)这一现代扩散系统默认组件下的行为方式仍缺乏清晰理解。现有 OPD 方法自然地将速度匹配扩展到 CFG 组合预测上,直接匹配教师与学生模型的引导速度。本文表明,该目标在分支层面存在欠定性:正分支与负分支的误差可在引导预测中相互补偿。通过两个对比案例,我们发现,在共享负条件的情况下,朴素匹配仍然有效,此时两个分支的误差会共同下降。然而,当模型原生的 CFG 模式在教师负分支中保留了学生无法获取的特权信息时,这种共同下降会被打破,组合目标会引发对抗性的分支误差动态,导致正分支误差下降而负分支误差上升。我们将这一失效模式称为负分支不对称(NBA)。为解决 NBA,我们提出了正方向匹配(PDM),一种分支感知的 OPD 目标,它分别约束正预测和 CFG 条件方向。我们将 PDM 应用于稠密到稀疏的视频控制任务,在该任务中,朴素引导匹配对推理引导尺度高度敏感,而分支感知的监督则能实现更鲁棒、更有效的知识迁移。

一句话总结

阿里巴巴通义部门提出了正向-方向匹配(PDM),这是一种分支感知的在线策略蒸馏目标,分别约束正预测和无分类器引导(CFG)条件方向,以解决负分支不对称性(NBA),并实现从密集到稀疏视频控制的稳健知识迁移。

核心贡献

  • 负分支不对称性(NBA)被确定为在使用无分类器引导的在线策略蒸馏中的一种失败模式,其中教师负分支中的特权信息阻止了分支错误的联合减少,并引发对抗性动态。
  • 正向-方向匹配(PDM)被引入作为一种分支感知目标,分别监督正预测和CFG条件方向,消除了跨分支误差补偿。
  • 密集到稀疏视频控制实验表明,PDM在不同推理引导尺度上改善了知识迁移和稳健性,而图像领域研究则证实了NBA出现的条件。

引言

无分类器引导(CFG)对现代扩散模型至关重要,但标准的在线策略蒸馏(OPD)可能仅匹配教师的有引导速度,即正分支和负分支预测的组合。该组合目标欠定:它约束的是分支误差的线性组合,而让各分支误差可以自由补偿。先前的工作要么将CFG内化到单个学生预测中,要么在教师和学生之间共享负条件,从而避免了这一问题。作者揭示,当教师的负分支拥有学生无法获得的特权信息时,这种模糊性会导致对抗性的分支误差动态,他们将这一失败模式称为负分支不对称性(NBA)。所产生的学生对推理引导尺度的变化变得敏感。为解决这一问题,他们提出了正向-方向匹配(PDM),分别监督正预测和CFG条件方向,消除跨分支误差补偿,提升在密集到稀疏视频控制任务中跨引导尺度的稳健性。

方法

作者采用扩散模型的在线策略蒸馏(OPD)框架,在该框架中,学生模型在其自身迭代去噪过程中访问的噪声状态上进行训练。令 xtSpθ\mathbf{x}_{t}^{S} \sim p_{\theta}xtSpθ 表示这样的状态。在每个访问状态,教师和学生定义各自的局部去噪步骤,这些步骤基于可能不同的信息 cT\mathbf{c}_{T}cTcS\mathbf{c}_{S}cS 进行条件化,因为教师可能能够访问学生仅能部分获得的特权信号。核心OPD目标在学生的访问状态上最小化教师与学生速度预测之间的差异,得到转移级损失

LOPD=ExtSpθ,t[w(t)vT(xtS,t,cT)vS(xtS,t,cS)22],\mathcal{L}_{\mathrm{OPD}} = \mathbb{E}_{\mathbf{x}_{t}^{S} \sim p_{\theta},\, t} \left[ w(t) \left\| \mathbf{v}_{T}(\mathbf{x}_{t}^{S}, t, \mathbf{c}_{T}) - \mathbf{v}_{S}(\mathbf{x}_{t}^{S}, t, \mathbf{c}_{S}) \right\|_{2}^{2} \right],LOPD=ExtSpθ,t[w(t)vT(xtS,t,cT)vS(xtS,t,cS)22],

其中 vT\mathbf{v}_{T}vTvS\mathbf{v}_{S}vS 是各自的速度预测,w(t)w(t)w(t) 吸收了依赖于求解器和参数化的权重。

当教师和学生使用缩放系数 γ>1\gamma > 1γ>1 的无分类器引导(CFG)时,去噪速度变为正分支和负分支预测的线性组合:

v~=γv++(1γ)v.\widetilde{\mathbf{v}} = \gamma \mathbf{v}^{+} + (1 - \gamma) \mathbf{v}^{-}.v=γv++(1γ)v.

当存在特权信息(例如参考图像或控制信号仅对教师可用)时,教师和学生的负分支常常不同。在这种情况下,天真地匹配CFG组合速度,

Lnaive=ExtSpθ,t[w(t)γe++(1γ)e22],\mathcal{L}_{\mathrm{naive}} = \mathbb{E}_{\mathbf{x}_{t}^{S} \sim p_{\theta},\, t} \left[ w(t) \left\| \gamma \mathbf{e}_{+} + (1 - \gamma) \mathbf{e}_{-} \right\|_{2}^{2} \right],Lnaive=ExtSpθ,t[w(t)γe++(1γ)e22],

其中 e+=vT+vS+\mathbf{e}_{+} = \mathbf{v}_{T}^{+} - \mathbf{v}_{S}^{+}e+=vT+vS+e=vTvS\mathbf{e}_{-} = \mathbf{v}_{T}^{-} - \mathbf{v}_{S}^{-}e=vTvS,引入了补偿问题。损失仅要求 γe++(1γ)e=0\gamma \mathbf{e}_{+} + (1 - \gamma) \mathbf{e}_{-} = \mathbf{0}γe++(1γ)e=0,这允许分支误差非零但在有引导的输出中相互抵消。当特权负条件导致降低 e+\|\mathbf{e}_{+}\|e+ 而增加 e\|\mathbf{e}_{-}\|e 的对抗动态时,这种分支模糊性就成为一种失败模式,称为负分支不对称性(NBA),从而在推理时改变引导尺度会损害性能。

为消除这种跨分支补偿,作者提出了分支感知的OPD目标,在CFG组合之前对预测进行监督。主要形式是正向-方向匹配(PDM),分别匹配正分支和条件方向 dM=vM+vM\mathbf{d}_{M} = \mathbf{v}_{M}^{+} - \mathbf{v}_{M}^{-}dM=vM+vM

PDM=e+22+λdTdS22=e+22+λe+e22,\ell_{\mathrm{PDM}} = \left\| \mathbf{e}_{+} \right\|_{2}^{2} + \lambda \left\| \mathbf{d}_{T} - \mathbf{d}_{S} \right\|_{2}^{2} = \left\| \mathbf{e}_{+} \right\|_{2}^{2} + \lambda \left\| \mathbf{e}_{+} - \mathbf{e}_{-} \right\|_{2}^{2},PDM=e+22+λdTdS22=e+22+λe+e22,

其中 λ>0\lambda > 0λ>0 控制方向匹配强度。第一项锚定正预测,第二项保持CFG条件方向,强制 e+\mathbf{e}_{+}e+e\mathbf{e}_{-}e 趋于零,消除补偿自由度。作为基线,独立分支匹配(IBM)直接匹配两个分支,其每分支权重由展开的天真损失推导,但不含交叉项:

IBM=γ2e+22+(γ1)2e22.\ell_{\mathrm{IBM}} = \gamma^{2} \left\| \mathbf{e}_{+} \right\|_{2}^{2} + (\gamma - 1)^{2} \left\| \mathbf{e}_{-} \right\|_{2}^{2}.IBM=γ2e+22+(γ1)2e22.

PDM和IBM都禁止了模糊解,但PDM旨在显式保持条件方向,而IBM通过独立项强制分支级对齐。

针对计算代价高昂的密集到稀疏视频蒸馏,作者引入了一种减少教师评估的高效监督策略。在学生访问的完整去噪轨迹状态 {xtkS}k=0N1\{ \mathbf{x}_{t_{k}}^{S} \}_{k=0}^{N-1}{xtkS}k=0N1 中,仅前 KKK 个状态接收教师监督:

LOPD(K)=E{xtkS}pθ[1Kk=0K1w(tk)(xtkS,tk)].\mathcal{L}_{\mathrm{OPD}}^{(K)} = \mathbb{E}_{\{ \mathbf{x}_{t_{k}}^{S} \} \sim p_{\theta}} \left[ \frac{1}{K} \sum_{k=0}^{K-1} w(t_{k}) \ell(\mathbf{x}_{t_{k}}^{S}, t_{k}) \right].LOPD(K)=E{xtkS}pθ[K1k=0K1w(tk)(xtkS,tk)].

学生仍完成完整的去噪展开,但教师损失仅在这些早期状态上计算,从而大幅降低训练成本并保持输出质量。设置 K=NK = NK=N 恢复全轨迹监督;较小的 KKK 降低每次迭代的算力。这种部分监督仅应用于密集到稀疏视频设置,而图像域实验遵循其标准的全轨迹协议。

实验

评估首先通过比较文本渲染蒸馏(共享负条件)和参考条件蒸馏(特权条件)来诊断负分支模糊性(NBA),揭示了NBA导致对抗性分支误差和过度的引导敏感性,而分支感知的在线策略蒸馏(PDM)解决了这一问题。应用于密集到稀疏视频控制时,PDM在不同引导尺度上持续提升了姿态、深度和涂鸦控制的保真度,优于天真匹配和其他基线。消融实验验证了默认的方向匹配权重和适中的监督范围。

在文本渲染蒸馏中,教师、天真学生和PDM学生在不同引导尺度上产生了非常相似的OCR奖励曲线,均在γ=1时显著下降,并随着引导增强获得相近的提升。缺乏无分类器引导时的性能损失源自教师,而非天真蒸馏引入。教师和两个学生模型表现出几乎相同的趋势,OCR奖励从γ=1时的约74–75升高到高引导尺度下的约94。γ=1时性能降低反映了教师对CFG的内在依赖,而非天真蒸馏带来的额外敏感性。

分支感知的在线策略蒸馏显著改善了密集到稀疏视频控制,优于天真匹配、SFT和离线策略基线。PDM在姿态、深度和涂鸦模态上提供了最一致的控制保真度提升,而IBM在几乎所有指标上也优于天真匹配。在姿态特定评估中,IBM在学生派生方法中获得了最佳空间精度和分布质量。PDM在训练引导尺度下于姿态、深度和涂鸦模态上实现了最一致的控制保真度改进。IBM在多数控制指标上优于天真OPD,证实了阻止跨分支误差补偿能增强保真度。对于姿态控制,OPD(IBM)获得了最低的MPJPE、最高的PCK分数和最佳FID,表明相对于其他非教师方法,姿态精度和图像质量更优。

当推理引导尺度偏离训练值5时,天真匹配在姿态控制和视频质量上严重下降,而分支感知方法IBM和PDM保持稳健。IBM在所有测试尺度上维持低关键点误差和高视觉保真度,PDM提供了最一致的控制保真度。天真匹配:当推理引导降至1时,MPJPE增加逾倍,FVD跳升至507.7,暴露出对偏离训练引导尺度的极度敏感性。IBM:在所有尺度上关键点MPJPE低于5.0,FVD低于72,证实分支感知监督消除了天真匹配中出现的急剧退化。

将方向匹配权重λ设为1可获得最佳控制保真度,在所有测试值中关键帧MPJPE最低且[email protected]最高。较高的λ值(5和10)产生了适度的更优分布质量(更低的FID和FVD),但持续降低了关键点精度和正确关键点百分比。纯正分支变体(λ=0)在关键帧指标上略逊于λ=1,证实了纳入条件方向匹配的益处。关键帧MPJPE从λ=0时的2.81降至λ=1时的2.75,随后随λ增大稳步上升,在λ=10时达3.07。关键帧[email protected]在λ=1时峰值91.66,λ=10时降至89.93,表明更大的λ削弱了精确对齐。FID从13.97(λ=0)改善至12.96(λ=10),FVD在λ=5时达到最小值56.85,表明较高的λ增强了整体分布真实感。采用λ=1获得了最佳的复合权衡,相比于λ=0提升了关键帧精度,同时相比于更大的λ保持了有竞争力的质量指标。

将监督范围从一步增加到八步逐步改善了关键帧控制保真度,K=8获得了最低的关键点姿态误差和最高的PCK分数。扩展到全轨迹监督将训练成本急剧提升至每步790秒,同时控制精度反而恶化,使K=8成为最有效且实用的设置。K=8实现了最强的控制保真度,在所有评估范围中获得了最佳关键点MPJPE和[email protected]。全轨迹监督(K=50)使关键点精度降至甚至低于K=1,同时每步训练时间增加34倍。训练时间从K=1到K=8由23秒平稳增长至132秒每步,随后在K=50时跃升至790秒。

针对文本渲染和密集到稀疏视频控制的蒸馏实验表明,天真在线策略蒸馏继承了教师对无分类器引导的依赖,未引入额外敏感性。分支感知方法(IBM和PDM)在不同推理引导尺度上提供了稳健的控制保真度并防止了跨分支误差,其中PDM相对于基线取得了最一致的改进。超参数消融实验确定,方向匹配权重为1且8步监督范围在空间精度、图像质量和训练效率之间提供了最佳权衡。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供