Command Palette
Search for a command to run...
Self-OPD:面向流匹配模型的无教师在线策略蒸馏
Self-OPD:面向流匹配模型的无教师在线策略蒸馏
摘要
在线策略蒸馏(OPD)利用预训练的专用教师模型提供密集监督信号,已在大语言模型(LLM)中取得显著成功,并近期被适配至流匹配模型。然而,该范式存在两个主要问题:第一,为每个新目标训练一个独立的任务特定教师会带来高昂的计算成本;第二,教师与学生分布之间的差异往往会导致生成轨迹上的复合误差。本文提出 Self-OPD,一种面向流匹配模型的无教师 OPD 框架,将学生自身的自我探索转化为逐步监督。在每个时间步,Self-OPD 将确定性下一状态预测分支为 K 个随机 SDE 候选,通过 ODE 采样器展开它们,并将其奖励与确定性自参照基线进行比较,以获得归一化优势。速度场通过一个全分支推拉目标进行优化,其中高优势分支在方向感知衰减和 SDE 方差归一化下吸引学生,低优势分支则排斥学生。对于多目标对齐,Self-OPD 在奖励层面融合归一化分数,避免了直接的梯度冲突。在单奖励和混合奖励基准上的实验表明,Self-OPD 在无需任务特定教师的情况下,性能优于先前的 RL 和 OPD 方法。
一句话总结
清华大学、浙江大学和阿里巴巴集团的研究者提出 Self-OPD,一种面向 flow matching 的无教师 on-policy 蒸馏框架。该框架通过将下一状态预测分支为 K 条随机 SDE 候选,并施加奖励级融合的全分支 pull-push 目标,将学生的自探索转化为逐步监督,在单一奖励和混合奖励基准上均优于以往的 RL 和 OPD 方法,且无需特定任务的教师模型。
核心贡献
- 本文提出 Self-OPD,一种面向 flow matching 模型的无教师 on-policy 蒸馏框架,将奖励引导的自探索与自参照基线转化为稠密的逐步监督,并通过在单一奖励和混合奖励基准上的实验表明,该方法在无特定任务教师的前提下优于以往的 RL 和基于教师的 OPD 方法。
- 引入了一种具有 SDE 方差归一化和方向感知衰减的全分支 pull-push 蒸馏目标,利用高优势和低优势分支来优化速度场,同时保持训练的稳定性。
- 提出了一种用于多目标对齐的奖励级融合策略,通过组合归一化标量分数对采样分支进行排序,从而在没有场级教师路由或梯度冲突的情况下实现黑盒组合。
引言
Flow matching 模型已成为高质量视觉生成的主流主干,但将其与下游目标对齐,例如文本渲染、组合正确性和人类偏好,仍然具有挑战性。先前的强化学习方法在众多去噪步骤上从终端奖励分配信用,导致高方差梯度和脆弱的多目标对齐。On-policy 蒸馏方法通过向预训练教师回归来提供稳定的逐步监督,但它们需要特定任务的教师,其性能受限于教师质量,并且难以在避免更新冲突的情况下融合多个教师。作者提出 Self-OPD,一种无教师 on-policy 蒸馏框架,用通过学生自身局部探索发现的奖励加权目标来替代教师提供的速度目标。通过分支轨迹、用任务奖励对其进行评估并使用确定性自参照基线,Self-OPD 在没有任何外部教师的情况下提供稠密的逐步监督,并在奖励级融合多个目标,使单张图像能够同时满足多种标准。
方法
作者提出 Self-OPD,一种无教师的 on-policy 蒸馏框架,将自生成的奖励转化为稠密的逐步监督。如框架图所示,
整个流程首先通过随机 SDE 分支围绕学生的 on-policy 路径探索局部轨迹,接着根据确定性自参照基线评估这些候选,最后通过优势加权的 pull-push 目标对集体反馈进行蒸馏。
Flow Matching 与 SDE 公式化 该方法的基础是 Flow Matching,它学习一个连续速度场 vθ,用于将噪声分布传输到数据分布。在推理过程中,样本通过逆向积分常微分方程生成。为实现随机探索,作者将逆 ODE 扩展为逆时随机微分方程。在 Euler-Maruyama 离散化方案下,每个转移步骤被分解为确定性下一状态预测和各项同性的随机扰动。通过将 score 函数代入漂移公式,确定性预测 xtj+1,θ 与速度场呈现出优雅的仿射关系:
xtj+1,θ=btj(xtj)+ctjvθ(xtj,tj)其中 ctj=(1+2η2)Δtj。这一仿射等价性保证了在转移空间中公式化的任何蒸馏目标,都可以在速度空间中最小化,并具有相同的收敛性质。
自参照评估与自探索 为在没有预训练教师的情况下保留稠密监督,该框架允许学生评估其自身局部替代方案。在时刻 tj,该方法通过单次前向传播计算确定性下一状态预测,并通过抽取独立的高斯扰动来实例化 K 条候选分支。所有分支共享相同的基础预测,这意味着昂贵的 Transformer 评估仅执行一次。
每条分支通过确定性 ODE rollout 完成至干净 latent,解码到像素空间,并由特定任务的奖励模型评分。为获得降低方差的基线,作者还直接从父状态运行一条完全确定性的 ODE 轨迹,将其奖励记为 rode。分支优势随后相对于该自参照进行归一化:
Ak=std({r(1),…,r(K)})+ϵr(k)−rode正优势表示表现优于学生默认轨迹的局部方向,而负优势则识别出应避免的方向。
全分支 Pull-Push 蒸馏 Self-OPD 并非仅向最优分支回归,而是利用整个探索邻域。正优势分支将确定性预测拉向表现更好的局部轨迹,而负优势分支则将其推离较差的方向。为防止当低奖励分支指向与最优分支几乎相同的方向时产生破坏性干扰,作者引入了一个方向感知衰减系数 dk。该系数对指向最优方向相反方向的负分支保持完全排斥,并在对齐时抑制排斥。
由于确定性预测与 vθ 是仿射关系,每条分支都可以关联一个有效分支速度。逐步 Self-OPD 目标公式化为:
LSelf-OPD(j)=2σtj2(1+η2/2)2∣Δtj∣K1k=1∑K∣Ak∣[rk∥vθ−v+(k)∥2−(1−rk)dk∥vθ−v−(k)∥2]第一项将 vθ 拉向高奖励分支速度,而第二项在方向感知衰减后将 vθ 推离低奖励速度。这种归一化承认了 KL 解释,其中转移方差归一化作为精度,使每个逐步回归成为 KL 梯度的无偏估计。总训练目标在整个去噪轨迹上聚合这些逐步损失,优先考虑建立全局语义布局的早中期时刻。
面向多目标对齐的奖励级融合 同时进行多目标对齐通常会在共享参数空间中引发破坏性的梯度干扰。作者通过在不可微分的奖励级进行目标融合来绕过这一点,将帕累托前沿搜索从参数空间转移到轨迹空间。联合目标坍缩为通过组合优势对转移核的单次倾斜。这通过对每条分支的归一化分数进行融合来形成组合奖励:
r(k)=m=1∑Mλmr~m(k)关键在于,组合分数仅通过定义优势的分支排序进入训练,永远不会被微分。训练目标保持单一、具体的轨迹速度,该速度在所有指标上均已取得良好分数。这种奖励级范式消除了目标间的梯度冲突,支持黑盒评分器,并允许在无需重新训练模型的情况下通过调整权衡来实现运行时组合性。
实验
评估使用搭载 LoRA 的 SD3.5-Medium,涉及文本渲染、组合生成和美学对齐任务,将 Self-OPD 与无教师 RL 基线以及基于教师的 OPD 方法进行对比。Self-OPD 通过局部 SDE 分支和自参照优势评估实现逐步自蒸馏,消除了对预训练教师的需求,始终优于所有单一和混合奖励的竞争者。定性结果展示了卓越的文本保真度、空间推理和计数准确性,消融研究证实,全分支优势加权、有界排斥和早期时刻损失缩放对于稳定训练和更快收敛至关重要。总体而言,该方法证明,直接在探索阶段对多个目标进行奖励级融合,比场级教师混合产生更好的联合对齐,并且在显著减少训练时间的同时取得了有竞争力的性能。
Self-OPD 是一种无教师的对齐范式,提供稠密的逐步信用分配和局部探索,并适应学生策略。消融研究表明,使用全部分支结合优势加权蒸馏和步对齐 KL 归一化能稳定训练,而有界排斥和早期时刻加权能在不牺牲最终性能的情况下加速收敛。与基于教师的 OPD 相比,Self-OPD 消除了教师训练瓶颈,约用一半的实际运行时间达到相当或更高的性能。Self-OPD 无需教师并分配稠密的逐步信用,这与使用终端信用分配的 Flow-GRPO 不同。利用优势加权和 KL 归一化从所有分支进行蒸馏能稳定训练,而仅选择最优分支则因高梯度方差导致不稳定。限制排斥项可防止梯度占优和训练崩溃,确保稳定的单调改进。向早期时刻加权损失可加速收敛,但过度采样早期步骤会降低性能,表明接触所有轨迹阶段是必要的。从头开始的 Self-OPD 更快速地达到基于教师的 OPD 性能,而热启动策略的速度大约是其两倍,同时获得更高的最终分数。
Self-OPD 作为一种无教师方法,在单一奖励训练中,在所有评估维度上都取得了最高分数,超过了分别使用不同单一奖励微调的专门化 Flow-GRPO 模型。尽管那些单一奖励模型仅在与训练奖励对齐的指标上表现出色,在其他指标上通常会退化,Self-OPD 则同时提高了组合生成、文本渲染和人类偏好分数,证明了通过逐步自蒸馏实现有效的多能力对齐。Self-OPD 在 GenEval、OCR、PickScore 和 HPSv2 上超越了所有单一奖励 Flow-GRPO 变体,在所有已训练方法中取得最优结果。Flow-GRPO 模型表现出狭窄的专长:优化 GenEval 奖励可获得高 GenEval 分数,但 OCR 和美学分数较低;优化 OCR 或 PickScore 奖励同样会在其他维度上牺牲性能。未进行对齐微调的基础模型能力有限,而 Self-OPD 将所有指标大幅提升至该基线之上,这与创建权衡的单一奖励微调不同。Self-OPD 在所有任务上的一致收益,凸显了在面向多方面对齐时,逐步自蒸馏相对于终端策略梯度优化的优势。
在混合奖励训练中,无教师的 Self-OPD 模型取得了最高的 GenEval strict 分数(0.95)和 OCR 准确率(96.0%),并且在相同的测试图像协议下,它在 PickScore(23.87 vs. 22.72)和 HPSv2(0.3214 vs. 0.2676)上均优于基于教师的 DiffusionOPD。这表明奖励级融合选取了位于联合高奖励区域内的生成结果,使单一模型能够同时满足多个标准,这与场级融合在任务提示上偏好质量下降的情况不同。Self-OPD 在混合奖励方法中,在没有教师监督的情况下,取得了最高的 GenEval strict 分数 0.95 和最优的 OCR 准确率 96.0%。在相同的测试图像协议下,Self-OPD 在 PickScore 上超过基于教师的 DiffusionOPD 1.15 分,在 HPSv2 上超过 0.0538,这证实了奖励级融合相对于场级融合的优势。奖励级融合使不同提示群体上的偏好分数保持稳定(Self-OPD 的 PickScore 变化为 0.48),而场级融合在任务提示上进行评估时会导致大幅下降(DiffusionOPD 的 PickScore 变化为 1.23)。
实验评估了 Self-OPD,一种使用稠密信用分配的逐步自蒸馏的无教师对齐方法。消融研究证实,利用优势加权和 KL 归一化从所有分支进行蒸馏能稳定训练,而有界排斥和早期时刻加权则加速收敛。在单一奖励训练中,Self-OPD 同时提高了组合生成、文本渲染和人类偏好分数,避免了在 Flow-GRPO 模型中观察到的狭窄专长。在混合奖励训练中,奖励级融合使单一模型能够满足多个标准,而没有出现场级融合中的偏好退化,Self-OPD 约用一半时间达到与基于教师方法相当或更高的性能。