HyperAIHyperAI

Command Palette

Search for a command to run...

在线策略增量蒸馏

Byeongho Heo Jaehui Hwang Sangdoo Yun Dongyoon Han

摘要

在线策略蒸馏是强化学习中一种替代性的后训练方法,通过提供来自教师模型的逐令牌监督,缓解了奖励模型带来的限制。尽管在线策略蒸馏已在多种场景中得到研究和应用,但其基本设计仍未被充分探索。本文引入了一种新的蒸馏奖励,称为增量信号,以替代直接模仿教师的输出分布。增量信号定义为教师模型与其在推理能力指令微调前的基础模型之间的差异。因此,它捕捉了推理微调所引起的变化,并为迁移推理能力提供了更直接的信号。通过大量实证证据,我们表明增量信号显著改进了在线策略蒸馏,并将这种新蒸馏方法称为在线策略增量蒸馏(OPD2)。在数学、科学和代码推理基准上的实验表明,OPD2 始终优于传统的在线策略蒸馏,使推理型大语言模型在仅需短暂后训练的情况下即可取得强劲性能。

一句话总结

NAVER AI Lab 的研究人员提出了 On-Policy Delta Distillation (OPD^2),一种新的在线策略蒸馏方法,利用 delta 信号——即教师模型与其预指令微调基础模型之间的差异——直接传递推理能力,在经过短时后训练后,在数学、科学和编程基准测试中显著优于传统的在线策略蒸馏。

核心贡献

  • delta 信号定义为经过推理微调的教师模型与其微调前基础模型之间的差异,被引入为一种新的蒸馏奖励,捕获了从推理微调中获得的知识。
  • 在线策略 Delta 蒸馏(OPD²)将此 delta 信号作为在线策略蒸馏的主要训练信号,将学习重点放在与推理相关的 token 上,同时保留学生模型原有的能力。
  • 在数学、科学和编程推理基准测试(14 个基准)上,使用参数规模从 1.7B 到 8B 的模型(Qwen3 和 Gemma4)进行的实验表明,OPD² 始终优于传统的在线策略蒸馏,并在短时后训练后取得了强大的推理性能。

引言

作者研究了用于大型语言模型后训练的在线策略蒸馏(OPD),其中学生模型生成自己的输出,并从教师模型获得 token 级别的奖励。OPD 绕过了强化学习的奖励设计问题,但其标准奖励——教师与学生之间的对数概率差异——并未显式地分离出教师在指令微调过程中获得的推理能力。本文提出在线策略 Delta 蒸馏(OPD²),该方法转而使用经过推理微调的教师模型与其基础模型之间的差异作为主要奖励信号。通过中心化和联合条件处理,此 delta 信号将奖励聚焦于推理特有的知识,作者表明,对于参数规模从 1.7B 到 8B 的模型,OPD² 在数学、科学和编程基准测试中始终优于传统的在线策略蒸馏。

方法

作者首先建立了在线策略蒸馏(OPD)的基础,这是一种后训练方法,学生模型在自己的 rollout 样本上学习模仿教师模型。目标是最小化学生与教师分布之间的 Kullback-Leibler(KL)散度。在类似强化学习的框架中,这通过为第 ttt 个 token yty_tyt 在给定上下文 y<ty_{<t}y<t 和问题 xxx 的条件下定义 token 级别的奖励来实现: Rt=logπ(ytx,y<t)logπθ(ytx,y<t)R_t = \log \pi^*(y_t \mid x, y_{<t}) - \log \pi_\theta(y_t \mid x, y_{<t})Rt=logπ(ytx,y<t)logπθ(ytx,y<t) 其中 π\pi^*π 是教师,πθ\pi_\thetaπθ 是学生。学生通过梯度计算来最大化这些奖励,从而有效地在在线策略数据上最小化 KL 散度。

为了改进标准 OPD,作者提出利用教师模型的学习轨迹,而不仅仅是其最终输出分布。他们引入了一个 delta 信号,该信号捕获了经过推理微调的教师模型与其预训练基础模型 πbase\pi^*_{base}πbase 之间的差异。delta 信号定义为: RtΔ=logπ(ytx,y<t)logπbase(ytx,y<t)R_t^\Delta = \log \pi^*(y_t \mid x, y_{<t}) - \log \pi^*_{base}(y_t \mid x, y_{<t})RtΔ=logπ(ytx,y<t)logπbase(ytx,y<t) 此信号代表了教师模型后训练阶段获得的知识,特别针对超越简单下一 token 预测的推理能力。请参考比较标准方法与所提方法的框架图:

对这些信号的分析表明,delta 形式强调推理连接词(例如“hence”、“however”),同时抑制探索性词汇(例如“try”、“verify”)。此外,在检查错误推理链上的 token 级别奖励时,delta 信号表现出更强的鲁棒性。如下图所示,关于简单推理示例上的 token 级别蒸馏信号:

与标准 OPD 相比,delta 信号更一致地抑制与错误推理步骤相关的 token,而标准 OPD 可能由于教师和学生之间的幅度差异而对错误推理产生正向信号。

然而,直接使用 RΔR^\DeltaRΔ 存在收敛问题,因为它忽略了学生当前的分布 πθ\pi_\thetaπθ,可能导致训练不稳定。为解决此问题,作者设计了在线策略 Delta 蒸馏(OPD2^22)。他们首先构造了减去偏差的优势函数,以确保训练稳定性。delta 信号的优势计算如下: AtΔ=RtΔEy~tπθ(x,y<t)[logπ(y~tx,y<t)logπbase(y~tx,y<t)]A_t^\Delta = R_t^\Delta - \mathbb{E}_{\tilde{y}_t \sim \pi_\theta(\cdot | x, y_{<t})} \left[ \log \pi^*(\tilde{y}_t \mid x, y_{<t}) - \log \pi^*_{base}(\tilde{y}_t \mid x, y_{<t}) \right]AtΔ=RtΔEy~tπθ(x,y<t)[logπ(y~tx,y<t)logπbase(y~tx,y<t)] 其中期望在学生策略的前 k 个 token 上近似,以节省 GPU 内存。

为确保学生能正确收敛到教师,OPD2^22 引入了一个停止条件,使 delta 优势与原始 OPD 优势 AtOPDA_t^{OPD}AtOPD 保持一致。最终的优势函数 AtD2A_t^{D^2}AtD2 定义为: AtD2={AtΔif AtΔAtOPD>00otherwiseA_t^{D^2} = \begin{cases} A_t^\Delta & \text{if } A_t^\Delta A_t^{OPD} > 0 \\ 0 & \text{otherwise} \end{cases}AtD2={AtΔ0if AtΔAtOPD>0otherwise 此条件将更新限制在 delta 信号与原始蒸馏信号一致的方向上,防止学生偏离教师分布。当学生与教师匹配时,优势被关闭。然后,OPD2^22 的训练梯度计算如下: θJOPD2(θ)=ExD,yπθ(x)[t=1TAtD2θlogπθ(ytx,y<t)]\nabla_\theta J_{OPD^2}(\theta) = \mathbb{E}_{x \sim \mathcal{D}, y \sim \pi_\theta(\cdot | x)} \left[ \sum_{t=1}^T A_t^{D^2} \nabla_\theta \log \pi_\theta(y_t \mid x, y_{<t}) \right]θJOPD2(θ)=ExD,yπθ(x)[t=1TAtD2θlogπθ(ytx,y<t)] 这种形式使得模型能够从以推理为中心的 delta 信号中受益,同时保持标准在线策略蒸馏固有的稳定收敛特性。

实验

实验在多领域数学、科学和编程任务上,对小型推理模型(Qwen3 和 Gemma4)评估了 OPD^2 与 OPD 和 ExOPD 的性能,测试了非思维和思维模式。OPD^2 始终取得最佳性能,在非思维模式下带来巨大提升,并在思维模式下改善或保持强大的能力,而其他方法通常会导致性能下降。delta 信号是改进的主要驱动力,训练动态显示 OPD^2 在整个训练过程中保持持续的优势。其计算开销适中,并能有效泛化到不同模型家族。

Delta 信号将蒸馏重点转移到诸如“hence”和“however”之类的推理连接词上,同时抑制诸如“see”和“verify”之类的探索性词汇。这些被增强的 token 在数学、编程和科学领域的前 5% 信号强度中出现频率很高,表明蒸馏过程中存在一致的偏向。在所有三个领域中,delta 信号强烈增强“hence”和“however”等推理连接词,其前 5% 强度出现率在 39% 到 74% 之间。而“see”、“try”和“verify”等探索和验证相关词汇被抑制,引导模型从试探性推理转向更果断的输出。

在线策略蒸馏方法显著提高了 Qwen3 模型在非思维模式下的数学性能,其中 OPD² 的提升最大。1.7B 模型的平均分几乎翻倍,而 4B 的 OPD² 模型超过了使用竞争方法训练的 8B 模型,表明该方法可以匹配或超过扩大模型规模带来的收益。OPD² 将 Qwen3-1.7B 的数学平均分几乎翻倍(从 34.8 提升到 54.6)。使用 OPD² 训练的 4B 模型达到 70.3,优于使用 ExOPD 的 8B 模型(67.8),展示了规模等效的增益。

在线策略蒸馏方法显著提高了 Qwen3 模型在编程和科学方面的非思维模式性能。OPD2 在所有模型规模上均提供了最大的提升,使用 OPD2 训练的 4B 模型已经优于使用 OPD 或 ExOPD 训练的 8B 模型,表明该方法可以提供与扩大模型规模相当的收益。对于 Qwen3-1.7B,OPD2 将编程平均分从 10.5 提升到 29.4,科学平均分从 30.8 提升到 38.8,分别比 OPD 和 ExOPD 高出 3.6 和 3.2 个百分点。4B 的 OPD2 模型超过了使用 OPD 或 ExOPD 训练的 8B 模型,表明所提方法可以匹配或超越更大模型规模的增益。

在思维模式数学评估中,OPD² 将 Qwen3-1.7B 的平均分从 59.2 提升到 62.7,而 OPD 和 ExOPD 分别将性能降至 57.1 和 58.4。提升集中在竞赛级基准测试如 AIME24 和 AIME25 上,MATH500 和 RGMath 的提升较小。OPD² 是唯一在思维模式下提高 Qwen3-1.7B 数学平均分的方法;OPD 和 ExOPD 均低于基线。OPD² 在 AIME25(+9.8 分)和 AIME24(+1.5 分)上取得了最大的绝对提升,HMMT25 和 AMC23 也有显著增益。

在思维模式下,在线策略蒸馏方法对 Qwen3 模型表现出不同的影响。OPD² 在编程和科学方面大幅提升了 1.7B 模型,而标准 OPD 则降低了 4B 模型的性能。在具有挑战性的编程基准测试如 CodeContests 上,提升尤为显著。OPD² 将 1.7B 模型的编程平均分从 29.3 提升到 40.4,科学平均分从 40.1 提升到 43.4,超越了 OPD 和 ExOPD。在 CodeContests 上,OPD² 几乎将 1.7B 模型的分数翻倍,从 19.8 提升到 37.8,这是单个基准测试中最大的提升。标准 OPD 将 4B 模型的编程平均分从 48.7 降至 46.4,科学平均分从 51.3 降至 48.4,表明思维模式性能对蒸馏方法较为敏感。

实验评估了应用于 Qwen3 模型的在线策略蒸馏方法(OPD、ExOPD、OPD²),在数学、编程和科学基准测试上,覆盖了非思维和思维模式。对蒸馏信号的 token 级别分析揭示了一种一致的偏向,即放大推理连接词并抑制探索性词汇,引导模型输出更果断。性能比较显示,OPD² 始终带来最大的增益,通常使较小的模型能够超越使用竞争方法训练的较大模型,而思维模式下的结果对蒸馏方法更为敏感,标准 OPD 有时会导致性能下降。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供