HyperAIHyperAI

Command Palette

Search for a command to run...

同策略学习还是异策略学习?蒸馏动力学的系统研究

Julianna Piskorz Antonin Berthon Mihaela van der Schaar

摘要

已有观点认为,同策略学习能够减少灾难性遗忘、产生更稀疏的参数更新,并改善泛化能力。然而,现有的监督微调与强化学习对比同时改变了许多因素,使得难以单独分离出 rollout 策略的贡献。我们在一个受控的强到弱蒸馏环境中研究 rollout 策略的影响,独立地改变 rollout 策略、token 级 KL 方向和学习率,涵盖 Llama 3 和 Qwen2.5 模型系列以及科学、医学和算术领域的推理任务。我们的分析揭示了一幅细致的蒸馏动力学图景:rollout 策略并不一定发挥核心作用。相反,token 级 KL 方向更明显地影响任务性能和输出覆盖度,而学习率主导遗忘和更新稀疏性。对 KL 梯度的分析以及沿学生-教师 rollout 策略连续谱开展的实验解释了这一模式:前向 KL 对 rollout 策略具有显著鲁棒性,即使 rollout 策略发生变化,其性能依然稳定且强劲;而反向 KL 则明显更敏感,并偏好学生生成的 rollout。尽管如此,在两种 KL 方向下,同策略数据都能改善对 Countdown 算术任务更难变体的泛化能力,尽管这一优势在后续 RLVR 之后并不总能可靠地保持。我们的更广泛结论在移除梯度裁剪、使用采样 KL 估计器以及在需要更长推理链的任务上进行训练时仍然稳健。总体而言,我们的结果挑战了同策略 rollout 本质上更可取的看法,并表明其价值关键取决于目标、评估设置和优化超参数。

一句话总结

剑桥大学的研究人员系统研究了 Llama 3 和 Qwen2.5 模型家族在科学、医学和算术领域推理任务上的强到弱蒸馏动态,独立改变 rollout 策略、token级 \mathrm{\mathrm{KL\mathrm{KL}KL}} 方向和学习率,发现前向 KL 对 rollout 策略保持稳健,而反向 KL 偏好 student 生成的 rollout,并且 on-policy 数据能提升对更难 Countdown 算术变体的泛化,但这一优势在后续 RLVR 后并不可靠地持续。

核心贡献

  • 本文提出了一项受控的强到弱蒸馏研究,在科学、医学和算术推理任务上,跨 Llama 3 和 Qwen2.5 独立改变 rollout 策略、token级 KL 方向和学习率。结果表明,token级 KL 方向更明显地影响任务性能和输出覆盖度,学习率主导遗忘和更新稀疏性,而 rollout 策略未必起核心作用。
  • 通过 KL 梯度分析和沿连续的 student-teacher rollout 策略谱的实验,本文表明前向 KL 对 rollout 策略变化具有稳健性,而反向 KL 更敏感,并偏好 student 生成的 rollout。
  • 在两种 KL 方向下,on-policy 数据均能提升对更难 Countdown 算术变体的泛化,但这一优势在后续 RLVR 后并不可靠地持续。这些结论在没有梯度裁剪、使用采样 KL 估计器以及需要更长推理链的任务上仍然稳健,挑战了 on-policy rollout 天然更优的观点。

引言

后训练对于大型语言模型推理能力的发展至关重要,强到弱蒸馏已成为将推理行为从较大的 teacher 迁移到较小 student 的常见方式。on-policy rollout 被认为能够减少灾难性遗忘、产生更稀疏的参数更新并改善泛化,但此前的比较常常将 rollout 策略与训练目标、监督密度、优化过程和学习率的变化混在一起。作者通过将强到弱蒸馏作为受控测试平台来解决这一问题,在科学、医学和算术推理任务上,跨 Llama 3 和 Qwen2.5 模型独立改变 rollout 策略、KL 方向和学习率。他们发现,在最终分布内准确率、灾难性遗忘或参数更新稀疏性方面,on-policy 蒸馏没有一致优势;KL 方向更强烈地决定任务准确率和覆盖度,而学习率主导遗忘和稀疏性。前向 KL 对 rollout 策略具有稳健性,而反向 KL 则明显更敏感,并偏好 on-policy rollout。

方法

5.1 Logit 梯度揭示对 rollout 策略的不同敏感性

为了理解 rollout 策略如何影响优化,作者分析了前向和反向 KL 散度的 token级梯度。令 (zSθ)v,v∈V(z_S^\theta)_v, v \in \mathcal{V}(zSθ​)v​,v∈V 表示 student 模型在固定前缀处产生的 logit 值,其中 πSθ(v)=softmax(zSθ)v\pi_S^\theta(v) = \mathrm{softmax}(z_S^\theta)_vπSθ​(v)=softmax(zSθ​)v​。则参数梯度可描述如下:

∇θDF−KL=∑v∈V(πSθ(v)−πT(v))∇θ(zSθ)v,\nabla_{\theta} D_{\mathrm{F-KL}} = \sum_{v \in \mathcal{V}} (\pi_S^\theta(v) - \pi_T(v)) \nabla_{\theta} (z_S^\theta)_v,∇θ​DF−KL​=v∈V∑​(πSθ​(v)−πT​(v))∇θ​(zSθ​)v​, ∇θDR−KL=∑v∈VπSθ(v)[log⁡πSθ(v)πT(v)−DR−KL]∇θ(zSθ)v.\nabla_{\theta} D_{\mathrm{R-KL}} = \sum_{v \in \mathcal{V}} \pi_S^\theta(v) \left[ \log \frac{\pi_S^\theta(v)}{\pi_T(v)} - D_{\mathrm{R-KL}} \right] \nabla_{\theta} (z_S^\theta)_v.∇θ​DR−KL​=v∈V∑​πSθ​(v)[logπT​(v)πSθ​(v)​−DR−KL​]∇θ​(zSθ​)v​.

这些表达式揭示了一个重要的不对称性。前向 KL 对 student logits 的导数为 πSθ(v)−πT(v)\pi_S^\theta(v) - \pi_T(v)πSθ​(v)−πT​(v);因此,只要 teacher 和 student 的下一个 token 分布不同,该导数就非零,并且每个坐标都位于 [−1,1][-1, 1][−1,1]。因此,在 student logit 雅可比矩阵 ∇θ(zSθ)\nabla_\theta (z_S^\theta)∇θ​(zSθ​) 有界的条件下,由两种 rollout 策略引起的前向 KL 更新之差,会被它们所诱导的前缀分布之间的总变分距离线性地限制。因此,rollout 策略产生的轨迹发生较小变化时,前向 KL 梯度也成比例地发生较小变化。

然而,对于反向 KL,当 teacher 和 student 对某些 token 赋予非常不同的概率时,即使 rollout 发生很小变化,也可能产生任意大的梯度变化。其 logit 导数按 student 概率 πSθ(v)\pi_S^\theta(v)πSθ​(v) 加权,因此当 student 概率趋近于零时该导数会消失,即使 teacher 对该 token 赋予相当大的概率。因此,反向 KL 可能难以恢复被 student 遗漏的 teacher 模式,反映其 mode-seeking 行为。反之,当 student 对 teacher 认为极不可能的 token 赋予可观概率时,对数比 log⁡πSθ(v)/πT(v)\log \pi_S^\theta(v) / \pi_T(v)logπSθ​(v)/πT​(v) 可以变得任意大,可能产生剧烈的高方差更新,从而破坏训练稳定性。与前向 KL 不同,反向 KL 不存在仅依赖 rollout 距离和 student logit 雅可比矩阵的界。

这些性质表明,反向 KL 对 rollout 策略更敏感。前向 KL 会在任何被访问且两个策略存在分歧的前缀处提供信号,而反向 KL 强调 student 支持但 teacher 不偏好的 token,因此更依赖于访问 student 自身的前缀分布。

实验

该研究运行了受控蒸馏实验,在医学、科学、算术和更长的数学推理任务上,比较 on-policy 和 off-policy rollout,同时改变 token级 KL 方向和学习率,并评估任务准确率、灾难性遗忘和参数更新稀疏性。结果表明,rollout 策略在分布内性能、遗忘或稀疏性方面没有一致优势,而前向 KL 比反向 KL 更稳健,学习率是主导遗忘和稀疏性的主要因素。rollout 策略谱确认,前向 KL 对 rollout 分布相对不敏感,而反向 KL 受益于 student 偏好的 rollout;进一步分析表明,on-policy 数据可以提升对更难任务的泛化,并减少偶然的 teacher 风格迁移,但这一优势在强化学习后并不可靠地持续。使用采样 KL、无梯度裁剪和更长 rollout 的消融实验表明,主要结论具有普遍性,仅在长 rollout 反向 KL 设定中存在一个提示性的 on-policy 优势。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供