HyperAIHyperAI

Command Palette

Search for a command to run...

LLM
模型训练

硬币皆有正反面:论大语言模型在策略蒸馏中泛化能力的双重性

摘要

在策略蒸馏(OPD)通过监督从学生自身策略中采样的轨迹来迁移教师能力,但其泛化行为仍未被充分理解,因为大多数研究仅在单一领域和接近训练数据的基准上评估 OPD。我们开展了一项受控研究,每次仅改变一个泛化因素,涵盖从域内分布偏移到跨域迁移以及多教师设置。我们发现,OPD 迁移的是教师的推理行为,而非其对特定问题的答案:训练难度几乎无关紧要,甚至教师从未解决的问题也很有用。迁移效果强烈依赖于教师与学生之间的同源关系:同源配对能使学生接近教师,跨越语言、推理深度甚至其他领域,而异源配对则主要拟合训练分布。这种广泛的覆盖范围是一把双刃剑:由于将提示路由到领域专家无法限制每位教师的影响,组合它们会导致其能力之间出现依赖混合比例的此消彼长。这些结果阐明了 OPD 何时能够泛化,并为诊断多教师 OPD 提供了有用的视角。

一句话总结

中国科学技术大学、北京大学等机构的研究人员证明,同策略蒸馏传递的是教师的推理行为而非具体答案,同源教师-学生对能够实现广泛的跨领域泛化,而异源教师-学生对主要拟合训练分布,多教师蒸馏会在能力之间产生依赖于混合比例的跷跷板效应,从而阐明 OPD 何时能够泛化。

核心贡献

  • 一项对照研究系统性地改变同策略蒸馏(OPD)中的泛化因素,涵盖数学、代码、科学和指令遵循领域,分离出问题难度、语言和推理跨度的领域内偏移、跨领域迁移以及多教师设置。
  • OPD 传递的是教师的推理行为而非其对特定问题的答案:训练问题的难度几乎无关紧要,甚至教师从未解决的问题也是有用的。
  • 泛化强烈依赖于教师与学生的同源关系:同源对能够在语言、推理跨度甚至其他领域实现广泛迁移,而异源对主要拟合训练分布;在多教师 OPD 中,路由无法限制每个教师的影响,导致其能力之间出现依赖于混合比例的跷跷板效应。

引言

作者研究了同策略蒸馏(OPD),这是一种通过用学生自身生成的轨迹进行监督,将强教师模型的能力迁移到较小学生模型的技术。虽然先前的工作表明 OPD 能提升目标任务上的性能,但未能区分学生仅仅拟合了训练分布,还是获得了能泛化到新环境的更广泛的推理模式。这一差距对于理解 OPD 的工作原理以及设计有效的多教师整合策略至关重要。作者进行了一项对照研究,每次系统地改变一个泛化因素,揭示出 OPD 传递的是教师的推理行为而非特定问题的解决方案,同源教师-学生对能够跨语言、跨推理跨度甚至跨领域广泛迁移,而这种广泛迁移在多教师 OPD 中成为一把双刃剑,提示路由无法隔离每个教师的影响,导致能力之间出现依赖于混合比例的跷跷板效应。

实验

这项工作在数学、代码、科学和指令遵循领域评估了单教师和多教师的同策略蒸馏。结果发现,训练问题的难度影响很小,而动态丢弃学生已经解决的问题能带来微小但一致的收益。同源教师-学生对跨语言、推理跨度和领域的迁移能力远强于异源对,后者主要拟合训练分布。由于教师的影响会超出其分配的领域,多教师路由无法隔离领域专家;改变教师混合比例会产生跷跷板效应,同源教师通过整体对齐学生策略而产生更强的牵引力。

仅动态丢弃学生已经解决的问题(通过率在 [0,1) 区间)在六个数学基准上带来了微小但一致的平均提升,而仅筛选未解决或仅筛选已解决的问题则没有帮助。这表明,移除已掌握的问题可以防止冗余的重新对齐,且不损害泛化。对于 Polaris-7B → DS-distill-1.5B,丢弃完全解决的问题将平均准确率从 41.4% 提升至 42.0%(+0.6 个百分点)。仅使用未解决问题(通过率=0)或仅使用已解决问题(通过率=1)时,平均准确率等于或低于无过滤的基线。丢弃已解决问题的好处在两个教师-学生对之间是一致的,在大多数单个基准上都有提升。

在多教师在线策略蒸馏中,改变数学专家教师与科学/指令遵循专家教师的提示混合比例,会使学生的数学准确率向获得更多提示的教师倾斜。当数学教师 JustRL-1.5B 占主导时,平均数学准确率略有上升;当科学/指令遵循教师 Nemotron-1.5B 占主导时,数学准确率下降。这展示了跨领域跷跷板效应,即教师的影响力会拉动其分配教学领域之外的表现。增加分配给数学教师的提示比例会提高学生的数学准确率,而增加科学/指令遵循教师的提示比例则会降低准确率。当数学教师获得最大提示份额(J/N=25/8)时,平均数学准确率最高(27.1%);当科学/指令遵循教师占主导(J/N=2/25)时,平均准确率最低(25.1%)。与等比例混合相比,数学教师占比高的比例使数学准确率提升了 0.8 个百分点,而科学教师占比高的比例则使其降低了 1.2 个百分点。

在同策略蒸馏过程中过滤掉学生已解决的问题,通过防止冗余的重新对齐带来了微小但一致的准确率提升,而仅使用未解决或仅使用已解决的问题则没有帮助。改变数学专家教师与科学/指令遵循教师的提示混合比例,展示了跨领域跷跷板效应,学生的数学表现会向获得更多提示的教师倾斜,甚至超出该教师分配的领域。这些结果验证了选择性问题过滤和教师提示分配是引导多教师蒸馏中学生表现的有效杠杆。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供