Command Palette
Search for a command to run...
DAPD:双锚定策略蒸馏
DAPD:双锚定策略蒸馏
Jianyu Wu Yizhou Wang Encheng Su Chen Tang Shixiang Tang
摘要
同策略(自)蒸馏(OPSD)在语言模型后训练中日益普及。它利用特权信息增强教师模型,但可能引发特权幻觉:学生模型学到依赖特权的行为,而这些行为无法从其推理时的上下文中复现,却表现得仿佛训练时的特权信息仍然可用,最终导致性能下降。本文指出,特权教师与学生推理时之间的信息不对称是 OPSD 中这一失效的根本原因。为解决该不对称性,我们提出双锚定策略蒸馏(DAPD),一个具有两个锚定层次的统一框架。双路径锚定(DPA)引入自条件桥接,并沿两条信息匹配的路径对齐参考行为与 rollout 行为,防止依赖特权的行为被迁移到推理时的学生模型。双源锚定(DSA)在参考到 rollout 和 rollout 到参考两个方向上应用这些路径,在保留正确性监督的同时,减少对特权参考引导的依赖。大量实验表明,DAPD 显著缓解了特权幻觉,在 Qwen3-4B 上平均任务得分比 OPSD 高出 +2.00 分。值得注意的是,其增益在不同规模上持续存在,在 4B 上达到 +2.69,在 32B 上达到 +2.78。代码见 https://github.com/uanu2002/DAPD。
一句话总结
上海交通大学、上海人工智能实验室和中国科学技术大学的研究人员提出的双锚定策略蒸馏(DAPD),通过双路径锚定和双源锚定对齐参考行为与 rollout 行为,解决了 on-policy 自蒸馏中的特权幻觉问题,在 Qwen3 模型上实现 4B 规模平均提升 +2.69、32B 规模平均提升 +2.78。
核心贡献
- 本文指出训练时特权教师与学生之间的信息不对称是 on-policy 自蒸馏中特权幻觉的根源,并通过引入自条件学生分布验证了这一点:该分布使后期错误声称减少 45%,平均 Avg@12 提升 +6.22 分。
- 提出双锚定策略蒸馏(DAPD),其双路径锚定通过自条件桥对齐信息匹配下的参考与 rollout 行为,其双源锚定以双向方式结合正确性导向的参考指导与学生可达的 rollout 指导。
- 在 1.7B 到 32B 的 Qwen3 模型上实验表明,DAPD 缓解了特权幻觉并优于 on-policy 自蒸馏,在 Qwen3-4B 上平均提升 +2.00 分,且在 4B 和 32B 规模分别获得 +2.69 和 +2.78 的一致缩放增益。
引言
后训练技术如 on-policy 自蒸馏(OPSD)通过从带有特权信息(如参考补全)的教师中蒸馏稠密的 token 级监督,将预训练语言模型转化为推理模型。由于学生推理时无法访问这些特权信息,常常产生“特权幻觉”:做出无根据的声称并幻觉步骤,仿佛隐藏的参考可用一般,这损害任务表现。先前缓解该幻觉的尝试要么直接使用特权教师的完整监督,要么选择性地重加权,但两种方法都直接修改教师信号,而未对齐教师和学生所获得的信息。它们也仅依赖参考作为指导来源,忽略了来自 on-policy rollout 的互补学习信号。
作者确定信息不对称是根源:教师看到学生缺乏的特权上下文,导致一种混合的蒸馏,将可复现的指导与依赖特权行为混在一起。为解决此问题,他们提出双锚定策略蒸馏(DAPD)。该框架引入两个模块:双路径锚定,在匹配的信息可用性下(包括有和没有特权信息的情况)通过自条件学生分布作为桥梁对齐参考与 rollout 行为;双源锚定,通过双向应用对齐路径,平衡正确性导向的参考指导与学生可达的 rollout 指导。在推理、编码和指令遵循基准上的实验表明,DAPD 一致地减少特权幻觉并优于 OPSD,在模型规模(1.7B 到 32B 参数)上获得稳定增益,而 OPSD 的收益则极大减弱。
方法
作者指出 on-policy 自蒸馏(OPSD)中的一个关键缺陷,即特权幻觉:学生在训练时依赖特权信息(例如真实参考),而这些信息教师可见但推理时学生无法访问。这种信息不对称导致学生做出无根据的声称,并随时间降低推理性能。如下图所示,标准 OPSD 训练导致错误声称显著增加、推理准确率下降,而匹配教师和学生可获得的信息则缓解了这些问题。
为解决这一结构限制,作者提出双锚定策略蒸馏(DAPD),该框架通过引入自条件分布作为可训练的桥梁来纠正信息不对称。该框架在每个自回归 token 步骤上操作三种不同分布:None 分布,在没有特权信息下预测;Cross 分布,基于替代补全条件;Self 分布,基于正在预测的完整补全条件。通过利用 Self 分布,DAPD 构建锚点,在匹配的信息条件下对齐参考和 rollout 行为。
DAPD 的核心包含两个主要组件:双路径锚定(DPA)和双源锚定(DSA)。整体架构和信息流如下图所示。
双路径锚定(DPA)在蒸馏过程中通过将三个定向目标组合为两个互补的对齐路径,匹配信息可用性,对于给定的补全方向。第一个目标,纠缠蒸馏,将 None 分布向 Cross 分布移动,以保持特权指导传递。第二个目标,推理锚点,训练 Self 分布向 None 分布对齐,以在没有特权信息下对齐行为。第三个目标,特权锚点,训练 Self 分布向 Cross 分布对齐,以在两者都接收特权信息时对齐行为。
DPA 将这些目标组合成无条件路径和特权路径。无条件路径针对推理相关分布,通过将当前补全上的纠缠蒸馏与替代补全上的推理锚点结合,此联合更新通过 Self 分布作为代理桥隐式对齐两个 None 分布。特权路径直接应用特权锚点,在两者都基于完整补全条件时对齐 Self 和 Cross 分布。
双源锚定(DSA)通过两个补全方向应用 DPA,平衡参考引导和 rollout 引导的监督。在 Rollout 到参考方向,rollout 作为补全,参考提供指导,利用真实信息的可靠性。相反,在参考到 Rollout 方向,参考作为补全,rollout 提供指导,捕获学生可达到的有用 on-policy 推理信号。最终 DAPD 目标使用权重参数 λ 平衡这两个方向路径,确保模型既受益于正确性导向的参考指导,又受益于学生可达的 rollout 指导。
实验
实验在 Qwen3 多个尺度上评估 DAPD,覆盖推理、编码和指令任务,与存在特权幻觉的 on-policy 自蒸馏基线对比。DAPD 通过对齐教师和学生的信息条件一致优于这些方法,增益在较大规模上持续存在,而基线改进消失。消融实验证实推理锚点和特权锚点路径都是必需的,且结合参考和 rollout 指导提供互补监督。该方法即使将精选参考替换为双 on-policy rollout 后仍然有效,并且通过验证信号进一步提升,展示了无外部参考下的鲁棒性。
DAPD 在六个基准上获得最高的总体平均分,明显超越标准 on-policy 自蒸馏(OPSD)。它也优于滤波或重路由特权教师信号的方法,表明匹配教师和学生的信息条件比纠正不对称信号更有效。增益在推理、编码和指令任务上保持一致。与最强的 on-policy 基线 OPSD 相比,DAPD 的六任务平均分提高超过两分。信息匹配的锚定比修改特权信号带来更大提升,DAPD 大幅优于纯化 OPSD 和 DOPD。
在推理数据上训练后,DAPD 向未见编码和指令基准迁移效果最好,取得最高的三任务平均分。它超越标准 on-policy 蒸馏和修改特权信号的方法,表明匹配师生信息条件改善了 Out-Of-Distribution 泛化。DAPD 获得顶级 LCB v5 分数(54.14)和最佳总体平均(49.64),平均领先次好的纯化 OPSD 0.86 分。DAPD 比标准 on-policy 蒸馏(OPSD)高 1.37 平均分,而纯化(纯化 OPSD)和路由(DOPD)策略增益较小或性能更低。
对 Qwen3 模型的消融研究表明,每种指导源内部的双路径结构和双源组合均提高推理分数。结合参考和 rollout 指导达到最佳 65.28 Avg@12,而最佳指导平衡随规模变化,且当仅用 on-policy rollout 并配合正确性验证器时增益仍然存在。结合参考和 rollout 指导达到 65.28 Avg@12,超越单独使用每种源(63.89 和 65.09)。较大模型偏好较低的参考指导权重(λ 降至 0.2)并调整特权锚点权重,显示对静态参考的依赖减少。使用双独立 rollout 而无需精选参考即超越 on-policy 基线,验证其中一个 rollout 可进一步将分数最高提升 1.11 分。
DAPD 匹配师生信息条件,在六个推理、编码和指令基准上超越 on-policy 自蒸馏以及滤波或重路由特权信号的方法,增益迁移至未见任务。对 Qwen3 模型的消融研究证实双路径和双源指导的价值,结合参考和 rollout 信号取得最高性能,而较大模型通过减少对静态参考的依赖受益,使用纯 on-policy rollout 加验证器同样超越基线。