Command Palette
Search for a command to run...
TTPO:测试时策略优化
TTPO:测试时策略优化
摘要
近期突出的后训练方法,如强化学习(RL)和在线策略自蒸馏(OPSD),推动了大语言模型在数学推理上的快速进步,但它们对真实标签的依赖使其无法用于测试时训练(TTT)。用多数投票伪标签替代真实标签是一种自然的替代方案,但该方法较为脆弱:一次错误的投票会污染教师模型并误导每一个词元。我们观察到这种失效模式具有不对称性:无论投票本身是否正确,与伪标签不一致的推理轨迹通常都是错误的。基于这一观察,我们提出测试时策略优化(TTPO),一种不对称的目标函数,通过 OPSD 蒸馏一致的轨迹,并通过分组 RL 惩罚不一致的轨迹。词元级选择进一步细化两个分支:蒸馏时降低已收敛位置的权重,而 RL 仅惩罚置信度高的错误。即使在频繁出现伪标签错误的情况下,这两种更新仍具有良好基础,且随着模型改进,多数投票路由能提供更严格的自监督。在没有任何标签的条件下,TTPO 在五个竞赛级基准上达到了与有标签监督的 OPSD 相当的性能,在 TTT 中将 Qwen3-1.7B 的表现从 38.0% 提升至 45.2%,在无思考模式下带来 +25.2% 到 +36.4% 的提升,并展现出强大的跨任务泛化能力。我们的代码已开源,地址为 https://github.com/ZJU-REAL/TTPO。
一句话总结
测试时策略优化(TTPO)由浙江大学和阿里巴巴集团的研究人员提出,是一种非对称测试时训练方法,它通过在线策略自蒸馏来蒸馏多数投票一致的rollouts,用分组RL惩罚不一致的rollouts,通过token级别选择优化两个分支,并实现无标签的数学推理,在竞赛基准上匹配有标签监督的OPSD,同时将Qwen3-1.7B从38.0%提升到45.2%。
核心贡献
- 多数投票伪标签在测试时训练中仍然有用,尽管错误频繁:虽然在大约85%的竞赛级提示上错误,但大约79%的不一致rollouts也是错误的,因此惩罚不一致仍然是正确的,而蒸馏则不然。
- TTPO,一个非对称目标,将一致的rollouts蒸馏到以答案为条件的教师模型,并用GRPO惩罚不一致的rollouts,在两个分支中都进行token级别选择。
- 在没有任何标签的情况下训练,TTPO在五个竞赛级基准上匹配或超过了有标签监督的OPSD,在测试时训练中将Qwen3-1.7B从38.0%提升到45.2%,并展示了强大的跨任务泛化能力。
引言
作者解决了LLM数学推理的测试时训练问题,其中模型必须通过从自身采样的解决方案中学习来改进无标签问题。先前的工作要么使用来自多数投票伪标签的粗糙序列级奖励(例如TTRL),当伪标签错误时会强化错误,要么依赖于需要真实答案且对标签噪声高度敏感的密集token级蒸馏。作者提出了测试时策略优化(TTPO),这是一种非对称目标,将GRPO惩罚应用于与伪标签不一致的rollouts(一个稳健的负信号),并对一致的rollouts进行在线策略自蒸馏,以rollouts自身的答案为条件来保持教师模型的安全,即使在伪标签不正确的情况下。Token级别选择使两个分支更加精细,产生了无标签训练,在模型规模和竞赛基准上匹配或超过了有监督的在线策略蒸馏。
方法
作者提出了一个非对称测试时训练框架,旨在在没有真实标签的情况下优化竞赛级问题上的语言模型。核心流程首先为每个测试问题采样多个推理轨迹,并提取它们的最终答案。这些答案通过数学等价性进行聚类,生成多数投票伪标签。然后,轨迹被划分为两个不同的集合:与伪标签一致的正样本,以及与伪标签不一致的负样本。
如下面的框架图所示:
在测试时训练设置中,多数投票伪标签经常是不正确的。作者观察到,使用损坏的教师模型对所有轨迹进行简单的自蒸馏会将错误传播到每个token。为了最小化这些伪标签错误的影响范围,框架采用了非对称设计。在将正样本蒸馏到以伪标签为条件的教师模型的同时,模型对负样本应用强化学习惩罚。这种方法非常稳健,因为在绝大多数情况下,惩罚不一致的rollout仍然是正确的,它仅依赖于不一致性,而不是可能错误的伪标签内容。
对于正样本,框架利用在线策略自蒸馏(OPSD)。教师分布是通过将同一模型以伪标签作为特权信息进行条件化来构建的,而学生分布则处理原始提示。教师和学生分布定义如下:
qt(a^)=πθ(⋅∣[x;a^]teacher,y<t) pt=πθ(⋅∣xstudent,y<t)作者应用了一个前向Kullback-Leibler散度损失,并采用了专门的逐token加权方案:
LOPSD(k)=Tk1t=1∑Tkw(t)⋅KL(qt(a^)∥pt)并非所有token都具有同等的学习价值,因此加权机制会降低学生已经收敛的位置的权重。它测量两个互补信号:学生熵和教师-学生散度。这些信号被归一化,并使用Soft-OR操作组合:
w(t)=H^(t)+Δ^(t)−H^(t)⋅Δ^(t)当学生不确定或自信地错误时,这会分配高权重;当学生已经自信且与教师一致时,权重接近零。
对于负样本,框架应用分组相对策略优化(GRPO)。每个轨迹根据多数投票分类获得二元奖励,优势是在给定问题的所有rollouts中分组相对计算的。由于负样本固有地获得负优势,该分支有效地惩罚了不一致的轨迹:
LGRPO(k)=−TkAkt=1∑Tkm(t)⋅logπθ(yk(t)∣x,yk(<t))为了防止对这些失败轨迹中局部正确的token进行错误惩罚造成附带损害,作者引入了一个token掩码方案。Token根据其负对数概率和归一化确定性进行评分:
s(t)=−logπθ(yk(t)∣x,yk(<t))⋅(1−H^(t))这种评分优先考虑模型自信地产生了不太可能内容的真正异常输出,同时自然地排除了局部正确的高概率token。然后通过按分数选择前一半token来构建二元掩码:
m(t)=1[s(t)≥median({s(t′)}t′=1Tk)]最终的统一目标结合了两个分支,用权重因子λ平衡各自的贡献。总体损失计算为正样本上的OPSD损失与负样本上的缩放GRPO损失之和,并按批次大小进行归一化:
LTTPO=∣B∣1(k∈P∑LOPSD(k)+λk∈N∑LGRPO(k))实验
评估使用在五个竞赛数学基准上用LoRA微调的Qwen3模型,在有监督和测试时训练设置下将TTPO与依赖标签和无标签的基线进行比较。TTPO的非对称目标——正样本上的前向KL和负样本上的GRPO——结合多数投票伪标签,始终匹配或超越依赖标签的方法,并显著优于先前的无标签方法,使得4B模型能够匹配8B基础模型。消融实验验证了token级别选择和更新策略,而分析表明,具有简短答案条件的思考教师提供了稳健的指导,该方法在任务间泛化,并且伪标签甚至可以通过维持有益的正负分割并促进自我进化改进来超越真实标签。
仅使用多数投票伪标签,TTPO在OpenThoughts训练数据上的三个模型规模上始终优于依赖标签的方法OPSD和GRPO。在4B模型上,TTPO达到了未经训练的8B基础模型的平均性能,有效地将推理能力放大到两倍大小的模型。这些结果表明,伪标签可以替代真实标签注释而不牺牲性能。尽管没有使用真实标签,TTPO在所有模型规模上都超越了OPSD和GRPO,平均增益在更大规模上扩大。TTPO在Qwen3-4B上达到了58.6的平均分,与8B基础模型持平,并有效地将每参数推理能力翻倍。多数投票伪标签被证明足以替代真实标签监督,使TTPO甚至超越了依赖标签的OPSD基线。
在Qwen3-1.7B模型上,无标签的测试时训练方法TTPO大幅优于TTRL和OPSD-TTT,在三个推理基准上达到了45.2的平均分。这比基础模型提高了7.2分,并表明来自具有答案条件伪标签的思考教师的密集token级指导比二元奖励或确定性自蒸馏更有效。TTPO在Qwen3-1.7B上达到45.2的平均分,超过OPSD-TTT 3.3分,超过TTRL 5.4分。与TTRL的差距突显了密集分布指导相对于二元奖励信号的优势。TTPO相对于OPSD-TTT的改进表明,具有非对称蒸馏的多数投票伪标签比贪婪自蒸馏提取了更多价值。
完整的token级别选择方法优于省略正样本加权或负样本掩码的变体。去除正样本加权会通过均匀蒸馏所有token来稀释梯度信号,而去除负样本掩码会不加区分地惩罚正确的推理步骤,并允许噪声token主导更新。结合这两种机制将蒸馏集中在信息丰富的token上,并将惩罚限制在错误位置,从而产生最佳结果。在所有基准上,放弃正样本加权会导致分数降低,因为均匀蒸馏削弱了信息丰富token的贡献。去除负样本掩码也会降低性能,在两个基准上出现明显下降,因为它惩罚了局部正确的步骤并引入了来自异常token的噪声。完整方法受益于互补效应:正样本加权将蒸馏集中在高价值token上,而负样本掩码防止附带损害和噪声注入。
当教师模型使用思考模式时,仅提供答案作为特权信息比没有特权信息略微提高性能,而完整轨迹会干扰独立推理从而降低性能。对于非思考教师,注入简短答案会严重降低性能,完整轨迹仅与无特权基线持平。因此,思考教师加答案设置在指导和稳健性之间提供了最佳权衡。使用思考教师时,仅答案提示产生最高性能,而完整轨迹通过主导上下文降低性能。使用非思考教师时,简短答案大幅降低性能,轨迹相对于无特权信息没有好处。思考教师加答案配置实现了指导与稳健性的最佳平衡。禁用教师的思考模式在所有类型的特权信息下都会持续损害性能。
实验评估了TTPO,一种使用来自思考教师的多数投票伪标签的测试时训练方法,在多个模型规模的推理基准上,与依赖标签(OPSD、GRPO)和无标签(TTRL、OPSD-TTT)基线进行比较。结果表明,伪标签可以完全替代真实标签注释,使TTPO能够达到两倍大小模型的性能,而具有非对称蒸馏的密集token级指导显著优于二元奖励或贪婪自蒸馏。消融实验表明,结合正样本加权和负样本掩码对于有效蒸馏至关重要,并且仅给予答案级特权信息的思考教师实现了指导与稳健性的最佳平衡,而不会干扰学生的推理。