Command Palette
Search for a command to run...
策略滞后下的轨迹复用:面向大语言模型强化学习的前缀归一化策略优化
策略滞后下的轨迹复用:面向大语言模型强化学习的前缀归一化策略优化
摘要
自回归轨迹生成是大语言模型强化学习中一项主要的计算开销。将每个轨迹批次复用于额外的学习器更新可以分摊这一成本,但随着学习器偏离行为策略,后续更新会变得越来越偏离策略。在某个词元位置,精确的离策略校正必须同时考虑当前动作以及到达其前缀的概率。累积重要性比率提供了这种校正,但其乘积形式可能导致难以处理的动态范围。我们研究了前缀归一化策略优化(PNPO),该方法将累积比率替换为每个因果前缀上似然比的几何平均值,在保留每个位置因果前缀依赖性的同时压缩了对数权重的尺度。在受控的长上下文数学推理实验中,我们通过对每个轨迹批次使用一个或四个策略更新轮次,构造了两种离策略状态。在一个更新轮次下,PNPO 并未一致地优于 GSPO。在四个更新轮次下,它在每个基准上均取得了最高的 Avg@32;三个独立选择的基准峰值的未加权均值为 50.24,比 GSPO 高出 3.00 个百分点。在匹配的 2400 次更新预算下,四轮次 PNPO 在 150 个轨迹批次后达到了 49.66 的最终宏观 Avg@32,与单轮次下 600 个批次后达到的 49.56 相当。这些结果提供了初步证据,表明随着训练进一步偏离策略,PNPO 可能具有优势。
一句话总结
腾讯等提出前缀归一化策略优化(PNPO),该方法用每个因果前缀上token似然比的几何平均值替代累积重要性比,以压缩对数权重尺度,同时保留因果前缀依赖性。在长上下文数学推理实验中,PNPO在四轮epoch更新下取得的Avg@32比GSPO高3个百分点,展示了高效的离策略LLM强化学习。
核心贡献
- 前缀归一化策略优化(PNPO)用每个因果前缀上token似然比的几何平均值替代精确的累积重要性比,保留了前缀条件依赖性,同时压缩了对数权重的动态范围。
- 在受控的数学推理实验中,PNPO在四轮epoch的离策略设置下,未加权平均峰值Avg@32比GSPO高3.00个百分点,且随着学习器与行为策略不匹配程度的增加,优势更加明显。
- 在匹配的2400次更新预算下,四轮epoch的PNPO在150个rollout批次后达到最终宏观Avg@32为49.66,与一轮epoch在600个批次后达到的49.56相当,初步证明了在更大的离策略不匹配下更有效的rollout复用。
引言
策略梯度方法是语言模型后训练的标准方法,但通过自回归生成收集rollout批次成本高昂。为分摊这一成本,PPO等方法将收集的rollout重用于多次学习器更新,这会导致离策略漂移,因为学习器发生变化而行为数据保持不变。近端策略方法通过局部比率替代项来解决这一不匹配问题,但这些方法忽略了完整的状态-动作校正,并且随着复用次数增加而减弱。作者提出了前缀归一化策略优化(PNPO),它使用沿因果前缀的似然比几何平均值来校正前缀访问,同时控制累积对数比率的尺度。其主要贡献是构建了这种前缀归一化权重,并在受控的离策略设置下进行评估,结果表明,当重复更新导致更大的学习器-行为不匹配时,PNPO相比序列共享权重表现出明显优势。
方法
作者提出了前缀归一化策略优化(PNPO),这是一种用于大语言模型强化学习微调的方法,旨在解决标准近端策略优化(PPO)及其变体(如GRPO)中固有的状态分布偏移问题。这些方法通常依赖一个局部替代项,该替代项将状态占用冻结在行为策略上,仅使用token级动作比 ρt=πθ(at∣st)/πβ(at∣st) 和截断的优势。虽然得到的策略梯度在行为策略处是无偏的,但当学习器偏离行为策略时,它忽略了精确离策略估计所需的前缀状态校正。
在自回归设定下,前缀状态比可以分解为过去动作比的乘积,从而得到精确的联合状态-动作测度变换比
Ct=k=1∏tρk.这个累积比与适当的优势相结合,可以得到无偏的梯度估计。然而,直接使用 Ct 会引入尺度问题:其对数方差随前缀长度和策略漂移而增长,使得梯度估计不稳定。此外,保留行为优势 Atβ 而使用当前token得分 zt=∇θlogπθ(at∣st) 会产生偏差;要将 Atβ 与无偏得分配对,必须使用累积前缀得分 ∑k=1tzk,而不是仅使用当前token得分。因此,作者开发了一种实用的替代项,在精确校正和尺度控制之间进行插值。
PNPO的核心是前缀归一化策略权重,它通过对 Ct 开t次方来压缩累积对数比:
wi,tPN=Ci,t1/t=exp(t1k=1∑tlogρi,k).这种变换保留了 logCt 的符号和跨响应的顺序,同时缩小了动态范围。在 t=1 时,它恢复为局部动作比;在 t=Li 时,它等于全响应比的几何平均值。对于中间位置,它仅依赖于前缀,排除了未来后缀的似然偏移,因此不是真正的密度比,而是一个单调近似。
为了进一步控制具有极端权重值的token的影响,PNPO采用了一个接受门,在权重超出位置相关容忍区间的token位置硬性拒绝得分项。该门使用启发式缩放因子 h(t,Li)=Li/t,它在早期位置放宽界限,并在最后一个token处收缩到基础区间 [1−ϵ−,1+ϵ+]。掩码 Mi,t 是一个二值指示符;如果权重超出界限,对应token的得分项就从目标中直接省略,而后续位置仍可参与。
完整的PNPO目标是一个分离的得分函数替代项,通过stop-gradient将门、前缀归一化权重和优势视为常数系数。对于一批提示,作者从行为策略中采样一组 G 个响应,计算组相对优势 Ai,t(使用与GRPO相同的归一化),然后最大化
JPNPO(θ)=E[G1i=1∑GLi1t=1∑Lisg[Mi,twi,tPNAi,t]logπθ(yi,t∣x,yi,<t)].每个响应的平均首先在有效token上归一化(被拒绝的token贡献为零),然后对所有响应的每个响应均值取平均。因此,该目标保留了PPO/GRPO的当前token得分结构,同时融入了近似状态分布校正的前缀感知权重。
在训练过程中,PNPO将一个固定的rollout批次重用于多个优化器epoch。行为策略的对数概率、组推导的优势和响应长度保持不变。在每个小批量更新中,学习器评估当前的分子对数概率,重新计算累积比、前缀归一化权重和接受掩码,并应用目标。这使得权重能够随着策略的演化而调整,而优势和行为策略分母保持固定。整体设计以精确的离策略校正换取稳定的尺度控制,旨在缓解当替代项在相同的陈旧轨迹上反复优化时可能累积的状态分布漂移。
实验
实验在长上下文数学推理任务上评估PNPO,使用在DAPO-Math-17k上微调的DeepSeek-R1-Distill-Qwen-1.5B模型,在AMC 2023、AIME 2024和AIME 2025上与GSPO和GRPO进行比较。在每个rollout批次进行四轮PPO epoch的情况下,PNPO在所有基准上均取得最佳性能,宏观平均比GSPO高3.00个百分点,并且这一优势贯穿整个训练轨迹,而不仅限于峰值分数。四轮epoch的PNPO与一轮epoch设置下的最终性能相当,但仅使用了四分之一的新生成响应,展示了更有效的rollout复用,并且比GSPO更早达到给定的奖励阈值。GRPO在长时间范围内未能保持早期收益,而GSPO虽然保持稳定,但评估指标上仍存在差距,这与PNPO的token级加权粒度的优势一致。
在四轮PPO epoch下,PNPO在所有基准上均取得最高的平均评估分数,比GSPO高出3个百分点。这一领先优势贯穿整个评估轨迹,并且PNPO仅使用四分之一的新生成响应就达到了与一轮epoch设置相当的最终性能,表明更高效的rollout复用。在四轮epoch设置下,PNPO也比GSPO提前数小时达到固定的奖励阈值。在四轮PPO epoch下,PNPO在所有三个基准上取得了最佳的Avg@32,平均为50.24,而GSPO为47.24。在一轮epoch设置下,PNPO和GSPO表现接近,交替领先;而在四轮epoch设置下,PNPO在15次评估中的14次领先,最终领先2.66个百分点。在相同的总优化器更新次数下,四轮epoch的PNPO在150个rollout批次后达到最终宏观Avg@32为49.66,与一轮epoch在600个批次后达到的49.56相当,显示了更有效的rollout复用。四轮epoch的PNPO在16.0小时内达到中心化奖励阈值0.25,比GSPO早6.4小时,且远早于一轮epoch的运行。GRPO的四轮epoch评估在达到峰值后下降,而GSPO稳定的奖励并未缩小评估差距,这与PNPO的位置相关前缀统计量提供的优势一致。
在比较PNPO、GSPO和GRPO在一轮和四轮PPO epoch下各基准的实验中,PNPO始终取得最高的评估分数,尤其是在四轮epoch设置下,它保持明显领先并更快达到奖励阈值。PNPO展示了更高效的rollout复用,用少得多的新响应匹配了一轮epoch训练的最终性能,而GRPO的性能在达到峰值后下降,GSPO未能缩小差距。这一优势归因于PNPO的位置相关前缀统计量。