Command Palette
Search for a command to run...
CoRT:面向令牌级评分准则引导策略优化的反事实重放方法
CoRT:面向令牌级评分准则引导策略优化的反事实重放方法
Bo-Wen Zhang Junwei He Wen Wang Song-Lin Lv Wentao Ma Rongyi Lin Shuhan Zhong Lan-Zhe Guo
摘要
基于评分准则的强化学习通过依据明确标准评估模型输出,丰富了语言模型的训练。然而,在 GRPO 风格的流程中,这些结构化的判断被简化为标量响应级奖励,并转换为响应级优势,再统一广播到所有生成的令牌上。这使得即使在响应内部不同准则对应不同文本片段、格式决策或语义选择时,也缺乏明确的功劳分配机制。我们提出 CoRT,一种用于评分准则条件 GRPO 的令牌级功劳加权方法。CoRT 不训练辅助的令牌评分模型,而是利用反事实重放,在原始评分准则条件提示和匹配的无准则提示下,对同一条采样响应重新评分。由此产生的逐令牌对数似然对比度,可作为对评分准则上下文依赖程度的代理指标。CoRT 将这些对比度映射为有界、响应归一化的权重,并用它们在令牌间重新分配带符号的 GRPO 优势,而无需引入辅助评分器或改变响应级奖励。在指令微调模型和不同奖励粒度上的实验表明,CoRT 在绝大多数对比中均优于匹配的响应级 GRPO,平均提升 4.4 个百分点。该方法在避免单独的相关性学习阶段的同时,仍能与基于学习的令牌级功劳基线相媲美。这些结果表明,策略内部的反事实似然对比度为响应内功劳分配提供了有效的训练信号,同时保留了 GRPO 的简洁性和稳定性。
一句话总结
CoRT,由南京大学、字节跳动和中国科学院大学的研究者提出,是一种用于基于评分标准条件化GRPO的token级信用加权方法,通过反事实回放计算评分标准条件化提示与无标准提示之间的token级对数似然对比,在无需辅助评分器的情况下重新分配符号化优势,平均带来4.4个百分点的提升,同时保留了GRPO的简洁性。
核心贡献
- CoRT是一种用于基于评分标准条件化GRPO的token级信用分配方法,通过反事实回放计算评分标准条件化提示与无标准提示之间的token级对数似然对比,作为标准依赖性的替代指标,无需训练辅助评分模型。
- CoRT将这些对比映射到有界、响应归一化的权重,并在token间重新分配符号化GRPO优势,保持原始rollout分布、标量奖励、验证器和截断替代目标结构不变。
- 在指令微调模型和不同奖励粒度上的实验表明,CoRT在大多数比较中优于响应级GRPO,平均提升4.4个百分点,并与学习到的token级信用基线方法保持竞争力,同时能平滑集成到DAPO和GSPO等替代策略优化算法中。
引言
在基于评分标准的指令遵循任务中,语言模型通过响应级奖励进行微调,这些奖励评估输出满足一组标准的程度。标准GRPO为响应中的所有token分配相同的优势信号,忽略了某些token对满足标准的贡献大于其他token的事实。这种响应内信用不匹配会减慢学习速度并破坏训练稳定性。作者引入CoRT,一种轻量级方法,利用反事实回放重新评估去除标准后的每个响应,然后将产生的似然对比转换为token级信用权重。这些权重将GRPO优势重新分配到更依赖标准的token上,无需独立模型,同时保持原始rollout分布、验证器和截断替代目标不变。
实验
在Qwen3-4B-Instruct模块中,CSR奖励GRPO变体在所有指令遵循基准测试中始终取得最高分,优于Instruct、SFT和DPO基线。最大提升出现在MultiDimIF Accuracy上,GRPO达到74.38,而其他方法在55-57范围内,其他指标则显示更温和的增益。使用CSR奖励的GRPO在每个指标上均取得最佳结果,在MultiDimIF Accuracy上有特别大的跃升。SFT和DPO根据基准测试互换第二佳方法的位置,SFT在IFEval上更强,DPO在IFBench Instruction、MultiDimIF Overall和AdvancedIF Rubric上更强。
Qwen3-14B模型使用两种奖励策略CSR和AON进行评估,均包含和不包含CoRT。CoRT持续提升MultiDimIF accuracy,尤其是AON,其指令遵循准确率从37.92提升至41.09,但应用于AON策略时略微降低了IFEval和IFBench分数。不含CoRT的AON取得最高的IFEval和IFBench分数,而含CoRT的AON则取得最佳的MultiDimIF整体准确率。CoRT将AON奖励GRPO的MultiDimIF指令遵循准确率从37.92提升至41.09,同时将IFEval从90.13略微降至89.80。CSR奖励GRPO在所有指标上均因CoRT获得一致提升,IFEval从87.87升至89.17。
将CoRT添加到DAPO可在所有评估指标上带来一致提升,包括指令遵循基准测试的明显增益。相比之下,CoRT仅对GSPO提供边际收益,MultiDimIF accuracy略有下降。含CoRT的DAPO在比较配置中取得最高的MultiDimIF accuracy。含CoRT的DAPO在IFEval指令分数上比单独DAPO提高1.3分,IFBench指令分数提高1.23分。含CoRT的GSPO在IFEval指令上仅提升0.1分,IFBench指令提升0.68分,而MultiDimIF accuracy下降0.3分。DAPO+CoRT在MultiDimIF accuracy上明显优于GSPO+CoRT,达到84.06对比81.96。
在三个实验中,论文评估了使用Qwen3模型进行指令遵循的一系列训练方法。CSR奖励GRPO变体始终优于基线,在MultiDimIF accuracy上产生特别大的增益。推理轨迹增强CoRT在应用于使用CSR奖励的GRPO或DAPO时提升MultiDimIF accuracy,但可能会略微降低AON奖励GRPO或GSPO的标准IFEval/IFBench分数,而DAPO+CoRT在比较的RL配置中取得最佳MultiDimIF accuracy。