Command Palette
Search for a command to run...
超越欧氏裁剪:通过黎曼等距策略优化克服大语言模型强化学习中的探索坍缩
超越欧氏裁剪:通过黎曼等距策略优化克服大语言模型强化学习中的探索坍缩
Zhicheng Cai Xinyuan Guo Hanlin Wu Mingxuan Wang Wei-Ying Ma Ya-Qin Zhang Hao Zhou
摘要
强化学习(RL)已成为增强大语言模型推理能力的主流范式。然而,基于 PPO-Clip 的 RL 算法固有地受限于探索坍缩。后续工作主要停留在启发式层面,未能识别 PPO-Clip 失效的根本原因。本工作揭示了 PPO-Clip 的基本缺陷:它隐式地使用欧氏度量来衡量策略差异,这在理论上与策略黎曼流形上的内蕴几何不一致。这种几何失配导致在低概率区域更新过于保守,而在高概率区域更新过于激进,最终造成探索坍缩。为纠正这一几何缺陷,我们提出了黎曼等距策略优化(RIPO),该方法保证在黎曼流形上进行等距的策略更新,有效平衡了探索与利用。我们进一步证明,RIPO 实现了有利的偏差-方差权衡,从而稳定了优化过程。大量实验表明,RIPO 在七个竞赛级基准测试中显著超越了现有的大语言模型 RL 算法(在 AIME24 上相较于 GRPO 提升高达 60%)。
一句话总结
清华大学的研究人员提出了黎曼等距策略优化 (RIPO),证明 PPO‑Clip 的探索坍塌源于策略黎曼流形上不一致的欧几里得度量,并通过强制等距更新来平衡探索与利用,在竞赛级推理基准上相较于 GRPO 最高提升 60%。
核心贡献
- PPO‑Clip 的根本局限在于几何不匹配:它隐式地使用欧几里得度量来约束策略更新,这与策略分布的内在黎曼流形几何相冲突,导致探索坍塌。
- 黎曼等距策略优化 (RIPO) 在策略黎曼流形上强制进行等距更新,以平衡探索与利用。
- RIPO 引入了统计同方差性以实现有利的偏差‑方差权衡,在七个竞赛级基准上的实验表明,它显著优于现有的 LLM 强化学习方法,包括在 AIME24 上相较于 GRPO 提升 60%。
引言
强化学习 (RL) 已成为增强大语言模型推理能力的关键范式,尤其是在数学问题求解等长期任务中。然而,在这些场景中被广泛采用的 PPO‑Clip 算法存在探索坍塌问题:策略会迅速收缩到一小部分高概率动作上,系统性地对稀有但信息丰富的动作更新不足,从而抑制性能。先前缓解该问题的尝试,例如提高裁剪边界,在 PPO‑Clip 框架内提供了一些启发式改进,但并未找出或解决根本原因。作者揭示了根本的几何不匹配:PPO‑Clip 在重要性比率上使用欧几里得度量来衡量策略差异,而自然的策略空间由 KL 散度支配并具有黎曼几何。这种不匹配导致了病态的更新,对于低概率动作过于保守,对于高概率动作又过于激进,从而推动策略过早集中。为了纠正这一问题,他们提出了黎曼等距策略优化 (RIPO),该方法在黎曼流形上重新解释策略更新,动态调整裁剪边界,以便为低概率动作允许更大的变化,同时约束高概率动作的变化。由此产生的等距更新平衡了探索与利用,显著提升了推理性能,而几何等距性还引入了统计同方差性,从而实现有利的偏差‑方差权衡。
方法
作者首先识别出标准 PPO‑Clip 机制中导致大语言模型策略优化出现探索坍塌的根本几何缺陷。PPO‑Clip 将重要性比率 rs,a(θ)=πθ(a∣s)/πθold(a∣s) 限制在固定区间 [1−ϵ,1+ϵ] 内,但这个约束是对称的且与当前动作概率无关。因此,高概率动作能够轻易地增长到其最大允许值(例如,当 ϵ=0.2 时从 0.8 到 0.96),而低概率动作几乎只能获得可忽略的绝对增长(例如,从 0.01 到 0.012)。这种不对称性抑制了探索多样性,并导致策略坍塌到一组已经偏好的 token 上。
这种行为的根本原因是 PPO‑Clip 隐式使用的欧几里得度量与策略空间的内在黎曼几何之间存在几何不匹配。PPO‑Clip 将比率偏差的平方 (r(θ)−1)2 视为策略变化的全局度量,假设相等的偏差意味着同等的可信度。实际上,策略差异的正确度量是 KL 散度,它在统计流形上诱导出黎曼度量。KL 散度的二阶泰勒展开揭示了两个策略之间的几何距离为
dgeom(πθold,πθ)∝πθold(a∣s)⋅(r(θ)−1)2.因此,距离取决于局部概率单纯形:高概率区域会放大距离,而低概率区域会缩小距离。PPO‑Clip 的裁剪边界完全忽略了这种缩放,使得高概率 token 消耗远更多的信赖域预算,而低概率 token 即使欧几里得偏差相同也被严重约束。
为了纠正这一点,作者提出了 黎曼等距裁剪 (Riemannian Isometric Clip, RIC)。RIC 不强制统一的比率偏差,而是要求每个状态‑动作更新在策略黎曼流形上移动完全相同的几何距离。他们施加
dgeom(πθold(a∣s),πθ(a∣s))≤δ,求解比率后,得到依赖于分布的裁剪阈值:
∣rs,a(θ)−1∣≤πθold(a∣s)2δ.在实践中,这被实现为一个动态裁剪边界 ϵs,a(πθold)=δ/πθold(a∣s),其中 δ 是允许的最大几何距离(信赖域半径)。因此,低概率动作获得更宽的裁剪范围,从而实现有意义的探索,而高概率动作则被限制在更紧的范围内,防止它们垄断更新预算。回到前面的例子,当 δ=0.02 时,高概率动作 (0.8) 被限制在 0.92(而不是 PPO 下的 0.96),而低概率动作 (0.01) 可以上升到 0.024(而不是 0.012)。两次更新消耗了完全相同的几何距离,实现了等距。
作者进一步证明,这种几何等距性在离策略重要性采样中意味着统计同方差性。重要性加权优势估计器的方差主要由与 πθold(x)r(x)2 成比例的项主导。PPO‑Clip 通过限制 r(x) 来降低方差,但它通过丢弃低概率样本引入了偏差。RIC 的动态裁剪在边界附近产生的方差贡献为 O(δ),与动作概率无关。因此,RIC 实现了原理性的偏差‑方差权衡:方差得到控制,而偏差远低于 PPO‑Clip,因为稀有但有价值的 token 不再被过度压制。策略流形上更新的几何等价性直接转化为样本间均等的二阶贡献,从而产生同方差性。
在此基础上,完整的 黎曼等距策略优化 (RIPO) 算法被设计用于 LLM 强化学习任务。RIPO 继承了 GRPO 的组相对优势估计器:对于每个查询 q,从旧策略中采样一组 G 个响应,并通过组均值和标准差归一化稀疏奖励来计算优势 A^i,t。然后,损失函数像 DAPO 一样应用 token 级别的策略梯度裁剪,以平衡不同长度响应的梯度影响。关键区别在于,裁剪边界现在是动态的 RIC 阈值 ϵi,t(πθold),而不是固定常数。形式上,RIPO 的目标函数为
JRIPO(θ)=Eq∼D,{oi}i=1G∼πθold(⋅∣q)[∑i=1G∣oi∣1i=1∑Gt=1∑∣oi∣min(ri,t(θ)A^i,t,clip(ri,t(θ),1−ϵi,t,1+ϵi,t)A^i,t)],其中 ϵi,t=δ/πθold(oi,t∣q,oi,<t)。这种设计确保每个 token 更新都遵守策略流形上相同的信赖域预算,直接对抗 PPO‑Clip 的探索坍塌,同时保持大语言模型训练的稳定性和样本效率。
实验
RIPO 在四种规模和架构各异的大语言模型上进行评估,使用 DAPO‑Math‑17k 进行训练,并在七个竞赛级数学推理基准上与六种采用不同裁剪策略的强化学习算法进行了比较。该方法始终优于基线,实现了更快的收敛和稳定的训练动态,没有熵坍塌或梯度尖峰,而消融研究证实了其对超参数的鲁棒性和对称裁剪的重要性。迁移到 PPO 目标、编程和搜索任务,以及 Pass@k 分析,进一步证明了 RIPO 的广泛适用性及其通过缓解长期推理中的探索坍塌来突破能力边界的能力。
RIPO 在所有四个基础模型规模上均一致地取得了最高的平均性能,相较于 GRPO 提升高达 37.2%,并超越了改进的裁剪方法如 DCPO。在 AIME24 和 BRUMO25 等困难基准上的增益尤为显著,且优势随模型规模而增长,证明了可扩展且鲁棒的推理改进。RIPO 提供了最佳的整体平均,在 Qwen3‑1.7B‑Base 上超出 GRPO 37.2%,并在所有测试骨干网络上一致领先于 DAPO、GSPO、GMPO 和 DCPO。在 AIME24 和 BRUMO25 等更困难的数据集上改进最为明显,并随着更大模型而扩大,突显了 RIPO 突破能力边界并保持策略多样性的能力。
对 AIME24 上 RIPO 裁剪参数 δ 的消融研究表明,对称值从 0.02 到 0.08 能产生稳定的 Avg@8 性能,在 40–44 左右,峰值在 0.05。引入不对称,将上裁剪边界(δ_high)设置得比下边界更紧,会导致 Avg@8 急剧下降到 29 以下,证实平衡的策略更新约束至关重要。对称裁剪且 δ 在 0.02 到 0.08 之间都能达到 Avg@8 超过 40,最佳结果为 δ=0.05 时的 43.8。将上裁剪边界设置得小于下边界(例如,δ_low=0.08, δ_high=0.02)会导致 Avg@8 降至 29 以下,与对称设置相比大幅下降。
RIPO 始终优于所有比较方法,在每个基准上都取得了最高分,相较于 GRPO 的提升幅度从 3.8 到超过 14 个点。虽然 GPPO 和 Clip‑Cov 总体上相对于 GRPO 有所改善,但 Clip‑Cov 在 HMMT25 上略有下降,突出了其不太稳定的行为。结果证明了 RIPO 在各种推理任务上的卓越稳定性和有效性。在六个基准中的四个上,RIPO 对 GRPO 取得了两位数的增益,包括在 BRUMO25 和 SMT25 上提升 14.2 个点。GPPO 提供了适度但一致的改进,在任何任务上都不低于 GRPO。Clip‑Cov 在大多数基准上优于 GRPO,但在 HMMT25 上下降了 1.2 个点,揭示了偶尔的不稳定性。在挑战性的 AIME25 基准上,RIPO (29.2) 对 GRPO 获得了 8.4 个点的增益,远远超过次优方法。
在与 PPO 目标一起使用时,RIPO‑Clip (RIC) 在 GSM8k 数学数据集上所有模型规模中均取得了最高的 Avg@1,优于 PPO‑Clip、DAPO‑Clip 和 DCPO‑Clip。对于较小的模型,增益最大,RIPO‑Clip 在 0.5B 模型上增加了 3.1 个点。训练动态显示,RIPO‑Clip 避免了标准 PPO‑Clip 中观察到的熵坍塌和梯度尖峰,促进了更稳定的优化和持续的探索。在 GSM8k 上,RIPO‑Clip 相对于 PPO‑Clip 的绝对 Avg@1 提升为 +3.1 (0.5B), +2.4 (1.5B), +1.8 (7B), 和 +1.2 (14B)。在 1.5B 模型上,RIPO‑Clip 保持了策略熵并表现出更平滑的梯度范数,而 PPO‑Clip 则遭受快速的熵衰减和剧烈的梯度波动。
在 AIME‑25 和 HMMT‑25 上,基础 Qwen3‑8B 模型的 pass@k 过早饱和,而经 RL 训练的方法随 k 的扩展而改善。RIPO 在每个采样预算下都取得了最佳的 pass@k,并继续从更大的 k 中受益,突破了基础模型的能力天花板。基础模型的 pass@k 在 k 增大时在 AIME‑25 上停滞在 16.7%,在 HMMT‑25 上为 6.7%,表明其固有的推理能力有限。RIPO 在 AIME‑25 上的 pass@128 达到 60.0%,在 HMMT‑25 上达到 45.3%,优于所有其他 RL 算法,并显示出随更多样本的持续改进。RIPO 与其他 RL 方法之间的差距随着采样预算的增加而扩大,DCPO、GRPO 和 DAPO 在所有测量的 k 值下均落后。
RIPO 在多个模型规模和挑战性数学推理基准上进行了评估,并与包括 GRPO 及其变体在内的几种强化学习基线进行了比较。实验表明,RIPO 始终提供最佳的整体性能,特别是在困难任务上,随着模型规模和采样预算的增加增益也在增长,证明了其超越基础模型能力限制的能力。消融研究证实对称裁剪对稳定性至关重要,其他研究揭示 RIPO 在训练过程中防止了熵坍塌和梯度尖峰,产生了更平滑的优化。总体而言,这些发现突显了 RIPO 在各种设置下的卓越鲁棒性、可扩展性和训练稳定性。