Command Palette
Search for a command to run...
从 RLVR 到 RLSVR:任务转换诱导自验证奖励,实现开放式大语言模型自我提升
从 RLVR 到 RLSVR:任务转换诱导自验证奖励,实现开放式大语言模型自我提升
摘要
基于可验证奖励的强化学习(RLVR)通过支持大规模优化,推动了近期面向推理的大语言模型(LLM)的进展。然而,其适用性仍主要局限于数学和编程等可确定性验证正确性的领域。相比之下,开放式任务通常依赖人类偏好、奖励模型或基于 LLM 的评判器,这会引入评估偏差、评判能力瓶颈和额外的推理成本。借鉴自监督学习通过构建前置任务从数据本身获取监督信号的原理,我们提出了基于自验证奖励的强化学习(RLSVR),这是一种基于任务转换的训练范式,旨在将 RLVR 扩展到开放式任务。RLSVR 将开放式任务转换为可验证的代理环境,其内部规则和交互结果能自动生成奖励信号。我们以 SpyRL 实例化 RLSVR,这是一种受社交推理游戏“谁是卧底”启发的自我博弈强化学习方法。智能体接收非对称信息,完成相同的目标任务,并通过投票识别指定的卧底。由于卧底身份是预先确定的,投票结果提供了完全可验证的奖励,而成功识别卧底仍与输出质量密切相关。在文本摘要、创意写作和数学推理上的实验表明,SpyRL 在不可验证任务上优于现有的自我提升方法,并在可验证推理任务上带来了一致的增益。这些结果表明,任务转换可以将基于 RLVR 的可扩展自我提升扩展到固有可验证领域之外。模型和代码已在 https://github.com/wangqinsi1/RLSVR/tree/SpyRL 发布。
一句话总结
杜克大学、Adobe Inc. 等提出带有自验证奖励的强化学习(RLSVR),这是一种任务转换范式,将开放式任务转化为可验证的代理环境,并以 SpyRL 作为具体实例——一个基于"谁是卧底"的自对弈游戏,其预先确定的卧底身份产生完全可验证的奖励信号,在文本摘要、创意写作和数学推理任务上展现出优于现有方法的自我改进能力。
核心贡献
- RLSVR 将 RLVR 扩展到开放式任务,通过将任务转化为代理环境,其内部规则产生自验证奖励,灵感来源于自监督前置任务的构建。
- SpyRL 将 RLSVR 实例化为一个信息不对称的多 agent 社交推理游戏,其中预先确定的卧底身份和投票结果自动生成与输出质量挂钩的可验证奖励。
- 在文本摘要、创意写作和数学推理上的实验表明,SpyRL 在 Qwen3-8B 上的摘要和创意写作分别达到 75.4% 和 77.3% 的胜率,并在 Qwen3-4B 和 8B 上跨七个基准将数学推理分别提升 8.97% 和 6.16%。基于投票的奖励与人类和 LLM 的质量判断高度一致。
引言
带有可验证奖励的强化学习(RLVR)已成功扩展了数学和编程等确定性领域的推理模型训练,但在摘要或创意写作等开放式任务中则失效,因为不存在真实答案的验证器。先前的方法通过使用学习到的偏好信号或基于模型的评判来放宽这一要求,但这些方法引入了评估偏差、受限于评判能力的瓶颈以及额外的推理开销。作者提出带有自验证奖励的强化学习(RLSVR),这一范式类似于自监督学习,将原始任务转化为一个奖励可自动验证的代理环境。他们通过 SpyRL 实例化这一想法,这是一个以社交推理游戏为蓝本的信息不对称自对弈框架。在 SpyRL 中,agent 接收到不同数量的任务信息,生成输出,然后投票识别哪个 agent 是卧底,这一过程将输出质量评估转化为一个可验证的身份推断问题。实验表明,SpyRL 在不可验证任务上大幅超越现有的自我改进方法,并在可验证的数学推理上也取得了一致的提升。
方法
作者提出 RLSVR(带有自验证奖励的强化学习),以解决开放式任务中 RLVR 的可验证性瓶颈。RLSVR 并非用学习到的奖励模型来近似不可验证的目标,而是将原始任务转化为一个奖励是确定性且基于规则的代理环境。这一转化涉及隐变量注入、条件化任务执行、可验证交互和基于规则的奖励计算,有效地将自监督学习原理转化为强化学习上下文。
为了实例化这一概念,作者引入 SpyRL,一个多 agent 自对弈框架,将不可验证的输出质量目标转化为可验证的身份识别问题。
如框架图所示,每个 SpyRL 训练周期在执行阶段和检测阶段之间交替进行。在执行阶段,n−1 个平民玩家接收完整信息,而一个卧底玩家接收输入的低质量版本。所有玩家为目标任务生成输出。在检测阶段,玩家共同分析这些输出以识别卧底。由于环境显式地分配了卧底身份,检测产生了一个自然可验证的结果。两个阶段的奖励紧密耦合:预先分配的身份监督检测阶段,而检测阶段的结果同时决定执行阶段的奖励。
在信息不对称的执行阶段,作者设计了面向能力的任务,以确保所需技能与目标任务对齐。为了引入可验证的训练信号,SpyRL 分配了不对称的信息输入。对于每个玩家 i,私有观察 oi 的构造方式是平民接收原始实例 x,而卧底接收低质量版本 g(x),其中 g(⋅) 是信息降级算子(例如上下文截断或关键信息压缩)。
上图详细展示了这一机制在三个代表性领域中的运作:文本摘要、创意写作和数学推理。降级算子模糊了关键信息,同时保留了风格和主题一致性,确保卧底表现出较差的性能,从而建立起可验证的奖励信号。每个玩家生成输出 yi∼πθP(⋅∣oi,τ),并被激励以最高能力执行任务,以避免被投票出局为卧底。
在带有可验证奖励的检测阶段,每个玩家基于公开输出 Y={y1,…,yn} 推断卧底的身份。玩家 i 采样一个投票动作 vi∼πϕD(⋅∣si),其中 si=(oi,Y)。由于卧底身份 u 由环境显式指定,检测器 i 的基础奖励为 riD=I[vi=u]。为了获得方差更低的优化信号,作者采用 GRPO 风格的组相对优势公式,在组内对奖励进行归一化,使检测器无需额外的 critic 网络即可学习。
SpyRL 的训练依赖于两阶段耦合优化。检测阶段的投票结果定义了执行阶段的奖励,创建了一个闭环学习系统。执行者的奖励设计遵循卧底和平民玩家之间的零和约束。卧底玩家 u 获得奖励 ruP=−β(mu−mˉc),而平民玩家 cj 获得 rcjP=ncβ(mu−mˉc)−λ(mcj−mˉc),其中 m 表示收到的票数。这确保了通过竞争实现持续的协同进化。为了缓解信息不对称引起的系统性偏差,在优化过程中引入了角色优势估计(RAE)。
在迭代优化过程中,执行者策略 πθP 和检测者策略 πϕD 使用带有 KL 正则化的 GRPO 风格截断目标分别更新。作者交替优化执行阶段和检测阶段,以避免过早收敛。当检测者容易识别卧底时,优化转向执行者以生成更高质量、更具欺骗性的输出。相反,当识别变得过于困难时,训练切换回检测阶段。这种交替策略打破了策略停滞,减少了信用分配中的干扰,从而带来更好的训练稳定性和样本效率。
实验
评估在三个领域中使用自对弈游戏,其中卧底接收掩码输入,平民接收完整文本,并交替训练执行阶段和检测阶段。SpyRL 将质量改进重新表述为身份判别问题,使奖励与任务表现对齐,无需外部验证器。它在可验证和不可验证任务上均一致地优于基线,提升通过人类评估和广泛泛化得到确认,而消融实验突显了交替优化、卧底机制和角色优势校准的必要性。
在摘要基准上,SpyRL 在 Qwen3-4B 和 Qwen3-8B 骨干上均一致地取得最高的 ROUGE-L 分数,优于基础模型以及 R-Zero 和 Absolute Zero 基线。在 GPT-4o A/B 评估中,SpyRL 在所有三十个测试设置中对每种其他方法都赢得了大多数成对比较,确认了其优越的生成质量。SpyRL 在所有五个摘要数据集上均取得最高的 ROUGE-L,无论骨干如何,在 GovReport 上相对于基础模型和基线的优势尤其大。在 GPT-4o 成对 A/B 测试中,SpyRL 在每个基准和两种模型规模上对每种其他方法(基础模型、R-Zero、Absolute Zero)的胜率均超过 50%。
在创意写作基准上,SpyRL 在 Qwen3-4B 和 Qwen3-8B 骨干的每个细粒度维度上均优于其未训练的骨干和自进化基线。最大的成对胜出优势出现在新颖性和情感方面,表明改进不仅限于表面流畅性,还延伸到开放式生成中更为主观的方面。SpyRL 在所有维度和骨干上赢得了对骨干和两个基线的所有成对比较,总体胜率从 71.1% 到 81.3% 不等。最大的提升出现在新颖性和情感方面,SpyRL 在 WritingPrompt 新颖性上对 Qwen3-4B 骨干的胜率达到 84.3%,而连贯性和一致性得分相对较低,表明在主观质量上有更深层的改进。
SpyRL 在 Qwen3-4B 和 Qwen3-8B 的所有七个数学和通用推理基准上均取得最高准确率,优于骨干和基线方法。在最具挑战性的数学基准上提升尤为显著,该方法还提升了 MMLU-Pro 和 GPQA-D 等知识密集型推理任务的表现,表明其收益超越了纯数学领域。SpyRL 在两种模型规模的所有基准上均取得最佳准确率,超越骨干、R-Zero 和 Absolute Zero。在 Qwen3-4B 的 AIME25 上,SpyRL 将准确率从 6.7% 提升至 20.0%,使骨干性能翻倍以上。该方法提升了 MMLU-Pro 和 GPQA-D 的得分,展示了在数学之外更广泛推理任务上的提升。SpyRL 的优势在所有五个数学基准上保持一致,在困难的 AIME24 和 AIME25 数据集上相对提升最大。
在创意写作的人类评估中,SpyRL 在每个维度和数据集上均优于骨干模型、R-Zero 和 Absolute Zero。最强的胜利出现在新颖性和情感方面,表明 SpyRL 的提升超越了流畅性,延伸到开放式文本中更为主观的品质。SpyRL 在 WritingPrompt 和 WritingBench 的所有五个维度上赢得了大多数成对比较,总体胜率从 72.0% 到 85.0% 不等。最大的优势出现在新颖性和情感方面,在 WritingBench 上对骨干的胜率分别达到 84.5% 和 85.0%,表明主观丰富性有所提升。面对最强的基线 R-Zero,SpyRL 仍然取得了明显优势,在两个数据集上的总体质量胜率超过 80%。
SpyRL 在两个写作基准的所有维度上一致地战胜了 Qwen3.5-RaR,WritingPrompt 的总体胜率为 59.3%,WritingBench 为 56.2%。面对 GPT-4o-RaR,胜率接近 50%,表明具有竞争力的表现。关键的是,SpyRL 在没有外部验证器的情况下取得了这些结果,而基线则产生了 200 美元和 900 美元的额外成本。在 WritingPrompt 上,SpyRL 在每个维度上均战胜 Qwen3.5-RaR,总体胜率为 59.3%。面对 GPT-4o-RaR,SpyRL 的总体胜率分别为 48.9% 和 48.2%,在避免 200 至 900 美元验证器成本的同时展现出相当的质量。
SpyRL 在摘要、创意写作、推理和人类偏好基准上进行了评估,一致地优于其未训练的骨干以及 R-Zero 和 Absolute Zero 等自进化基线。该方法在创意任务的新颖性和情感等主观品质上带来了尤为显著的提升,并在所有推理基准上取得了最高准确率,在具有挑战性的数学问题上改进尤为突出。人类评估确认了其相对于基线的偏好,并且其质量与使用昂贵验证器的方法相当,而无需产生额外的验证器成本,展示了稳健且具有成本效益的自我改进能力。