HyperAIHyperAI

Command Palette

Search for a command to run...

LLM
模型训练

J-ZERO:从零数据出发的统一挑战者–求解器–评判者协同进化框架

Gyouk Chu Myeongho Jeon Eunho Yang

摘要

自演化语言模型近期已成为迈向超级智能的一条有前景的路径,其优势在于降低人类监督的成本。尽管在可验证领域已取得显著进展,但在不可验证领域的自演化仍远未得到充分探索。我们提出从零数据出发的评判者协同适应框架(J-ZERO),这是一个统一的挑战者–求解器–评判者协同进化框架,支持在两类领域中进行自我改进。挑战者与求解器通过对抗式交互协同进化:挑战者生成越来越困难的任务,而求解器则学习为这些任务生成更高质量的响应。与此同时,评判者利用偏好对进行协同适应,这些偏好对的排序并非来自评判者自身的评分,而是根据每个响应的产生方式预先已知的,即求解器的答案优于挑战者的答案,以及其分解重组后的答案优于一次性生成的答案。J-ZERO 在可验证领域平均超出基线 4.2 分,在不可验证领域平均超出基线 8.0 分,并能在至少十轮迭代中持续改进,而基线方法在两轮后性能便开始下降。

一句话总结

KAIST 研究人员提出 J-ZERO,一个从零数据出发的统一 Challenger–Solver–Judge 协同进化框架,支持在可验证与不可验证领域中的自我改进;其中 Challenger 与 Solver 对抗性协同进化,Judge 则利用按生成顺序确定的偏好对进行协同自适应,而不是使用自身打分;该框架在可验证领域比基线高 4.24.24.2 分,在不可验证领域高 8.08.08.0 分,并且至少在十轮迭代中持续改进,而基线在两轮后即退化。

核心贡献

  • J-ZERO 是一个零数据自我进化框架,其中 Challenger、Solver 和 Judge 协同进化,在无需外部数据或人类反馈的情况下支持可验证与不可验证领域的自我改进。
  • Judge 利用偏好对进行协同自适应,这些偏好对的顺序根据响应生成方式预先已知,例如 Solver 响应优于 Challenger 响应,分解再组合的答案优于一次性答案。
  • 在两个模型规模上,J-ZERO 在可验证领域平均比先前的零数据方法高 4.2 分,在不可验证领域平均高 8.0 分;并且至少在十轮迭代中持续改进,而已有方法在两轮后即退化。

引言

自我进化的大语言模型减少了对昂贵人工监督的依赖,但无数据的自我对弈主要在可验证领域有效,因为客观答案提供了明确的奖励信号。在不可验证领域,先前方法依赖固定的 Judge,这产生了评估上限:一旦 Solver 超过 Judge 的内部偏好,后续训练就无法产生有用信号。作者提出 J-ZERO,这是一个零数据框架,其中 Challenger、Solver 和 Judge 协同进化。Judge 使用从循环中的结构不对称性导出的偏好对进行训练:Solver 响应优于 Challenger 响应,分治响应优于一次性响应。这使得评估信号能够随时间改进,并支持在可验证与不可验证领域持续自我改进。

方法

作者提出 J-ZERO,这是一个自我进化框架,在自我对弈循环中让 Judge 与 Challenger 和 Solver 一起协同自适应,而不是在整个训练过程中保持奖励模型固定。该方法缓解了静态奖励模型造成的性能上限。自我进化以迭代方式进行,每次迭代包含三个不同阶段。

如下图所示:

在第一阶段,Challenger 通过最小化 Judge 给 Solver 响应赋予的奖励,学习生成越来越困难的任务。在第二阶段,Solver 通过最大化 Judge 奖励,被训练为对这些困难任务产生更高质量的响应。最后,在第三阶段,Judge 使用自我对弈循环中构造的偏好对上的 Bradley-Terry 损失进行更新。

Challenger 与 Solver 的对抗进化

作者将 Challenger CθcC_{\theta_c}Cθc、Solver SθsS_{\theta_s}Sθs 和 Judge JϕJ_\phiJϕ 之间的交互建模为不对称对抗博弈。Challenger 采样一批任务,Solver 为每个任务生成多个响应。Judge 为每个任务-响应对分配标量分数。交互形式化为:

minθcLC(θc;θs,ϕ),maxθsRS(θs;θc,ϕ)\min_{\theta_c} \mathcal{L}_C(\theta_c; \theta_s, \phi), \quad \max_{\theta_s} \mathcal{R}_S(\theta_s; \theta_c, \phi)θcminLC(θc;θs,ϕ),θsmaxRS(θs;θc,ϕ)

Solver 目标由 Judge 分数直接决定,而 Challenger 目标包含辅助约束,以抑制重复或格式错误的任务。Challenger 损失定义为负的期望复合奖励。

为了计算 Challenger 奖励,作者首先对每个任务在 Solver 响应上计算平均 Judge 分数,用于估计当前 Solver 处理该任务的程度。任务难度奖励定义为 1 减去该平均分数。为防止 Challenger 生成近似重复的任务或格式错误的输出,难度奖励加入了重复惩罚和格式检查。重复惩罚将两两相似度高的任务分组成簇,并根据任务所在簇的大小对任务进行惩罚。复合 Challenger 奖励组合这些元素,如果生成的任务未通过格式检查,则施加严重惩罚。随后使用 Group Relative Policy Optimization 优化 Challenger 参数,以最大化该复合奖励。

对于 Solver 进化,作者冻结 Challenger,并采样更大的候选任务池。通过衡量响应级分数离散度,保留提供最丰富训练信号的任务。选择分数离散度最大的任务,因为这些任务位于 Solver 当前能力前沿附近,提供最大的学习空间。随后使用 Group Relative Policy Optimization 在这些选定任务上训练 Solver,同时保持 Challenger 和 Judge 固定。通过这些交替更新,Challenger 不断扩展任务前沿,而 Solver 适应以产生越来越高质量的响应。

Judge 自适应

为了实现持续自我改进,Judge 与另外两个组件协同进化。作者对这种协同进化提出两个要求:偏好对必须完全在闭环内构造,不使用外部监督;其标签不得依赖 Judge 自身产生的信号。利用两个互补监督来源来满足这些要求。

第一个来源是角色不对称偏好对。对于每个留出任务,选定响应从 Solver 采样,而被拒绝响应通过要求 Challenger 在相同提示下解决自己的任务产生。由于 Solver 被优化为擅长回答任务,而 Challenger 被优化为使任务变难,但没有获得回答任务的学习信号,因此 Solver 响应在系统上更优。这种排序由策略角色诱导,而不是当前 Judge 分数决定,因此即使在 Judge 误校准的情况下也能提供判别监督。

第二个来源是子任务放大偏好对。仅依赖角色不对称偏好对可能导致 Judge 在当前 Solver 能力水平饱和。为构造高于该前沿的响应,作者采用迭代放大。Challenger 将一个留出任务分解为更简单的子任务。Solver 回答每个子任务,Challenger 将部分解组合成完整响应。将该放大响应与从 Solver 采样的一次性响应进行比较。由于 Solver 在更简单的子任务上更可靠,组合响应往往更准确,使 Judge 接触到高于当前一次性前沿的响应质量。

这两个偏好对集合的并集构成 Judge 的训练数据。从上一轮迭代获得的参数开始,通过最小化 Bradley-Terry 损失更新 Judge:

LJ(ϕ)=E(x,y+,y)D[logσ(Jϕ(x,y+)Jϕ(x,y))]\mathcal{L}_J(\phi) = - \mathbb{E}_{(x, y^+, y^-) \sim \mathcal{D}} \left[ \log \sigma \left( J_\phi(x, y^+) - J_\phi(x, y^-) \right) \right]LJ(ϕ)=E(x,y+,y)D[logσ(Jϕ(x,y+)Jϕ(x,y))]

通过聚焦于自我进化的当前前沿,Judge 学会纠正其在困难示例上的错误排序,获得针对其所监督的最新策略定制的评估能力。

实验

实验使用 Qwen3-4B-Base 和 Qwen3-8B-Base,在可验证和不可验证基准上评估 J-ZERO,并与基础模型以及两个零数据自我对弈框架 R-Zero 和 G-Zero 进行比较。J-ZERO 在所有基准组上都取得最佳分数,在不可验证领域提升尤其大,而基线由于依赖仅可验证的奖励信号而表现困难。分析表明,自生成的偏好标签在整个训练过程中保持可靠,角色不对称偏好对在早期提供信号,子任务放大偏好对在 Solver 成熟后接替;消融实验确认两类偏好对都有贡献。关键在于,Judge 协同进化避免了固定 Judge 变体和竞争方法中观察到的平台期,使 Judge 的评估标准随 Solver 能力上升而提高,从而在十轮迭代中实现持续改进。

在可验证数学推理基准上,J-ZERO 在两个模型规模上均取得最高平均性能,明显优于基础模型和先前的零数据自我进化方法。在较难的基准如 Minerva、OlympiadBench 和 AMC23 上提升最强。在 GSM8K 上,分数已经较高,R-Zero 在两个规模上仍略领先于 J-ZERO。在 4B 和 8B 规模上,J-ZERO 在比较方法中取得了最佳的可验证基准平均分。较难的数学推理任务如 Minerva、OlympiadBench 和 AMC23 显示 J-ZERO 的明显改进,而 GSM8K 保持接近,R-Zero 略领先。

在不可验证基准上,J-ZERO 在两个评估规模上均一致优于基础模型和先前的零数据基线。R-Zero 和 G-Zero 的增益远小于可验证设置,使它们更接近基础模型,而 J-ZERO 的最大改进出现在广泛的指令遵循 AlpacaEval 基准上。J-ZERO 在每个不可验证基准以及两个模型规模的整体平均分上均领先,增益远大于 R-Zero 和 G-Zero。基线只取得适度改进:R-Zero 受限于多数投票奖励,无法扩展到开放式任务;没有 Judge 的 G-Zero 仍然仅略高于基础模型。J-ZERO 的最大增益出现在 AlpacaEval 上,从较低的基础模型分数提升到两个规模上报告的最高分数。

消融结果表明,Judge 的两个训练数据组件都有贡献,其中子任务放大带来更大的单项收益。移除子任务放大偏好对造成的整体性能下降大于移除角色不对称偏好对。结合两个来源可在可验证、不可验证和整体指标上取得最强结果。完整 J-ZERO 配置优于固定 Judge 变体以及缺少任一偏好数据组件的变体。子任务放大偏好对是更强的单一贡献来源,因为移除它导致的整体下降大于移除角色不对称偏好对。两个数据来源互补,并在不同阶段最可靠,因此同时使用两者可获得最佳整体性能。

J-ZERO 在可验证数学基准上优于基线和先前的零数据方法,较难任务增益最大,而 GSM8K 与 R-Zero 接近。在不可验证基准上,J-ZERO 在所有任务和规模上领先,尤其是在 AlpacaEval 上表现出特别强的改进,而先前方法仍接近基础模型。消融表明,Judge 的两个训练数据来源均有贡献,子任务放大带来更大的单项收益,组合则可获得最佳整体结果。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供