HyperAIHyperAI

Command Palette

Search for a command to run...

面向代码智能体 RL 的分组式智能体评分与优势再分配

Jinhao Dong Liang Zhao Zihao Yue Wenhan Ma Linghao Zhang Lei Li Shicheng Li Yifan Song Bowen Ye Fuli Luo

摘要

针对代码智能体的强化学习(RL)通常使用可执行测试来给出二元奖励。在这些奖励下,分组相对策略优化(GRPO)会为每个 rollout 组内通过测试的轨迹分配相同的优势,忽视了实现质量以及对任务要求的遵守程度上的差异。这使得策略缺少一种学习信号,无法偏向简洁、有针对性的实现,而不是包含不必要或超出范围修改的实现。我们提出了 Gagar,一个用于代码智能体 RL 的质量感知信用再分配框架。Gagar 基于动态采样,保留同时包含通过和失败轨迹的组,并将每个组中的所有轨迹放入一个共享工作空间;在那里,一个经过 SFT 训练的智能体评分器会联合检查这些轨迹,并对通过测试的候选轨迹进行排序。基于该排序,我们降低排名较低轨迹的权重,并按比例重新缩放所有通过测试轨迹的优势,以恢复它们原有的总和。这种保持总和不变的再分配在将信用向更高质量实现转移的同时,保留了基于质量降权所建立的相对权重。我们使用 MiMo-V2.6-Flash(总参数 310B)和 MiMo-V2.6-Pro(总参数 1.02T)的 RL 前 SFT 检查点,在工业规模上评估 Gagar。受控的纯代码 Flash 实验表明,代码智能体性能提升、轨迹长度增长降低,训练更加稳定。我们进一步在 Flash 和 Pro 的大规模混合任务 RL 中应用 Gagar。我们的结果支持将基于测试的验证与分组式智能体评分相结合,以提升代码智能体 RL 的质量和稳定性。

一句话总结

来自小米、中国人民大学、北京大学及其他机构的研究者提出 Gagar,这是一个面向 code agent RL 的质量感知信用重分配框架;该框架使用动态采样和经 SFT 训练的 agentic grader 对通过测试的轨迹进行排序,对排名较低的轨迹降权,并应用保和优势缩放;在 MiMo-V2.6-Flash(总参数量 310B)和 MiMo-V2.6-Pro(总参数量 1.02T)上进行的工业规模实验显示 code agent 性能提升、轨迹长度增长降低、训练更稳定。

核心贡献

  • Gagar 是一个面向 code agent RL 的质量感知信用重分配框架,它使用动态采样保留同时包含通过和失败轨迹的组,然后使用经 SFT 训练的 agentic grader 在共享工作区中检查并对通过测试的轨迹进行排序。
  • Gagar 对排名较低的通过轨迹降权,并按比例重新缩放所有通过轨迹的优势,在将信用向更高质量实现转移的同时保留原始总正优势。
  • 在 MiMo-V2.6-Flash 上进行的受控纯代码实验显示 code agent 性能提升、轨迹长度增长降低、训练更稳定;使用 MiMo-V2.6-Flash 和 MiMo-V2.6-Pro 的混合任务 RL 在 DeepSWE v1.1 上达到 avg@3 分数 67.9 和 71.9。

引言

通过可执行反馈进行强化学习,是训练 code agent 的一种可扩展方式,此类 agent 会检查仓库、修改代码,并在长时间交互中验证更改。在 GRPO 等常见的组相对设置中,所有通过测试的轨迹都获得相同的正结果优势,因此训练信号无法区分更干净、更聚焦的补丁与过于复杂或高风险的实现。基于静态文本的评估也往往会忽略仓库上下文和执行证据。作者提出 Gagar,一个质量感知框架,该框架使用 agentic grader 检查代码、运行针对性检查,并在每个 rollout 组中对通过测试的候选轨迹进行排序,然后在成功轨迹之间重分配信用,同时保持这些轨迹的总正优势不变。该方法旨在强化精确、最小侵入、可直接合并的解决方案,并已在 MiMo 模型上以工业规模得到验证。

方法

作者利用逐组质量监督来增强 code agent 的强化学习,从而超越二元的任务结果。如下图所示,该框架将逐组 agentic grading 集成到 RL 训练循环中,以评估和排序有效的通过实现。

在训练设置中,对于每个编码任务,rollout 策略会生成多条轨迹。每条轨迹的最终补丁使用可执行测试进行评估,得到二元结果奖励。令 Gx={τi}i=1n\mathcal{G}_x = \{\tau_i\}_{i=1}^nGx​={τi​}i=1n​ 表示有效轨迹组。作者使用按均值中心化的结果优势 Ai=Ri−RˉA_i = R_i - \bar{R}Ai​=Ri​−Rˉ,其中 Rˉ=n−1∑j=1nRj\bar{R} = n^{-1} \sum_{j=1}^n R_jRˉ=n−1∑j=1n​Rj​。为确保成功和失败的轨迹同时存在,采用动态采样,使得 0<Rˉ<10 < \bar{R} < 10<Rˉ<1。所有通过轨迹最初获得相同的正优势 1−Rˉ1 - \bar{R}1−Rˉ,这无法区分实现质量。

为此,作者引入逐组 agentic grading。该 grader 在共享工作区中联合检查所有 rollout,工作区包含任务规范、仓库、完整轨迹、提交的补丁和测试输出。这种比较有助于识别最强解决方案,并暴露无效策略。agentic grader 以迭代方式收集证据,审查逐轮摘要,阅读相关轨迹部分,并将补丁与仓库代码和测试日志进行交叉核对。它还可以运行针对性检查。质量评估涵盖五个标准:方案适配性、精确性、最小改动性、副作用和代码库一致性。对通过的解决方案会检查是否存在泄露或外部答案,确认的作弊行为会得到零奖励。其余候选方案被评分并映射到三个质量等级,这些等级决定对其正优势的折扣因子 fi∈(0,1]f_i \in (0, 1]fi​∈(0,1]。

在 grading 之后,应用保和优势重分配。简单应用折扣因子会使通过轨迹得到 A~i=fiAi\tilde{A}_i = f_i A_iA~i​=fi​Ai​,在负侧没有相应变化的情况下移除正信用。这种缺口削弱了对成功轨迹的强化。为了保持分配给通过轨迹的总正优势 S+=∑i∈PAiS_+ = \sum_{i \in \mathcal{P}} A_iS+​=∑i∈P​Ai​,作者应用一个公共重缩放因子:

λ=S+∑j∈PfjAj\lambda = \frac{S_+}{\sum_{j \in \mathcal{P}} f_j A_j}λ=∑j∈P​fj​Aj​S+​​

重分配后的优势为:

Ai⋆={λfiAi,i∈P,Ai,i∈F.A_i^\star = \begin{cases} \lambda f_i A_i, & i \in \mathcal{P}, \\ A_i, & i \in \mathcal{F}. \end{cases}Ai⋆​={λfi​Ai​,Ai​,​i∈P,i∈F.​

这确保总正优势得到恢复,并且该变化在通过子集上是零和的,同时保持质量偏好的排序和相对强度。

在在线训练集成过程中,grading 与 rollout 收集异步运行。系统检查 grading 结果的有效性,必要时回退到原始结果优势。对于确认依赖外部解决方案的情况,系统会在重新计算组统计量之前将受影响奖励重置为零。所得的序列级优势被广播到模型生成的响应 tokens,以监督 RL 策略更新。

实验

这些实验使用 DeepSWE v1.1 和 SWE-bench Pro 作为基准,在 MiMo-V2.6-Flash 上的纯代码强化学习以及 Flash 和 Pro 上的工业规模混合任务 RL 中评估 Gagar。主要对比显示,Gagar 提升了长时程 code agent 性能,使轨迹更短且更高效,并在外部模型审查中取得更高实现质量。消融实验证实,保和重分配对训练稳定性很重要,因为降权通过轨迹而不恢复信用会导致动态不稳定和下游行为退化。工业规模运行进一步表明,与更大的前沿模型相比,code agent 性能具有竞争力。

使用 Gagar 进行工业规模混合任务 RL 后,MiMo-V2.6-Flash 和 MiMo-V2.6-Pro 在编码基准上取得与强大外部基线具有竞争力的结果。MiMo-V2.6-Pro 在 DeepSWE 上优于 Kimi K3,尽管其总参数量少得多,并在 SWE-bench Pro 上超过 GPT-5.6 Sol。其 DeepSWE 分数接近 GPT-5.6 Sol 和 Claude Opus 5,但在 SWE-bench Pro 上落后于 Claude Opus 5。MiMo-V2.6-Pro 在 DeepSWE 上优于 Kimi K3,尽管其总参数量少得多。MiMo-V2.6-Pro 在 SWE-bench Pro 上超过 GPT-5.6 Sol。MiMo-V2.6-Pro 在 DeepSWE 上接近 GPT-5.6 Sol 和 Claude Opus 5,但在 SWE-bench Pro 上仍低于 Claude Opus 5。MiMo-V2.6-Flash 在 DeepSWE 和 SWE-bench Pro 上的分数接近更大的外部模型。

本实验评估经过使用 Gagar 的工业规模混合任务 RL 训练后的 MiMo-V2.6-Flash 和 MiMo-V2.6-Pro 在编码基准上的表现。结果表明,MiMo-V2.6-Pro 与强大的外部模型相比具有竞争力,在 DeepSWE 上优于 Kimi K3,尽管参数量少得多,并在 SWE-bench Pro 上超过 GPT-5.6 Sol,同时在 DeepSWE 上接近 GPT-5.6 Sol 和 Claude Opus 5,但在 SWE-bench Pro 上仍低于 Claude Opus 5。MiMo-V2.6-Flash 也在 DeepSWE 和 SWE-bench Pro 上取得接近更大外部模型的分数。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供