HyperAIHyperAI

Command Palette

Search for a command to run...

Co-RL:多智能体强化学习中多样化队列催生无监督推理能力

Yunhao Yang Yuexin Bian Yunjie Tian Di Fu Tianjin Huang Yuanyuan Shi Ziang Xiao Nuno Vasconcelos Yijiang Li

摘要

强化学习(RL)已成为提升语言模型和视觉-语言模型推理能力的有力途径,但其最显著的成功仍高度依赖真实标签监督(例如可验证奖励)。此类标注获取成本高昂,且随着推理能力超越人类可靠评估的范围而日益稀缺。自奖励强化学习通过让模型从自身生成结果中获取奖励信号来降低这种依赖。然而,仅基于自生成反馈进行训练可能会强化既有偏差和次优行为,降低响应多样性,并最终导致响应同质化和训练崩溃。在本工作中,我们证明无监督推理能力可以通过协作式多智能体训练自然涌现。我们提出 CO-RL 框架,在该框架中,多个相互解耦、不共享参数的模型通过强化学习同时优化,并使用来自同队列其他模型的奖励信号。我们进一步表明,通过异构模型家族、模型规模和改写后的训练样本提升队列多样性,可以减少驱动自强化反馈循环的相关性误差。这种多样性持续改善推理性能,保持行为多样性,并缓解训练崩溃。在纯文本和多模态领域中,CO-RL 均一致优于基础模型和此前的无标签方法,同时在没有任何真实标签的情况下达到或超越有监督方法。具体而言,CO-RL 在七个纯文本基准上为 LLM 带来 3.0–8.6% 的平均提升,在四个多模态基准上为 VLM 带来 2.3–7.2% 的平均提升。代码见 https://github.com/DrStranded/Co-RL

一句话总结

来自约翰霍普金斯大学、加州大学圣迭戈分校、埃克塞特大学的研究者与一位独立研究者提出 CO-RL,一种协作式多 agent 框架,其中参数解耦的模型通过同伴生成的奖励进行优化,并且跨模型家族、模型规模和改写样本的队列多样性降低了相关错误;在无真实标签的情况下,该方法在七个纯文本基准上取得 3.0–8.6% 的提升,在四个多模态基准上取得 2.3–7.2% 的提升。

核心贡献

  • 论文提出 CO-RL,一种无标签的 multi-agent 强化学习框架,其中多个不共享参数的解耦模型同时被优化,所用奖励来自同伴预测,而非真实标签或外部评判器。
  • 论文表明,通过异构模型家族、模型规模和改写训练样本提高队列多样性,可减少相关错误与自我强化的反馈回路,提升推理性能、保持行为多样性并缓解训练崩溃;理论分析表明,跨 agent 监督扩大了收敛到正确解的初始条件集合。
  • 在纯文本和多模态领域,CO-RL 在七个纯文本 LLM 基准上平均提升 3.0% 到 8.6%,在四个多模态 VLM 基准上平均提升 2.3% 到 7.2%,优于基础模型和既有无标签方法,并在不使用真实标签的情况下达到或超过监督式方法。

引言

带有可验证奖励的强化学习已经改善了大语言模型的推理能力,但随着任务变难,其对真实标签的依赖使标签变得昂贵且稀缺。此前的无标签方法通常依赖单一模型自身输出进行自我奖励,这可能放大既有偏差、降低响应多样性并导致训练崩溃。作者提出 CO-RL,一种协作式 multi-agent 框架,其中独立训练且多样化的模型通过同伴多数投票伪答案相互监督。这种去相关的跨 agent 监督避免使用外部评判器和真实标签,改善纯文本与多模态推理,并常常达到或超过监督式训练。

方法

强化学习(RL)已成为增强自回归语言模型推理能力的标准方法。通常,策略 πθ\pi_\thetaπθ 针对提示 xxx 生成响应 yyy,并通过类似群体相对策略优化(GRPO)的算法使用标量奖励 r(x,y)r(x, y)r(x,y) 进行优化。在缺乏外部验证器时,自我奖励 RL 方法直接从模型自身的输出构造奖励函数,例如使用多数投票一致性。然而,由于这些信号来自正在优化的同一策略,训练可能强化既有偏差、降低响应多样性,并最终导致响应同质化或训练崩溃。

如下图所示:

为解决这一问题,作者提出协同强化学习(Co-RL),一种无标签的 multi-agent RL 框架。其核心思想是,独立训练模型之间的错误已经去相关,因此可以产生独立的学习信号。一个模型能够提供另一个模型无法从自身生成结果中获得的纠正性反馈。

参见框架图:

在 Co-RL 中,一组 NNN 个 agent 具有独立参数化策略 {πθn}n=1N\{\pi_{\theta_n}\}_{n=1}^N{πθn}n=1N,为无标签问题生成补全。这些 agent 既不共享参数也不共享梯度;它们的优化仅通过相互提供的奖励耦合在一起。对于每个无标签问题 xxx,每个 agent nnn 独立采样一组 KKK 个补全,并提取最终答案。

如下图所示:

关键的是,每个 agent 仅根据指定同伴生成的答案构造监督目标。伪标签 a^n(x)\hat{a}_{-n}(x)a^n(x) 通过对该同伴答案进行多数投票得到:

a^n(x)argmaxbj=1K1[an1j=b]\hat{a}_{-n}(x) \in \arg\max_b \sum_{j=1}^K \mathbf{1}[a_{n-1}^j = b]a^n(x)argbmaxj=1K1[an1j=b]

其中索引按循环方式取值,使得 agent 1 由 agent NNN 监督。agent nnn 的第 kkk 个响应的奖励为 rnk=1[ank=a^n(x)]r_n^k = \mathbf{1}[a_n^k = \hat{a}_{-n}(x)]rnk=1[ank=a^n(x)]。这确保每个 agent 都不会参与自身监督目标的构造。

策略优化使用 GRPO 进行。奖励 {rnk}k=1K\{r_n^k\}_{k=1}^K{rnk}k=1K 在每个 agent 的采样组内进行归一化,得到群体相对优势 A^nk\hat{A}_n^kA^nk。总体训练目标最大化所有 agent 的平均 GRPO 目标:

maxθJCo-RL(θ)=1Nn=1NJGRPO(θn;{ynk,rnk}k=1K)\max_{\boldsymbol{\theta}} \mathcal{J}_{\text{Co-RL}}(\boldsymbol{\theta}) = \frac{1}{N} \sum_{n=1}^N \mathcal{J}_{\text{GRPO}}\left(\theta_n; \{y_n^k, r_n^k\}_{k=1}^K\right)θmaxJCo-RL(θ)=N1n=1NJGRPO(θn;{ynk,rnk}k=1K)

其中每个 agent 的目标包含裁剪后的替代损失和相对参考策略的 KL 正则项。

Co-RL 的有效性在很大程度上依赖于队列多样性。高度相似的模型往往会产生相关错误,从而削弱纠正信号。作者在三个维度上推动多样性:

  1. 解耦策略优化:各 agent 独立训练,彼此之间没有梯度传播,从而在整个训练过程中保持较低相关的预测。
  2. 模型家族与规模:使用不同的预训练模型家族(它们在架构、tokenization 和预训练数据上不同)以及不同的模型规模,可引入正交的归纳偏置和错误模式。
  3. 输入构造:agent 可以在语义等价但措辞不同的提示上进行训练(例如通过改写),以减少由特定提示措辞引发的相关错误。

这种多样化且解耦的设置使 Co-RL 能够利用各 agent 之间的互补优势,纠正自我奖励方法本来可能会强化的错误。

实验

实验在以数学为中心的数据集上训练的成对语言模型和视觉语言模型上评估 CO-RL,并在推理和多模态数学基准上与自我奖励、multi-agent RL 和真实标签监督等基线进行比较。主要结果表明,CO-RL 在自我奖励和 multi-agent 方法上持续改进,可扩展到三个异构 agent,并能迁移到视觉语言模型,在不使用标签的情况下常常达到或超过真实标签监督。消融实验进一步证实训练动态稳定,没有奖励崩溃或长度退化;预算匹配比较表明,这些提升源于跨 agent 监督,而不是额外计算或集成。

CO-RL 在语言基准上优于无标签的自我奖励基线。同家族设置已经使 Qwen2.5-3B 和 Llama-3.2-3B-Instruct 基础模型的平均性能分别提升 8.0 和 4.0 个百分点,而跨家族多样性还能带来总体上的进一步提升。真实标签奖励训练仅作为监督参考。同家族 CO-RL 变体使 Qwen2.5-3B 平均性能提升 8.0 个百分点,使 Llama-3.2-3B-Instruct 平均性能提升 4.0 个百分点。CO-RL 在无标签方法中处于领先地位,优于 TTRL、RENT、Intuitor 和 Co-Rewarding-II,且跨家族多样性增加了进一步的总体收益。

在 CoMAS multi-agent RL 比较中,不同家族 CO-RL 变体取得最高平均性能,并在七个基准中的五个上领先。它在仅使用一半数量 agent 且没有额外评判机制的情况下,比 CoMAS 高出四个百分点,并且平均性能也超过 MAPoRL 和 TTRL。采用不同家族 agent 的 CO-RL 在所有比较方法中获得最高总体平均性能。它在七个基准中的五个上领先,并在仅使用一半数量 agent 的情况下比 CoMAS 高出四个百分点。

在异构模型家族的单次三 agent CO-RL 运行中,CO-RL 改善了所有三个基础模型,平均提升约 6 到 8 个百分点。在不使用真实标签监督的情况下,三 agent CO-RL 在所有模型上的平均表现达到或超过真实奖励训练。对于 Qwen2.5-3B 和 Llama-3.2-3B-Instruct,它还优于 TTRL 自我奖励基线。CO-RL 在三个异构 agent 上均持续改进基础性能。三 agent CO-RL 在没有真实标签监督的情况下平均达到或超过 GT-Reward。CO-RL 在 Qwen2.5-3B 和 Llama-3.2-3B-Instruct 上优于 TTRL 自我奖励基线。

在小型视觉语言设置中,CO-RL 在 open-r1 下针对 InternVL3.5-2B 相比基础模型和 TTRL 都有提升,在所比较方法中取得最高平均值,并略高于真实标签监督。报告结果还指出,CO-RL 在四个小型 2B-3B 设置中的三个上取得最佳平均值,同时与真实奖励保持竞争力。对于 MMR1,TTRL 相比基础模型有明显提升,并且平均值高于真实标签监督。在 open-r1 下,CO-RL 在 InternVL3.5-2B 上的平均值略高于 TTRL 和 GT-Reward。在 open-r1 的逐基准结果中,GT-Reward 在 MathVision、MathVerse 和 MathVista 上仍然领先,而 TTRL 在 paper-Math 上领先。对于 MMR1,TTRL 的平均准确率高于基础模型,并略高于 GT-Reward。

实验在语言基准、multi-agent 强化学习、异构三 agent 运行和小型视觉语言模型上评估 CO-RL 这一无标签自我奖励方法。CO-RL 持续改进其基础模型,并优于 TTRL、RENT、Intuitor 和 Co-Rewarding-II 等无标签基线,跨家族多样性带来额外提升。在 multi-agent 比较中,不同家族变体在使用更少 agent 且没有独立评判机制的情况下取得最高总体平均值;异构三 agent 运行改善了所有参与模型,并在没有监督的情况下达到或超过真实奖励训练。在小型视觉语言设置中,CO-RL 对 InternVL3.5-2B 处于领先地位,并保持与真实标签监督的竞争力,而 TTRL 对 MMR1 表现出更明显的提升。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供