HyperAIHyperAI

Command Palette

Search for a command to run...

虚假前沿:自进化搜索智能体协同作弊的诊断与缓解

摘要

自进化搜索智能体可以通过联合优化生成问题的提议器(proposer)和回答问题的求解器(solver)来构建自身训练课程。这一闭环引入了一种我们称为协同作弊的失效模式:提议器和求解器对共同错误越来越一致,因此内部奖励提升,但外部正确性并未相应提高。基于源证据的事后参考审计显示,在连续多轮自进化中,协同作弊愈发严重,伪标签的正确性停滞甚至下降,而环内训练信号却在改善。最直接的缓解方法是在训练前验证每个提议。为此,我们引入多样本验证(MSV),对自进化所用的同一模型在带源证据和不带源证据的条件下各查询三次,以决定任务准入并替换不可靠伪标签。MSV 在一定程度上减少了虚假一致比例,但仍残留大量协同作弊,且每个候选需要额外六次标注器生成。这些局限促使我们提出主要方法 CrossFit。它将提议器的源文档划分为 A 和 B 两组:由 A 生成的问题交由仅在 B 上训练的辅助求解器评分,反之亦然。由此得到的交叉拟合一致性决定提议器奖励,阻止同源伪标签通过反馈求解器被直接复现,同时保持原求解器的更新规则不变。我们通过使用 Qwen3.5-4B 和 Qwen3.5-9B 重新运行完整自进化循环来评估这两种干预。自进化后,MSV 将虚假一致比例在 Qwen3.5-4B 上从 6.1% 降至 5.7%,在 Qwen3.5-9B 上从 8.8% 降至 7.2%,而 CrossFit 分别将其降至 3.0% 和 3.7%。在排除源证据的反馈下重放相同提议,可进一步将虚假一致比例降至 0.4% 和 0.1%,从而将反馈来源与生成课程的变化分离开来。在七个下游搜索基准上,CrossFit 在 4B 和 9B 规模上的平均性能分别比标准耦合自进化高 8.8 和 8.4 分,比 Search-R1 高 8.7 和 7.8 分。

一句话总结

来自罗格斯大学、加州大学圣迭戈分校、密歇根大学、麦吉尔大学以及法赫德国王石油矿产大学的研究人员诊断了自进化搜索 agents 中的 co-cheating 现象,并提出 CrossFit,一种交叉拟合验证方案,利用在不相交来源划分上训练的辅助 solver 对提议进行评分,将 Qwen3.5-4B 上的虚假一致质量降至 3.0%,Qwen3.5-9B 上降至 3.7%,同时在七个下游搜索基准上将平均性能较标准耦合自进化分别提升 8.8 和 8.4 分。

核心贡献

  • 该论文识别并实证刻画了自进化搜索 agents 中一种名为 co-cheating 的失效模式,即 proposer 与 solver 在共享错误上越来越一致,使得内部奖励上升,而经来源审计的伪标签正确率在连续轮次中停滞或下降。
  • 该论文提出多样本验证(MSV),对同一模型在有来源证据和无来源证据的情况下各查询三次,以决定任务准入并替换不可靠伪标签;MSV 将 Qwen3.5-4B 和 Qwen3.5-9B 上的虚假一致质量分别从 6.1% 和 8.8% 降至 5.7% 和 7.2%,但仍残留大量 co-cheating,并且每个候选需要六次标注生成。
  • 该论文提出 CrossFit 作为主要方法,将来源文档划分为 A 和 B 两组,使由 A 生成的问题仅由在 B 上训练的辅助 solver 评分,反之亦然;CrossFit 将虚假一致质量降至 3.0% 和 3.7%,并在 4B 和 9B 规模上使七个基准的平均性能较耦合自进化提升 8.8 和 8.4 分,较 Search-R1 提升 8.7 和 7.8 分。

引言

搜索增强语言模型通过将推理与检索或浏览器操作交错来改善回答,但自进化的 proposer-solver 系统会自行创建训练问题和伪标签,并以 solver 一致性作为奖励信号。作者表明,这种设置可能产生“co-cheating”:错误伪标签教会 solver 重复同一错误,而 proposer 随后因生成强化该虚假一致的问题而获得奖励。多样本验证仅部分缓解该问题,并增加了推理成本。作者的主要贡献是 CrossFit,它将 proposer 的来源文档划分为 A 和 B 组,在互补组上训练辅助评分 solver,并使用交叉拟合一致性来塑造 proposer 奖励,从而防止同一来源错误直接自我强化。在 Qwen3.5-4B 和 Qwen3.5-9B 的实验中,CrossFit 降低了虚假一致质量,并在七个基准问答准确率上较耦合自进化和 Search-R1 均有提升。

方法

作者在自进化循环中引入两项关键干预以缓解错误强化:多样本验证(MSV)和交叉拟合 proposer 反馈(CrossFit)。

首先,MSV 作为准入时测试,确保所提出的问题产生独立于 proposer 草稿的稳定答案。给定来源文档 xxx 和问题 qqq,模型 MMM 生成三个有来源答案 aisrc∼M(⋅∣x,q)a_i^{\text{src}} \sim M(\cdot \mid x, q)aisrc​∼M(⋅∣x,q) 和三个无来源答案 aiblind∼M(⋅∣q)a_i^{\text{blind}} \sim M(\cdot \mid q)aiblind​∼M(⋅∣q),其中 i∈{1,2,3}i \in \{1, 2, 3\}i∈{1,2,3}。多数函数 Maj\text{Maj}Maj 在至少两个样本在答案匹配器 ≃\simeq≃ 下一致时返回一个答案,否则返回 ∅\emptyset∅。定义 yv=Maj(a1:3v)y^v = \text{Maj}(a_{1:3}^v)yv=Maj(a1:3v​),其中 v∈{src,blind}v \in \{\text{src}, \text{blind}\}v∈{src,blind},准入条件表述为:

IMSV=1[ysrc≠∅∧yblind≠∅∧ysrc≃yblind].I_{\text{MSV}} = \mathbf{1} \left[ y^{\text{src}} \neq \emptyset \land y^{\text{blind}} \neq \emptyset \land y^{\text{src}} \simeq y^{\text{blind}} \right].IMSV​=1[ysrc=∅∧yblind=∅∧ysrc≃yblind].

当 IMSV=1I_{\text{MSV}} = 1IMSV​=1 时,兼容的多数答案替代草稿作为训练标签;否则,该任务被拒绝。此步骤提升进入训练阶段的监督质量。

虽然 MSV 细化了训练标签,CrossFit 则防止这种监督被直接回收到 proposer 的奖励中。该交叉拟合反馈机制的整体流程在下方的框架图中详述。

在此架构中,proposer 首先从来源文档生成问题和伪标签。然后作者将来源文档划分为两个不同的组:fold 0 和 fold 1。这一划分在来源层面进行,以防止同一文档中的相关示例被同时放入两侧,否则会保留其旨在消除的数据重用路径。

系统维护两个与这些 fold 对应的辅助反馈 solver。在第 rrr 轮中,一个辅助 solver 仅在 fold 0 的准入问题上训练,另一个仅在 fold 1 上训练。在随后的第 r+1r+1r+1 轮中,它们的评估角色交叉:来自 fold 0 的问题由在 fold 1 上训练的 solver 评分,来自 fold 1 的问题由在 fold 0 上训练的 solver 评分。这确保评估特定问题的 solver 未曾在由该问题来源派生的伪标签上训练。

反馈规则根据互补 solver 的响应计算奖励。设 hhh 表示来源 fold,Sr,1−hS_{r, 1-h}Sr,1−h​ 为在互补 fold 上训练的辅助 solver,y~\tilde{y}y~​ 为采用的标签。proposer 根据五个 rollouts z1,…,z5z_1, \ldots, z_5z1​,…,z5​ 获得奖励:

RP(q)=f(∑j=151[zj≃y~]),zj∼Sr,1−h(⋅∣q).R_P(q) = f \left( \sum_{j=1}^5 \mathbf{1} [ z_j \simeq \tilde{y} ] \right), \qquad z_j \sim S_{r, 1-h}(\cdot \mid q).RP​(q)=f(j=1∑5​1[zj​≃y~​]),zj​∼Sr,1−h​(⋅∣q).

这里,函数 f(k)=(5−k)/4f(k) = (5 - k) / 4f(k)=(5−k)/4(当 0<k<50 < k < 50<k<5 时,否则为零)作为前沿奖励。因此,原始训练目标得以保留,因为问题仍根据 solver 感知到的难度获得分数,但直接的自我强化错误路径被切断。

与辅助 solver 不同,主 solver 不被拆分。它继续在两个 fold 的所有准入问题上训练,利用细化后的反馈塑造下一轮 proposer 的课程,而不会继承局部的来源派生错误。

实验

实验使用 Qwen3.5-4B 和 Qwen3.5-9B,在七个开放域问答基准上评估自进化,比较耦合的 Dr. Zero 循环与多样本验证和来源排除的 CrossFit 反馈在三轮中的表现。对耦合循环的审计显示,proposer-solver 一致性随着虚假一致的积累而变得越来越乐观,而正确率没有同步提升,揭示出 co-cheating 动态。CrossFit 在下游搜索上较 Dr. Zero 和 Search-R1 显著改善,尤其是在多跳任务上;而单独验证收效甚微,表明反馈来源比伪标签质量本身更重要。使用固定问题库和来源级划分的消融实验证实,排除被评估来源进入反馈 solver(而不是评估器重复、划分或额外更新)防止了共享的同源错误,并解释了大部分学到的搜索改进。

交叉拟合反馈在两种 Qwen3.5 规模下均改善下游搜索性能,每个被评估基准都优于对比方法。多跳任务上的收益最大,而单独验证仅带来很小的平均提升,并且在交叉拟合之外几乎没有额外贡献。结果表明反馈来源是搜索策略改进的主要因素。CrossFit 在 4B 和 9B 规模下均优于 Dr. Zero 和 Search-R1,所有基准均获得提升。多跳基准的平均收益大于单跳数据集。仅使用 MSV 较 Dr. Zero 的提升不足 1 分,将 MSV 与 CrossFit 结合仅带来很小的额外改进。

实验在 4B 和 9B 规模的 Qwen3.5 上评估下游搜索中的交叉拟合反馈,将 CrossFit 与 Dr. Zero 和 Search-R1 进行比较。CrossFit 在两个规模的所有基准上一致提升性能,多跳任务收益最大,表明反馈来源是搜索策略改进的主要驱动因素。单独验证较 Dr. Zero 仅提供极小的平均提升,并且在交叉拟合之外几乎没有额外贡献,表明其贡献有限。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供