Command Palette
Search for a command to run...
ABSeeker:基于答案回溯信用分配的长程搜索智能体训练方法
ABSeeker:基于答案回溯信用分配的长程搜索智能体训练方法
Yijun Lu Rui Ye Jiajun Wang Yuwen Du Tian Jin Songhua Liu Siheng Chen
摘要
长程搜索智能体需要执行多个顺序动作(步骤)来搜索、检索、验证并整合证据,以得出最终答案。然而,现有训练这些智能体的方法通常在监督微调(SFT)和强化学习(RL)过程中对轨迹内的所有步骤一视同仁,未能区分有用动作与错误或冗余动作。本文提出答案回溯信用分配(ABC),这是一种细粒度的信用分配框架,通过将稀疏的轨迹级结果转化为密集的步骤级监督,奖励有用动作(即使出现在失败轨迹中)并抑制错误或冗余动作,从而训练长程搜索智能体。具体而言,给定一个可能模糊的查询及其对应的真实答案,ABC 首先执行答案回溯线索恢复,从答案反向追溯,恢复解答问题所需的中介线索。然后,它应用线索锚定步骤评分,根据这些线索评估每个搜索步骤,将稀疏的二元结果监督转化为密集的步骤级奖励。基于这些奖励,我们开发了 ABC-SFT(对每一轮的损失进行重新加权)和 ABC-GRPO(将步骤级分数用作 GRPO 中的奖励)。在此框架基础上,我们仅使用 8.5k 个样本,基于 Qwen3.5-4B 训练了 ABSeeker。ABSeeker 在 BrowseComp 上达到 37.3%,在 BrowseComp-ZH 上达到 39.1%。结合上下文管理后,得分分别进一步提升至 55.3% 和 52.9%,显著优于同规模(4B)智能体,甚至与更大规模(~30B)智能体的性能相当。这些结果证明了基于答案回溯的步骤级信用分配在训练长程搜索智能体方面的有效性。
一句话总结
上海交通大学的研究者提出了答案回溯信用分配(Answer-Backtracked Credit Assignment, ABC),这是一种细粒度框架,通过从真实答案回溯以恢复中间线索并对每个搜索步骤评分,将稀疏的轨迹级结果信号转化为密集的步骤级监督。基于此框架,使用 Qwen3.5-4B 构建的 ABSeeker agent 在 BrowseComp 上达到 37.3%,在 BrowseComp-ZH 上达到 39.1%,显著优于同规模 agent,并能媲美更大模型。
核心贡献
- 答案回溯信用分配(ABC)从已验证的答案中恢复中间证据线索,并使用线索锚定步骤评分,将稀疏的轨迹级结果信号转化为密集的步骤级监督,奖励有用动作并抑制错误或冗余动作。
- ABC-SFT 对每一轮的损失进行重新加权,而 ABC-GRPO 将步骤级评分用作 GRPO 中的奖励,从而在监督微调和强化学习过程中实现细粒度的信用分配。
- 基于 Qwen3.5-4B 并仅用 8.5k 样本训练的 ABSeeker,在 BrowseComp 上达到 37.3%,在 BrowseComp-ZH 上达到 39.1%,结合上下文管理后分别达到 55.3% 和 52.9%,优于同规模 agent 并能媲美更大模型。
引言
处理复杂的多步信息搜寻任务的搜索 agent 必须执行长序列的查询、证据检查和假设修正。训练这些 agent 很困难,因为现有方法为轨迹中的每一步分配统一的信用,忽略了即使是成功的运行也包含冗余或错误动作,而失败的运行可能包含有用的证据收集步骤。这种粗糙的监督限制了在细粒度层面优化关键搜索和推理行为的能力。
作者引入了答案回溯信用分配(ABC),该框架从已验证的答案中恢复中间线索,然后根据每个搜索步骤如何发现、验证或错误处理这些线索来对其进行评分。这产生了密集的、回合级的奖励,能够区分有效动作和错误,从而支持两种训练变体:ABC-SFT,在监督微调中按步重新加权损失;以及 ABC-GRPO,为强化学习提供步骤级奖励。利用 ABC,作者训练了 ABSeeker,这是一个 4B 参数的 agent,在 BrowseComp、BrowseComp-ZH、xbench 和 GAIA-text 上取得了优异的结果,优于同规模基线模型,并能与更大的搜索 agent 竞争。
方法
作者提出了一个包含两个核心阶段的训练流程,以解决搜索 agent 中轨迹级结果监督的稀疏和粗糙问题。
给定一个查询及其已验证的答案,该流程首先恢复一组中间证据线索,这些线索定义了朝向答案的有意义的进展。然后展开搜索轨迹,同时保留成功和失败的轨迹。接下来,步骤评分机制根据恢复的线索集评估每一步,并产生密集的、细粒度的步骤评分。最后,这些步骤级评分直接作为策略优化的奖励信号。
作者考虑一组训练问题,每个问题包含一个查询 q 和一个已验证的答案 a∗。一个搜索 agent 在 T 个回合中与网络环境交互,产生一条搜索轨迹:
τ=(s1,s2,…,sT,a)其中 a 是 agent 提交的最终答案。每一步 st 包含 agent 的推理、发出的工具调用以及相应的工具响应。在训练期间,agent 通常仅根据最终答案是否与真实答案匹配来获得奖励:
rans(τ)={1,0,if a=a∗,otherwise.这种轨迹级信号是稀疏且粗糙的,导致信用分配失败。一条错误的轨迹可能包含有用的中间步骤,但为零的最终奖励不提供任何正向信号。相反,一条正确的轨迹可能包含错误的中间步骤,但为一的最终奖励无法区分这些有缺陷的动作。作者通过为每条轨迹中的每一步构建步骤奖励 rt 来解决这一限制,从而实现稳定、密集且细粒度的监督。
已验证的答案指明了搜索应在何处结束,但对 agent 应如何到达该终点提供的监督很少。为了评估中间步骤的质量,作者需要一组答案回溯的锚点。答案回溯线索恢复将每个训练问题 (q,a∗) 映射为一组线索:
C={c1,c2,…,cK}其中每个 ck 是一段与回答 q 相关的可验证的中间证据。
恢复过程利用了基准测试提供唯一且可验证答案的事实。给定查询及其已验证的答案,作者提示一个 LLM 通过识别必须被发现、验证和交叉引用的中间实体和事实来重建证据链。这种回溯是一个主动的 ReAct 循环,其中恢复模型通过与正向 agent 相同的工具调用协议进行网络搜索并访问页面,从答案回溯到查询以追踪证据。在此验证中存留下来的线索可作为后续步骤评分的可靠参考点。
给定一个训练问题的恢复线索集 C,线索锚定步骤评分对每条收集到的轨迹中的每一步进行评估。对于每一步 st,评分器接收当前步骤、原始查询 q 以及完整的线索集 C。它输出一个步骤奖励 rt 以及简要的理由。每一步以 1.0 的基础分开始,确保没有明显错误的合理探索不会受到惩罚。一个步骤可能表现出多种评分行为,相应的增量在基础分上累积,并被裁剪到 [0,2.0] 区间:
rt=clip1.0+j∈At∑Δj,0,2.0其中 At 表示在第 t 步检测到的评分行为实例集合。在最终失败的轨迹中发现正确线索的步骤仍然获得正向信用,而在最终成功的轨迹中错误地否定了正确线索的步骤仍然会受到惩罚。
给定分配给每条轨迹中每一步的步骤奖励 rt,作者在两个连续的阶段中训练 agent:奖励加权的监督微调(ABC-SFT),然后是步骤级强化学习(ABC-GRPO)。成功和失败的轨迹均被保留。
在第一阶段,作者对所有收集到的轨迹执行 SFT。对于一条长度为 T 的轨迹 τ,令 xt,j 表示在步骤 st 中由策略生成的第 j 个 token,环境提供的工具响应被排除在优化之外。训练目标是:
LSFT(θ)=−t=1∑Tw(rt)j∑logpθ(xt,j∣xt,<j)其中步骤级权重通过 sigmoid 函数 w(rt)=σ(α⋅(rt−β)) 计算,α 控制映射的锐度,β 是中性基线。高评分步骤对梯度的贡献更大,而低评分步骤贡献的训练信号很少。
在第二阶段,作者通过带有步骤级奖励的在线 RL 进一步优化 agent。对于每个采样的 rollout i,第 t 步的奖励定义为 Ri,t=ri,t。在每个 rollout 组内对奖励进行归一化以获得 Ri,t,并计算折扣步骤级优势:
Ai,t=k=t∑Tiγk−tRi,k其中 γ 控制未来步骤奖励向早期决策的传播程度。计算出的优势 Ai,t 被分配给第 t 步中所有由策略生成的 token,而环境提供的工具响应被屏蔽,不参与优化。策略使用标准的裁剪 GRPO 目标进行优化,将其轨迹级优势替换为特定于步骤的优势 Ai,t。
实验
评估使用 Qwen3.5-4B 作为骨干网络,在 OpenSeeker 轨迹上进行训练,并在 BrowseComp、BrowseComp-ZH、xbench 和 GAIA 基准上进行测试。ABSeeker 在每个基准测试中都取得了 4B 搜索 agent 中的最佳性能,并且与更大的 30B agent 相比仍具竞争力,同时还能有效地泛化到未见过的基准测试。核心见解在于,答案回溯的步骤级信用分配保留了失败轨迹中的有用动作,并抑制了成功轨迹中的错误动作,从而带来更高效和更审慎的搜索行为。消融研究证实,与标准的轨迹级方法相比,这种细粒度的信用分配在监督微调和强化学习中都有所改进。
评分规则通过累积特定行为相对于 1.0 基础分的增量,然后裁剪到 [0, 2.0] 区间来分配步骤级奖励。发现或验证正确线索以及排除错误候选项会获得正向增量,而错误地否定正确线索或提交错误答案则会受到负向增量的惩罚。这种细粒度的信用分配使得失败轨迹中的有用步骤能够获得正向奖励,而成功轨迹中的错误步骤会受到惩罚。发现或验证正确线索产生最大的正向增量(+0.8),而提交错误答案则招致最大的惩罚(-1.0)。排除错误候选项提供适度的正向信号(+0.4),而错误地否定正确线索则带有对称的负向增量(-0.8)。提交已验证的答案会增加完整的 +1.0 增量,所有增量在 1.0 的基础分上累积,然后裁剪到 [0, 2.0] 范围。失败轨迹中有近 10% 的步骤获得了高于 1.0 的奖励,因为它们仍然发现或验证了有用的线索;而成功轨迹中约有 4% 的步骤因低质量动作而得分低于 1.0。
4B 参数的 ABSeeker 搜索 agent 在每个评估基准上都领先于所有同规模模型,并且与更大的 30B 级 agent 相比仍具竞争力,在 xbench-2505 和 GAIA-text 上超越了它们。其性能提升源于答案回溯的步骤级信用分配,该机制奖励了失败轨迹中的有效步骤并惩罚了成功轨迹中的低质量步骤,并在 BrowseComp 基准上通过上下文管理进一步放大。尽管仅在 BrowseComp 风格的问题上训练,该方法也表现出强大的跨基准泛化能力。ABSeeker 在 BrowseComp、BrowseComp-ZH、xbench-2505、xbench-2510 和 GAIA-text 上取得了所有 4B 搜索 agent 中的最高分。尽管规模较小,ABSeeker 在 xbench-2505 和 GAIA-text 上优于所有已报告的 30B agent,并在 BrowseComp 和 BrowseComp-ZH 上超越了多个 30B 系统。仅在 BrowseComp 风格的问题上训练,ABSeeker 有效地泛化到了 xbench 和 GAIA 基准。步骤级信用分配识别出失败轨迹中近 10% 步骤的有用动作,以及成功轨迹中约 4% 步骤的低质量动作,从而实现了比轨迹级信号更精确的监督。与标准的轨迹级 GRPO 相比,ABC-GRPO 训练始终带来更强的 BrowseComp 验证性能和更长的搜索轨迹。采用带有 256K token 限制的全丢弃上下文管理策略,将 ABSeeker 在 BrowseComp 上的表现从 37.3% 提升至 55.3%,在 BrowseComp-ZH 上从 39.1% 提升至 52.9%。
细粒度的步骤级信用分配通过奖励失败轨迹中的有用动作并抑制成功轨迹中的错误动作,同时改进了监督微调和强化学习。在五个基准中的四个上,ABC-SFT 优于标准 SFT,而在没有上下文管理的所有基准上,ABC-GRPO 始终超越标准的轨迹级 GRPO。这些增益归因于独立的逐步评估,它比轨迹级信号更精确地保留了有效探索并纠正了错误。在 BrowseComp、BrowseComp-ZH、xbench-2510 和 GAIA-text 上,ABC-SFT 比标准 SFT 提升了性能,同时在 xbench-2505 上保持可比性。ABC-GRPO 在所有五个基准上始终优于标准的轨迹级 GRPO。即使是成功的轨迹也包含约 4% 奖励低于 1.0 的低质量步骤,而失败轨迹中有近 10% 的步骤获得了高于 1.0 的奖励,这推动了步骤级信用分配的需求。ABC-GRPO 相对于标准 GRPO 的最大绝对增益出现在 BrowseComp 和 GAIA-text 上,在 xbench-2505 上也有较小但一致的改进。
ABSeeker 是一个 4B 参数的搜索 agent,在 BrowseComp、xbench 和 GAIA-text 基准上进行了评估。其训练使用答案回溯的步骤级信用分配,奖励失败轨迹中的有效步骤并惩罚成功轨迹中的低质量步骤,相比轨迹级信号,同时改进了监督微调和强化学习。这种细粒度的信用分配,结合在 BrowseComp 上的上下文管理,使 ABSeeker 领先于所有同规模模型,并超越了多个 30B agent,同时尽管仅在 BrowseComp 风格的问题上训练,仍能有效泛化。