HyperAIHyperAI

Command Palette

Search for a command to run...

TRACE:基于贡献估计的轮次级奖励分配方法用于长程智能体

Leitian Tao Baolin Peng Wenlin Yao Tao Ge Hao Cheng Mike Hang Wang Jianfeng Gao Sharon Li

摘要

多轮智能体通过扩展的工具交互序列来解决复杂任务,最终给出答案,这使得贡献分配成为后训练过程中的一个根本性挑战。结果奖励为短程推理提供了可靠的监督信号,但当轨迹增长到数十或数百次工具调用时,奖励变得稀疏且方差很大。它们还可能产生误导:一次失败的运行可能包含许多使智能体更接近目标的有用动作,但仅基于结果的训练会将这些动作与最终的错误赋予相同的负优势值。我们提出了TRACE(基于贡献估计的轮次级奖励分配),一种用于智能体强化学习的密集贡献分配方法。TRACE将运行过程表示为工具调用边界上的状态转移,从冻结的参考模型获取正确答案的对数概率,将其转换为对数比率状态值,并推导出每步动作的奖励,作为这些值的时序差分变化。该方法无需额外的评论家或过程标签训练,其单步对数比率时序差分组件能跨越冗余的工具调用进行伸缩。在长程复杂搜索任务上,TRACE仅使用纯强化学习就显著提升了基础模型的工具使用能力,无需冷启动监督微调阶段、智能体中期训练阶段或基于实时网络数据的训练。在封闭网络基准BrowseComp-Plus上,它将Qwen3-4B的得分从7.2提升至35.6,将Qwen3-30B-A3B的得分从8.4提升至42.6。学习到的搜索行为还能迁移到开放网络基准上,并且学习曲线显示在强化学习训练期间改进更早、收敛更快。

一句话总结

威斯康星大学麦迪逊分校和微软研究院的研究人员提出 TRACE(Turn-level Reward Assignment via Credit Estimation,基于信用估计的轮次级奖励分配),这是一种用于长程 agent 强化学习的密集信用分配方法,将冻结参考模型的对数比率状态值的时序差分变化作为每个动作的奖励,从而无需 critic 或过程标签,并在 BrowseComp-Plus 基准上将 Qwen3-4B 从 7.2 提升到 35.6,同时实现更快的收敛。

核心贡献

  • TRACE 是一种无 critic 的信用分配方法,将冻结参考模型得到的正确答案对数概率转换为对数比率状态值,并在工具调用边界处计算时序差分变化作为每个动作的奖励,避免了任何 critic、过程标签或蒙特卡洛推演。
  • 在纯 RL 且无冷启动 SFT 的条件下,TRACE 改善了长程搜索 agent:在 BrowseComp-Plus 上,Qwen3-4B 从 7.2 提升至 35.6,Qwen3-30B-A3B 从 8.4 提升至 42.6,学习曲线显示比仅使用结果监督的 GRPO 更早改善且收敛更快。
  • 学习到的搜索行为可迁移到开放网络基准,轮次级信用与基于结果的训练互补,在无需步骤标签标注或训练 critic 的情况下,减少了紧凑答案任务上的奖励稀疏性。

引言

大型语言模型 agent 现在通过将推理与工具调用交错执行,处理诸如网页导航和代码生成等复杂多步任务。基于可验证奖励的强化学习已被证明对短程推理有效,但在 agent 轨迹中,单一的最终结果信号无法区分哪些中间动作是有用的、多余的或有害的。先前关于过程监督的工作可以提供更密集的反馈,但通常依赖步骤级标签、强大的 LLM 评判器或训练好的过程奖励模型,而该模型的评分可能与最终答案的正确性产生偏差。作者提出了 TRACE,一种无 critic 的信用分配框架,使用冻结参考模型来衡量每次工具交互使正确答案更可预测的程度,然后通过时序差分变化分配轮次级奖励,同时保留基于结果的可验证奖励作为最终的训练锚点。

方法

在 agent 强化学习中,策略 LLM 通过交错生成助手 tokens、工具调用和工具观察来解决提示。此种设置下的一个主要挑战是信用分配,因为终端奖励监督的是由异质策略决策组成的长序列,却无法识别哪些具体的轮次对最终答案做出了贡献。为此,作者提出了 TRACE,一种用于长程 agent 后训练的无 critic 信用分配方法。TRACE 并不在稀疏的终端奖励上学习 critic,而是衡量每次工具交互是否使正确答案在冻结参考模型下变得更可预测。

参见下方框架图:

TRACE 在工具调用边界处拆分 rollout,为每个转移构造信用目标。对于带有正确答案的采样轨迹,该方法使用冻结参考模型 πref\pi_{\mathrm{ref}}πref 评估前缀状态 SkS_kSk。状态 SkS_kSk 的平均正确答案对数概率由下式计算: ˉk=1yt=1ylogπref(ytSk,y<t)0.\bar{\ell}_k = \frac{1}{|y^\star|} \sum_{t=1}^{|y^\star|} \log \pi_{\mathrm{ref}}(y_t^\star \mid S_k, y_{<t}^\star) \leq 0.ˉk=y1t=1ylogπref(ytSk,y<t)0. 较大的(不那么负的)ˉk\bar{\ell}_kˉk 表示当前对话记录包含更多能生成正确答案的证据。为使该分数适用于信用分配,作者将状态值建模为初始答案似然差距的相对闭合程度。定义 dk=ˉk+ϵd_k = -\bar{\ell}_k + \epsilondk=ˉk+ϵ 并设置偏置 ϵ>0\epsilon > 0ϵ>0,状态值被设为: V(Sk)=logd0dk=logˉ0+ϵˉk+ϵ.V(S_k) = \log \frac{d_0}{d_k} = \log \frac{-\bar{\ell}_0 + \epsilon}{-\bar{\ell}_k + \epsilon}.V(Sk)=logdkd0=logˉk+ϵˉ0+ϵ. 这保证了 V(S0)=0V(S_0) = 0V(S0)=0,且更大的 V(Sk)V(S_k)V(Sk) 表示动作-观察历史已闭合了初始差距中的更大比例。

在没有中间环境奖励且折扣为 1 的情况下,分配给一个转移的信用是值函数的单步时序差分变化: δk=V(Sk+1)V(Sk)=logdkdk+1.\delta_k = V(S_{k+1}) - V(S_k) = \log \frac{d_k}{d_{k+1}}.δk=V(Sk+1)V(Sk)=logdk+1dk. 当动作和观察使正确答案更可能时,该信用为正;当转移背离答案时,则为负。为捕捉延迟的工具效应,作者使用截断的 K 步 TD 备份。分配给当前轮次的局部进度信用为: cg,k(K)=1Zg,ku=khg,kγtdukδg,u,c_{g,k}^{(K)} = \frac{1}{Z_{g,k}} \sum_{u=k}^{h_{g,k}} \gamma_{\mathrm{td}}^{u-k} \delta_{g,u},cg,k(K)=Zg,k1u=khg,kγtdukδg,u, 其中 γtd\gamma_{\mathrm{td}}γtd 对延迟证据进行折扣。当备份窗口到达轨迹末尾时,最后的轮次将锚定到可验证的结果信号上: rg,kturn=cg,k(K)+1[hg,k=Tg1]λtermγtdTgkAgout.r_{g,k}^{\mathrm{turn}} = c_{g,k}^{(K)} + \mathbf{1}[h_{g,k} = T_g - 1] \lambda_{\mathrm{term}} \gamma_{\mathrm{td}}^{T_g - k} A_g^{\mathrm{out}}.rg,kturn=cg,k(K)+1[hg,k=Tg1]λtermγtdTgkAgout. 此处 AgoutA_g^{\mathrm{out}}Agout 是标准的 Group Relative Policy Optimization 组内相对优势。

最后,TD 派生的轮次信用与 GRPO 结果奖励联合优化。工具交互 tokens 的混合逐 token 优势为: A^g,t=αoutAgout+αturnrg,turn(t)turn,\hat{A}_{g,t} = \alpha_{\mathrm{out}} A_g^{\mathrm{out}} + \alpha_{\mathrm{turn}} r_{g,\mathrm{turn}(t)}^{\mathrm{turn}},A^g,t=αoutAgout+αturnrg,turn(t)turn, 其中 αout\alpha_{\mathrm{out}}αoutαturn\alpha_{\mathrm{turn}}αturn 控制终端正确性与轮次级信用的相对强度。作者优化一个包含该混合优势的截断 GRPO 目标,保留标准的组内相对结果信号,同时添加密集的轮次级信用,而不在提示组内对轮次值进行归一化。

实验

这些实验在基于 Qwen3 agent 的合成多文档搜索任务上评估了 TRACE,一种密集的轮次级信用分配方法。主要结果表明,TRACE 大幅改善了长程工具使用,不但优于仅使用结果监督的 RL 基线,且效果体现在封闭训练语料和开放网络基准上,表明搜索策略具有可迁移性。学习动态显示 TRACE 收敛更快并能得到更好的策略,消融实验证实对数比率信用形式以及对轮次奖励和前瞻视野的适度调节对其有效性至关重要。

TRACE 在没有任何冷启动 SFT、agent 中期训练或实时网络数据的情况下,大幅提升了基础模型在长程深度研究基准上的工具使用能力。将轮次级时序差分信用添加到结果奖励中,使封闭网络 BrowseComp-Plus 的得分对于 Qwen3-4B 从 7.2 提升至 35.6,对于 Qwen3-30B-A3B 从 8.4 提升至 42.6,与仅使用结果监督的 GRPO 相比,四个基准的平均得分从 29.5 提升至 34.0(4B)和从 32.5 提升至 38.1(30B-A3B)。这些提升来源于更好的信用分配,而非模型、数据或环境的改变,且该方法使用基础检查点作为稳定的参考模型即可工作。TRACE 仅使用结果和轮次级奖励,在没有 SFT 或实时网络数据的情况下,将 Qwen3-4B 的封闭网络深度研究准确率从 7.2 提升到 35.6,Qwen3-30B-A3B 从 8.4 提升到 42.6。相较于 GRPO 的仅结果基线,TRACE 将四个基准的平均得分从 29.5 提升到 34.0(4B 模型)和从 32.5 提升到 38.1(30B-A3B 模型),表明更密集的轮次级信用对长程任务至关重要。对数比率时序差分信用优于基于绝对似然的密集奖励,且该方法不需要特别调优的参考模型;基础检查点已足够。

在该信用分配消融实验中,仅结果 GRPO 得到 30.0 分,添加基于原始对数概率增量的密集转移奖励将分数提升至 32.4。用剩余答案似然差距进行归一化进一步将分数提升至 34.6,而提出的对数比率 TD 信用取得了 35.5 的最佳结果,表明相对差距闭合比绝对似然变化提供了更有效的信用信号。原始增量奖励优于仅结果 GRPO,但用剩余差距进行归一化带来了更大的提升,而对数比率方法达到了最高准确率。对数比率形式能更好地在不同置信水平的状态间归一化信用,并保留了一种可阻止冗余轨迹延长的 telescoping 结构。

TRACE 在基于基础 Qwen3 模型的长程深度研究和工具使用基准(包括 BrowseComp-Plus 和四个基准的平均)上进行了评估。将轮次级时序差分信用添加到结果奖励中,相比于仅使用结果监督的 GRPO,显著提高了封闭网络准确率,而对数比率 TD 信用形式优于其他密集奖励。该方法无需冷启动 SFT、agent 中期训练或实时网络数据,且基础检查点可作为稳定的参考模型,表明仅凭更好的信用分配就能在复杂多步任务中带来大幅提升。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供