HyperAIHyperAI

Command Palette

Search for a command to run...

边推理边推测:通过联合智能体–推测器强化学习教会智能体预测下一次工具调用

Jiabao Ji Yujian Liu Li An Rohit Jain Gungor Polatkan Siyu Zhu Shiyu Chang

摘要

大语言模型智能体常常花费大量挂钟时间等待工具调用结果。工具调用推测可以通过预测并预执行智能体的下一次工具调用来隐藏这一延迟,前提是预测与智能体最终的工具调用相匹配,但现有的推测器通常是独立的草稿模型或缓存的轨迹,与已部署智能体自身的行为对齐不佳。我们识别出这一推测器–智能体差距,并表明目标智能体本身就是一个强大的下一次调用推测器。这指向了一种更简洁的设计:将智能体与推测器统一在同一个模型内。在本文中,我们引入了自推测智能体,它是一个单一模型,既能在智能体模式下求解任务,也能在推测器模式下从部分轨迹预测其下一次工具调用,并完全复用前缀 KV 缓存。为了使这种双模式智能体在不降低性能的情况下工作,我们提出了一种联合智能体–推测器强化学习方法,该方法从智能体自身的 rollout 中导出推测目标,并交替进行智能体和推测器的更新。在智能体搜索问答和对话式工具使用智能体任务中,我们的方法将 Qwen3-4B 的平均下一次工具调用 Hit@1 从 44.1 提升至 61.2,将 Qwen3.5-4B 的从 48.9 提升至 66.3,同时保持了智能体的任务成功率。

一句话总结

加州大学圣塔芭芭拉分校和 LinkedIn 公司的研究人员提出了一种自推测 agent,它将 agent 和推测器统一到一个模型中,通过联合 agent-推测器强化学习进行训练,以预测自身的下一次工具调用,从而弥合推测器与 agent 之间的差距,将下一次调用 Hit@1\text{Hit@1}Hit@1 从 Qwen3-4B 的 44.144.144.1 提升至 61.261.261.2,从 Qwen3.5-4B 的 48.948.948.9 提升至 66.366.366.3,且不影响任务成功率。

核心贡献

  • 论文指出了推测器与 agent 之间的差距,即外部草稿模型或缓存的轨迹往往无法与 agent 自身的下一次工具调用对齐,从而增加推理开销。
  • 引入了一种自推测 agent,将任务求解和下一次调用预测统一在单个模型中,复用前缀 KV 缓存以避免额外的模型开销。
  • 提出了一种联合 agent-推测器强化学习方法,通过交替更新,在 agent 自身的 rollout 上训练推测器模式,将下一次调用 Hit@1 从 44.1 提升至 61.2(Qwen3-4B)和从 48.9 提升至 66.3(Qwen3.5-4B),同时保持下游任务成功率。

引言

大语言模型 agent 越来越依赖外部工具,如搜索引擎、代码解释器和 API,但等待工具响应往往占据了端到端延迟的主要部分。工具调用推测可以通过预执行可能的未来调用来隐藏这种延迟,然而现有的推测器构建在 agent 之外,使用较小的草稿模型或缓存的轨迹。这些外部方法存在推测器与 agent 的差距:推测器可能预测出与部署的 agent 不同的调用,导致工作浪费,并且它们引入了额外的模型推理开销。作者通过训练 agent 自身来推测其下一次工具调用,从而解决了这个问题。他们引入了一种自推测 agent,以双重模式运行,即任务求解和调用预测,并提出了联合 agent-推测器强化学习,以提高推测准确性而不降低任务性能。

方法

作者提出训练一个工具调用型 LLM agent,使其同时充当任务求解策略和自身的下一次调用推测器。核心思路是,同一个模型可以在 agent 模式下生成完整的推理与行动轨迹,同时也可以在推测器模式下,仅通过在输入上下文中附加一个固定的推测后缀,从部分前缀中预测即将进行的工具调用。这种设计使推测与部署的 agent 保持完全同策略,因为推测的目标来自 agent 自身当前的 rollout。

任务奖励 Rag(τ)R_{\mathrm{ag}}(\tau)Rag(τ) 根据最终答案 yyy 与真实答案 yy^{\ast}y 进行评估。对于推测,每个工具调用轮次 ttt 提供一个前缀 hth_tht,其中包含查询以及所有先前的推理、调用和观察结果。推测器的输入通过将 hth_tht 与一个固定的后缀 ssps_{\mathrm{sp}}ssp 拼接而成,并要求策略输出一个预测调用 a^t\hat{a}_ta^t。目标是来自同一轨迹中 agent 的实际下一次调用 ata_tat。推测奖励 RspR_{\mathrm{sp}}Rsp 定义为工具名称匹配指标 RnameR_{\mathrm{name}}Rname 与以名称为条件的参数奖励 RargsR_{\mathrm{args}}Rargs 的乘积。参数得分通过目标参数字典键上的宏 token-F1 计算,对每个键赋予相等权重,避免长参数值占据主导。这种构造反映了推测执行对精确匹配复用的要求:错误的工具名称无法复用预执行的结果,而正确的名称仍可因接近的参数值获得部分分数。

联合 agent-推测器 RL 过程将数据收集耦合在一起,但将策略更新分开。在每次 RL 迭代中,采样一批查询,当前策略生成 GagG_{\mathrm{ag}}Gag 条 agent 轨迹。这些 rollout 同时提供标准的 agent 优势(通过每个查询组内 RagR_{\mathrm{ag}}Rag 的 DAPO 风格归一化计算)和从相同轨迹中导出的同策略推测监督信号。一个固定的调度 m(k)m(k)m(k) 选择优化器步骤是使用 agent 目标还是推测器目标。在报告的配置中,调度遵循重复的 4:8 模式:连续四次 agent 更新,然后是连续八次推测器更新。两种模式共享相同的 DAPO 策略优化,但在输入上下文、rollout 结构和奖励函数上有所不同。

为稳定共享策略的训练,采用了三个组件。首先,在成功的 agent 轨迹和相应的中间轨迹推测示例的混合数据上进行短时间的 SFT 预热,使模型在 RL 开始前在两种模式下都具有良好的行为。其次,每当调度在 agent 和推测器更新之间切换时,重置优化器状态,防止一种模式目标的动量和自适应统计量干扰下一种模式。第三,agent 奖励包含对重复无意义工具调用的惩罚,以抑制 agent 持续调用工具而不推进任务进展的失败模式。

实验

评估测量了一个现成的草稿模型能否在相同的在线上下文中匹配部署 agent 的下一次工具调用,使用 Hit@1 精确匹配作为主要指标。外部推测器增加了大量的推理开销,且始终不如目标 agent 的自推测,证实了推测器与 agent 的差距。联合 agent-推测器 RL 提高了自推测准确性,同时保持了最终任务性能,消融实验表明 SFT 预热、优化器重置和交替更新调度对稳定训练都至关重要。跨领域评估显示,调用级别的预测可以在任务间迁移,但需要匹配领域的 RL 来维持任务成功率。

目标 agent 的自推测始终比来自同一家族的较小外部草稿模型获得更高的工具调用预测准确性,同时需要更少的 GPU 内存和更低的延迟。外部推测器在内存和时间上增加了大量的推理开销,其较低的 Hit@1 率使得额外成本难以被证明合理。这些结果促使训练 agent 自身作为推测器,而不是部署一个单独的模型。使用目标 4B 模型的自推测在两个模型家族和领域中都取得了最高的 Hit@1,优于所有较小的外部推测器。与自推测相比,添加外部推测器会显著增加 GPU 内存和推理时间,即使对于最小的草稿模型也是如此。在同一模型家族内,较大的外部草稿模型比较小的模型提高了 Hit@1,但仍不及目标 agent 预测自身的下一次调用。agent 是自身下一次工具调用最强的现成预测器,表明仅靠家族相似性无法恢复 agent 的调用分布。

联合 agent-推测器 RL 相比较小的外部草稿模型和 SFT 预热基线,大幅提高了下一次调用预测准确性,同时保持任务成功率稳定。基础 4B agent 已经优于最佳的小型推测器,而 RL 进一步提升了 Hit@1,在所有基准测试中都有一致的增益,表明推测质量与最终任务性能之间没有权衡。基础 Qwen3-4B agent 的平均 Hit@1 达到 29.1,远超最强外部推测器的 18.6。经过 RL 后,平均 Hit@1 升至 61.2,而任务成功率仅从 26.6 变为 27.7,保持了 agent 的能力。

当在一个交互家族上训练的自推测器在另一个家族上评估时,下一次调用预测准确性(Hit@1)持续提升,而最终任务成功率下降。例如,SearchQA 训练的模型提高了 Airline 和 Retail 的 Hit@1,但降低了任务成功率;ToolScale 训练的模型同样提升了 HotpotQA 和 MuSiQue 的 Hit@1,却以牺牲成功率为代价。这表明调用级别的行为可以在领域间迁移,但领域特定的推理对于任务完成仍然是必要的。跨领域迁移在所有测试基准上都提高了下一次调用 Hit@1,无论模型是在 SearchQA 还是 ToolScale 上训练的。迁移后任务成功率下降:SearchQA 训练的模型在 Airline 和 Retail 上成功率降低,而 ToolScale 训练的模型在 HotpotQA 和 MuSiQue 上成功率降低。自推测器学到了可迁移的工具调用参数匹配,但成功的任务完成仍然依赖于领域特定的交互策略。

在固定的迭代预算下,增加每次 agent 更新后连续推测器更新的次数,能同时大幅提高下一次调用预测准确性和任务成功率。4:8 调度产生了最强的结果,表明推测器受益于延长的训练块,而周期性的 agent 更新对于维持任务性能仍然是必要的。1:1 调度表现最差,在三个搜索数据集上仅达到 31.8 的平均 Hit@1 和 10.3 的平均任务成功率。相对于 agent 块延长推测器块持续提升了两项指标,4:8 调度达到了 55.2 的平均 Hit@1 和 26.1 的平均任务成功率。在 BCP 上,所有调度的任务成功率都较低,在 4:8 调度下达到峰值 8.1,而 HotpotQA 和 MuSiQue 在 Hit@1 和成功率上都显示出更大的增益。

这些实验评估了自推测(agent 预测自身的下一次工具调用)与外部较小草稿模型的对比。自推测始终以更低的开销实现更高的准确性,而联合 agent-推测器强化学习进一步提高了下一次调用预测,同时保持任务成功率稳定。跨领域迁移表明,调用级别的行为可以在领域间迁移,但任务完成仍然需要领域特定的推理。每次 agent 更新后包含更多连续推测器更新的不平衡调度,在预测准确性和任务性能之间实现了最佳权衡。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供