HyperAIHyperAI

Command Palette

Search for a command to run...

LLM
Agent

AgentGrad:面向多智能体系统的干预引导式提示优化

Jaewon Chu Jinwoo Seo Jaewon Cho Jeehye Na Yunyang Xiong Youngdae Kim Hyunwoo J. Kim

摘要

基于大语言模型(LLM)的多智能体系统(MAS)通过部署多个专用智能体实现了强大的性能,但其表现依赖于每个智能体的提示设计。在 MAS 提示优化中,利用自然语言反馈指导提示更新的文本梯度方法已成为主流范式。本文指出了现有文本梯度方法在两个阶段中的局限性:梯度提取与梯度聚合。在梯度提取阶段,先前工作选择一个目标提示,但未验证修改该提示是否能解决失败,并且在推导梯度时缺乏对相应智能体中间输出的智能体级监督。在梯度聚合阶段,各个梯度被随机分组并拼接,常常混合了不相关的失败模式,导致生成的提示泛化能力不足。为解决这些局限性,我们提出了 AgentGrad,一个基于顺序干预和语义文本梯度抽象的面向多智能体系统的提示优化框架。对于每一次失败,顺序干预逐一修改单个智能体的行为,以识别出修改后能解决失败的目标智能体。目标智能体修改后的输出随后作为智能体级监督,用于提取细粒度梯度。语义文本梯度抽象将语义相似的梯度进行聚类,以避免混合不相关的失败模式,并将每个聚类抽象为一个捕捉共享修正模式的泛化梯度。实验结果表明,AgentGrad 在五个 MAS 基准测试上均达到了最先进的性能,并且与次快的基线方法相比,平均将实际优化时间减少了 2.5 倍。

一句话总结

韩国大学、KAIST、Meta AI 和 UNIST 的研究人员提出 AgentGrad,一个面向多 agent 系统的 prompt 优化框架,采用顺序干预定位目标 agent,并通过 agent 级监督提取细粒度梯度,然后将语义相似的梯度聚类并抽象为泛化修正,在五个基准上取得最先进性能,并将优化时间平均缩短 2.5×2.5\times2.5×

核心贡献

  • AgentGrad 引入顺序干预,通过每次修改一个 agent 来识别导致失败的 agent,并将修正后的 agent 输出作为 agent 级监督,以提取细粒度的文本梯度。
  • 提出语义文本梯度抽象,根据语义相似性对样本级梯度进行聚类,避免混合无关的失败模式,并将每个聚类抽象为一个捕捉共享修正模式的泛化梯度。
  • 在五个多 agent 基准上的实验表明,AgentGrad 在 GPT-5-mini 和 Qwen3-8B 上均取得最先进性能,优于 MIPROv2、TextGrad 和 GEPA,同时将实际优化时间平均比次快基线缩短 2.5 倍。

引言

协调多个大语言模型的多 agent 系统是处理复杂任务的强大方式,但其有效性关键取决于 prompt 设计。通过文本梯度(即指导 prompt 更新的自然语言批评)进行自动 prompt 优化已成为主流方法。然而,先前的文本梯度方法存在系统性缺陷:它们选择要更新的 agent prompt 时未验证该更改能否真正解决失败,并且通过简单拼接聚合样本级梯度,混合了无关的失败模式,导致 prompt 泛化能力差。作者提出 AgentGrad,一个同时解决这两个阶段的框架。它引入顺序干预来识别导致失败的特定 agent,并生成 agent 级伪标签用于细粒度梯度提取。然后使用语义文本梯度抽象将共享修正模式的梯度聚类为语义小批量,并将每个聚类提炼为单个泛化更新。在涵盖问答、事实验证、指令遵循、任务委派和数学推理的五个基准上,AgentGrad 优于强基线,并将实际优化时间平均缩短 2.5 倍。

方法

作者提出 AgentGrad,一个利用顺序干预和语义文本梯度抽象的多 agent 系统 prompt 优化框架。整体流程旨在系统性地识别失败点,提取细粒度更新信号,并泛化这些信号以提升系统性能。

为识别导致系统失败的特定 prompt,作者采用顺序干预机制。给定包含 NNN 个 agent 的当前 prompt 集 P\mathcal{P}P 和来自训练数据的失败集 F\mathcal{F}F,框架每次修改一个 agent 以验证其修正是否能解决失败。

如下图所示,过程从失败集构建开始,在训练数据上执行当前 prompt 集以获得初始失败集 F\mathcal{F}F。然后框架按逆执行顺序应用顺序干预。在每一步 nnn,将提示 H\mathcal{H}H 注入 agent πn\pi^nπn 的 prompt 中,引导其产生修正的中间输出。通过此干预解决的失败子集记为 Tn\mathcal{T}^nTn,定义为:

Tn={(xi,yi)Fn+1r(Π(n,H)(xi;P),yi)=rmax}\mathcal{T}^n = \left\{(x_i, y_i) \in \mathcal{F}^{n+1} \mid r\left(\Pi^{(n, \mathcal{H})}(x_i; \mathcal{P}), y_i\right) = r_{\max}\right\}Tn={(xi,yi)Fn+1r(Π(n,H)(xi;P),yi)=rmax}

其中 Fn+1\mathcal{F}^{n+1}Fn+1 表示在步骤 n+1n+1n+1 时仍未解决的失败。已解决的失败 Tn\mathcal{T}^nTn 从未解决集中移除,过程继续处理下一个 agent。在步骤 n=1n=1n=1 后仍剩余的失败被视为困难案例,排除在当前训练轮次之外。

一旦为每个失败确定了目标 agent,作者使用 agent 级监督提取文本梯度。对于目标 agent πn\pi^nπn 和失败样本 (xi,yi)Tn(x_i, y_i) \in \mathcal{T}^n(xi,yi)Tn,框架比较原始输出 y^in\hat{y}_i^ny^in 与通过干预获得的修正输出 y~in\tilde{y}_i^ny~in

y^in=πn(xin;pn),y~in=πn(xin;pn,H)\hat{y}_i^n = \pi^n(x_i^n; p^n), \quad \tilde{y}_i^n = \pi^n(x_i^n; p^n, \mathcal{H})y^in=πn(xin;pn),y~in=πn(xin;pn,H)

这些输出之间的差异隔离了干预引起的行为变化。修正输出 y~in\tilde{y}_i^ny~in 作为 agent 级伪标签。然后梯度提取器 LLM 处理当前 prompt、输入上下文、原始输出和伪标签,产生样本级文本梯度 δin\delta_i^nδin

δin=LLM(pn,xin,y^in,y~in)\delta_i^n = \mathrm{LLM}_{\nabla}(p^n, x_i^n, \hat{y}_i^n, \tilde{y}_i^n)δin=LLM(pn,xin,y^in,y~in)

该方法通过隐式利用原始输出与修正输出之间的对比,绕过了对显式系统级损失函数的需求。

为确保更新方向一致,框架引入语义文本梯度抽象。聚合器 LLM 不是从随机小批量聚合梯度,而是根据共享的修正模式将样本级梯度 Ωn={δin}\Omega^n = \{\delta_i^n\}Ωn={δin} 聚类为语义小批量。聚合器同时进行聚类和抽象,为每个聚类生成泛化文本梯度 δˉjn\bar{\delta}_j^nδˉjn

{δˉjn}j=1Mn=LLMAggregator(Ωn)\{\bar{\delta}_j^n\}_{j=1}^{M_n} = \mathrm{LLM}_{\text{Aggregator}}(\Omega^n){δˉjn}j=1Mn=LLMAggregator(Ωn)

聚类过程由最小聚类大小的循环调度引导,鼓励模型在优化迭代中交替关注广泛共享的模式和细粒度修正。

最后,作者使用泛化梯度更新 agent prompt。更新按语义小批量大小降序应用,优先处理更广泛的修正。prompt 优化器 LLM 基于泛化梯度 δˉjn\bar{\delta}_j^nδˉjn 和当前 prompt pnp^npn 生成候选 prompt pnewnp_{\text{new}}^npnewn

pnewn=LLMPromptOptimizer(pn,δˉjn)p_{\text{new}}^n = \mathrm{LLM}_{\text{PromptOptimizer}}(p^n, \bar{\delta}_j^n)pnewn=LLMPromptOptimizer(pn,δˉjn)

每个候选 prompt 首先在其对应的语义小批量上评估。如果性能提升,随后在留出的验证集上评估。只有通过两个评估阶段的更新才被接受并替换当前 prompt。

实验

AgentGrad 在五个不同的多 agent 基准上,使用两种 LLM 骨干,与三种 prompt 优化算法和一个无优化基线进行了比较。它一致地取得了最先进性能,消融研究证实其三个组件——目标识别、agent 级监督和语义文本梯度抽象——各自贡献了互补的增益。AgentGrad 还因更高质量的梯度信号而优化更快,这些信号提高了 rollout 利用效率和泛化能力,并且其优化后的 prompt 可有效迁移到同一领域内的未见基准。

AgentGrad 在 GPT-5-mini 上于五个多 agent 基准中设立了新的最先进水平,优于所有基线,相比无优化基线平均提升 11.76 分。最大增益出现在 HotpotQA 和 PUPA 上,同时该方法也是最快的优化器,运行完成速度比次快基线快 2.5 倍,比 TextGrad 快 4.7 倍。这些结果表明 AgentGrad 同时提升了任务性能和优化效率。AgentGrad 在每个基准上均取得最高分,相比无优化基线平均提升 11.76 分,而次优方法 GEPA 为 9.24 分。最大性能差距在 HotpotQA(AgentGrad 73.89 vs. GEPA 68.33)和 PUPA(95.17 vs. 91.87)。AgentGrad 是最快的优化器,完成速度比 GEPA 快 2.5 倍,比 TextGrad 快 4.7 倍,同时提供最佳任务性能。

使用 Qwen3-8B 的 AgentGrad 相比无优化基线取得了最高平均提升,在五个多 agent 基准上获得 +9.67 分,优于所有其他 prompt 优化方法。它在五个任务中的四个上排名第一,展示了在使用开源模型时在多跳 QA、声明验证、指令遵循和数学推理上的一致增益。AgentGrad 在 HotpotQA (60.45)、HoVer (52.11)、PUPA (91.51) 和 MATH (85.81) 上取得最佳分数,而 TextGrad 仅在 IFBench 上略微领先 (42.52 vs. 41.42)。+9.67 分的平均提升是所有比较方法中最大的,超过 GEPA (+7.62) 和 MIPROv2 (+6.27)。

在 HotpotQA 和 PUPA 上的消融研究表明,AgentGrad 的每个组件——目标识别、agent 级监督和语义文本梯度抽象——均比普通基线提升了性能。完整组合取得最高分,确认这些组件解决了 prompt 优化的互补方面。仅添加目标识别在两个基准上均提升性能,表明识别负责的 agent 能产生更有效的梯度。agent 级监督和语义文本梯度抽象各自带来进一步增益,结合三者的完整模型达到最佳结果。

AgentGrad 在所有五个基准上是最快的优化方法,平均耗时 136 分钟,比次快基线 GEPA 快 2.5 倍,比 TextGrad 快 4.7 倍。最大加速出现在 HotpotQA 和 IFBench 上,即使在 TextGrad 相对高效的 MATH 上,AgentGrad 仍然更快。这些实际时间增益与最佳任务性能同时实现,表明优化质量和速度得到共同提升。AgentGrad 在每个基准上记录了最低的实际时间,相比次快方法平均加速 2.5 倍。在 HotpotQA 和 IFBench 上,AgentGrad 在不到两小时内完成,而 GEPA 需要近六小时,加速比分别为 3.2 倍和 3.0 倍。在 MATH 上,AgentGrad 在 88 分钟内完成,优于 TextGrad 的 126 分钟,尽管 TextGrad 在该基准上速度异常。AgentGrad 更高的小批量改进率转化为单位时间内更多的 rollout,其更高的验证改进率确保接受的更新泛化更可靠。

由 AgentGrad 优化的 prompt 比所有比较方法更有效地迁移到同一领域内的未见基准。在所有五个目标基准上,AgentGrad 取得最高平均性能,在 2WikiMultiHopQA 和 PUPA-TNB 上相比次优方法的差距最大。这表明 prompt 捕捉了可泛化的改进,而非特定于基准的模式。AgentGrad 的 prompt 在每个目标基准上取得最高迁移性能,在 2WikiMultiHopQA 上领先 6.33 分,在 PUPA-TNB 上领先 2.87 分。迁移结果表明 AgentGrad 的优化产生的 prompt 无需进一步调整即可保持有效,在所有未见基准上优于 GEPA、TextGrad 和 MIPROv2。

AgentGrad 在五个多 agent 基准上使用 GPT-5-mini 和开源 Qwen3-8B 进行了评估,设立了新的最先进结果,并取得了相比无优化基线的最大平均提升。该方法始终是最快的优化器,运行完成速度比替代方案快达 4.7 倍,同时提供顶级任务性能。消融研究确认目标识别、agent 级监督和语义梯度抽象各自贡献互补增益,且由 AgentGrad 优化的 prompt 更有效地迁移到未见基准,展示了可泛化的改进。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供