HyperAIHyperAI

Command Palette

Search for a command to run...

迈向智能体系统规模化的科学

摘要

基于语言模型的智能体能够推理、规划和行动,已广泛应用于现实任务,但其性能如何随系统在关键维度上的规模化而变化,仍缺乏深入探索。我们引入智能体系统的定量规模化原理,将其作为一种预测模型,刻画性能如何随协调机制、模型能力以及可度量的系统与任务因素而变化。在涵盖六项智能体基准测试、五种典型架构(单智能体及四种多智能体:独立式、集中式、去中心化式、混合式)和三个大语言模型家族的 260 种配置中,我们通过标准化工具、提示和计算资源进行受控评估,以分离架构效应。所得模型在所有六项基准测试上取得了交叉验证 R^2 = 0.373(采用任务相关能力指标时为 R^2 = 0.413)。我们识别出稳健的能力饱和效应及若干额外模式:(1)一旦单智能体基线超过特定性能,协调会呈现收益递减;(2)工具密集型任务似乎会产生多智能体开销;(3)缺乏集中验证的架构相比具有集中协调的架构,更倾向于传播错误。与单智能体基线相比,相对性能变化范围从可分解金融推理任务上的 +80.8% 到序列规划任务上的 −70.0%,表明架构与任务的对齐决定了协作的成败。该框架为 87% 的留出配置识别出最佳性能架构,并在未见过的前沿模型上显示出一致的相对架构偏好。智能体的有效性取决于协调与任务结构之间的对齐,而错配的协调会降低性能。

一句话总结

来自 Google Research、Google DeepMind 和 MIT 的研究者提出了一种 agent 系统扩展的预测模型,该模型在涵盖 6 个基准、5 种架构和 3 个 LLM 系列的 260 个配置中,捕捉了性能随协调、模型能力和任务因素的变化,实现了交叉验证的 R2=0.373R^2 = 0.373R2=0.373(或使用基于任务的指标时为 R2=0.413R^2 = 0.413R2=0.413),并揭示了架构-任务的对齐决定了协作的成功,相对于单 agent 基线,性能变化范围从 +80.8% 到 −70.0%,该框架在 87% 的留出配置中选出了最佳架构。

核心贡献

  • 一个预测性扩展模型捕捉了协调、模型能力和任务因素,在 6 个基准上实现了交叉验证 R² = 0.373(使用基于任务的能力指标时为 0.413),并在 87% 的留出配置中正确选出了最佳性能架构。
  • 该模型揭示了能力饱和效应(当单 agent 性能超过约 45% 时,协调带来的回报递减)、工具-协调权衡以及架构依赖的错误放大,错误放大倍数从 4.4×(集中式)到 17.2×(独立式)不等。
  • 在 BrowseComp-Plus 上评估的未见过的前沿模型上,该框架显示出一致的相对架构偏好,多 agent 系统性能预测的 MAE 为 0.061。

引言

作者探讨了一个悬而未决的问题:在需要持续环境交互、部分可观测性和自适应调整的 LLM 驱动的任务中,多 agent 协调何时真正优于单 agent 系统。先前的工作主要是在静态、非 agent 的基准上进行评估,在这些基准上,增加 agent 表现出单调的性能提升,但真实世界的 agent 任务引入了协调开销、错误传播和碎片化的上下文,这可能导致协作产生反效果。现有的评估还将架构效应与提示、工具和计算预算的差异混为一谈,并且缺乏过程级别的指标。作者贡献了一个受控的实验框架,该框架在跨越 5 种架构、3 个模型系列和 6 个 agent 基准的 260 个配置中隔离了协调结构。他们基于经验协调指标推导出一个预测模型,该模型识别了可量化的权衡,例如工具-协调惩罚和能力上限,并在为留出任务选择最佳架构方面达到了 87% 的准确率,为从业者提供了一种有原则的替代方案,取代了启发式团队设计。

数据集

作者构建了一个由 agent 任务组成的基准套件,而非静态语料库,用于评估交互式推理。其构成和处理遵循以下原则:

  • 任务定义与筛选 一项任务只有在满足三个必要属性时才会被纳入:顺序相互依赖(后续操作依赖于早期观察)、部分可观测性(关键信息必须通过工具使用或主动查询获取)以及自适应策略形成(策略必须根据交互更新信念)。缺少这些条件的基准,如 GSM8K 或 MMLU,被排除在外;当前需要多步交互的任务,如 SWE-Bench,则被保留。该定义与当前模型能力相关:当最优交互策略在实质上优于任何单次传递函数时,该任务即为 agent 任务。

  • 来源与选择 该套件扩展了 Zhu 等人的框架,并建立在 Agentic Benchmark Checklist 之上。作者选择了基础 LLM 在单次模式下表现不佳且非平凡的性能需要多步环境反馈的基准。最终集合未在文中列举,但隐含地由那些强制要求操作-观测循环长度大于 3 的任务组成。

  • 受控接口与标准化 所有基准共享相同的工具 API 和观测结构,以避免外部反馈质量带来的混淆。分数被标准化到最佳单 agent 基线,因此报告的指标衡量的是相对于该基线的协调增益或损失。评估强调自适应推理而非记忆性事实,通过基线标准化,跨模型比较考虑了固有的知识差异。

  • 论文中的使用 该基准套件用于比较 agent 架构。每个模型系列都在相同的任务上进行评估,所得分数隔离了架构对 agent 能力的影响。该设计确保任何观察到的优势都来自于模型通过交互收集信息、制定计划和修正假设的能力,而非来自静态知识或工具质量的差异。

方法

作者将 agent 系统形式化为一个元组 S=(A,E,C,Ω)S = (A, E, C, \Omega)S=(A,E,C,Ω),其中 AAA 是一组 agent,EEE 是共享环境,CCC 定义了通信拓扑,Ω\OmegaΩ 是编排策略。当 A=1|A| = 1A=1 时,该系统为单 agent 系统;当 A>1|A| > 1A>1 时,它变为多 agent 系统。每个 agent aia_iai 通过迭代反馈回路在环境中感知、推理和行动。

每个 agent aia_iai 本身由一个元组 Si=(Φi,Ai,Mi,πi)S_i = (\Phi_i, \mathcal{A}_i, M_i, \pi_i)Si=(Φi,Ai,Mi,πi) 定义。推理策略 Φi\Phi_iΦi 通常由一个大语言模型实例化。动作空间 Ai\mathcal{A}_iAi 由工具调用组成,形式化为 Ai={ToolCall(t,θ):tT,θΘt}\mathcal{A}_i = \{ \text{ToolCall}(t, \theta) : t \in \mathcal{T}, \theta \in \Theta_t \}Ai={ToolCall(t,θ):tT,θΘt},其中 T\mathcal{T}T 是可用工具集(例如,网页搜索、代码执行),Θt\Theta_tΘt 表示有效参数配置。内部记忆 MiM_iMi 存储 agent 的观测历史。决策函数 πi:HAi\pi_i : \mathcal{H} \to \mathcal{A}_iπi:HAi 将观测历史映射到动作,并由 LLM 实现:给定历史 hi,th_{i,t}hi,t,模型生成一个推理轨迹并选择下一个动作。

在每个时间步 ttt,agent aia_iai 根据以下公式选择动作:

αi,t=πi(hi,t),oi,t=E(αi,t),hi,t+1=fi(hi,t,αi,t,oi,t),\alpha_{i,t} = \pi_i(h_{i,t}), \quad o_{i,t} = E(\alpha_{i,t}), \quad h_{i,t+1} = f_i(h_{i,t}, \alpha_{i,t}, o_{i,t}),αi,t=πi(hi,t),oi,t=E(αi,t),hi,t+1=fi(hi,t,αi,t,oi,t),

其中 hi,0={s0}h_{i,0} = \{s_0\}hi,0={s0} 包含初始任务规格。历史更新函数 fif_ifi 将新的动作-观测对追加到现有历史中,当超过 token 限制时,会进行上下文窗口截断。此更新机制统一适用于单 agent 和多 agent 配置。

Agent 之间的通信通过编排层内的显式消息传递来处理。通信拓扑 CCC 定义了信息流模式。作者考虑了四种拓扑:

  • 独立式:仅 agent 到聚合器,没有对等通信。
  • 集中式:仅编排器到 agent。
  • 分散式:全连接。
  • 混合式:集中式和有限对等连接的组合。

编排策略 Ω\OmegaΩ 决定子 agent 输出如何聚合(例如,多数投票、加权合成),编排器是否可以推翻子 agent 的决定,记忆是否在协调轮次间持久化,以及基于共识或质量阈值的终止条件。

基于这些原语,作者实例化了四种具体的多 agent 架构,以形成对协调机制的结构化消融:

  • 独立式多 agent 系统nnn 个 agent 并行操作,聚合器在不进行交叉验证或多数投票的情况下连接它们的输出。这隔离了没有通信的并行化效果。
  • 集中式多 agent 系统:单个编排器在 rrr 轮中协调 nnn 个子 agent,创建了一个在编排器处存在潜在瓶颈的层级结构。
  • 分散式多 agent 系统:Agent 通过全连接进行 ddd 轮顺序辩论,从而通过同行讨论形成共识。
  • 混合式多 agent 系统:结合了编排器和有限的对等通信,继承了层级控制,同时允许横向信息交换。

该设计区分了通信(消息传递)与协调(战略指引)。在集中式系统中,编排器处理任务分解和进度监控;在分散式系统中,通信和协调通过辩论回合交织在一起。

为了量化错误动态,作者定义了一个任务级别的错误率 E=1PE = 1 - PE=1P,其中 PPP 是成功解决的任务比例。任务级别的错误放大因子 Aetask=EMAS/ESASA_e^{\text{task}} = E_{\text{MAS}} / E_{\text{SAS}}Aetask=EMAS/ESAS 捕捉了相对于单 agent 基线,多 agent 协调是抑制还是放大了错误。追踪级别的放大因子 AetraceA_e^{\text{trace}}Aetrace 进一步衡量了由 agent 间协调失败引起的额外计算工作,通过执行追踪 token 分析来估计。这些指标为不同架构如何处理错误提供了互补的视角。

实验

该研究在 260 个配置、6 个基准和 9 个 LLM 上评估了多 agent 系统,揭示了协调收益高度依赖于领域:像金融分析这样的可分解任务通过集中式协调获得了高达 80.8% 的提升,而顺序规划任务则下降了高达 70%。一个定量的扩展规律表明,单 agent 基线超过约 45% 会使改进饱和,并且任务可分解性、工具复杂性和协调效率解释了性能差异。该发现使得基于可测量属性的架构选择成为可能,其中集中式结构适用于分析,分散式适用于工具密集型任务,而单 agent 适用于顺序规划。

评估使用了 6 个基准,涵盖网页浏览、金融、Minecraft 规划、商业工具使用、软件工程和命令行执行。最稳健的发现是能力饱和,即单 agent 基线指标在约 45% 的成功率附近趋于平稳。提出了一个 Agentic Capability Index 作为静态智能综合指标更可靠的替代方案。这 6 个基准涵盖了不同的 agent 领域:网页浏览、金融、Minecraft 规划、商业工具使用、软件工程和系统管理。能力饱和(单 agent 基线)是唯一在聚类稳健(p=0.004)和 Holm–Bonferroni 校正下仍然显著的预测因子。Agentic Capability Index——所有基准的平均单 agent 性能——与静态智能指数的相关性仅为中等(r=0.45),并提高了交叉验证的拟合度。约 45% 的能力饱和阈值得到了 SWE-bench 和 Terminal-Bench 上 94% 配置匹配率的支持。域内交叉验证正确地为 87% 的留出配置识别了最优架构,尽管绝对的跨域预测是有限的。

单 agent 系统顺序执行,通信开销为零,内存使用最小。在多 agent 架构中,独立式变体实现了完全的并行化,同时仅增加了一次综合交换,保持了顺序深度不变。分散式辩论和集中式编排引入了额外的轮次,这成倍增加了 LLM 调用、通信开销和内存使用;混合式设计进一步增加了对等通信,产生了最高的协调成本。独立式多 agent 设置保持了与单 agent 相同的顺序深度,同时实现了完全的并行化,并且只需要一次通信交换进行投票综合。分散式辩论和集中式编排使 LLM 调用和 agent 间消息的数量随辩论或编排轮次的数量线性增长,增加了资源消耗。混合式架构通过结合编排器驱动的轮次和额外的对等消息交换,带来了最大的通信开销。

逐步增加经验协调指标及其与任务属性的交互作用,改进了对 agent 系统性能的交叉验证预测。结合了基础能力、任务特征和带有 9 个交互项的协调指标的完整模型,实现了最佳的交叉验证拟合度和最低的 AIC,表明这些指标捕捉了超越简单预测因子的方差。能力饱和,即较高的单 agent 性能为协调收益留下的空间较小,成为跨校正方法中最具统计稳健性的发现。带有交互项的完整模型实现了最高的交叉验证 R²(0.373)和最低的 AIC(−236.3),优于仅添加协调结构或单 agent 基线的设定。用 Agentic Capability Index(衡量跨基准的平均单 agent 性能)替换静态智能指数,进一步将交叉验证 R² 提升至 0.413,并且没有逆转任何发现。

一个跨越 260 个配置的回归模型显示,agent 系统性能最稳健的驱动因素是工具多样性、单 agent 基线以及协调效率与工具复杂性之间的交互作用。智能指数显示出线性效应,没有显著的曲率,而 agent 数量本身并不是一个可靠的预测因子。当使用基于任务的 Agentic Capability Index 而非静态综合指标来衡量能力时,模型拟合度得到改善。对数转换后的工具数量是一个强有力的正向预测因子,在多重比较校正后仍然成立。较高的单 agent 基线性能强烈地预测了整体系统性能,捕捉到协调收益空间的递减。效率与工具复杂性之间的交互作用显著,表明在工具丰富的环境中,效率惩罚会被放大。智能指数具有线性效应,但没有显著的二次项,表明能力不存在非线性的扩展规律。Agent 数量本身不显著,其效果通过与基线和任务属性的交互作用能得到更好的理解。用 Agentic Capability Index 替换静态智能指数,将交叉验证 R² 从 0.373 提升到 0.413,证实了动态性能指标与 agent 结果更一致。

协调架构显示出清晰的权衡:单 agent 系统效率高且错误率低,而多 agent 设置可以提高成功率,但协调成本高昂。效率从单 agent 的 0.466 单调下降到混合式架构的 0.074,并且独立式 agent 表现出最高的追踪级别错误放大,这损害了它们的成功率。协调复杂度的增加导致开销和轮次数上升,混合式系统招致最大的开销和最多的轮次。独立式 agent 遭受极端的错误放大(17.2),是单 agent 系统的 17 倍多,导致成功率仅为 0.370。随着协调复杂性的增加,效率急剧下降:单 agent 系统达到 0.466,而混合式架构则降至 0.074,下降了六倍。

评估涵盖了 6 个多样化的 agent 基准,发现单 agent 基线在约 45% 的成功率附近趋于平稳,确立了一个稳健的能力饱和效应,限制了协调收益。多 agent 架构可以提高成功率,但涉及严重的效率权衡,随着复杂性的增加,协调开销和错误放大急剧升级。一个动态的 Agentic Capability Index 作为预测因子优于静态智能指标,并且工具多样性、基线能力和协调效率的相互作用进一步解释了系统性能。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供