HyperAIHyperAI

Command Palette

Search for a command to run...

11 小时前
Agent
智能问答

更好的框架,更小的模型:通过自动化框架适配构建成本降低 90% 的智能体

Chenyang Yang Xinran Zhao Tongshuang Wu Christian Kästner

摘要

前沿大语言模型(LLM)智能体正在自动化许多商业任务,但其高昂的推理成本使得大规模部署难以为继。小语言模型(SLM)提供了一种成本更低的替代方案,然而,当将其直接替换到为前沿 LLM 设计的框架中时,其表现通常不尽如人意。我们证明,对于许多常规商业任务,当 SLM 智能体与一个可由元智能体自动发现的适配框架相结合时,能够以降低 90% 的成本达到与 LLM 相当的性能。其核心洞察在于,任务难度在很大程度上是跨实例共享的,可以通过量身定制的指令、工具和编排循环,将这部分难度从模型转移到框架中。为了系统性地研究这一点,我们创建了一个将智能体失败模式映射到框架适配策略的框架,并构建了一个框架优化器,该优化器能够从失败轨迹中自动发现有效的适配方案。在七个面向商业的智能体任务和三个 SLM 家族中,我们发现经过优化的框架在 21 个任务-SLM 组合中的 16 个上显著提升了性能,其中七个组合弥合了 SLM 与 LLM 之间的性能差距,表现最佳的 SLM 智能体以 4% 的成本恢复了 LLM 89.7% 的性能。我们的分析进一步表明,适配对于工作流程重复性更高的任务以及具备足够基础能力的 SLM 效果最佳。这些结果共同表明,框架适配能够拓展 SLM 智能体在常规商业任务中的实际部署范围。

一句话总结

卡内基梅隆大学的研究人员提出一个框架,利用 meta agent 自动发现适配层(harness)调整——优化指令、工具和编排——将任务难度从模型转移到适配层中,从而使小型语言模型在常规业务任务上能恢复高达前沿 LLM 性能的 89.7%,且推理成本仅为 4%。

核心贡献

  • 一个框架,将 agent 失败模式映射到适配层调整策略,将能力缺口与定制的指令、工具或编排循环关联起来。
  • 一个适配层优化器,能够从失败轨迹中自动发现有效的调整方案,使用 meta-agent 诊断 SLM 行为,而不依赖预先假设的能力限制。
  • 在七个业务导向的任务和三个 SLM 家族上的实验表明,优化后的适配层显著提升 SLM 表现,其中七个任务-模型对缩小了与前沿 LLM agent 的差距,而最优的 SLM agent 以 4% 的推理成本恢复了 LLM 性能的 89.7%;对于重复性工作流和具备足够基础能力的 SLM 效果最为显著。

引言

大语言模型(LLM)agent 越来越多地部署在业务工作流中,但其高推理成本、延迟和隐私关切使得大规模运营代价高昂。小型语言模型(SLM)提供了更便宜的替代方案,但在一般 agent 任务中,它们通常在规划、指令遵循和工具使用方面表现挣扎。先前关于 agent 适配的工作要么依赖手工启发式方法,在不同模型间泛化能力不佳,要么专注于增强已经强大的 LLM,将 SLM 在成本敏感自动化中的应用留待探索。作者引入一种系统化方法,利用基于能力的分类体系自动诊断 SLM 失败,然后通过一个 meta-agent 优化 agent 的适配层(指令、工具和编排)。他们在七个常规业务任务上的实证研究表明,适配层调整让 SLM 能够恢复 LLM agent 高达 89% 的性能,同时将成本削减超过 90%,使专门的 SLM agent 在重复性业务流程中变得实用。

方法

适配层调整策略

作者通过将任务需求从模型卸载到适配层来处理 agent 失败。当模型能力不及任务要求时,这种不匹配会表现为工具使用、指令遵循、知识、长上下文处理或规划方面的失败。为弥合这一差距,作者将适配层调整策略分为三类:上下文调整、工具调整和 agent 循环调整。

上下文调整塑造呈现给模型的信息,例如添加系统提示,或通过裁剪和摘要管理长上下文。工具调整重塑动作空间,通过创建自定义工具或筛除无关工具来简化选择。Agent 循环调整修改控制逻辑,例如用确定性检查辅助代码执行,或编排多 agent 系统。

自动化 SLM 适配层调整

前沿 LLM 使用通用适配层通常表现良好,而小型语言模型(SLM)经常表现出需要专门调整的能力缺口。将 SLM 简单替换到为 LLM 设计的适配层中往往导致表现不佳。作者证明,经过调整的适配层可以提供详细的计划、精简的工具集和监控钩子,使 SLM 以极低的成本达到与 LLM 相当的水平。

手动寻找恰当的调整十分困难,因为设计空间巨大且失败模式相互交织。作者主张应将适配层设计作为搜索问题自动化处理。他们创建了一个由 meta-agent 驱动的适配层优化器,输入 SLM、目标任务和初始适配层,输出优化后的适配层。

搜索空间与优化循环

搜索空间由来自开源框架的具体可编辑组件实例化,包括上下文、工具、钩子、上下文管理和子 agent。这一结构化空间使优化器能够可靠地覆盖相关失败模式。

优化循环分为三个阶段:采样与评估、失败诊断、以及新适配层验证。

  1. 采样与评估:系统维护一个已尝试适配层的池。使用遗传搜索过程,从 Pareto 前沿采样一个适配层,并在一批训练实例上评估,记录完整轨迹和得分。
  2. 诊断与提议:一个 meta-agent 检查轨迹和当前适配层代码以识别失败。它从任务轨迹、当前适配层、过往提议的搜索记忆以及设计空间文档中获取上下文。然后 meta-agent 编辑适配层组件,例如添加工具或插入技能。在继续之前进行一次健全性检查以捕捉无效代码。
  3. 验证与保存:新适配层在同一训练批次上评估。如果有改善,则进行完整验证,若优于先前候选则加入池中。

优化适配层示例

在一个预算审批任务中,默认适配层暴露了大量工具并需要端到端规划,这对前沿 LLM 有效但对 SLM 失败。适配层优化器在多次迭代中识别出必要的变化。它缩小了动作空间,将系统提示改写为明确的分步流程,并引入自定义钩子以防止循环。

通过将脆弱的工作流部分外化到提示、过滤器和运行时检查中,SLM 以显著更低的成本恢复了前沿模型性能。

实验

本研究评估了一个自动化适配层优化器,该优化器针对七个常规业务任务为小型语言模型(SLM)调整 agent 配置——例如系统提示和工具——使用留出测试集比较优化后的 SLM agent 与使用通用适配层的前沿 LLM。实验表明,优化后的适配层能让 SLM 以极低成本接近前沿性能,尤其对于重复性任务和能力更强的模型。最有效的调整通过添加上下文和管理工具来解决指令遵循和知识失败,优化器的成功更多地取决于忠实的失败分析和探索质量,而非搜索迭代次数。

基准包含七个多样化的业务任务,每个均源自现有评估套件,并设计成能产生可验证的结果。这些任务涵盖审核、预算审批、股票监控、异常检测、端到端测试、网站管理和代码重构等领域,全部具有明确定义的工作流和评估标准。任务实例重用或从先前基准生成,通过真值检查、测试执行或 AST 比较确保可复现性。七个任务横跨人力资源、财务、运维监控、软件测试、网站管理和软件工程。所有任务均基于已建立的基准,包括 TheAgentCompany、LOCA-Bench、WebGenBench、WebArena 和 RefactorBench。评估依赖可验证方法,如直接真值比较、执行生成的测试或检查代码抽象语法树。大多数任务包含 100 个实例;网站管理限于从 WebArena CMS 子集中精选的 50 个实例。任务创建利用现有流水线,对于静态网站则使用前沿语言模型生成完整 HTML 网站。

大型模型在所有任务上取得高平均准确率(89.7%),但单实例成本高昂(1.735/instance)。小型模型成本低几个数量级(1.735/instance)。小型模型成本低几个数量级(1.735/instance)。小型模型成本低几个数量级(0.043/instance),且在部分任务上具有竞争力,但其平均准确率降至 31.4%,在若干复杂任务上完全失败。在 Attention 任务上,小型模型准确率达 91.7%(对比大型模型的 96.5%),单实例成本仅 $0.025,成本降低 35 倍。小型模型单实例平均成本比大型模型低约 40 倍,但其平均准确率从 89.7% 下降到 31.4%,在 Stock、Anomaly、Playwright 和 Web 任务上得分接近零。

基准包含七个从现有评估套件改编的业务任务,实验将大型模型和便宜得多的小型模型进行对比。大型模型在所有任务上达到高准确率但单实例成本高,而小型模型成本降低约 40 倍但准确率有限,在若干复杂任务上完全失败。总体而言,小型模型仅在简单任务上具有竞争力,揭示了这些企业场景下成本节约与可靠性之间的尖锐权衡。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供