HyperAIHyperAI

Command Palette

Search for a command to run...

18 小时前
Agent
LLM

揭秘智能体技能:为何有效——直至失效

Zhiyuan Jiang Fangrui Huang Hanwen Xing Xander Wu Yipeng Gao Rui Cao Mengdi Wang Shilong Liu Yijiang Li

摘要

技能已成为一种实用且有效的方法,通过结构化的知识包在推理阶段增强 LLM 智能体。然而,现有评估大多只衡量技能是否提升了聚合任务成功率,一个更根本的问题仍未得到充分探索:技能何时有帮助、为何有效、又在何处失效?通过在多种基准、智能体框架和 LLM 上开展受控实验,我们分离了技能的表示方式、结果标注检索难度以及跨框架鲁棒性的影响。为进一步回答这一问题,我们设计了一项将受控定量实验与配对轨迹分析相结合的对比研究。我们对来自受控实验的 8,135 条试验记录进行了归一化处理,并从 240 条开放编码记录中保留了 238 个有效唯一标签。我们将这些观察结果归纳为一个包含三个高层类别和十二种技能使用模式的分类体系:当嘈杂轨迹成为稳定执行的过程锚点时,技能便发挥作用。在配对比较中,技能相较于 Workflow Memory 提升了 6.06 分。过程锚定占技能有效案例的 65.7%,而显式知识注入仅占 4.5%,表明技能的作用在于稳定行动而非注入缺失事实。检索是另一个独立瓶颈:当候选池从 5 增至 100 时,实际使用精度从 29.6% 降至 3.3%。易混淆的干扰项会损害离线识别,但下游成功率仍保持稳定;精确的真值调用既不充分也不必要。技能在脆弱假设、不兼容情境或适应不足时会失效。这些发现将评估推进到聚合成功率之外,并为可靠的自我进化智能体提供了指导。

一句话总结

在一项结合实验与成对轨迹分析的受控研究中,来自普林斯顿大学、加州大学圣迭戈分校、斯坦福大学等机构的研究者发现,agent 技能主要作为稳定执行过程的程序性锚点发挥作用(占 65.7% 的案例),而不是作为显式知识注入(占 4.5%);同时,随着候选池增大,检索精度从 29.6% 下降到 3.3%,技能在脆弱假设下也会失效。

核心贡献

  • 引入一种受控对比评估方法,将定量实验与对 8,135 条标准化 trial 记录的成对轨迹分析结合,并得出三大类、十二种技能使用模式的分类体系。
  • 指出程序性锚定是技能的主要收益,在匹配比较中比 Workflow Memory 提高 6.06 个百分点,并将 65.7% 的技能案例归因于程序性锚定,而仅 4.5% 归因于显式知识注入。
  • 量化检索与失效动态:当技能池从 5 增长到 100 时,实际使用精度从 29.6% 下降到 3.3%;精确的 ground-truth 调用既不充分也不必要;技能在脆弱假设、不兼容上下文或适应性不足时失效。

引言

使用工具的大型语言模型 agent 越来越依赖对先前执行的记忆,技能作为紧凑的程序性描述出现,用于压缩噪声经验、标准化例程并在任务之间迁移知识。然而,先前工作主要通过总体任务成功率来评估技能,未能说明 agent 行为发生了什么变化、技能何时有帮助以及为何失效。作者引入一种对比轨迹分析方法,比较有技能访问和无技能访问的匹配执行,并分析在表示、检索和调用层面的差异。其主要贡献是技能效用与失效的分类体系,以及技能主要作为程序性锚点而非事实知识发挥作用的证据;当检索到的指导在程序上不兼容、被弱调用或不足以解决执行瓶颈时,技能会失效。

方法

作者将技能使用界定为从先前 agent 轨迹到可复用程序性知识的受控转换。核心比较围绕三个执行分支构建:Raw 不接收先前经验;Workflow Memory 接收来自先前执行的清理后程序轨迹;Skill 接收从相同工作流中提炼出的标准化 SKILL.md 产物。对于每个选定任务,将成功和失败的 raw 轨迹收集到一个平衡的轨迹池中。随后,固定预算的组成网格在仅成功到仅失败之间变化证据组合,例如从 5s0f 到 0s5f。Workflow Memory 和 Skill 由相同的选定轨迹构建,并在相同的目标任务上评估,在保持底层经验不变的同时仅改变其表示形式。为了将程序性内容与显式结果信号分开,作者还创建了标准 Skill 变体和 no-hint Skill 变体。在 no-hint 设置中,技能构建期间会移除成功与失败的标签,但轨迹和执行协议保持不变。

对于跨框架迁移,程序性产物由在主要 Codex 设置中收集的轨迹构建,然后在 Gemini CLI 中使用 Gemini-3.1-Pro-Preview 进行评估。目标框架的 Raw 基线作为参照。该设置保持源经验不变,而目标 agent 在提示风格、工具使用接口和执行行为上有所不同。这使得作者能够检验当 agent 框架变化时,提炼出的技能是否比直接工作流轨迹更稳健地保留可复用的程序性指导。

技能检索研究使用受控的候选池构建方式,其中每个候选池包含任务的 ground-truth 技能集以及干扰项。候选池大小从 5 到 100 不等,干扰项按随机、语义相似或不相似技能进行采样。三个实验分支衡量技能使用的互补方面:一个 embedding 检索器按任务描述相似度对技能排序;一个显式 agent 选择设置在不执行任务的情况下选择可能有用的技能;以及全候选池真实执行,其中 agent 可以访问完整候选池。离线诊断独立运行,任何离线分支的选择输出都不会传递到执行实验中。在执行过程中测量已访问技能与 ground-truth 的重叠情况以及最终验证器结果。

为了解释技能可用时发生的变化,作者构建了一条对比轨迹分析流水线。异构基准输出被标准化为包含 8,135 条 trial 记录的共享清单,其中 7,837 条包含 agent 转录。对 240 条采样轨迹进行开放编码,产生 238 个有效标签,并将其合并为一个 12 模式的标准分类体系。分类体系的构建通过对 714 个轨迹-标签对的独立人工检查进行验证,获得 95.8% 的完全一致率和 Cohen’s κ=0.952\kappa = 0.952κ=0.952。分析的主要单元是成对三元组,用于比较同一任务和设置在 Raw、Workflow Memory 和 Skill 注入下的表现。作者构造了 528 个这样的三元组,产生 1,584 个分支级模式分配。对于每个三元组,LLM 评判器为每个分支分配一个分类模式,记录分支之间的成对变化,并判断注入产物是否通过程序性锚定、知识注入、失败警告、无有意义使用或产生反效果指导来发挥作用。这些细粒度模式被归入粗粒度技能使用类别,涵盖成功的程序性锚定、执行层与验证失败,以及调用或边界失败。

实验

实验在 Terminal-Bench 和 SkillsBench 上跨 Codex 与 Gemini CLI 比较 raw 执行、workflow memory 和提炼后的技能,同时测试跨框架迁移、结果标签可用性以及从受控技能池中的检索。技能相较 raw 轨迹的改进主要体现在作为程序性锚点稳定执行并减少环境或格式错误,但它们会引入新的误用失效,而 workflow memory 可能导致流程过载。当包含失败轨迹时,隐藏结果标注会产生重要影响;检索研究表明语义相似的干扰项会降低技能识别能力,而下游成功率保持相对平稳,这表明精确的技能调用既不充分也不必要。总体而言,技能价值取决于提炼、迁移、检索和运行时适应,而不仅仅是将 agent 暴露于先前经验。

Skill 注入在所有评估基准和轨迹组合中始终超过 raw 基线;而 workflow memory 仅在 SkillsBench 和 Terminal-Bench-Pro 上超过 raw,在 Terminal-Bench-2 上低于 raw。workflow memory 的成功率通常随着更多失败源轨迹的加入而下降,在大多数为失败轨迹的组合下达到最低值。Skill 注入在极端情况下也会减弱,但可能在成功与失败混合条件下达到峰值,而不是在全部成功轨迹条件下。在此比较中,Skill 注入在每种基准和轨迹组合设置下均优于 raw 基线。在所有轨迹组合中,workflow memory 均低于 Terminal-Bench-2 的 raw 基线,而在 SkillsBench 和 Terminal-Bench-Pro 上则优于 raw。加入一些失败源轨迹可能使技能成功率高于全部成功轨迹,特别是在 Terminal-Bench-2 和 Terminal-Bench-Pro 上。大多数为失败的源轨迹在 Terminal-Bench-2 和 Terminal-Bench-Pro 上产生最差的 workflow 结果,并降低 Terminal-Bench-Pro 上的技能增益。

注入的先前经验可分为程序性指导、缺失领域知识、陷阱警告、无有意义使用或主动有害使用。随着候选技能池增大,精确的 ground-truth 技能使用精度急剧下降,但下游任务成功率保持相对平稳,因此精确调用对成功既不充分也不严格必要。在离线场景中,相似干扰项是主要挑战,agent 通常会将 ground-truth 技能与干扰项一起考虑,而不是完全忽略它。机制标签将有益的程序性锚点和领域知识与无效或反效果区分开来。随着候选池大小增加,实际使用精度崩溃,而下游成功率在相同条件下保持相对稳定。干扰项之间的语义相似性是比候选池大小本身更强的压力因素,高召回率表明 ground-truth 技能通常被考虑,但未能被可靠选择。

人工验证覆盖分类体系构建的两个阶段:确认 raw 标签确实基于 agent 轨迹,以及将这些标签独立映射到标准模式。所有采样的 raw 标签均被确认基于其支撑轨迹。独立人工与 LLM 的分配结果几乎完全一致,支持分类体系在单一 LLM 之外的稳定性。在 714 个轨迹-标签检查中,每个 raw 标签均被确认基于记录的 agent 行为。独立人工与 LLM 的分类映射达到 95.8% 的完全一致率和 Cohen's kappa 为 0.952。

检索精度随着候选技能池增大而下降,其中语义相似的干扰项导致离线识别精度出现最大降幅。在较大候选池下,执行时技能使用精度崩溃至极低水平,而下游任务成功率保持相对稳定。这表明 agent 经常在干扰项中包含或检查正确技能,但未能可靠地将使用限制为标注的 ground-truth 技能。对于相似干扰项池,离线检索和显式 agent 选择的精度明显低于随机或不相似干扰项池,并且精度随候选池大小增加进一步下降。在执行过程中,实际技能使用精度随候选池增大而急剧下降,而任务成功率保持相对平稳,这表明精确的技能使用匹配与任务完成之间并不紧密耦合。

这些实验在多个基准和轨迹组合上比较 Skill 注入、workflow memory 与 raw 基线,考察注入经验的使用方式,通过更大的候选池和干扰项对检索与技能使用进行压力测试,并通过人工审查验证分类体系。Skill 注入始终优于 raw 基线;workflow memory 仅在 SkillsBench 和 Terminal-Bench-Pro 上有帮助,并在大多数为失败轨迹时减弱;注入经验可作为程序性指导或缺失领域知识,但也可能无效或有害;更大且语义相似的干扰项池会急剧降低精确技能使用精度,而下游任务成功率保持相对稳定。人工验证确认,所有采样的 raw 标签均基于 agent 行为,独立人工与 LLM 分类映射之间几乎完全一致。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供