Command Palette
Search for a command to run...
递归经验-工作记忆演化用于长时程智能体框架
递归经验-工作记忆演化用于长时程智能体框架
Zhaochen Yu Yingcheng Wu Zhenfei Yin Kaiyuan Chen Zhe Zhao Mengdi Wang Shuicheng Yan Ling Yang
摘要
递归自我改进(RSI)在长时程任务中仍然困难,因为不断增长的历史记录掩盖了任务状态并导致技能调用错位。我们引入了 Recuris,一种用于长时程智能体框架的递归经验-工作记忆架构,其中工作记忆跟踪任务进度并指导从经验记忆中选择技能,将技能使用基于当前需求而非完整历史。这种耦合还将执行转化为结构化证据,将失败定位到特定的记忆组件。在各种任务中,一个固定的元智能体将这些证据转化为对技能记忆的局部化、经过验证门控的更新,从而重塑执行并产生新证据,形成一个有界的递归记忆演化循环。在四个长时程基准和十个模型上,Recuris 在 37 个完成的模型-基准对中提升了 35 个的任务成功率,将前沿模型推至 SOTA 级任务成功率:在 τ²-Bench 上,它为 GPT-5.6 Sol 增加了 +17.8 个百分点,为 Claude Opus 5 增加了 +15.6 个百分点,使 Opus 5 达到 87.9%,并在 SkillFlow 上为 Qwen3.6-27B/35B 增加了 +16.6/+13.5 个百分点。随着交互时长的增长,优势进一步扩大,在最长任务上达到 +32.2 个百分点,常见的长时程失败最多减少 80%。这些结果表明,递归演化的记忆可作为 RSI 的可扩展基础,使智能体能够持续将积累的经验转化为越来越有效的长时程行为。
一句话总结
来自新加坡国立大学、斯坦福大学、牛津大学和普林斯顿大学的研究者提出了 Recuris,一种递归的经验-工作记忆架构,通过跟踪任务进度来指导技能选择,利用结构化证据定位失败原因,并实现验证门控的记忆更新;在四个基准测试和十个模型上,它在 37 个模型-基准组合中的 35 个上提升了任务成功率,在 τ2. -Bench 上为 GPT-5.6 Sol 增加了 +17.8 个百分点,在最长的任务上增加了 +32.2 个百分点。
核心贡献
- 提出了 Recuris,一种递归的经验-工作记忆架构,将自我改进外部化到记忆控制层,其中工作记忆跟踪经过验证的任务进度,从经验记忆中指导技能选择,固定的元智能体将失败归因到特定记忆组件,并仅在验证门控之后修补这些相关组件。
- 将状态提议与状态提交分离,仅在实际工具结果支持时才更新进度条目,将动作决策和技能调用都建立在经过验证的任务状态之上,并输出结构化轨迹,将任务状态、调用的技能、动作和结果关联起来,以支持局部化诊断。
- 在四个长程基准测试和十个模型上,提升了 37 个模型-基准组合中的 35 个的任务成功率,包括 GPT-5.6 Sol 在 τ²-Bench 上提升 +17.8 个百分点,Claude Opus 5 提升 +15.6 个百分点(达到 87.9%),Qwen3.6-27B/35B 在 SkillFlow 上分别提升 +16.6/+13.5 个百分点,在最长的任务上最高提升 +32.2 个百分点,故障定位率达到 64.8%,而仅凭任务结果只有 13.0%。
引言
LLM 智能体越来越依赖外部框架来协调记忆、工具使用和任务跟踪,但长程任务暴露了一个关键弱点:随着交互历史的增长,智能体会丢失未解决目标的线索,并调用过时的技能。现有的经验记忆方法从初始指令或完整历史中检索技能,但随着任务演变,这种方式变得不可靠,而且记忆更新往往过于粗糙,仅由最终成功或失败驱动,无法定位是哪个组件导致了问题。
作者提出了 Recuris,一种递归的经验-工作记忆架构,将经过验证的任务状态(工作记忆)与可复用的经验(经验记忆)耦合。工作记忆跟踪进度和未解决的目标,为技能选择提供依据,并且只从经过验证的工具反馈中更新,形成状态、动作和结果的闭环。跨任务时,固定的元智能体分析结构化轨迹,将失败定位到特定记忆组件,并应用验证门控的更新,保持基础模型不变。在四个长程基准测试和十个模型上的评估表明,Recuris 在 37 个组合中的 35 个上提升了成功率,增益随时间跨度增加而增长,故障定位准确率为 64.8%,而仅凭结果只有 13.0%。
方法
作者提出了 Recuris,一种围绕冻结的大语言模型(LLM)πθ 和工具集 T 构建的智能体框架。该系统协调任务状态跟踪、经验记忆访问、技能调用、工具交互和执行验证。在每个进化轮次 k,Recuris 维护一个不断演化的技能记忆,表示为 Mk=(Ek,Wk,ρk,Ck)。其中,Ek 以智能体技能格式存储可复用的技能,Wk 定义任务特定工作状态 wt 的状态模式和更新提议,ρk 是决定何时以及检索哪些技能的调用策略,Ck 是一组检查器,用于验证观察结果是否支持提议的状态变更。
如框架图所示,Recuris 通过两个相互连接的循环运行:任务级执行循环和跨任务进化循环。在任务内部,当前工作状态指导技能调用,执行证据控制后续状态更新。跨任务时,固定的元智能体利用失败的运行来定位有效的修复目标,提出组件特定的记忆补丁,并依靠固定的验证门控来接纳候选补丁。为了连接这些循环,系统在第 k 轮记录结构化执行轨迹 Γk,将每个动作和观察结果与触发技能调用的状态、提议的状态更新以及用于接受或拒绝该更新的证据关联起来。
在任务级循环中,作者实现了经过验证的经验记忆(EM)和工作记忆(WM)耦合。执行框架从任务初始化结构化工作状态 w0,其中每个目标条目跟踪其内容、状态(待处理、已完成或受阻)和支持证据。技能调用是状态驱动的,即策略 ρk 根据当前进度 wt 和特定执行事件 et 决定检索哪些技能 Et⊆Ek,而不是搜索完整的交互历史。在动作 at 和环境观察结果 ot 之后,工作记忆规范提议下一个状态 wt+1=UWk(wt,at,ot)。然后,检查器集合根据观察结果评估该提议,产生决策 ct=Ck(wt,wt+1,at,ot)。固定内核仅提交受支持的变更以生成 wt+1=K(wt,wt+1,ct),确保状态准确反映经过验证的进度。
对于跨任务进化循环,Recuris 采用有界的递归技能记忆进化。当任务失败时,元智能体的固定定位阶段分析结构化轨迹,生成诊断 Dk=Afixed(Γk,Mk)={(fj,zj)}j=1Jk。每个诊断出的失败 fj 被归因到组件 zj∈{E,W,ρ,C},即局部干预最有可能产生效果的组件。补丁阶段随后为每个相关组件提出具体编辑 Δmz=Pfixed(Γk,Mk,Dk,z),构建候选记忆 Mk+=Mk⊕Zk{Δmz}z∈Zk。该操作符仅修改相关组件,其余部分保持不变地复制。最后,固定验证门控 Gfixed 在失败任务和保留开发集上比较候选 Mk+ 与当前记忆 Mk。仅当补丁修复目标失败且不会在锚定任务上造成回归时,补丁才被接纳,完成递归更新 Mk→Γk→Dk→Mk+→Mk+1。
实验
评估涵盖工具使用基准(tau2-Retail、tau2-Airline)、SkillFlow 和 Terminal-Bench 2.1,使用冻结的中型部署模型来进化技能记忆,然后将该记忆不变地迁移到其他模型。Recuris 将经验记忆与经过验证的工作状态耦合,在 37 个模型-基准组合中的 35 个上提升了任务成功率,最大增益出现在 Retail 和 SkillFlow 上;消融实验表明,工作状态和状态驱动的技能调用是增益的主要来源,而单纯注入更多技能文本反而有害。关键记忆组件因领域而异(Airline 上是写评论,Retail 上是状态面板),递归进化(元智能体从失败轨迹中修补记忆)产生一致的保留集增益,并可跨任务和模型迁移,但迁移取决于目标是否仍包含已修复的失败类型。在孤立的 Terminal-Bench 任务上,测试时适应仅带来每次尝试可靠性的适度提升,但大部分主要改进来自重试预算本身,而非学习。
Recuris 在大多数模型-基准组合上持续提升任务成功率,最大增益出现在跨任务共享结构的基准上,例如零售和技能发现。该方法的收益不随模型规模扩展,其价值与自适应记忆相关,而非额外的上下文或计算量。Recuris 在 37 个已完成的模型-基准组合中的 35 个上提升了任务成功率。最大增益出现在具有共享结构的基准上,零售和技能发现任务分别提升了 23.3 和 16.8 个百分点。收益与模型规模无关;较小的模型可以获得与较大模型相当或更大的增益。在没有共享结构的孤立任务上,Recuris 几乎没有或没有收益,而额外上下文本身反而可能损害性能。
在零售和航空领域,结合情景记忆和工作记忆可获得最强性能,相对于基础智能体的增益最大。仅工作记忆在零售领域带来显著提升,而仅情景记忆只增加少量不显著的增益。模型控制的调用变体仅在零售领域表现出显著但较小的改进。完整记忆组合在两个领域都优于所有其他变体,实现了最高成功率和相对于基础智能体的最大置信区间改进。仅工作记忆在零售领域带来大幅显著增益,而仅情景记忆在两个领域都只产生边际且不显著的改进。模型控制的调用仅在零售领域测试,相对于仅工作记忆或组合记忆变体,提供了显著但较小的提升。
当技能库保持固定时,决定何时调用技能的方法对性能的影响大于技能内容本身。Recuris 为每个草拟的状态变更调用提供匹配的一个技能,优于每次都将所有技能注入上下文的模型控制变体,尽管两者使用逐字节相同的技能体。优势主要在覆盖率而非速度上,因为首次正确写入的中位轮次在所有配置中相同。Recuris 达到 82.4% 的必需写入召回率,而模型控制为 61.1%;任务成功率为 83.6%,而模型控制为 65.6%。将整个技能库放入上下文并让模型自行决定何时使用,得分低于完全没有技能的配置(任务成功率 65.6% 对 82.0%)。所有配置中首次正确写入的中位轮次均为 18,表明调用控制影响是否发出写入,而非写入速度。Recuris 的每个回合遗漏必需写入率最低(0.121),每次成功的 agent token 数最低(101k),而模型控制在两项上均为最高(0.417 和 147k)。
框架产生的结构化轨迹使组件故障可观察,宏召回率从仅结果的 13.0% 和原始轨迹的 37.0% 跃升至结构化轨迹的 64.8%。增益集中在对话记录中不可见的故障上,例如调用和工作记忆故障,而技能内容故障的增益最小,因为这些故障已出现在对话中。精确率也显著提高,表明轨迹有助于避免将故障错误归因到错误组件。仅结果的证据得分低于常数答案基线,原始轨迹勉强超过基线,而结构化轨迹几乎使基线翻倍。没有结构化轨迹时,调用故障从未被检测到,而结构化轨迹在 38.9% 的情况下检测到调用故障。工作记忆故障召回率从原始轨迹的 50.0% 提升到结构化轨迹的 83.3%。技能内容故障的增益最小,从 61.1% 提升到 72.2%,这与该故障在对话记录中可见的事实一致。宏精确率从 27.6% 提升到 64.4%,表明轨迹减少了对技能组件的错误指控。
技能记忆的递归进化持续提升保留集任务性能,相对于共享的起始记忆,增益在多次运行和多种实现中约为 9 到 17 个百分点。第二轮进化进一步叠加增益,而没有接纳候选的后续轮次没有显著改进。仅当保留任务包含记忆所修复的失败类型时才会发生迁移,这体现在成功包在保留任务上近乎普遍的调用,而航空特定谱系在没有此类失败残留的任务上没有增益。所有达到保留任务的包相对于起始记忆提升 9 到 17 个百分点,置信区间排除零。第二轮进化增加进一步增益,而后续没有循环内候选接纳的轮次没有显著改进。成功包的进化记忆在 86 个保留任务中的 78 到 86 个上被调用,表明是主动检索而非通用提示效应。唯一保留调用为零的包未能超过起始记忆,这强调了迁移取决于实际技能使用。航空特定谱系在缺乏已修复失败类型的任务上评估,没有显著增益且调用率较低。
Recuris 在大多数模型-基准组合上持续提升任务成功率,最大增益出现在跨任务共享结构的基准上,例如零售和技能发现,而在孤立任务上几乎没有收益。结合情景记忆和工作记忆可获得最强性能,仅工作记忆贡献显著增益,而仅情景记忆只增加边际改进。当技能库固定时,决定何时调用技能的方法比技能内容更重要,因为 Recuris 优于每次将所有技能注入上下文的模型控制变体。框架产生的结构化轨迹使组件故障可观察,显著提升故障召回率和精确率,尤其是对话记录中不可见的故障,技能记忆的递归进化持续提升保留集任务性能,增益随轮次叠加,迁移取决于实际技能使用。