HyperAIHyperAI

Command Palette

Search for a command to run...

Agent
LLM

递归经验-工作记忆演化用于长时程智能体框架

Zhaochen Yu Yingcheng Wu Zhenfei Yin Kaiyuan Chen Zhe Zhao Mengdi Wang Shuicheng Yan Ling Yang

摘要

递归自我改进(RSI)在长时程任务中仍然困难,因为不断增长的历史记录掩盖了任务状态并导致技能调用错位。我们引入了 Recuris,一种用于长时程智能体框架的递归经验-工作记忆架构,其中工作记忆跟踪任务进度并指导从经验记忆中选择技能,将技能使用基于当前需求而非完整历史。这种耦合还将执行转化为结构化证据,将失败定位到特定的记忆组件。在各种任务中,一个固定的元智能体将这些证据转化为对技能记忆的局部化、经过验证门控的更新,从而重塑执行并产生新证据,形成一个有界的递归记忆演化循环。在四个长时程基准和十个模型上,Recuris 在 37 个完成的模型-基准对中提升了 35 个的任务成功率,将前沿模型推至 SOTA 级任务成功率:在 τ²-Bench 上,它为 GPT-5.6 Sol 增加了 +17.8 个百分点,为 Claude Opus 5 增加了 +15.6 个百分点,使 Opus 5 达到 87.9%,并在 SkillFlow 上为 Qwen3.6-27B/35B 增加了 +16.6/+13.5 个百分点。随着交互时长的增长,优势进一步扩大,在最长任务上达到 +32.2 个百分点,常见的长时程失败最多减少 80%。这些结果表明,递归演化的记忆可作为 RSI 的可扩展基础,使智能体能够持续将积累的经验转化为越来越有效的长时程行为。

一句话总结

来自新加坡国立大学、斯坦福大学、牛津大学和普林斯顿大学的研究者提出了 Recuris,一种递归的经验-工作记忆架构,通过跟踪任务进度来指导技能选择,利用结构化证据定位失败原因,并实现验证门控的记忆更新;在四个基准测试和十个模型上,它在 37 个模型-基准组合中的 35 个上提升了任务成功率,在 τ2.\tau ^ { 2 } .τ2. -Bench 上为 GPT-5.6 Sol 增加了 +17.8+17.8+17.8 个百分点,在最长的任务上增加了 +32.2+32.2+32.2 个百分点。

核心贡献

  • 提出了 Recuris,一种递归的经验-工作记忆架构,将自我改进外部化到记忆控制层,其中工作记忆跟踪经过验证的任务进度,从经验记忆中指导技能选择,固定的元智能体将失败归因到特定记忆组件,并仅在验证门控之后修补这些相关组件。
  • 将状态提议与状态提交分离,仅在实际工具结果支持时才更新进度条目,将动作决策和技能调用都建立在经过验证的任务状态之上,并输出结构化轨迹,将任务状态、调用的技能、动作和结果关联起来,以支持局部化诊断。
  • 在四个长程基准测试和十个模型上,提升了 37 个模型-基准组合中的 35 个的任务成功率,包括 GPT-5.6 Sol 在 τ²-Bench 上提升 +17.8 个百分点,Claude Opus 5 提升 +15.6 个百分点(达到 87.9%),Qwen3.6-27B/35B 在 SkillFlow 上分别提升 +16.6/+13.5 个百分点,在最长的任务上最高提升 +32.2 个百分点,故障定位率达到 64.8%,而仅凭任务结果只有 13.0%。

引言

LLM 智能体越来越依赖外部框架来协调记忆、工具使用和任务跟踪,但长程任务暴露了一个关键弱点:随着交互历史的增长,智能体会丢失未解决目标的线索,并调用过时的技能。现有的经验记忆方法从初始指令或完整历史中检索技能,但随着任务演变,这种方式变得不可靠,而且记忆更新往往过于粗糙,仅由最终成功或失败驱动,无法定位是哪个组件导致了问题。

作者提出了 Recuris,一种递归的经验-工作记忆架构,将经过验证的任务状态(工作记忆)与可复用的经验(经验记忆)耦合。工作记忆跟踪进度和未解决的目标,为技能选择提供依据,并且只从经过验证的工具反馈中更新,形成状态、动作和结果的闭环。跨任务时,固定的元智能体分析结构化轨迹,将失败定位到特定记忆组件,并应用验证门控的更新,保持基础模型不变。在四个长程基准测试和十个模型上的评估表明,Recuris 在 37 个组合中的 35 个上提升了成功率,增益随时间跨度增加而增长,故障定位准确率为 64.8%,而仅凭结果只有 13.0%。

方法

作者提出了 Recuris,一种围绕冻结的大语言模型(LLM)πθ\pi_\thetaπθ 和工具集 T\mathcal{T}T 构建的智能体框架。该系统协调任务状态跟踪、经验记忆访问、技能调用、工具交互和执行验证。在每个进化轮次 kkk,Recuris 维护一个不断演化的技能记忆,表示为 Mk=(Ek,Wk,ρk,Ck)\mathcal{M}_k = (\mathcal{E}_k, \mathcal{W}_k, \rho_k, \mathcal{C}_k)Mk=(Ek,Wk,ρk,Ck)。其中,Ek\mathcal{E}_kEk 以智能体技能格式存储可复用的技能,Wk\mathcal{W}_kWk 定义任务特定工作状态 wtw_twt 的状态模式和更新提议,ρk\rho_kρk 是决定何时以及检索哪些技能的调用策略,Ck\mathcal{C}_kCk 是一组检查器,用于验证观察结果是否支持提议的状态变更。

如框架图所示,Recuris 通过两个相互连接的循环运行:任务级执行循环和跨任务进化循环。在任务内部,当前工作状态指导技能调用,执行证据控制后续状态更新。跨任务时,固定的元智能体利用失败的运行来定位有效的修复目标,提出组件特定的记忆补丁,并依靠固定的验证门控来接纳候选补丁。为了连接这些循环,系统在第 kkk 轮记录结构化执行轨迹 Γk\Gamma_kΓk,将每个动作和观察结果与触发技能调用的状态、提议的状态更新以及用于接受或拒绝该更新的证据关联起来。

在任务级循环中,作者实现了经过验证的经验记忆(EM)和工作记忆(WM)耦合。执行框架从任务初始化结构化工作状态 w0w_0w0,其中每个目标条目跟踪其内容、状态(待处理、已完成或受阻)和支持证据。技能调用是状态驱动的,即策略 ρk\rho_kρk 根据当前进度 wtw_twt 和特定执行事件 ete_tet 决定检索哪些技能 EtEk\mathcal{E}_t \subseteq \mathcal{E}_kEtEk,而不是搜索完整的交互历史。在动作 ata_tat 和环境观察结果 oto_tot 之后,工作记忆规范提议下一个状态 w~t+1=UWk(wt,at,ot)\widetilde{w}_{t+1} = U_{\mathcal{W}_k}(w_t, a_t, o_t)wt+1=UWk(wt,at,ot)。然后,检查器集合根据观察结果评估该提议,产生决策 ct=Ck(wt,w~t+1,at,ot)c_t = \mathcal{C}_k(w_t, \widetilde{w}_{t+1}, a_t, o_t)ct=Ck(wt,wt+1,at,ot)。固定内核仅提交受支持的变更以生成 wt+1=K(wt,w~t+1,ct)w_{t+1} = K(w_t, \widetilde{w}_{t+1}, c_t)wt+1=K(wt,wt+1,ct),确保状态准确反映经过验证的进度。

对于跨任务进化循环,Recuris 采用有界的递归技能记忆进化。当任务失败时,元智能体的固定定位阶段分析结构化轨迹,生成诊断 Dk=Afixed(Γk,Mk)={(fj,zj)}j=1JkD_k = \mathcal{A}_{\text{fixed}}(\Gamma_k, \mathcal{M}_k) = \{(f_j, z_j)\}_{j=1}^{J_k}Dk=Afixed(Γk,Mk)={(fj,zj)}j=1Jk。每个诊断出的失败 fjf_jfj 被归因到组件 zj{E,W,ρ,C}z_j \in \{\mathcal{E}, \mathcal{W}, \rho, \mathcal{C}\}zj{E,W,ρ,C},即局部干预最有可能产生效果的组件。补丁阶段随后为每个相关组件提出具体编辑 Δmz=Pfixed(Γk,Mk,Dk,z)\Delta m_z = \mathcal{P}_{\text{fixed}}(\Gamma_k, \mathcal{M}_k, D_k, z)Δmz=Pfixed(Γk,Mk,Dk,z),构建候选记忆 Mk+=MkZk{Δmz}zZk\mathcal{M}_k^+ = \mathcal{M}_k \oplus_{Z_k} \{\Delta m_z\}_{z \in Z_k}Mk+=MkZk{Δmz}zZk。该操作符仅修改相关组件,其余部分保持不变地复制。最后,固定验证门控 Gfixed\mathcal{G}_{\text{fixed}}Gfixed 在失败任务和保留开发集上比较候选 Mk+\mathcal{M}_k^+Mk+ 与当前记忆 Mk\mathcal{M}_kMk。仅当补丁修复目标失败且不会在锚定任务上造成回归时,补丁才被接纳,完成递归更新 MkΓkDkMk+Mk+1\mathcal{M}_k \to \Gamma_k \to D_k \to \mathcal{M}_k^+ \to \mathcal{M}_{k+1}MkΓkDkMk+Mk+1

实验

评估涵盖工具使用基准(tau2-Retail、tau2-Airline)、SkillFlow 和 Terminal-Bench 2.1,使用冻结的中型部署模型来进化技能记忆,然后将该记忆不变地迁移到其他模型。Recuris 将经验记忆与经过验证的工作状态耦合,在 37 个模型-基准组合中的 35 个上提升了任务成功率,最大增益出现在 Retail 和 SkillFlow 上;消融实验表明,工作状态和状态驱动的技能调用是增益的主要来源,而单纯注入更多技能文本反而有害。关键记忆组件因领域而异(Airline 上是写评论,Retail 上是状态面板),递归进化(元智能体从失败轨迹中修补记忆)产生一致的保留集增益,并可跨任务和模型迁移,但迁移取决于目标是否仍包含已修复的失败类型。在孤立的 Terminal-Bench 任务上,测试时适应仅带来每次尝试可靠性的适度提升,但大部分主要改进来自重试预算本身,而非学习。

Recuris 在大多数模型-基准组合上持续提升任务成功率,最大增益出现在跨任务共享结构的基准上,例如零售和技能发现。该方法的收益不随模型规模扩展,其价值与自适应记忆相关,而非额外的上下文或计算量。Recuris 在 37 个已完成的模型-基准组合中的 35 个上提升了任务成功率。最大增益出现在具有共享结构的基准上,零售和技能发现任务分别提升了 23.3 和 16.8 个百分点。收益与模型规模无关;较小的模型可以获得与较大模型相当或更大的增益。在没有共享结构的孤立任务上,Recuris 几乎没有或没有收益,而额外上下文本身反而可能损害性能。

在零售和航空领域,结合情景记忆和工作记忆可获得最强性能,相对于基础智能体的增益最大。仅工作记忆在零售领域带来显著提升,而仅情景记忆只增加少量不显著的增益。模型控制的调用变体仅在零售领域表现出显著但较小的改进。完整记忆组合在两个领域都优于所有其他变体,实现了最高成功率和相对于基础智能体的最大置信区间改进。仅工作记忆在零售领域带来大幅显著增益,而仅情景记忆在两个领域都只产生边际且不显著的改进。模型控制的调用仅在零售领域测试,相对于仅工作记忆或组合记忆变体,提供了显著但较小的提升。

当技能库保持固定时,决定何时调用技能的方法对性能的影响大于技能内容本身。Recuris 为每个草拟的状态变更调用提供匹配的一个技能,优于每次都将所有技能注入上下文的模型控制变体,尽管两者使用逐字节相同的技能体。优势主要在覆盖率而非速度上,因为首次正确写入的中位轮次在所有配置中相同。Recuris 达到 82.4% 的必需写入召回率,而模型控制为 61.1%;任务成功率为 83.6%,而模型控制为 65.6%。将整个技能库放入上下文并让模型自行决定何时使用,得分低于完全没有技能的配置(任务成功率 65.6% 对 82.0%)。所有配置中首次正确写入的中位轮次均为 18,表明调用控制影响是否发出写入,而非写入速度。Recuris 的每个回合遗漏必需写入率最低(0.121),每次成功的 agent token 数最低(101k),而模型控制在两项上均为最高(0.417 和 147k)。

框架产生的结构化轨迹使组件故障可观察,宏召回率从仅结果的 13.0% 和原始轨迹的 37.0% 跃升至结构化轨迹的 64.8%。增益集中在对话记录中不可见的故障上,例如调用和工作记忆故障,而技能内容故障的增益最小,因为这些故障已出现在对话中。精确率也显著提高,表明轨迹有助于避免将故障错误归因到错误组件。仅结果的证据得分低于常数答案基线,原始轨迹勉强超过基线,而结构化轨迹几乎使基线翻倍。没有结构化轨迹时,调用故障从未被检测到,而结构化轨迹在 38.9% 的情况下检测到调用故障。工作记忆故障召回率从原始轨迹的 50.0% 提升到结构化轨迹的 83.3%。技能内容故障的增益最小,从 61.1% 提升到 72.2%,这与该故障在对话记录中可见的事实一致。宏精确率从 27.6% 提升到 64.4%,表明轨迹减少了对技能组件的错误指控。

技能记忆的递归进化持续提升保留集任务性能,相对于共享的起始记忆,增益在多次运行和多种实现中约为 9 到 17 个百分点。第二轮进化进一步叠加增益,而没有接纳候选的后续轮次没有显著改进。仅当保留任务包含记忆所修复的失败类型时才会发生迁移,这体现在成功包在保留任务上近乎普遍的调用,而航空特定谱系在没有此类失败残留的任务上没有增益。所有达到保留任务的包相对于起始记忆提升 9 到 17 个百分点,置信区间排除零。第二轮进化增加进一步增益,而后续没有循环内候选接纳的轮次没有显著改进。成功包的进化记忆在 86 个保留任务中的 78 到 86 个上被调用,表明是主动检索而非通用提示效应。唯一保留调用为零的包未能超过起始记忆,这强调了迁移取决于实际技能使用。航空特定谱系在缺乏已修复失败类型的任务上评估,没有显著增益且调用率较低。

Recuris 在大多数模型-基准组合上持续提升任务成功率,最大增益出现在跨任务共享结构的基准上,例如零售和技能发现,而在孤立任务上几乎没有收益。结合情景记忆和工作记忆可获得最强性能,仅工作记忆贡献显著增益,而仅情景记忆只增加边际改进。当技能库固定时,决定何时调用技能的方法比技能内容更重要,因为 Recuris 优于每次将所有技能注入上下文的模型控制变体。框架产生的结构化轨迹使组件故障可观察,显著提升故障召回率和精确率,尤其是对话记录中不可见的故障,技能记忆的递归进化持续提升保留集任务性能,增益随轮次叠加,迁移取决于实际技能使用。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供