HyperAIHyperAI

Command Palette

Search for a command to run...

15 小时前
Agent
LLM

从记忆到技能:面向长程大语言模型智能体的证据驱动协同演化治理

摘要

现有面向长程大语言模型智能体的记忆系统通常将历史轨迹作为被动上下文进行检索,而非将其转化为可执行的能力。本文提出 MSCE,一种无需训练的“记忆–技能协同演化”框架,将智能体经验组织为有依据的步骤轨迹、可复用的程序化策略和声明式环境认知。MSCE 将具有正向估计收益且受证据支持的 L2 策略固化为可调用技能,这些技能保留证据链接、适用边界、决策指引、验证规则和可靠性估计。该框架进一步引入反思加权价值回填机制,通过稠密的局部自反思传播稀疏的终端反馈,生成经证据校准的轨迹价值,用于治理记忆与技能的演化。在 EvoAgentBench 和 LoCoMo 上的实验表明,MSCE 显著优于当前最先进的技能增强和记忆驱动智能体基线,展现出强大的跨领域迁移能力和终身演化能力。

一句话总结

来自MemTensor、中国科学技术大学及合作机构的研究团队提出MSCE,一个无需训练的Memory–Skill协同演化框架。该框架将agent经验转化为有证据支撑、可调用的技能,并利用反思加权价值回填机制来管理记忆与技能的演化,在EvoAgentBench和LoCoMo上显著优于基线方法,同时展现出强大的跨领域迁移能力。

核心贡献

  • MSCE是一个无需训练的框架,它将agent经验组织为三级记忆层级:有根基的轨迹、可复用的策略和环境认知,并将有证据支撑、具有正向收益的策略提升为可调用的技能,这些技能包含适用边界、决策指导、验证规则和可靠性估计。
  • 该框架引入反思加权价值回填机制,通过密集的局部自反思来传播稀疏的最终反馈,从而产生经过证据校准的轨迹价值,用于管理记忆保留和技能演化。
  • 在EvoAgentBench和LoCoMo上的实验表明,MSCE显著优于当前最先进的技能增强和记忆驱动基线,并展现出强大的跨领域迁移能力和终身演化能力。

引言

大语言模型agent越来越多地承担长周期、多步骤的交互任务,这需要持久化记忆来保持连贯性、实现个性化行为,并在不同会话间复用经验。现有的记忆系统通常存储事实日志或经验摘要,但将这些记录视为被动上下文,agent必须反复进行推理,导致token数量膨胀并错失自动化机会。虽然技能提供了一种更可执行的可复用知识形式,但直接从原始轨迹中提炼技能并不可靠,因为轨迹中包含失败尝试、稀疏反馈和特定环境的噪声,会导致脆弱的过拟合。作者提出MSCE,一个无需训练的memory–skill协同演化框架,引入受管理的三级记忆层级(轨迹、策略和环境认知)以及反思加权价值回填机制。该设计将嘈杂的交互历史转化为可验证的抽象,并仅将有证据支撑、稳定的程序化模式提升为可部署的技能,从而弥合了被动检索与主动技能执行之间的鸿沟。

方法

作者提出MSCE,该框架维护一个受管理的记忆层级和一个下游技能库,以实现可追溯、有证据支撑的技能获取和调用。

参考框架图:

如下图所示,系统维护一个记忆层级 M=(M(1),M(2),M(3))\mathcal{M} = (\mathcal{M}^{(1)}, \mathcal{M}^{(2)}, \mathcal{M}^{(3)})M=(M(1),M(2),M(3)),其中L1轨迹保存可审计的证据,L2策略抽象出可修订的程序,L3环境认知存储声明式环境知识。技能库 K\mathcal{K}K 位于该记忆层级下游,提供已验证的程序供调用。这种分离使得技能可以追溯到证据,同时防止轨迹、策略、环境事实和可调用动作被合并到一个不受控制的池中。

三级受管理记忆 L1轨迹记忆存储在交互过程中收集的有根基的决策单元:

fi,t(1)=(si,t,ai,t,oi,t,ρi,t,V(fi,t(1)))f_{i, t}^{(1)} = (s_{i, t}, a_{i, t}, o_{i, t}, \rho_{i, t}, V(f_{i, t}^{(1)}))fi,t(1)=(si,t,ai,t,oi,t,ρi,t,V(fi,t(1)))

其中 si,ts_{i, t}si,tai,ta_{i, t}ai,toi,to_{i, t}oi,tρi,t\rho_{i, t}ρi,t 分别表示第 ttt 步的语义状态、动作、观察和自反思。轨迹价值 V(fi,t(1))V(f_{i, t}^{(1)})V(fi,t(1)) 初始化为不可用,并在最终反馈到达后填充。L1作为证据层;更高级的记忆和技能必须保持与其支撑轨迹的链接。为了限制存储并降低隐私风险,MSCE存储归一化证据,而非无限制的原始观察。

L2策略记忆存储从反复出现的轨迹证据中归纳出的可复用策略:

f(2)=(ϕ,π,κ,B,{f(1)})f^{(2)} = (\phi, \pi, \kappa, \mathcal{B}, \{f^{(1)}\})f(2)=(ϕ,π,κ,B,{f(1)})

其中 ϕ\phiϕ 是触发条件,π\piπ 是自然语言程序,κ\kappaκ 指定验证或回退标准,B\mathcal{B}B 记录适用边界,{f(1)}\{f^{(1)}\}{f(1)} 是支撑的L1证据集。当一个有价的L1轨迹满足 V(fi,t(1))vminV(f_{i, t}^{(1)}) \geq v_{\min}V(fi,t(1))vmin 时,触发策略提取。合格的轨迹使用嵌入相似度和结构化证据与现有L2策略进行匹配。如果没有策略匹配,该轨迹进入候选池。仅当同一特征桶中收集了来自至少 nminn_{\min}nmin 个不同回合的证据时,才归纳出一个新的L2策略。对于每个被触及的策略,MSCE计算一个启发式效用增益:

G(f(2))=VˉwithVˉblend(Swithout)G(f^{(2)}) = \bar{V}_{\mathrm{with}} - \bar{V}_{\mathrm{blend}}(S_{\mathrm{without}})G(f(2))=VˉwithVˉblend(Swithout)

该增益决定一个策略是保持活跃、有资格进行技能结晶,还是被退役。

L3环境认知记忆将环境层面的认知压缩为:

f(3)=(E,I,C,{f(2)})f^{(3)} = (\mathcal{E}, \mathcal{I}, \mathcal{C}, \{f^{(2)}\})f(3)=(E,I,C,{f(2)})

其中 E\mathcal{E}EI\mathcal{I}IC\mathcal{C}C 分别是实体或结构事实、动作响应规律和环境约束,每一项都链接到支撑的L2策略。与L2策略不同,L3描述的是特定环境如何组织。当多个活跃策略共享一个领域上下文时,触发抽象化,提取声明式事实,同时排除命令式程序指令。

技能结晶与调用 技能是从合格的L2策略派生出的可调用对象:

k=(ϕ,π,κ,B,A,D,η)k = (\phi, \pi, \kappa, \mathcal{B}, \mathcal{A}, \mathcal{D}, \eta)k=(ϕ,π,κ,B,A,D,η)

它继承了L2的触发条件、程序、验证规则和边界,并增加了证据锚点 A\mathcal{A}A、决策指导 D\mathcal{D}D 和可靠性 η\etaη。技能提升需要两道门槛:源L2策略必须满足正向增益条件 G(f(2))>θGG(f^{(2)}) > \theta_GG(f(2))>θG,并且必须是稳定的。结晶提示以策略、证据锚点、工具白名单和决策指导种子为条件。一个确定性验证器检查模式、强制证据根基,并运行轻量级覆盖测试。未通过任何检查的草稿将被丢弃。

部署后,MSCE使用平滑成功率估计技能可靠性:

η=npass+1ntrial+2\eta = \frac{n_{\mathrm{pass}} + 1}{n_{\mathrm{trial}} + 2}η=ntrial+2npass+1

高可靠性技能进入主动检索。在推理过程中,如果上下文匹配某个L3认知,检索到的L3事实提供环境先验,用于实例化参数和解释适用边界,而不会覆盖技能程序。

通过双信号价值回填进行在线更新 MSCE通过密集的步级反思和稀疏的最终反馈来更新外部认知状态 Ci=(M(1),M(2),M(3),K)i\mathcal{C}_i = (\mathcal{M}^{(1)}, \mathcal{M}^{(2)}, \mathcal{M}^{(3)}, \mathcal{K})_iCi=(M(1),M(2),M(3),K)i。为了将稀疏的最终反馈 RiR_iRi 分配到每个步级轨迹,最终步继承此值:V(fi,Hi(1))=RiV(f_{i, H_i}^{(1)}) = R_iV(fi,Hi(1))=Ri。对于更早的步骤,MSCE应用反思加权价值回填:

V(fi,t(1))=αi,tRi+(1αi,t)γV(fi,t+1(1))V(f_{i, t}^{(1)}) = \alpha_{i, t} R_i + (1 - \alpha_{i, t}) \gamma V(f_{i, t+1}^{(1)})V(fi,t(1))=αi,tRi+(1αi,t)γV(fi,t+1(1))

其中 γ[0,1)\gamma \in [0, 1)γ[0,1) 是折扣因子,αi,t\alpha_{i, t}αi,t 是反思权重。高 α\alphaα 步骤为最终结果提供局部信息丰富的证据。权重 α\alphaα 基于自反思 ρi,t\rho_{i, t}ρi,t 及其局部上下文进行估计。在一个回合结束后,MSCE回填步级价值,关联或归纳L2策略,触发L3抽象,并将合格的策略结晶为技能。

实验

评估使用EvoAgentBench进行多领域技能自演化,使用LoCoMo进行长期对话记忆,在相同的工具访问和交互预算下,将MSCE与基于记忆和轨迹到技能的基线方法进行比较。MSCE在所有EvoAgentBench领域均取得最佳的Pass@1,同时在大多数设置下降低了推理成本,并展现出可迁移的跨领域增益和单调的终身改进,证明了“使用中学习”的有效性。消融结果证实,层级化记忆、技能结晶、价值校准的适用性过滤和反思加权学习共同推动了这些性能和效率的提升。

MSCE在所有五个EvoAgentBench领域均取得最佳或并列最佳的Pass@1,以显著优势超越最强的非MSCE基线,尤其是在软件工程领域取得了15.39个百分点的提升。在代码任务上,它以几乎一半的成本达到了与最佳基线相当的准确率,并且在其他领域成本保持竞争力或有所改善,这证实了增益并非以过高的推理预算为代价。MSCE在每个领域均获得最高或并列的Pass@1,在软件工程上领先最佳非MSCE基线15.39个百分点。在代码任务上,MSCE以61.54%的Pass@1与最佳基线持平,但将成本从3.9轮降至2.0轮。在信息检索、数学、代码和知识工作方面,与最强非MSCE基线相比,成本均有所降低,尤其在数学和代码任务上降幅显著。

MSCE在LoCoMo上取得了最佳的整体评分和F1值,分别以2.01和1.18个百分点的优势超越最强基线SkillFlow-Evolve。它还在单跳、多跳和时序推理问题上获得最高分,而在排除Vanilla Agent后,EverOS在开放域问题上表现最佳。层级化记忆设计有助于保留事实证据并抽象出长程依赖关系。MSCE在整体评分上超越SkillFlow-Evolve 2.01个百分点,在F1上超越1.18个百分点。MSCE在单跳、多跳和时序推理上领先;EverOS在开放域问题上表现最佳(排除Vanilla Agent)。

移除完整MSCE方法中的任何组件都会降低准确率或效率,这证实了层级化记忆、技能结晶和适用性过滤都对性能有贡献。扁平记忆变体在Pass@1上下降幅度最大,并在代码任务上产生最高成本,而禁用技能结晶则在每个领域都降低了Pass@1并增加了成本。每项消融实验都表明,有效的复用不仅依赖于简单的检索过去经验,而在于共同组织、选择和完善技能。扁平记忆使信息检索、数学推理和软件工程的Pass@1下降超过15个百分点,并将代码实现的成本从2.0轮几乎增至三倍,达到5.3轮。移除技能结晶导致最一致的组件级性能下降,在所有五个领域中Pass@1降低6.15至11.54个百分点,并在每个领域都增加了成本。禁用价值校准在每个领域都降低了Pass@1并增加了成本,表明适用性感知的过滤可以防止有害的技能注入。所有消融实验的性能均低于完整MSCE,层级化抽象、技能结晶和校准选择对于保持准确率和效率都至关重要。

MSCE在五领域EvoAgentBench和LoCoMo长上下文推理基准上进行了评估,并通过消融研究剖析了其组件。它在所有EvoAgentBench领域均取得最佳Pass@1,尤其是在软件工程领域有15个百分点的提升,同时降低了代码及其他任务的推理成本,并在LoCoMo的整体评分和F1值上领先,得益于用于处理长程依赖关系的层级化记忆,在单跳、多跳和时序推理上表现卓越。移除任何组件(层级化记忆、技能结晶或适用性过滤)都会显著降低准确率和效率,证实了它们的联合设计对于有效且经济高效的技能复用至关重要。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供