HyperAIHyperAI

Command Palette

Search for a command to run...

ACM:面向长周期任务的智能体上下文管理

Xiaochuan Li Ryan Ming Meng Chu Shuai Shao Rong Jin Chenyan Xiong

摘要

智能体任务本质上具有长周期和多轮交互的特点,在与环境交互过程中会不断累积上下文。现有的上下文压缩方法不可避免地会造成信息丢失,且由僵化的启发式规则触发,导致其与智能体不断变化的推理焦点错位。我们提出智能体上下文管理(Agentic Context Management,ACM)框架,为智能体配备专门构建的上下文编辑工具,以实现无损的上下文管理。受人类短期记忆与长期记忆交互方式的启发,智能体自主决定何时压缩上下文,将丢弃的内容卸载到外部记忆系统,并按需查询以供后续检索。在此框架基础上,我们进一步开发了一套后训练流程,用于构建高质量的上下文管理示例,并提升模型在智能体搜索和编码任务上的表现。进一步分析表明,有效的上下文管理能够降低峰值令牌压力,支持更广泛的探索,并在独立试验中产生更一致的解决方案。

一句话总结

卡内基梅隆大学和Meta的研究人员提出了Agentic Context Management (ACM),这是一个为agent配备无损上下文编辑工具的框架,用于自主的、受记忆启发的压缩与检索,并通过一个后训练流水线证明ACM能降低峰值token压力、扩展探索范围,并提升在agent搜索和编码任务上的一致性。

核心贡献

  • 提出了Agentic Context Management (ACM)框架,为语言模型agent提供显式的无损压缩与检索上下文工具,用agent自主发起的决策取代外部模块或固定启发式规则。
  • 一个带有双重约束的教师引导后训练流水线能生成高质量的上下文管理演示,使模型能够在无需繁重强化学习的情况下学会何时压缩、何时克制。
  • 在agent搜索和编码基准上的实验表明,ACM优于ReAct和基于摘要的基线方法,进一步分析显示其降低了峰值token压力、延长了探索视野,并在多次独立试验中产生更一致的解。

引言

处理复杂、长周期任务的大语言模型 (LLM) agent 会生成冗长的历史记录,其中混合了推理轨迹和嘈杂的工具输出。这些历史记录经常超出实际的上下文限制,即使对于名义上具有大上下文窗口的模型,也会导致性能下降。先前的缓解策略包括长上下文预训练(仍会退化)、混合注意力(仍受窗口限制),以及依赖固定外部规则而非模型自身推理的启发式上下文压缩流水线。

作者提出了Agentic Context Management (ACM),这是一个为agent提供显式记忆工具的框架,使其能够自主决定何时总结并将无关信息卸载到外部存储,以及何时检索这些信息。他们进一步引入了一个带有双重约束的教师-学生后训练流水线,教导模型何时调用以及何时避免上下文管理动作。这种方法减少了峰值token使用量,扩展了测试时的探索范围,并在多次独立试验中产生更一致的解。

数据集

作者通过一个教师引导的流水线构建训练数据集,旨在教导模型何时调用上下文管理工具。数据是从学生模型的 rollout 和教师标注中动态生成的,而非从静态来源收集。

数据集构成与来源

  • 数据集由学生模型在需要上下文管理的任务上的轨迹构建。
  • 一个来自同一模型家族的教师模型在两种互补的约束下对这些轨迹进行标注。
  • 最终的训练集将教师标注的数据与重新采样的原始学生 rollout 混合,以增强稳定性。

每个子集的关键细节

  • 注入数据(H⁻ rollout): 学生在没有上下文管理工具的情况下完成任务。教师使用引导提示,识别出压缩会有益的轮次(例如,冗余查询、无产出的循环、积累了足够的上下文),并插入一个带有推理轨迹的上下文管理动作。
  • 精炼数据(H⁺ rollout): 学生在有上下文管理工具的情况下完成任务。教师识别出学生过早或不必要的压缩调用轮次,并将其替换为更有产出的动作(例如,搜索证据、打开文档、给出答案),同样带有推理轨迹。
  • 重新采样的 rollout: 原始学生轨迹以自蒸馏的方式被重新采样并混合进来,以稳定训练。

论文如何使用数据

  • 学生通过在线策略蒸馏进行训练:教师为 rollout 中所有的助手token位置提供软的下一个token分布(top-K,K=20)。
  • 损失函数仅应用于助手生成的token;系统提示、用户输入和工具输出的token被屏蔽。
  • 此目标共同教导学生何时调用上下文管理以及何时克制。

处理细节

  • 质量过滤: 拒绝采样只保留学生未能成功完成所有试验的轨迹,将学习重点放在真正具有挑战性的问题上。内容过滤器验证教师的推理轨迹没有泄露参考答案的信息;标注必须引用轨迹层面的线索(冗余查询、循环模式、充分证据),而不能透露目标答案。
  • 裁剪策略: 不适用;数据来自完整的模型 rollout。
  • 元数据构建: 每个被标注的轮次包含一个替换动作和一个证明其决策合理性的推理轨迹。

方法

作者将agent交互形式化,其中agent πθ\pi_{\theta}πθ 基于累积的历史 Ht={s,(a1,o1),,(at1,ot1)}H_t = \{s, (a_1, o_1), \dots, (a_{t-1}, o_{t-1})\}Ht={s,(a1,o1),,(at1,ot1)} 生成一个动作 atπθ(Ht)a_t \sim \pi_{\theta}(\cdot \mid H_t)atπθ(Ht),环境返回一个响应 otπγ(Ht;at)o_t \sim \pi_{\gamma}(\cdot \mid H_t; a_t)otπγ(Ht;at)。当agent选择结束动作或达到上下文窗口限制时,交互终止。与最终会触及上下文限制的 ReAct 范式,或当使用量超过预定义阈值时由外部监视器强制压缩并丢弃原始消息的 Summary Agent 范式不同,所提出的 Agentic Context Management (ACM) 框架允许agent自主管理其上下文。

受人类认知的启发,ACM agent利用两个上下文管理工具来模拟短期和长期记忆机制。manage_context 工具将之前的轮次压缩成简洁的摘要,并将原始消息卸载到磁盘上的外部文件,而 query_memory 工具允许agent查询存储的原始消息以精确检索信息。当agent调用 manage_context 时,一个摘要生成 LLM 会压缩直到上一个摘要边界的所有消息。至关重要的是,原始消息被保存在外部存储中,并通过一个唯一标识符映射到摘要。当agent需要重新访问早期内容时,它使用指定的标识符调用 query_memory,一个查询 LLM 会返回相关信息。此设计确保了无损信息压缩和agent发起的上下文管理,允许agent在推理过程中的任何时刻调用压缩,而不是依赖于固定的时间表。

为了解决确定上下文管理适当时机的挑战,作者设计了一个带有双重约束的教师引导数据生成流水线。该流水线采用了一个分两个阶段运作的教师-学生框架。

在第一阶段,学生 Rollout,学生模型在两种条件下完成任务:有和没有上下文管理工具,分别产生记为 H+H^+H+HH^-H 的轨迹。H+H^+H+ 捕获了学生对工具未经训练的使用行为,而 HH^-H 反映了其普通的探索行为。在第二阶段,教师标注,教师模型接收引导指令提示 P+P^+P+PP^-P 以及相应的学生轨迹和参考答案 AA^*A。教师在两种互补的约束下生成标注。对于 HH^-H 上的注入,使用 P+P^+P+ 的教师识别出上下文管理会有益的轮次,例如当学生开始查询冗余主题或进入无产出的循环时,并将该动作替换为上下文管理工具调用 ata_t'at。对于 H+H^+H+ 上的精炼,使用 PP^-P 的教师识别出学生过早或不必要的上下文管理调用轮次,将不适当的调用替换为更有产出的动作 ata_t'at,例如搜索额外证据。

然后,使用在线策略蒸馏对学生进行训练。来自同一模型家族的一个更强的教师为每个学生生成的助手token标注一个软的下一个token分布。学生被优化以在 rollout 中的所有助手token位置上匹配这些教师分布,使用以下损失函数:

LACM(θ)=Eτπθ[tTa(τ)vVpT(vs;h<t)logπθ(vs;h<t)].\mathcal{L}_{\mathrm{ACM}}(\theta) = - \mathbb{E}_{\tau \sim \pi_{\theta}} \Bigg[ \sum_{t \in \mathcal{T}_a(\tau)} \sum_{v \in \mathcal{V}} p_{\mathrm{T}}(v \mid s; h_{<t}) \log \pi_{\theta}(v \mid s; h_{<t}) \Bigg].LACM(θ)=Eτπθ[tTa(τ)vVpT(vs;h<t)logπθ(vs;h<t)].

其中 τ\tauτ 是从学生策略中采样的轨迹,Ta(τ)\mathcal{T}_a(\tau)Ta(τ) 表示助手token位置的集合,V\mathcal{V}V 包含教师在位置 ttt 的 top-K 候选token。分布 pT(s;h<t)p_{\mathrm{T}}(\cdot \mid s; h_{<t})pT(s;h<t) 表示在 V\mathcal{V}V 上受限并重新归一化的教师概率,而 πθ(s;h<t)\pi_{\theta}(\cdot \mid s; h_{<t})πθ(s;h<t) 表示学生的下一个token分布。损失函数应用于所有学生生成的助手token,而系统提示、用户输入和工具输出的token被屏蔽。

为确保数据质量,作者应用了两种过滤机制。拒绝采样只保留学生未能成功完成所有试验的轨迹,确保学生从教师在真正具有挑战性问题上的行为中学习。内容过滤器验证教师的推理轨迹没有泄露参考答案 AA^*A 的信息,鼓励模型从轨迹结构中识别值得压缩的模式,而不是记忆依赖于答案的线索。最后,为了稳定训练,从学生的原始 rollout 中重新采样轨迹,并与教师标注的数据混合。

实验

评估使用了三个长周期基准(BrowseComp-Plus、DeepSearchQA、SWE-Bench Verified),以 Qwen3.5-9B 作为学生模型,并使用一个大得多的教师进行在线策略蒸馏。ACM框架使agent能够主动压缩上下文,其性能已优于 ReAct、基于摘要的和基于记忆的基线;在精心策划的上下文管理数据上进行后训练带来了27%的相对增益,并几乎匹敌大40倍的模型。行为分析显示,ACM agent在上下文限制之前就触发了压缩,显著降低了峰值token使用量,同时实现了更多探索性的工具调用,并且该方法通过使正确的解更可靠,缩小了 Pass@1 和 Pass@4 之间的差距。消融研究证实,专用的上下文管理数据和教师蒸馏是互补的,并且一个案例研究展示了模型自我监控、重读压缩历史,并在一个222K token的轨迹中维持一个紧凑的工作窗口。

ACM独特地结合了主动压缩、可训练策略、无损存储、agent发起的触发器以及开源训练数据,这与之前的方法不同,那些方法都缺少这些属性中的一项或多项。在上下文管理数据上进行后训练显著提高了可靠性(Pass@1 和 Pass^4)并缩小了与 Pass@4 的差距,同时也增加了压缩和检索工具调用的频率。将合成的上下文管理数据与通用蒸馏相结合能产生最佳的整体性能,因为这两个来源提供了互补的技能。ACM是唯一一个同时具备紧凑、可训练、无损、agent发起,并在开源数据上训练的方法。先前的记忆增强方法跨任务积累知识,但不会在单个回合内压缩工作上下文。在上下文管理数据上进行后训练显著提高了 Pass@1 和 Pass^4,使正确的解更可靠,而不仅仅是扩展能力边界。单独的 GPT-5.5 蒸馏未能在agent搜索上超越经过后训练的 ACM agent,而专用的上下文管理数据在各项任务中都带来了一致的增益。将蒸馏与上下文管理数据相结合能产生最佳的整体性能,表明这两个来源是相互增强的。ACM后训练增加了 manage_context 和检索工具调用的频率,从而能够更广泛地探索推理路径。在一个案例研究中,模型进行自我监控,仅在真正的内存压力下进行压缩,将压缩与内存探测交错进行,同时将工作窗口保持在远低于限制的水平。

为agent配备ACM框架能提升其相对于基线的性能,而在上下文管理数据上进行后训练带来了进一步的增益,包括在 BrowseComp-Plus 上27%的相对改进。该方法使较小的模型能够通过增加工具调用更有效地探索,同时降低峰值token使用量,从而减少推理负担和 KV-cache 开销。配备ACM的agent在没有后训练的情况下超越了所有基线,证明了agent发起的上下文管理的有效性。在上下文管理数据上进行后训练,在 BrowseComp-Plus 上带来了27%的相对增益,并接近大40倍的开源模型的性能。较小的agent模型更依赖通过工具调用来探索以解决问题,而上下文管理使它们能够有效地探索。在ACM框架下,峰值token使用量显著降低,尤其是与 Summary Agent 相比,减少了模型推理负担和服务器 KV-cache 开销。在上下文管理数据上进行后训练,通过保持上下文干净和组织良好,显著提高了 Pass@1 和多次试验间的一致性。

将来自强大教师的蒸馏轨迹与合成的agent上下文管理数据相结合,在各项任务中产生了最佳的整体性能,尽管这两个来源贡献了互补的优势。单独的上下文管理数据能持续提高性能并增加用于探索的工具使用量,而单独的蒸馏在搜索任务上可能表现不如基础agent。结果表明,专用的上下文管理训练是必要的,并且蒸馏和ACM数据是相互增强的。单独添加ACM数据在所有三项任务上都提高了基础模型的 pass@1,而单独蒸馏则降低了 BrowseComp-Plus 和 DeepSearchQA 上的 pass@1。ACM训练显著增加了搜索任务上每个回合的平均工具调用次数,+ACM 变体在 BrowseComp-Plus 上发出了46.2次工具调用,而基础模型为30.8次。单独蒸馏降低了 DeepSearchQA 上的峰值token数,但提高了 BrowseComp-Plus 上的峰值token数,而单独ACM则相对于基础模型降低了两个搜索基准上的峰值token数。将蒸馏与ACM相结合,在 BrowseComp-Plus 和 SWE-Bench Verified 上达到了最高的 pass@1,但在 DeepSearchQA 上略低于单独ACM。

评估将 Active Context Management (ACM) agent 与基线在agent搜索和软件工程任务上进行了比较。ACM独特地集成了主动压缩、可训练策略、无损存储、agent发起的触发器以及开源训练数据。在合成的上下文管理数据上进行后训练显著提高了可靠性和一致性,而将此数据与来自强大教师的通用蒸馏相结合能产生最佳的整体性能,因为这两个来源提供了互补的技能。ACM框架使较小的模型能够通过增加工具调用更有效地探索,同时降低峰值token使用量和 KV-cache 开销。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供