Command Palette
Search for a command to run...
MemTrapBench:评测大语言模型记忆使用中的认知陷阱
MemTrapBench:评测大语言模型记忆使用中的认知陷阱
Mengru Wang Haozhe Luo Zhenqian Xu Zhixiang Cui Haoming Xu Qu Yang Jizhan Fang Junfeng Fang Ningyu Zhang
摘要
记忆已成为大语言模型的关键组成部分,使其能够保留信息并从长期交互中学习。然而,现有的记忆评测基准主要评估信息是否被正确提取、存储和检索,却在很大程度上忽略了检索到的记忆如何重塑模型推理并影响当前任务的表现。我们识别出记忆引发的认知陷阱:即使是被忠实记录且语义相关的记忆,也可能扭曲模型的推理或信念,并降低当前任务的表现。为系统性地评估这些失效模式,我们引入了 MemTrapBench,它涵盖两类认知陷阱:推理固着与信念扭曲。在两个模型家族和五种代表性记忆框架上的实验表明,MemTrapBench 具有挑战性:所有被评估的记忆策略均不及无记忆设定,即使是最强的方法也出现了超过 10% 的性能下降。为缓解这些认知陷阱,我们提出了 AdaptiveMem,这是一种简单而有效的推理时方法,通过指示大语言模型规避记忆陷阱来工作。AdaptiveMem 在 MemTrapBench 上减轻了认知陷阱,同时在多种记忆框架的标准记忆评测基准上保持或提升了性能。
一句话总结
浙江大学、新加坡国立大学、东北大学、赫瑞瓦特大学和腾讯的研究人员提出了 MemTrapBench,一个针对记忆诱发认知陷阱的基准,涵盖推理固着(Reasoning Fixation)和信念扭曲(Belief Distortion);实验表明,在两个模型家族和五个代表性记忆框架上,所有被评估的记忆策略均不如无记忆设置,即使最强方法也下降超过 10%;并提出 AdaptiveMem,一种推理时方法,可在 MemTrapBench 上缓解这些认知陷阱,同时在标准记忆基准上保持或提升性能。
核心贡献
- 对记忆诱发的认知陷阱进行了形式化,即忠实记录且语义相关的记忆可能扭曲模型推理或信念,并降低当前任务性能。
- 引入 MemTrapBench,通过推理固着和信念扭曲评估这些陷阱;在两类模型家族和五种记忆框架上的实验表明,所有被评估的记忆策略均弱于无记忆设置,最强方法损失超过 10 个百分点。
- 提出 AdaptiveMem,一种基于提示的推理时方法,引导 LLM 在利用检索记忆之前识别并考虑记忆陷阱。它在不同记忆框架上提升 MemTrapBench 性能,例如在 Gemini-3-Flash-Preview 上将 LightMem 提升 14.9 个百分点,且不降低一般记忆性能。
引言
作者研究大语言模型记忆系统,其中从长交互历史中检索外部记忆以支持后续查询。此前基准和分析主要关注记忆管理失败,例如过时、错误或不相关的检索信息,却忽视了一个互补风险:即使是有效记忆也可能重塑模型推理并损害当前任务性能。论文表明记忆可能诱发认知陷阱,例如将模型锚定在之前成功的策略上,阻止其考虑新操作。为弥补这一空白,作者引入 MemTrapBench,涵盖推理固着和信念扭曲,并提出 AdaptiveMem,一种基于提示的技能,帮助模型在使用检索信息前检测并考虑潜在记忆陷阱。
数据集
作者将 MemTrapBench 用作诊断 LLM 中记忆诱发故障的基准。数据集由人工设计的种子实例扩展为多轮对话,再通过自动化和人工质量控制进行过滤。
- 构成与规模: MemTrapBench 包含 1,050 个实例,分为四类:350 个认知偏差、350 个任务边界、200 个安全和 150 个创伤。
- 实例结构: 每个种子实例指定四个字段:领域、陷阱机制、标准答案和植入先验。植入先验记录交互历史中引入的策略、反馈、规则或信念。
- 对话构建: GPT-5.4 将每个种子扩展为 18 到 40 轮对话,分三个阶段:植入陷阱、在噪声中掩埋、触发陷阱。最终查询仍与历史相关,但改变了先验应适用的条件。排除了“忽略之前的规则”等显式重置提示。
- 质量控制: 候选实例经过自动过滤和专家人工审核。检查涵盖主题连贯性、上下文一致性、交互真实性、独立可解性和上下文转换清晰度。标注者仅从查询判断转换。每个保留实例都标注金标准响应和预期失败模式。
- 使用方式: 基准比较有记忆和无记忆时的模型响应。记忆陷阱定义为记忆相对无记忆设置降低响应质量的情况。响应质量从正确性、格式、相关性和效率四个维度衡量。最终查询被设计为可独立回答,因此性能变化归因于记忆影响而非任务本身难度。
方法
作者提出 AdaptiveMem,一种简单而有效的提示技能,旨在缓解记忆诱发的认知陷阱。AdaptiveMem 使在不同记忆框架中运行的模型能够自适应地利用检索到的记忆,避免由其诱发的认知陷阱。它可以直接集成到各种记忆框架中,引导模型在推理时重新考虑应如何应用检索到的记忆。
为评估该方法有效性,作者从每个基准中随机抽取 200 个实例进行评估。如下图所示:
结果表明,在同一记忆框架中加入 AdaptiveMem 能够一致提升性能。在 MemTrapBench 上,AdaptiveMem 在 FullText、LightMem 和 EverMemOS 框架中均带来显著提升。例如,在 Gemini-3-Flash-Preview 上,提升分别达到 11.8、14.9 和 11.3 个百分点;在 Qwen3-30B-A3B-Instruct-2507 上,提升分别为 4.2、2.5 和 2.6 个百分点。在 LongMemEval 上,该方法在六个设置中的四个上有所改进,另两个保持不变,在 Gemini 和 Qwen 上分别最高提升 4.0 和 3.0 个百分点。这些结果表明,AdaptiveMem 可广泛集成到现有记忆框架中,在不降低典型记忆性能的情况下缓解认知陷阱。
实验
评估设置使用 MemTrapBench 基准,在两个模型上比较五种记忆策略与无记忆基线;该基准在多轮对话中嵌入推理固着和信念扭曲陷阱。所有记忆策略均相对基线降低性能,其中认知偏差和安全场景下降最严重;消融研究证实,导致失败的是设计陷阱而非历史本身的存在。增加记忆长度进一步放大效应,但轻量级自适应提示方法可以缓解陷阱诱发损害,而不影响标准记忆任务性能。
无记忆时,两个被评估模型均达到最高平均性能。所有记忆策略都降低整体性能,其中 EverMemOS 和 LightMem 分别在 Gemini 和 Qwen3-30B 上表现出记忆方法中最小的下降。最大降幅出现在认知偏差和安全任务中。与无记忆基线相比,加入任何记忆策略都会降低平均性能。在 Gemini 上,EverMemOS 在记忆策略中平均得分最高;在 Qwen3-30B 上,LightMem 领先,并在 Gemini 上位居第二。认知偏差和安全场景在记忆策略下性能下降最明显。
在一项配对案例研究中,两种设置都说明肾上腺素仅对某个既往患者不安全,然后询问一个没有禁忌症的不同儿童。没有创伤陷阱时,模型推荐肌内注射肾上腺素;但当历史中加入辱骂性负面反馈后,模型拒绝给出这一正确治疗。比较表明,失败由反馈诱发的回避驱动,而非医学背景。没有创伤陷阱时,模型对另一名无禁忌症的儿科患者给出肌内注射肾上腺素。有创伤陷阱时,同样历史加上辱骂性批评导致模型拒绝为新患者使用肾上腺素。保留患者信息但移除辱骂性反馈可显著提高正确性,表明该效应主要是反馈诱发的回避。
在保留任务和历史的情况下移除设计好的认知陷阱,性能恢复到接近或略高于无记忆基线,证实失败由陷阱而非记忆本身的存在引起。在创伤场景中,移除辱骂性反馈后正确率从 66.40% 恢复到 91.07%;在任务边界上,平均得分从 31.05% 升至 94.39%。无陷阱记忆在任务边界上略微提升性能(94.39% 对无记忆 92.29%),在创伤上几乎不变,说明额外的历史被正确处理。最大降幅出现在带陷阱记忆:任务边界平均下降超过 60 个百分点,创伤正确率下降约 26 个百分点,由反馈诱发的回避驱动。
当移除交互历史时,模型表现好得多;而即使保留少量记忆也会导致平均性能大幅下降。更长记忆长度与进一步下降相关,大部分额外下降发生在最短记忆设置和中点记忆设置之间。该模式在正确性、格式、相关性和效率上均成立。一旦引入记忆,性能退化最大;随着记忆长度增加,性能进一步单调下降。正确性和格式随记忆变长而稳步下降,相关性和效率虽然在完整记忆时略有上升,但总体趋势相同。
在正确性、格式、相关性和效率上,GPT-5.2 和 Claude-Sonnet-4.6 都一致给出无记忆时高于有记忆时的分数。GPT-5.2 的平均下降幅度大于 Claude-Sonnet-4.6,效率对两个评判模型都是下降最大的维度。记忆设置的评估也更不稳定,标准差更高,尤其集中在正确性上。两个评判模型在记忆条件下的分数下降方向和幅度一致。对两个评判模型而言,效率是受记忆设置影响最大的维度,正确性相对高于其他记忆设置维度。记忆设置分数波动更大,尤其是正确性;GPT-5.2 在各维度上的标准差均大于 Claude-Sonnet-4.6。
实验评估了各种记忆策略和认知陷阱下的模型性能,比较无记忆基线与引入交互历史的条件。无记忆时模型获得最高平均分数,加入任何记忆都会降低性能,尤其在安全和认知偏差任务中;但对照分析表明,下降由陷阱诱发的回避而非记忆本身引起。移除陷阱后性能恢复到接近基线,无陷阱记忆可略微改善任务边界处理。两个 LLM 评判模型在记忆设置下均一致给出较低分数,其中效率受影响最大,正确性波动最大。