MemFail:对LLM记忆系统故障模式的压力测试

arXiv cs.AI 论文

摘要

MemFail是一个诊断基准,通过形式化总结、存储和检索操作,并用对抗性设计的数据集进行评估,来隔离LLM记忆系统的故障模式。

arXiv:2605.26667v1 公告类型:new 摘要:大语言模型(LLM)代理越来越依赖外部记忆系统来在长期交互中保持一致,但很少有实证工作来了解这些系统呈现的特定故障模式和设计选择。现有基准报告聚合的问答准确率,并将记忆系统视为黑盒,从而无法将错误答案归因于系统的特定故障模式。我们介绍了MemFail,一个用于隔离现代LLM记忆系统故障模式的诊断基准。我们首先将记忆系统形式化为三个典型操作——总结、存储和检索——的组成,并识别每个操作可能引发的故障模式。基于这些假设的故障模式,我们构建了涵盖四个任务的五个数据集,每个数据集都经过对抗性设计,以测试记忆系统的特定操作。使用这些数据集,我们在MemFail上评估了四种最先进的记忆系统,并展示了如何利用MemFail从实证上理解由记忆系统架构差异引起的权衡。
查看原文
查看缓存全文

缓存时间: 2026/05/27 09:07

# MemFail:对LLM记忆系统故障模式的压力测试  
来源:https://arxiv.org/html/2605.26667  

Ishir Garg  
加利福尼亚大学伯克利分校  
ishirgarg@berkeley\.edu  
&  
Neel Kolhe  
加利福尼亚大学伯克利分校  
neelkolhe@berkeley\.edu  
Dawn Song  
加利福尼亚大学伯克利分校  
dawnsong@cs\.berkeley\.edu  
&  
Xuandong Zhao  
加利福尼亚大学伯克利分校  
xuandongzhao@berkeley\.edu  

###### 摘要  
大型语言模型(LLM)智能体越来越依赖外部记忆系统来在长时间交互中保持一致性,但现有的实证工作对于这些系统具体有哪些故障模式以及设计选择所引发的问题仍缺乏深入理解。现有基准测试报告的是整体的问答准确率,并将记忆系统视为黑箱,从而无法将错误答案归因于系统的某个特定故障模式。我们提出 **MemFail**,这是一个能够分离现代LLM记忆系统故障模式的诊断性基准测试。我们首先将记忆系统形式化为三个标准操作——摘要、存储和检索的组合,并识别每个操作可能引发的故障模式。基于这些假设的故障模式,我们构建了五个数据集,涵盖四个任务,每个任务都对抗性地设计用于测试记忆系统的特定操作。利用这些数据集,我们在 MemFail 上评估了四种最先进的记忆系统,并展示了 MemFail 如何用于实证理解不同记忆系统架构所引发的权衡。  

MemFail:对LLM记忆系统故障模式的压力测试  
Ishir Garg  
加利福尼亚大学伯克利分校  
ishirgarg@berkeley\.edu  
Neel Kolhe  
加利福尼亚大学伯克利分校  
neelkolhe@berkeley\.edu  
Dawn Song  
加利福尼亚大学伯克利分校  
dawnsong@cs\.berkeley\.edu  
Xuandong Zhao  
加利福尼亚大学伯克利分校  
xuandongzhao@berkeley\.edu  

https://github.com/ishirgarg/MemFail  

## 1 引言  
LLM智能体在长程任务上的能力迅速提升,但有限的上下文窗口使得它们难以随着时间保持一致性。传统的记忆系统,如检索增强生成(RAG)(Lewis et al., 2021 (https://arxiv.org/html/2605.26667#bib.bib16))和向量数据库,会存储原始对话历史,但当只有一部分内容值得记住时,这在存储和输入token上代价高昂,而且无法自然地遗忘或更新用户偏好变化后的旧信息。为此,越来越多的研究专注于 **LLM记忆系统**,为智能体配备外部存储器,使其能够在生命周期内进行读写和更新,从而实现一致且个性化的回应 (Chhikara et al., 2025 (https://arxiv.org/html/2605.26667#bib.bib9); Xu et al., 2025 (https://arxiv.org/html/2605.26667#bib.bib26); Liu et al., 2026 (https://arxiv.org/html/2605.26667#bib.bib18); Xu et al., 2026 (https://arxiv.org/html/2605.26667#bib.bib27); Rasmussen et al., 2025 (https://arxiv.org/html/2605.26667#bib.bib42); Hu et al., 2026a (https://arxiv.org/html/2605.26667#bib.bib43))。然而,压缩、更新和遗忘这些机制也引入了新的故障模式:系统可能在存储之前过度摘要对话,丢失关键细节,或者在出现矛盾信息时未能删除旧事实。  

先前的研究已经汇聚到几个关键需求上:仅检索对当前任务有用的记忆;忠实存储以保留原始体验的语义;可更新以覆盖过时事实并累积共存事实;低延迟以实现快速存储和检索;以及token效率以尽量减少智能体上下文中的token数量。然而,这些需求之间存在权衡:逐字存储所有对话(如简单RAG)的系统在忠实存储方面表现出色,但token效率低下;而将对话拆分成更小的记忆片段可以缩短检索到的上下文,但会使相关片段的查找变得更困难、更慢。  

尽管近来涌现出各种设计选择的记忆系统,但很少有工作刻画这些需求之间的 **权衡** 或背后的故障模式。现有基准测试将记忆系统视为端到端的黑箱,提供的整体指标掩盖了内部不同的故障模式。  

在本工作中,我们提出 **MemFail**,一个针对LLM记忆系统故障模式的基准测试。我们首先提出一个框架,将记忆系统形式化地表示为三个操作的组合:摘要、存储和检索。基于这一分类,我们假设任何符合此形式化的记忆系统都可能表现出不同的故障模式。MemFail 提供了五个数据集,涵盖四个任务,以引发这些故障模式:  

- **条件事实**:关键因果关系的忠实保留。  
- **人物检索**:在误导性问题下对小细节的忠实保留。  
- **长程跳转**:对长距离因果关系的检索。  
- **共存事实**:针对查询存储并检索所有相关的共存信息片段。  
- **条件事实(困难版)**:在摘要经验时保留关键的因果细节。  

我们在 MemFail 上评估了四种最先进的记忆系统——Mem0 (Chhikara et al., 2025 (https://arxiv.org/html/2605.26667#bib.bib9))、A-MEM (Xu et al., 2025 (https://arxiv.org/html/2605.26667#bib.bib26))、SimpleMem (Liu et al., 2026 (https://arxiv.org/html/2605.26667#bib.bib18)) 和 StructMem (Xu et al., 2026 (https://arxiv.org/html/2605.26667#bib.bib27))。我们的分析揭示了三个原本会被整体指标掩盖的发现。第一,没有单一系统占据主导:每种架构都有其独特的故障特征——基于图的 StructMem 在因果推理上表现出色,但在共存事实检索上崩溃,而 Mem0 则呈现相反的模式。第二,无论是增加检索记忆的数量,还是增强底层LLM的能力,带来的改进都很有限,在某些情况下甚至会导致性能下降,这表明当前系统受限于架构约束,而非模型智能或上下文预算。第三,token消耗与准确性之间的关系取决于具体任务:受摘要瓶颈限制的任务受益于冗长的记忆,而受检索瓶颈限制的任务则会因大型记忆污染嵌入空间而受损。基于这些发现,我们提出两个未被充分探索的方向——混合专家记忆架构和任务自适应的token缩放——作为缓解而非权衡上述需求的道路。  

## 2 相关工作  

**LLM记忆系统。** 越来越多的研究为LLM配备持久记忆。MemGPT 在操作系统的启发下,将上下文工作记忆与外部存储进行分页交换 (Packer et al., 2024 (https://arxiv.org/html/2605.26667#bib.bib20))。MemoryBank 对用户特定事实应用摘要和艾宾浩斯遗忘曲线 (Zhong et al., 2023 (https://arxiv.org/html/2605.26667#bib.bib29))。Mem0 将原子事实提取到混合向量和图存储中,并显式支持 ADD、UPDATE 和 DELETE 操作 (Chhikara et al., 2025 (https://arxiv.org/html/2605.26667#bib.bib9))。A-MEM 摒弃预定义模式,将记忆组织为智能体自主链接的笔记,由智能体动态标记和重组 (Xu et al., 2025 (https://arxiv.org/html/2605.26667#bib.bib26))。StructMem 构建层次化的事件级结构,并定期进行语义整合 (Xu et al., 2026 (https://arxiv.org/html/2605.26667#bib.bib27)),而 SimpleMem 则通过熵感知过滤和自适应检索实现语义无损压缩 (Liu et al., 2026 (https://arxiv.org/html/2605.26667#bib.bib18))。Reflexion (Shinn et al., 2023 (https://arxiv.org/html/2605.26667#bib.bib22)) 和 Generative Agents (Park et al., 2023 (https://arxiv.org/html/2605.26667#bib.bib21)) 探索了反思性记忆流,用于自我改进和社交模拟。它们共享我们的框架所抽象的基本操作——摘要、存储、检索——并且我们的基准测试可以接入任何暴露这些操作的系统。  

**LLM长上下文与记忆系统基准测试。** 两条正交的工作与我们的研究互补。ER-MIA (Piehl et al., 2026 (https://arxiv.org/html/2605.26667#bib.bib32))、InjecMEM (Tian et al., 2025 (https://arxiv.org/html/2605.26667#bib.bib24)) 和 SkillJect (Jia et al., 2026 (https://arxiv.org/html/2605.26667#bib.bib33)) 分别针对记忆增强型LLM、分层系统(如 MemoryOS (Kang et al., 2025 (https://arxiv.org/html/2605.26667#bib.bib12)))和智能体技能抽象发起记忆注入、提示注入和技能注入攻击,暴露的是对抗性而非良性故障。Needle-in-a-Haystack (Nelson et al., 2024 (https://arxiv.org/html/2605.26667#bib.bib34))、RULER (Hsieh et al., 2024 (https://arxiv.org/html/2605.26667#bib.bib35))、LongEval (Krishna et al., 2023 (https://arxiv.org/html/2605.26667#bib.bib13))、LongBench (Bai et al., 2024 (https://arxiv.org/html/2605.26667#bib.bib6))、L-Eval (An et al., 2024 (https://arxiv.org/html/2605.26667#bib.bib5)) 和 M4LE (Kwan et al., 2024 (https://arxiv.org/html/2605.26667#bib.bib14)) 对LLM自身的长上下文能力进行压力测试,而非构建在它们之上的记忆系统。在通用回忆方面,MemoryBank 将探测性问题与多日历史配对 (Zhong et al., 2023 (https://arxiv.org/html/2605.26667#bib.bib29));PerLTQA 针对个性化长期问答 (Du et al., 2024 (https://arxiv.org/html/2605.26667#bib.bib10));MemBench 涵盖事实性和反思性记忆,涉及参与和观察场景,并提供准确性、召回率、容量和时间效率指标 (Tan et al., 2025 (https://arxiv.org/html/2605.26667#bib.bib23));MemoryAgentBench 将长上下文数据集转化为增量任务,涵盖准确检索、测试时学习、长程理解和冲突解决四种能力 (Hu et al., 2026b (https://arxiv.org/html/2605.26667#bib.bib36));LoCoMo 提供多会话对话,涵盖单跳、多跳、时序、开放域、对抗、事件摘要和多模态任务 (Maharana et al., 2024 (https://arxiv.org/html/2605.26667#bib.bib19));LongDialQA 从电视剧本中提取多方对话 (Kim et al., 2025 (https://arxiv.org/html/2605.26667#bib.bib37))。在推理方面,MemSim (Zhang et al., 2024 (https://arxiv.org/html/2605.26667#bib.bib38)) 通过贝叶斯关系网络合成问答,MemoryBench 将评估重新定义为从模拟反馈中持续学习,区分陈述性记忆和程序性记忆 (Ai et al., 2026 (https://arxiv.org/html/2605.26667#bib.bib39))。少数工作明确针对故障:LoCoMo 包含用于拒答的误导性问题 (Maharana et al., 2024 (https://arxiv.org/html/2605.26667#bib.bib19));LongMemEval 整理了500个问题,涵盖信息抽取、多会话推理、时序推理、知识更新和拒答,并附带键值形式化模型 (Wu et al., 2024 (https://arxiv.org/html/2605.26667#bib.bib25))。然而,其模型不如我们的通用,且未讨论故障模式;StructMemEval 表明组织性提示有助于改善记忆组织 (Shutova et al., 2026 (https://arxiv.org/html/2605.26667#bib.bib40))。所有这些工作都将系统视为黑箱,报告的是整体端到端分数,无法将故障定位到摘要、存储、检索或推理——而 MemFail 则通过分离每个操作并分析故障模式及其权衡来填补这一空白。  

## 3 背景  
我们给出 MemFail 所假设的LLM记忆系统的形式化模型。该框架识别出任何符合该模型的系统可能表现出的自然故障模式,而 MemFail 正是为此进行测试而设计的。  

### 3.1 记忆系统的三个操作  

我们假设每个记忆系统都可以分解为三个操作。设 \(Q\) 表示用户查询,\(H\) 表示对话历史,\(M\) 表示当前的记忆数据库。  

- **检索**。给定新查询 \(Q\)、对话历史 \(H\) 和记忆状态 \(M\),系统从 \(M\) 中检索一组相关记忆 \(R\),并将其与 \(Q\) 和(可选的)\(H\) 一起插入到智能体的提示中。  
- **摘要**。在交互之后,\(H\) 被压缩成表示 \(H'\),提取出被认为值得保留的信息。  
- **存储**。存储步骤接收 \(H'\) 和现有记忆状态 \(M\),并产生更新后的记忆状态 \(M'\),可能覆盖、合并或追加到 \(M\) 中的现有条目,或者不执行任何操作。  

如表 1 (https://arxiv.org/html/2605.26667#S3.T1) 所示,这一分解涵盖了广泛的现代记忆系统,包括 Mem0、A-MEM、SimpleMem 和 StructMem,并反映了人类记忆的经典编码/存储/检索描述。  

**表 1**:每个受测记忆系统如何实现第 3 节 (https://arxiv.org/html/2605.26667#S3) 中所述的三个操作。  

### 3.2 故障模式  

基于我们对记忆系统的抽象模型,我们提出记忆系统会表现出四种自然故障模式:  

- **摘要故障**:摘要操作删除或错误地改变了 \(H\) 中的重要信息。例如,“我对花生有严重过敏”可能被压缩为“对花生过敏”,从而丢失了关键的下游推理所需的严重程度。  
- **存储故障**:存储步骤未能充分将 \(H'\) 整合到 \(M\) 中。这包括拒绝覆盖过时事实(例如,在用户表示 Dan 现在讨厌披萨后,未能更新“Dan 喜欢披萨”),以及拒绝接受有效的共存事实(例如,将“Dan 喜欢汉堡”视为与已存储的“Dan 喜欢披萨”矛盾而拒绝)。  
- **检索故障**:检索未能返回 \(R\) 中的相关记忆,或者返回了语义相似但在上下文中不合适的记忆。  
- **推理故障**:即使在正确记忆被检索到的情况下,智能体仍做出错误判断。请注意,这 **不是** 记忆系统的故障,但我们出于完整性考虑对其进行测量。  

先前的工作主要通过插入长对话历史并让LLM推断用户个性或偏好来评估所有四种模式的组合,而不加以区分。MemFail 包含专门设计的任务,用于分离模式(1)–(3),这些模式是现代记忆系统独有的,并且未被先前的基准测试所解决。  

### 3.3 与现有记忆系统的兼容性  

关键的是,一个好的基准测试应能在对系统内部细节做最小假设的情况下评估各种记忆系统。MemFail 评估任何暴露三个函数的系统:  

- **store_conversation(\(H\))**:将 \(H\) 存储在数据库中(涵盖摘要和存储)。  
- **retrieve_memories(\(Q, H, k\))**:返回与 \(Q\) 和 \(H\) 最相关的 \(k\) 个记忆。  
- **get_all_memories()**:返回当前存储的所有记忆。  

前两个函数是评估循环所必需的。第三个函数仅由 MemFail 的判断LLM用于诊断发生了哪种故障模式,并非记忆系统部署所必需。任何实现这三个函数的系统都可以自动接入我们的评估框架。  

## 4 基准测试详情  

MemFail 包含五个英文数据集,分为四个任务,每个任务假设用于分离第 3 节 (https://arxiv.org/html/2605.26667#S3) 中所述的某个故障模式。我们仅概述高层设计;完整规格、生成器提示、验证规则、去重阈值、采样池以及其他工作示例见附录 B (https://arxiv.org/html/2605.26667#A2)。  

##### 任务 1:条件事实  
目标:**摘要故障**——基于摘要的记忆系统在提交事实时剥离了限定条件。每行编码一条规则“实体 \(E\) 仅在条件 \(C\) 满足时表现出行为 \(B\)”,并将其嵌入到一篇 5–8 句的短文以及 4–7 个无关的非条件事实 a

相似文章

MemEvoBench:LLM 代理内存误演化基准测试

arXiv cs.CL

MemEvoBench 引入了首个用于评估 LLM 代理内存安全性的基准测试,衡量对抗性内存注入、噪声输出和有偏反馈在问答与工作流任务中导致的行为衰退。该研究表明内存演化是安全失败的重要因素,且静态防御措施不足以应对。

MemOps:长时对话中生命周期记忆操作的基准测试

arXiv cs.AI

介绍了MemOps,这是一个将对话记忆重新定义为具有结构化轨迹的生命周期操作的基准,能够对基于LLM的智能体中的记忆故障进行操作级诊断,揭示当前系统远未达到均匀可靠的境地。

MemTrace:探究最终准确率在长期记忆中遗漏的内容

arXiv cs.AI

MemTrace 是一个基准,它在知识点层面评估 LLM 代理的记忆,探究事实在不同记忆年龄、问题类型和证据条件下的表现。它揭示出汇总的准确率掩盖了不同的失败模式,并且主要瓶颈是证据的使用而非检索。