AgentMemBench:评估对话式AI智能体长期记忆管理策略的系统性基准

arXiv cs.CL 论文

摘要

AgentMemBench 是一个系统性基准,在三个数据集上评估对话式 AI 智能体的五种长期记忆管理策略,发现外部键值存储检索在质量上占优,但会带来更大的内存占用。

arXiv:2608.00009v1 公告类型:新 摘要:长期记忆仍然是对话式 AI 智能体的关键瓶颈,因为其有限的上下文窗口无法在数千轮对话中保持连贯的回忆。我们提出了 AgentMemBench,这是一个统一的、可复现的基准,在相同条件下评估五种记忆管理策略:上下文窗口法(ICW)、外部键值存储(EKV)、基于图的情景记忆(GEM)、基于压缩的摘要(CBS)和网络增强记忆(WAM)。所有策略均在三个公共数据集上进行评估,涵盖长期多会话对话(LoCoMo)、任务导向的文档支撑(MultiDoc2Dial)和基于人物角色的多会话聊天(MSC),使用 Recall@k、MRR、nDCG@k、Answer F1、LLM 评判的忠实度分数、内存占用和延迟,评估基于 491 个带标注的问题轮次。生成和评判均使用 Qwen2.5-7B-Instruct(4-bit),并采用贪心解码以确保确定性。我们的结果表明:(1)EKV 在每个质量指标上均占优(宏平均 Recall@5 为 0.792,MRR 为 0.677,F1 为 0.156,忠实度为 0.354);(2)长距离召回是决定性因素:在 LoCoMo 上,当目标轮次位于许多会话之前时,ICW、WAM、GEM 和 CBS 几乎检索不到任何内容(Recall@5 <= 0.005),而仅 EKV 就达到 0.573,这表明近期窗口、摘要和实体图在长时间跨度上失效,只有稠密检索可以扩展;(3)CBS 在检索方面位居第二(0.556);(4)根据其设计,WAM 在语料库内召回上与 ICW 持平,因为外部结果不携带语料库内出处;(5)EKV 的召回优势带来了占用成本(约 5,100 个 token,而 ICW/WAM 约 300 个 token),这是一种明确的准确性与效率之间的权衡。我们还针对同一测试框架评估了两个已发布的记忆系统(MemGPT/Letta、HippoRAG),并发布了所有代码、环境和结果工件,以实现完全可复现性。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:36

# 评估对话式AI代理长期记忆管理策略的系统化基准

###### Abstract

长期记忆仍然是对话式AI代理的关键瓶颈,其有限的上下文窗口无法支持跨越数千轮对话的连贯回忆。We present AgentMemBench, a unified and fully reproducible benchmark that evaluates five memory management strategies under identical conditions: in-context windowing (ICW), external key-value store (EKV), graph-based episodic memory (GEM), compression-based summarisation (CBS), and web-augmented memory (WAM). All strategies are assessed across three public datasets covering long-term multi-session dialogue (LoCoMo), task-oriented document grounding (MultiDoc2Dial), and persona-grounded multi-session chat (MSC), using Memory Recall@k, Mean Reciprocal Rank, nDCG@k, Answer F1, an LLM-judge Faithfulness score, Memory Footprint, and Latency over 491 annotated question turns. Generation and faithfulness judging both use Qwen2.5-7B-Instruct (4-bit), with greedy decoding for determinism. Our measured results show that (1) EKV dominates on every quality axis, achieving the highest macro-averaged Recall@5 (0.792), MRR (0.677), Answer F1 (0.156), and Faithfulness (0.354); (2) long-range recall is the decisive case: on LoCoMo, where the gold turn lies many sessions back, ICW, WAM, GEM, and CBS retrieve almost nothing (Recall@5≤0.005) while EKV alone reaches 0.573, showing that recency windows, summaries, and entity graphs collapse at long horizons and only dense retrieval scales; (3) CBS is the clear runner-up on retrieval (macro 0.556) by inheriting the provenance of the turns it compresses; (4) WAM is equivalent to ICW on in-corpus recall by construction—its external results carry no in-corpus provenance—so WAM is best understood as ICW augmented with optional external grounding; and (5) EKV’s recall advantage carries a footprint cost (~5,100 vs. ~300 tokens for ICW/WAM), an explicit accuracy–efficiency trade-off. We release all code, environment, and result artefacts for full reproducibility.

###### keywords:

大语言模型 · 智能体记忆 · 长期对话 · 基准测试 · 知识图谱 · 网络增强检索 · 对话式AI

## 1 引言

由大语言模型(LLM)驱动的对话式AI代理已迅速从单轮助手发展为多会话、长周期系统,能够管理复杂且不断演变的任务[5 (https://arxiv.org/html/2608.00009#bib.bib9),24 (https://arxiv.org/html/2608.00009#bib.bib4)]。然而,一个根本性的约束始终存在:LLM在有限的上下文窗口内处理信息,通常为4,096–128,000个token,这远远小于真实世界代理部署中持续数天或数周的累计交互历史[35 (https://arxiv.org/html/2608.00009#bib.bib17)]。其结果是**记忆鸿沟**——无法回忆先前会话中的相关上下文,导致重复、矛盾以及任务连续性差[21 (https://arxiv.org/html/2608.00009#bib.bib1)]。

为弥合这一鸿沟,主要出现了五种策略:

**上下文窗口(ICW)** 在上下文窗口中保留最近的k个token,通过滑动窗口或基于近期性的截断丢弃更早的轮次[3 (https://arxiv.org/html/2608.00009#bib.bib14)]。

**外部键值存储(EKV)** 将轮次编码为稠密嵌入,并在推理时通过近似最近邻搜索检索相关记忆[21 (https://arxiv.org/html/2608.00009#bib.bib1),22 (https://arxiv.org/html/2608.00009#bib.bib5)]。

**图基情景记忆(GEM)** 从每一轮中提取实体和关系,构建持久化知识图谱,从而实现结构化的关联回忆[12 (https://arxiv.org/html/2608.00009#bib.bib10),6 (https://arxiv.org/html/2608.00009#bib.bib6)]。

**压缩式摘要(CBS)** 定期将较早的上下文压缩为密集的自然语言摘要,在保留语义内容的同时释放上下文窗口容量[38 (https://arxiv.org/html/2608.00009#bib.bib19),32 (https://arxiv.org/html/2608.00009#bib.bib20)]。

**网络增强记忆(WAM)** 通过网页搜索API或Model Context Protocol(MCP)工具调用,用实时外部知识补充内部对话记忆,模拟现代支持浏览的代理,如带网页浏览的ChatGPT和集成MCP的Claude[1 (https://arxiv.org/html/2608.00009#bib.bib40)]。

尽管现实世界的记忆系统层出不穷——Mem0[22 (https://arxiv.org/html/2608.00009#bib.bib5)]报告了49,500个GitHub星标,并已在财富500强公司生产环境采用;LangChain[11 (https://arxiv.org/html/2608.00009#bib.bib16)]集成了多种记忆后端;最近的综述在文献中识别出超过40种不同的记忆架构[33 (https://arxiv.org/html/2608.00009#bib.bib39),4 (https://arxiv.org/html/2608.00009#bib.bib38)]——但仍然**没有统一的、可复现的基准**能够:(i) 在相同评估条件下比较全部五类策略;(ii) 覆盖多样化的任务类型(开放域对话、任务规划、长周期问答);(iii) 同时衡量**答案质量**和**部署效率**(token开销、延迟);以及 (iv) 为策略比较提供统计显著性检验。最近的基准如LongMemEval[31 (https://arxiv.org/html/2608.00009#bib.bib31)]和MemoryAgentBench[13 (https://arxiv.org/html/2608.00009#bib.bib32)]显著推进了记忆评估——MemoryAgentBench尤其跨多个任务比较了多种记忆方法——但它们并未共同满足标准(i)–(iv):两者都没有围绕五种经典策略家族组织比较,也没有报告部署效率指标。AgentMemBench正好定位于这一交叉点。

### 贡献

本文提出AgentMemBench,包含四项新贡献:

1. 1.**统一、可复现的基准**,覆盖5种记忆策略 × 3种任务类型 = 15种配置,在来自三个公开多会话数据集的491个标注问题轮次上进行评估(200个LoCoMo、187个MultiDoc2Dial、104个MSC),并跨七个互补指标报告结果,涵盖检索质量、答案质量和部署效率。据我们所知,这是第一个在单一测试框架下比较这五类策略家族(包括网络增强变体)并同时报告答案质量和部署效率指标的基准;最接近的先前工作是MemoryAgentBench[13 (https://arxiv.org/html/2608.00009#bib.bib32)],它在质量上比较记忆方法,但既未采用五家族分类法,也未测量效率。
2. 2.**来源感知的检索评估**:每个检索项都携带其所表示上下文的真实(会话,轮次)来源,因此Recall@k/MRR/nDCG是针对标准标注会话标注进行评分,而非针对检索索引——纠正了临时记忆评估中常见的方法论错误。
3. 3.**经验基线**:我们还在同一测试框架下实现并评估了两个已发布的外部记忆系统——MemGPT/Letta和HippoRAG——将五类策略家族置于更广泛的文献背景中。
4. 4.**MADS启发式**——一种零样本的**记忆自适应动态选择器**,根据四个语料统计量选择策略;我们将其作为面向部署的设计指南提出,并诚实分析了其选择与经验最优策略偏离的地方。
5. 5.**开放可复现产物**:所有策略的模块化Python实现、评估框架、Docker化环境以及完整的预计算结果文件。

### 动机示例

表1 (https://arxiv.org/html/2608.00009#S1.T1)具体说明了记忆问题。用户在会话9中问道:“我们第一次会话时,我说我想读哪本书?”——这个问题需要从8个会话之前、大约3,200 token的先前交互中回忆信息。表中展示了每种策略如何处理这一轮。ICW(w=16)早已丢弃了会话1,回答“我没有相关信息。”;EKV通过稠密相似性检索到会话1的轮次并恢复了书名;CBS浮现出保留了书名的会话1摘要;GEM检索到一个话题相关但不完整的实体邻域,体现了其高精确率、低召回率的行为。这个单一的示例预示了我们的实证发现——稠密检索(EKV)和摘要(CBS)最可靠地恢复长距离事实,而图策略更具选择性——这也激励了在共同测试框架下评估多种策略,而非假设某一种策略普遍最优。

表 1: 动机示例。问题在会话9中提出,需要回忆会话1的信息。✓ = 正确检索到答案,~ = 部分正确,× = 错误。Footprint = 记忆上下文消耗的token数。

本文其余部分组织结构如下:第2节 (https://arxiv.org/html/2608.00009#S2)回顾了LLM记忆与代理架构的相关工作;第3节 (https://arxiv.org/html/2608.00009#S3)定义了五种策略和评估指标;第4节 (https://arxiv.org/html/2608.00009#S4)描述了数据集和实验配置;第5节 (https://arxiv.org/html/2608.00009#S5)展示结果;第6节 (https://arxiv.org/html/2608.00009#S6)讨论启示;第7节 (https://arxiv.org/html/2608.00009#S7)总结。

## 2 背景与相关工作

### 2.1 LLM代理中的记忆

LLM代理的认知架构通常被分解为四个模块:感知、推理、记忆和行动[5 (https://arxiv.org/html/2608.00009#bib.bib9),29 (https://arxiv.org/html/2608.00009#bib.bib21)]。记忆是在代理生命周期内存储和检索信息的模块。受认知科学启发,代理记忆系统通常区分**感觉/工作记忆**(实时上下文窗口)、**情景记忆**(过去经验的记录)和**语义记忆**(提炼出的事实知识)[28 (https://arxiv.org/html/2608.00009#bib.bib23),24 (https://arxiv.org/html/2608.00009#bib.bib4)]。

### 2.2 上下文窗口与长上下文模型

处理长对话最直接的方法是扩展底层LLM的上下文窗口[3 (https://arxiv.org/html/2608.00009#bib.bib14),25 (https://arxiv.org/html/2608.00009#bib.bib22)]。GPT-4 Turbo(128k tokens)和Claude 3.5 Sonnet(200k tokens)等模型显著增大了可行窗口大小。然而,研究一致表明LLM存在**中间丢失**退化[19 (https://arxiv.org/html/2608.00009#bib.bib15)]:当信息远离上下文开头或结尾时,检索准确率下降,这使得单纯扩展窗口无法满足生产部署的需求。

### 2.3 外部键值与向量记忆

检索增强方法维护一个轮次嵌入的外部存储,在推理时检索最相关的top-k条记忆[17 (https://arxiv.org/html/2608.00009#bib.bib7)]。Mem0[22 (https://arxiv.org/html/2608.00009#bib.bib5)]等系统通过将语义相似性与近期性和频率信号结合来对记忆排序,从而扩展了这种方法。向量数据库(FAISS[14 (https://arxiv.org/html/2608.00009#bib.bib8)]、Chroma、Weaviate)为大规模记忆存储提供了可扩展的近似最近邻搜索。最近关于MemoryBank[39 (https://arxiv.org/html/2608.00009#bib.bib11)]和ReadAgent[16 (https://arxiv.org/html/2608.00009#bib.bib12)]的工作表明,动态记忆选择能提高长周期对话中的事实准确性。

### 2.4 图基情景记忆

知识图谱记忆将代理的历史表示为实体和关系的结构化图[12 (https://arxiv.org/html/2608.00009#bib.bib10)]。GraphRAG系统[6 (https://arxiv.org/html/2608.00009#bib.bib6)]将其扩展到社区级摘要,从而支持跨存储知识的多跳推理。图记忆擅长回答需要结构化索引而非语义相似性的关系型问题(“Alice在第三次会话中遇到了谁?”)。然而,知识图谱构建存在噪声——命名实体识别(NER)和关系抽取会引入错误——而且图遍历的延迟可能对实时代理构成障碍。

### 2.5 基于压缩的记忆

基于摘要的记忆会定期将较早的轮次浓缩为较短的自然语言摘要[38 (https://arxiv.org/html/2608.00009#bib.bib19),32 (https://arxiv.org/html/2608.00009#bib.bib20)]。DialoCML[37 (https://arxiv.org/html/2608.00009#bib.bib29)]系统维护一个滚动的人物摘要,在每次会话后更新。SumMem[15 (https://arxiv.org/html/2608.00009#bib.bib30)]表明递归摘要(对摘要再摘要)可以在>96%的上下文压缩率下保持令人惊讶的高召回率。然而,随着压缩率的增加,摘要的忠实度会下降,尤其是对数值和时间信息。

### 2.6 基准与评估空缺

记忆评估基准的版图正在迅速扩展。LoCoMo[21 (https://arxiv.org/html/2608.00009#bib.bib1)]评估长期对话回忆,但不比较记忆策略。LongMemEval[31 (https://arxiv.org/html/2608.00009#bib.bib31)]引入了一套综合测试套件,涵盖信息抽取、多会话推理、时间理解与知识更新,揭示了随着历史增长准确率下降30–60%——然而,它评估的是模型而非记忆架构。最接近的先前工作是MemoryAgentBench[13 (https://arxiv.org/html/2608.00009#bib.bib32)],这是一个统一的基准,评估跨度类似的记忆增强代理(上下文内、检索/RAG、外部记忆代理和工具使用),并围绕四种能力组织评估(准确检索、测试时学习、长距离理解、选择性遗忘)。它与AgentMemBench有两个区别,这恰好定义了我们的贡献:(i) 它没有围绕五个经典策略家族来组织比较(它没有显式的上下文内 vs. 键值 vs. 图 vs. 压缩 vs. 网络增强轴线);(ii) 它仅报告答案/记忆质量,**没有部署效率指标**(token占用、延迟)。Evo-Memory[20 (https://arxiv.org/html/2608.00009#bib.bib35)]使用自进化记忆对测试时学习进行基准测试,侧重于任务完成而非检索质量。最近的综述[33 (https://arxiv.org/html/2608.00009#bib.bib39),4 (https://arxiv.org/html/2608.00009#bib.bib38)]对记忆操作提供了全面的分类,但没有统一的数量比较。

据我们所知,没有先前的基准在单一测试框架下比较全部五类策略家族(上下文窗口、外部键值、图、压缩和网络增强记忆),同时报告**答案质量**和**部署效率**指标(占用与延迟)。AgentMemBench正是瞄准这一交叉点——五家族分类法和效率维度——而非声称在一般记忆基准方面拥有优先权;尤其是MemoryAgentBench已经覆盖了多策略、多任务、质量维度。表2 (https://arxiv.org/html/2608.00009#S2.T2)总结了空缺所在。

表 2: 相关基准比较。✓ = 支持,✗ = 未覆盖。此处“多策略”指

相似文章

MemArena:一种面向大规模设备端智能个人记忆助手的自我中心基准

arXiv cs.CL

MemArena 是一种新的自我中心基准,用于评估设备端个人记忆助手,它使用 MASim 智能体模拟器生成多会话对话世界,并在回忆、推理和可信度维度上提供真值。初步结果表明,记忆后端的选择通常比读取器规模更重要,而基于权限的访问仍然是一个普遍挑战。