选择性遗忘:一个基于图的长期LLM代理记忆框架

arXiv cs.AI 论文

摘要

本文评估了一个面向长期LLM代理的基于图的记忆框架,发现该框架在召回指标上并不优于扁平向量检索,但选择性遗忘模块能以最小性能损失有效减少存储。

arXiv:2608.28978v1 公告类型:新 摘要: 知识图谱被提出作为扁平检索增强生成在长期代理记忆上的结构化替代方案,假设将对话表示为实体和关系能提高召回率。我们直接评估了这一假设。我们的框架将每个对话回合提取为带类型的节点和带属性的边,从两跳子图中回答问题,并定期修剪在新鲜度、访问频率、度中心性和年龄的加权组合上得分低的节点。在LongMemEval上,该图在匹配的候选生成预算为五个检索根时,并不优于扁平向量基线:token F1为$0.417$对比$0.468$,且对500个问题的配对自举给出 $\Delta = -0.050$(95\%置信区间$[-0.085, -0.016]$)。差距在需要回忆特定先前助手回合的问题上最大,其中判断正确性从$0.911$下降到$0.607$,表明将回合分解为实体会丢弃这些问题所依赖的表面形式。遗忘模块更为成功。应用于一个持久的27{,}021节点图一次后,它移除了9.8\%的节点和9.5\%的存储字节;token F1未改变($+0.001$,95\%置信区间$[-0.015, +0.016]$),判断正确性下降1.6点,95\%区间将任何损失限制在3.8点($[-0.038, +0.006]$)。由于我们的提取器是一个在单一基准上评估的单一小型模型,这些结果表征了这个基于提取的管道,而非图结构记忆的一般情况。代码: https://github.com/skhanzad/Selective-Amnesia
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:45

# 选择性遗忘:面向长期LLM智能体的基于图的记忆框架  
来源:https://arxiv.org/html/2608.28978  
作者:Theo Rusu  
隶属机构:计算机科学系  
隶属机构:多伦多都会大学  
隶属机构:加拿大安大略省多伦多市  
邮箱:[trusu@torontomu\.ca](mailto:)  

Sourena Khanzadeh  
††注:此项研究在作者加入Flybits与创意学院之前进行。作者此前曾隶属于多伦多都会大学计算机科学系。  
隶属机构:创意学院  
隶属机构:多伦多都会大学  
隶属机构:加拿大安大略省多伦多市  
隶属机构:Flybits,创意人工智能中心  
隶属机构:加拿大安大略省多伦多市  
邮箱:[sourena\.khanzadeh@torontomu\.ca](mailto:)  

Manar Alalfi  
隶属机构:计算机科学系  
隶属机构:多伦多都会大学  
隶属机构:加拿大安大略省多伦多市  
邮箱:[manar\.alalfi@torontomu\.ca](mailto:)  

###### 摘要  
知识图谱被提议作为长期智能体记忆中平面检索增强生成的结构化替代方案,其假设是将对话表示为实体和关系能够提升召回效果。我们直接评估了这一假设。我们的框架将每个对话轮次提取为带类型的节点和带属性的边,从两跳子图中回答问题,并根据新近性、访问频率、度中心性和轮次时间的加权组合定期修剪评分较低的节点。在LongMemEval基准测试上,该图在匹配候选生成预算为五个检索根节点的情况下,并未优于平面向量基线:token F1为0\.417,而基线为0\.468;在500个问题上的配对自举检验给出Δ=−0\.050(95%置信区间[−0\.085,−0\.016])。差距在需要回忆特定先前助手轮次的问题上最为显著,判断正确率从0\.911降至0\.607,这表明将轮次分解为实体会丢弃这些问题所依赖的表层形式。  
遗忘模块则更为成功。将其应用于一个包含27,021个节点的持久化图后,移除了9\.8%的节点和9\.5%的存储字节数;token F1保持不变(+0\.001,95%置信区间[−0\.015,+0\.016]),判断正确率下降1\.6点,且95%置信区间将任何损失限制在3\.8点以内([−0\.038,+0\.006])。由于我们的提取器是一个在单一基准上评估的单个小模型,这些结果描述的是该基于提取的流程,而非通用的图结构记忆。  
代码:https://github\.com/skhanzad/Selective\-Amnesia  

## 1 引言  
大型语言模型已迅速从独立的文本生成器演变为复杂智能体系统的基石,这些系统能够推理、规划和使用外部工具。这些系统正越来越多地被采纳为个人AI助手,与用户进行长时间的交互。这些交互的质量不仅依赖于模型即时的推理能力,也依赖于模型整合过去交流信息的能力。因此,记忆成为这些系统的关键组成部分,通常被分为两个子类别:短期记忆和长期记忆。  
当前广泛采用的长期记忆方法是检索增强生成(Lewis等人,2020),其中密集向量存储在推理时被索引和查询,以检索相关条目来增强模型输出。该方法将记忆建模为基于相似性的平面检索系统,但已被证明对噪声敏感,容易检索到无关或冗余的上下文,并且其在支持多跳推理或维持连贯的长期知识方面的能力有限(Gao等人,2023)。为了解决这些局限性,最近的工作探索了基于知识图谱的结构化记忆表示,其中信息以实体及其关系的形式组织,而非独立的嵌入。在这些系统中,记忆被编码为节点和边,从而可以存储更复杂的语义和关系表示(Ji等人,2021;Peng等人,2023)。  
然而,现有的图方法主要关注如何添加信息以及如何保持一致性(Chhikara等人,2025)。这未能解决长期记忆系统的一个根本挑战:无界增长。随着交互随时间累积,记忆存储变得越来越大,导致一系列下游负面影响,包括检索质量下降、计算成本增加以及保留低效用信息。  
随着记忆在长时间交互中的积累,系统必须整合新信息并管理现有知识的关联性。先前在持续学习和神经记忆系统中的研究表明,有效的记忆需要选择性保留和遗忘机制,因为保留所有信息会导致性能下降(Kirkpatrick等人,2017;Wei等人,2026)。  
在本工作中,我们研究将长期对话记忆构建为知识图谱是否能显著提升LLM智能体的检索和推理能力,以及系统是否能在扩展的交互中保持高效。我们引入了一个带有显式遗忘模块的基于图的记忆框架,该模块控制存储信息的生命周期。我们的研究并非假设结构化表示普遍有益,而是通过实证描述基于图的记忆在哪些方面有帮助,在哪些方面会降低性能。此外,我们表明,基于新近性、频率和结构重要性的选择性遗忘可以在不影响检索质量的前提下减少记忆大小。这些发现强调,有效的长期记忆需要结构化表示以及对更新和保留机制的精心设计。  

## 2 相关工作  
### 2\.1 基于LLM的智能体中的记忆  
为神经系统配备显式记忆早于当前一代语言模型。早期的可微架构,如图灵机神经网络(Graves等人,2014)和端到端记忆网络(Sukhbaatar等人,2015),将控制器与可寻址的外部存储器耦合,建立了后来记忆系统继承的读写抽象。随着LLM成为智能体系统的支柱,记忆被重新用于在轮次和会话之间持久化信息,而非在单次前向传递中(Zhang等人,2025)。  
一个常见的设计是生成式智能体(Generative Agents)的记忆流(Park等人,2023),它记录观察结果并使用新近性、重要性和相关性的组合进行检索,并定期合成更高层次的反思。后续系统沿着不同的轴扩展了这一想法:MemoryBank(Zhong等人,2024)引入了受艾宾浩斯遗忘曲线启发的更新方案(Ebbinghaus,1913);MemGPT(Packer等人,2023)将记忆视为操作系统风格的层次结构,在有界上下文窗口和外部存储之间分页信息;ReadAgent(Lee等人,2024)将非常长的上下文压缩为摘要记忆;而Think-in-Memory(Liu等人,2023)、Self-Controlled Memory(Wang等人,2025)和MemLLM(Modarressi等人,2024)则赋予模型对存储和召回内容的显式控制。这些方法也支持了Xu等人(2022)研究的长期对话场景。  
然而,这条研究路线的大多数工作将记忆组织为条目的平面集合,重点放在写入和读取上,而非有原则的移除。  

### 2\.2 检索增强生成  
将LLM输出基于外部知识的主流策略是检索增强生成(Lewis等人,2020),它从非参数存储中检索相关段落,并基于这些段落进行条件生成。密集检索(Karpukhin等人,2020)以及联合预训练的检索-阅读模型,如REALM(Guu等人,2020)和RETRO(Borgeaud等人,2022),在大规模上提升了检索质量,同时检索已被证明可以减少对话中的幻觉(Shuster等人,2021)。最新的变体增加了对何时以及检索什么的自反控制(Asai等人,2024),并为对话场景专门化了模型(Liu等人,2024)。  
然而,正如Gao等人(2023)的综述所指出,RAG从根本上将记忆建模为基于独立嵌入的平面、相似性查找。这使得它对检索噪声和冗余敏感,并限制了其进行多跳推理或维持连贯长期知识的能力,从而推动了更结构化的记忆表示。  

### 2\.3 图结构记忆  
知识图谱提供了一种结构化替代方案,其中信息以实体及其之间的关系表示(Ji等人,2021;Peng等人,2023)。越来越多的工作将这种结构与LLM集成(Pan等人,2024),范围从使用检索到的三元组进行提示(Baek等人,2023)到让模型通过遍历图进行推理(Sun等人,2024)。  
专门针对检索而言,GraphRAG(Edge等人,2024)构建实体图和社区摘要以支持面向查询的摘要生成,而HippoRAG(Gutiérrez等人,2024)借鉴海马体索引理论,将知识图谱与基于图的检索相结合用于长期回忆。在智能体记忆设置中,像Mem0(Chhikara等人,2025)这样的系统采用图表示来跨会话存储和整合用户信息。这些方法展示了关系结构在检索和推理方面的优势,但它们侧重于信息的添加和保持一致性,基本上忽略了记忆存储的无界增长问题。  

### 2\.4 遗忘与记忆保留  
遗忘的需求在智能体记忆之外已被充分证实。在人类认知中,记忆保留随时间可预测地衰减(Ebbinghaus,1913)。在神经网络中,朴素的顺序学习会导致灾难性遗忘(McCloskey和Cohen,1989),促使了保护重要参数的机制的出现(Kirkpatrick等人,2017);Wang等人(2024)综述了深度学习中更广泛的遗忘现象,而机器遗忘(machine unlearning)则研究特定信息的刻意移除(Bourtoule等人,2020)。  
这些领域的一个一致发现是,有效的记忆需要选择性保留,而非无限期积累。这一原理直到最近才被应用于智能体记忆:FadeMem(Wei等人,2026)引入了受生物学启发的遗忘机制以保持智能体记忆的效率。我们的工作在精神上最接近这一方向,但将遗忘与图结构存储耦合:我们将遗忘模块集成到节点和边的生命周期中,而不是将保留视为对平面条目的事后过滤,这样在保留关系结构的同时,移除了过时或低效用的记忆。  

### 2\.5 评估长期记忆  
评估长期交互中的记忆需要专门的基准。LoCoMo(Maharana等人,2024)评估非常长期的对话记忆,而LongMemEval(Wu等人,2024)则探究聊天助手在长期交互记忆能力上的表现,如多会话推理和知识更新。我们采用LongMemEval来评估带有遗忘的结构化记忆是否能在交互累积过程中保持高质量的回忆。  

## 3 方法论  
本研究提出了一种基于图的对话记忆框架,将交互建模为一个结构化的、不断演化的知识图谱。该系统不将过去的交流存储为独立的嵌入,而是维护实体及其关系作为节点和边,随着新的对话轮次的到来不断更新此图谱,并定期修剪低重要性节点以限制长期交互中的图谱增长。  

### 3\.1 架构  
该框架组织为一个三阶段流水线:*检索*、*更新*和*保留*。  
在*检索*阶段,选择与当前问题最相关的子图并将其序列化为答案生成的上下文。  
在*更新*阶段,LLM从当前对话轮次中提取实体和关系,并将其整合到知识图谱中。  
在*保留*阶段,遗忘模块对每个存储的节点进行评分,并移除那些重要性低于阈值的节点,以限制图谱增长并丢弃低效用信息。  
图1(https://arxiv.org/html/2608.28978#S3.F1)概述了整个流程以及三个阶段如何与持久化的知识图谱交互。  

用户问题 实体提取 描述符嵌入  
Top-5节点搜索(余弦相似度 > 0\.75) → 2跳子图遍历(≤15个节点) → LLM答案  
**1\. 检索**  

对话轮次 LLM节点与边提取  
描述符嵌入 去重(标题索引,余弦相似度 > 0\.92)  
写入新节点/合并现有节点 → **2\. 更新**  

每400个轮次 重要性评分(新近性·频率·中心性·轮次时间)  
阈值检查 → 剪枝节点及关联边(s < 0\.10) → **3\. 保留**  

持久化知识图谱(带类型节点·带属性边·向量索引)  
读取:节点与子图 写入/合并 剪枝 图统计  

图1:所提记忆框架概述。每个对话轮次由*更新*阶段处理,该阶段提取、嵌入、去重节点和边,并将其写入持久化知识图谱。在提问时,*检索*阶段嵌入所引用的实体,选择余弦相似度排名前5的匹配节点,并通过2跳子图遍历扩展它们以构建答案生成上下文。每400个轮次,*保留*阶段根据新近性、访问频率、中心性和轮次时间对每个节点进行评分,修剪重要性低于阈值的节点。

相似文章

面向长周期LLM智能体的选择性记忆保留

arXiv cs.AI

本文提出TraceRetain,这是一个用于冻结LLM智能体中绑定外部存储的轻量级框架,表明选择性记忆保留主要在记忆流包含噪声时与缓存启发式方法区分开,从而带来任务成功率和效率的提升。