面向长期LLM代理的检索驱动记忆再巩固

arXiv cs.CL 论文

摘要

本文介绍了REALM,一个用于LLM代理长期记忆的框架,它利用检索驱动的再巩固来自主地将记忆组织成认知图,从而在长期记忆基准测试中取得更好的性能。

arXiv:2609.16053v1 公告类型:新 摘要:长期记忆对于基于LLM的代理在扩展交互中至关重要。现有的记忆系统主要在信息到达时更新记忆,将检索视为记忆访问的终点,而非记忆演化的驱动力。因此,检索反馈很少被利用来持续重组记忆以供未来访问。此外,大多数现有方法依赖于预定义的记忆结构和固定的检索流程,限制了代理自主组织和演化自身记忆的能力。受认知神经科学中记忆再巩固的启发,我们提出了\textbf{REALM},一个\textbf{r}econsolidation-\textbf{e}volution \textbf{a}gentic \textbf{l}ong-term \textbf{m}emory框架。它将长期记忆建模为一个持续的生命周期,通过自主地将记忆组织成异构认知图、通过自适应组合的图搜索原子检索证据,并基于检索反馈持续再巩固记忆来实现。REALM在LoCoMo上达到平均准确率75.97\%,在LongMemEval上达到65.11\%,分别比最强基线高出7.17和1.31分。消融研究证实记忆再巩固持续提升性能,进一步分析显示它逐渐将相关记忆单元重组为更连贯的局部结构,以便在推理过程中集体召回和利用证据。这些结果表明,检索驱动的记忆再巩固为LLM代理中持续演化长期记忆提供了有效机制。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:40

# 基于检索驱动的记忆再巩固用于长期LLM智能体  
来源:https://arxiv.org/html/2609.16053  
宋元怡††注:此项工作在宋元怡于OPPO实习期间完成。  
王宇凯  
单位:上海交通大学  
邮箱:[[email protected]](mailto:)  

马新蓓  
单位:上海交通大学 / 新加坡国立大学  
邮箱:[[email protected]](mailto:)  

傅志辉  
单位:OPPO  
邮箱:[[email protected]](mailto:)  

林江豪  
单位:上海交通大学  

刘伟文  
单位:上海交通大学  

王军  
单位:OPPO  

邓华荣  
单位:OPPO  

俞扬  
单位:上海交通大学  

张伟楠††注:J. Lin、W. Liu、J. Wang 和 W. Zhang 为通讯作者。  
单位:上海交通大学  

#### 摘要  
长期记忆对于在长时交互中运行的基于LLM的智能体至关重要。现有记忆系统主要在接收新信息时更新记忆,将检索视为记忆访问的终点而非记忆演化的驱动力。因此,检索反馈很少被用于持续重组记忆以优化未来访问。此外,大多数现有方法依赖于预定义的记忆结构结合固定的检索流程,限制了智能体自主组织与演化自身记忆的能力。受认知神经科学中记忆再巩固的启发,我们提出了REALM——一个再巩固-演化智能体长期记忆框架。它将长期记忆建模为一个持续的生命周期:自主将记忆组织为异构认知图,通过自适应组合的图搜索原子检索证据,并基于检索反馈持续再巩固记忆。REALM在LoCoMo上达到平均75.97%的准确率,在LongMemEval上达到65.11%的准确率,分别超出最强基线7.17和1.31个百分点。消融研究证实记忆再巩固能一致提升性能,进一步分析表明,它逐步将相关记忆单元重组为更连贯的局部结构,以便在推理过程中集体召回和利用证据。这些结果表明,检索驱动的记忆再巩固为LLM智能体中长期记忆的持续演化提供了有效机制。  

## 1 引言  
基于大语言模型(LLM)的智能体近期进展使其能够部署在长期交互场景中,如个人助手、长时程任务协作和持续决策(Zhang et al., 2025;Du, 2026;Song et al., 2026)。在这些场景中,智能体必须在广泛的历史中积累知识,并利用过去经验进行未来推理,使得长期记忆成为智能体的基础能力(Wang et al., 2024;Li et al., 2026;Fang et al., 2026;Chai et al., 2026)。如图1左侧所示,现有长期记忆研究主要遵循前向演化范式,其中记忆更新(包括记忆单元的添加、删除与合并)仅由新获取的信息触发(Zhong et al., 2024;Hu et al., 2025;Wang and Chen, 2025)。在此范式下,记忆检索被视为利用的被动终点,而非结构优化的催化剂。  
图1:检索驱动的记忆再巩固动机。现有记忆系统主要通过预定义数据结构和固定检索流程使用新信息更新记忆,而REALM则形成闭环记忆生命周期,利用检索反馈在利用时动态重组记忆拓扑。  
这种主流范式与认知神经科学中的记忆再巩固形成鲜明对比,后者是一种基础机制:被回忆的记忆并非静态数据(Adam, 2026;Lee and Jung, 2025;Samieiyeganeh et al., 2026);相反,再激活会引发一种不稳定状态,其中连接被加强、削弱或新建,使记忆网络能通过使用主动演化,从而在保持稳定性的同时适应新经验(Nader et al., 2000a)。  
因此,长期记忆应是一个动态的记忆生命周期,具备在每次检索后自主重组其组织的反馈驱动能力。然而,实现这种检索后演化需要平衡高度灵活的记忆结构与针对演化拓扑的自适应检索机制(Hu et al., 2026)。  
为解决此挑战,我们提出REALM——一个再巩固-演化智能体长期记忆生命周期框架,通过三个互补组件实例化此整体生命周期:  
(1)**自主组织**:我们定义原子记忆节点和关系,赋能智能体自主构建局部拓扑,使其有机涌现为统一的智能体认知图。  
(2)**自适应检索**:我们将复杂图遍历分解为原子搜索动作,允许智能体动态组合上下文定制的检索策略。  
(3)**记忆再巩固**:每次任务后,我们对激活的子图进行局部再巩固,动态更新连接以实现持续的检索驱动演化。  
标准基准上的实验表明,REALM持续优于传统后静态范式,进一步分析证实记忆再巩固能有效在长时程上优化记忆结构。同时,智能体认知图实现了高效的记忆组织和检索。这些发现支持我们的假设:长期记忆应通过使用持续演化,而非仅仅积累新信息。  
我们的主要贡献总结如下:  
- **记忆生命周期概念**:我们为LLM智能体中的长期记忆引入生命周期视角,其中记忆通过使用持续演化,而非在构建后保持静态。  
- **REALM框架**:我们提出一个统一的智能体记忆框架,将自主记忆组织、自适应检索和检索后再巩固整合为统一的演化生命周期。  
- **实证验证**:综合评估表明,生命周期驱动的记忆演化持续提升长期记忆性能,揭示了可复用记忆拓扑和检索策略的自主涌现。  

## 2 相关工作  
### 2.1 智能体长期记忆  
现有长期记忆系统主要关注记忆组织与检索,持续积累、组织和利用历史信息(LangChain Inc., 2025;Zhou et al., 2026)。早期工作依赖扁平增量存储来提取和总结历史交互(Zhong et al., 2024;Chhikara et al., 2025;Wang et al., 2025)。为增强表示,近期方法采用显式结构,包括层级树或思维导图(Rezazadeh et al., 2025;Li et al., 2026;Xu et al., 2026)、知识图谱(Edge et al., 2024;Yang et al., 2026)、时序(Rasmussen et al., 2025)或操作系统启发式管理(Li et al., 2025;Packer et al., 2023;Kang et al., 2025;Zhu et al., 2026),以及多模态表示(Wang and Chen, 2025)。相应地,检索研究通过多跳图推理(Gutiérrez et al., 2024)、迭代搜索(Yan et al., 2025;Du et al., 2025)、双过程检索(You et al., 2026)和自适应图遍历(Jiang et al., 2026a)来增强利用。然而,这些方法通常遵循预定义组织与静态检索后状态。相比之下,我们制定了一个统一的记忆生命周期,在组织和检索中加入动态、自主的记忆重组。  

### 2.2 智能体记忆演化与生命周期  
受认知神经科学启发,融入记忆阶段(如编码与巩固)的做法日益流行(Gutiérrez et al., 2024;Khiste and Ilie, 2014;Jiang et al., 2026b)。神经科学揭示,被回忆的记忆会暂时变得不稳定并经历再巩固以实现持续适应(Nader et al., 2000b),这意味着长期记忆通过重复使用而非一次性存储来演化(Gonzalez et al., 2026)。尽管一些研究通过离线压缩(Fang et al., 2025)、最近性与频率启发式(Zhong et al., 2024;LangChain Inc., 2025)或带选择性遗忘的时间衰减(Gu et al., 2026)探索记忆演化,但其更新由时间或新输入驱动,而非记忆使用本身。另一研究方向使用强化学习估计记忆价值(Zhang et al., 2026),但此方法仅优化孤立条目而不修改关系结构。受记忆再巩固启发,REALM实例化了一个检索驱动的生命周期,在每次检索时动态重组激活的局部认知图。  
图2:REALM概览。该框架将观测组织为智能体认知图记忆,通过自适应图搜索原子检索证据,并在利用后再巩固激活的子图以演化记忆拓扑。  

## 3 方法  
### 3.1 问题形式化  
我们建模一个在长时信息流 $\mathcal{O}=\{o_1,o_2,\cdots,o_T\}$ 中与环境交互的长时程智能体。传统智能体记忆范式在接收到 $o_t$ 时通过前向操作(包括插入、巩固或遗忘)顺序演化记忆图 $\mathcal{G}_t$,并被动提取静态子图 $\mathcal{G}_q \subset \mathcal{G}_t$ 来回答查询 $q$。  
相比之下,我们认为记忆利用产生关键的认知反馈,应主动驱动结构优化。因此,我们引入检索后记忆再巩固阶段。给定查询 $q$ 及其答案反馈 $f$,智能体将激活的拓扑 $\mathcal{G}_q$ 动态重组为优化状态 $\mathcal{G}'_q$。全局记忆状态转换因此表述为:  
$$\mathcal{G}_{t+1}=\text{Reconsolidating}(\mathcal{G}_t\setminus\mathcal{G}_q \cup \mathcal{G}'_q,\ f) \quad (1)$$  
整体框架如图2所示。  

### 3.2 记忆组织:统一认知图  
#### 3.2.1 图表示  
为支持无模式局部配置,我们将记忆建模为图 $\mathcal{G}=(\mathcal{V},\mathcal{E})$,其中节点对应不同类别的记忆单元,边编码它们的关系。将结构分解为逻辑正交维度,我们正式定义节点空间为 $\mathcal{V} \subset \{\text{entity},\text{event},\text{episode},\text{fact}\}$,边空间为 $\mathcal{E} \subset \{\text{logical},\text{causal},\text{hierarchical},\text{associative}\}$。  
形式上,每个智能体生成的认知节点 $v \in \mathcal{V}$ 结构化为:  
$$v = \big(\kappa_{v},\ c_{v},\ des_{v},\ k_{v},\ t_{v}\big), \quad (2)$$  
其中 $\kappa_{v}$ 表示节点类型,$c_{v}$ 是原始源内容,$des_{v}$ 表示语义描述,$k_{v}$ 表示类型特定的关键词或名称,$t_{v}$ 指定时间跨度约束(如适用)。相应地,每个智能体生成的有向边 $e_{ij} \in \mathcal{E}$ 形式化为:  
$$e_{ij} = \big(v_{i},\ v_{j},\ \kappa_{ij},\ des_{ij},\ w_{ij}\big), \quad (3)$$  
其中 $\kappa_{ij}$ 表示关系类型,$des_{ij}$ 是关系描述文本,$w_{ij} \in [0,1]$ 表示置信度权重。此形式化将原始记忆内容与拓扑解耦,为下游检索和拓扑演化提供关键结构变量。  

#### 3.2.2 记忆构建  
与分离插入、合并和遗忘的传统方法不同,REALM 将这些操作统一为单一整合阶段,将遗忘视为冗余(Ong et al., 2025)。接收到新观测 $o_t$ 后,智能体首先提取 $m$ 个候选记忆单元 $X=\{x_{i}\}_{i=1}^{m}$,其中每个 $x_{i} \in \mathcal{V}$ 由智能体自主分类。然后,对于每个候选单元 $x \in X$,智能体查询其相关邻域节点:$N(x) = N_{sim}(x) \cup N_{recent}(x)$,其中 $N_{sim}$ 和 $N_{recent}$ 分别表示语义相似节点和最近处理的节点。  
基于 $N(x)$,智能体决定新候选是否应被**添加**为新节点、**合并**到现有记忆节点,或**跳过**而不保存到记忆中。如果选择添加或合并,智能体随后在预定义边空间 $\mathcal{E}$ 中推断 $x$ 与 $N(x)$ 之间的一组有向关系边 $E_v$。此统一流程赋能智能体不仅通过选择性保留自主决定**是否记住**观测,而且通过动态拓扑集成自主决定**如何表示**观测。  

### 3.3 记忆检索:

相似文章

受人类启发的LLM智能体记忆架构

arXiv cs.AI

微软研究人员提出了一种受生物学启发的LLM智能体记忆架构,该架构结合了睡眠阶段巩固和基于干扰的遗忘机制,以高效管理持久性记忆。