CAMeR: 关键词门控混合激活机制用于LLM智能体的自适应记忆留存

arXiv cs.CL 论文

摘要

本文提出了CAMeR,一种用于LLM智能体的记忆留存框架,该框架结合了关键词门控混合激活与自适应权重动态,并推出了CAMeR-Bench,一个用于评估自适应记忆留存的基准测试。实验表明,与仅基于嵌入或时间驱动的基线相比,混合符号-神经门控在留存差距和检索效率方面表现更优。

arXiv:2607.20458v1 公告类型:新论文 摘要:在长时间对话中运行的大型语言模型(LLM)智能体会积累大量信息,然而现有记忆系统要么不加区分地保留所有信息,要么应用统一的遗忘启发式规则,无法区分相关与无关知识。我们提出了CAMeR(上下文激活记忆强化),一种将关键词门控混合激活——联合符号(词级Jaccard)与亚符号(嵌入余弦)门控机制——与自适应权重动态相结合的记忆留存框架。CAMeR为每个记忆-查询对计算混合相似度分数;超过阈值的记忆获得强化,而所有记忆经历受控衰减。我们引入了CAMeR-Bench,一个包含76条记忆、100轮交互、跨越8个主题簇并按梯度激活频率设计的基准测试,旨在测试现有基准(如LoCoMO、LongMemEval)无法评估的自适应留存能力。在CAMeR-Bench上,与仅嵌入门控(剪刀差:0.039对比0.024)相比,CAMeR的关键词门控在高频记忆与从未被引用的记忆之间实现了1.6倍的更大留存差距(剪刀差:0.039对比0.024),而时间驱动基线(Oblivion、SuperLocalMemory)在100轮后权重几乎降至零。CAMeR的前5项检索相比全上下文方法(累积39k对比231k个token)节省了83.2%的token,同时产生的权重信号提高了检索精度。通过8种消融实验,我们确定在该规模下,关键词门控——而非可学习衰减——是性能的主要驱动因素。我们的发现表明,混合符号-神经门控为LLM智能体的自适应记忆留存提供了一种简单而有效的机制。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:16

# 关键词门控混合激活:面向LLM智能体的自适应记忆保留
来源:https://arxiv.org/html/2607.20458

###### 摘要

在长时间对话场景下运行的大语言模型(LLM)智能体积累了海量信息,但现有的记忆系统要么不加区分地保留所有内容,要么应用统一遗忘启发式方法,无法区分相关信息与无关信息。我们提出**CAMeR**(上下文激活记忆增强,Context-Activated Memory Reinforcement),一种融合**关键词门控混合激活**——即联合符号(词级Jaccard)与次符号(嵌入余弦)门控机制——与自适应权重动力学的记忆保留框架。CAMeR为每个记忆‑查询对计算混合相似度分数;超过阈值的记忆获得强化,同时所有记忆经历受控衰减。我们引入了**CAMeR-Bench**,一个包含76条记忆、100轮查询、跨越8个主题簇并具有分级激活频率的基准测试,旨在测试自适应保留能力——这是现有基准(LoCoMO、LongMemEval)无法做到的。在CAMeR-Bench上,CAMeR的关键词门控在高频记忆与从未被引用的记忆之间实现了相较于仅嵌入门控1.6倍更大的保留差距(剪刀差:0.039 vs. 0.024),而基于时间的基线方法(Oblivion、SuperLocalMemory)在100轮后权重几乎塌缩至零。CAMeR的top-5检索相较于全上下文方法节省83.2%的token(累计39k vs. 231k),同时产生的权重信号提升了检索精度。通过8种消融条件,我们确定了关键词门控——而非可学习衰减——在此规模下是性能的主要驱动因素。我们的研究结果表明,混合符号‑神经门控为LLM智能体的自适应记忆保留提供了一种简单而有效的机制。

## 1 引言

部署于长期运行应用(如客户支持、个人助手、治疗机器人)中的LLM智能体必须在上百轮对话中维持连贯的记忆。天真地保留每一次交互会导致上下文无限增长并产生高昂的token成本。相反,固定的遗忘启发式方法又可能丢弃关键信息。根本挑战在于**自适应保留**:确定哪些记忆需要强化、哪些需要衰减、哪些需要丢弃。

最近的工作探索了多种方法:学习式过期时间跨度[1 (https://arxiv.org/html/2607.20458#bib.bib1)]、基于艾宾浩斯遗忘曲线的遗忘曲线[2 (https://arxiv.org/html/2607.20458#bib.bib2)]、面向记忆操作的GRPO强化学习[3 (https://arxiv.org/html/2607.20458#bib.bib3)]、以及基于指数时间衰减与匹配强化相结合的方法[4 (https://arxiv.org/html/2607.20458#bib.bib4)]。然而,这些方法共享一个共同局限:它们主要依赖**次符号**(基于嵌入的)相似度信号进行激活决策。仅凭嵌入相似度容易产生误报——语义接近但事实无关的记忆可能获得不应得的强化,而余弦分数较低但真正相关的记忆可能被忽视。

我们认为,**关键词级符号信号**提供了纯嵌入相似度所缺乏的互补精度。考虑一个来自我们实验的具体例子:“User uses Python for backend development”(用户使用Python进行后端开发)与“User has a pet python named Monty”(用户有一条名为Monty的宠物蛇)。使用嵌入模型(all-MiniLM-L6-v2),这些句子与“Python programming”的余弦相似度均为0.47——足以越过典型的检索阈值。然而,关键词集合 {python, backend, development} 与 {python, pet, monty} 与编程查询的Jaccard重叠度仅为0.14,使得组合分数降至无关记忆的激活阈值以下。

本文做出四项贡献:

1. 1.**关键词门控混合激活**:一种联合评分机制,结合全文嵌入余弦(α=0.6)与关键词Jaccard相似度(1−α=0.4)用于记忆门控。与先前仅依赖嵌入相似度的工作不同,我们的门控利用词级重叠的稀疏性来拒绝假阳性激活。
2. 2.**CAMeR-Bench**:一个受控基准测试,包含跨越8个主题簇的76条记忆、100轮查询以及分级激活频率梯度(高频簇37个查询,背景控制簇0个查询)。我们解释了为什么现有基准(LoCoMO、LongMemEval)不适合保留实验。
3. 3.**Token消耗因果链**:我们证明CAMeR的关键词门控产生的权重信号信息量足够大,能够提升相对于纯嵌入排序的检索精度,在100轮中相较于全上下文方法节省83.2%的token。
4. 4.**综合消融**:在规模上评估了8种CAMeR变体条件和5种竞争基线,并详细分析了**每个基线失败的原因**以及**CAMeR的哪个组件最为关键**。

## 2 相关工作

### 2.1 LLM智能体的记忆系统

增强记忆的LLM系统大致可分为三种范式。**全上下文**方法[14 (https://arxiv.org/html/2607.20458#bib.bib14),15 (https://arxiv.org/html/2607.20458#bib.bib15)]保留整个对话历史,依赖模型的原生上下文窗口——但代价是二次注意力复杂度和快速增长的token预算。**检索增强**系统[5 (https://arxiv.org/html/2607.20458#bib.bib5),13 (https://arxiv.org/html/2607.20458#bib.bib13)]将过往交互索引到向量数据库中,每次查询检索前k个匹配项;它们避免了二次复杂度,但可能遗漏与当前轮次相关但恰好嵌入相似度较低的信息。**混合**系统[12 (https://arxiv.org/html/2607.20458#bib.bib12),16 (https://arxiv.org/html/2607.20458#bib.bib16)]结合了结构化记忆存储与检索,但缺乏显式的激活门控。

表1 (https://arxiv.org/html/2607.20458#S2.T1) 将CAMeR与最相关的、对衰减或遗忘进行建模的记忆系统进行了对比。

表 1:具有衰减/遗忘机制的记忆系统对比。“符号门控” = 使用词级关键词重叠进行激活决策。“每条记忆衰减” = 每条记忆可能具有不同的衰减率。
| 系统 | 门控信号 | 符号门控 | 每条记忆衰减 | 参数量 | 机制 |
| :--- | :--- | :--- | :--- | :--- | :--- |
| Mem0[5 (https://arxiv.org/html/2607.20458#bib.bib5)] | Embedding | ✗ | ✗ | – | 可配置保留 |
| Memory-R1[3 (https://arxiv.org/html/2607.20458#bib.bib3)] | Embedding | ✗ | ✗ | 10K+ | GRPO RL操作 |
| Oblivion[4 (https://arxiv.org/html/2607.20458#bib.bib4)] | Embedding | ✗ | ✗ | 2 | exp(−λΔt) |
| SuperLocal[2 (https://arxiv.org/html/2607.20458#bib.bib2)] | Embedding | ✗ | ✗ | 1 | e^{-t/S},Ebbinghaus |
| Expire-Span[1 (https://arxiv.org/html/2607.20458#bib.bib1)] | Embedding | ✗ | ✓ | 1000+ | 每条记忆学习到的过期时间 |
| **CAMeR (our)** | **Hybrid** | **✓** | **✓** | **81** | **关键词门控 + MLP优化** |

### 2.2 关键词提取与符号信号

关键词作为可解释的稀疏特征,在信息检索领域有着悠久的历史[10 (https://arxiv.org/html/2607.20458#bib.bib10),11 (https://arxiv.org/html/2607.20458#bib.bib11)]。KeyBERT[9 (https://arxiv.org/html/2607.20458#bib.bib9)]利用句子变换器提取代表文档语义的关键短语。在CAMeR中,关键词扮演双重角色:为混合门控提供符号信号,**同时**为每条记忆的内容提供可解释的表示。我们的提取管道使用KeyBERT(all-MiniLM-L6-v2)作为主提取器,并回退至YAKE再至TF-IDF,以增强对短文本或领域特定文本的鲁棒性。

### 2.3 为什么现有基准不充分

两个广泛使用的基准评估LLM长上下文记忆:LoCoMO[6 (https://arxiv.org/html/2607.20458#bib.bib6)]提供多会话对话及其问答对,LongMemEval[7 (https://arxiv.org/html/2607.20458#bib.bib7)]将其扩展到更长的上下文。然而,两者都旨在测试**检索准确性**——模型能否在大量上下文中找到特定信息——而非**保留质量**。具体来说:

1. 1.**单一人设设计**:所有会话摘要描述同一个人设,因此每条记忆都与每个查询相关。这消除了测量假阳性抑制的能力。
2. 2.**无激活梯度**:记忆以统一频率被访问,无法提供自适应分化的信号。
3. 3.**无背景控制**:没有从未被引用的记忆作为基线来衡量不必要的保留。

我们通过实验证实了这一点:在LoCoMO的19个会话摘要上运行CAMeR导致权重均匀饱和(所有权重≈0.99),因为每个查询激活了每条记忆——这对保留实验而言是一种退化情况。**CAMeR-Bench** 解决了上述所有三个缺口。

## 3 CAMeR框架

CAMeR对一组记忆 M = {m_1, ..., m_N} 进行操作,其中每条记忆 m_i 存储:原始文本、提取的关键词 K(m_i)、嵌入 e(m_i)、权重 w_i ∈ [0,1]、访问计数器 a_i、长期贡献累积器 l_i 以及类型标签 {short, long}。

参见图注
图 1:CAMeR系统架构。用户查询触发 (1) 关键词提取和 (2) 嵌入计算;(3) 混合门控结合嵌入余弦与关键词Jaccard产生激活分数;(4) 权重更新器施加衰减与条件强化;(5) 权重增强型检索按 w_i × 余弦相似度排名。长期迁移累积激活次数并将记忆切换至较慢的衰减率。

### 3.1 关键词门控混合激活

给定用户查询 q,CAMeR为每条记忆 m_i 计算组合相似度分数:

score(m_i, q) = α · 嵌入相似度 [ cos(e(m_i), e(q)) ] + (1−α) · 关键词重叠 [ Jaccard(K(m_i), K(q)) ]   (1)

其中 e(·) ∈ ℝ^384 是来自 all-MiniLM-L6-v2[8 (https://arxiv.org/html/2607.20458#bib.bib8)] 的全文嵌入,Jaccard(A,B) = |A∩B| / |A∪B| 作用于词级分词后的关键词集合,α=0.6 控制嵌入信号相对于关键词重叠的权重。关键词通过 KeyBERT[9 (https://arxiv.org/html/2607.20458#bib.bib9)] 提取,并采用 YAKE → TF-IDF 回退链以增强鲁棒性。若在轮次 t 中 score(m_i, q) > τ,则记忆被激活,其中 τ=0.25 是固定阈值。

### 3.2 权重更新动力学

激活决策做出后,权重更新遵循简单的强化-衰减规则:

w_i^(t) = { clamp(w_i^(t-1)·γ + 0.2, 0, 1)  若被激活;否则 w_i^(t-1)·γ }   (2)

固定衰减率 γ=0.99,强化 Δw=0.2。裁剪操作将权重限制在 [0,1] 内。此设计具有几个有意为之的性质:

- • **有界动力学**:权重不会爆炸或变为负数。经过 T 轮纯衰减无强化后,w = 0.99^T,100轮后达到0.366——从未归零,但与受到强化的记忆清晰可辨。
- • **非对称更新**:强化(+0.2)大约是单轮衰减的20倍(≈−0.01),意味着一次激活可以抵消大约20轮的忽视。
- • **非线性交互**:由于衰减是乘法而强化是加法,激活的顺序很重要。在第1轮激活后从未再激活的记忆,与在第99轮才首次激活的记忆不同。

### 3.3 长期记忆迁移

被激活的记忆累积一个长期贡献计数器:每激活一次 l_i += 0.2 × 0.1 = 0.02。当 l_i ≥ 1.0(需要约50次激活)时,记忆类型升级为**长期**,并获得更慢的衰减率 γ_long = 0.995。此机制专为多会话部署设计,使得跨会话持续被访问的记忆能够更持久地保留。

### 3.4 定性案例研究:关键词作为精度过滤器

表2 (https://arxiv.org/html/2607.20458#S3.T2) 展示了关键词门控在 CAMeR-Bench 的一个代表性查询上的运行效果。如果没有关键词Jaccard项,三条记忆都会被激活(余弦 > 0.25);使用混合门控后,只有一条超过 τ=0.25,正确抑制了两个假阳性。

表 2:定性示例:来自簇A(技术)的查询“你推荐哪些Python库用于网络爬虫?”关键词门控抑制了两个假阳性(包含表面术语“Python”的记忆),同时正确激活了目标记忆。
| 记忆文本 | 簇 | cos | Jac | Hybrid | 关键词(top-5) |
| :--- | :--- | :--- | :--- | :--- | :--- |
| 用户使用Python结合BeautifulSoup和Scrapy进行网络爬虫任务。 | A (技术) | 0.62 | 0.25 | 0.47 ✓ | python, beautifulsoup, scrapy, web, scraping |
| 用户有一条名为Monty的宠物蛇,它吃老鼠。 | G (宠物) | 0.47 | 0.07 | 0.31 ✗ | python, pet, monty, mice, snake |
| 用户参加了一场关于机器学习的Python会议演讲。 | A (技术) | 0.52 | 0.09 | 0.35 ✗ | python, conference, talk, machine, learning |
嵌入模型给三条记忆都打了中等到高的余弦分数(0.47–0.62),因为它们都提到“Python”且共享对话结构。Jaccard项进行了区分:只有第一条记忆与查询共享具体的技术关键词(beautifulsoup, scrapy, web, scraping)。这种稀疏性正是符号信号的关键优势——内容词的长期分布产生了密集嵌入所平滑掉的天然分离。

### 3.5 权重增强型检索

标准检索按余弦相似度排序:rank(m_i) = cos(e(m_i), e(q))。CAMeR 则采用权重增强排序:rank(m_i) = w_i · cos(e(m_i), e(q))。这意味着嵌入匹配完美但权重接近零的记忆(例如从未被引用的背景记忆)将排在中等匹配但高度强化的记忆之后。前 k 个检索到的记忆被注入到LLM的上下文中。

算法 1 CAMeR:每轮处理
1: 查询 q,记忆存储 M,门控权重 α=0.6,阈值 τ=0.25,衰减 γ=0.99,强化 Δw=0.2
2: 更新后的权重 w_i,检索到的 top-k 记忆
3:
K(q) ← ExtractKeywords(q)  ▷ KeyBERT with YAKE/TF-IDF fallback
4:
e(q) ← Embed(q)  ▷ all-MiniLM-L6-v2
5: for each memory m_i ∈ M do
6:
sim_cos ← cos(e(m_i), e(q))
7:
sim_jac ← |K(m_i) ∩ K(q)| / |K(m_i) ∪ K(q)|
8:
score ← α·sim_cos + (1−α)·sim_jac

相似文章

面向长周期LLM智能体的选择性记忆保留

arXiv cs.AI

本文提出TraceRetain,这是一个用于冻结LLM智能体中绑定外部存储的轻量级框架,表明选择性记忆保留主要在记忆流包含噪声时与缓存启发式方法区分开,从而带来任务成功率和效率的提升。

AdMem:面向任务求解智能体的高级记忆系统

arXiv cs.AI

本文介绍AdMem,一种面向基于LLM的智能体的统一记忆框架,整合语义记忆、情景记忆和程序性记忆,并采用双层短期与长期存储结构,通过多智能体架构实现自动记忆生成与自适应检索。实验表明,该方法在长程多轮任务中提升了鲁棒性和成功率。