JustMem:长期对话中的适度内存访问
摘要
本文提出JustMem,一个通过平衡发现广度和读取保真度来适应长期对话的内存访问系统,用更少的令牌实现更高的准确性。
arXiv:2609.19877v1 公告类型:新
摘要:高效的长期对话记忆需要在不过度扩展提供给语言模型的上下文的情况下检索足够的证据。这很具有挑战性,因为相关证据可能分布在多个会话中,而压缩可能会丢弃回答所需的细节。因此,不同的查询需要不同形式的内存访问。为了捕捉这些需求,我们从两个维度来定义内存访问:发现广度,控制证据搜索的广泛程度;以及读取保真度,控制证据是以紧凑形式读取还是从原始对话中恢复。基于此定义,我们引入JustMem,它将对话历史存储为紧凑的原子记忆,并针对每个查询沿这两个维度适应内存访问。具体而言,LOOKUP处理局部证据,COMPOSE扩展发现范围以处理分布式证据,REPLAY提高读取保真度以处理保真度敏感的证据。在LoCoMo和LongMemEval-S上,JustMem在比较的内存系统中实现了最高的平均准确性和检索召回率,同时使用了显著更少的生成模型令牌进行记忆构建和推理。
查看缓存全文
缓存时间: 2026/09/18 09:03
# JustMem:长期对话的精准内存访问
来源:https://arxiv.org/html/2609.19877
Yanting Wang, Wenjing Zhi, Lei Sha††
†† 通讯作者,隶属北京航空航天大学
###### 摘要
高效的长期对话记忆需要在检索充分证据的同时,避免无差别地向语言模型扩展上下文。这一挑战源于相关证据可能分散在多个会话中,而压缩过程可能丢失回答所需的关键细节。因此,不同查询需要不同形式的内存访问。为捕捉这些需求,我们将内存访问形式化为两个维度:**发现广度**控制证据的搜索范围,**阅读保真度**控制证据是以紧凑形式读取还是从原始对话中恢复。基于此框架,我们提出JustMem系统,将对话历史存储为紧凑的原子记忆,并根据每个查询自适应调整这两个维度的内存访问。具体而言:**Lookup**处理局部证据,**Compose**扩展分布式证据的发现范围,**Replay**为保真度敏感的证据提高阅读保真度。在LoCoMo和LongMemEval-S测试中,JustMem在记忆构建和推理阶段使用的生成模型标记显著更少的同时,达到了最高的平均准确率和检索召回率。
## 1 引言
语言模型助手正越来越多地处理超出单个上下文窗口的跨对话任务。有效的长期记忆必须恢复先前信息、整合跨会话证据并保留早期交互细节。如图1(https://arxiv.org/html/2609.19877#S1.F1)所示,这些需求对应不同的证据要求:部分问题依赖紧凑记忆中的**局部证据**,另一些需要分散在多会话中的**分布式证据**,还有些需要**保真度敏感证据**——其关键细节可能在压缩过程中丢失。
**图1:同一对话历史的不同问题对应不同证据要求**
局部证据可从紧凑记忆获取,分布式证据跨多个记忆分布,保真度敏感证据可能需要原始对话的细节。
现有记忆系统尝试了持久化存储、摘要、检索增强和显式内存管理(Lewis等, 2020;Zhong等, 2024;Packer等, 2023)。然而,固定的访问策略难以高效满足多样化需求:狭窄检索可能遗漏分布式证据,紧凑表示可能丢失高保真回忆所需的细节。均匀扩展检索或源上下文虽能解决这些问题,却会增加上下文成本和干扰暴露风险。核心挑战在于如何为不同查询提供充分证据而非采用统一策略。
我们通过分离内存访问的两个维度来解决这一挑战:**发现广度**控制候选证据的搜索范围,**阅读保真度**判断紧凑记忆是否足够或需查阅原始对话。这种分离使系统能在不增加最终紧凑证据预算的前提下扩大搜索范围,并在压缩移除必要细节时恢复原始内容。
基于此框架,JustMem提供三种查询自适应访问配置:处理局部证据的**Lookup**、处理分布式证据的**Compose**以及处理保真度敏感证据的**Replay**。三者基于相同的紧凑原子记忆库,根据查询需求调用更广的发现范围或源内容恢复。在LoCoMo(Maharana等, 2024)、LongMemEval-S(Wu等, 2025)和LoCoMo-Plus(Li等, 2026)上的实验表明,JustMem在显著降低生成预算的同时实现了优异性能。对照实验进一步验证了全局原子访问、查询引导发现广度和自适应源恢复的独立优势。
我们的主要贡献包括:
- 将长期对话记忆形式化为沿**发现广度**和**阅读保真度**两维度的自适应证据分配;
- 提出JustMem可恢复原子记忆架构,自适应处理局部、分布式及保真度敏感证据需求;
- 通过受控评估验证记忆粒度、发现广度与阅读保真度的作用,证明自适应访问能在降低生成预算的同时实现优异性能。
## 2 相关工作
##### 记忆表示与维护
持久记忆通过外部记忆库、显著性遗忘机制及记忆层间的显式迁移实现(Zhong等, 2024;Packer等, 2023)。近期系统将记忆组织为链接笔记、分层短长期存储或动态事件结构(Xu等, 2026;Kang等, 2025;Banerjee等, 2026)。生成与反思智能体还将经验整合为高层记忆(Park等, 2023;Tan等, 2025)。这些方法主要改进对话经验的表示、组织或维护方式,而**JustMem专注于查询时的访问机制**:采用可恢复的紧凑记忆表示,并根据每个查询的证据需求自适应调整访问方式。
##### 记忆检索与读取
检索增强生成(RAG)将生成过程基于检索的外部证据(Lewis等, 2020),但长上下文研究显示,当证据与干扰项竞争时,添加相关文本并不能保证可靠利用(Liu等, 2024)。近期记忆系统引入自适应图遍历、事件-对话轮次层次、多工具检索或粗粒度检索后语义重排序(Van等, 2026;Cao等, 2026;Banerjee等, 2026;Zhang等, 2026)。这些方法推动了灵活记忆访问的研究,但更广检索与更高保真阅读带来不同成本并解决不同证据故障。**JustMem通过发现广度与阅读保真度区分这些需求**:广发现允许在固定紧凑读取预算下竞争更多证据,选择性源恢复仅在必要时引入更高保真上下文。这种分配为增强记忆访问提供了无需均匀扩展生成上下文的路径。
## 3 JustMem系统
长期对话查询不仅在**需要何种证据**上存在差异,更在**如何访问这些证据**上有所不同。部分问题依赖局部化证据,另一些需要跨记忆或会话的分布式证据,还有些需要紧凑记忆可能不再保留的细节(如先前生成的计划、代码或结构化助手输出)。我们从两个维度刻画这些需求:**发现广度**决定候选证据的搜索范围,**阅读保真度**判断紧凑记忆是否足够或需源级对话内容。当相关证据分散时需要更广发现,当关键细节可能在压缩中丢失时则需要更高保真阅读。
图2(https://arxiv.org/html/2609.19877#S3.F2)展示了JustMem通过三种查询自适应访问配置实例化这些维度:
- **Lookup**通过局部发现与紧凑阅读处理**局部证据**
- **Compose**在保持紧凑证据预算上限时扩展**分布式证据**的候选发现
- **Replay**通过选择性源恢复提高**保真度敏感证据**的阅读保真度
**图2:JustMem内存访问的两个维度**
Lookup使用局部发现与紧凑阅读;Compose扩展发现范围但保持紧凑证据预算上限;Replay通过选择性源恢复提高阅读保真度。
核心原则是**精准内存访问**:仅在查询要求时扩展发现或恢复源内容。
**图3:JustMem架构概览**
对话历史被编码为带有源对话溯源链接的紧凑原子记忆。推理时,结构化规划器估计证据需求并选择访问配置:局部证据使用Lookup、分布式证据使用Compose、保真度敏感证据使用Replay。选定的证据在紧凑记忆预算内提供给答案模型,仅在需要高保真阅读时恢复源内容。
基于此分配视角,JustMem围绕可恢复的紧凑记忆库组织内存访问(如图3所示)。查询时,它预测证据需求并选择相应的记忆访问方式。三种配置均基于相同的原子记忆表示。
### 3.1 可恢复记忆编码
对每个对话会话,JustMem从对话内容中提取一组原子记忆卡片。每张卡片包含紧凑记忆内容、时间信息、指向源对话的溯源链接,以及描述记忆类型和访问属性的轻量级元数据。同一会话的所有卡片及其属性通过单次提取模型调用联合生成。单个会话可能产生对应不同事实、事件、偏好、状态或交互的多张卡片。这里的“原子”指检索语义:每张卡片代表可独立检索和解释的信息单元。这种粒度使得单个记忆(包括来自同一会话的多张卡片)能在检索时全局竞争。
记忆类型保留后续访问所需的结构:事实记忆存储为显式主语的自然语言陈述,事件导向记忆额外保存显式主语和时间信息以支持组合访问。溯源机制使紧凑表示具有可恢复性:当卡片内容充分时可直接作为证据,而其溯源链接可在需要源级细节时提供原始对话访问。第5.2节(https://arxiv.org/html/2609.19877#S5.SS2)在固定记忆内容的前提下隔离了原子检索粒度的影响。
### 3.2 查询自适应内存访问
给定查询后,JustMem首先预测其证据需求,执行三种访问配置之一,并将选定证据提供给答案模型。答案基于这些证据生成,必要时按计划操作组合多个记忆。
#### 3.2.1 访问规划
规划器生成包含目标实体、时间约束及对检索证据操作指令的结构化检索规范。这些字段定义相关证据范围及选定证据的使用方式(包括直接查找、聚合、时间选择、排序或比较)。规划器额外预测两个二进制访问需求:
$$z_{q}=\begin{cases}\text{Replay},&f_{q}=1,\\ \text{Compose},&f_{q}=0\land d_{q}=1,\\ \text{Lookup},&\text{otherwise}\end{cases}$$ (1)
其中$z_{q}$为访问配置,$d_{q},f_{q}\in\{0,1\}$分别表示分布式证据需求和源保真度需求。对于分布式证据查询,规划器还会生成最多两个无答案检索改写,在保留原始查询实体和约束的同时提供互补视角。检索规范、访问需求指标和适用改写通过单次规划器调用联合生成。随后通过公式(1)(https://arxiv.org/html/2609.19877#S3.E1)的确定性规则分配访问配置,无需额外模型调用。因此模型预测结构化证据需求,固定规则则将这些需求映射为可解释的访问配置。第5.5节(https://arxiv.org/html/2609.19877#S5.SS5)比较了该自适应分配与固定Lookup、Compose和Replay配置的效果。
#### 3.2.2 Lookup:局部证据
对于可由局部证据支持的查询,Lookup通过与原始查询的语义相似度检索候选记忆。候选结果根据查询重排序并缩减为有限数量的紧凑记忆卡片。当答案相关证据可局部化且能通过紧凑记忆充分表示时,Lookup提供轻量级访问路径。
#### 3.2.3 Compose:分布式证据
对于证据可能分散在记忆或会话中的查询,Compose在选择前扩展候选发现范围。它形成多视图候选并集:
$$C_{q}=C(q)\cup\bigcup_{r\in R_{q}}C(r)$$ (2)
其中$C(x)$是检索视图$x$的候选集,$R_{q}$是查询$q$的改写集,$C_{q}$是去重后的并集。操作感知路由确定相关候选范围,改写则提供互补检索视角。所得候选缩减为固定紧凑证据预算:
$$E_{q}=\operatorname{Top}_{K}\left(\operatorname{Rerank}(q,C_{q})\right)$$ (3)
其中$\operatorname{Rerank}(q,C_{q})$根据$q$对候选排序,$\operatorname{Top}_{K}$保留最佳$K$张卡片,$E_{q}$是最终紧凑证据集。因此,更广发现改变了参与竞争的记忆范围,而不增加呈现给答案模型的紧凑卡片数量。第5.3节(https://arxiv.org/html/2609.19877#S5.SS3)在固定重排序器和最终证据预算的前提下评估了这一效果。
#### 3.2.4 Replay:保真度敏感证据
部分查询需要紧凑记忆能定位但无法完整保留的信息,典型如先前生成的代码、详细计划或结构化助手输出——其关键内容未被完全保留在短记忆卡片中。对于这类查询,Replay检索并重排序紧凑记忆以识别相关源对话。选定的卡片既作为紧凑证据,也作为源恢复的溯源锚点。
阅读保真度在查询层面控制:当规划器预测保真度敏感需求($f_{q}=1$)时,Replay遵循选定卡片的溯源...相似文章
T-Mem: 预见性记忆,而非归档式记忆
T-Mem 是一种新型长程对话记忆架构,能够同时支持描述性回忆和关联性回忆,涵盖查询与记忆共享表面特征的场景以及两者通过潜在语义弧相连的场景。该架构在 LoCoMo 和 LoCoMo-Plus 基准测试上达到了最先进水平。
Memora: 平衡抽象与具体性的和谐记忆表示
Memora 是一个可扩展的 AI 智能体记忆系统,它将存储与检索解耦,在长周期任务上实现了最先进的性能,同时使用的 token 数量减少了高达 98%。该研究发表于 ICML 2026。
Cognis:面向对话式 AI 智能体的上下文感知记忆系统
Lyzr Cognis 推出统一开源记忆系统,融合 BM25 与 Matryoshka 向量搜索并支持版本感知写入,在 LoCoMo 与 LongMemEval 基准上实现 SOTA。
SimpleMem: 面向大语言模型智能体的高效终身记忆
介绍SimpleMem,一种面向LLM智能体的高效记忆框架,利用语义无损压缩提升准确率并降低token消耗,F1分数提升26.4%,推理时token使用量减少高达30倍。
即时记忆:学习为LLM代理策展任务自适应记忆
本文介绍了即时记忆(JitMem),一种为LLM代理设计的方法,它将记忆策展推迟到读取时以实现任务自适应负载,展示了在ALFWorld和WebShop等基准测试中相对于基线方法的显著性能提升。