更少的上下文,更高的准确性:一种用于LLM代理的双时态记忆引擎,其中精简检索的上下文胜过了完整历史
摘要
本文介绍了Engram,一个开源的用于LLM代理的双时态记忆引擎,它通过检索一个紧凑的上下文片段(约9.6k token),在LongMemEval上以混合读取路径融合稠密、词汇、图和时间信号,比完整历史基线(79k token)高出10.4个准确率点。
arXiv:2606.09900v1 公告类型: 新
摘要: 长期记忆是LLM代理缺失的一层:跨会话时它们会遗忘,而常见的变通方法——将整个历史重放到提示中——昂贵、缓慢,并且随着干扰项的积累,准确性降低。大多数记忆系统在成本或延迟上胜出,但在准确性上仍输给全上下文基线,而且基准数字是在不一致、不可重复的测试工具上报告的,因此同一系统在不同来源上显示截然不同的分数。我们提出了Engram,一个基于双时态数据模型的开源双过程记忆引擎。快速写入路径以无损方式追加情节,关键路径上无需LLM;异步路径提取原子事实(主语、谓语、宾语),构建双时态知识图,并在无需每个事实调用LLM的情况下解决矛盾——失效但不删除,因此每个事实都保留来源和替代链。混合读取路径融合稠密、词汇、图以及新近/显著性信号,应用时间点(“截至”)过滤器,并组装成一个紧凑的、带有来源标签的上下文。在完整的500个问题的LongMemEval_S上,由官方类别特定评判器评分,Engram的精简配置——从约9.6k token的检索片段中回答,从不使用完整历史——得分为83.6%,而全上下文基线为73.2%(+10.4个百分点,McNemar p < 10^-6),token数量减少约8倍(9.6k对比79k),且0/500出现错误。这种增益需要混合读取路径:仅事实会丢失召回率,而事实加上检索的块能恢复细节。我们还贡献了一个中立的、仓库内的评估工具,内置官方评判器,并在每个表格中包含全上下文基线,发布原始逐问题日志,并记录测量完整性陷阱(截断、自建评判器、完整历史泄露),这些陷阱会悄然扭曲记忆基准。每个数字都附带可复现的命令。
查看缓存全文
缓存时间: 2026/06/10 06:09
# 一种用于LLM智能体的双时态记忆引擎:精简的检索上下文胜过完整历史 来源:https://arxiv.org/html/2606.09900 王柳音 独立研究者 通讯作者:liuyinwangthu@gmail\.com。代码、原始日志及可复现工具集:https://github.com/ly-wang19/engram。 (2026年6月) ###### 摘要 长期记忆是LLM智能体缺失的一层:跨会话时它们会遗忘,而常见的变通方法——将整个历史重放至提示中——不仅昂贵、缓慢,而且随着干扰项积累,准确度*反而降低*。大多数记忆系统在成本或延迟上胜出,但在准确度上仍然落后于全上下文基线,而且该领域的基准测试结果报告在不一致、不可复现的工具集上,因此同一系统在不同来源中得分相差悬殊。我们提出 **Engram**,一个基于双时态数据模型的开源双过程记忆引擎。快速写入路径在关键路径上无需LLM即可追加无损片段;异步整合路径提取原子化(主语、谓语、宾语)事实,构建双时态知识图谱,并在*无需*对每个事实调用LLM的情况下解决矛盾——采用失效(而非删除)机制,因此每个事实都保留来源和替代链。混合读取路径融合稠密、词法、图谱及时效/显著性信号,应用时间点(“as-of”)时态过滤器,并组装一个紧凑、带有来源标签的上下文。在完整的500问 **LongMemEval** 基准上,由*官方*按类别专属评判器评分,Engram的轻量配置——从约9.6k个token的检索切片(而非完整历史)作答——得分为83.6%,而全上下文基线为73.2%(+10.4个百分点,McNemar精确检验p<10⁻⁶),同时使用约8倍更少的token(9.6k vs. 79k),且500个问题中两者均无误。我们发现收益的关键在于读取路径是*混合式*的:仅事实的路径会丢失召回率,而事实加上检索到的原始片段则可恢复细节。除系统本身外,我们还贡献了一个中立、集成在仓库内的评估工具集,内置官方评判器,每张表中都包含全上下文基线,并发布了每个问题的原始日志——同时我们记录了那些会悄悄扭曲记忆基准测试得分的测量完整性陷阱(截断、自建评判器、完整历史“泄露”)。本文中的每个数字都附带可复现它的命令。 ## 1 引言 LLM智能体跨会话是无状态的。实用的修复方法——将整个对话历史拼接到提示中——在三个维度上同时扩展不佳:token成本随历史长度线性增长,延迟随之增加,而准确度*下降*,因为无关的轮次挤满窗口,模型被迫在干扰项中寻找“针”[12 (https://arxiv.org/html/2606.09900#bib.bib12)]。一个能够存储、结构化并有选择性地检索过去的长期记忆层是自然的替代方案,越来越多的系统正在探索这一方向[14 (https://arxiv.org/html/2606.09900#bib.bib14),15 (https://arxiv.org/html/2606.09900#bib.bib15),2 (https://arxiv.org/html/2606.09900#bib.bib2),16 (https://arxiv.org/html/2606.09900#bib.bib16),6 (https://arxiv.org/html/2606.09900#bib.bib6)];参见Du [4 (https://arxiv.org/html/2606.09900#bib.bib4)]的最新(2026年)综述。两个缺口依然明显。首先,**准确度**:大多数记忆系统的报告称比全上下文更便宜或更快,但*并非更准确*。在*准确度*上击败全上下文——一个精确检索的切片优于噪声完整的窗口——是更难也更有价值的目标,因为它将记忆从成本优化转变为质量提升。其次,**可复现性**:记忆基准测试在不一致的工具集上报告,使用不同的摄入、答案提示和评判器,因此同一系统可能因来源不同而显示58%、66%或92%的得分,不同论文给出矛盾的排序。在一个每个数字都受质疑的领域,一个任何人都能重新运行的中立工具集本身就是一项贡献。我们通过开源的记忆引擎 **Engram** 及其仓库内的评估工具集来解决这两个问题。我们的设计遵循一个原则——*我们无法复现的数字不存在*——以及一个组合论点:没有单一机制能获胜,因此我们组合了类型化记忆、双时态知识图谱、多信号检索融合、显著性衰减和异步整合,并在它们之间的缝隙处构建。 #### 贡献。 1. **一个双过程、双时态记忆引擎**(§3 (https://arxiv.org/html/2606.09900#S3)),具有廉价、非破坏性的冲突解决:被矛盾的事实会被*失效*(带有替代链和完整来源),从不覆盖,通常情况*无需*调用LLM即可解决。 2. **一个实证结果**:精简的检索上下文在准确度上击败全上下文(§5 (https://arxiv.org/html/2606.09900#S5)):在完整的500问 **LongMemEval** 上,在官方评判器下,**+10.4** 个百分点(83.6% vs. 73.2%),使用约8倍更少的token——即去除干扰项*提高*了准确度——同时发现*混合式*的事实加片段读取路径是关键(仅事实会丢失召回率)。 3. **一个中立、可复现的工具集**(§4 (https://arxiv.org/html/2606.09900#S4)):仓库内的一条流水线,内建官方评判器,每张表中包含全上下文基线,同一作答器和评判器自动应用于每个系统,并发布每个问题的原始日志。此外,我们记录了我们发现并修复的测量完整性陷阱。 4. **一个按类别分析**(§5 (https://arxiv.org/html/2606.09900#S5)),隔离出双时态建模的收益所在(知识更新 87.5%,时间推理 81.1%)以及尚存提升空间之处(多会话聚合、偏好)。 Engram 采用双重许可(AGPL-3.0 加商业许可),可自托管,并通过确定性离线回退实现零设置端到端运行——无需 API 密钥,无需外部服务——因此架构和演示可在无网络访问的情况下复现。 ## 2 相关工作 #### LLM智能体的记忆系统。 MemGPT[14 (https://arxiv.org/html/2606.09900#bib.bib14)] 将LLM视为一个操作系统,将内存分页进出有限的上下文窗口。生成式智能体[15 (https://arxiv.org/html/2606.09900#bib.bib15)] 引入带有重要性、时效性和相关性评分以及周期性反思的记忆流。Mem0[2 (https://arxiv.org/html/2606.09900#bib.bib2)] 针对生产环境智能体,采用可扩展的提取-存储记忆。Zep/Graphiti[16 (https://arxiv.org/html/2606.09900#bib.bib16)] 与 Engram 在精神上最接近:一种具有双时态边的时序感知知识图谱记忆。HippoRAG[6 (https://arxiv.org/html/2606.09900#bib.bib6)] 使用图谱加个性化 PageRank 进行多跳检索,其后续版本 HippoRAG 2[7 (https://arxiv.org/html/2606.09900#bib.bib7)] 将同一机制重新解释为非参数化连续记忆。最新的智能体记忆系统增加了 LLM 驱动的控制,以决定记忆如何写入和组织:A-MEM[21 (https://arxiv.org/html/2606.09900#bib.bib21)] 构建了一个相互链接的、卡片盒式笔记网络;MemoryOS[9 (https://arxiv.org/html/2606.09900#bib.bib9)] 强加了一个操作系统风格的短/中/长期层次结构;GAM[19 (https://arxiv.org/html/2606.09900#bib.bib19)] 将记忆编码与层次化图上的整合解耦。Engram 的不同之处在于*组合*了双时态图与混合式(事实 + 原始片段)读取路径以及一个明确、廉价的冲突解决策略,并且——特别地——提供了中立工具集,使得这些设计选择可以被测量而非断言的。 #### 长上下文与干扰项的成本。 “迷失在中间”[12 (https://arxiv.org/html/2606.09900#bib.bib12)] 表明 LLM 对长上下文的使用不均衡,当相关证据被埋藏在干扰项中时准确度下降。这正是我们主要结果所利用的机制:一个经过过滤、精确检索的切片可以*比*完整窗口*更准确*,而不仅仅更便宜。 #### 基准测试。 LongMemEval[18 (https://arxiv.org/html/2606.09900#bib.bib18)] 评估聊天助手在长期交互记忆上的表现,涵盖多个类别(单/多会话、知识更新、时间推理、偏好和弃权),并配有类别专属的评判提示。LOCOMO[13 (https://arxiv.org/html/2606.09900#bib.bib13)] 评估极长期对话记忆,最近的一些基准测试将场景扩展到多模态历史(Mem-Gallery[1 (https://arxiv.org/html/2606.09900#bib.bib1)])。我们在此报告 LongMemEval 上的结果,并将 LOCOMO 及其他骨干模型视为近期未来工作(§6 (https://arxiv.org/html/2606.09900#S6))。 #### 检索。 Engram 的读取路径建立在稠密检索[10 (https://arxiv.org/html/2606.09900#bib.bib10)]之上,使用现代稠密句子嵌入(BGE 系列[20 (https://arxiv.org/html/2606.09900#bib.bib20)];我们使用英文版 bge-small-en-v1.5),经典词法评分(BM25[17 (https://arxiv.org/html/2606.09900#bib.bib17)]),以及通过倒数排名融合进行排名融合[3 (https://arxiv.org/html/2606.09900#bib.bib3)],继承自检索增强生成传统[11 (https://arxiv.org/html/2606.09900#bib.bib11)]。双过程框架借鉴了认知科学中的系统1/系统2区分[8 (https://arxiv.org/html/2606.09900#bib.bib8)],显著性衰减借鉴了经典遗忘曲线[5 (https://arxiv.org/html/2606.09900#bib.bib5)]。 ## 3 Engram 系统 Engram 是一个双过程记忆系统:一个快速的在线写入路径(系统1)和一个慢速的异步整合路径(系统2),写入类型化、双时态的记忆,并由混合读取路径进行查询(图1 (https://arxiv.org/html/2606.09900#S3.F1))。 **add(消息)** → **系统1** · 热写入路径 · 无LLM · <50毫秒 → 追加无损片段 → 身份解析(会话/设备) → 轻量嵌入 → **系统2** · 异步整合 · 秒级 → 提取原子化事实 (s, p, o) → 构建双时态知识图谱 → 冲突检测 → 失效 → 显著性 + 衰减 → **类型化记忆** · 可插拔存储 → 片段性记忆 → 语义图(双时态) → 个人资料/身份 → 程序性记忆 → **读取路径** · 混合检索 · <100毫秒 → 查询分解(多跳) → 稠密 + BM25 + 图谱 + 时效性 → RRF融合(+重排序) → 双时态 as-of 过滤器 → 弃权门 → 组装上下文 → **搜索(查询)** → **答案就绪上下文** ← 异步队列 写入事实 检索 图1:Engram 双过程架构。热写入路径(系统1)从不阻塞于LLM;异步整合路径(系统2)提取原子化事实,构建双时态知识图谱,并以非破坏性方式解决冲突;两者都馈入由可插拔存储支持的类型化、双时态记忆;混合读取路径检索一个紧凑、带有来源标签的切片(稠密+词法+图谱+时效性,由RRF融合),应用 as-of 时态过滤器和弃权门,并组装答案上下文。 ### 3.1 双时态数据模型 两个时间轴是一等公民,这使得知识更新和“as-of”查询成为内在特性而非附加功能。 - **片段**——原始、无损的轮次/事件,带有*事件时间*(在现实中发生的时间)和*摄入时间*(事务时间,记录它的时间)。 - **事实**——原子化的(主语、谓语、宾语)声明,包含表面文本、嵌入向量、*显著性*和*置信度*,以及*来源*(来源片段ID)。它携带两个时间轴:*有效时间*(valid_at / invalid_at,声明在现实中为真的时间)和*事务时间*(created_at / expired_at,我们获知或撤回它的时间),以及一个指向它所替代事实的 supersedes 指针。 - **实体/关系**——图节点和边;边携带相同的双时态戳记。 不变量:*永远不硬删除被矛盾的事实——将其失效*(设置 invalid_at)并保留历史。每个事实因此可以回答“这从何而来?”以及“它替代了什么?”(图2 (https://arxiv.org/html/2606.09900#S3.F2))。 现实时间 t₀ t₁ 现在 **事实A:“在腾讯工作”** 保留 · 失效,未删除 valid_at = t₀ **事实B:“在月之暗面AI工作”** ... invalid_at = t₁ valid_at = t₁ supersedes **as-of t₀:** “X在哪里工作?” ⇒ 腾讯 **as-of 现在:** “X在哪里工作?” ⇒ 月之暗面AI 图2:双时态事实使得矛盾和“as-of”查询成为一等公民。当事实B在t₁到达时,Engram 设置 A.invalid_at = t₁ 和 B.supersedes = A:事实A被*失效,而非删除*,因此历史(及来源)得以保留。一个时间点查询随后针对该时间的有效事实进行解析——在t₀时为腾讯,在现在时为月之暗面AI——这正是知识更新和时间推理类别所需要的。 ### 3.2 系统1:热写入路径 在 add(消息) 上,Engram 追加一个无损片段,解析身份(将会话和跨设备链接用户/实体),计算轻量嵌入,并将片段入队等待整合。此路径上不运行LLM,使延迟保持在50毫秒以内,从而写入永远不会阻塞智能体。 ### 3.3 系统2:异步整合 在关键路径之外,整合引擎(i)从片段中提取原子化事实(默认基于规则,配置模型时也可基于LLM),(ii)构建双时态知识图谱(实体和关系),(iii)检测冲突并失效被替代的事实,以及(iv)评分显著性并应用衰减/强化,从而使未强化记忆淡出,存储保持小巧快速。层次化抽象(会话摘要→个人资料)也在此运行。 ### 3.4 廉价-升级式冲突解决 当一个新的事实到达时,对于现有的(主语、谓语)槽位且对象不同,Engram 按成本递增的顺序进行解决: 1. **槽位匹配**(精确)表明可能是更新;**嵌入相似度**捕获在不同自由形式谓语下的同一属性;**内容包含**(一个声明⊆另一个)将矛盾与详述区分开来。 2. 如果声明明显矛盾且存在时序顺序,则失效旧事实(old.invalid_at ← new.valid_at)并设置 new.supersedes ← old.id。*无需LLM调用。* 3. 只有在真正模棱两可的情况下才升级到LLM裁决器。 这是相对于在每个事实上都调用LLM的系统的成本优势,同时保持了生产级别的时序正确性和完整的审计轨迹。 ### 3.5 混合读取路径 在 search(查询) 上,Engram(1)理解查询,对于多跳问题,将其分解为子查询;(2)通过四个互补通道并行检索——稠密语义、BM25词法、从查询实体出发的图 n 跳、以及时效性/显著性;(3)使用倒数排名融合[3 (https://arxiv.org/html/2606.09900#bib.bib3)](以及可选的交叉编码器对 top-k 重排序,默认关闭)融合排序列表;(4)应用双时态“as-of”过滤器(在时间 T 时我们认为什么是真的);(5)通过弃权门,当证据缺失时拒绝回答;(6)组装去重、带有来源标签、符合 token 预算的上下文。每个项目的得分结合所有信号: \[ \text{score}(item \mid q) = w_{\text{sem}} \cos(q, item) + w_{\text{lex}} \text{bm25}(q, item) + w_{\text{graph}} \text{prox}(item) + w_{\text{rec}} e^{-\Delta t / \tau} + w_{\text{sal}} \text{sal}(item), \]相似文章
更少上下文,更智能代理:面向长周期工具使用的LLM代理的高效上下文工程
本文评估了企业工具使用工作流中LLM代理的上下文工程配置,表明选择性修剪的摘要化相比全上下文基线实现了91.6%的准确率,同时将令牌使用量减少了60%以上。
SimpleMem: 面向大语言模型智能体的高效终身记忆
介绍SimpleMem,一种面向LLM智能体的高效记忆框架,利用语义无损压缩提升准确率并降低token消耗,F1分数提升26.4%,推理时token使用量减少高达30倍。
RecMem:基于重复的记忆整合方法,用于高效且有效的长期运行LLM智能体
RecMem是一种基于重复的记忆整合方法,适用于长期运行的LLM智能体,通过仅在语义相似的交互重复出现时调用LLM,可减少高达87%的令牌消耗,同时提高准确性。
Mem0:利用可扩展的长期记忆构建生产就绪的 AI 智能体
Mem0 引入了一种基于图表示的可扩展内存中心架构,旨在提升大语言模型(LLM)在长期对话中的连贯性,在显著降低延迟和 Token 成本的同时,性能优于现有的记忆系统。
面向长周期LLM智能体的选择性记忆保留
本文提出TraceRetain,这是一个用于冻结LLM智能体中绑定外部存储的轻量级框架,表明选择性记忆保留主要在记忆流包含噪声时与缓存启发式方法区分开,从而带来任务成功率和效率的提升。