T-Mem: 预见性记忆,而非归档式记忆
摘要
T-Mem 是一种新型长程对话记忆架构,能够同时支持描述性回忆和关联性回忆,涵盖查询与记忆共享表面特征的场景以及两者通过潜在语义弧相连的场景。该架构在 LoCoMo 和 LoCoMo-Plus 基准测试上达到了最先进水平。
arXiv:2606.15405v1 公告类型:新论文
摘要:长程记忆对于对话智能体在长时间对话中保持连贯性、执行多轮会话前的承诺以及适应每个用户的行为至关重要。然而,当前基于大语言模型的长程对话记忆在可达性上受限于查询与存储内容之间的相似性(包括词汇和密集向量)。当查询和记忆共享表面特征(如措辞或命名实体,我们称之为描述性回忆)时,这种方法有效。但它忽略了另一类同样有价值的情况:查询和记忆不共享表面特征,仅通过潜在语义弧(关联性回忆)相连。在这一方面,现有的长程记忆系统普遍失败。覆盖这另一半使得助手能够首次主动将过去的对话作为语义资产加以利用。在记忆方面,这相当于认知科学中所称的“情景未来思维”的工程实现:为未来需要找到的上下文预演过去的经历。我们将这种写入时的预演称为触发机制。我们提出 T-Mem,这是首个同时支持描述性回忆和关联性回忆的长程对话记忆架构。在两种证据粒度(单个事实和完整对话交换)上,T-Mem 各自实例化一个描述性触发族和一个关联性触发族,使得每条记忆都能通过表面相似和相关性约束的查询被访问。作为实证验证,T-Mem 在 LoCoMo 和 LoCoMo-Plus 上都达到了最先进水平。
查看缓存全文
缓存时间: 2026/06/16 11:47
# T-Mem:预见而非归档的记忆
来源:https://arxiv.org/html/2606.15405
Weidong Guo Dakai Wang Zixuan Wang Hui Liu Yu Xu 腾讯
{weidongguo, dkkatzewang, zzixuanwang, pvopliu, henrysxu}@tencent.com
###### 摘要
长期记忆对于对话代理在多轮对话中保持连贯性、兑现若干会话前做出的承诺,以及根据每个用户调整其行为至关重要。然而,当前基于大语言模型的长期对话记忆,其可访问性受到查询与存储内容之间相似度(无论是词法相似度还是稠密向量相似度)的约束。当查询和记忆共享表面特征(如措辞或命名实体,我们称之为描述性关联)时,这种方法非常有效。但它忽略了另一类同样重要的情况:查询和记忆不共享表面特征,仅通过潜在语义脉络(关联性关联)联系在一起。对于这种情况,现有的长期记忆系统集体失效。覆盖这一半的情况,才能首次使助手能够主动将过去的对话作为语义资产加以利用。在记忆端,这对应于认知科学中所谓的情景未来思维的工程实现:预演过去的经验,以便在未来需要找到它们的上下文中能被访问。我们将这些写入时的预演称为触发标记。我们提出T-Mem,这是首个同时覆盖描述性回忆和关联性回忆的长期对话记忆架构。在两种证据粒度(单个事实和完整对话片段)上,T-Mem 各自实例化了一个描述性触发标记族和一个关联性触发标记族,使得每条记忆既可通过表面相似的查询访问,也可通过相关性约束的查询访问。实证验证表明,T-Mem 在 LoCoMo 和 LoCoMo-Plus 基准上都达到了最优水平。
T-Mem:预见而非归档的记忆
Weidong Guo Dakai Wang Zixuan Wang Hui Liu Yu Xu
腾讯
{weidongguo, dkkatzewang, zzixuanwang, pvopliu, henrysxu}@tencent.com
††脚注:我们的源代码将在论文接收后发布。
## 1 引言
围绕大语言模型构建的外部长期记忆模块,能让对话助手将每个新对话轮次与过去的内容重新连接:当用户后来使用相似的措辞、提到相同的实体、或锚定相同的时间和地点时,应能正确检索到相应的存储记忆。我们将这种机制称为描述性回忆。平面检索增强生成 (Lewis 等人,2020 (https://arxiv.org/html/2606.15405#bib.bib7))、图和超图结构化记忆 (Edge 等人,2024 (https://arxiv.org/html/2606.15405#bib.bib3); Yue 等人,2026 (https://arxiv.org/html/2606.15405#bib.bib15))、智能体分层记忆 (Chhikara 等人,2025 (https://arxiv.org/html/2606.15405#bib.bib2); Xu 等人,2025 (https://arxiv.org/html/2606.15405#bib.bib13)),以及操作系统风格的记忆内核 (Packer 等人,2023 (https://arxiv.org/html/2606.15405#bib.bib10); Li 等人,2025 (https://arxiv.org/html/2606.15405#bib.bib8); Wang 和 Chen,2025 (https://arxiv.org/html/2606.15405#bib.bib12)) 都采用相同的检索方案:将查询和存储内容投影到单一的相似度空间(词法 BM25 或稠密向量嵌入),并取最相似的 Top-K 个结果。这些系统在结构上差异很大,但占据着检索设计空间的同一区域(图1 (https://arxiv.org/html/2606.15405#S1.F1),描述性半区)。
参见图注
图 1:跨粒度(项目/场景)和取向(描述性/关联性)的触发标记设计空间。先前的系统集中在描述性(右侧)半区;T-Mem 在每个象限实例化一个触发标记。
然而,长程对话中还存在着另一种同样常见的查询-记忆关系:查询和目标之间没有共享任何表面形式;连接它们的是一个潜在语义脉络,例如因果关系或共同情境的延续。我们将这种机制称为关联性回忆,源自人类关联性记忆中长期研究的线索绑定检索 (Anderson 和 Bower,2014 (https://arxiv.org/html/2606.15405#bib.bib1))。举个例子,一个月前用户提到“我团队里有个同事对海鲜严重过敏”;今天用户问“今晚我们带团队去哪里吃饭好?”这两条消息没有共享任何表面形式,但第一条正是第二条必须依赖的信息。在长期对话中,用户很少会用几周前使用的相同措辞重新提起旧话题;他们通常通过新情境触发的间接线索来重新审视旧话题 (Xu 等人,2022b (https://arxiv.org/html/2606.15405#bib.bib29); Maharana 等人,2024 (https://arxiv.org/html/2606.15405#bib.bib9))。相似性搜索,按其构造,只能沿着词法或语义距离收敛;一个表面形式已经偏离的目标,永远无法从相同的邻域中到达。
展开这一观察,我们得到一个取向轴,取向 ∈ {描述性,关联性}。这个轴并非孤立存在:查询所依赖的证据也具有两种自然的粒度。有些查询询问单个事实(例如,“Calvin 的东京音乐会在哪一周?”),并在项目层回答。其他查询询问一段连贯的对话(例如,“我们上次讨论 Calvin 巡演时还提到什么?”),并在场景层回答。粒度轴适用于取向的两侧,因此与取向正交,形成了一个 2×2 的检索空间(图1 (https://arxiv.org/html/2606.15405#S1.F1))。现有的记忆系统集中在象限 I(项目 × 描述性),最近基于图的系统已扩展到象限 IV(场景 × 描述性);象限 II 和 III,即关联性半区,仍然是结构上的盲点。
我们提出 T-Mem,这是首个覆盖所有四个象限的长期对话记忆架构。T-Mem 以两种证据粒度组织记忆:场景(一段连贯的对话)和项目(从场景中提取的原子事实)。在这个证据层之上,T-Mem 为每个象限实例化一个触发标记族——实体(Q I)、桥梁(Q II)、地平线(Q III)和场景(Q IV);桥梁和地平线正是填补上述关联性盲点的两个家族。所有四个家族都由一个记忆构建大语言模型在写入时离线预计算,并与其宿主项目或场景一起存储。这将“什么使记忆可访问”与“在回答时什么算作证据”解耦:当查询无法再通过相似性到达宿主时,它仍然可以通过其某个触发标记定位到宿主。因此,每条记忆既可以从描述性相似的查询访问,也可以从关联性相关的查询访问。
我们的贡献总结如下:
(i) 我们表明,现有的长期对话记忆系统共享一个单一的基于相似性的检索方案,因此仅覆盖粒度 × 取向设计空间的描述性半区(Q I 和 Q IV);关联性回忆(Q II 和 Q III)是该方案的结构性盲点。
(ii) 我们提出 T-Mem,一种在索引层填补这一盲点的长期对话记忆架构:在场景-项目证据层之上,T-Mem 在设计空间的每个象限实例化一个写入时触发标记族,将所有四个象限纳入一个系统。
(iii) 实证上,T-Mem 在 LoCoMo (80.26%) 和 LoCoMo-Plus (74.81%) 上都达到了最优水平,并将跨基准差距从现有系统的 28-50 个百分点缩小到 5.45 个百分点。
## 2 相关工作
长期对话记忆已收敛到四个广泛的设计家族 (Zhang 等人,2024 (https://arxiv.org/html/2606.15405#bib.bib25))。我们沿着第 1 节 (https://arxiv.org/html/2606.15405#S1) 中使用的两个轴组织先前的工作:粒度(项目 vs. 场景)和取向(描述性 vs. 关联性)。
### 2.1 长期记忆架构
(i) 平面 RAG。检索增强生成 (Lewis 等人,2020 (https://arxiv.org/html/2606.15405#bib.bib7)) 将对话流分块并建立稠密索引,通过查询嵌入进行检索;这是所有后续家族构建的基线。
(ii) 图、超图和时序图结构化记忆。第二个家族增加了显式结构:用于面向查询摘要的知识图谱 (GraphRAG Edge 等人,2024 (https://arxiv.org/html/2606.15405#bib.bib3) 及其变体 Guo 等人,2025 (https://arxiv.org/html/2606.15405#bib.bib5); Gutiérrez 等人,2025 (https://arxiv.org/html/2606.15405#bib.bib6))、用于智能体记忆的时序图 (Zep Rasmussen 等人,2025 (https://arxiv.org/html/2606.15405#bib.bib11)),以及覆盖主题-情节-事实层次结构的超边 (HyperMem Yue 等人,2026 (https://arxiv.org/html/2606.15405#bib.bib15))。
(iii) 智能体分层记忆。第三个家族将会话浓缩为细粒度笔记,并逐步合并:基于遗忘曲线的用户事实 (MemoryBank Zhong 等人,2024 (https://arxiv.org/html/2606.15405#bib.bib14))、面向生产的事实层 (Mem0 Chhikara 等人,2025 (https://arxiv.org/html/2606.15405#bib.bib2))、笔记间的动态重新链接 (A-MEM Xu 等人,2025 (https://arxiv.org/html/2606.15405#bib.bib13)),以及轻量级 (Fang 等人,2025 (https://arxiv.org/html/2606.15405#bib.bib4)) 和自主增强 (Salama 等人,2025 (https://arxiv.org/html/2606.15405#bib.bib21); Huang 等人,2026 (https://arxiv.org/html/2606.15405#bib.bib22)) 变体。
(iv) 操作系统风格记忆内核。第四个家族将记忆视为具有显式调度和分页策略的分层存储,以 MemGPT (Packer 等人,2023 (https://arxiv.org/html/2606.15405#bib.bib10))、MemOS (Li 等人,2025 (https://arxiv.org/html/2606.15405#bib.bib8)) 和 MIRIX (Wang 和 Chen,2025 (https://arxiv.org/html/2606.15405#bib.bib12)) 为代表。
这些家族一起占据了图1 (https://arxiv.org/html/2606.15405#S1.F1) 的象象限 I 和 IV:仅项目系统(平面 RAG、智能体堆栈、大多数操作系统内核)位于 I,结构化记忆扩展到 IV。象限 II 和 III 仍然系统地未被充分服务。
### 2.2 认知线索记忆访问
另一条独立的脉络借鉴了经典关联性记忆 (Anderson 和 Bower,2014 (https://arxiv.org/html/2606.15405#bib.bib1)),其中回忆是线索驱动的:当前话语通过习得的关联(而非表面相似性)激活一个时间上遥远的情节。这与认知科学中所谓的情景未来思维一致 (Suddendorf 和 Corballis,2007 (https://arxiv.org/html/2606.15405#bib.bib19); Addis 和 Schacter,2008 (https://arxiv.org/html/2606.15405#bib.bib20)),其中过去的经验被预演以应对未来的线索。LoCoMo (Maharana 等人,2024 (https://arxiv.org/html/2606.15405#bib.bib9)) 和 LoCoMo-Plus (Li 等人,2026 (https://arxiv.org/html/2606.15405#bib.bib16)) 在评估侧实现这种面向未来的观点;T-Mem 在检索侧实现它,其中桥梁和地平线触发标记分别占据象限 II 和 III。
### 2.3 角色和画像记忆
一组互补的工作将每个说话者的画像视为长格式对话的一等公民。基于角色的基准 (Zhang 等人,2018 (https://arxiv.org/html/2606.15405#bib.bib26); Mazaré 等人,2018 (https://arxiv.org/html/2606.15405#bib.bib27)) 确立了说话者携带可在轮次间检索的结构化属性,长程变体 (Xu 等人,2022a (https://arxiv.org/html/2606.15405#bib.bib28), b (https://arxiv.org/html/2606.15405#bib.bib29); Jang 等人,2023 (https://arxiv.org/html/2606.15405#bib.bib30)) 认为这些画像应该跨远距离会话聚合。MemoryBank (Zhong 等人,2024 (https://arxiv.org/html/2606.15405#bib.bib14)) 和 Mem0 (Chhikara 等人,2025 (https://arxiv.org/html/2606.15405#bib.bib2)) 在智能体记忆系统内实现了这一观点。我们将此功能视为互补,而非细粒度回忆的替代品:T-Mem 包含一个每个说话者的画像,用于填补稀疏触发标记输出留下的画像覆盖缺口。
参见图注
图 2:T-Mem 框架。构建流水线分割场景,分配主题,提取项目,并为每个象限实例化一个触发标记族(场景节点的颜色指示主题成员身份)。检索级联执行自顶向下的主题 → 场景 → 项目选择,并带有关联性触发标记增强。
## 3 方法
我们将 T-Mem 设计为一种按检索能力(而非存储形式)组织的记忆架构,每个组件分配给第 1 节 (https://arxiv.org/html/2606.15405#S1) 线索-记忆空间的一个象限。图2 (https://arxiv.org/html/2606.15405#S2.F2) 给出了概览;本节分三个部分进行:类型化记忆结构、四阶段构建流水线和自顶向下的检索级联。
表 1:一个工作示例:两个不同日期的场景归入一个主题,锚定了一个项目——Gina 的店铺扩张——该项目依赖于这两个场景。画像行聚合了单个项目无法独立携带的说话者属性。
### 3.1 记忆结构
T-Mem 操作五种对象(表1 (https://arxiv.org/html/2606.15405#S3.T1) 给出了一个工作实例)。我们在给出统一总结之前逐一介绍它们。
* 场景 (V^S):从对话流中分割出的连贯交流;在回答时作为证据传递给 QA 大语言模型。
* 项目 (V^I):从场景中提取的原子事实,通过 E^SI 锚定到一个或多个宿主场景;在回答时也作为证据传递给 QA 大语言模型。原子项目附加到单个源场景,而连接项目则附加到它从中提取的每个源场景。
* 主题标签 (V^T):由轻量级主题模块产生的多标签标记,通过 E^TS 连接到场景。主题标签仅用于限定项目提取的范围和在检索时预过滤场景池;QA 大语言模型永远不会读取它们。
* 四个触发标记族:实体和桥梁作用于项目;场景和地平线作用于场景:设计空间每个象限一个(第 1 节 (https://arxiv.org/html/2606.15405#S1));它们仅参与检索。
* 画像 (X):每个说话者稳定特征的摘要,跨整个对话聚合。它作为通用上下文注入到回答时的检索通道之外,附加在检索到的场景和项目之后,而不是与检索预算竞争。
将这五种对象放在一起,T-Mem 将对话记忆存储为类型化元组
M = (V^T ∪ V^S ∪ V^I, E^TS ∪ E^SI, T^Ent ∪ T^Brg ∪ T^Scn ∪ T^Hor, X) (1)
三个设计承诺塑造了这个对象:证据层保持类型隔离,以便场景和项目可以各自在其粒度上被检索;主题标签保持在 QA 通道之外,以便预过滤不会污染证据;触发标记保持在证据路径之外,以便“如何到达记忆”与“到达什么”解耦。
### 3.2 记忆构建
M 由一个四阶段流水线产生:场景分割、主题分配、项目提取、以及触发标记生成。场景由角色自注意函数 (Gao 和 Wan,2022 (https://arxiv.org/html/2606.15405#bib.bib4)) 配合低预算语言模型分割:当相邻话语中所有角色之间的平均注意权重低于阈值时,系统在此处切割;这比统一的令牌或轮次窗口更好地遵循主题边界。每个场景被压缩成一个语义摘要s_i。主题通过嵌入s_i并执行基于密度的聚类来分配,标签通过聚类中心附近的话语焦点词生成 (参见附录 B (https://arxiv.org/html/2606.15405#S7.B));主题管理是预算友好的,每个场景仅需一次轻量级建模调用。
项目提取以主题为条件:聚合每个主题下的场景摘要,并要求一个大语言模型枚举所有原子事实。这给出了一个主题绑定的证据根,允许系统跨对话周期链接事实,而无需全局关系推理。然后每个事实被声明为原子(它追踪单个上下文)或连接(它从两个或多个场景中汇总证据);这种区分依赖于结构分析:系统验证事实的适用场景集。原子事实被分配一个单元素锚,而连接事实被分配一个多元素锚,每个元素指向一个源场景。当一个事实的适用场景曾经被遗忘时,它的锚会衰减,允许这个连接事实萎缩回原子状态。
触发标记生成在每个场景和项目上独立运行,由结构化提示指导(完整的提示模板在附录 A (https://arxiv.org/html/2606.15405#S7.A) 中)。对于每个项目,大语言模型被要求生成:(i) 实体触发标记(具有高精确度的关键条目名称),以及 (ii) 桥梁触发标记(在语义上不同的遥远上下文中可能重新出现的功能等价物)。对于每个场景,它被要求生成:(iii) 场景触发标记(场景的高级抽象/摘要,独立于具体措辞),以及 (iv) 地平线触发标记(一个可能在未来引发回忆的未来/假设情况)。为了确保场景触发标记为条目化查询提供粒度,系统约束它们列出场景的关键元素;地平线触发标记是自由形式,不需要遵循任何结构。所有四个家族的生成都是非自回归的(一次提示中的集体枚举);给定的项目或场景的触发标记计数由大语言模型决定。
在最后一步,画像被组装:跨对话聚合所有话语,并询问一个大语言模型推断每个说话者的稳定特征(个性特征、行为偏好、已知关系和约束;再次参见附录 A (https://arxiv.org/html/2606.15405#S7.A) 中的提示)。这为用户提供一个微妙的画像,并作为检索失败的软备用。
### 3.3 记忆检索:自顶向下级联
给定一个查询,T-Mem 执行分层检索来定位证据:
1. 主题过滤。查询嵌入(使用 text-embedding-3-small)根据聚类质心进行评分;选择前 k_T 个主题。主题标签被编码为质心嵌入;由于聚类已经完成,这简化为最近的质心查找。
2. 场景检索。在选定主题的场景内,场景摘要根据查询嵌入进行评分;选择前 k_S 个场景。使用场景摘要作为检索键,将检索限制为每个主题内的最近场景——一个较窄的池,需要较少的全局相似性搜索。
3. 项目选择。从选定的场景中获取锚定项目;它们被打包为内部集合。选择前 k_I 个场景,其中场景分数由其摘要和查询嵌入之间的余弦距离给出。同时,为了确保场景内的叙事连贯性,我们还选择它们的时间邻居(相邻的场景),这作为常规检索之上的备用语义缓冲。
4. 触发标记增强。在项目嵌入评分之上,系统计算每个项目的实体和桥梁触发标记与查询之间的余弦相似度。如果任何触发标记达到相似度阈值(由在验证集上的强健性优化设定的 0.47 的全局超参数),则该项目被提升到检索集中。这个操作恢复了当纯语义嵌入未能识别关联线索时被丢弃的项目。对场景执行相同的过程,使用场景和地平线触发标记;如果超过阈值,则提升场景。
通过这个过程,检索集包含来自直接语义匹配的证据和通过触发标记检测到的语义上遥远但相关的证据。当所有通道(包括触发标记)产生空集或分数低于最低阈值时,画像 X 充当备用上下文,确保记忆系统永远不会返回空洞。最后,这个集合同查询本身以及画像一起被输入到 QA 大语言模型中,以生成最终答案。相似文章
Memanto:面向长周期智能体的类型化语义记忆与信息论检索
Memanto 引入了一个基于模式(schema)、冲突解决机制以及 Moorcheh 信息论检索引擎的类型化语义记忆系统,在 LongMemEval 和 LoCoMo 基准测试中取得了最先进的结果,且零摄入成本、延迟低于 90 毫秒。
@dair_ai: // 记忆即模型 // 该论文为任何LLM增加一个单独训练的记忆模型,用于存储、检索和整合…
MeMo 引入了一种模块化记忆模型,可为任何 LLM 增强存储、检索和整合新知识的能力,无需重新训练或担心灾难性遗忘。它在 BrowseComp-Plus、NarrativeQA 和 MuSiQue 等基准测试上优于基于 RAG 的方法。
Cognis:面向对话式 AI 智能体的上下文感知记忆系统
Lyzr Cognis 推出统一开源记忆系统,融合 BM25 与 Matryoshka 向量搜索并支持版本感知写入,在 LoCoMo 与 LongMemEval 基准上实现 SOTA。
H-Mem:一种通过混合结构实现智能体记忆演化与检索的新型记忆机制
H-Mem是一种面向基于LLM的智能体的新型记忆机制,采用时间-语义树与知识图谱相结合的混合结构,以建模记忆演化并提升检索性能,在问答基准上实现了最先进水平。
Memora: 平衡抽象与具体性的和谐记忆表示
Memora 是一个可扩展的 AI 智能体记忆系统,它将存储与检索解耦,在长周期任务上实现了最先进的性能,同时使用的 token 数量减少了高达 98%。该研究发表于 ICML 2026。