CueMem:基于线索引导的长期对话记忆上下文重建
摘要
CueMem 是一个针对长期对话记忆的线索引导框架,它使用检索线索重建对话上下文,以提升在 LLM 驱动的代理中的性能。
arXiv:2609.12354v1 公告类型:新
摘要:长期对话代理必须通过从扩展对话历史中回忆信息来回答用户查询,但直接使用完整历史记录成本高且往往不可靠,而压缩的记忆单元可能会丢失问答所需的细粒度证据。受自传体记忆重构观点的启发,我们提出了 CueMem,一个线索引导框架,该框架将提取的记忆记录视为检索线索而非自包含证据,并从其源轮次中重建查询相关的对话上下文。在记忆构建阶段,CueMem 从对话轮次中提取细粒度记忆线索,并将每个线索链接到其源轮次。在查询时,它检索查询相关的线索,将它们映射到源轮次锚点,并在捕捉时间接近性和语义相关性的轮次图上从这些锚点扩展,从原始对话中重建紧凑的证据上下文,以供 LLM 生成答案。在 LoCoMo 和 LongMemEval 上的实验表明,CueMem 一致优于代表性的长期记忆基线。进一步的分析显示,基于图的上下文重建有助于恢复支持性对话证据,同时与完整历史记录的 LLM 设置相比,减少了查询时的输入令牌和延迟。这些结果突出了检索线索作为长期对话问答中自包含记忆证据的有效替代方案。
查看缓存全文
缓存时间: 2026/09/14 08:34
# CueMem:基于线索引导的上下文重建以实现长期对话记忆 来源:https://arxiv.org/html/2609.12354 常建 王 | 单位:马上消费金融股份有限公司 | 单位:哈尔滨工业大学(深圳) | 邮箱:[[email protected]](mailto:[email protected]) 魏立 关 | 单位:哈尔滨工业大学(深圳) 书明 石 | 单位:马上消费金融股份有限公司 全 陆 | 单位:马上消费金融股份有限公司 宁 姜 | 单位:马上消费金融股份有限公司 ###### 摘要 长期对话代理必须通过回忆扩展的对话历史来回答用户查询,然而直接使用完整历史成本高昂且往往不可靠,而压缩的记忆单元可能丢失问答所需的细粒度证据。受自传体记忆重构观点的启发,我们提出了 CueMem,这是一个线索引导的框架,它将提取的记忆记录视为检索线索,而非自包含的证据,并从其源对话轮次中重建与查询相关的对话上下文。在记忆构建阶段,CueMem 从对话轮次中提取细粒度记忆线索,并将每个线索链接到其源轮次。在查询时,它检索与查询相关的线索,将其映射到源轮次锚点,并从这些锚点出发,在一个捕捉时间邻近性和语义相关性的轮次图上进行扩展,从原始对话中重建紧凑的证据上下文,供大语言模型生成答案。在 LoCoMo 和 LongMemEval 上的实验表明,CueMem 持续优于具有代表性的长期记忆基线模型。进一步的分析表明,基于图的上下文恢复有助于找回支持性对话证据,同时与完整历史输入的大语言模型设置相比,减少了查询时的输入标记数和延迟。这些结果凸显了检索线索作为自包含记忆证据的有效替代方案,可用于长期对话问答。 ## 1 引言 图 1:记忆单元与记忆线索的示例对比。粗糙的记忆单元可能因压缩或混合语义表示而丢失细粒度的语义信息,例如,一个“旅行规划”记忆单元可能合并了目的地、预算和酒店偏好,使得难以获取用户查询所需的证据。相比之下,链接到源轮次的细粒度记忆线索提供了聚焦的检索目标,使系统能够恢复相关的源轮次 T2,并重建回答 Lakeside Town 所需的对话上下文。 大语言模型(LLMs)近年来发展迅速(Achiam 等人, 2023 (https://arxiv.org/html/2609.12354#bib.bib19); Yang 等人, 2025 (https://arxiv.org/html/2609.12354#bib.bib20)),极大地提升了由大语言模型驱动的对话代理的能力。在现实场景中,对话往往是长时间、多轮次的,要求代理通过有效利用长期对话历史来回答用户查询。由于上下文长度限制、噪声信息、“中间丢失”现象(Liu 等人, 2024 (https://arxiv.org/html/2609.12354#bib.bib11))以及增加的推理延迟,天真地整合全部交互历史通常是无效的。因此,如何建模和利用长期对话记忆已成为对话代理面临的主要挑战。 现有方法通常通过对对话历史进行分段、压缩、摘要或提取显著信息来构建可检索的记忆单元,并检索最相关的单元作为生成的上下文(Zhong 等人, 2024 (https://arxiv.org/html/2609.12354#bib.bib17); Pan 等人, 2025 (https://arxiv.org/html/2609.12354#bib.bib21); Fang 等人, 2026 (https://arxiv.org/html/2609.12354#bib.bib5))。然而,此类记忆单元通常仍是原始对话的压缩或去上下文化片段,并且基于向量的索引可能将多个语义信号纠缠在一个密集表示中。更重要的是,许多现有系统将检索到的记忆单元视为用于生成的自包含证据。这种设计与自传体记忆的重构观点形成对比,后者认为回忆是由线索引导,并从更广泛的自传体知识库中重构的(Conway 和 Rubin, 1993 (https://arxiv.org/html/2609.12354#bib.bib18); Conway 和 Pleydell-Pearce, 2000 (https://arxiv.org/html/2609.12354#bib.bib1); Holland 和 Kensinger, 2010 (https://arxiv.org/html/2609.12354#bib.bib2))。 例如,如图 1(https://arxiv.org/html/2609.12354#S1.F1)所示,一个现有的记忆系统可能将几个关于目的地、预算和酒店偏好的轮次组合成一个关于“旅行规划”的记忆单元。然而,后续的查询如“我们之前提到过的哪个地方我妈妈会喜欢?”仅针对这个主题的细粒度方面,使得检索变得困难,因为相关信号与同一可检索单元内的多个其他语义混合在一起。相比之下,诸如“用户妈妈喜欢安静的地方”这样的细粒度线索提供了更聚焦的检索目标,并能引导系统回到原始的对话轮次以重建上下文。受此认知视角启发,我们认为长期对话记忆应遵循类似的检索-重构过程:首先识别与当前查询匹配的细粒度线索,然后在生成答案之前恢复这些线索周围的原始对话上下文。 在本文中,我们提出了 CueMem,这是一个简单有效的长期对话代理记忆系统,其灵感来源于自传体记忆的重构观点。CueMem 首先从对话轮次中构建细粒度记忆线索,每个线索作为一个语义聚焦的检索目标,链接到其源轮次。给定用户查询,CueMem 检索最相关的线索,并使用它们的源轮次作为上下文重建的锚点。为了恢复支持性证据,CueMem 构建了一个轮次图,该图根据时间邻近性和语义相似性连接对话轮次,并从锚点轮次出发,在该图上扩展以收集查询相关的对话上下文。最后,将重建的上下文提供给大语言模型,作为答案生成的记忆证据。我们在两个长期对话问答基准测试 LoCoMo(Maharana 等人, 2024 (https://arxiv.org/html/2609.12354#bib.bib3))和 LongMemEval(Wu 等人, 2025 (https://arxiv.org/html/2609.12354#bib.bib4))上评估了 CueMem,并证明其始终优于基线记忆模型。这些结果证明了检索细粒度记忆线索并从锚点轮次重构对话上下文的有效性。 我们的贡献总结如下: - • 我们引入了一个以线索为中心的长期对话记忆观,其中细粒度记忆线索引导相关对话上下文的重构,而不是作为生成的自包含证据。 - • 我们提出了 CueMem,一个简单而有效的框架,它从对话轮次中构建细粒度记忆线索,检索查询相关线索,并通过在轮次级图上从其源轮次锚点扩展来恢复支持性对话上下文。 - • 在两个长期对话问答基准上的实验表明,CueMem 始终优于强大的长期记忆基线模型,证明了细粒度线索检索和基于锚点的上下文重构的有效性。 ## 2 相关工作 检索增强生成(RAG)通过在生成前检索相关外部上下文来增强语言模型(Lewis 等人, 2020 (https://arxiv.org/html/2609.12354#bib.bib9); Gao 等人, 2023 (https://arxiv.org/html/2609.12354#bib.bib10))。在长上下文和对话场景中,RAG 通常用于检索对话轮次、文本块、摘要或记忆条目,减少了处理完整历史的需求,并缓解了诸如“中间丢失”问题(Liu 等人, 2024 (https://arxiv.org/html/2609.12354#bib.bib11))等长上下文问题。最近的工作还探索了更结构化的检索机制,例如基于图的 RAG(Edge 等人, 2024 (https://arxiv.org/html/2609.12354#bib.bib12); Guo 等人, 2024 (https://arxiv.org/html/2609.12354#bib.bib13); Gutiérrez 等人, 2024 (https://arxiv.org/html/2609.12354#bib.bib22); Gutiérrez 等人, 2025 (https://arxiv.org/html/2609.12354#bib.bib14)),它将文档或实体组织成图以支持多跳或全局信息访问。然而,这些 RAG 系统主要针对静态外部知识库,其固定的分块和检索在动态长期对话中可能面临粒度不匹配的问题。 长期对话记忆旨在帮助大语言模型代理保留和利用来自扩展交互的信息。早期的代理记忆系统将观察或对话历史存储为记忆流,并检索相关记录用于未来的推理或响应生成(Park 等人, 2023 (https://arxiv.org/html/2609.12354#bib.bib15); Zhong 等人, 2024 (https://arxiv.org/html/2609.12354#bib.bib17); Packer 等人, 2023 (https://arxiv.org/html/2609.12354#bib.bib16))。更新近的方法通过分层模块、结构化笔记、图链接或整合机制进一步组织记忆,以支持可扩展的存储、更新和检索(Kang 等人, 2025 (https://arxiv.org/html/2609.12354#bib.bib6); Chhikara 等人, 2025 (https://arxiv.org/html/2609.12354#bib.bib7); Xu 等人, 2025 (https://arxiv.org/html/2609.12354#bib.bib8); Fang 等人, 2026 (https://arxiv.org/html/2609.12354#bib.bib5))。然而,这些方法通常依赖于压缩的摘要或记忆笔记作为生成的直接证据,这可能会丢失细粒度细节和局部对话上下文。此外,将多个事实合并到一个记忆单元中可能纠缠不同的语义信号并降低检索精度。 自传体记忆的认知研究为解决此问题提供了有用的视角。自传体记忆通常被定义为“对个人生活中事件的记忆”(Conway 和 Rubin, 1993 (https://arxiv.org/html/2609.12354#bib.bib18))。尽管代理记忆并非人类记忆,但长期对话记忆扮演着功能上类似的角色:它记录代理交互历史中的事件,并支持后续响应用户查询的回忆。认知研究表明,自传体记忆并非以完美记录的形式存储,而是借助线索从更广泛的自传体知识中重构的(Holland 和 Kensinger, 2010 (https://arxiv.org/html/2609.12354#bib.bib2); Conway 和 Pleydell-Pearce, 2000 (https://arxiv.org/html/2609.12354#bib.bib1))。这一视角启发了 CueMem,它将存储的记忆视为用于重构证据的细粒度检索线索,而非自包含的证据。 ## 3 问题表述 我们关注长期对话问答,即代理在给定长对话历史的情况下回答用户查询。形式化地,令 \(\mathcal{D}=\{u_1, u_2, \ldots, u_T\}\) 表示由 \(T\) 个轮次组成的对话历史。对话历史可能跨越多个会话,每个会话是时间上连续的轮次块,但我们用按时间顺序排列的轮次序列来表示整个历史。每个轮次 \(u_i\) 包含用户话语和相应的代理响应,并可能包含相关元数据,如时间戳。给定用户查询 \(q\),目标是生成一个既与 \(q\) 相关又忠实于 \(\mathcal{D}\) 所含信息的回答 \(a\)。由于 \(\mathcal{D}\) 可能很长、有噪声且仅与当前查询部分相关,系统应识别出紧凑的证据上下文,而不是依赖整个对话历史作为输入。我们将该任务表述为选择一个查询相关的证据上下文 \(E_q \subseteq \mathcal{D}\) 并基于查询和该上下文生成回答: \(a = \text{LLM}\big(\text{Prompt}(q, E_q)\big)\), 其中 \(E_q\) 包含回答 \(q\) 所需的历史信息,而 \(\text{Prompt}(\cdot)\) 表示用于为大语言模型格式化查询和证据上下文的答案生成提示。 图 2:CueMem 概览。在离线阶段,CueMem 从对话轮次中提取细粒度记忆线索,将每个线索链接到其源轮次,将线索编码为密集向量用于检索,并构建具有时间和语义边的轮次图。在线上阶段,CueMem 将用户查询编码到相同的向量空间,检索查询相关线索,将其映射到源轮次锚点,在轮次图上扩展以重建支持性对话上下文,并将重建的上下文输入大语言模型进行答案生成。 ## 4 方法论 CueMem 遵循线索-锚点-上下文的记忆重构流程,如图 2(https://arxiv.org/html/2609.12354#S3.F2)所示。给定长对话历史,CueMem 首先从单个对话轮次中提取细粒度记忆线索,并将每个线索链接到其源轮次。然后,它在原始对话历史上构建一个轮次级图,其中时间边保留局部对话连续性,语义边根据线索级语义相似性连接轮次。在查询时,CueMem 检索查询相关线索,将其映射到源轮次锚点,并从这些锚点出发在轮次图上扩展以重建证据上下文。然后将重建的上下文提供给大语言模型进行答案生成。 ### 4.1 记忆线索提取 CueMem 的第一步是将对话历史转换为一组细粒度记忆线索。与将多个语义信号压缩到一个单元的分段或摘要级记忆不同,每个线索旨在捕捉对话中一个相对原子化的信息片段。记忆线索可以采用多种形式,例如自然语言陈述或结构化关系记录。为简单起见和可解释性,我们在本文中将每个线索实例化为一个关系三元组。形式化地,给定对话历史 \(\mathcal{D}\),我们提取一个线索集 \(\mathcal{C}=\{c_1, c_2, \ldots, c_N\}\)。每个线索表示为 \(c_i = (t_i, \tau_i)\),其中 \(t_i\) 表示从对话中提取的三元组 \((\text{主体}, \text{关系}, \text{对象})\),\(\tau_i \in \{1, 2, \ldots, T\}\) 表示指向 \(\mathcal{D}\) 中源轮次的指针。三元组为检索提供语义聚焦的表示,而指针则将线索链接回原始对话轮次,以便后续上下文重建。在实践中,我们使用大语言模型从每个对话轮次中提取关系三元组以构建记忆线索。如果一个轮次包含多条有用信息,则可能产生多个线索;如果不包含任何信息,则可能没有线索。我们进一步使用嵌入模型对每个三元组 \(t_i\) 进行编码,得到其密集表示 \(\mathbf{t}_i = \text{Enc}(t_i)\),用于后续的检索和图构建。 ### 4.2 轮次图构建 提取记忆线索后,CueMem 在原始对话历史上构建一个轮次级图,以支持后续的上下文重建。该图超越了孤立的线索匹配,保留了对话结构,允许系统在找到源轮次后恢复时间和语义上相关的轮次。
相似文章
Cognis:面向对话式 AI 智能体的上下文感知记忆系统
Lyzr Cognis 推出统一开源记忆系统,融合 BM25 与 Matryoshka 向量搜索并支持版本感知写入,在 LoCoMo 与 LongMemEval 基准上实现 SOTA。
当用户未提问时:对话代理中上下文驱动记忆检索的基准测试
本文介绍了LoCoMo-Conv,一个对话记忆基准,用于评估长期对话代理中使用不同查询风格的记忆检索和响应质量,揭示了现有QA基准中的差距,并建议基于推理的记忆细化作为一个有前景的方向。
MemTrain:自监督上下文记忆训练
MemTrain 提出了一种自监督训练框架,通过在维基百科语料上使用掩码重建和中间记忆召回代理任务,增强 LLM 智能体的上下文记忆能力,在下游记忆密集型 QA 基准上取得了高达 17.67 个百分点的提升。
重构正确片段:评估超越长上下文的交错对话记忆
本文介绍了 SCALE-QA,一个用于评估长上下文中交错对话记忆的基准,并提出了 TSIM,一种提高记忆重构精度的方法,优于现有基线。
CoreMem: 对话代理中长期记忆的黎曼检索与Fisher引导蒸馏
CoreMem提出了一种资源高效的边缘-云端内存架构,用于对话代理,采用基于Fisher-Rao度量的黎曼检索和Fisher引导的离散令牌蒸馏,在8 GB VRAM预算内实现了显著的准确性提升。