EdgeMem: 通过保留证据的多锚点超图实现无LLM智能体记忆构建与检索
摘要
EdgeMem提出一种无LLM的方法,用于智能体记忆的构建与检索,采用多锚点超图,保留证据以提高基于记忆的问答性能。
arXiv:2609.05553v1 公告类型:新
摘要:智能体记忆允许LLM智能体在回答新查询时使用早期交互。现有方法通常将交互历史压缩为摘要或其他LLM生成的表示。重复生成增加了成本,并且在系统知道未来查询所需之前可能会丢弃包含答案的细节。我们提出EdgeMem,一种围绕简单原则构建的智能体记忆方法:保留原始交互轮次,并通过互补的内容、时间和情景线索进行组织。EdgeMem通过轻量级本地处理构建的多锚点超图实现这一原则。检索直接返回源证据,并将LLM的使用保留用于最终答案生成,将多会话历史的结构化访问与原始对话的忠实保留相结合。在LoCoMo和LongMemEval-S上的实验显示了强大的检索和基于记忆的问答性能;在LoCoMo上,EdgeMem在共享提示下的七个复现系统中取得了最高的严格评分(61.01对58.70),而构建和检索不需要生成式LLM调用。总体而言,EdgeMem表明,保留和组织源证据为智能体记忆提供了有效且高效的基础,无需生成式记忆管理。
查看缓存全文
缓存时间: 2026/09/10 08:38
# EdgeMem: 基于证据保留的多锚点超图构建与检索无大语言模型代理记忆 来源: https://arxiv.org/html/2609.05553 CCS: 信息系统 信息检索CCS: 计算方法学 自然语言处理 崔泽洋 邮箱: [[email protected]](mailto:[email protected]) 机构: 香港理工大学,香港,香港特别行政区 曹柬农 邮箱: [[email protected]](mailto:[email protected]) 机构: 香港理工大学,香港,香港特别行政区 温志远 邮箱: [[email protected]](mailto:[email protected]) 机构: 香港理工大学,香港,香港特别行政区 袁博 注: 袁博与陈晟源为共同通讯作者。 邮箱: [[email protected]](mailto:[email protected]) 机构: 九天研究院,中国移动,北京,中国 冯俊兰 邮箱: [[email protected]](mailto:[email protected]) 机构: 九天研究院,中国移动,北京,中国 陈晟源 邮箱: [[email protected]](mailto:[email protected]) 机构: 香港理工大学,香港,香港特别行政区 © 无 ###### 摘要\. 代理记忆使大语言模型代理能够在回答新查询时利用先前的交互。现有方法通常将交互历史压缩为摘要或其他由大语言模型生成的表示形式。重复生成增加了成本,并且在系统知晓未来查询所需信息之前,可能丢弃包含答案细节的信息。我们提出了EdgeMem,一种基于简单原则构建的代理记忆方法:保留原始交互轮次,并通过互补的内容、时间和情节线索进行组织。EdgeMem通过轻量级局部处理构建的多锚点超图实现这一原则。检索直接返回源证据,并将大语言模型的使用保留用于最终答案生成,将对多会话历史的结构化访问与对原始对话的忠实保留相结合。在LoCoMo和LongMemEval-S上的实验显示了强大的检索和基于记忆的问题回答能力;在LoCoMo上,在相同提示下,EdgeMem在七个复现系统中获得了最高的严格评判分数(61.01 对 58.70),而构建和检索不需要生成式大语言模型调用。总体而言,EdgeMem表明,通过保留和组织源证据,为代理记忆提供了一个有效且高效的基础,无需生成式记忆管理。 ###### 关键词: 代理记忆; 大语言模型代理; 记忆构建与检索 参见图注 \(a\) \(b\) 图1\.\(a\)基于大语言模型的摘要和检索可能丢失包含答案的证据,而原始证据保留使其直接可检索。\(b\)现有记忆框架在记忆构建和每次查询回答中都涉及大量的生成式大语言模型令牌成本。上图:并排比较显示,基于大语言模型的摘要和检索在回答前丢失了包含答案的细节,而原始证据保留则直接检索到它。下图:按组排列的水平条形图,采用对数令牌轴;EdgeMem的构建成本为零,其回答成本最低。 ## 1.引言 代理记忆使大语言模型代理能够在回答新查询时利用过去的交互\(Zhang et al\., 2025 (https://arxiv.org/html/2609.05553#bib.bib26)\)。在多会话对话中,相关信息可能位于更早的会话中\(Maharana et al., 2024 (https://arxiv.org/html/2609.05553#bib.bib13);Wu et al., 2025 (https://arxiv.org/html/2609.05553#bib.bib21)\)。随着交互历史的增长,维护可用的记忆并检索与当前查询相关的证据变得越来越具有挑战性。每次查询都将完整历史输入模型需要逐渐增加输入令牌,并且可能最终超过模型的上下文窗口\(Packer et al., 2023 (https://arxiv.org/html/2609.05553#bib.bib14)\)。因此,代理记忆系统通常将过去的交互外部存储,并仅检索少量相关证据用于响应生成\(Lewis et al., 2020 (https://arxiv.org/html/2609.05553#bib.bib10);Zhang et al., 2025 (https://arxiv.org/html/2609.05553#bib.bib26)\)。 现有的代理记忆方法通过块检索或派生记忆表示来组织外部历史。传统方法将过去的交互分段,并使用词汇或密集相似性检索相关块。更新的方法使用大语言模型推理来提取或压缩显著信息\(Chhikara et al., 2025 (https://arxiv.org/html/2609.05553#bib.bib2);Pan et al., 2025 (https://arxiv.org/html/2609.05553#bib.bib15)\),构建分层存储、链接记忆网络和知识图谱\(Xu et al., 2025 (https://arxiv.org/html/2609.05553#bib.bib23);Kang et al., 2025 (https://arxiv.org/html/2609.05553#bib.bib8);Gutiérrez et al., 2025 (https://arxiv.org/html/2609.05553#bib.bib5)\),或构建多粒度记忆视图\(Xu et al., 2026 (https://arxiv.org/html/2609.05553#bib.bib22)\)。大语言模型还可能在查询时指导分层导航、规划检索或过滤候选证据\(Li et al., 2025 (https://arxiv.org/html/2609.05553#bib.bib11);Hu et al., 2026 (https://arxiv.org/html/2609.05553#bib.bib6);Xu et al., 2026 (https://arxiv.org/html/2609.05553#bib.bib22)\)。将大语言模型推理置于记忆生命周期中的方法存在两个局限性,如图1 (https://arxiv.org/html/2609.05553#acmlabel1)总结所示。首先,随着历史增长,用于构建、更新和检索的重复大语言模型调用会产生大量的令牌成本。在评估的LoCoMo规模下,仅记忆构建消耗的令牌就已经超过了每个主流基线的原始历史(图1b (https://arxiv.org/html/2609.05553#acmlabel1)b)。其次,生成的摘要和提取的记忆单元可能省略或扭曲原始轮次中的细节\(Pan et al., 2025 (https://arxiv.org/html/2609.05553#bib.bib15);Zhuang et al., 2026 (https://arxiv.org/html/2609.05553#bib.bib28)\)。一旦包含答案的细节丢失,后续的检索阶段就无法恢复它(图1a (https://arxiv.org/html/2609.05553#acmlabel1)a)。这些局限性共同促使了一种直接组织原始对话证据并将生成保留用于最终答案的记忆设计。 受情节记忆研究启发,该研究通过内容和时空背景来描述事件\(Tulving, 1972 (https://arxiv.org/html/2609.05553#bib.bib19);Clayton and Dickinson, 1998 (https://arxiv.org/html/2609.05553#bib.bib3)\),我们将对话记忆视为由互补访问线索组织的原始交互记录。一个轮次可以通过其讨论的内容、发生的时间以及所属的情节来回忆。因此,我们保留每个轮次作为原子证据记录,并将其与多个内容、时间和情节上下文的锚点相关联。然后,查询可以遵循与其线索最相关的锚点,检索相应的源证据。 具体而言,我们提出了EdgeMem,一种结构化的代理记忆方法,无需大语言模型即可构建和检索多会话交互历史。EdgeMem使用本地NLP工具和转录元数据,为每个轮次标注实体和词汇键、时间、情节成员资格和情节内顺序。这些标注形成了一个包含三个组件的多锚点超图:时间子超图按日历时间组织轮次,共现子超图通过共享实体和词汇键连接轮次,情节子超图保留会话成员资格和局部上下文。对于新查询,本地提取的实体、词汇和日期线索会激活匹配的超边。情节检索提供上下文核心,而共现和时间检索在固定预算下添加互补证据。生成的证据包包含原始源轮次,并传递给单个阅读器大语言模型进行答案生成。由于锚点构建和查询路由使用本地工具和确定性规则,只有这个最终的阅读器调用大语言模型。 为了评估EdgeMem的有效性,我们在LoCoMo上将其与六个可复现的端到端记忆基线进行比较:A-Mem, CAM, CompassMem, MemoryOS, MemGAS, 和 SeCom。在LongMemEval-S上,我们将其与该基准发布的完整历史、密集检索、对话记忆和结构化记忆基线进行比较。在LoCoMo的相同读出协议下,EdgeMem取得了最高的基于评判和基于词汇的分数,包括严格评判下的61.01对最强基线的58.70。它还正确拒绝了92.57%的前提不支持问题,而相同拒绝指令下的最强基线为84.68%。在LongMemEval-S上,相同的配置获得了最佳的会话级检索分数,Recall@3为81.49,NDCG@3为90.49,并达到了60.00的答案分数,而最佳结果为60.20,同时每个问题使用的令牌仅为36%。这些结果表明,在大幅降低生成式大语言模型成本的同时,实现了强大的记忆检索和基于记忆的问题回答。 总之,本工作做出了三个核心贡献: - • 我们引入了EdgeMem,一种源保留的代理记忆框架,它将原始交互轮次组织在一个多锚点超图中,使得记忆构建和检索无需生成式大语言模型调用。 - • 我们设计了一种确定性的、预算感知的检索策略,该策略使用情节上下文作为其证据核心,并加法地整合来自相应子超图的跨会话共现和时间范围内的证据。 - • 在LoCoMo和LongMemEval-S上的广泛实验表明,EdgeMem在LoCoMo的相同读出下取得了最强的答案质量,在LongMemEval-S上取得了k=3的最佳会话级检索,同时使用的生成式大语言模型令牌远少于竞争系统。 图2\. EdgeMem概述。*上图(构建)*:交互历史作为源轮次保留,并通过轻量级本地标注进行处理;时间、共现和会话分组导出一个时间、共现和情节锚点键的多锚点超图。*下图(检索)*:查询线索驱动在时间、共现和情节子超图上的确定性证据通道。它们选择的源轮次在固定预算下融合,并传递给一个阅读器,该阅读器返回答案或明确拒绝。阅读器是该流水线中唯一的大语言模型阶段。 ## 2.相关工作 与代理记忆相关的先前工作涵盖三条路线:大语言模型编写的对话记忆、图组织的记忆与检索,以及受情节性上下文回忆模型启发的源级检索。 #### 大语言模型编写的对话记忆\. 一条主流路线在写入时使用语言模型将轮次总结为链接笔记\(Xu et al., 2025 (https://arxiv.org/html/2609.05553#bib.bib23)\),将观察蒸馏成分层存储\(Kang et al., 2025 (https://arxiv.org/html/2609.05553#bib.bib8)\),通过提取-合并策略整合事实\(Chhikara et al., 2025 (https://arxiv.org/html/2609.05553#bib.bib2);Zhong et al., 2024 (https://arxiv.org/html/2609.05553#bib.bib27)\),递归总结历史\(Wang et al., 2025 (https://arxiv.org/html/2609.05553#bib.bib20)\),或压缩主题分割单元\(Pan et al., 2025 (https://arxiv.org/html/2609.05553#bib.bib15)\)。最近,HyperMem在分层超图中组织由大语言模型派生的主题、情节和事实,并执行从粗到细的检索\(Yue et al., 2026 (https://arxiv.org/html/2609.05553#bib.bib24)\);尽管其情节节点保留了原始对话,但情节分割、主题聚合、事实提取和重要性加权在写入时仍然依赖于大语言模型推理。此类表示需要基于模型的构建,因为历史在被处理时;从中省略的细节可能无法用于后续问题。 #### 图组织的记忆与检索\. 基于图的方法组织存储的知识用于遍历或扩散。它们将记忆表示为带有个性化PageRank检索的知识图谱三元组\(Gutiérrez et al., 2025 (https://arxiv.org/html/2609.05553#bib.bib5)\),由大语言模型导航的分层摘要图\(Li et al., 2025 (https://arxiv.org/html/2609.05553#bib.bib11)\),通过代理搜索的事件图\(Hu et al., 2026 (https://arxiv.org/html/2609.05553#bib.bib6)\),或带有PPR融合的多粒度图\(Xu et al., 2026 (https://arxiv.org/html/2609.05553#bib.bib22)\)。LinearRAG则构建一个用于文档检索的图,无需大语言模型关系抽取\(Zhuang et al., 2026 (https://arxiv.org/html/2609.05553#bib.bib28)\),表明图组织不一定依赖于生成式构建。然而,在许多代理记忆系统中,图构建或查询时导航仍然引入了大语言模型调用。 #### 源级检索与情节组织\. 源级检索提供了一个互补的基础。检索增强生成将答案建立在选定的源段落中\(Lewis et al., 2020 (https://arxiv.org/html/2609.05553#bib.bib10)\),而BM25在没有生成的情况下对存储的文本进行排序\(Robertson and Zaragoza, 2009 (https://arxiv.org/html/2609.05553#bib.bib17)\)。直接应用于对话时,简单的相关性本身将轮次视为独立的,并将共享事件、情节成员资格和时间等关系隐式化。相比之下,对情节记忆的认知描述通过内容及其时空背景来刻画事件\(Tulving, 1972 (https://arxiv.org/html/2609.05553#bib.bib19);Clayton and Dickinson, 1998 (https://arxiv.org/html/2609.05553#bib.bib3)\),这激发了保留源记录同时暴露多种上下文访问路径的记忆结构。 总体而言,先前工作在生成式抽象、图关联和直接源检索方面提供了互补的优势。然而,基于生成的记忆引入了大语言模型成本,并使证据保真度依赖于中间表示,而简单的源检索本身不编码时间和情节结构。这些特性通常不会在一个代理记忆设计中结合。第3节 (https://arxiv.org/html/2609.05553#S3)介绍了EdgeMem,它保留原始轮次,并通过本地导出的时间、共现和情节锚点来组织无需大语言模型的构建和检索。 ## 3.EdgeMem:无大语言模型的结构化记忆管理 我们提出了EdgeMem,一种为大语言模型自由
相似文章
EM^2Mem:面向大语言模型的事件中心多模态记忆
EM^2Mem 提出了一种事件中心的多模态记忆框架,该框架将异构证据绑定到事件锚点,为长视频问答提供紧凑、可生成的记忆,从而提高准确性并降低延迟。
H-Mem:一种通过混合结构实现智能体记忆演化与检索的新型记忆机制
H-Mem是一种面向基于LLM的智能体的新型记忆机制,采用时间-语义树与知识图谱相结合的混合结构,以建模记忆演化并提升检索性能,在问答基准上实现了最先进水平。
AdMem:面向任务求解智能体的高级记忆系统
本文介绍AdMem,一种面向基于LLM的智能体的统一记忆框架,整合语义记忆、情景记忆和程序性记忆,并采用双层短期与长期存储结构,通过多智能体架构实现自动记忆生成与自适应检索。实验表明,该方法在长程多轮任务中提升了鲁棒性和成功率。
MemoryLACE:基于记忆生命周期感知的整合与证据检索
MemoryLACE是一个为长期LLM代理设计的轻量级记忆框架,它显式建模文本证据的生命周期以改善推理能力,无需全面的知识图谱,并在基准测试中实现更高的性能和更低的运行时间。
ActiveMem:面向长程LLM推理的分布式主动记忆
ActiveMem提出了一种分布式主动记忆系统,将智能体记忆与大模型核心推理过程解耦,在长程任务上实现了最先进的准确率,同时显著降低了开销。