准确高效的LLM智能体长期记忆

arXiv cs.AI 论文

摘要

MOSAIC是一个结构化、具备冲突感知能力的LLM智能体长期记忆框架,它采用实体类型化图存储、哈希加速检索和主动冲突检测,在长对话问答和事实冲突检测任务上实现了高准确率和高效率。

arXiv:2607.16211v1 公告类型:新 摘要:具备持久记忆的LLM智能体能够回忆过去的交互,但现有系统存在两个局限性:扁平化的非结构化存储丢失了多跳推理和时间推理所需的关系上下文,并且依赖昂贵的基于LLM的分类使得它们在延迟敏感型部署中不实用。由于缺乏将新信息与存储知识进行验证的机制,这些系统会悄无声息地积累矛盾。本文提出MOSAIC(信息收集的存储组织结构化智能体),这是一个结构化、具备冲突感知能力的LLM智能体长期记忆框架,显著提高了准确性和效率。MOSAIC引入了三项关键能力:(1) 实体类型化图存储,通过语义分类保留跨事件、角色和关系的关系结构,支持对对话历史的多跳推理和时间推理;(2) 哈希加速的双路径检索,用局部敏感哈希替代基于LLM的分类,实现近乎即时的查找且准确率损失可忽略不计;(3) 在保存时进行主动冲突检测,将新信息与现有图邻居进行交叉引用,对矛盾条目触发更新或删除。在LoCoMo(长对话问答)、HaluMem和一个新颖的临床指南错误累积测试上的评估显示,MOSAIC在LoCoMo上达到89.35%的准确率(比最佳基线高27.21个百分点),在HaluMem-Medium上取得最佳抽取F1值(86.77%),在HaluMem-Long上取得最佳抽取F1值(85.84%),在Medium和Long上均取得最佳问答正确率(73.10%,70.75%),并检测出66%的注入事实冲突——是最佳基线(14%)的4.7倍,同时哈希加速检索使平均搜索延迟保持在每问题0.58秒。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:37

# 准确且高效的 LLM 智能体长期记忆
来源:https://arxiv.org/html/2607.16211
Zicheng Zhao¹,†, Xinyang Guo¹,†, Luyao Lv², Menghan Wang², Ming Li¹,∗, Shuaicheng Li³,∗ ¹华中人工智能研究院 ²广东省数据科学与交叉研究应用重点实验室,北京师范大学-香港浸会大学联合国际学院,珠海 ³香港城市大学计算机科学系 †同等贡献 ∗通讯作者

###### 摘要

配备持久记忆的 LLM 智能体能够回忆过去的交互,但现有系统存在两个局限:扁平、非结构化的存储方式丢失了多跳和时间推理所需的关联上下文;以及对昂贵的基于 LLM 分类的依赖,使其在延迟敏感型部署中不实用。由于缺乏针对存储知识验证新信息的机制,这些系统会不知不觉地积累矛盾。我们提出 MOSAIC(Memory-Organized Structured Agent for Information Collection,即信息收集的存储组织结构化智能体),这是一种结构化、具有冲突感知能力的 LLM 智能体长期记忆框架,其准确性和效率显著更高。MOSAIC 引入了三项关键能力:(1) 带有语义分类的实体类型化图存储,可保留跨事件、人物和关系的关联结构,支持对对话历史进行多跳和时间推理;(2) 基于哈希加速的双路检索,用局部敏感哈希替代基于 LLM 的分类,实现近乎瞬时的查找且准确率损失极小;(3) 在保存时主动进行冲突检测,将新信息与现有的图邻居进行交叉引用,对矛盾的条目触发更新或删除。经 LoCoMo(长对话问答)、HaluMem 以及一项新型临床指南错误累积测试评估,MOSAIC 在 LoCoMo 上达到 89.35% 的准确率(比最佳基线高出 27.21 个百分点),在 HaluMem-Medium 上取得最佳抽取 F1 值(86.77%)和 HaluMem-Long 上最佳抽取 F1 值(85.84%),在 Medium 和 Long 问题上均取得最佳问答正确率(73.10%,70.75%),并能检测出 66% 的注入事实冲突——是最佳基线(14%)的 4.7 倍——而哈希加速检索将平均搜索延迟维持在每问题 0.58 秒。

关键词:LLM 智能体,长期记忆,记忆图,冲突检测,错误累积,对话式 QA

## 1 引言

记忆增强型 LLM 智能体的普及制造了一个隐含的假设:能记住的智能体就是能基于其记忆进行正确推理的智能体。诸如 MemGPT(Packer 等人,2023 (https://arxiv.org/html/2607.16211#bib.bib15))、Mem0(Chhikara 等人,2025 (https://arxiv.org/html/2607.16211#bib.bib4))、A-Mem(Xu 等人,2025 (https://arxiv.org/html/2607.16211#bib.bib30))和 MemOS(Li 等人,2025 (https://arxiv.org/html/2607.16211#bib.bib10))等系统已在用户偏好、事实历史以及跨会话的上下文细微差别方面展示了令人印象深刻的记忆能力。然而,一个根本性的局限依然存在:这些系统将记忆视为*仅附加存储*,在吸收新信息时未针对现有知识进行验证,因此不知不觉地积累了矛盾,这些矛盾会在检索和推理阶段不断累积放大。

这种*错误累积*问题在安全关键领域尤为严重。在临床环境中,如果默默存储了患者的目标血压为 <<160/100 mmHg 而指南规定 <<130/80 mmHg,这种错误就会扩散到不正确的风险分层和可能有害的处方决策中(Yaraghi, 2024 (https://arxiv.org/html/2607.16211#bib.bib32))。在法律和金融领域,矛盾的事实会引发矛盾的检索结果,进而导致矛盾的下游决策。现代记忆系统的流水线结构——从提取到存储,再到检索和推理——意味着摄入阶段一个未被发现的错误可以指数级地放大到后续各阶段。

越来越多的证据揭示了*回忆*与*任务完成*之间更深层次的脱节:当没有明确的机制强制进行系统性覆盖时,记忆增强型智能体会过早结束对话、遗漏所需信息,或偏离到无关话题(Xi 等人,2025 (https://arxiv.org/html/2607.16211#bib.bib29); Wang 等人,2024 (https://arxiv.org/html/2607.16211#bib.bib27))。当前的智能体框架提供两大能力:*动作选择*(选择下一步做什么)和*记忆*(存储已学到的内容)。但结构化信息收集任务需要第三项:*任务状态追踪*——一种持久化的、可查询的表征,显示哪些所需信息单元已获得、哪些仍未解决,以及哪些依赖关系约束了应如何按顺序获取这些信息。没有这种机制,智能体无法区分“我有足够信息可以停止”和“我已经问不出什么容易问的问题了”这两种情况。

这种区分不仅仅是一个工程细节。在临床初诊中,遗漏的用药史会扩散到错误的风险分层和可能有害的处方决策(Singhal 等人,2023 (https://arxiv.org/html/2607.16211#bib.bib22))。在保险理赔处理中,缺少责任认定会使下游裁决无效。在技术支持中,未诊断的硬件故障会导致反复尝试仅针对软件的修复。这些领域的共同结构是一个*部分可观测的信息空间*,其中存在*前提约束*和*覆盖要求*,必须通过多轮交互来系统地满足。

我们将这些失败归因于现有记忆架构中的三个结构性缺陷:*扁平存储*,即记忆以非结构化的文本块或键值对形式保存,缺乏类型化关系,导致无法交叉引用;*被动吸收*,即新信息在未与现有记忆进行冲突检查的情况下无条件存储;以及*单一化检索*,即对扁平存储的语义搜索无法利用关系结构进行多跳或时间推理。

一个更深层次的问题是*为什么用图*,而不是更简单的任务表示形式,例如扁平清单、优先级队列或计划模板。答案在于真实信息收集任务的一个结构特性:*局部依赖性*。一个特定信息实体是否需要被询问、重新询问或降低优先级,并不取决于整个对话的全局状态,而是取决于一小部分与其语义或逻辑相关的实体——即其*图邻居*的状态。知道患者的肌酐水平会影响询问肾病的重要性,但不会影响询问吸烟史。确认事故日期会改变天气状况查询的相关性,但不会改变车辆品牌查询。这种局部性正是图结构所编码的,也是扁平表示所丢弃的。

我们提出 MOSAIC,一个通过三种机制解决上述缺陷的框架。首先,MOSAIC 将记忆组织为*类型化实体图*,附带语义分类,分为事件、人物和关系,保留关系结构以支持基于图的推理。其次,MOSAIC 在*保存时主动进行冲突检测*:当吸收新信息时,将其与现有记忆图进行交叉引用;冲突会触发警告,并可通过更新或删除来解决。第三,MOSAIC 采用*哈希加速检索*,实现近乎瞬时的记忆查找,同时保持与基于 LLM 分类相当的准确率。

我们将 MOSAIC 图结构背后的关键洞察形式化为*邻居条件稳定性*(Neighbor-Conditioned Stability, NCS):一个节点的重要性分数、信念状态和优先级,仅当其至少一个图邻居的状态发生改变时才需要重新评估。当局部邻域未改变时,该节点的状态保证稳定。该原理与动态规划中的贝尔曼最优性原理(Bellman, 1966 (https://arxiv.org/html/2607.16211#bib.bib2))高度相似,后者将全局优化分解为通过状态转移图传播的局部价值更新。正如动态规划通过利用局部结构避免冗余的全局重新计算一样,MOSAIC 通过利用记忆图中编码的依赖和关联结构,避免对实体优先级进行冗余的重新评估。

我们在三个互补的基准上评估 MOSAIC:LoCoMo(Maharana 等人,2024 (https://arxiv.org/html/2607.16211#bib.bib12)),测试长对话记忆问答,包含 1540 个问答对;HaluMem(Chen 等人,2025 (https://arxiv.org/html/2607.16211#bib.bib3)),分别评估带有幻觉检测的记忆提取、更新和问答;以及一个新颖的错误累积测试,其中将 50 个事实冲突手动注入高血压临床指南。在这些基准上,MOSAIC 在 LoCoMo 上达到 89.35% 的总体准确率(比最佳基线 Mem0 高 27.21 个百分点),在 HaluMem-Medium 上取得最佳抽取 F1 值 86.77%,在 HaluMem-Long 上取得最佳抽取 F1 值 85.84%,在 HaluMem 的 Medium 和 Long 问题上均取得最佳问答正确率(73.10%,70.75%),检测出 66% 的注入事实冲突——是最佳基线(14%)的 4.7 倍——并将 HaluMem-Medium 的平均搜索延迟保持在每问题 0.58 秒。

## 2 相关工作

### 2.1 记忆增强型 LLM 智能体

LLM 智能体的持久记忆发展迅速。MemGPT(Packer 等人,2023 (https://arxiv.org/html/2607.16211#bib.bib15))引入了受操作系统启发的虚拟内存管理,维护一个分层内存层级(主上下文、归档存储、回溯存储),并配备显式的内存管理函数。Mem0(Chhikara 等人,2025 (https://arxiv.org/html/2607.16211#bib.bib4))提供多层次持久内存,具有跨用户、会话和智能体级别的自适应个性化能力。A-Mem(Xu 等人,2025 (https://arxiv.org/html/2607.16211#bib.bib30))实现了具有自动存储、检索和摘要功能的自适应内存,可动态调整内存粒度。MemOS(Li 等人,2025 (https://arxiv.org/html/2607.16211#bib.bib10))通过操作系统抽象层统一了内存操作。Zep(Rasmussen 等人,2025 (https://arxiv.org/html/2607.16211#bib.bib18))为 AI 助手提供具有时间感知能力的生产级内存。

Zhang 等人(2025 (https://arxiv.org/html/2607.16211#bib.bib33))的一项全面调查从存储格式、检索策略和管理策略等维度对内存机制进行了分类。尽管具有多样性,所有现有系统都有一个共同局限:它们关注于*保留*——确保信息一旦存储就能被准确检索——但缺乏*冲突检测*或*结构化组织*机制,这些机制本可以阻止矛盾信息被存储。

### 2.2 智能体框架与规划

更广泛的 LLM 智能体架构为 MOSAIC 的设计选择提供了背景。ReAct(Yao 等人,2022 (https://arxiv.org/html/2607.16211#bib.bib31))融合了推理和行动,使用思维链提示逐步决定行动。Reflexion(Shinn 等人,2023 (https://arxiv.org/html/2607.16211#bib.bib21))通过自我反思反馈循环增加了语言强化学习。Plan-and-Solve(Wang 等人,2023 (https://arxiv.org/html/2607.16211#bib.bib26))通过在执行前生成显式计划来改进零样本推理。这些框架展示了复杂的规划和推理能力,但缺乏用于跨会话信息管理的持久化、结构化内存(Xi 等人,2025 (https://arxiv.org/html/2607.16211#bib.bib29); Wang 等人,2024 (https://arxiv.org/html/2607.16211#bib.bib27))。

工具增强方法(Schick 等人,2023 (https://arxiv.org/html/2607.16211#bib.bib20))为智能体扩展了外部能力,但未解决根本的记忆组织问题。思维链提示(Wei 等人,2022 (https://arxiv.org/html/2607.16211#bib.bib28))改善了单一上下文窗口内的推理,但不支持跨会话的长期记忆。

### 2.3 知识图谱与结构化内存

一些系统将智能体内存组织为知识图谱(Pan 等人,2024 (https://arxiv.org/html/2607.16211#bib.bib17))。Mem0-Graph 扩展了 Mem0 以包含图结构,但不执行冲突检查。GraphRAG(Edge 等人,2024 (https://arxiv.org/html/2607.16211#bib.bib5))使用基于图的检索进行面向查询的摘要,证明了图结构在信息检索中的优势。然而,这些系统专注于检索质量而非摄取时验证。

MOSAIC 的实体图与一般知识图谱的不同之处在于,它关注类型化实体(事件、人物、关系),并在摄取时进行显式的冲突检测。双图公式——将前提依赖关系与语义关联分开——既提供了逻辑有效性,也提供了对话连贯性,这是单图方法无法同时优化的属性。

### 2.4 内存评估基准

LoCoMo(Maharana 等人,2024 (https://arxiv.org/html/2607.16211#bib.bib12))通过覆盖单跳、多跳、时间和开放域问题的多类型问答来评估长对话内存。HaluMem(Chen 等人,2025 (https://arxiv.org/html/2607.16211#bib.bib3))引入了对内存流水线的幻觉感知评估,分别评估提取、更新和问答阶段。LLM-as-Judge 方法(Zheng 等人,2023 (https://arxiv.org/html/2607.16211#bib.bib34))补充了基于参考的评估。我们的错误累积测试通过特别针对冲突检测来补充这些,该能力是现有基准未评估的。

### 2.5 幻觉与事实一致性

LLM 中的幻觉问题已被广泛研究(Huang 等人,2025 (https://arxiv.org/html/2607.16211#bib.bib7); Ji 等人,2023 (https://arxiv.org/html/2607.16211#bib.bib8))。事实验证系统(Thorne 等人,2018 (https://arxiv.org/html/2607.16211#bib.bib23))和细粒度事实评估(Min 等人,2023 (https://arxiv.org/html/2607.16211#bib.bib13))在生成时解决幻觉问题。MOSAIC 解决一个互补的问题:防止幻觉或矛盾信息被存储在持久记忆中,从而避免其在未来的检索和推理步骤中累积放大。

## 3 方法

见图注图 1:MOSAIC 系统架构。对话通过实体提取和双路分类(经由 LLM 或局部敏感哈希)进行处理。实体构成一个带有前提边和关联边的类型化记忆图。在摄取时,冲突检测模块根据图邻居验证新事实,在存储之前解决矛盾。社区感知的检索能够对图结构进行多跳推理。

### 3.1 问题形式化

我们将结构化内存管理问题形式化如下。令 D = {(u₁, a₁), (u₂, a₂), ..., (u_T, a_T)} 表示一个多轮对话,其中 u_t 是用户在回合 t 的话语,a_t 是智能体的响应。在每个回合,智能体必须:(1) 从用户的话语中*提取*信息实体;(2) 将提取的实体与现有记忆存储进行*验证*以发现冲突;(3) 将验证后的实体以结构化表示*存储*;(4) *检索*相关记忆以生成具有上下文依据的响应。

错误累积

相似文章

MOSAIC:结构化代理智能与组合的模块化编排框架

arXiv cs.AI

MOSAIC 提出了一种用于自动化数据科学的结构化代理框架,该框架基于记忆驱动的模型选择和工作流构建,并在金融时间序列任务上得到验证。其性能优于 AutoML 及其他基于代理的基准方法。