Infini Memory:用于长期LLM智能体记忆的可维护主题文档
摘要
介绍了Infini Memory,一种用于LLM智能体的可维护基于文本的持久化记忆架构。它使用主题结构化文档和迭代检索来改进长期记忆使用,在MemoryAgentBench上达到了64.7%的得分。
arXiv:2606.10677v1 Announce Type: new
摘要:长期LLM智能体需要持久化记忆,以跟踪变化的事实并在跨会话中提供相关证据。现有记忆系统通常将观察结果存储为孤立的记录、摘要或索引片段,这使得证据聚合、事实修正和记忆维护变得困难。我们提出Infini Memory,一种可维护的基于文本的持久化记忆架构,将智能体记忆视为主题结构化文档。每个主题文档作为一个语义单元,用于收集相关证据、保留元数据并随时间修正事实。新的观察结果首先被暂存在缓冲区中,然后定期整合成连贯的文本上下文。在推理时,一种智能体检索过程允许LLM通过迭代工具调用来读取记忆,而不是单次检索步骤。在MemoryAgentBench上,Infini Memory实现了64.7%的总分。消融实验表明,主题结构化维护和迭代证据检查改善了长期记忆使用的互补方面。
查看缓存全文
缓存时间: 2026/06/10 06:16
# Infini Memory:面向长期LLM智能体记忆的可维护主题文档
来源:https://arxiv.org/html/2606.10677
苏兆浩¹,吴宝东¹,∗,王泽豪²,夏磊¹,李庆平¹,王瑞松¹,丁文波²,朱振华²,李博勋¹,戴国浩³,¹,汪玉²,∗
¹无限智能 ²清华大学 ³上海交通大学
\{jisuozhao, wubaodong, xialei, liqingping, wangruisong, liboxun\}@infini\-ai\.com
\{wangzeha24@mails, ding\.wenbo@sz, zhuzhenhua@mail, yu\-wang@mail\}\.tsinghua\.edu\.cn
daiguohao@sjtu\.edu\.cn
∗通讯作者
代码:https://github.com/infinigence/Infini-Memory
###### 摘要
长期运行的LLM智能体需要持久性记忆,能够追踪变化的事实并在不同会话中提供相关证据。现有的记忆系统通常将观察结果存储为孤立记录、摘要或索引片段,这使得证据聚合、事实修正和记忆维护变得困难。我们提出**Infini Memory**,一种可维护的基于文本的持久性记忆架构,将智能体记忆视为按主题组织的文档。每个主题文档作为一个语义单元,用于收集相关证据、保留元数据并随时间修正事实。新观察结果首先暂存在缓冲区中,并定期合并为连贯的文本上下文。在推理时,一种智能体检索过程让LLM通过迭代工具调用而非单次检索步骤来读取记忆。在MemoryAgentBench上,Infini Memory取得了64.7%的整体得分。消融实验表明,主题式维护和迭代证据检查能够互补地改善长期记忆使用的不同方面。
## 1 引言
LLM智能体越来越多地跨多个会话进行长周期操作,但LLM的上下文窗口仅限制了模型在单次前向传播中能处理多少输入。增加窗口长度可以让模型看到更多历史,但其本身并未指定哪些信息应保留、如何修正过时信息、或如何将相关证据组织起来供将来使用(Packer等,2023(https://arxiv.org/html/2606.10677#bib.bib13);Somers等,2024(https://arxiv.org/html/2606.10677#bib.bib17))。为弥补这一不足,最近的智能体系统引入了记忆机制,以保留即时提示之外的信息,包括先前的交互、工具观察结果、任务事实和用户偏好(Yao等,2023(https://arxiv.org/html/2606.10677#bib.bib21);Park等,2023(https://arxiv.org/html/2606.10677#bib.bib12);Shinn等,2023(https://arxiv.org/html/2606.10677#bib.bib15))。记忆已被作为语言智能体架构和长期对话智能体的组成部分进行研究(Zhong等,2024(https://arxiv.org/html/2606.10677#bib.bib22);Chhikara等,2025(https://arxiv.org/html/2606.10677#bib.bib1);Xu等,2025(https://arxiv.org/html/2606.10677#bib.bib6);Somers等,2024(https://arxiv.org/html/2606.10677#bib.bib17)),同时也有并行工作引入了衡量多轮记忆能力的基准(Maharana等,2024(https://arxiv.org/html/2606.10677#bib.bib9);Wu等,2025(https://arxiv.org/html/2606.10677#bib.bib20);Hu等,2025(https://arxiv.org/html/2606.10677#bib.bib5))。在本文中,我们使用**持久性记忆**(persistent memory)指代一种外部的、可编辑的记忆状态,它跨交互会话存在,并可在推理时由智能体写入、更新和查询。这些记忆系统通常将信息维护在模型之外,并在推理时将相关内容检索回提示中。现有设计包括基于摘要对话记忆的文本记忆(Tan等,2025(https://arxiv.org/html/2606.10677#bib.bib25))、向量检索(Park等,2023(https://arxiv.org/html/2606.10677#bib.bib12);Chhikara等,2025(https://arxiv.org/html/2606.10677#bib.bib1))、层级记忆管理器(Packer等,2023(https://arxiv.org/html/2606.10677#bib.bib13);Kang等,2025(https://arxiv.org/html/2606.10677#bib.bib26);Fang等,2025(https://arxiv.org/html/2606.10677#bib.bib2))以及知识图谱记忆层(Rasmussen等,2025(https://arxiv.org/html/2606.10677#bib.bib14);Gutiérrez等,2025(https://arxiv.org/html/2606.10677#bib.bib4);Shu等,2026(https://arxiv.org/html/2606.10677#bib.bib16))。这些系统展示了外部记忆的实用性,但也存在四种常见的失效模式(图1(https://arxiv.org/html/2606.10677#S1.F1))。当记忆主要表示为独立的可检索项时,关于同一用户、任务或事件的证据可能会分散在许多小记录中(记忆碎片化)。当新观察与旧观察矛盾时,追加式存储可能同时保留两个版本供检索(记忆冲突)。当长历史被压缩为摘要时,时序和来源线索可能被削弱(压缩损失)。基于向量相似性、关键词匹配或固定top-k过程的标准检索方法可能返回孤立片段,而非足够支持时序推理的证据(检索不足)。我们将此类检索到的片段称为**碎片**(fragments):它们可能与查询相关,但缺乏解决该查询所需的局部上下文。
图1:长期智能体记忆维护中的四个常见挑战:(1)相关证据分散在孤立记录中;(2)同一事实的新旧版本并存而未解决;(3)摘要化丢失了时序、来源和上下文线索;(4)单次检索返回的碎片不足以支持多跳推理。
这些观察促使我们将持久性记忆视为一个生命周期维护问题。一个面向长期智能体的记忆模块应支持三个耦合的操作。首先,它应**写入**(write)交互中的持久信息到记忆状态。其次,它应**维护**(maintain)该状态,通过将相关证据分组,使关于同一用户、任务或事件的事实不再分散;通过将新观察与矛盾的旧观察进行协调;以及在内容浓缩时保留时序和来源线索。第三,它应**读取**(read)记忆,检索到的证据应具有足够的局部上下文,而非孤立片段。我们提出Infini Memory,一种可维护的持久性记忆架构,将外部记忆表示为按主题组织的文档。每个主题文档将相关证据归类到共同主题下,并在内容被重写时携带条目级元数据以保留时序和来源线索。该系统将频繁写入与较少发生的结构性合并分离:新记忆候选首先追加到缓冲区文档,然后定期被重写、拆分、更新和合并到主题文档中。查询时,智能体从该文档库中检索,并展开匹配证据周围的局部上下文。对此文档库的检索可使用纯文本文档的词汇索引,无需向量或图数据库后端。本文的主要贡献如下:
- • 我们提出了一种面向长期LLM智能体的基于文档的持久性记忆架构。它通过主题文档组织记忆,并通过缓冲写入和定期合并进行维护,避免了对向量或图数据库的强制依赖。
- • 我们提出了一种智能体检索策略,其中LLM通过对结构化记忆工具的多步搜索过程进行控制。该策略支持迭代证据检查、局部上下文扩展和面向答案的证据组装。
- • 我们在MemoryAgentBench上评估Infini Memory,其智能体检索变体取得了64.7%的整体得分,并通过受控变体分析维护和检索选择的影响。
## 2 相关工作
### 2.1 持久性记忆的表示与维护
近期关于LLM智能体的工作越来越多地将记忆视为一种必须跨交互写入、更新和检索的外部状态。早期的持久性记忆系统主要扩展了LLM的有效上下文。MemGPT引入了虚拟上下文管理,智能体通过显式控制操作将信息在有限的上下文记忆和外部存储之间移动(Packer等,2023(https://arxiv.org/html/2606.10677#bib.bib13))。MemoryBank存储长期用户记忆,并利用受艾宾浩斯遗忘曲线启发的机制随时间更新(Zhong等,2024(https://arxiv.org/html/2606.10677#bib.bib22))。Mem0进一步发展了这一方向,从对话中动态提取、合并和检索显著信息,并提供基于图的变体以处理关系结构(Chhikara等,2025(https://arxiv.org/html/2606.10677#bib.bib1))。这些系统表明,持久性记忆对长期交互是有用的,但它们通常将记忆存储为紧凑条目、摘要或索引片段,当信息分散在多次交互中时,后续的修正和证据重建可能变得困难。
第二条工作线关注结构化记忆组织。基于图和关联的方法,如HippoRAG-v2,使用非参数化记忆结构来支持事实性、关联性和意义建构性检索(Gutiérrez等,2025(https://arxiv.org/html/2606.10677#bib.bib4))。REMem使用时序感知的要旨和事实构建混合图来表示情节记忆,目标是对事件历史进行回忆和推理(Shu等,2026(https://arxiv.org/html/2606.10677#bib.bib16))。A-MEM提出一种受Zettelkasten方法启发的智能体记忆系统,其中每条记忆存储为带有结构化属性的原子笔记,并动态生成指向相关记忆的链接(Xu等,2025(https://arxiv.org/html/2606.10677#bib.bib6))。这些方法改善了记忆组织,超越了平面检索,但它们通常依赖原子笔记、嵌入或图结构作为主要载体。LightMem也具有相关性,它将记忆处理分为多个阶段:感觉过滤、主题感知的短期合并和离线长期更新(Fang等,2025(https://arxiv.org/html/2606.10677#bib.bib2))。Infini Memory与降低在线维护开销的动机一致,但不同之处在于强调纯文本主题文档和显式的合并操作。这使得它的设计更符合对可解释性、可编辑状态和基础设施简单性有要求的系统。
### 2.2 长期记忆智能体的检索与评估
检索是长期记忆的一个关键难点,因为相关证据可能分散在多次交互中。标准检索管道通常依赖向量相似性、关键词匹配或固定top-k过程。这些方法效率高,但可能返回孤立片段,而非足够支持时序推理或矛盾解决的证据。因此,近期系统转向更主动的检索过程。例如,REMem使用带有精心设计工具的智能体检索器,迭代地检索和推理情节记忆图(Shu等,2026(https://arxiv.org/html/2606.10677#bib.bib16))。A-MEM主要在记忆构建和组织中引入智能体性,在新记忆到达时动态创建笔记、属性和链接(Xu等,2025(https://arxiv.org/html/2606.10677#bib.bib6))。Infini Memory将这一方向扩展到结构化文本记忆的读取路径:LLM可以迭代地选择记忆工具、检查中间结果、展开局部上下文,并在回答前组装证据。
长期记忆的基准也已从静态长上下文理解转向交互式记忆评估。LoCoMo评估跨多轮对话的极长期会话记忆,包括问答、事件摘要和多模态对话生成任务(Maharana等,2024(https://arxiv.org/html/2606.10677#bib.bib9))。LongMemEval专注于聊天助手的长期交互记忆,评估信息提取、多轮推理、时序推理、知识更新和拒绝回答能力(Wu等,2025(https://arxiv.org/html/2606.10677#bib.bib20))。这些基准对于测试长上下文召回和时序对话理解很有用,但它们并未完全孤立地测试增量存储、修正和检索信息的记忆智能体所需的操作能力。MemoryAgentBench与本文目标更直接一致。它通过增量多轮交互评估记忆智能体,并识别出四种核心能力:准确检索、测试时学习、长距离理解和选择性遗忘(Hu等,2025(https://arxiv.org/html/2606.10677#bib.bib5))。这些能力与Infini Memory解决的主要设计问题相匹配:系统能否检索相关证据、在部署中获取新信息、整合长距离上下文以及修正过时记忆。因此,我们使用MemoryAgentBench作为主要评估设置,同时将结果解释为基准层面的证据,而非对所有长期记忆用例的完整刻画。
## 3 记忆设计
### 3.1 Infini Memory设计概述
Infini Memory将持久性记忆表示为一个**主题文档**(topic documents)库,其中主题定义了一个维护范围,将后续操作(路由、拆分、合并)中统一处理的条目分组。该范围由记忆在未来交互中将如何使用来定义。例如,关于用户稳定偏好或正在进行的项目的条目可能形成一个主题,因为它们为同一类未来问题和更新提供了上下文。这种设计避免了两种不太理想的极端情况:(1)如果记忆存储为孤立记录,相关证据可能被分离,后续检索可能返回缺乏足够上下文的碎片;(2)如果所有记忆存储在一个单一时间日志中,后续操作可能需要扫描或重写无关的历史。我们在附录A.2(https://arxiv.org/html/2606.10677#A1.SS2)中讨论了我们拒绝的替代方案(纯向量存储、纯知识图谱、无缓冲区)。主题文档提供了一个有界的单元,可以在局部标题下保留相关条目及其元数据,同时保持每个文档足够聚焦以进行重写、拆分和合并。
基于主题文档,Infini Memory围绕表示、写入、合并和检索组织其记忆管道。每个主题文档存储一个摘要、一个层级化正文和条目级元数据,以在有限的文档范围内组织相关证据(第3.2节(https://arxiv.org/html/2606.10677#S3.SS2))。新记忆首先进入名为`CURRENT`的短期缓冲区,这样频繁写入不会反复重写主题库;当足够多的相关证据积累后,触发合并(第3.3节(https://arxiv.org/html/2606.10677#S3.SS3))。在推理时,LLM迭代地搜索、检查和展开来自已维护主题库的上下文,以恢复超出单次检索结果的证据(第3.4节(https://arxiv.org/html/2606.10677#S3.相似文章
基于文件系统的LLM Agent记忆:组织、演化与可持续性
本文首次系统性地探索了基于文件系统的LLM Agent记忆,将管理、搜索和执行Agent的角色规范化,使其围绕一个共享的记忆存储。研究发现,组织主要降低了检索成本,但尚未提升答案质量,并且工具选择对存储形态的影响与模型选择一样大。
@dair_ai:关于LLM智能体长期记忆的优秀论文。(收藏)粗粒度的摘要会偏移,无约束的更新会导致信息损坏,……
AtomMem 为 LLM 智能体引入了一种长期记忆系统,将原子事实作为高效记忆单元,将其组织成层次化的事件结构和时间用户画像,在 LoCoMo 基准上达到了最先进水平。
SimpleMem: 面向大语言模型智能体的高效终身记忆
介绍SimpleMem,一种面向LLM智能体的高效记忆框架,利用语义无损压缩提升准确率并降低token消耗,F1分数提升26.4%,推理时token使用量减少高达30倍。
IFCMemoryBench:评估基于LLM的智能体在BIM信息检索中的长期记忆
本文介绍了IFCMemoryBench,一个经过人工验证的基准测试,用于评估基于LLM的智能体在BIM信息检索中的长期记忆。研究表明,当前的记忆系统仅能达到32.4%的答案准确率,揭示了智能体记忆中的领域迁移差距。
受人类启发的LLM智能体记忆架构
微软研究人员提出了一种受生物学启发的LLM智能体记忆架构,该架构结合了睡眠阶段巩固和基于干扰的遗忘机制,以高效管理持久性记忆。