具有快速写入路由和慢速整合的双层智能体记忆
摘要
本文提出了一种针对LLM智能体的双层智能体记忆框架,通过快速写入路由和慢速整合来管理知识生命周期,以在保持性能的同时修剪冗余外部记忆。
arXiv:2608.22215v1 公告类型:新
摘要:大型语言模型(LLM)智能体在动态环境中运行,知识不断演变。现有的记忆系统通常将外部记忆视为单调增长的存储库,不可避免地导致检索性能下降和计算成本随时间增加。我们认为核心挑战不仅仅是检索,而是管理知识生命周期:决定什么内容需要外部化、更新或最终内化。受神经科学中互补学习系统(CLS)理论的启发,我们提出了双层智能体记忆,一种将记忆管理转移到写入阶段的框架,通过成本感知的认知路由和定期参数整合实现。传入信息被分类为非写入、写入新内容或写入更新,并通过从小模型到大模型的级联路由,以最小化路由开销同时过滤冗余记忆。随后的写回阶段通过监督微调选择性地将高价值外部记忆整合到模型参数中。实验展示了我们方法的双重效率:一个1.7B/8B的级联可以修剪高达68%的冗余外部记忆,同时仅升级少于50%的输入,但保留了超过98%的由详尽保留基线实现的下游问答精确匹配(EM)。我们进一步表明,定期整合成功地将外部知识内化,使得路由器能够随着模型认知边界的演变自适应地抑制冗余写入。总体而言,我们的框架为智能体记忆提供了一个统一范式:选择性外部化后跟选择性内化。代码和数据集将在接受后发布。
查看缓存全文
缓存时间: 2026/08/25 04:28
# 具有快速写入路由与慢速整合的双层智能体记忆 来源:https://arxiv.org/html/2608.22215 **作者** 董杰(独立研究员) 吕童童(小红书) 兰蕊(小红书) 王佩瑶(独立研究员) 洪灵子(北德克萨斯大学) 潘伟航(浙江大学) 潘博元(浙江大学) 胡瑶(浙江大学) ###### 摘要 大型语言模型(LLM)智能体在动态环境中运行,知识持续演变。现有记忆系统通常将外部记忆视为单调递增的存储库,不可避免地导致检索性能随时间下降并增加计算成本。我们认为核心挑战不仅在于检索,更在于管理*知识生命周期*:决定哪些信息需要外部化、更新,或最终内化。受神经科学中互补学习系统理论启发,我们提出**双层智能体记忆**框架,通过成本感知的认知路由与周期性参数整合,将记忆管理重心转移至写入阶段。输入信息被分类为**不写入、写入新内容、写入更新**三种类型,并通过小到大的模型级联进行路由,以最小化路由开销并过滤冗余记忆。随后的回写阶段通过监督式微调,选择性地将高价值外部记忆整合进模型参数。实验表明该方案具有双重效率优势:1.7B/8B的级联结构可裁剪多达68%的冗余外部记忆,同时仅将少于50%的输入上传至大模型,却能保持穷举存储基线98%以上的下游问答精确匹配性能。我们进一步展示周期性能成功将外部知识内化,使路由器能随着模型认知边界演变自适应地抑制冗余写入。总体而言,本框架提出了智能体记忆的统一范式:选择性外部化后接选择性内化。代码与数据集将在论文接收后发布。 ## 1 引言 大型语言模型(LLM)智能体正越来越多地部署于多会话对话、自主研究、个人助理和持续决策系统等长期动态环境中。在这些场景中,知识随时间演变而非保持静态。智能体可能反复遇到已被其参数捕获的信息、超出当前参数记忆范围的新事实,或与过时内部信念直接冲突的更新。例如,助理可能积累大量冗余或过时的用户交互日志,却未能保留新提出的用户偏好或修正先前错误的假设。因此,有效的记忆管理对于智能体系统的持久连贯推理至关重要。 现有方法主要通过为智能体配备显式外部记忆机制来应对这一挑战,通常通过检索增强生成、记忆日志、分层缓冲区或结构化外部记忆实现。这些系统提升了超出上下文窗口的持续性,但通常将外部记忆视为无条件日志,观测数据被单调追加。由于过滤机制主要在*读取*阶段运行——依赖下游查询来调节检索——系统无法在源头主动拒绝冗余信息。这种设计导致了基本的存储-性能权衡:随着外部记忆增长,检索变得更具噪声、成本更高且对延迟更敏感。 另一类工作尝试通过知识编辑或持续学习直接将新知识融入模型参数,以绕过检索。虽然这实现了快速的无检索访问,但存在自身局限:参数更新计算成本高昂,易受干扰或灾难性遗忘影响。更重要的是,无论是重检索还是纯参数方法,都隐含假设固定的存储载体。知识被外部化或内部化,但很少被视为应跨存储载体动态分配、修正和迁移的事物。我们认为这种观点根本上是不完整的。核心挑战不是将过滤决策推迟到查询驱动的读取阶段,而是在知识进入系统时即管理其完整生命周期。当新事实到达时,智能体应立即将其与参数记忆进行比对,以判断该事实是否冗余、是否需写入外部记忆,以及是否应随后整合进模型参数。尤其外部记忆不应作为永久倾倒场,而应作为缺失于参数记忆或与过时内部信念冲突的知识的选择性临时存储。 这一视角自然连接到神经科学中的记忆机制。互补学习系统理论提出生物记忆依赖于两个交互子系统:能够快速编码新经验的快速学习海马体,以及通过睡眠离线重放逐步将稳定知识整合为长期表征的慢速学习新皮层。从这个角度看,外部记忆充当新信息或易冲突信息的可快速编辑海马缓冲区,而参数记忆则是更慢、更稳定的皮层基底。受此类比启发,我们将智能体记忆表述为由快速写入路由和慢速整合构成的*双层知识生命周期*问题。 具体而言,我们提出包含两类记忆和两种决策形式的双层系统: - **载体层**:智能体维护用于稳定、压缩、低成本知识的*参数记忆*,以及用于动态、可编辑、高风险事实的*外部记忆*。 - **决策层**:我们将*快速写入路由*与*慢速回写*(整合机制)分离。 我们将每条输入知识通过操作性分类框架划分为三类:**不写入**(已从参数记忆安全回答的知识)、**写入新内容**(参数记忆缺失的知识)、**写入更新**(模型产生非拒绝但错误答案,表明内部知识过时或冲突的知识)。为实现高效准入管理,写入路由器绕过显式三分类,直接通过二元准入决策优化连续的存储-性能权衡:**写入**或**丢弃**。其中,“写入”和“丢弃”是路由器层面的成本感知决策行为,而新旧事实的具体处理则延迟至后续整合阶段。 本框架的核心系统贡献在于将写入路由实现为*小到大级联*。我们不依赖大模型处理所有路由决策,而是使用轻量级模型进行廉价前端筛选以早期解决简单情况,仅将不确定或模糊的知识项提升至更强模型。这一设计至关重要,因为写入路由本身是资源分配问题:若路由器始终需要大模型,则路由成本将过高。级联结构因此不仅优化存储使用,也优化路由策略自身的计算成本。 为实施此框架,我们在原始(知识,查询,答案)三元组上构建行为标注流程。对每个三元组,我们比较零样本回答与显式记忆支持的回答:若模型零样本回答正确,相应知识被标注为**不写入**;若模型零样本失败但在记忆支持下成功,则属于可写入项。我们进一步根据零样本失败表现为明确拒绝还是自信错误答案,区分**写入新内容**与**写入更新**。这些标注使我们能够基于模型行为(而非抽象语义判断)训练和评估写入路由器。 参见标题 **图1:智能体记忆范式比较**。 (a)纯外部记忆:单调追加事实至外部数据库常导致记忆膨胀并降低检索精度。 (b)纯参数记忆:直接将连续更新融入模型权重计算成本高昂且易受灾难性遗忘影响。 (c)双层智能体记忆(本文方法):我们将记忆表述为知识生命周期。成本感知级联路由器(快速写入路由)过滤输入事实,提升不确定项以维持紧凑外部记忆。保留的外部记忆通过监督式微调(慢速整合)周期性内化。该过程更新模型参数知识,移动其认知边界以减少未来对外部记忆的依赖。 最后,我们研究作为生命周期慢半部的**回写**机制,将选定的写入新内容/更新记忆转化为微调监督信号,并测试先前依赖检索的事实是否变为可内部回答。在此意义上,本框架不仅关乎选择性存储,更关乎选择性内化:智能体首先仅外部化高价值知识,随后将稳定验证的记忆整合回参数记忆,以减少未来对检索的依赖。由于写入路由器直接操作模型隐状态和不确定性分布,它自然感知到整合过程:一旦事实被内化,其内部表征的转变促使路由器丢弃未来遇到的相同知识,有效闭环知识生命周期。 我们的贡献总结如下: - • 将智能体记忆表述为**双层知识生命周期系统**,统一外部记忆、参数记忆、快速写入路由与慢速整合。 - • 引入**操作性记忆分类**(不写入、写入新内容、写入更新)及**成本感知小到大路由级联**,将记忆准入框架化为精度-效率优化问题。 - • 提出周期性回写整合机制,实现**知识内化**与自适应**认知边界移动**,随参数知识演进逐步减少对外部记忆的依赖。 - • 构建在线**流式评估基准**,解耦写入时准入与读取时检索,表明选择性外部化与整合能缓解记忆膨胀,同时紧密匹配穷举记忆性能。 ## 2 相关工作 ##### 基于LLM的智能体记忆架构。 长期LLM智能体通常通过外部检索增强生成扩展工作记忆,早期系统如生成式智能体和MemGPT引入了长期记忆管理。随着记忆成为终身LLM智能体的核心,近期系统通过分层分块、动态链接和结构化记忆表征进一步改进工作记忆压缩与组织。但这些方法主要管理活跃上下文或组织存储记忆,缺乏在外部与参数记忆间闭环知识生命周期的机制。因此外部记忆可能积累冗余事实,导致记忆膨胀和访问质量下降。相比之下,我们的双层智能体记忆通过将记忆表述为知识生命周期来解决此问题,其中快速写入路由与慢速整合协同工作,实现选择性外部化后接选择性内化。 ##### 检索增强生成与路由。 为缓解穷举检索的延迟与噪声,近期框架动态路由记忆操作。但这些路由机制主要在*读取*阶段运行,依赖下游查询调节检索决策。为解决记忆准入这一基础问题——在存储前决定哪些内容需要外部化——我们显式将重点转移至*写入*阶段。借鉴广泛用于优化LLM生成的级联推理思想,我们采用成本感知小到大级联严格控制记忆准入。 ##### 知识编辑与持续参数更新。 ROME和MEMIT等技术更新特定模型参数以修正过时事实,近期方法将编辑扩展至长文本、多样化格式或参数保持的多跳场景。但持续参数更新计算成本高昂且极易导致灾难性遗忘。这促使我们使用外部记忆作为快速可编辑缓冲区,将参数修改保留用于较慢的离线整合。 ##### 神经科学启发的记忆与整合。 我们的架构设计受CLS框架启发,模拟快速学习海马体与慢速学习新皮层的交互。近期AI系统采用CLS启发的整合策略,通过结构化记忆、重建性持久性或混合记忆电路防止遗忘。相关持续学习工作进一步表明,类睡眠无监督重放能在有限或不平衡数据下提升保留率。基于此整合视角,我们将睡眠阶段转化为周期性监督式微调,物理性地将短暂外部记忆整合进模型参数。 ## 3 双层智能体记忆 我们将智能体记忆建模为*双层知识生命周期*问题。本框架
相似文章
学习保留内容:面向多智能体LLM系统高效协作的Gated-Memory Routing
本文提出了Gated-Memory Routing,一个用于多智能体LLM系统的框架,该框架使用学习到的门控机制来管理记忆,提高了在推理和代码生成基准测试中的准确性并降低了推理成本。
受人类启发的LLM智能体记忆架构
微软研究人员提出了一种受生物学启发的LLM智能体记忆架构,该架构结合了睡眠阶段巩固和基于干扰的遗忘机制,以高效管理持久性记忆。
RecMem:基于重复的记忆整合方法,用于高效且有效的长期运行LLM智能体
RecMem是一种基于重复的记忆整合方法,适用于长期运行的LLM智能体,通过仅在语义相似的交互重复出现时调用LLM,可减少高达87%的令牌消耗,同时提高准确性。
智能体LLM系统的共享选择性持久记忆
本文介绍了面向智能体LLM系统的共享选择性持久记忆,该记忆保留可复用的上下文(如任务规范和数据模式),同时丢弃会话特定的推理痕迹,在企业场景中实现了96%的任务完成率和显著的令牌成本降低。
面向长周期LLM智能体的选择性记忆保留
本文提出TraceRetain,这是一个用于冻结LLM智能体中绑定外部存储的轻量级框架,表明选择性记忆保留主要在记忆流包含噪声时与缓存启发式方法区分开,从而带来任务成功率和效率的提升。