DELTAMEM:基于残差树的LLM智能体增量经验记忆
摘要
DeltaMem将LLM智能体记忆组织成残差树,以减少冗余和检索冲突,存储经验的增量变体以支持持续学习。
arXiv:2606.03083v1 公告类型:新论文
摘要:基于大语言模型(LLM)的智能体越来越依赖记忆来在持续交互中从经验中学习。然而,将经验存储为独立的平面单元会导致大量冗余和检索冲突,因为类似的片段会重复重叠的内容,而微小的场景变化会导致检索到的记忆提供相互矛盾的指导。为了解决这个问题,我们引入了残差经验的概念,认为新获得的经验往往是已有知识的增量变体。我们提出了DeltaMem框架,该框架将经验记忆组织成两个独立的残差树:一个存储以目标为条件的任务经验作为可复用技能,另一个存储场景级环境知识。每棵树使用一个根节点来存放通用的基础经验,以及增量的delta节点来存放后续变体,使得相关经验能够共享共同的基础而不重复。在检索时,通过故障惩罚相似度扫描找到最佳匹配,并通过根到匹配链的组合重建完整经验。一种自主 consolidation 机制将高频路径提炼为新的根节点,使树能够从通用启发式方法自我组织为专门变体。在多种交互环境中的实验表明,DeltaMem持续优于现有基线。为促进未来研究,我们在 https://github.com/import-myself/DeltaMem 上发布了代码。
查看缓存全文
缓存时间: 2026/06/03 09:42
# DeltaMem:基于残差树的LLM代理增量经验记忆
来源:https://arxiv.org/html/2606.03083
Haoran Tan1111共同第一作者\.333北京大型模型与智能治理重点实验室444下一代智能搜索与推荐教育部工程研究中心,Zeyu Zhang1111共同第一作者\.333北京大型模型与智能治理重点实验室444下一代智能搜索与推荐教育部工程研究中心,Zhicheng Cao2,Rui Li1333北京大型模型与智能治理重点实验室444下一代智能搜索与推荐教育部工程研究中心,Xu Chen1222通讯作者\.333北京大型模型与智能治理重点实验室444下一代智能搜索与推荐教育部工程研究中心,
1中国人民大学高瓴人工智能学院,北京,中国, 2杜克大学医学院
\{tanhaoran1321,zeyuzhang,xu\.chen\}@ruc\.edu\.cn
###### 摘要
基于大语言模型(LLM)的智能体在持续交互中越来越依赖记忆来从经验中学习。然而,将经验存储为独立的、扁平化的单元会导致严重的冗余和检索冲突,因为相似的情节会重复重叠的内容,而微小的场景变化又会导致检索到的记忆提供相互矛盾的指导。为了解决这一问题,我们引入了残差经验的概念,认为新获得的经验通常是现有知识的增量变化。我们提出了DeltaMem,一个将经验记忆组织成两个独立残差树的框架:一个用于存储目标条件化任务经验作为可复用技能,另一个用于存储场景级环境知识。每棵树使用一个根节点来存储泛化的基础经验,并使用增量差异节点来存储后续的变化,使得相关经验可以在不重复的情况下共享共同基础。在检索时,采用失败惩罚相似度扫描找到最佳匹配,并通过根到匹配链的组合重构完整经验。一个自主整合机制将高频路径蒸馏成新的根节点,使得树能够从通用启发式策略自我组织为专门变体。在多种交互环境中的实验表明,DeltaMem一致性地优于现有基线。为了促进未来研究,我们在https://github.com/import-myself/DeltaMem 上发布了代码。
DeltaMem:基于残差树的LLM代理增量经验记忆
Haoran Tan1111共同第一作者\.333北京大型模型与智能治理重点实验室444下一代智能搜索与推荐教育部工程研究中心,Zeyu Zhang1111共同第一作者\.333北京大型模型与智能治理重点实验室444下一代智能搜索与推荐教育部工程研究中心,Zhicheng Cao2,Rui Li1333北京大型模型与智能治理重点实验室444下一代智能搜索与推荐教育部工程研究中心,Xu Chen1222通讯作者\.333北京大型模型与智能治理重点实验室444下一代智能搜索与推荐教育部工程研究中心,1中国人民大学高瓴人工智能学院,北京,中国,2杜克大学医学院\{tanhaoran1321,zeyuzhang,xu\.chen\}@ruc\.edu\.cn
## 1 引言
随着大语言模型(LLM)在推理和规划方面取得快速进展(Wang et al., 2024a (https://arxiv.org/html/2606.03083#bib.bib6)),自主智能体在解决长时域、复杂的序列决策任务方面展现出巨大潜力,这些任务涵盖网页导航、具身操作和科学实验等领域(Tan et al., 2026 (https://arxiv.org/html/2606.03083#bib.bib9))。然而,LLM 固有的无状态特性和有限的上下文迫使智能体在每个情节中从零开始推理,无法从过去的尝试中受益(Zhao et al., 2024 (https://arxiv.org/html/2606.03083#bib.bib7))。因此,为智能体配备记忆已成为一个核心机制。记忆使得经验学习成为可能,允许智能体积累过去的交互,适应不断变化的环境,并在连续情节中改进其行为策略(Zhang et al., 2025 (https://arxiv.org/html/2606.03083#bib.bib12))。
参考图注图 1:三种记忆存储范式。左:扁平轨迹存储。中:紧凑工作流/洞察提取。右:DeltaMem 的残差树,包含泛化的基础经验和增量 Δ\\Delta-节点。
当前用于经验学习的记忆机制大致分为两大类,如图 1 (https://arxiv.org/html/2606.03083#S1.F1) 所示。第一类将完整或压缩的历史轨迹存储为记忆单元(Zheng et al., 2024 (https://arxiv.org/html/2606.03083#bib.bib23))。在推理时,检索最相关的过去情节作为少样本示例。第二类侧重于从过去的经验中提取高层洞察、反思或规则,而不是使用原始轨迹步骤(Ouyang et al., 2025 (https://arxiv.org/html/2606.03083#bib.bib25); Wang et al., 2024b (https://arxiv.org/html/2606.03083#bib.bib24))。这些提取的洞察随后作为文本提示添加到智能体的上下文中,以指导未来的决策。
尽管这两种方法被广泛使用,但它们都将每个记忆项视为一个**独立的、扁平化的单位**,无论这个项目是轨迹示例还是提取的洞察。存储来自相似场景的完整情节会造成大量冗余,并忽略跨情节的联系。在读取时,检索到的记忆在源任务或上下文上的差异可能导致冲突,提供相互矛盾的指导,从而降低决策质量并限制持续适应能力。例如,两个将物体放在桌子上的情节,但房间布局不同,当它们一起被检索时,会在搜索位置方面给出冲突的建议,同时重复放置步骤,将可复用的任务逻辑和场景特定的空间事实混合在一个扁平条目中。
为了解决这些局限性,我们提出了 DeltaMem,一个双树残差记忆框架,将经验解耦为用于目标条件化动作策略的任务树(Task-Tree)和用于场景级声明性知识的环境树(Env-Tree)。该框架不是保存完整轨迹或将洞察提取到扁平孤立的存储库中,而是将一些泛化的基础经验(来自任务或环境)作为根节点存储,并将新情节记录为紧凑的残差差异节点,仅保留它们的增量差异。在检索时,采用带有失败节点惩罚的全局相似度扫描,通过根到匹配链的组合重构一个连贯且无冲突的经验上下文。受神经科学记忆巩固(McGaugh, 2000 (https://arxiv.org/html/2606.03083#bib.bib21))的启发,高频收敛路径被自主蒸馏成新的根节点,使得记忆能够随时间自我组织。为了促进社区采用,我们在 https://github.com/import-myself/DeltaMem 上发布了代码。
总之,我们的贡献如下: ∙\\bullet我们通过增量差异存储引入了残差经验的概念,以消除记忆冗余和检索冲突。基于这一基础,我们提出了 DeltaMem,一个双树框架,进一步将任务策略与环境知识解耦,使得每个维度能够独立检索和演化。 ∙\\bullet我们设计了一种树内记忆巩固机制,将高频收敛路径蒸馏成新的根节点,使得记忆层次能够在连续情节中自主组织。 ∙\\bullet我们在多种交互环境中系统地评估了 DeltaMem,展示了相对于现有经验记忆基线的一致且显著的改进。
## 2 相关工作
参考图注图 2:DeltaMem 概述。顶部:端到端流水线。任务指令触发从双树的检索,重构的记忆上下文被注入智能体以进行环境交互,然后通过在线学习将产生的经验提取回树中。左下:树细节,显示节点内容结构、跨所有树的全局搜索以及重构的根到匹配路径。右下:链重构,将基础技能与 Δ\\Delta 技能差异、基础知识与 Δ\\Delta 知识差异组装成完整、无冲突的记忆上下文,供下游智能体使用。
#### 基于 LLM 的智能体。
基于 LLM 的自主智能体通常围绕四个核心组件构建,即**配置**、**规划**、**记忆**和**动作**(Wang et al., 2024a (https://arxiv.org/html/2606.03083#bib.bib6); Summers et al., 2023 (https://arxiv.org/html/2606.03083#bib.bib20))。ReAct(Yao et al., 2022b (https://arxiv.org/html/2606.03083#bib.bib8))建立了一个基于环境反馈的思维-动作-观察循环;Reflexion(Shinn et al., 2023 (https://arxiv.org/html/2606.03083#bib.bib10))添加了言语自我批评以进行情节内改进。思维链提示(Wei et al., 2022 (https://arxiv.org/html/2606.03083#bib.bib26))进一步改进了单个情节内的多步推理。规划已通过树搜索(Yao et al., 2023 (https://arxiv.org/html/2606.03083#bib.bib11))和层次化框架(Tan et al., 2026 (https://arxiv.org/html/2606.03083#bib.bib9))得到了扩展。尽管在每个情节上表现强劲,但这些系统将每个情节视为独立的,跨情节的经验积累仍然是一个开放且活跃的研究挑战。
#### 智能体记忆。
记忆在对话和个人助手场景中得到了广泛研究(Zhang et al., 2025 (https://arxiv.org/html/2606.03083#bib.bib12); Tan et al., 2025 (https://arxiv.org/html/2606.03083#bib.bib13); Zhang et al., 2026a (https://arxiv.org/html/2606.03083#bib.bib14))。对于显式记忆,MemGPT(Packer et al., 2023 (https://arxiv.org/html/2606.03083#bib.bib17))引入了操作系统风格的分页来扩展 LLM 上下文,Mem0(Chhikara et al., 2025 (https://arxiv.org/html/2606.03083#bib.bib18))支持可扩展的长期个人记忆,生成式智能体(Park et al., 2023 (https://arxiv.org/html/2606.03083#bib.bib19))维护了一个感知-反思-检索流,而 MemTree(Rezazadeh et al., 2025 (https://arxiv.org/html/2606.03083#bib.bib22))将记忆组织成树状结构以实现结构化检索。Zhang 等人(2026b (https://arxiv.org/html/2606.03083#bib.bib15))进一步探索了通过将过去交互编码到模型参数中的隐式记忆。对于交互式任务智能体,记忆用于跨情节累积可执行的体验。Synapse(Zheng et al., 2024 (https://arxiv.org/html/2606.03083#bib.bib23))检索最相似的成功轨迹作为少样本示例,但存储量线性增长;AWM(Wang et al., 2024b (https://arxiv.org/html/2606.03083#bib.bib24))和 ExpeL(Zhao et al., 2024 (https://arxiv.org/html/2606.03083#bib.bib7))将工作流规则提取到扁平的每个任务文件中;ReasoningBank(Ouyang et al., 2025 (https://arxiv.org/html/2606.03083#bib.bib25))将提炼的经验标记为成功或失败条目。Voyager(Wang et al., 2023 (https://arxiv.org/html/2606.03083#bib.bib27))通过开放式探索构建了一个不断增长的技能库,而 ReMEmbR(Anwar et al., 2025 (https://arxiv.org/html/2606.03083#bib.bib16))为机器人导航构建结构化情节记忆。这些扁平结构无法跨场景变体泛化,也无法将任务策略与环境知识解耦。
相比之下,DeltaMem 通过一个双残差树解决了这些局限性,该树将任务策略(任务树)与环境知识(环境树)解耦,并将每个新经验存储为相对于最相似现有链的紧凑差异,从而实现跨场景泛化,而不会导致存储线性增长。
## 3 方法
DeltaMem 围绕两个互补原则构建:**结构解耦**和**残差压缩**。它不是将每个情节视为一个独立的扁平记忆单元,而是将经验分离成两个正交维度:目标条件化的程序性经验和场景级环境知识,并将每次新交互存储为相对于最相似先前经验的增量差异。图 2 (https://arxiv.org/html/2606.03083#S2.F2) 提供了系统级概览,左侧面板显示了双树结构,中间面板显示了带有失败节点惩罚的全局扁平检索,右侧面板显示了根到匹配链重构,该重构为 LLM 组装了一个完整、无噪声的经验上下文。
参考图注图 3:DeltaMem 中的自主记忆巩固。残差节点累积成功命中计数(阶段 1);当达到 KconsK_{\\text{cons}} 时,LLM 将链融合为新的根节点 R∗R^{\*}(阶段 2);后续查询直接匹配 R∗R^{\*},绕过链遍历(阶段 3)。
### 3.1 双树记忆架构
智能体经验涵盖两个性质不同的维度。**任务策略**捕获针对特定目标的条件化程序性动作,而**环境知识**涵盖场景级声明性事实,如物体特征、空间布局和交互规则,这些保持全局一致且与任务无关。将这两个维度混在一起会导致任务特定的启发式策略与通用场景事实混合,当智能体试图在熟悉环境中完成新目标时,会造成跨任务的知识干扰。例如,查找和放置物体的逐步动作序列属于任务策略,而观察结果(如某类物体通常存放在哪里)构成可跨多个不同任务目标迁移的场景知识。
为了实现这种解耦,DeltaMem 维护了两个独立的层次化记忆结构。**任务树**(Ttask\\mathcal{T}_{\\text{task}})存储程序性经验条目,每个条目组织为一个可复用的**技能**,包含三个组件:
Skill=⟨α,π,ω⟩\\text{Skill}=\\langle\\alpha,\\pi,\\omega\\rangle (1)
其中 α\\alpha 是激活条件,指定该技能何时适用;π\\pi 是执行过程,一个自包含的有序动作序列;ω\\omega 是终止条件,指示技能何时完成。当前指令中提取的任务目标在推理时作为对任务树的查询。
同时,**环境树**(Tenv\\mathcal{T}_{\\text{env}})存储**场景知识条目**,每个条目捕获环境级声明性事实:
Knowledge=⟨α,κ⟩\\text{Knowledge}=\\langle\\alpha,\\kappa\\rangle (2)
其中 α\\alpha 是用于匹配的场景级描述性触发器,κ\\kappa 表示声明性内容,如物体布局和交互规则。环境树查询不是依赖于单独生成的环境描述,而是通过从任务指令或初始观察(例如场景描述和空间上下文)中提取与环境相关的部分获得,将其与目标规范解耦。这两棵树异步且独立地演化;它们各自的检索链仅在推理时融合,确保了智能体记忆的干净、无干扰表示。
### 3.2 残差树结构
为了直接解决大规模记忆冗余和检索冲突的问题,DeltaMem 中的每棵树都采用残差存储方式:不是将每一次完整经验存储为一个扁平节点,而是将共享共同基础的相关经验组织(或合并)到基于根节点的链中。**根节点**编码泛化的基础经验(代表性模式),而后续的**差异节点**(Δ\\Delta-节点)仅存储与根节点或先前差异节点的增量差异。在检索时,遍历根节点到匹配的差异节点路径,按顺序组合编码的经验,进行重构。这种紧凑的表示显著减少了冗余,并通过将独特特征限制在专用差异节点中,防止了场景变体之间的冲突。
具体来说,DeltaMem 中的每棵树从一个空根节点开始初始化,此时为空。对于第一个到达的经验,它直接成为根节点。之后,当遇到一个新经验时,进行全局相似度扫描(第 3.3 节)以定位最佳匹配节点。如果相似度超过预设阈值 SretrieveS_{\\text{retrieve}},新经验将被视为一个差异节点添加到匹配节点之下;否则,它将作为一个新的根节点插入。值得注意的是,与现有的结构化记忆不同,DeltaMem 不限制树的高度或宽度——实验中的树自然演化为浅而宽的拓扑结构,因为经验差异相对于根节点通常保持简短。相似文章
RecMem:基于重复的记忆整合方法,用于高效且有效的长期运行LLM智能体
RecMem是一种基于重复的记忆整合方法,适用于长期运行的LLM智能体,通过仅在语义相似的交互重复出现时调用LLM,可减少高达87%的令牌消耗,同时提高准确性。
SimpleMem: 面向大语言模型智能体的高效终身记忆
介绍SimpleMem,一种面向LLM智能体的高效记忆框架,利用语义无损压缩提升准确率并降低token消耗,F1分数提升26.4%,推理时token使用量减少高达30倍。
AdMem:面向任务求解智能体的高级记忆系统
本文介绍AdMem,一种面向基于LLM的智能体的统一记忆框架,整合语义记忆、情景记忆和程序性记忆,并采用双层短期与长期存储结构,通过多智能体架构实现自动记忆生成与自适应检索。实验表明,该方法在长程多轮任务中提升了鲁棒性和成功率。
ElasticMem:作为LLM智能体可学习资源的潜在记忆
ElasticMem 为 LLM 智能体引入了一种可学习的潜在记忆机制,该机制能够自适应地为检索到的记忆分配可变预算,从而在减少 token 成本的同时,提升内存密集型问答和具身智能体任务的性能。
ActiveMem:面向长程LLM推理的分布式主动记忆
ActiveMem提出了一种分布式主动记忆系统,将智能体记忆与大模型核心推理过程解耦,在长程任务上实现了最先进的准确率,同时显著降低了开销。