AutoMem: 一种用于自动化记忆架构搜索的文本梯度递归自我改进框架
摘要
AutoMem 是一个文本梯度递归自我改进框架,用于LLM代理中的自动化记忆架构搜索,它发现任务自适应架构,这些架构在准确性和效率上超越了人类设计的基线。
arXiv:2608.14621v1 公告类型:新
摘要:长期记忆在LLM代理中越来越核心,但记忆设计仍然是一个高度耦合的架构问题:什么信息需要编码、如何存储、如何检索以及如何管理,在不同任务和骨干模型之间可能存在显著差异。我们构建了一个离散搜索空间,包含5个编码器、5个存储器、6个检索器和4个管理器,并表明没有单一的记忆架构能持续占据主导:不同任务偏好不同的模块组合,导致显著的性能差距。受此启发,我们提出了\textsc{AutoMem},一个用于任务自适应记忆架构搜索的文本梯度递归自我改进框架。\textsc{AutoMem}通过两个组件优化分解空间:经验引导架构搜索,它从历史搜索轨迹和累积反思中提出候选架构;以及失败引导模块诊断,它将与记忆相关的故障定位到特定模块,并将其转化为有针对性的文本反馈。在GAIA、WebWalkerQA和xBench-DeepSearch上跨越两个LLM骨干的实验表明,\textsc{AutoMem}持续发现任务自适应记忆架构,这些架构在准确性和效率上超越了最强的人类设计记忆基线,在六个基准-骨干设置中平均提高了$2.8$个点的准确性。进一步分析表明,\textsc{AutoMem}实现了有利的准确性-效率权衡,在Qwen3.5-122B-A10B下,将令牌成本降低了$14.3\%$,同时在仅几次引导迭代中就找到了比大幅随机搜索更强的架构。
查看缓存全文
缓存时间: 2026/08/18 09:45
# AutoMem:一种用于自动记忆架构搜索的文本梯度递归自我改进框架
来源:https://arxiv.org/html/2608.14621
林杜¹,周杰¹,²*(通讯作者),蔡宇轩¹,陈凯²,陈勤¹,李鑫²,张博²,李伟²,何良¹
¹华东师范大学计算机科学与技术学院,上海
²上海人工智能实验室
{jzhou, qchen, lhe}@cs.ecnu.edu.cn
https://github.com/ECNU-ICALK/AutoMem
###### 摘要
长期记忆在大型语言模型智能体中日益重要,但记忆设计仍是一个高度耦合的架构问题:编码什么、如何存储、如何检索以及如何管理,这些方面因任务和基础模型的不同而存在显著差异。我们构建了一个包含5种编码器、5种存储器、6种检索器和4种管理器的离散搜索空间,并证明没有单一记忆架构能始终占据优势:不同任务偏好不同的模块组合,导致性能差距显著。基于此,我们提出了AutoMem,一种用于任务自适应记忆架构搜索的文本梯度递归自我改进框架。AutoMem通过两个组件优化分解后的搜索空间:经验引导的架构搜索(从历史搜索轨迹和累积反思中提出候选架构)和失败引导的模块诊断(将记忆相关失败定位到具体模块,并将其转化为针对性的文本反馈)。在GAIA、WebWalkerQA和xBench-DeepSearch上跨两个大型语言模型基础模型进行的实验表明,AutoMem持续发现任务自适应记忆架构,其性能优于最强的人工设计记忆基线,在六个基准-骨干设置中平均提升2.8个百分点。进一步分析显示,AutoMem实现了良好的准确性-效率权衡,在Qwen3.5-122B-A10B下相比最强准确性基线降低了14.3%的令牌成本,同时仅通过几次引导迭代就发现了比大幅随机搜索更优的架构。
## 1 引言
长期记忆已成为大型语言模型智能体的重要组成部分[1](https://arxiv.org/html/2608.14621#bib.bib1)。它使智能体能够保留过去交互、轨迹和任务执行中的可重用信息,并在未来的决策中复用此类信息。现有工作探索了基于对话和轨迹的情景记忆[2](https://arxiv.org/html/2608.14621#bib.bib2)、[3](https://arxiv.org/html/2608.14621#bib.bib3)、[4](https://arxiv.org/html/2608.14621#bib.bib4)、[5](https://arxiv.org/html/2608.14621#bib.bib5),语言反思和提炼的经验[6](https://arxiv.org/html/2608.14621#bib.bib6)、[7](https://arxiv.org/html/2608.14621#bib.bib7),以及以技能、工作流或测试时备忘录形式存在的程序性记忆[8](https://arxiv.org/html/2608.14621#bib.bib8)、[9](https://arxiv.org/html/2608.14621#bib.bib9)、[10](https://arxiv.org/html/2608.14621#bib.bib10)、[11](https://arxiv.org/html/2608.14621#bib.bib11),以及智能体间的结构化经验共享[12](https://arxiv.org/html/2608.14621#bib.bib12)。这些系统表明,智能体记忆不再是一个单一的检索增强存储,而是一个涉及编码内容、存储方式、检索方法和随时间维护方式决策的多模块子系统[13](https://arxiv.org/html/2608.14621#bib.bib13)。然而,大多数记忆系统在部署后仍是手工设计且固定的。这存在局限性,因为记忆效果依赖于多个模块间的交互。任务可能失败的原因包括:有用信息未被编码、存储的表示难以检索、检索器选择了不相关的记忆,或者记忆库包含过时、重复或冲突的条目。因此,改进智能体记忆需要优化整个记忆架构,而非调整单个检索组件。
为了系统地研究这个问题,我们将长期记忆分解为四个模块:编码、存储、检索和管理。编码决定哪些信息应写入记忆,存储决定记忆的表示方式,检索决定如何选择相关记忆,管理控制记忆的整合、去重、淘汰和冲突解决。基于先前记忆系统的常见设计,我们构建了一个包含5种编码器、5种存储器、6种检索器和4种管理器的离散搜索空间。这使得记忆设计转化为在 $\mathcal{A} = \mathcal{E} \times \mathcal{S} \times \mathcal{R} \times \mathcal{M}$ 上的记忆架构搜索问题。我们的初步研究表明,架构选择是性能差异的主要来源。在分解空间上的简单搜索可以发现与强大固定记忆基线匹配或超越它们的架构。更重要的是,最佳架构因数据集和基础模型而异,且模块效应强烈耦合。例如,即使编码器写入了低质量记忆,强大的检索器也可能失败;同样,如果检索器无法正确查询,有用的存储格式也可能无效。这些发现表明记忆架构搜索是有价值的,但穷举或随机搜索成本高昂,因为每个候选架构都需要完整的智能体展开,且提供的可重用优化信号有限。
我们提出了AutoMem,一种用于任务自适应记忆架构搜索的文本梯度递归自我改进框架(图2[2](https://arxiv.org/html/2608.14621#S4.F2))。AutoMem包含两个组件。经验引导的架构搜索从历史搜索轨迹、已评估架构、性能记录和累积反思中提出候选架构。失败引导的模块诊断分析失败的展开过程,将记忆相关故障定位到编码、存储、检索或管理模块,并将其转化为针对下一轮搜索的定向文本反馈。通过反复的提议、评估、诊断和验证,AutoMem将失败轨迹转化为改进记忆架构的方向性信号。
我们在多个大型语言模型骨干网络上对AutoMem在GAIA、WebWalkerQA和xBench-DeepSearch上进行了评估。实验表明,AutoMem发现了优于所有强大基线的任务自适应记忆架构,同时降低了每任务的令牌成本。此外,AutoMem随着迭代稳步提高所发现记忆架构的质量,并在几轮内快速识别出优于大幅随机搜索的架构。我们的贡献有三方面:
- •我们通过将记忆架构分解为编码、存储、检索和管理模块,系统化了大型语言模型智能体的长期记忆设计空间,并实证研究了哪些模块设计和跨模块交互对记忆效果最为关键。
- •我们提出了AutoMem,一种在有限评估预算下高效识别任务自适应记忆架构的递归自我改进框架,结合了经验引导的架构搜索与失败引导的模块诊断。
- •我们在多个大型语言模型骨干网络上对GAIA、WebWalkerQA和xBench-DeepSearch进行了实验,表明任务自适应记忆架构优于人工设计的框架。
## 2 相关工作
#### 面向大型语言模型智能体的记忆架构。长期记忆已成为大型语言模型智能体的重要组成部分。现有方法通过将对话或轨迹总结到记忆存储中并按相关性检索来存储和检索情景经验[2](https://arxiv.org/html/2608.14621#bib.bib2)、[3](https://arxiv.org/html/2608.14621#bib.bib3)、[4](https://arxiv.org/html/2608.14621#bib.bib4)、[5](https://arxiv.org/html/2608.14621#bib.bib5),提炼语言自我反思和跨任务洞见以供复用[6](https://arxiv.org/html/2608.14621#bib.bib6)、[7](https://arxiv.org/html/2608.14621#bib.bib7),诱导程序性记忆,如可重用技能、工作流或测试时的“备忘录”[8](https://arxiv.org/html/2608.14621#bib.bib8)、[9](https://arxiv.org/html/2608.14621#bib.bib9)、[10](https://arxiv.org/html/2608.14621#bib.bib10)、[11](https://arxiv.org/html/2608.14621#bib.bib11),或在智能体间共享结构化经验[12](https://arxiv.org/html/2608.14621#bib.bib12)。这些研究表明记忆可以改进智能体的学习、推理和跨任务复用。然而,它们也表明记忆不是单一的检索组件,而是一个涉及编码内容、存储方式、检索方法和随时间维护方式的耦合架构[13](https://arxiv.org/html/2608.14621#bib.bib13)。大多数现有系统手工选择一种记忆配置并保持固定。相比之下,AutoMem将这些设计选择系统化到一个离散的编码/存储/检索/管理空间中,并将记忆架构本身视为一个可优化的变量。
#### 自我演进记忆。更相近的研究方向是自适应或自我演进的记忆系统。Zhang等人[14](https://arxiv.org/html/2608.14621#bib.bib14)通过从执行日志中合成新的记忆实现,并通过锦标赛评估选择候选方案来元进化整个记忆系统。这种方法增加了记忆设计的灵活性,但每个候选都是整体实现,难以将功劳归于单个记忆模块或进行受控的模块级编辑。Liu等人[15](https://arxiv.org/html/2608.14621#bib.bib15)引入了一个带有回滚机制的结构化诊断循环,但主要调整对话QA记忆的检索配置。更广泛地讲,自动化智能体设计方法搜索代码定义的智能体[16](https://arxiv.org/html/2608.14621#bib.bib16)、工作流[17](https://arxiv.org/html/2608.14621#bib.bib17)、智能体图[18](https://arxiv.org/html/2608.14621#bib.bib18)、符号智能体参数[19](https://arxiv.org/html/2608.14621#bib.bib19)或自我修改的编码智能体[20](https://arxiv.org/html/2608.14621#bib.bib20),但它们主要优化提示、工具、工作流或编排,而非记忆子系统。AutoMem与这些方法的不同之处在于对四个记忆模块进行结构化的、可归因于模块的搜索。这使得候选方案在构造时即有效,允许受控的架构编辑,并能在智能体网络任务上进行任务自适应的记忆优化。
#### 文本梯度优化。AutoMem也与文本梯度和失败驱动优化相关。先前工作将大型语言模型生成的自然语言反馈视为优化信号。ProTeGi使用文本“梯度”来批评和编辑提示[21](https://arxiv.org/html/2608.14621#bib.bib21),TextGrad通过计算图传播文本反馈[22](https://arxiv.org/html/2608.14621#bib.bib22),OPRO和DSPy使用大型语言模型优化提示或管道参数[23](https://arxiv.org/html/2608.14621#bib.bib23)、[24](https://arxiv.org/html/2608.14621#bib.bib24)。这些方法主要优化单个文本对象、提示或管道参数,而非结构化的记忆架构。另一条线将智能体失败归因于负责的步骤或模块[25](https://arxiv.org/html/2608.14621#bib.bib25)、[26](https://arxiv.org/html/2608.14621#bib.bib26)、[27](https://arxiv.org/html/2608.14621#bib.bib27),但通常止步于诊断。AutoMem通过将失败展开转化为模块级文本反馈连接了这两个方向。该反馈将记忆相关故障定位到编码、存储、检索或管理,然后指导在搜索轮次中得到验证的架构编辑。这完成了从失败归因到记忆架构改进的闭环。
表1:沿四个模块$(E,S,R,M)$分解的代表性记忆系统,每个映射到我们菜单(表5[5](https://arxiv.org/html/2608.14621#A3.T5))中最接近的原子组件;管理列则列出每个系统的生命周期操作,该菜单中的管理预设对此进行了捆绑。“–”表示系统未实现的模块(例如,无选择性检索或无生命周期管理)。现有系统仅实例化了几个组件,其余保持通用默认值,而AutoMem搜索所有四个。
## 3 初步分析
### 3.1 智能体记忆架构的模块化视图
在介绍AutoMem之前,我们首先阐明当大型语言模型智能体配备长期记忆时,优化的是什么。现有记忆系统在表面上存在显著差异:一些存储情景轨迹,一些提炼语言反思,一些维护技能库或工作流记忆,还有一些构建图结构记忆或策展知识库。尽管存在这种多样性,它们的设计可以组织为四个反复出现的架构模块:编码、存储、检索和管理。我们用 $\mathcal{E}$、$\mathcal{S}$、$\mathcal{R}$ 和 $\mathcal{M}$ 表示这四个模块的候选集,并用小写字母 $e \in \mathcal{E}$、$s \in \mathcal{S}$、$r \in \mathcal{R}$ 和 $m \in \mathcal{M}$ 表示具体的模块选择。
**编码**决定哪些信息应写入记忆。常见选择包括与任务无关的提示、失败衍生的洞见、压缩的行动-观察轨迹、可重用的工作流,以及参数化的技能或快捷方式。这些选择反映了关于何种经验可重用的不同假设:自然语言反思强调一般性教训,轨迹记忆保存具体的示范,而工作流和技能记忆旨在捕获程序性知识。
**存储**决定编码后的记忆如何表示。现有系统使用纯文本缓冲区、键值记录、密集向量索引、混合符号-向量存储、实体-关系图或大型语言模型构建的时序知识图谱。存储格式不仅影响记忆容量,还影响哪些检索和管理操作是可行的。例如,基于图的检索需要图结构的存储,而基于嵌入的检索天然与向量化记忆表示配对。
**检索**决定在推理时如何选择相关记忆。现有方法包括语义检索、词法-语义混合检索、基于成功和失败案例的对比检索、基于案例的重排序、图遍历、假设文档嵌入,以及多样性感知选择。检索通常被视为核心记忆操作,但其有效性很大程度上取决于已编码的内容及其存储方式。
**管理**决定记忆库如何随时间演变。代表性的操作包括遗忘、去重、冲突解决、记忆整合、轨迹到工作流的提升以及技能验证。对于长时间运行的智能体,管理尤为重要,因为过时、冗余或冲突的记忆即使检索本身准确也可能降低性能。
在这种模块化视图下,一个记忆架构是一个元组 $a=(e,s,r,m)$,其中 $e$、$s$、$r$ 和 $m$ 分别从编码、存储、检索和管理候选集中选择。无约束的笛卡尔空间是 $\widetilde{\mathcal{A}} = \mathcal{E} \times \mathcal{S} \times \mathcal{R} \times \mathcal{M}$。在实践中,并非每个元组都有效,因为一些模块施加了兼容性约束。因此,我们将可行的记忆架构空间定义为 $\mathcal{A} = \{(e,s,r,m) \in \widetilde{\mathcal{A}} \mid \operatorname{Valid}(e,s,r,m) = 1\}$,其中 $\operatorname{Valid}(\cdot)$ 过滤相似文章
AutoMem: 作为认知技能的记忆自动化学习
AutoMem 引入了一个框架,将记忆管理作为 LLM 的可训练技能进行自动化学习,通过优化记忆结构和熟练度,将长期任务的性能提升 2-4 倍。
EvolveMem: 通过AutoResearch实现LLM智能体的自演化记忆架构
EvolveMem为LLM智能体引入了一种自演化记忆架构,通过LLM驱动的诊断和迭代研究周期来优化检索配置,在LoCoMo和MemBench等基准测试上取得了显著的性能提升。
@omarsar0: // AutoMem // 我非常喜欢这个元记忆的概念。(标记一下) 这项来自斯坦福的新研究将智能体的记忆…
这篇斯坦福研究论文介绍了AutoMem,这是一个将智能体记忆管理视为可训练技能的框架。通过分别优化记忆结构和熟练度,AutoMem在长周期任务上将基础智能体性能提升了2到4倍,使得一个32B开源权重模型能够与Claude Opus 4.5和Gemini 3.1 Pro Thinking等前沿系统竞争。
SelfMem: 面向AI智能体的自优化记忆框架
SelfMem提出了一种面向AI智能体的自优化记忆框架,使其能够通过记忆工具和反馈信号探索、评估和优化自身的记忆策略,在BEAM基准测试上,于大型对话规模下相较于基线方法取得了显著改进。
从多模态经验中学会学习
本文介绍了AutoMMemo,一个使多模态智能体能够自动设计记忆机制(可表达为可执行的备忘录程序)以从多模态交互轨迹中学习的框架,在GUI/Web导航和视觉推理基准上优于无记忆和固定记忆基线。