SelfMem: 面向AI智能体的自优化记忆框架
摘要
SelfMem提出了一种面向AI智能体的自优化记忆框架,使其能够通过记忆工具和反馈信号探索、评估和优化自身的记忆策略,在BEAM基准测试上,于大型对话规模下相较于基线方法取得了显著改进。
查看缓存全文
缓存时间: 2026/07/07 04:38
# SelfMem:AI智能体的自我优化记忆
来源:https://arxiv.org/html/2607.03726
Shu Yang¹、Junchao Wu²、Derek F. Wong²、Di Wang¹†
¹PRADA实验室,阿卜杜拉国王科技大学
²NLP2CT实验室,澳门大学
###### 摘要
尽管当前的AI智能体在处理长程任务时已支持越来越长的上下文窗口、工具使用和技能执行,但它们仍需记忆系统来有效利用历史经验。现有的记忆框架通常依赖固定的存储、检索和摘要机制,这些机制在不同任务间可能显得僵化,且常需手动调优。为解决这一局限,我们提出SelfMem,一个自我优化的记忆框架。受自我改进AI相关工作的启发,我们遵循“授人以渔而非授人以鱼”的原则。SelfMem并不强制模型遵循预定义的记忆策略或格式,而是提供一个包含记忆工具和反馈信号的环境,让智能体能够自主探索、评估并优化自身的记忆策略。实验结果表明,在BEAM基准上,从100K到1M token的对话规模下,SelfMem始终优于检索、压缩和智能体记忆基线方法。与最强基线相比,在100K、500K和1M规模下,官方评分分别提升48.7%、40.8%和41.9%。进一步的问题类型分析显示,该方法在多样的记忆需求下具有广泛的鲁棒性,而优化研究表明,模型引导的策略优化能进一步提升性能。
## SelfMem:AI智能体的自我优化记忆
††通讯作者
## 1 引言
随着处理更长上下文能力(Bai等人,2024 (https://arxiv.org/html/2607.03726#bib.bib41))、执行多步规划(Li等人,2025 (https://arxiv.org/html/2607.03726#bib.bib32))、使用外部工具(Schick等人,2023 (https://arxiv.org/html/2607.03726#bib.bib24))以及整合环境反馈(Yao等人,2023 (https://arxiv.org/html/2607.03726#bib.bib23);Shinn等人,2023 (https://arxiv.org/html/2607.03726#bib.bib26);Zhou等人,2024 (https://arxiv.org/html/2607.03726#bib.bib25))的不断增强,AI智能体已在日益多样化的长程任务中展现出强大能力(Liu等人,2024b (https://arxiv.org/html/2607.03726#bib.bib28);Merrill等人,2026 (https://arxiv.org/html/2607.03726#bib.bib29))。然而,这些进步也对智能体在长时间交互中记忆用户偏好、项目背景和重要事实细节的能力提出了更高要求,使得有效的记忆系统支持变得至关重要(Liu等人,2024a (https://arxiv.org/html/2607.03726#bib.bib22);Packer等人,2023 (https://arxiv.org/html/2607.03726#bib.bib27);Zhong等人,2024 (https://arxiv.org/html/2607.03726#bib.bib30);Tavakoli等人,2025 (https://arxiv.org/html/2607.03726#bib.bib31))。

图1:「授人以渔而非授人以鱼」:引导智能体通过学习原则和权衡来自我优化记忆,而非依赖僵化、预定义的记忆策略。

图2:SelfMem概览。原始转录文本作为不可变的事实来源,同时智能体被赋予记忆动作空间,用于检查转录文本、编写和修订记忆以及审查记忆质量。
现有的智能体记忆方法,如LoCoMo、检索增强生成(RAG)、MemGPT和MemoryBank,通常依赖手动指定的策略来构建、更新、检索和向模型呈现历史知识(Maharana等人,2024 (https://arxiv.org/html/2607.03726#bib.bib19);Packer等人,2023 (https://arxiv.org/html/2607.03726#bib.bib27);Zhong等人,2024 (https://arxiv.org/html/2607.03726#bib.bib30))。尽管这些方法提升了智能体利用过往对话历史的能力,但其记忆结构和操作在很大程度上仍是预定义的,限制了其在更广泛任务中的适应性。A-Mem(Xu等人,2026 (https://arxiv.org/html/2607.03726#bib.bib39))采取了更具主体性的步骤,允许智能体自行编写、索引、检索和链接记忆,遵循Zettelkasten原则维护一个不断发展的知识网络。然而,核心挑战依然存在:不同的任务和对话历史需要不同的记忆行为,但如何让智能体根据任务需求和环境反馈调整其记忆策略仍不明确。如图1 (https://arxiv.org/html/2607.03726#S1.F1) 所示,这正是我们提出SelfMem方法的动因:并非给予智能体固定的记忆机制,而是通过将记忆管理决策暴露给智能体自身,教会它们如何自适应地管理记忆。
如图2 (https://arxiv.org/html/2607.03726#S1.F2) 所示,SelfMem将记忆管理转化为一个由智能体控制的优化过程。SelfMem并非规定固定的存储、更新或检索规则,而是将记忆工具与响应性能、token数量、成本和缓存复用等反馈信号一同暴露出来。利用这些信号,智能体决定哪些内容保留在记忆中,哪些压缩,哪些更新,以及哪些留待从转录文本中检索。实验结果表明,我们的方法在质量与成本的权衡上优于固定的记忆流水线。
我们的实验结果显示,SelfMem在BEAM基准上,面对长对话历史、多样的问题类型以及所有评估的token规模,均展现出稳健的记忆性能。在100K、500K和1M tokens规模下,SelfMem均取得了最高的官方评分和Pass0.5。与最强的非SelfMem基线相比,官方评分分别提升0.165、0.141和0.134,Pass0.5分别提升17.0、14.9和14.3个百分点。除总体性能外,问题类型分析表明,SelfMem在不同记忆需求下仍然广泛鲁棒,在100K规模下于9/10的问题类型上取得最佳分数,在500K下为8/10,在1M下为7/10。我们的优化与泛化分析进一步表明,模型引导的策略优化也能改善记忆行为,说明SelfMem为长程记忆管理暴露了一个有用的优化曲面。
## 2 相关工作
#### 智能体记忆
近期关于智能体记忆的工作为LLM智能体配备了外部记忆状态,以支持长时间交互和个性化。生成式智能体引入了一种记忆流架构,智能体在其中记录观察、检索相关经验,并综合更高层次的反思用于未来规划(Park等人,2023 (https://arxiv.org/html/2607.03726#bib.bib12))。MemoryBank将这一方向扩展到长期对话,通过维护持久的记忆和用户画像,使得这些信息可以在重复交互中被回忆、更新和加强(Zhong等人,2024 (https://arxiv.org/html/2607.03726#bib.bib30))。MemGPT将长上下文交互表述为虚拟上下文管理,通过工具介导的记忆操作,智能体在核心/工作记忆与归档记忆之间移动信息(Packer等人,2023 (https://arxiv.org/html/2607.03726#bib.bib27))。ReadAgent研究了对极长输入的智能体阅读,通过构建要点记忆,并在需要详细证据时选择性地查找原始段落(Lee等人,2024 (https://arxiv.org/html/2607.03726#bib.bib40))。另一条并行研究线考察如何评估和构建长期对话记忆。LoCoMo引入了极长期的跨会话对话,并评估智能体在问答、事件摘要以及基于长历史的多模态对话生成上的表现(Maharana等人,2024 (https://arxiv.org/html/2607.03726#bib.bib19))。LongMemEval进一步将长期记忆评估分解为信息提取、跨会话推理、时序推理、知识更新和拒绝回答等能力(Wu等人,2025 (https://arxiv.org/html/2607.03726#bib.bib21))。更近期的记忆系统开始转向结构化、面向生产的记忆构建。Mem0提取、整合并检索对话中的突出事实,并增强了基于图的变体以支持关系型记忆(Chhikara等人,2025 (https://arxiv.org/html/2607.03726#bib.bib20))。A-Mem采取了更具主体性的步骤,按照Zettelkasten风格的组织方式动态编写、索引、链接和演化记忆(Xu等人,2026 (https://arxiv.org/html/2607.03726#bib.bib39))。如附录A (https://arxiv.org/html/2607.03726#A1) 中表2 (https://arxiv.org/html/2607.03726#A1.T2) 所总结,这些方法在记忆单元、检索机制和更新行为上各有不同,但它们在很大程度上仍实例化了一种预定义的记忆架构或一组固定的记忆操作。
#### 自我改进的智能体
另一条互补的研究路线表明,语言模型和智能体可以通过反馈、反思和搜索来改进自身行为,通常无需更新底层模型参数。Self-Refine使用同一模型生成反馈并迭代优化自身输出(Madaan等人,2023 (https://arxiv.org/html/2607.03726#bib.bib33))。Reflexion将任务反馈转化为存储于情景记忆中的语言反思,使得智能体通过语言而非权重更新在未来的尝试中改进(Shinn等人,2023 (https://arxiv.org/html/2607.03726#bib.bib26))。Voyager展示了具身智能体可以利用环境反馈、执行错误和自我验证来构建一个不断扩展的可复用技能库(Wang等人,2023 (https://arxiv.org/html/2607.03726#bib.bib8))。LATS进一步将推理、行动、规划和环境反馈通过树搜索结合起来,使智能体在做出决策前能够探索和评估不同的行动轨迹(Zhou等人,2024 (https://arxiv.org/html/2607.03726#bib.bib25))。Self-RAG将这一思想扩展到检索增强生成,通过学习何时检索、生成和通过自我反思来评判证据(Asai等人,2024 (https://arxiv.org/html/2607.03726#bib.bib34))。除了改进单个输出或行动轨迹外,近期关于自然语言优化的研究表明,模型也可以对策略本身进行搜索。OPRO将LLM视为一个黑箱优化器,从先前的解决方案及其分数中提出新的候选指令(Yang等人,2024 (https://arxiv.org/html/2607.03726#bib.bib35))。Pryzant等人 (2023 (https://arxiv.org/html/2607.03726#bib.bib37)) 利用自然语言梯度、束搜索和波段选择来自动改进提示词。Promptbreeder通过适应度反馈演化任务提示和变异提示,表明手工设计的提示策略可以通过迭代自指搜索来改进(Fernando等人,2024 (https://arxiv.org/html/2607.03726#bib.bib38))。这些研究支持了我们的假设:记忆行为也可以通过语言进行优化——给定适当的反馈信号和动作空间,智能体可能发现比手动指定规则更适应当前任务的记忆策略。
## 3 SelfMem:自我优化的记忆框架
### 3.1 概述
如图2 (https://arxiv.org/html/2607.03726#S1.F2) 所示,SelfMem将记忆管理转化为一个由模型控制的优化过程。该框架将原始记录下的对话历史(原始转录文本)作为不可变的事实来源,同时向智能体暴露一个记忆工作空间和一组记忆管理工具。SelfMem并非要求智能体填写固定的画像模式或遵循预定义的摘要规则,而是允许智能体检查转录文本证据、决定哪些记忆值得写入、以任务敏感的方式组织记忆、审查自身记忆质量,并在诊断表明存在风险时修订记忆。关键设计目标是分离**框架约束**与**记忆策略**。框架提供人类设计的过程原则、可用的记忆工具、反馈通道和审计约束。智能体则确定具体的记忆行为:需要检查哪些转录轮次或检索片段、存储什么信息、压缩或更新什么、精确保留什么,以及哪些内容保留为可从原始转录文本中恢复。
### 3.2 问题定义
我们考虑在固定交互历史上操作的智能体的记忆管理问题。设
\(H = (t_1, t_2, \ldots, t_T)\)
表示按时间顺序记录的用户-智能体轮流对话,其中每一轮包含说话人角色、时间锚点、内容和呈现元数据。给定一个未来查询 \(q\),智能体必须利用 \(H\) 中的信息生成答案 \(y\)。一个简单的解决方案是将整个历史放入模型上下文。然而,当交互超出上下文窗口时,这变得昂贵或不可行。另一个常见方案是构建固定的摘要或记忆模式,但这样的表示可能遗漏任务关键细节、保留过时事实,或无法匹配不同任务的需求。因此,我们将记忆管理形式化为从原始交互历史中构建一个紧凑的记忆工作空间 \(M^\star\),同时保留转录文本用于精确的事实依据:
\[
\begin{aligned}
M^\star &= \Pi_{\mathrm{agent}}(H; \mathcal{A}, \mathcal{F}), \\
E_q &= \mathrm{Retrieve}(q, M^\star, H), \\
y &= \mathrm{LLM}(q, M^\star, E_q).
\end{aligned}
\]
这里,\(\mathcal{A}\) 是提供给智能体的记忆动作空间,\(\mathcal{F}\) 是环境返回的反馈,\(E_q\) 表示为了支持查询而检索到的转录文本片段或轮次。现有的记忆系统通常通过手工设计的存储格式、检索规则、摘要策略或更新操作来实例化 \(\Pi\)。相比之下,SelfMem 将这个记忆管理过程本身就暴露给智能体:智能体根据工具反馈和任务需求,决定检查转录文本的哪些部分、存储什么信息、如何组织以及何时修订。
### 3.3 转录文本存储
转录文本存储是 SelfMem 中的事实来源。SelfMem 并非暴露隐藏的摘要或预提取的事实,而是将记录的交互历史存储为只读数据库。在我们的实现中,每个转录文本由一个 SQLite 表表示:
```
turns (turn_index, turn_id, role, time_anchor, content, rendered, char_count)
```
记忆智能体只能通过只读工具检查这个转录文本:
\[
o_i^H = \mathrm{Read}_H(a_i),
\]
其中 \(a_i\) 是模型选择的读取动作,\(o_i^H\) 是返回的转录文本观察。转录文本接口包括 `conversation_manifest`,它报告模式与转录文本统计信息,以及 `conversation_sql_query`,它允许智能体在 turns 表上发出只读 SQL 查询。这种设计让智能体自行决定历史中哪些部分值得检查,而不是强迫对整个对话应用固定的分块或摘要策略。
### 3.4 记忆工作空间与动作空间
我们提供一个由模型管理的记忆工作空间 \(M_i\)。该工作空间可以容纳智能体认为有用的任何结构,例如用户画像、偏好列表、项目状态备注、时间线,甚至紧凑的策略。智能体通过一个由模型选择的动作空间与工作空间交互:
\[
\mathcal{A} = \mathcal{A}_{\mathrm{read}} \cup \mathcal{A}_{\mathrm{write}} \cup \mathcal{A}_{\mathrm{review}} \cup \mathcal{A}_{\mathrm{probe}}.
\]相似文章
@omarsar0: // AutoMem // 我非常喜欢这个元记忆的概念。(标记一下) 这项来自斯坦福的新研究将智能体的记忆…
这篇斯坦福研究论文介绍了AutoMem,这是一个将智能体记忆管理视为可训练技能的框架。通过分别优化记忆结构和熟练度,AutoMem在长周期任务上将基础智能体性能提升了2到4倍,使得一个32B开源权重模型能够与Claude Opus 4.5和Gemini 3.1 Pro Thinking等前沿系统竞争。
通过参数化记忆扩展自进化智能体
来自阿里巴巴/Qwen和北京大学的研究人员提出了TMEM——一种自进化参数化记忆框架。该框架利用在线LoRA权重更新,使LLM智能体能够在单个回合内真正从经验中学习,而非仅依赖提示空间中的记忆。TMEM在多个基准测试(包括LoCoMo、LongMemEval-S和CL-Bench)上均优于基于摘要和基于检索的基线方法。
AdMem:面向任务求解智能体的高级记忆系统
本文介绍AdMem,一种面向基于LLM的智能体的统一记忆框架,整合语义记忆、情景记忆和程序性记忆,并采用双层短期与长期存储结构,通过多智能体架构实现自动记忆生成与自适应检索。实验表明,该方法在长程多轮任务中提升了鲁棒性和成功率。
EvolveMem: 通过AutoResearch实现LLM智能体的自演化记忆架构
EvolveMem为LLM智能体引入了一种自演化记忆架构,通过LLM驱动的诊断和迭代研究周期来优化检索配置,在LoCoMo和MemBench等基准测试上取得了显著的性能提升。
AutoMem: 作为认知技能的记忆自动化学习
AutoMem 引入了一个框架,将记忆管理作为 LLM 的可训练技能进行自动化学习,通过优化记忆结构和熟练度,将长期任务的性能提升 2-4 倍。