驾驭记忆:记忆智能体中记忆基质的全面评估
摘要
本文对用于记忆增强LLM智能体的记忆基质进行了全面评估,发现没有单一基质在所有条件下占主导地位,并提倡采用自适应基质路由来优化不同操作条件下的性能。
arXiv:2608.15008v1 公告类型:新
摘要:记忆正成为长期LLM智能体的核心基础设施,然而现有评估对于在不同操作模式下应使用哪种记忆基质(即记忆表示和存储的底层介质)提供的指导有限。我们提出了一种针对记忆增强智能体的记忆基质的受控评估框架,涵盖密集和稀疏索引、文本记录、结构化存储、分层存储、基于精炼的记忆、参数更新以及激活兼容上下文机制。在三个骨干模型和四个基准套件上,涵盖以用户为中心的问答和以智能体为中心的决策,我们在统一框架下设置了26个性能和效率指标。我们的结果显示,没有单一基质能持续占主导地位:广泛检索有利于长上下文事实问答,而过度检索可能会将注意力从行动关键上下文中转移,从而损害顺序决策。可扩展性引入了另一个路由维度,因为在中等历史长度下表现良好的基质在更长的视野下可能变得成本高昂或脆弱。这些发现表明基质路由是自适应智能体记忆系统的必要组成部分,并为设计高效、可靠且感知操作模式的LLM智能体长期记忆提供了实证指导。代码将在接受后公开。
查看缓存全文
缓存时间: 2026/08/18 09:59
# 驾驭记忆:记忆代理中记忆基质的整体评估 来源:https://arxiv.org/html/2608.15008 Wooseong Yang, Yiwei Yang, Henry Peng Zou, Hanrong Zhang, Ying Nian Wu, Haolun Wu, Kai-Wei Chang, Philip S. Yu, Xue Liu, Aylin Caliskan 伊利诺伊大学芝加哥分校, 华盛顿大学, 麦吉尔大学, 穆罕默德·本·扎耶德人工智能大学, 加利福尼亚大学洛杉矶分校 (通讯作者) ###### 摘要 记忆正成为长周期LLM代理的核心基础设施,但现有评估在不同操作范式下应使用何种记忆基质(即记忆表示和存储的底层媒介)方面提供的指导有限。我们对记忆增强代理的记忆基质进行了受控框架评估,涵盖稠密与稀疏索引、文本记录、结构存储、层级存储、基于提炼的记忆、参数更新以及激活兼容的上下文机制。在三种骨干模型和四个基准测试套件(涵盖以用户为中心的问答和以代理为中心的决策)上,我们在统一框架下测量了26项性能与效率指标。我们的结果表明:没有单一基质能始终占据优势——广泛检索有益于长上下文事实问答,而过度检索则可能损害顺序决策,因为它会将注意力从行动关键上下文中转移。可扩展性引入了另一个路由维度:在中等历史长度下表现良好的基质,在更长周期下可能变得昂贵或脆弱。这些发现表明,基质路由是自适应代理记忆系统的必要组成部分,并为设计高效、可靠且感知范式的LLM代理长期记忆提供了实证指导。代码将在论文被接受后公开。 ## 1 引言 基础模型代理正迅速从单轮助手发展为需要持久记忆的长周期场景:编程助手在拉取请求中积累项目上下文[81, 31],网络代理通过重复导航学习浏览模式[83],个人伴侣在数百个会话中跟踪演变的用户偏好[82],科学发现代理在迭代循环中完善假设[41]。尽管跨越不同领域,这些代理面临一个共同挑战:将新经验写入持久存储,在决策时读取相关知识,并在有限的计算和存储预算下管理不断增长的记忆[69]。没有单一记忆设计能在准确性、效率和成本这三个轴上同时表现出色[27, 85]:向量索引写入成本效益高,但难以处理多跳检索[9];知识图谱能进行关系推理,但构建需要数量级更多的LLM调用[33];KV缓存与模型集成紧密,但牺牲了可扩展性[26]。这种权衡的多样性推动了长期目标:一个通用的自适应记忆系统,能根据查询、任务和部署约束动态选择或组合基质。设计这样的系统需要理解每种基质何时更优,尤其是在何种操作范式下。 近期关于代理框架(围绕模型的脚手架,用于分解任务、跨会话管理上下文并评估输出)的研究表明,这种脚手架通常是提升代理性能(超越原始模型能力)的主要杠杆[37, 2, 54]。记忆基质是任何此类框架的基础设施层:其设计限制了框架的其他所有决策,从写入成本和读取延迟,到存储知识是否可检查以及系统如何在历史增长时降级[71]。然而,同一种基质可能在一项任务上是质量领导者,在另一项任务上则是严格被支配的选择,因此通用框架不能在设计时固定于单一基质。它必须根据范式在基质间路由。 产生该路由信号的实证基础需要评估框架本身:将记忆基质作为控制变量隔离,同时保持其余脚手架固定,跨越对记忆操作有根本不同压力的范式。 图1:52个记忆增强LLM系统(2023-2026)的评估格局。(a)基准采用率:62%集中于LoCoMo和LongMemEval;(b)指标覆盖率:每个系统都报告准确性,但只有21%报告任何效率指标;81%的系统使用GPT系列骨干模型。(c)广度与效率:一半系统使用单一基准且无效率指标;没有系统同时实现广泛覆盖和全面的效率报告。 当前评估几乎没有提供此类信号。如图1所示,对52个近期记忆增强系统的格局分析揭示了三个限制,使通向通用代理记忆的路径在实证上缺乏基础。首先,评估集中在特定基准:62%的基准-系统对仅来自两个以对话为中心的数据集LoCoMo[30]和LongMemEval(LME)[65],而代理任务几乎未被检查(图1a)。其次,指标和骨干覆盖范围狭窄:每个系统都报告准确性,但只有21%测量任何效率维度;管理成本和压缩比未被报告。此外,81%的系统使用GPT系列作为唯一骨干,使得无法区分基质效应与模型特定行为(图1b)。第三,评估范围肤浅:一半系统仅在单一基准上测试且无效率指标,没有系统同时实现广泛覆盖和全面的效率报告(图1c)。完整的逐系统调查、纳入标准和汇总统计在附录A中报告。 因此,我们知道哪个系统在准确性排行榜上领先,但不知道在何种操作范式下另一种基质更优——这正是任何通用记忆框架所需的路由信号。我们通过一个受控框架评估来弥合这一差距,该评估将记忆基质作为唯一实验变量进行隔离。采用[15]的分类法,我们将设计空间划分为外部记忆(模型外数据结构中的信息)和内部记忆(编码在模型权重或激活中的信息),并实现了跨越所有七个基质族的11种方法,如图2所示。所有基质在相同交互历史上进行评估,使用三种骨干模型和四个基准测试,涵盖以用户为中心的问答和以代理为中心的决策。 框架评估得出三个发现。首先,最优基质在不同范式间逆转:结构图在对话QA中领先,但在代理任务上被帕累托支配;而提炼记忆在具身规划中领先,但在QA中落后(第5.1节)。其次,检索更多条目有助于QA但损害代理决策,注意力探针解释了原因:随着检索深度增长,模型的注意力从任务上下文转向检索块,这正是QA中答案所在之处,但在代理任务中,策略需要关注当前观察而非检索内容(第5.2节)。第三,可扩展性研究显示,提炼记忆能优雅扩展,而结构和全上下文基质在长周期下面临部署限制(第5.3节)。 综合这些发现,得出一个设计规则:用读取广度换取写入深度(每次查询检索更少条目,在写入时投入更多用于提炼和结构化记忆),以及一个更广泛的启示:没有单一基质能服务所有范式,因此通用代理记忆必须作为多基质或多代理系统实现,其中异构基质根据范式组合和路由,每个处理其适用的操作条件。 我们的贡献总结如下: - •首个代理记忆的整体框架评估:一项受控评估,隔离记忆基质,涵盖外部和内部分类法下的11种方法和七个基质族、三种骨干模型,以及跨越以用户为中心和以代理为中心范式的四个基准测试,首次用26项指标使部署关键成本可见。 - •记忆基质的跨范式性能-延迟分析:首个受控比较,将每种方法和基质族映射到跨以用户为中心和以代理为中心任务的统一性能-延迟格局,识别在哪些操作范式下哪些基质族被支配,为任何多基质或多代理记忆系统提供所需的路由信号。 - •检索扩展和上下文可扩展性的诊断研究:检索深度扫描与注意力探针结合,诊断检索广度如何重塑跨范式的注意力分配,以及可扩展性分析,表征每种基质族如何随输入增长而扩展,为感知范式的记忆提供可操作的设计规则。 参考标题:图2:框架评估概览。11种记忆方法(M1-M11)跨越七个基质族,在相同交互历史上进行评估,使用四个基准测试,采用26项指标(分为性能和效率两类)进行测量。 ## 2 记忆基质与配置 记忆系统配置高度复杂,有许多可调参数和模块化设计选择,因此我们不问哪种方法本身更优,而是研究在哪些配置下在不同任务设置和操作范式下产生特定效益和权衡——这是任何必须动态选择基质的通用记忆系统的实证前提。 #### 基质概述。 我们研究了排列成七个族的十一种记忆基质(附录B中表4)。在外部方面,八种方法跨越结构谱系: - **平坦索引**:M1稠密向量和M2稀疏向量[68, 43]无需LLM调用,确立了检索基线。 - **文本记录**:M3摘要索引[23]增加了写入端摘要和读取端页面选择。 - **结构**引入关系链接:M4动态笔记[70]写入互连笔记并带有演变触发重写,M5双层图[8]构建双层实体关系图。 - **层级**:M6层级树[45, 49]递归聚类和摘要记忆成多层结构,通过折叠树稠密搜索检索。 - **提炼**积累经验而非存储:M7蒸馏策略[35]判断轨迹并提取可重用策略,M8技能包[79]将经验聚类成技能包。 在内部方面,**权重族**M9适配器调优[80]通过微调将知识烘焙到权重中;**激活族**包括M10全上下文和M11剧情聚类重预填充[20],后者将轮次聚类为剧情,在读取时重新预填充选定剧情。我们在辅助成本分析(附录B.3)中报告Zep[40]、Mem0[3]和MemGPT[36],而非主要受控比较,因为它们的生产流水线引入了显著不同的辅助LLM预算。 ## 3 实验设计 我们的目标是在共享框架、骨干模型、提示和辅助LLM设置下隔离实现的基质族。我们提出两个问题:(1)代理行为中,任务性能和效率有多少可归因于基质本身?(2)这种归因是否在不同操作范式下稳定?我们测试每种基质在以用户为中心的基准测试(代理从长对话历史中检索事实)和以代理为中心的基准测试(代理必须执行精确行动序列)。 设计上排除三种配置:M7仅适用于具有轨迹的代理中心任务(其策略蒸馏流水线在对话输入上无对应物);M9与Gemma-4-26B-A4B-IT中的A4B MoE路由不兼容;M10(全上下文)在两个代理中心基准测试(ALFWorld和BigCodeBench-Hard)中被省略,因为累积上下文超过了所有测试的上下文窗口。 #### 基准测试。 我们选择四个基准测试,共同覆盖以用户为中心和以代理为中心的分界。在以用户为中心的一侧,LoCoMo[30]提供10个多会话对话,包含五个类别的1,986个问题;MemoryAgentBench(MAB)[12]将长上下文记忆分解为四种能力:准确检索(AR,在LongMemEval-S*子集[65]上实例化)、长程理解(LRU)、测试时学习(TTL)和冲突解决(CR);我们还使用CR作为可扩展性探针,扫描内容长度。在结果表中,我们将其标记为LongMemEval-S(LME-S)作为单独列,与LRU、TTL和CR能力并列。这些基准测试共同强调以回忆为导向的能力,即广泛检索有益的范式。 在以代理为中心的一侧,ALFWorld[47]提供134个有效未见的具身规划任务,评估在episode内(积累)和跨episode(从预建库恢复)范式下;BigCodeBench-Hard[86]提供148个代码任务,通过跨任务成功和失败池的检索进行评分。这些基准测试强调相反的范式,其中...
相似文章
基于文件系统的LLM Agent记忆:组织、演化与可持续性
本文首次系统性地探索了基于文件系统的LLM Agent记忆,将管理、搜索和执行Agent的角色规范化,使其围绕一个共享的记忆存储。研究发现,组织主要降低了检索成本,但尚未提升答案质量,并且工具选择对存储形态的影响与模型选择一样大。
用户侧记忆中的基底不对称性:一个诊断框架
本文介绍了一个针对LLMs用户侧记忆的诊断框架,表明个性化因素分解为行为一致性、事实存在和事实缺失。它证明了没有任何单一方法(例如LoRA vs RAG)在所有三个轴上均表现出色,并强调了参数化用户记忆的对齐税。
AdMem:面向任务求解智能体的高级记忆系统
本文介绍AdMem,一种面向基于LLM的智能体的统一记忆框架,整合语义记忆、情景记忆和程序性记忆,并采用双层短期与长期存储结构,通过多智能体架构实现自动记忆生成与自适应检索。实验表明,该方法在长程多轮任务中提升了鲁棒性和成功率。
H-Mem:一种通过混合结构实现智能体记忆演化与检索的新型记忆机制
H-Mem是一种面向基于LLM的智能体的新型记忆机制,采用时间-语义树与知识图谱相结合的混合结构,以建模记忆演化并提升检索性能,在问答基准上实现了最先进水平。
受人类启发的LLM智能体记忆架构
微软研究人员提出了一种受生物学启发的LLM智能体记忆架构,该架构结合了睡眠阶段巩固和基于干扰的遗忘机制,以高效管理持久性记忆。