基于文件系统的LLM Agent记忆:组织、演化与可持续性

arXiv cs.CL 论文

摘要

本文首次系统性地探索了基于文件系统的LLM Agent记忆,将管理、搜索和执行Agent的角色规范化,使其围绕一个共享的记忆存储。研究发现,组织主要降低了检索成本,但尚未提升答案质量,并且工具选择对存储形态的影响与模型选择一样大。

arXiv:2607.26637v1 公告类型:新 摘要:已部署的LLM Agent越来越多地将其长期记忆保存为文件系统:一个由markdown文件组成的目录树,Agent通过通用文件工具自行读取、写入和重新组织。然而,研究在很大程度上忽略了这一媒介:先前的系统设计定制化的记忆表示并研究在这些表示上的检索,将默认设置的两个工作假设未经检验:即Agent能够在记忆积累、冲突和过时的情况下保持不断增长的存储有序,并且这种有序是值得的。我们首次系统性地探索了基于文件系统的LLM Agent记忆。我们将该设置形式化为围绕一个记忆文件系统的三个角色:管理Agent整合并组织传入内容,搜索Agent通过引用来源回答查询,执行Agent提供任务轨迹并将其提炼为技能,将声明性记忆和技能统一于一个存储中。在长对话基准和具身任务中,我们改变了记忆形态(Agent组织的层次结构、逐字转储、块检索)、数据流规模、工具框架(沙盒Shell、记忆工具风格的函数、多种搜索工具)以及管理和搜索Agent的强度,追踪随着记忆增长答案质量、成本和存储健康状况的变化。组织可靠带来的好处是搜索经济性:在有大量材料的情况下,有序存储大约将检索成本减半。然而,当今的Agent未能达到默认设置的承诺:在我们的增长研究中,除了最强的管理Agent外,其他Agent的组织性都在退化,且我们测量的所有Agent都没有将组织本身转化为更好的答案。模型并非影响存储形态的唯一杠杆:仅改变工具集就能像更换模型一样显著重塑存储。这项研究将文件系统默认设置从一个假设转变为Agent记忆的设计空间。
查看原文
查看缓存全文

缓存时间: 2026/07/30 09:58

# 基于文件系统的LLM智能体记忆:组织、演化与可持续性 来源:https://arxiv.org/html/2607.26637 Sizhe Zhou\*,1,†, Sheldon Yu\*,2, Hui Wei\*,3, Junda Wu4, Siru Ouyang1, Yizhu Jiao1, Shijia Pan3, Julian McAuley2, Yu Zhang5, Tong Yu4, Jiawei Han1 1伊利诺伊大学厄巴纳-香槟分校 2加州大学圣迭戈分校 3加州大学默塞德分校 4Adobe Research 5德州农工大学 \{sizhez,siruo2,yizhuj2,hanj\}@illinois\.edu \{ziy040,jmcauley\}@ucsd\.edu \{huiwei2,span24\}@ucmerced\.edu \{jundaw,tyu\}@adobe\.com yuzhang@tamu\.edu

###### 摘要

已部署的LLM智能体越来越多地将其长期记忆维护为一种文件系统:一个由智能体自身通过通用文件工具读写、重组的Markdown文件目录树。然而,研究领域在很大程度上忽视了这一媒介:先前的工作设计了定制化的记忆表示并研究了其上方的检索,却未检验这一默认设置的两个工作假设:即智能体能够随着记忆的积累、冲突和过时而保持不断增长的存储库的组织性,以及这种组织性能够带来回报。我们首次对基于文件系统的LLM智能体记忆进行了系统性探索。我们将这一场景形式化为围绕一个记忆文件系统的三种角色:一个管理智能体整合并组织传入的内容,一个搜索智能体通过引用来源来回答查询,以及一个执行智能体提供被提炼为技能的任务轨迹,从而将陈述性记忆和技能统一于单一存储库中。在长对话基准和具身任务中,我们变化了记忆形态(智能体组织的层次结构、逐字转储、分块检索)、流规模、工具接口(沙盒化Shell、记忆工具风格函数、多种搜索工具),以及管理和搜索智能体的能力强度,追踪记忆增长过程中的答案质量、成本和存储库健康度。组织性带来的可靠收益是搜索经济性:当材料规模较大时,组织化的存储库大约将检索成本减半。然而,当前的智能体未能兑现默认设置所承诺的:在我们的增长研究中,除了最强的管理智能体外,所有智能体的组织性都会衰减,并且我们测量的任何智能体都未能将组织性本身转化为更好的答案。而且,模型并非唯一能改变存储形态的杠杆:仅改变工具集就会像更换模型一样显著重塑存储库。本研究将文件系统默认设定从一个假设转化为智能体记忆的设计空间。\{NoHyper\}††footnotetext:\* 同等贡献。†通讯作者:sizhez@illinois\.edu。

## 1 引言

大型语言模型(LLM)智能体越来越多地在单一上下文窗口无法覆盖的时间跨度内工作,跨会话维护代码库,并连续数月为同一用户提供帮助。该领域的雄心更进一步,朝向能够从自身经验中持续学习、最终达到人类水平智能的智能体。这两者都需要一种记忆,它更像大脑而非转录本:跨片段持久存在并演化,吸收新信息,与已有存储内容进行协调,并在增长过程中保持足够的组织性以维持高效可搜索性和可信赖性。当今的模型并不提供这样的记忆:上下文窗口是短暂的,并且在填满之前很久就会退化(Liu等,2024 (https://arxiv.org/html/2607.26637#bib.bib9)),因此持久的外部记忆已成为智能体设计的一阶组成部分(Zhang等,2025 (https://arxiv.org/html/2607.26637#bib.bib22))。在本文全文中,我们使用 *记忆* 这一包容性的经典含义(Sumers等,2024 (https://arxiv.org/html/2607.26637#bib.bib18)):它涵盖 *陈述性* 内容(事实、事件、偏好、规则)和 *程序性* 内容,即智能体从经验中提炼出的可复用 *技能* (Wang等,2024 (https://arxiv.org/html/2607.26637#bib.bib19); Anthropic, 2025b (https://arxiv.org/html/2607.26637#bib.bib2)),且单一存储库同时服务于两者。

研究已经探索了记忆的多种形式:操作系统风格的分页上下文(Packer等,2023 (https://arxiv.org/html/2607.26637#bib.bib13))、提取的事实存储(Chhikara等,2025 (https://arxiv.org/html/2607.26637#bib.bib5))、时间知识图谱(Rasmussen等,2025 (https://arxiv.org/html/2607.26637#bib.bib15))、自链接笔记网络(Xu等,2025 (https://arxiv.org/html/2607.26637#bib.bib20))、摘要库(Zhong等,2024 (https://arxiv.org/html/2607.26637#bib.bib23))、话语单元存储(Pan等,2025 (https://arxiv.org/html/2607.26637#bib.bib14); Zhou & Han, 2025 (https://arxiv.org/html/2607.26637#bib.bib24)),以及嵌入组织的树(Rezazadeh等,2025 (https://arxiv.org/html/2607.26637#bib.bib16)),每种形式都配有各自专门构建的接口。而部署实践则收敛于一种更朴素的方案:*文件系统*。编码智能体已经依赖于文件,因此文件成为扩展其上下文的自然接口:Anthropic的记忆工具将记忆暴露为一个目录,包含文件,通过六种通用文件操作来操作(Anthropic, 2025a (https://arxiv.org/html/2607.26637#bib.bib1));Claude Code在索引记忆文件夹中维护智能体编写的笔记(Anthropic, 2026a (https://arxiv.org/html/2607.26637#bib.bib3));智能体上下文文件和“技能”作为仓库中的Markdown文件在生态系统中广泛分发(OpenAI & Agentic AI Foundation, 2025 (https://arxiv.org/html/2607.26637#bib.bib12); Anthropic, 2025b (https://arxiv.org/html/2607.26637#bib.bib2))。文件系统有其合理性:它可检查、可移植,并且由智能体已经熟练掌握的文件工具来操作。它也是天然分层的:文件夹构成了一个分类体系,其名称即为标签。然而,这一默认发货的媒介却很少得到研究的系统关注。先前的工作在文件系统记忆 *上* 构建智能体系统,并研究 *跨* 文件的检索(Zhang等,2025 (https://arxiv.org/html/2607.26637#bib.bib22));记忆形式本身很少得到系统研究:如何构建、塑造并维护一个由智能体策管的文件存储库。

这一默认实践建立在一个未经检验的假设之上:存储库在增长过程中仍能保持可控。写入记忆一次后再读回是容易的情况;在长时间跨度下,记忆会积累,随之而来的是重复、矛盾、过时的事实以及同一主题内容分散在多个文件中的情况。存储库必须被 *演化*:更新、协调、重组。做错这一点代价高昂:用LLM持续重写记忆库可能使其退化到还不如无记忆基线(Zhang等,2026 (https://arxiv.org/html/2607.26637#bib.bib21))。现有机制并未弥合这一差距。学术界的记忆操作是针对单个条目进行的(添加、更新、删除)(Chhikara等,2025 (https://arxiv.org/html/2607.26637#bib.bib5)),从未触及存储库的整体形态。行业级别的整合(“dreaming”)在智能体外运行:OpenAI的dreaming在后台合成一个扁平的记忆摘要(OpenAI, 2026 (https://arxiv.org/html/2607.26637#bib.bib11)),而Anthropic的 *Dreams* 则从过往会话中整体重建存储库(Anthropic, 2026b (https://arxiv.org/html/2607.26637#bib.bib4)),其引入恰恰是因为工作智能体自身的写入仍然是“局部且增量的”,存储库在两次重建之间会退化。外部清理处理的是症状;而智能体自身能否保持一个不断增长的存储库的组织性,以及组织性是否能回报其成本,仍然只是假设而非被检验的事实。

文件系统的原生解决方案是人类式的 *组织*:将相关材料分组到文件夹中,命名以便再次找到,根据内容需求进行拆分和合并。LLM智能体能否做到同样的事情,以及这样做是否有回报,这两个方向都是开放的。组织性可能正是使不断增长的记忆保持 *可持续* 的关键——在规模扩展时仍高效可搜索且内容可信;或者,一个由强大搜索工具覆盖的扁平存储库可能同样有效,从而使策管成为一项昂贵的绕路。

据我们所知,本文首次对基于文件系统的LLM智能体记忆进行了系统性探索。第2节 (https://arxiv.org/html/2607.26637#S2) 将这一场景形式化为围绕单一存储库的三种角色(图1 (https://arxiv.org/html/2607.26637#S2.F1)):一个 *管理智能体* 负责整合每个传入片段并保持存储库有序,一个 *搜索智能体* 负责凭引用来源回答查询,以及在技能设置中,一个固定的 *执行智能体*,其任务尝试提供片段并消费检索到的技能。这些契约在设计上尽可能简单,使得角色可以映射到已部署的接口上;在编码智能体中,所有三种角色可能由同一个模型承担。我们将这一场景实例化为会话记忆(基于长对话带来源归属的问答:LoCoMo, PersonaMem, REALTALK; Maharana等,2024 (https://arxiv.org/html/2607.26637#bib.bib10); Jiang等,2025 (https://arxiv.org/html/2607.26637#bib.bib6); Lee等,2025 (https://arxiv.org/html/2607.26637#bib.bib7))和程序性记忆(固定执行智能体的任务成功率:ALFWorld; Shridhar等,2021 (https://arxiv.org/html/2607.26637#bib.bib17)),并变换四个组成部分:存储库的构建方式(组织智能体、逐字转储、或针对检索进行分块和索引的原始流(Lewis等,2020 (https://arxiv.org/html/2607.26637#bib.bib8)))、流的规模、智能体接触存储库所用的接口,以及构建和搜索模型的强度。在整个过程中,我们测量答案质量以及成本(轮次、令牌数、读取的内容)和存储库随时间的健康度(早期记忆是否在后续演化中幸存,更新是否正确落地):增长曲线,而非终点。

我们的研究围绕五个问题对文件系统记忆进行了实证刻画,每个问题均在两个设置中给出答案。

- • **RQ1(组织性)**。在自行组织的情况下,管理智能体生长出基于主题的树,但形态更多地是模型的签名而非对规模的响应:面对更多材料,存储库倾向于合并而非分裂,层级在文件夹、文件和文件内标题之间重新定位;最明显的退化行为是重组过程无声地压缩内容,除非添加一条保留规则。
- • **RQ2(形态的价值)**。没有任何形态在所有正确率上获胜;组织性的明确回报在于搜索成本,且成本随材料规模增长。在技能方面,优胜者随执行智能体而变化:逐字记录日志最适合强大的执行智能体,而精简指导则适合较弱的执行智能体。
- • **RQ3(骨干模型能力)**。在对话方面,管理智能体的能力带来的是组织风格而非答案质量,而搜索智能体的能力直接产生回报。能力确实在写入本身失败的情况下发挥作用:在一个基准上,管理智能体不一致地将变化的偏好记录为带日期标记的更新,从而使过时的事实仍然作为活跃的特征存在;更强的骨干模型执行相同的指令可以恢复大约一半的损失,而同样的升级在存储库已经很好地服务于其搜索智能体的情况下毫无变化。当记忆需要被提炼成程序时,能力表现为一个阈值:一旦超过该阈值,存储库包含的内容比哪个模型执行更重要。
- • **RQ4(扩展下的可持续性)**。在我们考察的时间跨度内,存储库只会随着增长变得更有用,且累积的经验可以替代执行智能体的能力。存储库健康在两个设置中均保持:会话存储库在早期创建少量文件,之后只编辑它们,从不删除;在技能方面,早期记忆幸存,且更强的管理智能体会保持文件在原地而非替换它们。组织性是较弱的一环:对分类学契约的遵守随着大多数存储库的增长而减弱,只有我们追踪的最强管理智能体能坚持该契约。随规模增长的成本是努力和体积:策管永远不会按片段变得更便宜,保持的存储库相对于任务链生成的内容而言保持紧凑,而随着存储库增长的一个负担是逐字记录日志的“服务一切”型检索。
- • **RQ5(接口)**。添加一个工具会改变智能体行为但不改变结果;替换整个工具集会重塑存储库本身,其方向和收益由设置决定,在长对话中导致分割和绑定,在技能中导致合并和获胜:接口是记忆组织的一个控制杠杆,而非一个中性包装器。

对照默认的两个假设,答案存在分歧:在我们测量的每个时间跨度内,智能体可以保持一个不断增长的存储库有用且健康,尽管其组织的好坏取决于管理智能体的能力;组织性是否有回报是有条件的——取决于材料、消费记忆的智能体以及手头的工具;我们测量的任何智能体都未能将组织性本身转化为更好的答案。

##### 贡献

- • **形式化与统一**。基于文件系统的智能体记忆的管理/搜索/执行角色分解,具有最小契约,将陈述性记忆和技能统一在单一存储库中,镜像已部署的接口。
- • **系统研究框架**。涵盖长对话和具身任务的基准;受控的记忆形态;接口、规模、模型强度维度;以及跟踪存储库健康、成本和质量随记忆增长的可持续性协议。
- • **发现**。一份实证刻画,将文件系统默认设定从一个假设转化为设计空间:证据表明,在我们测量的时间跨度内,不断增长的存储库保持有用且健康,而其组织质量仍受限于管理智能体的能力;提供关于何时策管值得其成本、何时转储或分块索引即可的指导;关于针对弱和强的记忆消费者应提供什么;关于模型能力在何处产生回报——对话中的搜索智能体,以及技能中超过阈值的管理智能体;并确立工具集作为存储库组织的控制旋钮,同时指出开放问题:质量基准大多对形态不敏感,以及超过单个会话的时间跨度。

## 2 形式化基于文件系统的智能体记忆

以下形式化是故意最简的:它将已部署接口已经实现的记忆系统抽象为我们研究中变化的组件。请参阅图1的说明文字。

图1:基于文件系统的智能体记忆概述。一个执行智能体完成工作;它所经历或选择保存的内容(对话片段、任务轨迹或任何其他内容)作为片段流出到 *管理智能体*,后者将每个片段整合到一个记忆文件系统中,同时服务于陈述性记忆和技能,并保持其有序;当智能体需要记忆时,它询问 *搜索智能体*,后者遍历存储库并返回带有归属的答案(引用自存储库)或检索到的技能。管理和搜索智能体仅通过可互换的工具接口作用于存储库,并且跟踪存储库在流上的演化。执行智能体是可选的,并且无需直接调用管理智能体(其记录的内容可以传递过去)。

### 2.1 记忆存储库

一个 *记忆存储库* M\{\mathcal{M}\} 是组织在根路径层级中的有限文件集合。每个文件 f∈Mf\in\{\mathcal{M}\} 是一个三元组 f=(pf,df,cf)f=(p_f,d_f,c_f):路径 pfp_f(例如 /memories/people/alice.md)、单行描述 dfd_f 以及文本内容 cfc_f。文件夹是路径的共享前缀,本身不携带内容。文件夹结构、文件名以及文件内部的Markdown标题共同构成存储库的 *分类学*:一个带有标签的树,在文件层级之下继续进入嵌套章节,可自上而下导航,其名称和单行描述是其唯一的标识。

图2:一个记忆文件系统的两个文件。一个陈述性记忆文件(上方)和一个技能文件(下方)共享单一结构:YAML前置元数据(name,description)由...

相似文章

从存储到经验:大语言模型智能体记忆机制演进综述

Hugging Face Daily Papers

本综述论文提出了一种大语言模型(LLM)智能体记忆机制的演进框架,将其发展划分为三个阶段:存储、反思和经验。文章分析了长程一致性和持续学习等核心驱动力,旨在为下一代智能体的设计提供指导原则。

AdMem:面向任务求解智能体的高级记忆系统

arXiv cs.AI

本文介绍AdMem,一种面向基于LLM的智能体的统一记忆框架,整合语义记忆、情景记忆和程序性记忆,并采用双层短期与长期存储结构,通过多智能体架构实现自动记忆生成与自适应检索。实验表明,该方法在长程多轮任务中提升了鲁棒性和成功率。

受人类启发的LLM智能体记忆架构

arXiv cs.AI

微软研究人员提出了一种受生物学启发的LLM智能体记忆架构,该架构结合了睡眠阶段巩固和基于干扰的遗忘机制,以高效管理持久性记忆。