智能体LLM系统的共享选择性持久记忆
摘要
本文介绍了面向智能体LLM系统的共享选择性持久记忆,该记忆保留可复用的上下文(如任务规范和数据模式),同时丢弃会话特定的推理痕迹,在企业场景中实现了96%的任务完成率和显著的令牌成本降低。
arXiv:2607.09493v1 公告类型:新
摘要:通过多轮工具使用生成代码的智能体LLM系统面临一个根本性的上下文问题:每个会话从零开始,丢弃了先前会话中得以高效运行的配置选择、领域约束、数据模式以及工具使用模式。简单地保留整个对话历史在令牌使用上效率低下且适得其反:无关的上下文会降低生成质量。我们引入了共享选择性持久记忆,一种识别并保留四类可复用上下文(任务规范、数据模式、工具配置和输出约束)的架构,同时丢弃会话特定的推理痕迹。关键在于,这种记忆是共享的:封装了选择性记忆的工作空间可以通过基于角色的访问控制在用户间转移,从而无需重复规范即可实现协作复用。我们在一个已投产的协作工作空间平台上实现了该架构,在该平台上LLM代理从异构来源(CSV、SQL、REST API和MCP服务器)生成、编辑和维护基于Git版本控制的工件(仪表板、报告和数据驱动文档)。一个补充性的零令牌数据刷新机制将生成的程序与运行时数据解耦,使得工件无需重新调用即可复用。在三个企业场景中,共享选择性持久记忆实现了96%的任务完成率(相比之下,无记忆时为79%,完整历史时为71%)。零令牌刷新消除了定期更新时对LLM的重新调用(任务时间减少14倍),而基于摘要的生成与原始数据注入相比,每次调用的令牌成本降低了97倍。在四个公共数据集上的重复实验确认了其泛化能力,零令牌刷新在12/12次试验中成功。值得注意的是,简单的完整历史持续记忆会通过用旧痕迹偏差智能体而主动降低完成率,而选择性记忆则优于两种极端情况。
查看缓存全文
缓存时间: 2026/07/13 07:53
# 共享选择性持久内存:面向智能体LLM系统的架构 **来源:** https://arxiv.org/html/2607.09493 **Sanjana Pedada** Apple Inc. s\[email protected] **Aditya Dhavala** Apple Inc. a\[email protected] **Neelraj Patil** Apple Inc. neelraj\[email protected] ###### 摘要 通过多轮工具使用生成代码的智能体LLM系统面临一个根本性的上下文问题:每个会话从零开始,丢弃了先前会话中积累的配置选择、领域约束、数据模式以及工具使用模式。粗暴地持久化整个对话历史既浪费令牌,又会适得其反——无关上下文会降低生成质量。我们提出**共享选择性持久内存**,一种面向智能体系统的内存架构,用于识别并保留四类**可复用上下文**——任务规范、数据模式、工具配置和输出约束——同时丢弃会话专属的推理轨迹。关键在于,这种内存是**共享的**:封装了选择性内存的工作空间可以在用户之间通过基于角色的访问控制进行传输,从而实现积累上下文的协作复用,无需重复指定。我们在一个已部署的协作工作空间平台上实现了该架构,该平台中LLM智能体从通过多种连接器类型(CSV上传、SQL、REST API和MCP服务器)访问的异构数据源生成、编辑并维护Git版本化的工件——包括交互式仪表盘、结构化报告和数据驱动文档。Git支持的版本控制结合草稿隔离,使用户可以无风险地探索修改,并恢复到任何先前状态,而无需重新调用模型。一种互补的**零令牌数据刷新**机制将生成的程序与运行时数据解耦,实现无需重新调用的工件复用。在三个企业部署场景中,共享选择性持久内存实现了96%的任务完成率(相比之下,无内存时为79%,完整历史记录时为71%)。零令牌数据刷新机制完全消除了针对重复数据更新的LLM重新调用(任务时间减少14倍),而基于摘要的生成相对于原始数据注入将每次调用的令牌成本降低了97倍。在四个公共数据集上的复制实验确认了泛化能力,零令牌刷新在12/12次试验中成功。值得注意的是,粗暴的完整历史持久化通过使用过时的推理轨迹偏向智能体,反而会降低任务完成率,而选择性内存的表现优于这两种极端情况。 --- ## 1 引言 智能体LLM系统——那些能够自主调用工具、写入文件和执行代码以实现用户目标的系统——在代码生成(GitHub, 2021;Anthropic, 2025b)、数据分析(OpenAI, 2023b)和多步推理(Wu et al., 2023)方面展现了令人印象深刻的能力。然而,所有当前的智能体框架都面临一个根本性限制:**会话是无状态的**。当会话结束时,积累的上下文——领域约束、数据模式、工具配置、提示词优化以及输出格式偏好——被完全丢弃。这是有浪费的。在企业工作流中,用户反复执行结构相似的任务:从更新的数据导出生成每周仪表盘,使用一致的格式生成报告,使用相同的认证模式查询相同的内部工具,从不断变化的数据源起草文档,以及在团队间维护版本化的工件。每个会话都迫使系统重新指定系统本应已知的信息。 问题不在于LLM缺乏记忆,而是现有系统未能提供一种机制来**选择性持久化**重要的上下文,同时丢弃无关的会话特定推理。粗暴的解决方案——持久化整个对话历史——是适得其反的。先前关于长上下文LLM的研究(Liu et al., 2024)证明,无关上下文会降低输出质量(“中间迷失”现象)。对于智能体系统,问题更为复杂:先前会话的工具使用轨迹(文件读取、Shell命令、错误恢复)不仅无关,而且当注入新会话时还会造成危害,因为它会使智能体偏向于先前探索过的解决方案路径,而非当前任务。 我们提出**共享选择性持久内存**,一种面向智能体LLM系统的内存架构,其核心观察是:从智能体会话中可复用的知识可以分解为四个正交类别,每个类别都紧凑、在会话间稳定,并且持久化后有益: 1. **任务规范**——自定义系统提示,编码领域规则、输出格式约束和生成偏好(例如,“始终为≥95%的实现率使用绿色”)。 2. **数据模式**——列名、类型、统计摘要以及跨数据源的关系,从原始数据预计算得出。 3. **工具配置**——哪些外部工具可用,它们的参数模式、调用模式和认证要求。 4. **输出约束**——生成的工件与其运行时环境之间的结构契约(例如,“数据在运行时注入,绝不硬编码”)。 同样重要的是,我们**丢弃**的内容:多轮推理轨迹、工具调用日志、中间文件状态以及来自先前会话的错误恢复路径。这些在会话**内部**有用,但在会话**之间**有害。 我们验证了该架构在一个已部署的企业协作工作空间平台中,该平台中LLM智能体从通过多种连接器类型(CSV上传、SQL数据库、REST API和MCP服务器)访问的异构数据源生成、编辑并维护Git版本化的工件——包括交互式仪表盘、结构化报告和数据驱动文档。Git支持的版本控制结合草稿隔离,允许用户无风险地探索优化,并恢复到任何先前的工件状态,而无需重新调用模型。一种互补的**零令牌数据刷新**机制强制了LLM生成的程序与运行时数据之间的严格分离,实现了零LLM令牌的数据刷新。 我们的贡献如下: 1. **一种共享选择性持久内存架构**,识别了四类可复用的智能体上下文,独立于会话轨迹持久化它们,并包含一个**零令牌数据刷新**机制,将生成的程序与运行时数据解耦(第3节)。 2. **一个协作工作空间平台**,具有Git版本化的工件、草稿隔离、多连接器数据集成(CSV、SQL、REST、MCP)以及AI辅助的编辑和查询模式(第4节)。 3. **企业部署案例研究**,涵盖三个企业场景,证明共享选择性内存减少了冗余指定,支持工作空间复用,并实现了零令牌数据刷新(第6节)。 ### 1.1 激励用例 我们基于三个企业场景构建架构。 (1)**周期性刷新**:分析师每周生成一个供应链仪表盘;每个会话中必须重新指定8–12个格式约束(4–5轮对话)。使用选择性内存,规范持久化,零令牌数据交换使得无论数据源类型如何都能一键刷新。 (2)**跨团队共享**:总监将一个收入工作空间发布为版本化模板;同事加载它,连接模式兼容的数据,工件在基于角色的访问控制下立即渲染。 (3)**迭代构建**:一个团队跨会话构建工作空间,每次添加组件。选择性内存将积累的规范传递下去;草稿隔离保护已发布版本;Git支持的回滚使团队能够恢复到任何先前的工件状态,而无需重新调用模型。会话时间从约20分钟减少到约5分钟。 ## 2 相关工作 #### LLM系统中的内存。 上下文窗口扩展(Press et al., 2022;Chen et al., 2023)增加了令牌预算,但未解决持久化哪些内容的问题。RAG(Lewis et al., 2020)在文档级别检索,而非智能体系统所需的结构化配置级别。对话摘要(Xu et al., 2023)压缩了先前对话轮次,但保留了会话特定的推理轨迹。MemGPT(Packer et al., 2023)提供了一种受操作系统启发的内存层次结构,专注于对话连续性。生成式智能体(Park et al., 2023)维护了针对叙事连贯性优化的内存流。Reflexion(Shinn et al., 2023)持久化失败摘要以进行任务内的试错学习。我们的方法识别了四个结构化类别以跨会话持久化,并明确丢弃推理轨迹。 #### 智能体LLM框架。 ReAct(Yao et al., 2023)建立了交织推理和工具使用行动的模式,建立在思维链提示(Wei et al., 2022)之上。LangChain(Chase, 2022)、AutoGen(Wu et al., 2023)和CrewAI(CrewAI, 2024)提供了多智能体编排。LATS(Zhou et al., 2023)通过树搜索统一了推理、行动和规划。Voyager(Wang et al., 2023)引入了具身智能体的持久技能库——这是最接近的先前工作,尽管它持久化的是可执行技能而非声明性配置。这些框架中没有一个能在会话之间持久化任务规范、工具配置或输出约束。 #### 工具增强型LLM。 Toolformer(Schick et al., 2023)展示了自主工具学习;Gorilla(Patil et al., 2023)提高了API调用准确性;MCP(Anthropic, 2024)标准化了工具发现。OpenAI助手API(OpenAI, 2023a)提供了线程级别的持久化,但保留的是完整对话线程,而非选择性提取可复用配置。LLM驱动的代码生成工具(GitHub, 2021;Anthropic, 2025b;Cursor, 2024)和代码解释器(OpenAI, 2023b)是单用户且临时的。传统BI平台提供持久化仪表盘,但需要领域特定查询语言而非自然语言。 ## 3 共享选择性持久内存 图1展示了端到端架构。用户通过对话式前端交互;每个会话由从工作空间存储中提取的选择性持久内存提供上下文。智能体引擎通过自主工具使用生成和编辑版本化工件,外部数据通过多连接器集成层(CSV、SQL、REST、MCP)访问。生成的工件通过运行时注入契约(第3.5节)专门消耗数据,工作空间仅捕获四个结构化的内存类别——从不包含会话轨迹。  **图1:系统架构。** 多个用户各自拥有独立的工作空间,可通过基于角色的访问控制共享以进行协作。每个工作空间持久化四类选择性内存(顶部)。智能体引擎将工作空间内存组合成语义提示;零令牌数据架构将生成的工件与运行时数据解耦。数据通过异构连接器(CSV、SQL、REST、MCP)访问。 ### 3.1 问题形式化 考虑一个智能体LLM系统,给定用户查询 \( q \) 和系统提示 \( s \),通过一系列工具使用步骤 \( T = (t_1, t_2, \ldots, t_n) \) 生成工件 \( a \)。在当前系统中,完整的会话状态 \( \mathcal{S} = (s, q, T, a) \) 在会话结束后被丢弃。当用户返回执行相关任务 \( q' \) 时,必须重新指定所有隐含知识:编码在 \( s \) 中的领域约束、在 \( q \) 中的数据模式假设、在 \( T \) 期间调用的工具配置以及在 \( a \) 中的输出格式契约。我们观察到,这种重新指定既是用户摩擦的主要来源,也是令牌浪费的主要来源。 ### 3.2 内存分解 我们将会话中的可复用知识分解为四个类别: #### 任务规范(\( \mathcal{M}_{task} \)) 扩展基本系统提示的自定义指令。这些指令编码领域规则(“使用门类颜色编码:供应为蓝色,订单为橙色,流程为紫色”)、输出偏好(“始终包含执行摘要卡片”)和质量约束(“在所有数值操作中防范NaN”)。任务规范由用户编写,并在多次会话中优化。 #### 数据模式(\( \mathcal{M}_{data} \)) 关联数据源的预计算摘要:列名和类型、数值列的统计分布、分类列的唯一条目录、行计数和样本行。这些信息通过统计概要分析从上传数据自动生成(我们使用带有分类分析扩展的pandas.describe();对于大型数据集,概要分析在恒定内存中对列统计进行操作,与行数无关)。数据模式为LLM提供了足够的信息来生成正确的数据处理代码,而无需读取原始数据——在提高生成准确性的同时减少提示令牌。 #### 工具配置(\( \mathcal{M}_{tools} \)) 可用的外部工具和数据连接器集合,包括其参数模式、调用模式(REST端点、MCP服务器、SQL连接、子智能体委托)和认证要求。在企业环境中,工具可用性、连接器配置和认证上下文在会话间保持稳定,但从头开始发现和配置代价高昂。 #### 输出约束(\( \mathcal{M}_{output} \)) 生成的工件与其运行时环境之间的结构契约。关键约束是数据注入契约:生成的脚本必须专门从定义良好的运行时注入点消费数据,绝不使用硬编码值。该约束实现了零令牌数据刷新。
相似文章
面向长周期LLM智能体的选择性记忆保留
本文提出TraceRetain,这是一个用于冻结LLM智能体中绑定外部存储的轻量级框架,表明选择性记忆保留主要在记忆流包含噪声时与缓存启发式方法区分开,从而带来任务成功率和效率的提升。
ActiveMem:面向长程LLM推理的分布式主动记忆
ActiveMem提出了一种分布式主动记忆系统,将智能体记忆与大模型核心推理过程解耦,在长程任务上实现了最先进的准确率,同时显著降低了开销。
RecMem:基于重复的记忆整合方法,用于高效且有效的长期运行LLM智能体
RecMem是一种基于重复的记忆整合方法,适用于长期运行的LLM智能体,通过仅在语义相似的交互重复出现时调用LLM,可减少高达87%的令牌消耗,同时提高准确性。
具有快速写入路由和慢速整合的双层智能体记忆
本文提出了一种针对LLM智能体的双层智能体记忆框架,通过快速写入路由和慢速整合来管理知识生命周期,以在保持性能的同时修剪冗余外部记忆。
多智能体LLM系统的受控共享内存
本文介绍了MemClaw,一种用于多智能体LLM系统的受控共享内存架构,形式化了诸如未授权泄漏和过时传播等故障模式,并通过ArgusFleet测试框架评估了该系统。