智能体上下文管理:内存与成本作为架构问题
摘要
本文主张,AI智能体中的上下文管理应被视为一个生命周期架构问题,并提出了智能体上下文管理框架,包含五个基本要素与一个参考实现,该实现已取得高基准测试分数。
暂无内容
查看缓存全文
缓存时间: 2026/08/26 06:09
# 通过生命周期与架构问题解决代理记忆与成本问题 来源:https://arxiv.org/html/2607.21503 ###### 摘要 生产级AI智能体的失败较少源于推理能力不足,更多在于无法管理推理上下文中所容纳的内容。智能体需在上下文中处理海量信息:对话历史、大型提示词、庞大的工具定义以及不断膨胀的工具输出。它们沉溺于自身积累的历史信息,同时为每轮对话中呈线性增长的token成本付费,导致在同一对话及跨对话场景中出现记忆缺失。当前主流方法将其视为存储与检索问题。我们认为这种框架过于狭窄。我们主张主动管理智能体"脑中"内容应被视为一个生命周期过程,而非单纯的存储:它涵盖决定记忆内容、提取与结构化信息、为不同数据类型选择合适存储、优化冗余设计、主动巩固、遗忘过时信息并保持溯源、确定当前对话相关性、预判后续需求以及压缩上下文以适配预算等环节,所有这些都需在确保回忆能力的前提下完成。在严肃的生产级智能体中,这一过程不仅服务于单个用户,更需覆盖组织层级结构。我们更倾向于将此规范称为"代理上下文管理",并将其分解为五个核心原语:架构设计、信息摄取、范围界定、预期管理以及压缩与巩固。随后我们将通过经济论证说明为何生命周期管理不可或缺:朴素的上下文累积会导致token成本随对话长度呈二次增长,粗暴的摘要压缩以准确度断崖式下跌换取线性成本,唯有经过验证的压缩能在保持保真度的同时实现线性成本增长。我们描述了一个名为Maximem Synap的参考实现,它将五大原语构建为多租户服务,在第6节详述的配置下,在LongMemEval上达到92%准确率,在LoCoMo上达到93.2%准确率。最后,我们指出现有基准测试尚未涵盖的维度——包括延迟、token效率和上下文衰减抗性,以及该领域在决策级和组织级上下文管理方面的开放前沿;这些维度将持续决定智能体在严肃场景中的效用稳定性和可用性。 ## 1引言 过去两年,大语言模型已从对话界面演进为能执行动作、调用工具并在多轮多会话中完成任务的智能体。多项行业调查显示生产化部署极为困难。截至2025年,多数企业正在试验AI智能体,但仅约四分之一实现规模应用,且在单一业务功能中部署智能体的企业不足10%。事实上,绝大多数智能体试点项目未能进入生产环境(麦肯锡,2025)。限制规模化扩展最明显的能力并非推理能力——因为前沿模型的推理表现已相当出色。真正缺乏的是对每一步上下文应包含内容的系统性规范。缺乏这种规范时,部署的智能体会部分或完全遗忘长对话中用户先前告知的信息,或遗忘同一对话中通过工具获取的内容,或忘记上周曾提及的事项;在多智能体交接中自相矛盾;从过度填充以至于失去实用性的上下文中产生幻觉;且每增加一轮对话成本就会上升。 当前对此问题的框架是"记忆"。围绕它已发展出丰富的记忆工具生态。我们认为框架本身限制了这些系统的发展。"记忆"指代一种存储——即存放事实并取回的场所。围绕存储构建的系统仅优化了写入和读取两个时刻。但请考虑生产级智能体平台每轮对话必须做出的决策:(a)刚刚所述内容中哪些值得保留;(b)应以何种结构保留这些内容;(c)已保留的所有信息中,哪一小部分应纳入当前轮次的上下文;(d)下一轮对话可能需要什么;(e)当相关上下文超出模型有效处理预算时应如何处理。这是在五个不同时刻做出的五种不同决策,而存储系统无法完成其中任何一项。存储只是生命周期中的一个环节,而非全部。可用平台必须在防止用户间上下文泄露、遵守组织边界的同时,完成所有这五项决策。 本文做出四项贡献以解决上述问题: 重构与分类:我们定义代理上下文管理并将其分解为五个原语:架构设计、信息摄取、范围界定、预期管理、压缩与巩固;这些原语在从个体用户到组织的层级范围内运作(第2节)。 经济论证:我们指出并证明生命周期管理是必需品而非奢侈品。完整追加模式的上下文在对话过程中会产生O(n²)级token消耗。粗暴摘要压缩以准确度下降为代价换取线性成本。相反,经过验证的智能压缩能在保持保真度的同时达到线性成本的效率前沿(第3节)。我们通过一项涵盖五个数据领域的原创性研究支持了该论证的检索方面。 参考实现:我们在架构层面与可观察行为层面(第4-5节)描述了融合这五大原语的多租户服务Maximem Synap。 证据与规划:我们在第6节报告了在两个公开记忆基准测试上的结果及其局限性,并在第8节阐述了决策级与组织级上下文管理的前沿方向。 Maximem的Synap产品在本文中作为该类别的参考实现出现。但论证本身关乎整个类别。读者若在读完本引言后能将上下文管理视为生命周期过程,便已领会核心观点。参考实现只是构建此类生命周期系统的一种方式。 ## 2从记忆到上下文管理 我们将代理上下文管理定义为规范智能体在上下文中应保留什么、何时保留、保留多久及付出何种成本的学科,贯穿从上下文获取到上下文退役的全生命周期。它包含五个原语。 架构设计:在存储单个记忆前,必须为特定智能体决定记忆形态:哪些信息类别重要、应如何提取、存放位置、持久时长、检索与压缩方式。多数系统以固定通用模式应对此问题。我们认为架构设计本身应作为构建上下文管理系统的一级原语。 信息摄取:原始信号(如对话轮次、多模态文档上传、工具调用及响应)必须转化为结构化、可检索的记忆。关键观察已在先期工作中确立并得到实践验证:检索质量受限于摄取质量。例如,存储"用户提及定价方案"的系统永远无法检索出"用户于4月3日将套餐从基础版升级为专业版"的细节。 范围界定:在摄取与检索时,系统必须决定其已知信息中哪些部分与未来相关、在何种范围内相关。这是一个跨组织层级(定义见下文)的分层决策,需严格隔离,确保一个用户的上下文绝不泄露至另一用户的会话。当组织信息不断丰富时,能在满足数据特性允许的前提下,为B2B智能体环境中的所有用户创造网络效应驱动的积极生产体验。 预期管理:智能体不知其不知。若智能体从未请求某信息,就不太可能检索到。推测预取是计算机系统的经典理念。我们将其应用于智能体上下文。这使上下文管理系统能原初观察智能体行为,并在明确请求到来前准备其可能需要的上下文,将检索移出关键路径。我们将预期视为区别于检索的独立原语:检索回答"当前搜索查询或时刻的相关内容",预期检索则回答"接下来可能相关的内容"。它还能帮助智能体获取那些它不知需要知道的问题的答案,从而准确满足用户需求。 压缩与巩固:当相关上下文超出下游模型有效处理预算时,系统必须缩减内容而不丢弃未来所需信息。至关重要的是,压缩应可验证:静默丢弃关键事实的压缩比不做压缩更糟,因其会产生看似自信的错误答案。我们主张可验证、无损且具策略性的压缩在生产规模上既可能实现又有价值。 这五个原语相互耦合:首个原语选择的架构决定了其他原语的运作方式(客服智能体与编码智能体需要不同的信息类别、保留策略和压缩方式)。这种耦合构成了将上下文作为系统而非五个独立工具组合进行管理的核心论据。 范围维度:每个原语都需跨越层级范围运作,而非仅限单个用户。本文使用三个术语表示该层级,从最窄到最宽:用户(与智能体交互的个人或智能体/子智能体)、客户(该用户所属组织)及委托方(智能体平台运营方,其部署覆盖多个客户组织)。信息摄取与检索应遵循"从最窄范围开始解析"原则,即用户→客户→委托方,同时保持严格隔离。应存在独立的全局知识层用于共享常识(如公共实体的标准标识符)。多数记忆工具仅限定在用户范围;将组织结构扁平化为单一容器要么丢失组织上下文,要么泄露用户数据至他人会话。将范围作为一级维度对待(原语×范围),使得上下文管理能服务组织而非仅限个体。 图1:五原语上下文生命周期(架构设计→信息摄取→范围界定→预期管理→压缩与巩固),绘制为环绕中央智能体的循环图,检索范围层级(用户→客户→委托方)作为纵轴,全局知识层单独绘制以支持实体标准化。我们认为处理好单个原语的是记忆工具。连贯处理所有五个原语且覆盖各范围层级的,才是上下文管理平台。 此分类基于观察到的失效模式:每个原语之所以存在,是因为其缺失会导致已知的生产失效模式;部分案例记录于我们的部署笔记(Maximem, 2026a),其余见于公开文献。表1(https://arxiv.org/html/2607.21503#S2.T1)明确映射了这种关系;第3节量化了主导成本与准确度的两种失效模式。 表1:生产失效模式与缺失原语的映射关系 ## 3为何存储-检索模式不足 第2节的重构是概念性的。本节将其量化,因为生命周期管理的论据本质上基于经济学与信息论,两者均可度量。 ### 3.1不作为的成本呈二次增长 考虑多轮智能体对话。设每轮增加约t个token(用户消息加助手回复),对话持续n轮。在朴素的"完整追加"模式下(每轮重发完整历史,这是多数手工构建智能体的做法),第k轮的输入上下文为当前全部历史,约k·t个token。因此整段对话的累计输入token为 Cappend=∑k=1nkt=tn(n+1)2≈t2n2=O(n2) 由于服务商按输入token计费,成本随对话长度呈二次增长。(每轮的注意力计算量更严重,与序列长度呈二次关系,但计费结果更便于推理。)若系统每轮将上下文控制在固定预算W,则累计token为n·W=O(n)。两者比值 CappendCbounded=t(n+1)2W 随n线性增长:对话越长,完整追加模式惩罚性越强。按示例数值(t=500, W=4,000),在100轮时成本约为6倍,200轮时约13倍;完整推导与敏感性表格见附录A。 图2:累计输入token与对话轮次关系:完整追加模式(二次增长)对比有界上下文(线性增长)。 ### 3.2但朴素限制上下文会破坏准确度 设定预算是必要的;限制方式决定能否保持准确度。粗暴摘要限制了token但具损耗性且未验证,损耗可能带来灾难性后果:先前研究记载,将18,282 token上下文压缩至122 token后,任务准确度从66.7%骤降至57.1%,比完全无上下文更差(Zhang等, 2025)。摘要器因无法预知下游需求而丢弃了关键信息。 这形成三向对比: 图3:准确度-成本前沿:完整追加(右上)、粗暴摘要(左下)、经验证的压缩(左上)。该图概括了本节核心论点。论点现已明确。上下文管理系统应位于左上象限——线性成本与经验证的保真度,而实现该目标需要将压缩视为经过验证的操作而非充满希望的尝试。 ### 3.3检索不等于充分 成本只是一半故事。另一半是检索到的上下文是否足以支撑推理。检索质量本身是一系列瓶颈: 答案质量≤min(提取质量,检索质量,推理充分性) 其中提取指摄取阶段将原始信号转化为存储结构化记忆的步骤;检索指查询阶段获取信息的步骤。每个步骤都限制着输出答案质量。若存储垃圾信息,提取质量形成限制。表1(https://arxiv.org/html/2607.21503#S2.T1)的垃圾信息审计案例是极端情况,对未提取信号的忠实存储使存储库完全失效。检索错误材料则检索质量形成限制;检索到部分相关材料但非推理可证明答案所需的全部上下文时,推理充分性形成限制(Dadhich, 2026a)。最后一点最易被忽视——多数基准测试仅衡量检索命中率(相关文档是否出现?),几乎不衡量是否呈现了推理所需的全部条件,更不用说衡量检索了多少无关条目。 我们进行了一项出于好奇的动机性研究,考察检索问题在...
相似文章
Agentic Context Management:将智能体记忆与成本作为生命周期与架构问题来解决
本文提出 Agentic Context Management(ACM),将智能体记忆视为包含五个原语的生命周期问题,并介绍了参考实现 Maximem Synap,该实现取得了强劲的基准测试结果。
在持久化代理内存实现后,你们如何处理活动上下文?
本文讨论了在长期运行的AI代理工作流中管理活动上下文的挑战,重点关注上下文保留与效率和成本之间的平衡,并寻求社区的实际解决方案。
小型子代理用于上下文工程
作者建议使用小型、快速的AI子代理进行上下文工程,以提高AI系统的效率并降低成本,质疑为何这种方法未被广泛采用,并寻求社区反馈。
智能体AI记忆不是囤积问题,而是剪枝问题。
作者认为,AI代理的记忆应侧重于数据剪枝而非囤积,借鉴人类记忆类型(感觉记忆、短期记忆、长期记忆),并指出模仿人类记忆可以在减少令牌用量的同时维持高质量上下文。
AI智能体的有效上下文工程
Anthropic发布指南,将上下文工程定义为提示工程的演进,侧重于为AI智能体筛选最优上下文token,以在多轮推理过程中保持性能和专注度。