Agentic Context Management:将智能体记忆与成本作为生命周期与架构问题来解决
摘要
本文提出 Agentic Context Management(ACM),将智能体记忆视为包含五个原语的生命周期问题,并介绍了参考实现 Maximem Synap,该实现取得了强劲的基准测试结果。
查看缓存全文
缓存时间: 2026/07/27 05:39
论文页 - 智能体上下文管理:将记忆与成本视为生命周期与架构问题来求解
来源: https://huggingface.co/papers/2607.21503
摘要
生产级AI智能体的失败往往并非源于推理能力不足,更多是由于它们无法管理好自身推理上下文中的内容:包括对话历史、巨型提示词、庞大的工具定义以及不断膨胀的工具输出。智能体在自身不断累积的历史中苦苦挣扎,同时每轮交互产生的token成本还在持续增长,导致单次对话内部及跨对话间出现记忆缺失。当前的主流应对方式将其视为一个存储和检索问题。我们认为这种定位过于狭隘。主动管理智能体所“铭记”的内容是一个生命周期问题,而非仅仅是一个存储问题:它涵盖了决定记忆什么、提取并结构化信息、为每种数据类型选择合适的存储、在保留溯源的同时进行整合与遗忘、判断当前的相关内容、预测下一步所需信息、以及在预算限制内压缩上下文而不丢失关键要素。在严肃的生产环境中,这一过程并非仅针对单个用户,而是跨越组织的层级范围。我们将这一学科命名为智能体上下文管理(Agentic Context Management,ACM),并将其分解为五个原语:架构设计、摄取、范围界定、预判以及压缩与整合。随后我们从经济角度分析:简单的上下文累加会使token成本随对话长度呈二次方增长;粗粒度的摘要可将成本降至线性,但代价是准确性的断崖式下降;只有经过验证的压缩才能在保持忠实度的同时实现线性成本。我们描述了一个参考实现——Maximem Synap,它将上述五个原语实现为多租户服务,并在第6节详述的配置下,于LongMemEval上达到92%,于LoCoMo上达到93.2%。最后,我们指出了现有基准尚不能覆盖的维度——延迟、token效率、上下文抗轮转能力,以及该方向所指向的决策级和组织级上下文这一前沿领域。
查看 arXiv 页面 (https://arxiv.org/abs/2607.21503)
查看 PDF (https://arxiv.org/pdf/2607.21503)
项目页面 (https://maximem.ai/synap)
GitHub 0 (https://github.com/maximem-ai/eval_benchmark_runs_output)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.21503)
获取此文到你的智能体:
hf papers read 2607\.21503
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
暂无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.21503 即可从此页链接。
引用此论文的数据集 0
暂无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.21503 即可从此页链接。
引用此论文的 Space 0
暂无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.21503 即可从此页链接。
包含此论文的收藏集 0
暂无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页链接。
相似文章
智能体记忆:剖析
探讨智能体记忆库的组件与设计决策,澄清认知科学术语与工程实现之间的差距。
探索智能体记忆系统的跨场景通用性:诊断与强基线
本文评估了面向LLM智能体的八种记忆系统在五种不同场景下的表现,发现给予智能体对存储和检索的主动控制(而非被动管道)能够获得最佳的跨场景泛化能力,并由此提出了AutoMEM框架。
构建多智能体系统让我意识到记忆比编排更难
构建多智能体系统表明,管理共享记忆和上下文一致性比编排更具挑战性。作者使用 Statewave 进行的实验将记忆视为一个不断演化的生命周期,而非单纯的检索问题。
我曾以为智能体记忆只是存储问题。现在我不这么认为了。
一位开发者重新思考智能体记忆,认为它不仅仅是存储,而是提出了一个带有角色和激活场的活图,用以赋予过去信息适当的权威和上下文。
智能体记忆不仅仅是基于用户事实的RAG
文章认为,简单的基于RAG的智能体记忆系统在生产中会失败,原因包括过时的偏好、遗漏的关键词和提示注入等问题,并主张采用分层记忆架构,具备主动选择、确定性回退、治理和测试等功能。