全量召回,代价几何?智能体记忆系统的服务成本基准测试
摘要
本文对三种智能体记忆系统(Mem0、Hindsight、Mastra Observational Memory)与参考策略在多种对话主干模型上的服务成本进行了基准测试,发现成本主要由内部记忆行为驱动,盈亏平衡点差异很大,且没有系统能在成本和准确性上同时胜出。
arXiv:2608.11879v1 公告类型:新
摘要:长期运行的对话智能体越来越多地依赖记忆系统来避免每轮重发整个对话,但服务这些系统所需的成本却很少被系统性基准测试。我们将三种记忆系统(Mem0、Hindsight 和 Mastra Observational Memory)与两种参考策略——固定大小的滚动窗口和重新提交完整记录——进行比较,涵盖两种主干模型和最多 400 轮对话,并将每次成本测量与 665 个 LoCoMo 问题上的回答准确率配对。首先,记忆系统的服务成本不能仅从对话长度和消息大小来预测:一个紧密跟踪两种参考策略的回归模型对记忆系统的预测偏差达 18-69%,其成本反而由内部记忆行为驱动。其次,盈亏平衡分析表明,记忆系统是否——以及何时——比完整记录更便宜,对系统和主干模型高度敏感:最便宜的系统在最初的几十轮内即可达到平衡,而最昂贵的系统在 400 轮内都无法实现。第三,没有系统能在两个维度上同时胜出:准确率跨度达 21-54%,且主干模型的选择对成本的影响与记忆系统本身一样大。
查看缓存全文
缓存时间: 2026/08/13 15:28
# 全量记忆,代价几何?智能体记忆系统服务成本的基准测试
Source: https://arxiv.org/html/2608.11879
## 全量记忆,代价几何?智能体记忆系统服务成本的基准测试CCS:计算方法 自然语言处理CCS:计算方法 分布式人工智能CCS:一般与参考
2026©, 2026;
###### 摘要。
长期运行的对话智能体日益依赖记忆系统来避免每轮都重新发送完整对话,然而其服务成本却鲜有系统性的基准测试。我们比较了三种记忆系统(Mem0、Hindsight 和 Mastra Observational Memory)与两种参考策略——固定大小的滚动窗口和重新提交完整记录——在两种骨干模型、最长 400 轮对话上的表现,并将每项成本测量与 665 个 LoCoMo 问题上的回答准确率配对,使成本与准确率来自同一匹配配置。首先,记忆系统的服务成本无法仅凭对话长度和消息大小预测:一个紧密追踪两种参考策略的回归模型与记忆系统的实际成本偏差高达 18–69%,其成本实际上由内部记忆行为驱动。其次,盈亏平衡分析表明,记忆系统是否——以及何时——变得比完整记录更便宜,对系统和骨干模型高度敏感:从最便宜系统的前几十轮,到最昂贵系统在 400 轮内从未达到盈亏平衡。第三,没有系统能在两个维度上同时胜出:准确率跨度从 21% 到 54%,而骨干模型的选择对成本的影响与记忆系统本身相当。
###### 关键词:
智能体记忆系统,LLM 推理成本,成本基准测试,成本建模,成本盈亏平衡,长期运行的对话智能体,成本-准确率权衡
## 1. 引言
基于大语言模型(LLM)构建的对话智能体已从单会话演示发展为跨越数周或数月交互的部署。为了在会话之间保持连贯性,此类智能体必须复用早期轮次中建立的信息。有两种策略可以解决这一问题。第一种是在每一轮都将完整的历史记录重新提交到长上下文 LLM 的上下文窗口中,依靠模型来关注所有过去的交互。第二种是构建专门的*记忆系统*,将过去的交互提炼为紧凑的记录——提取的事实、摘要或知识图谱条目——并在查询时仅检索相关子集(Lewis 等人 2020(https://arxiv.org/html/2608.11879#bib.bib16);Packer 等人 2024(https://arxiv.org/html/2608.11879#bib.bib24);Chhikara 等人 2025(https://arxiv.org/html/2608.11879#bib.bib7))。第二种策略后来发展出了多种架构。
随着这些智能体的规模化,部署成本与准确率一样成为首要关注点。商业 LLM API 按 token 数量对请求计费(OpenAI 2025a(https://arxiv.org/html/2608.11879#bib.bib22);Anthropic 2025(https://arxiv.org/html/2608.11879#bib.bib3)),因此,由于历史记录随每一轮增长,重新提交历史记录的每轮成本会随着会话持续而无上限地上升。采用记忆系统在很大程度上是为了摆脱这种增长:通过用较小的检索负载取代不断增大的记录,记忆系统承诺每轮成本在对话变长时基本保持平稳。然而,这种框架忽略了记忆系统本身的成本。现代记忆系统并非被动存储;它们运行自己的 LLM 流水线——在摄取时提取事实、嵌入并检索事实,在某些设计中还会定期对累积状态进行反思以进行整合。每个阶段都会产生各自可计费的模型调用。然而,对记忆系统的评估几乎完全集中在准确率和召回率上(Maharana 等人 2024(https://arxiv.org/html/2608.11879#bib.bib18);Wu 等人 2025(https://arxiv.org/html/2608.11879#bib.bib30);Jiang 等人 2025(https://arxiv.org/html/2608.11879#bib.bib12)),而现有的成本证据也仅以个别系统在自身条件下报告的孤立 token 节省或延迟数据形式出现。还没有研究在统一骨干模型和定价下,跨系统、对照透明基线来衡量记忆系统的服务成本。
因此,今天选择记忆系统的从业者无法回答一个基本问题:服务成本是多少,而且这个成本是否真的优于重新提交记录?记忆系统的每轮成本由其内部流水线行为决定,而它是否经济还进一步取决于对话运行的时间长度以及提供服务所用的骨干模型。如果没有受控的跨系统测量,记忆系统的成本论据只能建立在假设而非证据之上。
在本研究中,我们对智能体记忆系统的服务成本进行基准测试。我们测量了三种记忆系统——Mem0(Chhikara 等人 2025(https://arxiv.org/html/2608.11879#bib.bib7))、Hindsight(Latimer 等人 2025(https://arxiv.org/html/2608.11879#bib.bib15))和 Mastra Observational Memory(Barnes 2026(https://arxiv.org/html/2608.11879#bib.bib4))——与两种界定成本范围的参考策略:固定大小的滚动窗口和完整记录重新提交。我们在两个骨干模型、两种推理努力设置下,对最长 400 轮的合成对话运行每个系统,并将每项成本测量与 LoCoMo 基准(Maharana 等人 2024(https://arxiv.org/html/2608.11879#bib.bib18))上的回答准确率配对,从而在单一匹配配置中同时获得成本和准确率。我们的贡献是:
- • 对三种智能体记忆系统的服务成本进行受控基准测试,并与两种透明的参考策略(滚动窗口和完整记录重新提交)进行对比。
- • 一个每轮成本模型,将消息大小和对话深度拟合为两个独立项,并在保留的工作负载上验证;它能预测参考策略,但无法预测记忆系统,后者的成本由内部记忆状态驱动。
- • 一项盈亏平衡分析,确定记忆系统何时变得比重新提交完整记录更便宜。
- • 在 LoCoMo 上跨记忆系统和骨干模型进行联合成本-准确率比较。
## 2. 相关工作
对话智能体的记忆系统。检索增强生成(Lewis 等人 2020(https://arxiv.org/html/2608.11879#bib.bib16))是记忆增强的早期形式,将检索到的文档块置于提示之前,以在外部知识的基础上进行生成。MemGPT(Packer 等人 2024(https://arxiv.org/html/2608.11879#bib.bib24))将 LLM 上下文管理与操作系统虚拟内存进行类比,在上下文工作记忆和外部长期存储之间分页事实。Mem0(Chhikara 等人 2025(https://arxiv.org/html/2608.11879#bib.bib7))从每一轮中提取原子化的、扁平类型的事实,并将其存储在向量数据库中,在查询时检索 top-k。后来的系统追求更丰富的表示,包括相互关联的记忆笔记(Xu 等人 2025(https://arxiv.org/html/2608.11879#bib.bib31))、时间感知的知识图谱(Rasmussen 等人 2025(https://arxiv.org/html/2608.11879#bib.bib25))以及时间连续事实的持续性摘要(Su 等人 2026(https://arxiv.org/html/2608.11879#bib.bib28))。我们基准测试的三个系统涵盖了这一设计空间:Mem0 代表扁平的提取-检索范式,Hindsight(Latimer 等人 2025(https://arxiv.org/html/2608.11879#bib.bib15))增加了保留-回忆-反思的记忆摄取流水线,而 Mastra Observational Memory(Barnes 2026(https://arxiv.org/html/2608.11879#bib.bib4))则运行一个观察者-反思者-行动者循环,并带有阈值触发的整合机制。关键在于,这些架构不仅存储的内容不同,而且*计算花费方式*也不同——固定大小的事实提取、随对话延长而增长的检索负载,或阈值触发的记忆整合过程——因此不能假定它们具有相同的成本曲线。以往的工作通过这些系统的表示形式和召回准确率来刻画它们;我们则通过服务成本来刻画它们。
记忆与长上下文基准测试。几个基准测试评估系统回忆扩展交互的能力。LoCoMo(Maharana 等人 2024(https://arxiv.org/html/2608.11879#bib.bib18))提供多会话对话,其问题涵盖单跳、多跳、时间性和开放域类别;LongMemEval(Wu 等人 2025(https://arxiv.org/html/2608.11879#bib.bib30))测试信息提取、多会话推理、时间推理、知识更新和弃权;PersonaMem(Jiang 等人 2025(https://arxiv.org/html/2608.11879#bib.bib12))则探测跨问题的人设一致性。此类基准也被用来直接将记忆系统与长上下文推理进行比较,因为上下文窗口的扩大引发了一个问题:检索是否仍有必要(Khalusova 2024(https://arxiv.org/html/2608.11879#bib.bib14);Rengifo and Martin 2025(https://arxiv.org/html/2608.11879#bib.bib26)),尽管长上下文模型在长提示上的注意力并不均匀(Liu 等人 2024(https://arxiv.org/html/2608.11879#bib.bib17))。然而,这场争论几乎完全围绕准确率展开:这些基准衡量系统回忆了什么,而不是服务成本是多少,记忆系统的服务成本因此从未被计量。我们的工作将 LoCoMo 上的准确率与匹配的成本测量配对,使两者可以直接比较。
LLM 推理的成本与效率。按 token 计费的 API 定价使推理成本成为生产环境的核心关注点,一系列技术也针对这一点。提示缓存复用共享输入前缀的预计算键值状态(Gim 等人 2024(https://arxiv.org/html/2608.11879#bib.bib10)),提供商对缓存输入 token 给予大幅折扣(OpenAI 2024(https://arxiv.org/html/2608.11879#bib.bib21);Anthropic 2024(https://arxiv.org/html/2608.11879#bib.bib2));提示压缩则直接缩短输入本身(Jiang 等人 2023(https://arxiv.org/html/2608.11879#bib.bib13))。此类技术优化的是*单条*推理路径。相比之下,记忆系统是一个多阶段流水线,其总计费成本由摄取阶段、检索阶段和回答阶段复合而成,每个阶段都会发起各自的模型调用。此类流水线的组合成本——以及它在哪个对话长度下低于直接重新提交记录——尚未被刻画。我们提供了这一刻画:一项针对记忆系统的受控服务成本基准测试,以透明的下限和上限基线为对照,并附有盈亏平衡分析和匹配的准确率比较。
## 3. 方法论
我们在两个独立的基准测试中评估三种记忆系统,它们共享相同的骨干模型、推理努力和嵌入配置:一个*成本基准*,衡量作为对话长度和轮次大小函数的可计费服务成本;以及一个*准确率基准*,衡量在多会话对话式 QA 基准的分层子集上的回答正确性。第 3.5 节(https://arxiv.org/html/2608.11879#S3.SS5)将它们组合成一个每次正确回答成本统计量。
### 3.1. 记忆系统
我们基准测试三种记忆系统:Mem0(Chhikara 等人 2025(https://arxiv.org/html/2608.11879#bib.bib7))、Hindsight(Latimer 等人 2025(https://arxiv.org/html/2608.11879#bib.bib15))和 Mastra Observational Memory(Mastra OM)(Barnes 2026(https://arxiv.org/html/2608.11879#bib.bib4))。每个系统的流水线配置见表 5(https://arxiv.org/html/2608.11879#A1.T5)。
我们还评估了两种界定成本范围的参考策略:
滚动窗口(下限):每一轮只看到最近 10 轮;不持久存储任何内容——这是最便宜的可能策略。
完整历史(上限):每一轮都重新提交完整记录。每个记忆系统的盈亏平衡点(第 4.2 节(https://arxiv.org/html/2608.11879#S4.SS2))都是相对于这一上限测量的。
### 3.2. 骨干模型与推理级别
所有系统都在相同的两个骨干模型下评估:gpt-oss-20b(OpenAI 等人 2025(https://arxiv.org/html/2608.11879#bib.bib20))和 Gemma 4 26B A4B(Google DeepMind 2026(https://arxiv.org/html/2608.11879#bib.bib11)),每个都使用两种推理努力设置(*低*、*中*)。嵌入使用 pplx-embed-v1-0.6b(Eslami 等人 2026(https://arxiv.org/html/2608.11879#bib.bib9));每 token 定价和 OpenRouter 提供商路由见附录 A(https://arxiv.org/html/2608.11879#A1)。
### 3.3. 成本基准设计
图 1(https://arxiv.org/html/2608.11879#acmlabel1)给出了成本基准的端到端概览,从设计网格到拟合的成本模型;本小节的其余部分详细说明每个阶段。
1. 设计网格 2. 合成对话 3. 通过 3 个系统 + 2 个基线重放 5. 可分离成本模型 检索 回答 摄取?摄取(若触发)4. 每轮流水线(×N\\times\\,N轮)对于每一轮每轮 C 图 1。成本基准概览。(1)我们采样五个 (N,L)(N,L) 单元:对话长度 NN 和每轮 token 大小 LL 网格的四个角和中心。(2)对于每个 (N,L,seed)(N,L,\\mathrm\{seed\}),一个 LLM 生成两说话人对话,并缓存后原样复用,因此每个系统看到相同的输入。(3)每个缓存的对话通过三个记忆系统和两个参考基线重放。(4)在一次运行中,每一轮都经过检索、回答以及一个决定是否刷新缓冲轮次的摄取门;这三个阶段计费的输入 token 给出每轮成本 CC。(5)然后我们拟合一个对数-对数成本模型,包含独立的 NN 和 LL 项,每个(系统、模型)拟合一个,通过留一交叉验证和 bootstrap 置信区间进行验证。一个两层流程图。顶行从左到右显示四个框式阶段:“1. 设计网格”、“2. 合成对话”、“3. 通过三个记忆系统和两个基线重放”和“5. 可分离成本模型”。箭头将每个阶段连接到下一个阶段。在阶段 3 下方,一个虚线框组标记为“4. 每轮流水线(x N 轮)”,依次包含四个子节点:“检索”、“回答”、菱形门“摄取?”以及“摄取”。一条箭头从阶段 3 进入这个每轮组;一条箭头离开该组并携带“每轮 C”进入阶段 5。
#### 网格。
对于每个(系统、模型)对,我们采样五个 (N,L)(N,L) 单元:对话长度 NN 和每轮 token 大小 LL 网格的四个角和中心。每个单元用不同的随机种子运行八次。确切的 (N,L)(N,L) 值,包括基线和 Mastra OM 的额外单元,列于附录 B(https://arxiv.org/html/2608.11879#A2)。
#### 合成对话生成。
每个成本基准对话均由 LLM 合成生成:对于每个 (N,L,seed)(N,L,\\text\{seed\}),模型生成一个两说话人对话,共 NN 轮,每轮大约 LL 个 token,提示要求保持具体的个人细节——姓名、日期、偏好、计划。超长轮次被截断,不足轮次被填充,以使轮次长度接近 LL;每个完成的对话都会被缓存,以便在不同重复和不同系统之间保持一致。生成对话使我们能够精确填满每个 (N,L)(N,L) 单元。生成提示在附录 C(https://arxiv.org/html/2608.11879#A3)中复现。
#### 成本模型。
对于对话深度为 t 的一轮(消息平均 LL 个 token),令 CC 为在摄取、检索和回答中计费的 LLM 输入 token 总数。我们对 CC 建模,而不是美元成本:美元成本由附录 A(https://arxi相似文章
AgentMemBench:评估对话式AI智能体长期记忆管理策略的系统性基准
AgentMemBench 是一个系统性基准,在三个数据集上评估对话式 AI 智能体的五种长期记忆管理策略,发现外部键值存储检索在质量上占优,但会带来更大的内存占用。
MemArena:一种面向大规模设备端智能个人记忆助手的自我中心基准
MemArena 是一种新的自我中心基准,用于评估设备端个人记忆助手,它使用 MASim 智能体模拟器生成多会话对话世界,并在回忆、推理和可信度维度上提供真值。初步结果表明,记忆后端的选择通常比读取器规模更重要,而基于权限的访问仍然是一个普遍挑战。
从回想到遗忘:为个性化智能体评估长期记忆
研究者推出 Memora 基准,衡量大模型在持续数周至数月的对话中保留、更新与遗忘用户长期记忆的能力,发现模型常复用已失效记忆。
每个智能体记忆系统都用召回率做基准,却几乎没人检查记忆是否仍然真实
本文认为,智能体记忆系统的评估只看召回率,而不看召回的事实是否仍然为真;并提出一个“过时正确性”(correctness under staleness)基准,结果显示向量存储在 68% 的情况下会返回过时事实。
记忆造就差异:评估不同记忆角色如何塑造对话代理
本文介绍了一种对话记忆类型的分类法和一个以用户为中心的评估框架,用于研究不同记忆角色如何影响基于RAG的对话代理的响应质量。