MemoryLake 在 MemoryArena 上的研究:智能体内存后端的匹配研究

arXiv cs.AI 论文

摘要

该研究比较了 MemoryLake,一个结构化内存后端,与其他系统在 MemoryArena 基准测试上的表现,发现它在部分任务中成功率更高,但并未在所有领域确立明显优势。

arXiv:2608.13883v1 公告类型:新 摘要:大多数智能体内存基准测试的是事后回忆,而 MemoryArena 评估的是内存是否支持相互依赖的多会话任务完成。我们比较了 MemoryLake,一个结构化的多轨道内存后端,与 Mem0、text-embedding-3-small 向量 RAG 以及长上下文控制在所有五个 MemoryArena 领域上的表现。这些系统共享相同的智能体框架、请求的 gpt-5-mini 模型别名、任务样本和评分代码;内存集成是故意改变的部分。由于每个后端捆绑了写入、检索、整合、预算和提示组装选择,该研究是匹配的系统级比较,而非仅表示的消融或成本匹配实验。在共享评估集上,MemoryLake 在数学(9/40)、物理(12/20)和渐进检索(4/20)中观察到的成功率(SR)最高。每个系统在旅行规划中 SR 为零,网页购物产生一个捆绑级成功(长上下文,1/150);MemoryLake 在旅行软流程分数和购物步骤匹配中均排名第三。遵循 MemoryArena 的套件级惯例,事后等权平均五个 SR 为 20.5%(MemoryLake)对比 13.6%(最佳比较器)。这些是点估计:样本量适中,置信区间重叠,我们不报告配对显著性测试。单独的 MemoryLake 运行在所有 221 个渐进查询上产生失败计数 SR 为 26.7%(59/221),并非基线比较。结果支持内存后端的工作负载依赖视图,并在共享集上观察到所评估四个系统中的领先;它们并未确立基准范围内的最先进水平或表示结构的因果优势。
查看原文
查看缓存全文

缓存时间: 2026/08/17 09:55

# MemoryLake在MemoryArena上的表现:智能体记忆后端的匹配研究
来源:https://arxiv.org/html/2608.13883
强周 官南 李Affiliation:黄振强 王千金Affiliation:\[2pt\] MemoryLake团队Email:[contact@zbyte\-inc\.com](mailto:)

2026年8月

###### 摘要

大多数智能体记忆基准测试评估事后回忆能力,而MemoryArena则评估记忆是否支持相互依赖的多会话任务完成。我们在MemoryArena的所有五个领域中,将结构化多轨记忆后端MemoryLake与Mem0、基于text\-embedding\-3\-small向量RAG以及长上下文控制方案进行了比较。这些系统共享相同的智能体框架、请求的gpt\-5\-mini模型别名、任务样本和评分代码;记忆集成部分是特意更改的组件。由于每个后端捆绑了写入、检索、整合、预算管理和提示组装等选择,本研究是匹配的系统级比较,而非仅表示消融实验或成本匹配实验。在共享评估集上,MemoryLake在数学(9/40)、物理(12/20)和渐进式检索(4/20)领域观察到的成功率最高。每个系统在旅行规划领域的成功率为零,网页购物仅产生一次捆绑级成功(长上下文,1/150);MemoryLake在旅行软流程分数和购物步骤匹配度上均排名第三。按照MemoryArena的套件级惯例,五个成功率的事后等权重平均值,MemoryLake为20.5%,而最佳比较对象为13.6%。这些是点估计:样本量有限,置信区间重叠,且我们未报告配对显著性检验。一次单独的MemoryLake运行覆盖所有221个渐进式查询,得出计失败成功率为26.7%(59/221),这并非基线比较。结果支持记忆后端依赖于工作负载的观点,并显示在共享集上观察到的四系统领先地位;但并未确立基准测试范围内的最先进水平或表示结构的因果优势。

关键词:智能体记忆,MemoryArena,长期记忆,LLM智能体,基准评估

## 1引言

智能体记忆评估正从静态回忆转向任务完成。以回忆为导向的基准如LoCoMo、LongMemEval、MemoryAgentBench和MemoryBench询问智能体能否从长交互历史中恢复信息\[1 (https://arxiv.org/html/2608.13883#bib.bib1),2 (https://arxiv.org/html/2608.13883#bib.bib2),3 (https://arxiv.org/html/2608.13883#bib.bib3),4 (https://arxiv.org/html/2608.13883#bib.bib4)\]。这些基准很有用,但它们并未直接测试记忆的信息是否改变后续行动、是否在错误累积中幸存或是否支持最终的多步骤目标。

MemoryArena通过封闭的记忆-智能体-环境循环解决了这一差距\[5 (https://arxiv.org/html/2608.13883#bib.bib5)\]。每个实例由有序、相互依赖的子任务组成。早期子任务生成的信息可能成为后续需要的先决条件、约束、兼容产品或中间发现。因此,该基准将过程级完成与端到端成功区分开来:系统可能恢复部分中间信息而未完成最终任务。

我们在此背景下研究MemoryLake。MemoryLake是一个结构化多轨记忆后端,在不同的存在策略下维护已确认的结论、支持性证据和可重用经验。我们将其与公开的MemoryArena版本提供的或与其对齐的三种控制方案进行比较:Mem0、使用text\-embedding\-3\-small的朴素向量分块RAG,以及将先前轨迹扁平化到提示中的同模型长上下文配置。

该研究提出两个问题。首先,在匹配的智能体框架、模型别名、任务样本和评估器下,哪个后端在共享评估集上具有最高的端到端成功率?其次,在强调精确结论重用、广泛逐字回放、约束跟踪或中间发现聚合的工作负载下,排名如何变化?

主要贡献包括:
1. 对四个记忆配置在全部五个MemoryArena领域进行的匹配系统级比较,并给出精确样本量和分母;
2. 一项端到端分析,报告每个领域的成功率和基准的等权重套件级平均成功率,同时保持过程指标可见性;
3. 工作负载级解释,区分观察到的系统性能与不受支持的表示级因果关系;以及
4. 对影响可重复性的抽样、评判者依赖性、工件范围和基准发布模糊性的透明说明。

#### 声明范围。证据支持一个有限声明:在本研究使用的共享集上,MemoryLake在三个领域具有观察到的最高成功率,并且在四系统中具有最高的事后宏观平均成功率。证据未建立统计显著性、基准范围的最先进结果、资源匹配的优势或任何单一表示机制的因果效应。

## 2相关工作

#### 以回忆为导向的记忆基准。LoCoMo和LongMemEval评估长对话上的问答\[1 (https://arxiv.org/html/2608.13883#bib.bib1),2 (https://arxiv.org/html/2608.13883#bib.bib2)\]。MemoryAgentBench和MemoryBench将评估扩展到增量交互和持续学习\[3 (https://arxiv.org/html/2608.13883#bib.bib3),4 (https://arxiv.org/html/2608.13883#bib.bib4)\]。它们的共同关注点是信息存储后能否被恢复;环境反馈和跨子任务行动依赖有限或不存在。

#### 以行动为导向的智能体基准。WebArena、WebShop和SWE\-bench评估导航、工具使用、具身购物和软件修复\[6 (https://arxiv.org/html/2608.13883#bib.bib6),7 (https://arxiv.org/html/2608.13883#bib.bib7),8 (https://arxiv.org/html/2608.13883#bib.bib8)\]。这些任务测试具有后果的行动,但实例通常是独立的,不需要持久记忆层来跨多个会话传递信息。

#### 记忆-行动耦合评估。MemoryArena明确结合了跨相互依赖会话的记忆、行动和环境反馈\[5 (https://arxiv.org/html/2608.13883#bib.bib5)\]。其领域探究了多种记忆需求:形式推理中的程序重用、旅行规划中的偏好和约束跟踪、捆绑购物中的精确项目兼容性,以及渐进式网络搜索中的中间发现聚合。

#### 记忆系统。现有系统涵盖提取式事实记忆、轨迹检索、操作系统式记忆、图结构记忆以及可重用的推理或技能抽象\[9 (https://arxiv.org/html/2608.13883#bib.bib9),10 (https://arxiv.org/html/2608.13883#bib.bib10),11 (https://arxiv.org/html/2608.13883#bib.bib11),12 (https://arxiv.org/html/2608.13883#bib.bib12),13 (https://arxiv.org/html/2608.13883#bib.bib13)\]。MemoryLake属于结构化记忆家族,但使用具有不同存在策略的并行轨道,而非单一的同质存储。

两项近期工作特别相关。DeMem将记忆表述为以决策为中心的速率失真问题,并在不同模型和协议下报告了MemoryArena结果\[14 (https://arxiv.org/html/2608.13883#bib.bib14)\]。MSCE组织具身轨迹、程序策略和声明性认知,并将有证据支持的策略提升为可调用的技能\[15 (https://arxiv.org/html/2608.13883#bib.bib15)\]。它们的发布值在此不作为相同协议的基线处理:DeMem使用不同的任务骨干和评估配置,而MSCE未在MemoryArena上评估。

## 3评估设置

### 3.1匹配的系统级协议

所有四个系统使用相同的MemoryArena智能体框架、相同的请求基础模型别名(gpt\-5\-mini)、每个跨系统比较的相同任务ID,以及基准的官方评分脚本,辅以第3.4节(https://arxiv.org/html/2608.13883#S3.SS4)中描述的渐进式检索聚合。对于MemoryLake,相同的gpt\-5\-min别名既用于任务智能体,也用于后端的内部LLM操作;后端内部不使用更大或辅助语言模型。任务实例之间记忆重置。基准环境和评估器未修改。对固定基准结账进行了两项记录更改:智能体的硬编码输出令牌预算对所有四个系统相同提高(第6.2节(https://arxiv.org/html/2608.13883#S6.SS2)),并且Mem0的渐进式运行在Mem0内存服务集成内部应用了基于后端名称的每写大小上限,否则该任务根本无法完成Mem0的运行。Mem0更改是系统特定的;在第6.2节(https://arxiv.org/html/2608.13883#S6.SS2)量化并在每个出现的表中标记。MemoryLake通过与其他外部内存配置使用的相同内存服务集成点连接。

集成点是特意更改的组件,但记忆后端不是单个变量。它可以更改写入策略、提取、辅助模型调用、整合、检索、排序、提示组装、上下文长度、回退行为和资源使用。因此,实验确定了在测试设置下分配端到端记忆配置的效果。它既不是仅表示消融,也不是令牌、延迟或成本匹配的比较。

### 3.2系统

长上下文系统是零抽象控制。Mem0代表提取式事实记忆。向量RAG代表简单的基于嵌入的检索管道;在原始MemoryArena表中的方法中,text\-embedding\_3\_small具有最高的报告套件级平均成功率\[5 (https://arxiv.org/html/2608.13883#bib.bib5)\]。MemoryLake在第4节(https://arxiv.org/html/2608.13883#S4)描述,包括其使用的gpt\-5\-mini语言模型和bge\-m3密集嵌入器。

表1:系统级差异。实验比较完整的后端配置,而非隔离表示结构。
### 3.3任务、样本和指标

表2(https://arxiv.org/html/2608.13883#S3.T2)总结了通用评估集。本文中的跨系统声明仅使用所有四个系统共享的ID。

#### 形式化数学推理。发布的集合包含40个论文级实例,分解为354个有序子问题。每篇论文是一个记忆会话;早期步骤的结论可能在后续步骤中需要。官方评估器使用基于LLM的数学等价判断。PS是论文内子问题准确率的跨论文均值。SR是论文最终子问题被判断正确的比例。我们使用完整的发布集合。

#### 形式化物理推理。物理推理集合包含20篇论文和86个有序子问题。协议和指标与数学任务相同。我们使用完整的发布集合。

#### 团体旅行规划。发布的基准包含270个团体。我们使用一个包含208个成员级计划的固定30个团体列表,跨系统相同。评估器执行确定性插槽匹配。SPS衡量相对于基础行程的附加成员约束满足情况。SR要求团体中每个成员都通过。

表2:共享比较集和指标。旅行和渐进式检索使用发布的基准的子集。
#### 捆绑网页购物。每个捆绑包含六个顺序购买,具有跨步骤兼容性和预算约束。所有四个系统都完成了完整的发布集合(150个捆绑,5类×30捆绑,900步),跨系统表对那个完整集合评分。还额外评分了一个固定的50捆绑、300步敏感性子集——每个类别的前10个捆绑——以检查步骤匹配排序在不同规模下的稳定性。

#### 渐进式检索。发布的数据包含221个具有渐进式分解的查询,总计1,641个插槽(1,420个子查询和221个最终组合查询)。主要比较使用一个包含20个查询和142个插槽(122个子查询和20个最终查询)的固定子集,在评分前选择并由所有系统共享。该子集不是随机样本:它是基于分解深度的确定性比例分层样本,未使用随机种子绘制。这221个分解查询按插槽数量分层,每个层接收配额round⁡(nstratum×20/221)\mathrm\{round\}(n\_\{\text\{stratum\}\}\times 20/221),层内最低查询ID填充该配额。深度是此任务旨在强调的变量,因为结论必须在链的每一步中存活,因此按比例抽样子集使其难度特征与全部221个匹配,而非偏向短或长链。原始选择脚本未保留;此处陈述的规则从已发布的子集中恢复并精确再生,因此它是经验证的重建而非原始代码,并且子集可以从发布的清单离线重建。相同的环境故障处理应用于所有系统。一次单独的MemoryLake运行覆盖所有221个已发布的渐进式查询;它单独报告,不用于跨系统排名。

#### 渐进式PS和SR定义。对于每个查询q,令SqS\_\{q\}表示其插槽数量(子查询加最终组合查询),aq≤Sqa\_\{q\}\leq S\_\{q\}为产生非空答案的插槽,pqp\_\{q\}为判断正确的数量。我们报告PS=1Q∑qpq/Sq\mathrm\{PS\}=\frac\{1\}\{Q\}\sum\_\{q\}p\_\{q\}/S\_\{q\},即所有插槽通过率跨查询的宏观平均值;未回答的插槽计为不正确。这与评分器的默认值不同,后者除以aq a\_\{q},因此衡量的是在更轻松的分母上回答更少插槽的系统。插槽覆盖率∑qaq/∑qSq\sum\_\{q\}a\_\{q\}/\sum\_\{q\}S\_\{q\}与表7(https://arxiv.org/html/2608.13883#A2.T7)中的PS一起报告。两种形式都是跨查询的宏观平均值,而非跨插槽的∑qpq/∑qSq\sum\_\{q\}p\_\{q\}/\sum\_\{q\}S\_\{q\},因此一个2插槽查询与一个16插槽查询权重相同。因为SqS\_\{q\}包括最终组合查询,该项同时计入PS和SR,两个指标不是独立的。

### 3.4评分、套件级摘要和验证

MemoryArena的官方评分脚本生成数学、物理、旅行和购物指标。基准未提供渐进式检索的端到端评分器:它提供LLM评判者,但未提供跨插槽的每查询PS/SR聚合。因此,该任务使用基准的评判者以及我们提供的聚合脚本,对四个系统相同应用,并随工件发布。旅行和购物是确定性的。数学、物理和渐进式检索依赖于基准的基于LLM的评判配置。

遵循MemoryArena使用的套件级摘要,我们还报告五个领域成功率值的等权重平均值:
MacroAvgSR=15∑d=15SRd\.\mathrm\{MacroAvgSR\}=\frac\{1\}\{5\}\sum\_\{d=1\}^\{5\}\mathrm\{SR\}\_\{d\}.\(1\)此平均值很有用,因为SR是跨领域的共同端到端结果。但在此研究中,它是事后得出的,未经预先注册,并对具有不同样本量和部分覆盖子集的领域给予相等权重。因此,我们将其视为描述性摘要而非推断性统计量。

相似文章

EvoArena:追踪记忆演化以实现动态环境中鲁棒的LLM智能体

Hugging Face Daily Papers

EvoArena引入了一个基准测试,用于评估LLM智能体在动态环境中的表现,该环境在终端、软件和社交领域具有渐进式更新;同时EvoMem提出了一种基于补丁的记忆范式,记录结构化的演化;实验表明,当前智能体在EvoArena上仅达到39.6%的准确率,而EvoMem在该基准测试上平均提升1.5%,并在GAIA和LoCoMo上也有所改进。