MemOps:长时对话中生命周期记忆操作的基准测试
摘要
介绍了MemOps,这是一个将对话记忆重新定义为具有结构化轨迹的生命周期操作的基准,能够对基于LLM的智能体中的记忆故障进行操作级诊断,揭示当前系统远未达到均匀可靠的境地。
arXiv:2607.12893v1 公告类型:新
摘要:长期记忆已成为陪伴用户进行长时间、多会话交互的基于LLM的智能体的基础能力。然而,现有基准几乎完全通过下游问答来评估这种记忆,仅对最终答案的正确性进行评分。这种黑盒式表述混淆了记忆失败的异质原因,例如遗漏相关事实的介绍、将操作绑定到错误目标、或依赖更新后的过时值。因此,即使答案依赖于不一致或不安全的记忆状态,它也可能被给予正确评分。在本文中,我们认为,在动态的长时交互中,记忆并非静态事实的集合,而是明确操作的生命周期,包括记忆、遗忘、更新、反思及其组合。我们引入了MemOps,这是一个基准,将对话记忆重新定义为生命周期操作的序列,并通过结构化轨迹表示每个记忆事件,指定其触发条件、目标、范围、状态转换和支持证据。一个可控的生成流水线将这些操作嵌入到面向任务的长对话中,并生成黄金操作轨迹以及六类操作级探针,分别在相邻证据和长上下文设置下进行评估。在长上下文、基于检索、参数化和管理记忆系统中,MemOps分离了仅凭最终答案准确性无法揭示的失败模式,显示当前系统远未达到均匀可靠。例如,会话级检索优于轮次级检索,且长上下文模型在重构有序记忆状态轨迹方面仍然明显薄弱。这些结果将长期记忆评估从最终答案评分转向可解释的操作级诊断。
查看缓存全文
缓存时间: 2026/07/15 04:21
# MemOps:长时程对话中生命周期内存操作的基准测试 来源:https://arxiv.org/html/2607.12893 1\] 忆张(上海)科技有限公司 2\] 香港科技大学(广州) 3\] 中国人民大学 张泽宇 林泽豪 孙奕航 郭梓亮 张曦充 梁宇轩 熊飞宇 李志宇 (2026年7月14日) ###### 摘要 长期记忆已成为基于LLM的智能体在跨多会话、长时间陪伴用户时所必需的基础能力。然而,现有基准测试几乎完全通过下游问答来评估这种记忆,仅对最终答案的正确性进行评分。这种黑盒式的表述混淆了记忆失败的不同原因,例如遗漏相关事实的引入、将操作绑定到错误的目标、或在修正后仍依赖过时的值。因此,它可能奖励正确的答案,即使该答案依赖于不一致或不安全的记忆状态。在本文中,我们认为,在动态的长时程交互中,记忆并非事实的静态集合,而是一系列显式操作的生命周期,包括记忆、遗忘、更新、反思及其组合。我们提出 **MemOps**,一个将对话记忆重新表述为生命周期操作序列的基准测试,并使用结构化轨迹表示每个记忆事件,指定其触发条件、目标、范围、状态转换和支持证据。一个可控的生成流水线将这些操作嵌入到长期任务导向的对话中,并生成黄金操作轨迹以及六类操作级探针,在相邻证据和长上下文两种设置下进行评估。在长上下文、基于检索、参数化和托管记忆系统上,**MemOps** 揭示了最终答案准确性单独无法暴露的失败模式,表明当前系统远未达到统一可靠。例如,会话级检索优于轮次级检索,而长上下文模型在重构有序记忆状态轨迹方面仍然明显薄弱。这些结果将长期记忆评估从最终答案评分转向可解释的操作级诊断。 ## 1 引言 近年来,大型语言模型(LLM)已迅速从局限于单一会话的助手演变为能够在数天、数周甚至数月的持续交互中陪伴用户的交互式智能体[wang2024survey, xi2025rise]。在这种设置下,长期记忆[zhang2025survey, sumers2024cognitive]已成为决定基于LLM的智能体能否随时间维持连贯、个性化交互的基础能力。与仅响应当前上下文的助手不同,记忆增强型智能体应能在交互中积累用户特定知识、检索相关先前经验、适应不断变化的用户状态,并忽略已过时或用户要求遗忘的信息。受此需求驱动,越来越多的基准测试[locomo, wu2024longmemeval, tan2025membench]极大地推进了长期对话记忆的评估,测试智能体能否回忆事实、跨会话推理、处理时间信息以及回答基于长交互历史的问题。 尽管取得了这些进展,现有基准测试[locomo, wu2024longmemeval, tan2025membench, ai2026memorybench, hu2026memoryagentbench, yang2026groupmembench, hu2026evermembench]主要仍通过下游性能(最突出的是基于多会话对话历史的问答任务)来评估长期记忆。如图1 (https://arxiv.org/html/2607.12893#S1.F1) 所示,虽然这种表述提供了系统能否利用对话历史生成正确响应的端到端度量,但最终答案的准确性往往掩盖了记忆失败的不同原因。不正确的响应可能源于记忆过程不同阶段的错误,例如遗漏了与记忆相关的事实的引入、将属性绑定到错误的对象、或从不足的证据中得出无支持的概括。相反,智能体可能在仍操作于不正确或不安全的记忆状态时产生正确答案,这种不一致在记忆仅作为黑盒输入输出行为进行评估时很难被诊断。 这种局限性在动态的长期交互[sun2026preference]中最为突出,因为记忆并非作为事实的静态集合,而是作为一个生命周期过程[lin2026memorysecurity]发挥作用。在此类交互过程中,用户可能引入一条信息,随后修正它,请求遗忘其中的一部分,或通过反复出现的行为隐式表明偏好。这些事件实例化不同的记忆操作,即记忆、更新、遗忘和反思,每个操作由其自身的触发条件、目标对象、范围、状态转换和特征性失败模式定义。例如,成功的遗忘操作不仅需要在未来响应中抑制被遗忘的值,还需要保留应继续可用的不相关活跃记忆[maini2024tofu, shi2025muse]。同样,成功的更新需要区分当前值与过时的历史值,而不是将两者视为同等有效的证据[cohen2024ripple]。反思性记忆操作需要将多个线索综合成有支持的结论,而不过度推断超出证据的范围。然而,现有基准测试仅通过这些操作的下游答案来评估它们,不提供对操作本身的直接监督或诊断。如表1 (https://arxiv.org/html/2607.12893#S1.T1) 所总结,我们将 **MemOps** 与代表性长期记忆基准测试在五个维度上进行了比较,包括显式记忆操作、生命周期覆盖、状态转换建模、遗忘与泄漏控制以及失败诊断。虽然几个基准测试部分涉及个别维度,例如将知识更新或选择性遗忘作为孤立能力进行评估,但没有一个将记忆操作本身作为构建和监督的显式单元,也没有联合支持状态转换建模和细粒度失败诊断。 参见图注 图1:现有长期记忆基准测试与我们的 **MemOps** 之间的比较。 在这项工作中,我们提出 **MemOps**,一个用于诊断记忆增强型智能体中长期记忆行为的生命周期记忆操作基准测试。**MemOps** 不仅关注基于长对话的问答,而是评估智能体能否在对话历史中检测、执行和遵循显式或隐式的记忆操作。我们的基准测试将长期记忆能力分解为操作级组件,并使用结构化轨迹表示每个记忆事件,指定其触发条件、对象、范围、状态转换和支持证据。这种表述使得不仅能够评估最终答案,还能评估产生该答案的中间记忆行为。 为了支持这一诊断目标,**MemOps** 构建了受控的长期对话历史,其中记忆操作被嵌入到自然的任务导向交互中。每个示例包含一个黄金记忆操作轨迹和一组针对度量的探针。这些探针评估操作检测、目标提取、状态转换、操作特定鲁棒性和来源支持。例如,一个遗忘示例可能首先建立一个临时凭证,引入一个单独的保留控制事实,然后请求仅删除临时凭证。评估随后区分被遗忘值的泄漏与保留事实的过度遗忘。类似地,更新示例区分对新值的正确采用与对过时值的持续依赖,而反思示例测试模型能否从多个线索推断出偏好而无需无支持的概括。 基于我们的基准测试,我们评估了来自四种典型记忆范式的代表性系统,包括长上下文模型、基于检索的记忆、参数化记忆和托管记忆,在相邻证据和长上下文两种设置下。结果表明,当证据紧邻查询呈现时性能最强,而将证据分散到更大、充满干扰的历史中则会持续降低答案准确性和操作级可靠性。在评估的系统中,会话级检索明显优于轮次级检索,而保留更长、上下文更丰富的记忆单元的托管记忆服务优于存储简短、孤立事实的服务,这表明周围上下文对于正确执行生命周期操作(而不仅仅是检索相关内容)至关重要。参数化记忆将交互历史直接折叠到模型参数中,在几乎所有诊断维度上仍然明显不可靠。值得注意的是,操作级分析揭示,在多个组合操作中重构有序的记忆状态轨迹比任何单步操作都脆弱得多,即使对于其他方面表现良好的模型也是如此,这暴露了仅靠最终答案准确性无法揭示的失败模式。 我们的贡献可总结为三个部分: - • **对话记忆的生命周期操作表述**。我们引入对话记忆的生命周期操作表述,将长期记忆分解为具有结构化触发条件、目标、范围、状态转换和失败类型的显式操作。 - • **可控的基准测试生成流水线**。我们开发了一个可控的基准测试生成流水线,将记忆操作嵌入到长期任务导向对话中,并生成黄金操作轨迹以及操作特定的探针。 - • **评估与发现**。我们表明,一旦证据被长且充满干扰的历史所稀释,性能就会下降。此外,会话级检索和保留上下文的记忆优于细粒度存储。最后,即使对于强模型,重构有序记忆状态轨迹仍是一个持续的弱点,揭示了仅凭最终答案准确性无法暴露的失败。 表1:**MemOps** 与现有长期记忆基准测试的比较。**MemOps** 独特地强调显式记忆操作、生命周期状态转换、安全遗忘、泄漏控制和细粒度失败诊断。✓ = 显式支持;◐ = 部分支持;✗ = 不支持。Ops 表示操作。 | 基准测试 | 显式记忆操作 | 生命周期操作 | 状态转换 | 遗忘/泄漏 | 失败诊断 | | --- | --- | --- | --- | --- | --- | | LoCoMo [locomo] | ✗ | ✗ | ✗ | ✗ | ✗ | | LongMemEval [wu2024longmemeval] | ✗ | ◐ | ◐ | ◐ | ◐ | | MemBench [tan2025membench] | ✗ | ◐ | ◐ | ✗ | ◐ | | MemoryBench [ai2026memorybench] | ✗ | ◐ | ◐ | ◐ | ✗ | | MemoryAgentBench [hu2026memoryagentbench] | ✗ | ◐ | ✓ | ✓ | ◐ | | GroupMemBench [yang2026groupmembench] | ✗ | ◐ | ◐ | ◐ | ◐ | | EverMemBench [hu2026evermembench] | ✗ | ◐ | ◐ | ◐ | ◐ | | **MemOps** | ✓ | ✓ | ✓ | ✓ | ✓ | ## 2 相关工作 ### 2.1 长期对话基准测试 对话记忆的评估已逐步从短期的单会话对话建模转向基于长期累积的用户-助手历史进行问答。LoCoMo [locomo] 标志着这一趋势的一端,通过生成跨越数百轮和数十个会话的极长对话,将它们锚定在固定的人物画像和时间事件图中,并通过问答、事件总结和多模态生成来探测记忆。其分析表明,长上下文模型和检索增强阅读器仍远低于人类表现,特别是在时间性和对抗性问题上。LongMemEval [wu2024longmemeval] 将评估组织为五种核心能力:信息抽取、多会话推理、时间推理、知识更新和拒绝回答。它将记忆系统概念化为一个包含索引、检索和阅读的三阶段过程,并构建长度可配置的历史来评估这些能力。这两个基准测试确立了当前的标准设置,即相关证据被长而嘈杂的历史所稀释,但它们最终根据最终答案的正确性对系统进行评分。 另一系列基准测试扩展了记忆评估的范围,超越了简单的信息保留。MemBench [tan2025membench] 区分了事实记忆与反思记忆,以及参与场景与观察场景,并报告容量和效率以及准确性。MemoryBench [ai2026memorybench] 将任务重新定义为从测试时用户反馈中持续学习。通过分离陈述性知识和程序性知识,它模拟了显式和隐式反馈,评估系统能否通过累积交互(而非仅仅依赖静态检索)得到改进。MemoryAgentBench [hu2026memoryagentbench] 将评估框架化为增量式多轮交互,并定义了四种核心能力,包括准确检索、测试时学习、长程理解和选择性遗忘。它认为,静态的长上下文问答无法捕捉记忆智能体如何随时间持续吸收和更新信息。 最近的基准测试进一步将记忆评估扩展到多方和协作设置。GroupMemBench [yang2026groupmembench] 研究多方对话,其中相同的话语可能根据说话者暗示不同的记忆更新。它强调以说话者为中心的信念追踪,并表明简单的检索基线可以与学习的记忆系统匹敌,这表明当前的摄取流水线丢弃了群体记忆的重要线索。EverMemBench [hu2026evermembench] 针对跨多个参与者和群体的长时程协作记忆,在百万token规模上评估细粒度回忆、记忆意识和画像理解。 尽管范围不断扩大,这些基准测试共享一个共同的评估范式:将历史与问题配对,并对最终答案进行评分。即使那些名称指代特定操作的类别,例如 LongMemEval 中的知识更新、MemoryAgentBench 中的选择性遗忘以及 EverMemBench 中的用户知识更新,仍然通过下游问答来衡量。因此,错误的答案无法归因于记忆过程的特定阶段,而正确的答案可能建立在不安全或不一致的记忆状态之上。相比之下,我们的基准测试将对话记忆重新表述为一系列显式的生命周期操作,并通过结构化轨迹和操作特定探针评估系统能否检测、执行和应用这些操作。 ### 2.2 记忆增强型LLM系统 现有为LLM配备长期记忆的方法主要可分为四类。最直接的方法是将整个交互历史保留在上下文窗口内,并依赖长上下文模型来处理累积的信息。虽然这种设计消除了外部记忆机制的需要,但其推理成本随交互历史长度而增长。此外,随着上下文扩展,它们有效利用远距离证据的能力会下降 [bai-etal-2024-longbench],导致**中间丢失**效应 [wu2024longmemeval, hu2026memoryagentbench, liu-etal-2024-lost, hsieh2024ruler]。至关重要的是,原始上下文并不明确指示先前的陈述是否已经被修正。
相似文章
GroupMemBench:多轮对话中LLM代理记忆的基准测试
GroupMemBench是一个新的基准,用于评估多轮对话中LLM代理的记忆能力,揭示了当前记忆系统的缺陷,最佳系统仅达到46%的平均准确率。
MemEvoBench:LLM 代理内存误演化基准测试
MemEvoBench 引入了首个用于评估 LLM 代理内存安全性的基准测试,衡量对抗性内存注入、噪声输出和有偏反馈在问答与工作流任务中导致的行为衰退。该研究表明内存演化是安全失败的重要因素,且静态防御措施不足以应对。
从回想到遗忘:为个性化智能体评估长期记忆
研究者推出 Memora 基准,衡量大模型在持续数周至数月的对话中保留、更新与遗忘用户长期记忆的能力,发现模型常复用已失效记忆。
先个性化再存储:面向长周期智能体的个性化记忆基准测试与学习
本文介绍了PerMemBench,这是首个用于评估基于LLM的智能体中个性化记忆系统的基准测试,并提出了一个会话级存储门控框架,该框架根据个体用户上下文调整记忆策略。
MemGym:面向LLM智能体的长时记忆环境
MemGym是一个基准测试,用于评估LLM智能体在长时任务中的记忆形成,它统一了现有的智能体gym和合成流水线,并采用记忆隔离得分。它涵盖工具使用对话、多轮搜索、编码和计算机使用,并包含一个轻量级奖励模型(MemRM)以实现高效评估。