MEMPROBE:通过隐藏用户状态恢复探测智能体长期记忆
摘要
MEMPROBE是一个基准,通过从智能体交互后的记忆中重建隐藏用户状态,来评估大语言模型智能体的长期记忆能力。
arXiv:2606.24595v1 Announce Type: new
摘要:长期记忆有望使大语言模型智能体在多次会话中不断提升能力,保持对用户准确且不断更新的理解,而这种理解是在交互中形成的。然而在实践中,这种记忆主要通过下游行为来评估,例如后续的回答、个性化质量或任务成功率,这些方式仅间接测试理解能力,且记忆产物本身几乎未经审计。我们认为,长期记忆应作为交互后可审计的产物来评估:在日常帮助之后,能从智能体留下的记忆中重建出什么样的结构化用户状态?我们将这一观点具体化为MEMPROBE基准,其中配备了记忆的智能体协助模拟用户,每个用户携带一个基于分类法的隐藏用户状态库,在一系列泄漏可控的任务轨迹中,之后在完全存储和top-k访问两种条件下,从智能体产生的记忆中重建该状态库。MEMPROBE基于合成真实值以实现高效、可扩展的测量,涵盖50个模拟用户,每个用户有31个隐藏维度(共1550个恢复目标),并测试了5个代表性记忆系统。测试最先进的记忆智能体时,我们发现成功的协助和可恢复的记忆表现为不同的能力。任务完成度几乎饱和,即使对于无记忆基线也是如此,而类别平衡恢复率仍适中(约0.6),在top-k检索下进一步下降。MEMPROBE是首个直接研究记忆恢复的基准,重建系统保留的用户状态并对照真实值进行评分。我们将恢复视为未来记忆智能体需要优化的具体目标,而MEMPROBE则是迈向这样一个环境的一步:智能体被训练去记住用户,随着相处时间越长,其记忆越发准确。
查看缓存全文
缓存时间: 2026/06/24 07:47
# MEMPROBE:通过隐藏用户状态恢复探测长期智能体记忆 来源:https://arxiv.org/abs/2606.24595 查看PDF(https://arxiv.org/pdf/2606.24595) > 摘要:长期记忆有望让LLM智能体在多次会话中持续提升能力,维护对用户准确且不断演化的理解,而这种理解正是通过交互形成的。然而在实际中,这种记忆主要通过下游行为来评估,例如后续的回答、个性化质量或任务成功率,这些方式只能间接检验理解能力,而记忆本身却几乎未经审计。我们认为,长期记忆应当被评估为一种可审计的交互后产物:在常规辅助之后,能否从智能体留下的记忆中重建出结构化的用户状态?我们将这一观点具体化为MEMPROBE基准测试。在该基准中,配备记忆的智能体辅助模拟用户,每位用户携带一个基于分类体系的隐藏用户状态库,经历一系列可控泄露的任务轨迹;之后,在全局存储和top-k访问两种条件下,从智能体产生的记忆中重建该状态库。MEMPROBE基于合成真值实现高效、可扩展的测量,涵盖50个模拟用户,每个用户有31个隐藏维度(共1,550个恢复目标),并测试了5个代表性的记忆系统。测试最先进的记忆智能体时,我们发现成功辅助和可恢复记忆表现为两种不同的能力。任务完成率几乎饱和,即使对于无记忆基线也是如此;而类别平衡的恢复率保持中等(约0.6),在top-k检索下进一步下降。MEMPROBE是首个直接研究记忆恢复的基准测试,它重建系统保留的用户状态,并与真值进行评分。我们将恢复视为未来记忆智能体应优化的具体目标,MEMPROBE则是向这样一种环境迈出的一步:智能体被训练去记住其用户,相处越久,记忆越忠实。 ## 提交历史 来自:马恩泽 \[查看邮件(https://arxiv.org/show-email/b91bd510/2606.24595)\] **\[v1\]** 2026年6月23日星期二 13:52:46 UTC(422 KB)
相似文章
MemTrace:探究最终准确率在长期记忆中遗漏的内容
MemTrace 是一个基准,它在知识点层面评估 LLM 代理的记忆,探究事实在不同记忆年龄、问题类型和证据条件下的表现。它揭示出汇总的准确率掩盖了不同的失败模式,并且主要瓶颈是证据的使用而非检索。
先个性化再存储:面向长周期智能体的个性化记忆基准测试与学习
本文介绍了PerMemBench,这是首个用于评估基于LLM的智能体中个性化记忆系统的基准测试,并提出了一个会话级存储门控框架,该框架根据个体用户上下文调整记忆策略。
MemPro:作为可进化程序的智能体记忆系统
MemPro 是一个系统级进化框架,它将记忆构建-检索管道视为一个可进化的程序,使用进化智能体(Evolving Agent)迭代诊断失败并创建改进版本。在长期任务基准上的实验表明,与静态和提示级基线相比,它在性能-成本权衡方面取得了持续改进。
从回想到遗忘:为个性化智能体评估长期记忆
研究者推出 Memora 基准,衡量大模型在持续数周至数月的对话中保留、更新与遗忘用户长期记忆的能力,发现模型常复用已失效记忆。
LongMemEval-V2:评估长期智能体记忆,迈向经验丰富的同事
本文介绍了 LongMemEval-V2,这是一个用于评估 Web 智能体长期记忆系统的基准,同时提出了两种记忆方法:AgentRunbook-R 和 AgentRunbook-C。