GroupMemBench:多轮对话中LLM代理记忆的基准测试

arXiv cs.CL 论文

摘要

GroupMemBench是一个新的基准,用于评估多轮对话中LLM代理的记忆能力,揭示了当前记忆系统的缺陷,最佳系统仅达到46%的平均准确率。

arXiv:2605.14498v1 公告类型:新 摘要:大型语言模型(LLM)代理越来越多地充当个人助理和工作场所协作者,其效用依赖于从长对话中提取、检索和应用信息的记忆系统。然而,现有的记忆系统和基准均围绕二元、单用户场景构建,而实际部署通常涉及多个用户与代理以及彼此交互的群组和频道。这种脱节导致群体记忆的三个特性未被衡量:(i)超越简单拼接一对一聊天的群体动态,(ii)基于说话者的信念跟踪(需要按用户建模记忆),以及(iii)适应听众的语言(心理理论转换产生角色特定的词汇)。我们提出了GroupMemBench,一个全面暴露这三方面问题的基准。基于图的合成流水线生成具有可控回复结构的多方对话,并根据每个用户的人设和目标受众对每条消息进行条件设定。然后,对抗性查询流水线将每个问题绑定到特定的提问者,覆盖多跳推理、知识更新、术语歧义、用户隐含推理、时间推理和弃权六个类别,并迭代搜索反映全面记忆能力的具有挑战性的现实查询。对领先记忆系统的基准测试揭示了严重的性能崩溃:最强的系统仅达到46.0%的平均准确率,其中知识更新为27.1%,术语歧义为37.7%,而简单的BM25基线匹配或超过了大多数代理记忆系统。这表明当前的记忆吸收过程抹去了群体记忆所依赖的结构和词汇特征,使得多用户记忆问题远未解决。
查看原文
查看缓存全文

缓存时间: 2026/05/15 06:22

# GroupMemBench: 多轮对话中LLM智能体记忆能力的基准测试
来源:https://arxiv.org/abs/2605.14498
查看PDF (https://arxiv.org/pdf/2605.14498)

> 摘要:大语言模型(LLM)智能体越来越多地充当个人助理和职场协作者,其效用依赖于从长期对话中提取、检索和应用信息的记忆系统。然而,现有的记忆系统和基准测试都围绕二元、单用户场景构建,但实际部署通常涉及多个用户与智能体以及彼此之间在群组和频道中互动。这种错位导致群组记忆的三个特性未被测量:(i) 超出简单一对一对话拼接的群组动态,(ii) 基于说话者的信念追踪——需要对每个用户的记忆进行建模,以及 (iii) 面向受众的语言——心理理论转换会产生特定角色的词汇。我们提出了GroupMemBench,一个暴露了上述全部三个特性的基准测试。一个基于图谱的合成流程能够生成具有可控回复结构的多方对话,并根据每个用户的角色和目标受众对每条消息进行条件化处理。随后,一个对抗性查询流程将每个问题与特定提问者绑定,涵盖六个类别——多跳推理、知识更新、术语歧义、用户隐含推理、时序推理以及弃权——并迭代搜索挑战性强、贴近现实且能全面反映记忆能力的查询。对主流记忆系统的基准测试揭示出急剧的性能塌缩:最强的系统平均准确率仅达46.0%,其中知识更新为27.1%,术语歧义为37.7%,而简单的BM25基线却等于或超过了大多数智能体记忆系统。这表明当前的记忆注入过程抹除了群组记忆所依赖的结构和词汇特征,多用户记忆问题远未得到解决。

## 提交历史

来自:Jingbo Yang [查看邮箱 (https://arxiv.org/show-email/7b03a516/2605.14498)] **\[v1\]** 2026年5月14日星期四 07:38:29 UTC (1,535 KB)

相似文章

MemEvoBench:LLM 代理内存误演化基准测试

arXiv cs.CL

MemEvoBench 引入了首个用于评估 LLM 代理内存安全性的基准测试,衡量对抗性内存注入、噪声输出和有偏反馈在问答与工作流任务中导致的行为衰退。该研究表明内存演化是安全失败的重要因素,且静态防御措施不足以应对。

MemGym:面向LLM智能体的长时记忆环境

arXiv cs.CL

MemGym是一个基准测试,用于评估LLM智能体在长时任务中的记忆形成,它统一了现有的智能体gym和合成流水线,并采用记忆隔离得分。它涵盖工具使用对话、多轮搜索、编码和计算机使用,并包含一个轻量级奖励模型(MemRM)以实现高效评估。

MemOps:长时对话中生命周期记忆操作的基准测试

arXiv cs.AI

介绍了MemOps,这是一个将对话记忆重新定义为具有结构化轨迹的生命周期操作的基准,能够对基于LLM的智能体中的记忆故障进行操作级诊断,揭示当前系统远未达到均匀可靠的境地。

PM-Bench:评估LLM智能体的前瞻记忆能力

arXiv cs.AI

提出了PM-Bench,这是一个受认知科学启发、用于评估LLM智能体前瞻记忆能力的基于文本的基准测试。实验表明,即使是最佳方法(GPT-5.4智能体)也仅达到65.1%的F1分数,表明在可靠的意图执行方面存在重大挑战。