当用户未提问时:对话代理中上下文驱动记忆检索的基准测试
摘要
本文介绍了LoCoMo-Conv,一个对话记忆基准,用于评估长期对话代理中使用不同查询风格的记忆检索和响应质量,揭示了现有QA基准中的差距,并建议基于推理的记忆细化作为一个有前景的方向。
arXiv:2609.03467v1 公告类型:新
摘要:大型语言模型(LLMs)越来越多地被部署为长期对话代理,这激发了对记忆系统的日益增长的兴趣。然而,现有的基准主要通过问答式探测来评估记忆,而不是在对话中的实际使用。我们介绍了LOCOMO-CONV,一个从LoCoMo派生的对话记忆基准,具有四种查询风格:对话式、隐式、反事实和组合式。在五个代表性的记忆系统中,我们评估了检索召回率和端到端响应质量。我们的实验表明,对话框架揭示了问答基准忽略的显著检索差距,尤其是在隐式和组合式查询上,多方面查询重写可以缩小原始轮次记忆的差距,但对抽象记忆则不能。我们进一步发现,强检索并不能完全转化为响应质量,并且隐式查询表现出静默基础,其中记忆在没有明确呈现黄金事实的情况下改善了上下文基础。这些结果指向基于推理的记忆细化作为一个有前景的方向,我们发布了辅助的supportive_memory注释,捕捉了超出原始黄金证据的对话有用上下文。
查看缓存全文
缓存时间: 2026/09/04 06:00
# 上下文驱动记忆检索在对话智能体中的基准测试 来源:https://arxiv.org/html/2609.03467 Yun-Nung Chen 所属机构:国立台湾大学,中国台湾台北 邮箱:[[email protected]](mailto:[email protected]) / [email protected] ###### 摘要 大型语言模型(LLMs)正越来越多地被部署为长期对话智能体,这推动了记忆系统研究兴趣的增长。然而,现有基准测试主要通过问答式探测来评估记忆,而非评估其在实际对话中的使用。我们引入了LoCoMo-Conv,一个源自LoCoMo的对话记忆基准,包含四种查询风格:*对话式*、*隐含式*、*反事实式*和*组合式*。针对五种代表性记忆系统,我们评估了检索召回率和端到端响应质量。实验表明,对话框架揭示了问答基准测试所忽略的显著检索差距,尤其在隐含式和组合式查询中,而多方面查询改写虽然缩小了原始对话轮次记忆的差距,却未能改善摘要式记忆。我们进一步发现,强大的检索能力并不能完全转化为响应质量,且隐含式查询表现出*隐式情境化*现象——记忆能在不显式呈现关键事实的情况下提升响应的情境化程度。这些结果指向基于推理的记忆扩展作为有前景的方向,并发布了辅助标注层supportive_memory,以捕捉超出原始关键证据的对话有用上下文。111 https://github.com/MiuLab/LoCoMo-Conv/ **表1**:与现有记忆基准的比较。LoCoMo-Conv在固定的LoCoMo记忆上仅变化查询框架,并独立评分检索和响应质量。 **表2**:一个LoCoMo问答改写为我们的3种对话查询风格的示例。关键答案和关键证据轮次(左侧)在所有改写中共享;仅用户侧措辞(右侧)发生变化。反事实式改写注入了错误前提(红色),需要智能体纠正。 **表3**:与对话/隐含/反事实式改写单个LoCoMo问答不同,*组合式查询*将两个源问答组合成一个需要多事实综合的对话请求。上半部分展示源问答及其证据轮次,共享轮次(∗)标记重叠部分。下半部分展示LLM生成的组合查询和综合评分标准。 ## 1 引言 (请参照图注) **图1**:展示LoCoMo-Conv与现有基准之间差距的示意图 大型语言模型(LLMs)正越来越多地被部署为长期对话智能体,用户跨会话与之交互。这一转变使记忆成为核心需求:助手不仅需要存储先前交互,还必须在后续对话需要时检索并适当使用它们。近期研究提出了多样化的记忆架构和基准来评估长期对话记忆。然而,大多数现有评估仍通过显式问答式查询探测记忆(如表1所示 https://arxiv.org/html/2609.03467#S0.T1),无法确定这些系统是否能支持自然对话交互。 为解决这一差距,我们引入了LoCoMo-Conv,一个将LoCoMo问答库重构为四种查询风格的对话记忆基准,反映用户如何自然调用记忆——对话式、隐含式、反事实式和组合式——并评估记忆增强智能体在自然对话中(而非显式探测下)如何使用检索到的记忆。 在五种代表性记忆系统上,我们报告三个发现:首先,对话框架揭示了问答式评估所掩盖的显著检索失败,尤其在隐含式和组合式查询中;多方面查询改写缩小了差距,但仅适用于原始对话轮次记忆,而非摘要式记忆。其次,强大的检索能力并不能保证情境化响应——尤其是摘要压缩虽然有助于匹配,却丢弃了情境化响应所需的细节——这指向基于推理的记忆扩展而非有损压缩。第三,我们识别出*隐式情境化*现象:记忆能在不呈现关键事实的情况下改善隐含式查询响应,暴露了严格事实召回指标的局限性。 我们的主要贡献包括: 1. 引入LoCoMo-Conv,一个具有四种第一人称查询风格的对话基准,超越问答式探测评估记忆系统。 2. 提供统一的评估框架,涵盖检索和响应生成,支持在对话场景下系统比较抽取式与摘要式记忆系统。 3. 发布supportive_memory,一个超越原始关键证据的对话支持性上下文辅助标注层,促进超越显式事实召回的记忆情境化分析。 ## 2 相关工作 ### 2.1 长期对话记忆基准 现有长期记忆基准主要在探测方式和评分维度上有所不同。 LoCoMo(Maharana et al., 2024)开创性地构建了极长多会话对话,通过五类第三人称问答进行评估(单/多跳推理、时间性、对抗性、开放常识)。 LongMemEval(Wu et al., 2025)定义了五种记忆能力——信息抽取、多会话推理、时间推理、知识更新和拒绝回答——通过可扩展对话历史的精选问答进行探测。 MemoryAgentBench(Hu et al., 2026)将长上下文数据集重构为增量多轮流,评估四种记忆能力(准确检索、测试时学习、长程理解、冲突解决),规模达1.4M token。 其他基准针对特定记忆故障模式:HaluMem(Chen et al., 2026)将记忆幻觉分解为抽取、更新和问答阶段;PrefEval(Zhao et al., 2025)评估LLM是否在长上下文对话中遵守用户偏好;HorizonBench(Li et al., 2026a)在偏好演变下探测长期个性化,使用约163K token、6个月的对话历史。 更接近对话应用的是PersonaMem(Jiang et al., 2025a)及其后续PersonaMem-v2(Jiang et al., 2025b),专注于跨会话积累的隐式用户偏好,发现前沿LLM在隐式个性化上仅达37–48%准确率;但两者均通过多选题评估,探测智能体是否随时间内化用户特征,而非是否在查询时从单次话语中调取相关记忆。 MADial-Bench(He et al., 2025)评估具有主动召回的记忆增强对话生成,但限于单一情感支持领域且使用小规模人工评估。 LoCoMo-Plus(Li et al., 2026b)测试对话延续是否与潜在约束保持一致,其中有效响应无需检索或表达任何特定事实。 AMemGym(Jiayang et al., 2026)通过与模拟用户进行在策略交互评估记忆,与我们固定历史设置形成互补。 尽管测量轴线多样,几乎所有现有基准仍通过结构化探测评估——第三人称问答、多选题、约束检查或操作级追踪——而非自由形式对话响应生成,且没有基准要求外部记忆系统从未直接询问的用户话语中检索并情境化特定可验证事实。 LoCoMo-Conv打破这一惯例,评估*助手如何将记忆整合到对话响应中*——这是部署中记忆实际消费的形式。 ### 2.2 记忆增强对话智能体 近期研究探索了为LLM配备长期记忆的多样架构策略。 mem0(Chhikara et al., 2025)和AnchorMem(Shen et al., 2026)从原始交互中抽取原子事实并组织到结构化存储,AnchorMem进一步构建关联事件图谱以捕获跨记忆依赖。 第二条路线将过往交互压缩为简洁表示:COMEDY(Chen et al., 2025)完全摒弃检索,使用单个LLM生成、压缩并消费压缩记忆;LightMem(Fang et al., 2026)采用受Atkinson–Shiffrin启发的三阶段流水线;MemAgent(Yu et al., 2025)在覆写策略下分段处理长输入,并通过强化学习优化。 第三类借鉴操作系统原则:MemGPT(Packer et al., 2024)引入带显式分页的分级记忆层次;MemoryOS(Kang et al., 2025)扩展为短期、中期和长期存储层;HiGMem(Cao et al., 2026)采用两级事件-轮次结构,由LLM引导轮次选择。 A-MEM(Xu et al., 2025)将记忆构建本身视为智能体驱动过程,遵循Zettelkasten原则构建具有动态链接和记忆演化的互联知识网络。 最后,Memora(Xia et al., 2026)提出和声记忆表示,将抽象记忆索引与详细记忆值分离。每个记忆包含用于索引的主要抽象、用于多样检索访问的多个线索锚点,以及保留细粒度细节的非压缩记忆值。 为评估我们选取了覆盖上述主流范式的五个系统(AnchorMem, A-MEM, mem0, Memora, 以及使用all-MiniLM-L6-v2的密集检索基线),将更广泛覆盖的基准测试留给未来工作。 ## 3 LoCoMo-Conv 我们通过将每个LoCoMo问答重写为四种对话查询风格(同时保留原始关键答案和证据对话ID)来构建LoCoMo-Conv。222三位标注员在每种风格的40个项目上验证了改写质量:自然度(4.6–4.8/5),保留原始信息需求,且触发预期记忆;详见附录G。 ### 3.1 对话查询风格 **对话式**:原始问答查询的直接第一人称对话重构(例如,“你还记得我上次……吗?”)。底层事实目标不变,但措辞改写为更像自然对话而非第三人称问答。 **隐含式**:用户未明确提问的情景式对话语句。智能体必须推断应主动呈现相关历史记忆。例如,关于父母爱好的事实问答可能被改写为涉及礼物选择或回忆的对话情景。 **反事实式**:包含关于关键事实的错误前提的第一人称对话查询。智能体应识别并使用对话记忆纠正该错误假设。 **组合式**:需要综合多个源问答和证据片段的多记忆对话查询。构建过程详见3.2节。 对于所有非组合式风格,我们使用原始问题、关键答案和说话者身份提示GPT-5.4-mini,指令生成保留原始信息需求且保持自然第一人称风格的对话改写。对于反事实式查询,提示额外注入特定错误前提。改写示例如表2所示,所有查询改写提示见附录C.1。 ### 3.2 组合式多记忆簇 与其他对话风格不同,组合式查询通过将多个源问答组合为单一对话请求构建,需要多记忆综合。 对于每个问答实例q,令E(q)⊆D表示其关键证据对话ID。我们枚举同一样本内的所有问答对(qᵢ, qⱼ),并保留满足三个条件的候选簇:(i)证据重叠:E(qᵢ)∩E(qⱼ)≠∅;(ii)证据不同:E(qᵢ)≠E(qⱼ);(iii)组合证据非平凡:|E(qᵢ)∪E(qⱼ)|≥2。这些约束确保两个问答主题相关但仍贡献不同信息。 我们保留所有满足约束的有效簇,共产生1,069个组合簇(每段对话36–198个)。对于每个簇,我们使用源问答对及其关键证据轮次提示GPT-5.4-mini,要求其生成自然对话查询,隐式要求两个源答案。组合关键答案定义为构成问答的原子答案集合,关键证据对应其对话ID的并集。 由于组合查询需要综合多个原子事实,二元正确性往往过于严格。因此我们使用连续*原子事实覆盖率*(第4节)评估组合响应,衡量生成响应正确覆盖原子关键事实的比例。组合簇示例如表3所示。 ## 4 评估方法学 我们从两个互补维度评估记忆系统:(1)针对关键对话ID的检索召回率;(2)使用风格特定LLM评判器的端到端响应质量。 ### 4.1 检索召回率 对于每个查询,我们将前K个检索记忆与关键证据对话ID比较。关键轮次若其原文出现在任何返回记忆中(不区分大小写)即视为已检索。对于暴露源元数据的摘要式系统,我们额外通过元数据字段匹配检索到的对话ID。 检索召回率计算为:|retrieved∩gold| / |gold|。 ### 4.2 响应质量评判 检索到的记忆提供给答案模型生成响应,随后由LLM评判器使用风格特定标准进行评估。 - **对话式与隐含式**:*部分得分事实使用度*(3级评分:1.0若关键事实实质被正确传达——允许转述和模糊表达;0.5若响应捕捉多条关键事实的核心概念但遗漏具体细节;0.0若响应断言矛盾内容、仅含糊暗示或完全忽略事实)。 - **反事实式**:*未察觉/模糊/纠正*三元评判映射为0/0.5/1。A类(*未察觉*)将用户的错误前提视为真实处理;
相似文章
Cognis:面向对话式 AI 智能体的上下文感知记忆系统
Lyzr Cognis 推出统一开源记忆系统,融合 BM25 与 Matryoshka 向量搜索并支持版本感知写入,在 LoCoMo 与 LongMemEval 基准上实现 SOTA。
AgentMemBench:评估对话式AI智能体长期记忆管理策略的系统性基准
AgentMemBench 是一个系统性基准,在三个数据集上评估对话式 AI 智能体的五种长期记忆管理策略,发现外部键值存储检索在质量上占优,但会带来更大的内存占用。
从回想到遗忘:为个性化智能体评估长期记忆
研究者推出 Memora 基准,衡量大模型在持续数周至数月的对话中保留、更新与遗忘用户长期记忆的能力,发现模型常复用已失效记忆。
记忆造就差异:评估不同记忆角色如何塑造对话代理
本文介绍了一种对话记忆类型的分类法和一个以用户为中心的评估框架,用于研究不同记忆角色如何影响基于RAG的对话代理的响应质量。
MemOps:长时对话中生命周期记忆操作的基准测试
介绍了MemOps,这是一个将对话记忆重新定义为具有结构化轨迹的生命周期操作的基准,能够对基于LLM的智能体中的记忆故障进行操作级诊断,揭示当前系统远未达到均匀可靠的境地。