MemUse: 将记忆评估从直接问答转向长期人机对话中的自然整合
摘要
本文介绍了MemUse,一个基准,它表明对话记忆的直接问答准确性不能预测用户满意度,而先前上下文的自然整合则可以,揭示了回忆与对话使用之间的巨大差距。
查看缓存全文
缓存时间: 2026/08/27 03:19
论文页面 - MemUse:在长期人机对话中将记忆评估从直接问答转向自然整合
来源:https://huggingface.co/papers/2608.24189
摘要
对话记忆的直接问答基准测试无法预测用户满意度,而先前上下文的自然整合则能够,这揭示了受激回忆与实际对话使用之间存在巨大差距。
用于对话大语言模型的记忆系统通常通过直接、事实性的先前对话问题进行评估(直接问答):模型能否从先前对话中回忆事实X?我们测试了更高的直接问答准确率是否与四个月部署中的更高用户满意度相关(40名用户,1,872次会话,7种记忆条件)。在现有基准测试中,直接问答在7种条件下的准确率从19.7%到70.1%不等,但满意度并未随之变化。我们假设现有基准测试和用户满意度衡量的是不同的能力:基准测试衡量的是受激检索(被询问时的回忆),而对话需要自然整合(检测相关性并自然地将先前上下文编织到响应中)。为此,我们引入了MemUse,这是一组从部署中提取的真实用户提示的记忆时刻,通过整合感知的自然对话响应评判进行评分。在固定模型和上下文的情况下,在直接问答中得分78.8%的同一系统在对话中仅引用了7.9%的事实——差距达71个百分点。在这些时刻中,自然整合与满意度相关,而直接问答则不相关。我们在https://github.com/ryuichi-sumida/memuse发布了部署语料库以及MemUse,并包含所有评判和评分提示。
查看arXiv页面 (https://arxiv.org/abs/2608.24189) 查看PDF (https://arxiv.org/pdf/2608.24189) GitHub0 (https://github.com/ryuichi-sumida/memuse) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.24189)
社区
论文作者
论文提交者
约2小时前 (https://huggingface.co/papers/2608.24189#6a8f8da90084513b81306af3)
已被EMNLP 2026主会录用。
我们进行了为期4个月的增强记忆的对话AI的真实世界部署,发现直接问答准确率——评估长期记忆的标准方式——并不能预测用户满意度:一个在直接问答中得分78.8%的系统,在实际对话中仅自发引用了7.9%的这些事实。
我们引入了MemUse,一个基于真实用户交互构建的基准测试,它衡量的是模型是否自然地将记住的上下文整合到响应中。
通过拖入文本输入、粘贴或点击此处上传图片、音频和视频。
点击或粘贴至此上传图片
通过您的代理获取此论文:
hf papers read 2608.24189
没有最新版CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.24189,以从本页链接。
引用此论文的数据集1
RuiSumida/memuse 查看器• 更新于约2小时前 • 2.06k • 64 (https://huggingface.co/datasets/RuiSumida/memuse)
引用此论文的空间0
无空间链接此论文
在空间README.md中引用arxiv.org/abs/2608.24189,以从本页链接。
包含此论文的合集0
无合集包含此论文
将此论文添加到合集 (https://huggingface.co/new-collection),以从本页链接。
相似文章
AgentMemBench:评估对话式AI智能体长期记忆管理策略的系统性基准
AgentMemBench 是一个系统性基准,在三个数据集上评估对话式 AI 智能体的五种长期记忆管理策略,发现外部键值存储检索在质量上占优,但会带来更大的内存占用。
当用户未提问时:对话代理中上下文驱动记忆检索的基准测试
本文介绍了LoCoMo-Conv,一个对话记忆基准,用于评估长期对话代理中使用不同查询风格的记忆检索和响应质量,揭示了现有QA基准中的差距,并建议基于推理的记忆细化作为一个有前景的方向。
从回想到遗忘:为个性化智能体评估长期记忆
研究者推出 Memora 基准,衡量大模型在持续数周至数月的对话中保留、更新与遗忘用户长期记忆的能力,发现模型常复用已失效记忆。
# MemoryDocDataSet:联合对话记忆与长文档推理基准测试
MemoryDocDataSet 是一个全新的合成基准测试,包含 50 个微型世界和 1,000 个问答对,专为同时评估 AI 系统在对话记忆与长文档推理两项联合任务上的表现而设计。最优基线方法(RAG-Both)的整体 F1 值仅为 0.358,凸显了当前系统在将对话记忆与长文档导航能力融为一体方面存在的显著差距。
SuperMemory-VQA: 一个面向长期记忆的自我中心视觉问答基准
SuperMemory-VQA 是一个新的自我中心VQA基准,包含52.9小时AI眼镜录像和4,853个问答对,旨在评估AI助手在长期记忆任务上的表现,涵盖物体回忆、意图、时间线和对话。基准测试显示,现有的智能体框架和大型语言模型在这些真实世界的记忆挑战上仍远未达到可靠水平。