MemUse: 将记忆评估从直接问答转向长期人机对话中的自然整合

Hugging Face Daily Papers 论文

摘要

本文介绍了MemUse,一个基准,它表明对话记忆的直接问答准确性不能预测用户满意度,而先前上下文的自然整合则可以,揭示了回忆与对话使用之间的巨大差距。

对话式LLMs的记忆系统传统上通过对先前对话进行直接、事实寻求的问题(直接问答,Direct QA)来评估:模型能否从先前对话中回忆起事实X?我们在一次为期4个月的部署(40名用户,1872次会话,7种记忆条件)中测试了更高的直接问答准确性是否与更高的用户满意度相关。现有基准的直接问答在7种条件下从19.7%到70.1%不等,但满意度没有变化。我们假设现有基准和用户满意度正在跟踪不同的能力:基准测量的是引发式检索(被询问时的回忆),而对话需要自然整合(检测相关性并将先前上下文自然编织到响应中)。为了检验这一点,我们引入了MemUse,这是一组从部署中提取的真实用户提示的记忆时刻,通过整合感知的自然对话响应判断进行评分。在固定模型和上下文的情况下,同一个在直接问答上得分78.8%的系统在对话中仅引用了其中7.9%的事实——差距达71个百分点。在这些时刻中,自然整合与满意度相关,而直接问答则不相关。我们发布了部署语料库和MemUse,以及所有判断和评分提示,地址为https://github.com/ryuichi-sumida/memuse。
查看原文
查看缓存全文

缓存时间: 2026/08/27 03:19

论文页面 - MemUse:在长期人机对话中将记忆评估从直接问答转向自然整合

来源:https://huggingface.co/papers/2608.24189

摘要

对话记忆的直接问答基准测试无法预测用户满意度,而先前上下文的自然整合则能够,这揭示了受激回忆与实际对话使用之间存在巨大差距。

用于对话大语言模型的记忆系统通常通过直接、事实性的先前对话问题进行评估(直接问答):模型能否从先前对话中回忆事实X?我们测试了更高的直接问答准确率是否与四个月部署中的更高用户满意度相关(40名用户,1,872次会话,7种记忆条件)。在现有基准测试中,直接问答在7种条件下的准确率从19.7%到70.1%不等,但满意度并未随之变化。我们假设现有基准测试和用户满意度衡量的是不同的能力:基准测试衡量的是受激检索(被询问时的回忆),而对话需要自然整合(检测相关性并自然地将先前上下文编织到响应中)。为此,我们引入了MemUse,这是一组从部署中提取的真实用户提示的记忆时刻,通过整合感知的自然对话响应评判进行评分。在固定模型和上下文的情况下,在直接问答中得分78.8%的同一系统在对话中仅引用了7.9%的事实——差距达71个百分点。在这些时刻中,自然整合与满意度相关,而直接问答则不相关。我们在https://github.com/ryuichi-sumida/memuse发布了部署语料库以及MemUse,并包含所有评判和评分提示。

查看arXiv页面 (https://arxiv.org/abs/2608.24189) 查看PDF (https://arxiv.org/pdf/2608.24189) GitHub0 (https://github.com/ryuichi-sumida/memuse) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.24189)

社区

论文作者

论文提交者

约2小时前 (https://huggingface.co/papers/2608.24189#6a8f8da90084513b81306af3)

已被EMNLP 2026主会录用。

我们进行了为期4个月的增强记忆的对话AI的真实世界部署,发现直接问答准确率——评估长期记忆的标准方式——并不能预测用户满意度:一个在直接问答中得分78.8%的系统,在实际对话中仅自发引用了7.9%的这些事实。

我们引入了MemUse,一个基于真实用户交互构建的基准测试,它衡量的是模型是否自然地将记住的上下文整合到响应中。

通过拖入文本输入、粘贴或点击此处上传图片、音频和视频。

点击或粘贴至此上传图片

通过您的代理获取此论文:

hf papers read 2608.24189

没有最新版CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.24189,以从本页链接。

引用此论文的数据集1

RuiSumida/memuse 查看器• 更新于约2小时前 • 2.06k • 64 (https://huggingface.co/datasets/RuiSumida/memuse)

引用此论文的空间0

无空间链接此论文

在空间README.md中引用arxiv.org/abs/2608.24189,以从本页链接。

包含此论文的合集0

无合集包含此论文

将此论文添加到合集 (https://huggingface.co/new-collection),以从本页链接。

相似文章

# MemoryDocDataSet:联合对话记忆与长文档推理基准测试

arXiv cs.CL

MemoryDocDataSet 是一个全新的合成基准测试,包含 50 个微型世界和 1,000 个问答对,专为同时评估 AI 系统在对话记忆与长文档推理两项联合任务上的表现而设计。最优基线方法(RAG-Both)的整体 F1 值仅为 0.358,凸显了当前系统在将对话记忆与长文档导航能力融为一体方面存在的显著差距。

SuperMemory-VQA: 一个面向长期记忆的自我中心视觉问答基准

Hugging Face Daily Papers

SuperMemory-VQA 是一个新的自我中心VQA基准,包含52.9小时AI眼镜录像和4,853个问答对,旨在评估AI助手在长期记忆任务上的表现,涵盖物体回忆、意图、时间线和对话。基准测试显示,现有的智能体框架和大型语言模型在这些真实世界的记忆挑战上仍远未达到可靠水平。