SpeakerMem-R1:以说话者为中心的双轨记忆用于多方对话

Hugging Face Daily Papers 论文

摘要

本文提出 SpeakerMem-R1,一个以说话者为中心的双轨记忆系统,用于多方对话,解决了消息归属和关系理解的瓶颈。它在 EverMemBench 和 LoCoMo 等基准测试中取得了最先进的结果。

在多方对话中的长期对话记忆不仅需要从长期对话中检索相关内容,还必须区分谁说了什么、每个陈述涉及谁、个体如何相互感知、群体共享哪些信息,以及状态如何随时间变化。最近对多方对话基准的研究表明,现有的通用LLM记忆系统往往会丢失个人和群体关系,或难以整合分布在成员、群体和时间中的线索。这些问题共同揭示了两个核心瓶颈:多方对话中的消息归属和关系理解,以及从交错历史中重建状态。为了解决这两个问题,我们提出 SpeakerMem-R1:其双轨记忆存储说话者标记的逐字消息和派生状态,组织成个人级和群体级视图,然后在查询时通过实体、事件和时间结合两条轨道的证据。为了在结构化记忆构建中减少归属和更新错误,同时支持本地部署,我们使用 SpeakerLevenshtein 和说话者条件的 GRPO 训练 Writer-R1。在 GroupMemBench、SocialMemBench 和 EverMemBench 上,SpeakerMem-R1 分别实现了 47.9%、69.2% 和 61.9% 的二元准确率。在 EverMind-AI 公开报告的 EverMemBench 排行榜上,我们取得了 62.33%,这是最新最先进框架中报告的最佳结果。在 1,986 个 LoCoMo 问题上,它也实现了 70.85% 的准确率,我们将其用作两人长期对话边界测试。在对 305 个问题的受控评估中,强化学习将 SFT Writer 的平均准确率从 57.38% 提高到 68.20%。我们报告二元准确率和 token-F1,消融研究表明,在标准化评估接口下,逐字轨道和结构化轨道,以及个人级和群体级视图是互补的。
查看原文
查看缓存全文

缓存时间: 2026/09/24 03:37

论文页面 - SpeakerMem-R1:面向多方对话的说话者中心双轨记忆系统

来源:https://huggingface.co/papers/2609.26780

摘要

多方对话场景下的长期对话记忆构建,不仅需要从历史对话中检索相关内容,还必须区分不同说话者的陈述内容、理解每个人物的关系网络、把握群体共享的信息结构,并追踪状态的动态演变。近期多方对话基准测试的研究表明,现有的通用大语言模型记忆系统容易丢失人物与群体关系,且难以整合分散在不同成员、群体和时间维度上的线索。这些局限揭示了两个核心瓶颈:多方对话中的信息溯源与关系理解,以及从交错历史中重建状态信息。为解决这些问题,我们提出SpeakerMem-R1系统:其双轨记忆结构同时存储带说话者标签的原始对话信息和按个人与群体维度组织的衍生状态信息,查询时通过实体、事件和时间三重维度整合双轨证据。为减少结构化记忆构建过程中的溯源与更新错误并支持本地部署,我们采用说话者莱文斯坦距离与说话者条件化的GRPO策略训练了Writer-R1模型。在GroupMemBench、SocialMemBench和EverMemBench测试中,SpeakerMem-R1分别达到47.9%、69.2%和61.9%的二元准确率。在EverMind-AI发布的EverMemBench公开排行榜上,我们以62.33%的准确率超越所有最新框架。在作为两人长期对话边界测试的1,986个LoCoMo问题上,系统达到70.85%的准确率。在包含305个问题的受控评估中,强化学习将SFT Writer的平均准确率从57.38%提升至68.20%。我们同时报告二元准确率与token-F1分数,消融实验表明在标准化评估接口下,原始记录与结构化双轨、个人视角与群体视角具有显著互补性。

查看arXiv页面 (https://arxiv.org/abs/2609.26780) 查看PDF (https://arxiv.org/pdf/2609.26780) 项目页面 (https://2022hpsk.github.io/SpeakerMemR1/) GitHub仓库 (https://github.com/2022hpsk/SpeakerMemR1) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.26780)

在您的代理工具中获取此论文: hf papers read 2609.26780

尚未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型数量:0

暂无模型关联此论文

在模型的README.md中引用 arxiv.org/abs/2609.26780 即可从此页面关联

引用此论文的数据集数量:0

暂无数据集关联此论文

在数据集的README.md中引用 arxiv.org/abs/2609.26780 即可从此页面关联

引用此论文的Spaces数量:0

暂无Space关联此论文

在Space的README.md中引用 arxiv.org/abs/2609.26780 即可从此页面关联

收录此论文的合集数量:0

暂无合集收录此论文

将此论文添加到合集 (https://huggingface.co/new-collection) 即可从此页面关联

相似文章

T-Mem: 预见性记忆,而非归档式记忆

arXiv cs.CL

T-Mem 是一种新型长程对话记忆架构,能够同时支持描述性回忆和关联性回忆,涵盖查询与记忆共享表面特征的场景以及两者通过潜在语义弧相连的场景。该架构在 LoCoMo 和 LoCoMo-Plus 基准测试上达到了最先进水平。