SpeakerMem-R1:以说话者为中心的双轨记忆用于多方对话
摘要
本文提出 SpeakerMem-R1,一个以说话者为中心的双轨记忆系统,用于多方对话,解决了消息归属和关系理解的瓶颈。它在 EverMemBench 和 LoCoMo 等基准测试中取得了最先进的结果。
查看缓存全文
缓存时间: 2026/09/24 03:37
论文页面 - SpeakerMem-R1:面向多方对话的说话者中心双轨记忆系统
来源:https://huggingface.co/papers/2609.26780
摘要
多方对话场景下的长期对话记忆构建,不仅需要从历史对话中检索相关内容,还必须区分不同说话者的陈述内容、理解每个人物的关系网络、把握群体共享的信息结构,并追踪状态的动态演变。近期多方对话基准测试的研究表明,现有的通用大语言模型记忆系统容易丢失人物与群体关系,且难以整合分散在不同成员、群体和时间维度上的线索。这些局限揭示了两个核心瓶颈:多方对话中的信息溯源与关系理解,以及从交错历史中重建状态信息。为解决这些问题,我们提出SpeakerMem-R1系统:其双轨记忆结构同时存储带说话者标签的原始对话信息和按个人与群体维度组织的衍生状态信息,查询时通过实体、事件和时间三重维度整合双轨证据。为减少结构化记忆构建过程中的溯源与更新错误并支持本地部署,我们采用说话者莱文斯坦距离与说话者条件化的GRPO策略训练了Writer-R1模型。在GroupMemBench、SocialMemBench和EverMemBench测试中,SpeakerMem-R1分别达到47.9%、69.2%和61.9%的二元准确率。在EverMind-AI发布的EverMemBench公开排行榜上,我们以62.33%的准确率超越所有最新框架。在作为两人长期对话边界测试的1,986个LoCoMo问题上,系统达到70.85%的准确率。在包含305个问题的受控评估中,强化学习将SFT Writer的平均准确率从57.38%提升至68.20%。我们同时报告二元准确率与token-F1分数,消融实验表明在标准化评估接口下,原始记录与结构化双轨、个人视角与群体视角具有显著互补性。
查看arXiv页面 (https://arxiv.org/abs/2609.26780) 查看PDF (https://arxiv.org/pdf/2609.26780) 项目页面 (https://2022hpsk.github.io/SpeakerMemR1/) GitHub仓库 (https://github.com/2022hpsk/SpeakerMemR1) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.26780)
在您的代理工具中获取此论文:
hf papers read 2609.26780
尚未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型数量:0
暂无模型关联此论文
在模型的README.md中引用 arxiv.org/abs/2609.26780 即可从此页面关联
引用此论文的数据集数量:0
暂无数据集关联此论文
在数据集的README.md中引用 arxiv.org/abs/2609.26780 即可从此页面关联
引用此论文的Spaces数量:0
暂无Space关联此论文
在Space的README.md中引用 arxiv.org/abs/2609.26780 即可从此页面关联
收录此论文的合集数量:0
暂无合集收录此论文
将此论文添加到合集 (https://huggingface.co/new-collection) 即可从此页面关联
相似文章
VoiceMem: 用于实时交互的流式双脑记忆
VoiceMem为语音语言模型引入了一种双脑流式记忆架构,提高了检索准确性、情感个性化和实时效率。
CoreMem: 对话代理中长期记忆的黎曼检索与Fisher引导蒸馏
CoreMem提出了一种资源高效的边缘-云端内存架构,用于对话代理,采用基于Fisher-Rao度量的黎曼检索和Fisher引导的离散令牌蒸馏,在8 GB VRAM预算内实现了显著的准确性提升。
JustMem:长期对话中的适度内存访问
本文提出JustMem,一个通过平衡发现广度和读取保真度来适应长期对话的内存访问系统,用更少的令牌实现更高的准确性。
Cognis:面向对话式 AI 智能体的上下文感知记忆系统
Lyzr Cognis 推出统一开源记忆系统,融合 BM25 与 Matryoshka 向量搜索并支持版本感知写入,在 LoCoMo 与 LongMemEval 基准上实现 SOTA。
T-Mem: 预见性记忆,而非归档式记忆
T-Mem 是一种新型长程对话记忆架构,能够同时支持描述性回忆和关联性回忆,涵盖查询与记忆共享表面特征的场景以及两者通过潜在语义弧相连的场景。该架构在 LoCoMo 和 LoCoMo-Plus 基准测试上达到了最先进水平。