VoiceMem: 用于实时交互的流式双脑记忆

Hugging Face Daily Papers 论文

摘要

VoiceMem为语音语言模型引入了一种双脑流式记忆架构,提高了检索准确性、情感个性化和实时效率。

对话系统,如双工语音语言模型(SLMs),仍然缺乏一个流式、准确且富有同理心的记忆系统作为其核心。我们介绍了VoiceMem,这是一个简单的记忆架构,具有并行的信息左脑、情感右脑和流式记忆I/O机制。我们进一步构建了完整的流水线,用于记忆感知的SLM训练、长期评估和可更换记忆后端的解耦部署。实验和实际部署显示三个优势:i) 准确性:在top-5检索下,左脑在top-200上比经典系统如Mem0高出近30个点;ii) 情感与个性化:右脑通过短期和长期情感归因及双节点人格建模,在三个基准测试中实现了最先进的性能,并将总分提高了4.29分,超过之前最佳系统;iii) 实时与低成本:VoiceMem在134毫秒内完成检索,远低于标准VAD延迟,没有增加额外的对话延迟,同时保持高准确性和低成本。这些结果表明,VoiceMem为实时、个性化且情感感知的语音交互提供了实用的记忆基础。
查看原文
查看缓存全文

缓存时间: 2026/08/27 07:19

论文页面 - VoiceMem:面向实时交互的双脑流式记忆架构

来源:https://huggingface.co/papers/2608.26005

摘要

VoiceMem 引入了一种用于语音语言模型的双脑流式记忆架构,旨在提升检索精度、情感个性化和实时效率。

当前的对话系统,例如全双工语音语言模型 (https://huggingface.co/papers?q=duplex%20speech%20language%20models) (SLMs),仍然缺乏一个流式、精确且富有同理心的记忆系统作为其“灵魂”。我们推出了VoiceMem (https://huggingface.co/papers?q=VoiceMem),这是一个简洁的记忆架构,包含并行的信息左脑 (https://huggingface.co/papers?q=informational%20left%20brain)、情感右脑 (https://huggingface.co/papers?q=emotional%20right%20brain) 以及流式记忆I/O (https://huggingface.co/papers?q=streaming%20memory%20I%2FO) 机制。我们进一步构建了一个完整的管线,涵盖记忆感知的SLM训练、长周期评估以及采用可互换记忆后端的解耦部署。实验和实际部署展现了三大优势:i) 准确性:在 top-5 检索中,左脑的表现优于经典系统(如 Mem0 在 top-200 下的表现),提升近 30 个百分点;ii) 情感与个性化:右脑利用短周期和长周期的情感归因 (https://huggingface.co/papers?q=affective%20attribution) 与双节点角色建模 (https://huggingface.co/papers?q=dual-node%20persona%20modeling),在三个角色基准测试上达到最先进的性能,相比之前的最佳系统,综合分数提升了 4.29 分;iii) 实时且低成本:VoiceMem (https://huggingface.co/papers?q=VoiceMem) 的检索耗时仅 134 毫秒,远低于标准的VAD (https://huggingface.co/papers?q=VAD) 延迟,在保持高精度和低成本的同时,未增加额外的对话延迟。这些结果表明,VoiceMem (https://huggingface.co/papers?q=VoiceMem) 为实时、个性化且具备情感感知的语音交互提供了实用的记忆基础。

查看 arXiv 页面 (https://arxiv.org/abs/2608.26005)查看 PDF (https://arxiv.org/pdf/2608.26005)项目主页 (https://xzf-thu.github.io/VoiceMem/)GitHub 28 (https://github.com/xzf-thu/VoiceMem)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.26005)

通过您的代理获取此论文:

hf papers read 2608.26005

没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.26005 以从本页面链接到它。

引用此论文的数据集 0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.26005 以从本页面链接到它。

引用此论文的 Spaces 0

无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.26005 以从本页面链接到它。

包含此论文的收藏集 0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接到它。

相似文章

面向代理式语音识别的Voice Memory

arXiv cs.CL

Voice Memory提出了一种仅推理的方案,用于代理式语音识别:一个冻结的纠正器读取每个领域的记忆文件,为每个话语决定是采取行动还是放弃,从而在不更新权重的情况下降低多个领域的词错误率。