VoiceMem: 用于实时交互的流式双脑记忆
摘要
VoiceMem为语音语言模型引入了一种双脑流式记忆架构,提高了检索准确性、情感个性化和实时效率。
查看缓存全文
缓存时间: 2026/08/27 07:19
论文页面 - VoiceMem:面向实时交互的双脑流式记忆架构
来源:https://huggingface.co/papers/2608.26005
摘要
VoiceMem 引入了一种用于语音语言模型的双脑流式记忆架构,旨在提升检索精度、情感个性化和实时效率。
当前的对话系统,例如全双工语音语言模型 (https://huggingface.co/papers?q=duplex%20speech%20language%20models) (SLMs),仍然缺乏一个流式、精确且富有同理心的记忆系统作为其“灵魂”。我们推出了VoiceMem (https://huggingface.co/papers?q=VoiceMem),这是一个简洁的记忆架构,包含并行的信息左脑 (https://huggingface.co/papers?q=informational%20left%20brain)、情感右脑 (https://huggingface.co/papers?q=emotional%20right%20brain) 以及流式记忆I/O (https://huggingface.co/papers?q=streaming%20memory%20I%2FO) 机制。我们进一步构建了一个完整的管线,涵盖记忆感知的SLM训练、长周期评估以及采用可互换记忆后端的解耦部署。实验和实际部署展现了三大优势:i) 准确性:在 top-5 检索中,左脑的表现优于经典系统(如 Mem0 在 top-200 下的表现),提升近 30 个百分点;ii) 情感与个性化:右脑利用短周期和长周期的情感归因 (https://huggingface.co/papers?q=affective%20attribution) 与双节点角色建模 (https://huggingface.co/papers?q=dual-node%20persona%20modeling),在三个角色基准测试上达到最先进的性能,相比之前的最佳系统,综合分数提升了 4.29 分;iii) 实时且低成本:VoiceMem (https://huggingface.co/papers?q=VoiceMem) 的检索耗时仅 134 毫秒,远低于标准的VAD (https://huggingface.co/papers?q=VAD) 延迟,在保持高精度和低成本的同时,未增加额外的对话延迟。这些结果表明,VoiceMem (https://huggingface.co/papers?q=VoiceMem) 为实时、个性化且具备情感感知的语音交互提供了实用的记忆基础。
查看 arXiv 页面 (https://arxiv.org/abs/2608.26005)查看 PDF (https://arxiv.org/pdf/2608.26005)项目主页 (https://xzf-thu.github.io/VoiceMem/)GitHub 28 (https://github.com/xzf-thu/VoiceMem)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.26005)
通过您的代理获取此论文:
hf papers read 2608.26005
没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.26005 以从本页面链接到它。
引用此论文的数据集 0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.26005 以从本页面链接到它。
引用此论文的 Spaces 0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.26005 以从本页面链接到它。
包含此论文的收藏集 0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接到它。
相似文章
面向代理式语音识别的Voice Memory
Voice Memory提出了一种仅推理的方案,用于代理式语音识别:一个冻结的纠正器读取每个领域的记忆文件,为每个话语决定是采取行动还是放弃,从而在不更新权重的情况下降低多个领域的词错误率。
VoiceLongMemEval:AI助手能否记住你说话时的语音特征?
本文介绍了VoiceLongMemEval (VLME)基准,它评估AI助手在长期对话中记忆和推理语音副语言元数据(如情感和韵律)的能力,揭示了当前模型中存在的'情感差距'。
CoreMem: 对话代理中长期记忆的黎曼检索与Fisher引导蒸馏
CoreMem提出了一种资源高效的边缘-云端内存架构,用于对话代理,采用基于Fisher-Rao度量的黎曼检索和Fisher引导的离散令牌蒸馏,在8 GB VRAM预算内实现了显著的准确性提升。
EM^2Mem:面向大语言模型的事件中心多模态记忆
EM^2Mem 提出了一种事件中心的多模态记忆框架,该框架将异构证据绑定到事件锚点,为长视频问答提供紧凑、可生成的记忆,从而提高准确性并降低延迟。
参数化多模态用户记忆:存储文字描述无法传达的信息
本文介绍了一种参数化多模态用户记忆系统,通过整合语音和外貌等感知数据,利用视觉语言模型和专用编码器,提升AI智能体回忆用户的能力,从而超越基于文本的方法。