VoiceLongMemEval:AI助手能否记住你说话时的语音特征?
摘要
本文介绍了VoiceLongMemEval (VLME)基准,它评估AI助手在长期对话中记忆和推理语音副语言元数据(如情感和韵律)的能力,揭示了当前模型中存在的'情感差距'。
arXiv:2609.00570v1 公告类型:新
摘要:随着多智能体架构和大型语言模型规模的增长,部署的AI助手越来越多地负责推理长期、连续、多会话对话历史。当前基准将这种对话历史评估为跨长时间范围的信息检索、时间推理或知识更新,而忽略了人机交互的基本动态,即他们是如何说的。为解决这一差距,我们提出了VoiceLongMemEval (VLME)基准,其中每个答案都依赖于附在对话轮次上的副语言元数据(情感标签、韵律描述符和语音事件),这些数据仅从文字中无法恢复。每个项目都经过三阶段对抗性门控,确保仅给定转录文本时强大的语言模型会失败。评估领先的前沿和开放权重模型揭示了普遍存在的'情感差距';提供文本轨道副语言元数据可将准确率提高0.09至0.38(当提供证据提示时为0.61至0.69),而标准ASR管道系统性地丢弃这一信号。此外,音频原生模型成功直接从语音中提取这些线索(0.354至0.412 vs. 0.325盲测)。代码和数据集将在接受后提供。
查看缓存全文
缓存时间: 2026/09/02 06:06
# VoiceLongMemEval:助手能记住你的声音吗? 来源:https://arxiv.org/html/2609.00570 #### 摘要 随着多智能体架构和大型语言模型规模的扩大,部署中的AI助手越来越多地被赋予基于超长、连续、多会话对话历史进行推理的任务。现有基准测试将这些对话历史视为长期信息检索、时间推理或知识更新,但关键性地忽略了人机交互的基本动态——即“他们是如何说的”。为填补这一空白,我们提出了 VoiceLongMemEval (VLME) 基准测试。在此测试中,每个答案都依赖于附加在对话轮次上的副语言元数据(情感标签、韵律描述符和语音事件),而这些信息无法仅从文字本身恢复。每个测试项都经过三阶段对抗性验证,确保强大的语言模型在仅获得转录文本时也会失败。对领先的前沿和开放权重模型的评估揭示了一种普遍的“情感差距”:提供文本轨道上的副语言元数据可带来 +0.09 至 +0.38 的准确率提升(在提供证据提示时为 +0.61–0.69),而标准的自动语音识别管道系统性地丢弃了这些信号。此外,音频原生模型能够直接从语音中成功提取这些线索(0.354–0.412 vs. 0.325 盲解)。代码和数据集将在论文接受后公开。 ## 1 引言 用户用平淡的声音拖着叹息说:“那家餐厅还行吧”。几周和数十万token之后,他们问:*我那天对那家餐厅感觉如何?*回答所需的一切在编码时就已存在,但仅存在于表达方式中。文字是事实描述;悲伤是声音传达的。一个只会转录的助手会回答:“你觉得还行!”但只有关注情感的模型才会知道用户并不喜欢那家餐厅。尽管长期对话记忆(Maharana 等人,2024;Wu 等人,2025;Jiang 等人,2025;Wu 等人,2026)和副语言感知(Ao 等人,2024;Yang 等人,2024;Wang 等人,2025b)都已成为可衡量的能力,但这两个维度迄今为止只是被分开测试。它们的交集,即记住某事是如何表达的、跨会话保留、更新任何表达变化并在很久以后针对特定问题检索,是一个关键的跨模态维度,而现有基准测试缺乏对此的考量。为此,我们推出了 VoiceLongMemEval (VLME),一个填补此空白的基准测试。每个测试项都在对话会话的“大海捞针”中嵌入一个副语言“针”:答案只能从表达元数据中恢复,而永远无法仅从文字中得出,这通过第3节中描述的三部分对抗性验证来强制执行。我们的贡献如下: 1. 1\.VoiceLongMemEval (VLME) 基准测试:: 523 个经过对抗验证的测试项,涵盖六种问题类型,将副语言记忆分解为情感回忆、情感偏好、情感更新、跨会话情感、时间-情感推理和韵律消歧解释,每种类型都有弃权变体。 2. 2\.情感差距的系统性分析:: 我们评估了八个模型(三个专有模型,五个开放权重模型),揭示了所有系统中一致存在 +0.09 到 +0.38 的情感差距(所有 p < 0.001)。通过细粒度的组件消融和五层措辞谱分析,我们表明情感标签提供了最强的信号,思维链推理无法替代缺失的上下文,并且受控的反事实分析隔离出严格由元数据内容驱动的 +0.067 净准确率增益。 ## 2 相关工作 #### 长期对话记忆。 一系列新兴的基准测试探究助手是否能够跨会话保留和使用信息。MSC(Xu 等人,2022)建立了多会话环境,LoCoMo(Maharana 等人,2024)将其扩展到非常长的、基于角色的对话,并表明长上下文阅读和检索增强生成都远远落后于人类。LongMemEval(Wu 等人,2025)和 LongMemEval-V2(Wu 等人,2026)——我们直接在此基础上构建——在可自由扩展的“大海捞针”中嵌入精心设计的问题,将记忆分解为提取、多会话推理、时间推理、知识更新和弃权。后续的基准测试将这些评估范围扩大到包括个性化上下文和角色条件对话。PerLTQA(Du 等人,2024)侧重于社交互动和事件的长期记忆;MemBench(Tan 等人,2025)将记忆分为事实记忆和反思记忆;而 DialSim(Kim 等人,2024)评估智能体在脚本对话中进行角色扮演时回答自发问题的能力。另一类基准测试针对*隐性*信号:PrefEval(Zhao 等人,2025)显示偏好遵循度在仅几千个token后就降至10%以下,而 PersonaMem-v2(Jiang 等人,2025)发现前沿模型在隐性个性化方面的准确率仅为37-48%,即使证据仍在上下文线索内。最接近我们设定的是 A-BER(Wen 等人,2026),它要求模型根据长期的、多会话的交互历史推断用户的情绪状态。但是,其证据纯粹是词汇性的,即情感是*写在文字里*的。在整个这类基准测试中,被测试的记忆是*说了什么*的记忆,而不是*怎么说*的记忆。我们的基准测试试图通过增加音频组件来弥合这一差距。 #### 语音-LLM中的副语言理解。 互补的一系列工作评估音频语言模型是否根本感知非词汇线索。更广泛的音频评估基准,如 Dynamic-SUPERB(Huang 等人,2024)、AIR-Bench(Yang 等人,2024)、Audio2Tool(Pahwa 等人,2026)、AudioBench(Wang 等人,2025a)、MMAU(Sakshi 等人,2025)和 MMSU(Wang 等人,2026)等,在一般音频理解中包含了情感、韵律和说话者属性任务。其他基准测试超越了识别;SD-Eval(Ao 等人,2024)检查回复是否随说话者的情感、口音、年龄和背景噪音适当变化;CP-Bench(Wang 等人,2025b)针对野外数据的上下文副语言推理;而 S2S-Arena(Jiang 等人,2026)和 ParaS2S(Yang 等人,2026)评估语音到语音模型中的副语言指令遵循和回复适当性。这项工作建立在先前的情感计算工作(Busso 等人,2008;Poria 等人,2019;Castro 等人,2019)及其最近的基于LLM的后继工作(Xu 等人,2024;Lin 等人,2024)之上,但所有这些都仅在单次话语内测试感知。相比之下,VLME要求模型跨会话保留副语言信息:答案取决于约100k token之前的对话中某事是如何表达的。 #### 级联管道 vs. 音频原生管道。 生产中的语音助手在很大程度上仍然是级联的(ASR→LLM),这种设计在转录边界丢弃了韵律。音频原生模型,如 GPT-4o(Hurst 等人,2024)、Qwen2-Audio(Chu 等人,2024)、Qwen2.5-Omni(Xu 等人,2025)、Moshi(Défossez 等人,2024)和 GLM-4-Voice(Zeng 等人,2024),接受音频作为输入,并且原则上能感知和复现声音的细微差别。先前的级联与原生比较仅限于单轮理解(Ao 等人,2024;Wang 等人,2025b;Pahwa 等人,2026),然而,我们在*记忆*层面衡量了级联管道的副语言损失,其中在一个会话中被转录掉的线索会在数周后悄然破坏答案。最后,与先前的情感数据集不同,我们语料库中的每个测试项都通过了一个对抗性验证门,其中仅给定转录文本的强盲解模型必须*无法回答*该问题,以确保副语言通道是有效的,并且没有问题可以仅靠文字来回答。 ## 3 基准测试构建 Voice-LongMemEval 测试模型是否在话语发出很久后还能记住用户*如何*说话。其202个问题的、经过对抗性验证的核心集以及两个衍生系列,总计523个问题,嵌入在约100k token历史中的326个经过副语言标注的证据会话中(表1)。每个测试项都遵循一个不变式:正确答案可从副语言通道恢复,但无法仅从文字中得出。构建包含四个阶段:标注(第3.1节)、证据创作与加固(第3.2和3.3节)、问题生成(第3.4节)和语音合成(第5.6节)。 表1:基准测试组成。分类学问题使用完整的“大海”;细微和间接问题针对单个证据会话,但继承其源历史。 ### 3.1 副语言层 每个实例在保留与现有工具兼容性的同时,以可加方式扩展了 LongMemEval 兼容记录(Wu 等人,2025)。每个*用户*轮次有五个标注: * 一个来自涵盖效价-唤醒平面的12个日常标签的*情感*(Russell,1980)(*中性、快乐、兴奋、满足、悲伤、失望、焦虑、沮丧、生气、尴尬、无聊、深情*); * 一个涵盖语速、音高、音量、停顿和强调词(必须逐字出现在轮次中)的分类*韵律*元组; * 从五个可可靠合成的非语言声音中提取的*语音事件*(*笑声、叹息、咳嗽、清嗓子、喘息*); * 用于讽刺和不确定性的*语用标记*; * 以及一个自由文本的*表达方式描述*。 描述必须是*仅限声学的*:麦克风捕捉到的内容,而非解释。一个词汇门会拒绝情感名称、语调变化和约60种解释性描述(*释然、讽刺、嘲弄、...*);例如,“快速而轻快,句子中间笑了”可以通过,而“释然”则不能。因为描述会进入模型的文本输入,解释性标签会将任务简化为字符串匹配。该层有三种渲染模式: * *盲解*(仅转录文本,与原始文本字节一致); * *描述性*(转录文本加上声学舞台指示;也会提供一个结构化的*带标签*变体); * 以及*音频*(第5.6节)。 盲解渲染既是控制组,也是第3.3节中对抗者的视角。 ### 3.2 证据创作与大海捞针组装 一个LLM在14个主题批次中创作了4-12轮的证据会话(每个实例最多26个证据轮次)(两个试点,十二个16项批次)。一个协议强制执行了四个经过验证器检查的不变式:(i) 词汇平淡性(“针”读起来像中性的事实描述),(ii) 情感与语用的对立(尽可能让情感与事件的先验相反),(iii) 问题中立性(功能性、无涉效价的问题),以及 (iv) 标注一致性(每个用户轮次都被完全标注,因此标注的存在不能揭示“针”的位置)。对于一个有 *k* 个证据会话的实例,一个确定性的种子组装器添加了40个经过主题筛选的 LongMemEval 填充会话(带有合成的中性标注),以及6+2(*k*−1)个来自不相交的48会话池的情感性、无答案的干扰项;干扰项预算随 *k* 缩放以防止情感密度捷径。“针”的位置是分层的(早期/中期/后期),多证据弧线在时间上分布。语料库以*预言机*模式(仅证据,≤1k token)和*完整*模式(约100k token)发布,与 LongMemEval 保持一致。 ### 3.3 对抗性验证门 主要风险是*词汇泄露*:如果一个测试项可以仅从文本解决,那么它测量的就不是副语言记忆。我们通过三种方式审计每个分类学测试项: * **G1(盲解-不可解)**:一个对抗者回答盲解渲染,一个LLM评判员应用带有仅词汇答案作为明确陷阱的类型特定评分标准(Zheng 等人,2023);任何正确的盲解答案都视为失败。 * **G2(感知-可解)**:同一个模型回答描述性渲染;我们按求解器能力报告结果(而非验证门结果),因为失败可能反映模型局限。 * **G3(表面清理)**:对解释性术语、固定短语和效价预设进行静态检查。 我们与一个7B评判-对抗模型迭代,然后使用 Qwen2.5-72B-Instruct-AWQ 进行验证,要求在冻结的文件上连续两次通过清理运行以减少不确定性。72B盲解对抗者解出了8个(7.5%)通过7B验证门的测试项。事后分析确定了五种泄露机制——语用先验泄露、结果泄露、答案匹配先验、默认恢复先验和A/B礼物——现在这已成为一个检查清单;后续批次在创作阶段零泄露。我们在组装好的语料库上重新运行了最终验证门,因为日期/顺序变化可能影响边际判断。最终结果:175个非弃权分类学测试项中有0个可通过盲解解决,G3未标记任何项,72B感知-可解率为57.9%。衍生系列(第3.4节)没有单独进行盲解攻击;它们依赖于已通过验证门的证据会话和机械不变性检查。语料库探测增加了两个控制:按情感标注密度对会话进行排序,在13.1%的情况下找到了“针”(前1名;随机为3.3%),低于15%的预算,并且会话长度探测得分为0。 ### 3.4 问题生成 #### 分类学(202个)。六种类型分离了副语言记忆技能: * *情感回忆*(一个埋藏时刻表达的状态) * *情感偏好*(仅通过表达方式表达的状态所对应的一条规则) * *情感更新*(重复措辞但表达方式改变;最新的解读...
相似文章
VoiceMem: 用于实时交互的流式双脑记忆
VoiceMem为语音语言模型引入了一种双脑流式记忆架构,提高了检索准确性、情感个性化和实时效率。
SuperMemory-VQA: 一个面向长期记忆的自我中心视觉问答基准
SuperMemory-VQA 是一个新的自我中心VQA基准,包含52.9小时AI眼镜录像和4,853个问答对,旨在评估AI助手在长期记忆任务上的表现,涵盖物体回忆、意图、时间线和对话。基准测试显示,现有的智能体框架和大型语言模型在这些真实世界的记忆挑战上仍远未达到可靠水平。
MemLens:大规模视觉-语言模型中多模态长期记忆的基准测试
MemLens是一个新的基准测试,通过多轮对话评估大规模视觉-语言模型的记忆能力。它比较了长上下文和记忆增强方法,揭示了二者的局限性,并推动了混合架构的发展。
面向代理式语音识别的Voice Memory
Voice Memory提出了一种仅推理的方案,用于代理式语音识别:一个冻结的纠正器读取每个领域的记忆文件,为每个话语决定是采取行动还是放弃,从而在不更新权重的情况下降低多个领域的词错误率。
LongMemEval-V2:评估长期智能体记忆,迈向经验丰富的同事
本文介绍了 LongMemEval-V2,这是一个用于评估 Web 智能体长期记忆系统的基准,同时提出了两种记忆方法:AgentRunbook-R 和 AgentRunbook-C。