HEAR 谁说了什么:通过反事实语音锚定解锁说话人归属推理

arXiv cs.CL 论文

摘要

本文介绍了 HEAR,一个用于评估语音语言模型中说话人归属推理的基准测试,并提出了 A2R,一个使用反事实数据优化的 30B 模型,以提升在多说话人任务上的性能。

arXiv:2608.29120v1 Announce Type: new 摘要:语音语言模型(SLMs)越来越多地部署在多说话人环境中,但其将语音归因于正确说话人并推理说话人身份的能力仍不清楚。因此,我们介绍了 HEAR,一个概念层次化的基准测试,用于诊断说话人归属推理的基础能力,包含来自887个多样化多人音频剪辑的2.4K个经过人工验证的样本。在 HEAR 上评估20个领先的 SLMs 显示,它们在这些基础任务上挣扎,往往依赖语义先验而非实际的声学线索。为了解决这个问题,我们提出了 A2R,一个在反事实音频上使用说话人级别硬负样本(CASH)优化的 30B 模型,该数据集旨在指导模型优先考虑声学语音线索而非语言信号。A2R 在 HEAR 上表现出色,并在多样化的多说话人下游任务中展现出零样本泛化能力,表明学习到的说话人归属解锁了模型在说话人感知推理方面的潜在能力。所有资源可在 https://attributetoreason.github.io/AttributeToReason/ 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:17

# HEAR 谁说了什么:通过反事实语音定位解锁说话人属性推理
来源:https://arxiv.org/html/2608.29120
Sangkwon Park,隶属机构:首尔国立大学电子与计算机工程系  
Eunwoo Song,隶属机构:延世大学电气工程系  
Che Hyun Lee,隶属机构:首尔国立大学电子与计算机工程系  
Youngho Cho  
Junho Kim  
June Young Yi  
Heeseung Kim<sup>222</sup>通讯作者\.
Sungroh Yoon<sup>222</sup>通讯作者\.
隶属机构:首尔国立大学(SNU)IPAI  
隶属机构:首尔国立大学电子与计算机工程系  
隶属机构:首尔国立大学计算机科学与工程系  
隶属机构:首尔市立大学人工智能系  
隶属机构:首尔国立大学AIIS、ASRI、INMC及ISRC  
###### 摘要
语音语言模型(SLMs)越来越多地被部署在多说话人环境中,但它们将语音正确归因于说话人并基于说话人身份进行推理的能力仍不明确。因此,我们引入了**HEAR**,一个概念上呈层级结构的基准,用于诊断说话人属性推理的基础能力,包含来自887个多样化多方音频片段的2.4K个人工验证样本。在HEAR上对20个领先的SLMs进行评估显示,它们在这些基础任务上表现不佳,常常依赖语义先验而非实际的语音线索。为解决此问题,我们提出了**A2R**,这是一个在**CASH**数据集上优化的300亿参数模型。**CASH**是“带说话人级困难负样本的反事实音频”的简称,旨在引导模型优先考虑声学语音线索而非语言信号。A2R在HEAR上取得了强劲的性能,并展现出对多样化多说话人下游任务的零样本泛化能力,表明习得的说话人属性解锁了模型潜藏的说话人感知推理能力。所有资源均可在我们的[项目页面](https://attributetoreason.github.io/AttributeToReason/)获取。
<sup>22</sup>脚注:通讯作者。
## 1 引言
理解真实环境中的语音通常需要处理多说话人场景,其中多个声音同时存在并动态交互(Lee等人,2026年 [链接](https://arxiv.org/html/2608.29120#bib.bib1))。识别谁说了什么,这一任务通常被称为说话人归属(Kanda等人,2021年 [链接](https://arxiv.org/html/2608.29120#bib.bib42)),是任何多方场景下更高级理解或推理的基本前提。随着语音语言模型(SLMs)越来越多地被部署在多方环境中(Nguyen等人,2025年 [链接](https://arxiv.org/html/2608.29120#bib.bib41)),这一挑战变得至关重要。然而,先前的工作(Kumar等人,2025年 [链接](https://arxiv.org/html/2608.29120#bib.bib5);Sakshi等人,2024年 [链接](https://arxiv.org/html/2608.29120#bib.bib4))常常仅通过其下游任务来评估说话人归属,而没有直接测试支持它所需的基础能力。这使得难以定位模型实际失败的原因:它们是难以区分不同的声音,难以将话语正确归因于说话人,还是仅仅缺乏下游任务的推理能力?
为解决这一差距,我们引入了一个名为**HEAR**的基准,旨在评估SLMs中说话人属性推理所依赖的基础能力。HEAR植根于Erber的听觉层次理论(Erber, 1982 [链接](https://arxiv.org/html/2608.29120#bib.bib2)),该理论将人类的听觉理解组织为从感知辨别到识别及更高层次理解的递进过程。我们将其映射到三个维度:(i) **区分**,即区分不同声音身份的能力;(ii) **归属**,即将语言内容与特定声音身份绑定的能力;以及 (iii) **推理**,即基于说话人属性的话语进行基本推理的能力。通过镜像这种人类认知进程,我们提供了一个受生物学启发的分类法,以诊断SLMs的失败是源于低层次的声学感知还是高层次的语义推理。
该基准由887个真实世界音频片段和2.4K个人工验证的选择题问答对组成,涵盖了日常对话、会议和纪录片等多种真实世界声学环境。
我们在HEAR基准上的评估揭示了大多数领先SLMs的脆弱性。这些模型在基本归属任务上失败,并表现出对语义先验的过度依赖,在存在语义上下文时忽略了声学语音线索。为了缓解这种对语义的过度依赖,我们引入了**CASH**(Counterfactual Audio with Speaker-level Hard negatives,带说话人级困难负例的反事实音频),这是一个60K规模的语料库,涵盖了HEAR的所有任务维度,旨在将声学身份与语义内容解耦。通过使用语音克隆技术为特定话语替换说话人同时保留原始转录稿(图2 [链接](https://arxiv.org/html/2608.29120#S2.F2)-(A)),CASH生成了正确答案仅因语音线索而翻转的困难负例,从而迫使模型将预测基于声学证据而非文本先验。
基于此数据集,我们提出了**A2R**(Attribution-to-Reasoning,从属性到推理),这是一个从Qwen3-Omni-30B-A3B-Instruct(Xu等人,2025b [链接](https://arxiv.org/html/2608.29120#bib.bib19))优化而来的语音语言模型,通过群组相对策略优化(GRPO)(Shao等人,2024 [链接](https://arxiv.org/html/2608.29120#bib.bib3))进行训练,以加强说话人归属能力同时保留基础模型强大的内在推理能力。它在“转录优先”目标下训练:首先生成带说话人标签的转录稿,然后基于此进行推理。因此,A2R不仅在HEAR上表现出色,还在各种需要说话人归属的多说话人下游基准测试中展示了稳健的零样本迁移能力。这些结果表明,说话人归属不仅仅是一个辅助子任务,而是解决多方听觉理解中声学瓶颈的关键机制。通过明确迫使模型将话语基于语音线索进行定位,我们展示了在多说话人环境中可以激发模型的说话人属性推理能力。
我们的贡献总结如下:
(1) 我们提出了**HEAR**,一个包含2.4K个人工标注样本的基准,旨在评估说话人属性推理的基础能力。
(2) 我们揭示当前领先的SLMs在说话人属性推理中表现出*语义幻觉*,利用语言先验而非实际决定谁说了什么的语音线索。
(3) 我们提出了**CASH**,一个60K规模的数据集,旨在引导模型优先考虑语音线索而非语义内容。
(4) 我们介绍了**A2R**,一个采用“转录优先”目标训练的300亿参数模型,该目标奖励准确的转录稿再进行推理,从而在HEAR上取得显著改进,并在需要说话人归属的基准测试上获得迁移收益。
**图1:** HEAR基准说明。受Erber听觉层次理论(Erber, 1982 [链接](https://arxiv.org/html/2608.29120#bib.bib2))启发,HEAR将说话人属性推理分解为几个基础能力:区分、归属和推理。
## 2 HEAR 基准
在本节中,我们介绍**HEAR**,即属性与推理的层级评估基准,旨在评估SLMs中说话人属性推理所依赖的基础能力。该基准以选择题问答(MCQA)格式组织,其层级结构镜像了人类的听觉处理过程(Erber, 1982 [链接](https://arxiv.org/html/2608.29120#bib.bib2)),如图1([链接](https://arxiv.org/html/2608.29120#S1.F1))所示:(i) 区分,(ii) 归属,和 (iii) 推理。为分析重叠语音的影响,我们根据回答问题是否需要关注重叠语音片段来区分情况(附录B.3 [链接](https://arxiv.org/html/2608.29120#A2.SS3))。
### 2.1 分类体系
#### 2.1.1 区分
此维度评估区分不同声音身份并定位其时间边界的能力。
##### 声音基数(VC)
此任务评估模型确定给定音频片段中存在的唯一说话人总数的能力。作为说话人身份聚类的最基础层面,VC评估模型能否准确量化声学场景中的基础说话人群体。
##### 声音定位(VL)
给定目标说话人的参考音频片段,任务是识别目标说话人出现或缺席的时间区间。通过结合有声活动检测和缺席验证,此任务评估目标声音活动检测能力。
##### 声音变化检测(VCD)
此任务要求模型识别说话人转换点。对于非重叠语音样本,重点在于检测轮换边界;而对于重叠样本,任务涉及检测包含同时语音的时间区间。
#### 2.1.2 归属
此维度评估将语义内容与其相应声音身份在两个方向上绑定的能力:从文本到音频,以及从音频到文本。
##### 内容到声音归属(CVA)
给定转录的语句作为文本查询,模型必须从五个候选声音中识别对应的说话人。
##### 声音到内容归属(VCA)
在此任务中,模型获得参考声音的简短音频样本,必须识别五个文本候选中哪个是由该声音说出的。
#### 2.1.3 推理
此维度考察基本的*说话人属性推理*能力。每个推理项都是一个语义-幻觉对:每个原始片段与一个反事实变体配对,其中与答案相关的一段话语被另一位说话人的声音重新朗读,转录稿保持不变但正确答案翻转,因此声音盲模型必然在这一对上失败(第4节 [链接](https://arxiv.org/html/2608.29120#S4.SS0.SSS0.Px2))。
##### 身份推理(IR)
评估模型能否判断哪些话语是由同一人说出的。给定锚定话语(文本),模型必须识别出由同一说话人说出的另一段话语(文本)。
##### 时间推理(TR)
此任务评估模型基于说话人身份辨别时序关系和时间动态的能力。我们将此评估分解为两个粒度层级:(a) *说话人内时间排序*,要求模型浏览单个说话人的历史以发现该说话人的第一或最后一段话语;(b) *说话人间时间对齐*,评估通过将目标说话人的话语相对于不同说话人的锚定话语(例如,有人说‘X’之后,最先说‘Y’的人说了什么?)来对齐多个参与者时间线的能力。
##### 量化推理(QR)
此任务考察模型聚合每个说话人的话语统计信息以推断数值和比较关系的能力。我们通过两个子任务评估这一点:(a) *条件计数*,要求模型量化说出特定单词的不同说话人数量;(b) *序数排序*,评估根据累积说话时长对说话人进行排名并识别出总说话时长第k长的说话人(例如,“以下哪句话是由总说话时长第k长的说话人说出的?”)的能力。
### 2.2 基准构建
HEAR由约2.4K个源自887个音频片段的MCQA查询组成,总计约23小时的音频。片段平均长度约为93秒,最长为150秒。我们仅从AMI(Carletta等人,2005 [链接](https://arxiv.org/html/2608.29120#bib.bib6))、ICSI(Janin等人,2003 [链接](https://arxiv.org/html/2608.29120#bib.bib8))和VoxMM(Kwak等人,2024 [链接](https://arxiv.org/html/2608.29120#bib.bib7))的测试集划分中策划音频片段,这些片段已由人工标注了说话人分割和转录稿,确保在会议、日常对话、广播媒体和讲座等各种真实世界声学条件下具有可靠的说话人-语音对齐。每个片段平均包含4.05位说话人,所有样本由人工标注者根据回答问题是否需要关注重叠语音区域而被标注为重叠或非重叠(附录B.3 [链接](https://arxiv.org/html/2608.29120#A2.SS3))。
我们通过基于规则的管道生成查询,并由八位标注员进行了额外的手动验证。结果,HEAR中的每个项目都经历了两阶段的人工验证:首先在源数据集的构建期间,其次通过我们的额外验证过程,从而生成了一个具有高标注可靠性的高质量数据集。
**图2:** 我们关于说话人属性推理的数据集和方法概述。(A) 我们的数据集CASH通过语音克隆随机将话语重新分配给不同说话人,同时保留整个话语,生成正确答案始终翻转的反事实变体。(B) 我们展示了来自What Do You Like?基准(Wu等人,2024 [链接](https://arxiv.org/html/2608.29120#bib.bib9))的一个基本说话人归属任务,其中如果不识别谁说了什么,则查询无法解决。(C) 我们的模型首先转录多方音频场景,然后基于转录稿进行推理,以实现更可靠的说话人感知推理。
## 3 训练
### 3.1 动机
单模态坍塌,即模型过度依赖单一模态,长期以来一直是视觉-语言任务中公认的问题(Koishigarina等人,2026 [链接](https://arxiv.org/html/2608.29120#bib.bib15)),在语音领域也观察到了类似现象。最近的一项研究(Lee等人,2026 [链接](https://arxiv.org/html/2608.29120#bib.bib1))强调,SLMs经常表现出*语义幻觉*,绕过声学线索而偏好其文本先验,这是多方音频场景中说话人属性推理的一个关键瓶颈。基于语义合理性来判断“谁说了什么”可能暗示谁*可能*发言,但在任何参与者都可能发表任何言论的动态对话中会失败,因此需要优先考虑声学语音线索而非文本上下文来确定谁*实际*发言。
### 3.2 迫使模型依赖语音线索
为了鼓励模型将说话人归属建立在声学语音线索而非语义内容的基础上,我们引入了**CASH**(Counterfactual Audio with Speaker-level Hard negatives,带说话人级困难负例的反事实音频)。CASH是一个用于多方音频的60K规模数据集,涵盖了HEAR的所有任务维度。给定一个原始多说话人片段,我们通过使用不同说话人的声音转换版本替换目标话语来构建反事实变体,该转换保留*相同转录稿*,同时保持时间结构和其他语音内容(图2 [链接](https://arxiv.org/html/2608.29120#S2.F2)-(A))。我们基于VoxMM(Kwak等人,2024 [链接](https://arxiv.org/html/2608.29120#bib.bib7))的训练集构建,从多样化的音频场景中提取了约5.2K个真实世界音频片段。所有合成声音均使用VoxCPM2(Zhou等人,2026 [链接](https://arxiv.org/html/2608.29120#bib.bib52))生成,总计产生约20K个混合真实-合成音频片段和约60K个查询。详情请见附录A([链接](https://arxiv.org/html/2608.29120#A1))。
### 3.3 在推理前奖励归属
我们介绍了**A2R**(Attribution-to-Reasoning,从属性到推理),这是一个通过GRPO优化基线模型以增强说话人归属能力同时保持通用性能而开发的模型。通过将新获得的语音定位能力与其固有的推理

相似文章

Hear2Act:评估韵律何时应改变助手行为基准

arXiv cs.CL

本文介绍了Hear2Act,一个统一的基准,用于评估韵律线索如何影响任务导向对话的决策。研究发现,当词汇证据不足时,韵律很重要,并且音频LLM通过显式的动作关注表示能获益。

LaSR:基于潜在推理的上下文感知语音识别

arXiv cs.CL

LaSR提出了一种针对上下文感知语音识别的潜在推理训练范式,围绕声学特征对齐思维链监督,以在无额外延迟的情况下提高术语识别能力,在Fun-Audio-Chat上优于标准微调。