自监督语音识别模型中的说话人群体编码
摘要
研究自监督语音识别模型如何跨层编码说话人群体信息(性别、年龄、方言、民族、母语者状态),以及针对ASR或说话人识别等任务的微调如何影响这种编码。
arXiv:2606.10654v1 公告类型:新
摘要:我们研究了自监督语音识别模型(S3Ms)关于说话人群体(SGs)的学习内容。我们考察了S3Ms的几种状态:预训练、微调于说话人识别(SID)、微调于自动语音识别(ASR)、以及使用公平性增强算法微调于ASR。我们发现S3Ms编码了关于多个说话人群体类别(SGCs)的信息,包括性别、年龄、方言、民族以及是否是母语者。我们发现,针对SID的微调会放大某些SGCs,即那些变异更具语音性质的类别,但不会放大其他SGCs,即那些变异更具语义性质的类别。另一方面,针对ASR的微调会丢弃语音变异的说话人群体信息(SGI),但保留语义变异的SGI。我们发现,为提升公平性而设计的ASR算法会改变SGI在S3Ms中的编码程度;然而,这主要适用于语音变异的SGCs,而对语义变异的SGCs影响较小。我们讨论了SGI如何被每一层编码,并识别了负责编码不同SGCs的嵌入子维度。最后,我们讨论了我们的发现如何有助于设计更公平的ASR算法。
查看缓存全文
缓存时间: 2026/06/10 06:12
# 自监督语音识别模型中的说话人群体编码 来源:https://arxiv.org/html/2606.10654 Felix Herron¹,²&Solange Rossato²&Alexandre Allauzen¹&Benoit Favre²,³&François Portet² MILES团队,LAMSADE实验室,巴黎多芬纳-巴黎文理研究大学,法国(¹) GETALP团队,LIG实验室,格勒诺布尔阿尔卑斯大学,法国(²) NLP团队,LIS实验室,艾克斯-马赛大学,法国(³) [email protected] ###### 摘要 我们探究了自监督语音识别模型(S3Ms)对说话人群体(SGs)的编码情况。我们考察了S3Ms的几种状态:预训练后、在说话人识别(SID)上微调后、在自动语音识别(ASR)上微调后,以及使用一种增强公平性的算法进行ASR微调后。我们发现S3Ms编码了多个说话人群体类别(SGCs)的信息,包括性别、年龄、方言、种族以及是否为母语者。我们还发现,针对SID的微调会放大某些SGCs,特别是那些方差更偏向语音性质的SGCs,但不会放大其他方差更偏向语义性质的SGCs。另一方面,针对ASR的微调会丢弃具有语音变异的说话人群体信息(SGI),但保留具有语义变异的SGI。我们还发现,旨在提升公平性的ASR算法会改变SGI在S3Ms中的编码程度;然而,这主要适用于具有语音变异的SGCs,而对具有语义变异的SGCs影响较小。我们讨论了SGI在每个层中的编码方式,并识别出负责编码不同SGCs的嵌入子维度。最后,我们讨论了这些发现如何对设计更公平的ASR算法有所裨益。 ## 1 引言 自监督语音编码器模型(S3Ms)是许多语音相关下游任务的流行骨干工具。它们特别多功能,因为它们在预训练期间学习任务无关的嵌入,而预训练仅需纯音频数据。预训练期间学到的丰富嵌入可以与轻量级下游模型配对,将S3M微调到特定的下游任务,如自动语音识别(ASR)或说话人识别(SID)等[30 (https://arxiv.org/html/2606.10654#bib.bib116)]。这些轻量级下游模型学习从S3M的潜在输出空间映射到下游任务空间。 大量研究表明,S3Ms在某些说话人群体(SGs)上的下游任务表现优于其他群体。例如,非母语者被ASR系统理解得较差[10 (https://arxiv.org/html/2606.10654#bib.bib123),29 (https://arxiv.org/html/2606.10654#bib.bib79),23 (https://arxiv.org/html/2606.10654#bib.bib112)];各种语言的非标准方言也是如此[10 (https://arxiv.org/html/2606.10654#bib.bib123),23 (https://arxiv.org/html/2606.10654#bib.bib112),13 (https://arxiv.org/html/2606.10654#bib.bib118),14 (https://arxiv.org/html/2606.10654#bib.bib98),13 (https://arxiv.org/html/2606.10654#bib.bib118)],同样的情况也发生在非常年轻和非常年长的说话人身上[10 (https://arxiv.org/html/2606.10654#bib.bib123),23 (https://arxiv.org/html/2606.10654#bib.bib112)]。这些观察结果支持了一个假设,即S3Ms对不同SGs的话语进行了不同建模。本文探讨了这些差异如何在S3M逐层处理话语的过程中得以体现。我们分析了在不同模型架构的每一层中,哪些类型的说话人群体信息(SGI)是存在的,以及随着模型微调,这种SGI的存在性如何变化。我们还分析了SGI的神经元级表示,并讨论了SGI如何在潜在嵌入维度上分布。本文聚焦于S3Ms的可解释性,虽然我们没有基于工作提供具体的公平性提升算法,但我们基于结果提出了未来在公平性提升方面可能的研究方向。 ## 2 相关工作 ### 2.1 S3M可解释性 基于Transformer的语音S3M嵌入的性质自2021年问世以来就一直在研究中[2 (https://arxiv.org/html/2606.10654#bib.bib135)]。例如,它们在SUPERB(英语)或LeBenchmark(法语)等基准测试中被使用,并被证明能够无需微调或经过微调解决任意数量的语音相关任务[30 (https://arxiv.org/html/2606.10654#bib.bib116),8 (https://arxiv.org/html/2606.10654#bib.bib72)]。在文献[3 (https://arxiv.org/html/2606.10654#bib.bib137)]中,作者分析了哪些层在各种下游任务上表现最佳,表明早期层通常包含更多与说话人身份相关的任务信息(如SID或说话人日志),而后期层更适合语义性更强的任务(如ASR或意图分类)。在此基础上,[18 (https://arxiv.org/html/2606.10654#bib.bib124)]和[22 (https://arxiv.org/html/2606.10654#bib.bib5)]表明语音信息在中间层达到峰值,而单词身份信息在后期层达到峰值。此外,他们还展示了S3Ms可以被视为自动编码器,后期层学习到的特征与初始层相似(鉴于S3M重建性预训练目标通常是针对掩码输入子序列的交叉熵或对比损失[28 (https://arxiv.org/html/2606.10654#bib.bib20)]),不过这种趋势在ASR微调后消失。[19 (https://arxiv.org/html/2606.10654#bib.bib125)]表明,使用CNN作为声学特征提取器(例如,而不是梅尔滤波器组系数MFC)的S3Ms,最终学习到的表示仍然类似于MFC。他们还显示,根据预训练目标的不同,不同模型将音素/单词信息存储在不同的层。[4 (https://arxiv.org/html/2606.10654#bib.bib97)]表明S3Ms编码了词义的一些语义信息,尽管远少于其编码的原始语音内容。 也有关于说话人层级逐层可解释性的研究。例如,[32 (https://arxiv.org/html/2606.10654#bib.bib8)]表明,为ASR微调的S3Ms在早期层实现了高SID性能,但在最后几层几乎完全丧失。此外,[15 (https://arxiv.org/html/2606.10654#bib.bib93)]表明说话人信息与音素信息在S3M的中间表示中是正交存储的,而[16 (https://arxiv.org/html/2606.10654#bib.bib35)]提供了一种方法,可以定量比较不同类型信息(如说话人信息与音素信息)的正交性。[9 (https://arxiv.org/html/2606.10654#bib.bib105)]表明,S3M嵌入中的静默部分比实际语音部分包含更多说话人信息,并且人为地在话语中添加静默可以提升S3M对该话语说话人建模的能力。 我们强调SID与SG识别(SGID)之间的一个关键区别——前者涉及学习识别一组固定的说话人,而后者必须泛化到未知的说话人。有鉴于此,高SID性能并不一定能泛化到高SGID性能。在SGID方面的研究相对较少——许多公开可用的语音语料库包含的元数据类别要么很少,要么标签不一致,因此研究起来具有挑战性。一个有一定研究进展的案例是阿拉伯方言识别[24 (https://arxiv.org/html/2606.10654#bib.bib14)]。因此,这项工作与我们的研究有一定关联,不过阿拉伯语不同方言之间的差异远大于英语方言之间的差异,而且这种差异通常更多是基于词汇而非语音的[1 (https://arxiv.org/html/2606.10654#bib.bib106)]。 ## 3 方法 S3M将一个话语处理为其长度对应的一序列离散化声学嵌入,并生成一序列相应的丰富嵌入,每个离散化单元对应一个。[26 (https://arxiv.org/html/2606.10654#bib.bib82)]表明,对话语的所有嵌入取平均值会产生一个固定长度的向量,其中包含与说话人身份相关的信息。这合乎逻辑,因为对所有嵌入取平均应该会抵消局部语音信息,并放大全局话语级别的信息。我们实验了几种池化策略,类似于[9 (https://arxiv.org/html/2606.10654#bib.bib105)],通过对帧嵌入的子序列取平均值。我们实验了五种子序列:第一帧、前50帧(对应一秒音频)、最后一帧、最后50帧(即最后一秒音频),以及整个序列。我们对每个模型的每一层计算这些池化后的嵌入。 为了测试SGI,我们首先尝试了线性探针,如SUPERB基准测试中为SID任务提出的方法[30 (https://arxiv.org/html/2606.10654#bib.bib116)]。这些探针采用单个线性层的形式:\(M_{SGC} \in \mathbb{R}^{d_M, |SGC|}\),其中\(d_M\)是每个模型嵌入的大小(即对于large S3M配置为1024),\(|SGC|\)是SGC中的类别数(例如性别为2¹)。然而,我们注意到我们的探针倾向于在训练集中的说话人上过度拟合,导致SGID在训练集和测试集之间的性能差异巨大。(这正是SGI与SID根本差异的体现!)。我们的探针不仅学习了通用的SG特征,还学习将特定说话人映射到SG类别。为了抵消这一点,我们将探针分为两层(见公式1):一个投影层\(M_P\),具有较小的潜在维度\(d_P\)(即5),以及一个分类层\(M_C\),其中\(M_P \in \mathbb{R}^{d_M, d_P}\),\(M_C \in \mathbb{R}^{d_P, |SGC|}\)。然后我们学习从此层出发的两个线性连接:1)如前的SG分类层,以及2)一个说话人识别层,我们使用反向梯度层[11 (https://arxiv.org/html/2606.10654#bib.bib146)]对其进行训练。这迫使中间层对说话人识别具有不变性,并防止说话人过拟合。我们首先预热所有三层直至收敛(不将反向梯度传播到\(M_P\)),然后添加梯度反转并训练直至第二次收敛,如[32 (https://arxiv.org/html/2606.10654#bib.bib8)]所述。 来自投影层的低维中间嵌入包含了可以学习SG分类器的嵌入;因此,这些中间嵌入可以看作是在SGC空间上的投影。这种双层探针并没有给我们的探针过程增加复杂性,因为我们在\(M_P\)和\(M_C\)之间没有使用非线性激活函数²。 \[\begin{align} \text{M}_{SGC}(u) &:= M_C M_P(u) \quad (\in \mathbb{R}^{|SGC|}) \tag{1} \\ \text{M}_{\text{SID}, SGC}(u_1, u_2) &:= M_{SID} M_P(u) \quad (\in \mathbb{R}^{|\text{speakers}|}) \tag{2} \end{align}\] 在本文的实验中,我们使用了\(d_P = 5\),尽管我们实验了\(5 \in [5, 10, 50]\)并发现了类似的结果。 ### 3.1 自监督语音编码器模型(S3Ms) 我们分析了两种主要S3M架构——Wav2Vec 2.0 (W2V2) 和 WavLM 的能力。我们选择了这些模型的完全开源检查点,因此我们可以根据其架构和训练数据进行比较。我们使用W2V2,因为它是第一个在S3M语音建模中使用Transformer架构的模型,并且至今仍是最广泛使用的[2 (https://arxiv.org/html/2606.10654#bib.bib135),28 (https://arxiv.org/html/2606.10654#bib.bib20)]。此外,Hugging Face上多种W2V2配置的开源权重可访问性极大地便利了我们的分析[2 (https://arxiv.org/html/2606.10654#bib.bib135)]。我们还分析了WavLM。它不仅是在SUPERB基准测试中表现最佳的开源模型;其预训练方式也使其成为编码SGI的良好先验候选。首先,在预训练期间它使用重建损失而不是W2V2的对比损失,这受HuBERT启发[12 (https://arxiv.org/html/2606.10654#bib.bib67)]。这种能够再现初始信号基本信息的要求可能使WavLM更倾向于存储SGI。(先前工作表明预训练目标在S3Ms捕获的信息中起着重要作用[5 (https://arxiv.org/html/2606.10654#bib.bib115)])。其次,WavLM在预训练中使用了额外的语音混合步骤,旨在增强嵌入的说话人特定信息[3 (https://arxiv.org/html/2606.10654#bib.bib137)]。WavLM预训练涉及在训练过程中随机叠加不相关的音频以模拟嘈杂的说话环境,因此模型必须学会区分不同的音频源,从而可能学会更好地对SGs进行建模。 我们的大部分实验在S3Ms的large配置上进行。这允许我们标准化模型大小(24个隐藏层,隐藏层大小1024,约3亿可训练参数)。我们还实验了WavLM的base配置(约1亿参数)。这将使我们能够确定large模型大小是否是建模SGI的前提条件。 为了最大可比性,我们聚焦于在LibriVox(LibriLight,VoxPopuli)版本上训练的模型,WavLM模型和W2V2-lv60正是这种情况。不过,我们也比较了53语言的W2V2-XLSR-53。这将使我们能够评估多样化预训练数据在某些SGID任务中的重要性。 ### 3.2 微调 除了模型架构,我们还在仅预训练模型与预训练并微调模型之间进行了实验变化。我们探究了针对ASR或SID的微调过程是导致模型存储SGI还是相反。我们还实验了域对抗训练(DAT)和域增强训练(DET)的微调变体,这两种方法已知能改善整体转录性能[32 (https://arxiv.org/html/2606.10654#bib.bib8)]以及公平性[13 (https://arxiv.org/html/2606.10654#bib.bib118)]。DET训练的工作原理是在任意给定的Transformer层(通常是中间层)上附加一个额外的SG分类器,以强制中间层在微调期间保留说话人信息。DAT训练的工作方式相反,通过在后期层上放置一个SG分类器,并采用反向梯度更新规则,强制模型在ASR之前学习说话人无关的表示。这与我们在上一节中用于训练说话人不变性探针的策略相同。 根据[32 (https://arxiv.org/html/2606.10654#bib.bib8)],我们使用说话人ID作为多类目标中的类别,对于large模型,DET分类器放在第10层,DAT分类器放在第21层;对于base模型,分别放在第5层和第9层。对于我们的SID分类器,我们基于每一层的激活训练一个xvector[25 (https://arxiv.org/html/2606.10654#bib.bib140)],这是一种已被证明能有效捕获说话人信息的架构³。我们还在实验中使用了线性分类器,但发现它在擦除对抗层中的SGI方面效果较差。这可能是因为嵌入空间中说话人身份的维度大于一,因此需要一个能够建模更高维表示的 ¹为简单起见,本文假设两种性别。 ²我们实验了带ReLU激活的两层MLP,发现SGI检测没有显著改善。 ³说话人识别分类器。# 自监督语音识别模型中的说话人群体编码 来源:https://arxiv.org/html/2606.10654 Felix Herron¹,²&Solange Rossato²&Alexandre Allauzen¹&Benoit Favre²,³&François Portet² MILES团队,LAMSADE实验室,巴黎多芬纳-巴黎文理研究大学,法国(¹) GETALP团队,LIG实验室,格勒诺布尔阿尔卑斯大学,法国(²) NLP团队,LIS实验室,艾克斯-马赛大学,法国(³) [email protected] ###### 摘要 我们探究了自监督语音识别模型(S3Ms)对说话人群体(SGs)的编码情况。我们考察了S3Ms的几种状态:预训练后、在说话人识别(SID)上微调后、在自动语音识别(ASR)上微调后,以及使用一种增强公平性的算法进行ASR微调后。我们发现S3Ms编码了多个说话人群体类别(SGCs)的信息,包括性别、年龄、方言、种族以及是否为母语者。我们还发现,针对SID的微调会放大某些SGCs,特别是那些方差更偏向语音性质的SGCs,但不会放大其他方差更偏向语义性质的SGCs。另一方面,针对ASR的微调会丢弃具有语音变异的说话人群体信息(SGI),但保留具有语义变异的SGI。我们还发现,旨在提升公平性的ASR算法会改变SGI在S3Ms中的编码程度;然而,这主要适用于具有语音变异的SGCs,而对具有语义变异的SGCs影响较小。我们讨论了SGI在每个层中的编码方式,并识别出负责编码不同SGCs的嵌入子维度。最后,我们讨论了这些发现如何对设计更公平的ASR算法有所裨益。 ## 1 引言 自监督语音编码器模型(S3Ms)是许多语音相关下游任务的流行骨干工具。它们特别多功能,因为它们在预训练期间学习任务无关的嵌入,而预训练仅需纯音频数据。预训练期间学到的丰富嵌入可以与轻量级下游模型配对,将S3M微调到特定的下游任务,如自动语音识别(ASR)或说话人识别(SID)等[30 (https://arxiv.org/html/2606.10654#bib.bib116)]。这些轻量级下游模型学习从S3M的潜在输出空间映射到下游任务空间。 大量研究表明,S3Ms在某些说话人群体(SGs)上的下游任务表现优于其他群体。例如,非母语者被ASR系统理解得较差[10 (https://arxiv.org/html/2606.10654#bib.bib123),29 (https://arxiv.org/html/2606.10654#bib.bib79),23 (https://arxiv.org/html/2606.10654#bib.bib112)];各种语言的非标准方言也是如此[10 (https://arxiv.org/html/2606.10654#bib.bib123),23 (https://arxiv.org/html/2606.10654#bib.bib112),13 (https://arxiv.org/html/2606.10654#bib.bib118),14 (https://arxiv.org/html/2606.10654#bib.bib98),13 (https://arxiv.org/html/2606.10654#bib.bib118)],同样的情况也发生在非常年轻和非常年长的说话人身上[10 (https://arxiv.org/html/2606.10654#bib.bib123),23 (https://arxiv.org/html/2606.10654#bib.bib112)]。这些观察结果支持了一个假设,即S3Ms对不同SGs的话语进行了不同建模。本文探讨了这些差异如何在S3M逐层处理话语的过程中得以体现。我们分析了在不同模型架构的每一层中,哪些类型的说话人群体信息(SGI)是存在的,以及随着模型微调,这种SGI的存在性如何变化。我们还分析了SGI的神经元级表示,并讨论了SGI如何在潜在嵌入维度上分布。本文聚焦于S3Ms的可解释性,虽然我们没有基于工作提供具体的公平性提升算法,但我们基于结果提出了未来在公平性提升方面可能的研究方向。 ## 2 相关工作 ### 2.1 S3M可解释性 基于Transformer的语音S3M嵌入的性质自2021年问世以来就一直在研究中[2 (https://arxiv.org/html/2606.10654#bib.bib135)]。例如,它们在SUPERB(英语)或LeBenchmark(法语)等基准测试中被使用,并被证明能够无需微调或经过微调解决任意数量的语音相关任务[30 (https://arxiv.org/html/2606.10654#bib.bib116),8 (https://arxiv.org/html/2606.10654#bib.bib72)]。在文献[3 (https://arxiv.org/html/2606.10654#bib.bib137)]中,作者分析了哪些层在各种下游任务上表现最佳,表明早期层通常包含更多与说话人身份相关的任务信息(如SID或说话人日志),而后期层更适合语义性更强的任务(如ASR或意图分类)。在此基础上,[18 (https://arxiv.org/html/2606.10654#bib.bib124)]和[22 (https://arxiv.org/html/2606.10654#bib.bib5)]表明语音信息在中间层达到峰值,而单词身份信息在后期层达到峰值。此外,他们还展示了S3Ms可以被视为自动编码器,后期层学习到的特征与初始层相似(鉴于S3M重建性预训练目标通常是针对掩码输入子序列的交叉熵或对比损失[28 (https://arxiv.org/html/2606.10654#bib.bib20)]),不过这种趋势在ASR微调后消失。[19 (https://arxiv.org/html/2606.10654#bib.bib125)]表明,使用CNN作为声学特征提取器(例如,而不是梅尔滤波器组系数MFC)的S3Ms,最终学习到的表示仍然类似于MFC。他们还显示,根据预训练目标的不同,不同模型将音素/单词信息存储在不同的层。[4 (https://arxiv.org/html/2606.10654#bib.bib97)]表明S3Ms编码了词义的一些语义信息,尽管远少于其编码的原始语音内容。 也有关于说话人层级逐层可解释性的研究。例如,[32 (https://arxiv.org/html/2606.10654#bib.bib8)]表明,为ASR微调的S3Ms在早期层实现了高SID性能,但在最后几层几乎完全丧失。此外,[15 (https://arxiv.org/html/2606.10654#bib.bib93)]表明说话人信息与音素信息在S3M的中间表示中是正交存储的,而[16 (https://arxiv.org/html/2606.10654#bib.bib35)]提供了一种方法,可以定量比较不同类型信息(如说话人信息与音素信息)的正交性。[9 (https://arxiv.org/html/2606.10654#bib.bib105)]表明,S3M嵌入中的静默部分比实际语音部分包含更多说话人信息,并且人为地在话语中添加静默可以提升S3M对该话语说话人建模的能力。 我们强调SID与SG识别(SGID)之间的一个关键区别——前者涉及学习识别一组固定的说话人,而后者必须泛化到未知的说话人。有鉴于此,高SID性能并不一定能泛化到高SGID性能。在SGID方面的研究相对较少——许多公开可用的语音语料库包含的元数据类别要么很少,要么标签不一致,因此研究起来具有挑战性。一个有一定研究进展的案例是阿拉伯方言识别[24 (https://arxiv.org/html/2606.10654#bib.bib14)]。因此,这项工作与我们的研究有一定关联,不过阿拉伯语不同方言之间的差异远大于英语方言之间的差异,而且这种差异通常更多是基于词汇而非语音的[1 (https://arxiv.org/html/2606.10654#bib.bib106)]。 ## 3 方法 S3M将一个话语处理为其长度对应的一序列离散化声学嵌入,并生成一序列相应的丰富嵌入,每个离散化单元对应一个。[26 (https://arxiv.org/html/2606.10654#bib.bib82)]表明,对话语的所有嵌入取平均值会产生一个固定长度的向量,其中包含与说话人身份相关的信息。这合乎逻辑,因为对所有嵌入取平均应该会抵消局部语音信息,并放大全局话语级别的信息。我们实验了几种池化策略,类似于[9 (https://arxiv.org/html/2606.10654#bib.bib105)],通过对帧嵌入的子序列取平均值。我们实验了五种子序列:第一帧、前50帧(对应一秒音频)、最后一帧、最后50帧(即最后一秒音频),以及整个序列。我们对每个模型的每一层计算这些池化后的嵌入。 为了测试SGI,我们首先尝试了线性探针,如SUPERB基准测试中为SID任务提出的方法[30 (https://arxiv.org/html/2606.10654#bib.bib116)]。这些探针采用单个线性层的形式:\(M_{SGC} \in \mathbb{R}^{d_M, |SGC|}\),其中\(d_M\)是每个模型嵌入的大小(即对于large S3M配置为1024),\(|SGC|\)是SGC中的类别数(例如性别为2¹)。然而,我们注意到我们的探针倾向于在训练集中的说话人上过度拟合,导致SGID在训练集和测试集之间的性能差异巨大。(这正是SGI与SID根本差异的体现!)。我们的探针不仅学习了通用的SG特征,还学习将特定说话人映射到SG类别。为了抵消这一点,我们将探针分为两层(见公式1):一个投影层\(M_P\),具有较小的潜在维度\(d_P\)(即5),以及一个分类层\(M_C\),其中\(M_P \in \mathbb{R}^{d_M, d_P}\),\(M_C \in \mathbb{R}^{d_P, |SGC|}\)。然后我们学习从此层出发的两个线性连接:1)如前的SG分类层,以及2)一个说话人识别层,我们使用反向梯度层[11 (https://arxiv.org/html/2606.10654#bib.bib146)]对其进行训练。这迫使中间层对说话人识别具有不变性,并防止说话人过拟合。我们首先预热所有三层直至收敛(不将反向梯度传播到\(M_P\)),然后添加梯度反转并训练直至第二次收敛,如[32 (https://arxiv.org/html/2606.10654#bib.bib8)]所述。 来自投影层的低维中间嵌入包含了可以学习SG分类器的嵌入;因此,这些中间嵌入可以看作是在SGC空间上的投影。这种双层探针并没有给我们的探针过程增加复杂性,因为我们在\(M_P\)和\(M_C\)之间没有使用非线性激活函数²。 \[\begin{align} \text{M}_{SGC}(u) &:= M_C M_P(u) \quad (\in \mathbb{R}^{|SGC|}) \tag{1} \\ \text{M}_{\text{SID}, SGC}(u_1, u_2) &:= M_{SID} M_P(u) \quad (\in \mathbb{R}^{|\text{speakers}|}) \tag{2} \end{align}\] 在本文的实验中,我们使用了\(d_P = 5\),尽管我们实验了\(5 \in [5, 10, 50]\)并发现了类似的结果。 ### 3.1 自监督语音编码器模型(S3Ms) 我们分析了两种主要S3M架构——Wav2Vec 2.0 (W2V2) 和 WavLM 的能力。我们选择了这些模型的完全开源检查点,因此我们可以根据其架构和训练数据进行比较。我们使用W2V2,因为它是第一个在S3M语音建模中使用Transformer架构的模型,并且至今仍是最广泛使用的[2 (https://arxiv.org/html/2606.10654#bib.bib135),28 (https://arxiv.org/html/2606.10654#bib.bib20)]。此外,Hugging Face上多种W2V2配置的开源权重可访问性极大地便利了我们的分析[2 (https://arxiv.org/html/2606.10654#bib.bib135)]。我们还分析了WavLM。它不仅是在SUPERB基准测试中表现最佳的开源模型;其预训练方式也使其成为编码SGI的良好先验候选。首先,在预训练期间它使用重建损失而不是W2V2的对比损失,这受HuBERT启发[12 (https://arxiv.org/html/2606.10654#bib.bib67)]。这种能够再现初始信号基本信息的要求可能使WavLM更倾向于存储SGI。(先前工作表明预训练目标在S3Ms捕获的信息中起着重要作用[5 (https://arxiv.org/html/2606.10654#bib.bib115)])。其次,WavLM在预训练中使用了额外的语音混合步骤,旨在增强嵌入的说话人特定信息[3 (https://arxiv.org/html/2606.10654#bib.bib137)]。WavLM预训练涉及在训练过程中随机叠加不相关的音频以模拟嘈杂的说话环境,因此模型必须学会区分不同的音频源,从而可能学会更好地对SGs进行建模。 我们的大部分实验在S3Ms的large配置上进行。这允许我们标准化模型大小(24个隐藏层,隐藏层大小1024,约3亿可训练参数)。我们还实验了WavLM的base配置(约1亿参数)。这将使我们能够确定large模型大小是否是建模SGI的前提条件。 为了最大可比性,我们聚焦于在LibriVox(LibriLight,VoxPopuli)版本上训练的模型,WavLM模型和W2V2-lv60正是这种情况。不过,我们也比较了53语言的W2V2-XLSR-53。这将使我们能够评估多样化预训练数据在某些SGID任务中的重要性。 ### 3.2 微调 除了模型架构,我们还在仅预训练模型与预训练并微调模型之间进行了实验变化。我们探究了针对ASR或SID的微调过程是导致模型存储SGI还是相反。我们还实验了域对抗训练(DAT)和域增强训练(DET)的微调变体,这两种方法已知能改善整体转录性能[32 (https://arxiv.org/html/2606.10654#bib.bib8)]以及公平性[13 (https://arxiv.org/html/2606.10654#bib.bib118)]。DET训练的工作原理是在任意给定的Transformer层(通常是中间层)上附加一个额外的SG分类器,以强制中间层在微调期间保留说话人信息。DAT训练的工作方式相反,通过在后期层上放置一个SG分类器,并采用反向梯度更新规则,强制模型在ASR之前学习说话人无关的表示。这与我们在上一节中用于训练说话人不变性探针的策略相同。 根据[32 (https://arxiv.org/html/2606.10654#bib.bib8)],我们使用说话人ID作为多类目标中的类别,对于large模型,DET分类器放在第10层,DAT分类器放在第21层;对于base模型,分别放在第5层和第9层。对于我们的SID分类器,我们基于每一层的激活训练一个xvector[25 (https://arxiv.org/html/2606.10654#bib.bib140)],这是一种已被证明能有效捕获说话人信息的架构³。我们还在实验中使用了线性分类器,但发现它在擦除对抗层中的SGI方面效果较差。这可能是因为嵌入空间中说话人身份的维度大于一,因此需要一个能够建模更高维表示的 ¹为简单起见,本文假设两种性别。 ²我们实验了带ReLU激活的两层MLP,发现SGI检测没有显著改善。 ³说话人识别分类器。
相似文章
The Learning Objective Governs Perceptual Narrowing: A Cross-Lingual, Layer-Wise, Ten-Seed Study of Self-Supervised Speech Encoders
A ten-seed study of self-supervised speech encoders shows that the learning objective (reconstruction vs. prediction) governs cross-lingual perceptual narrowing, with reconstruction degrading non-native phoneme discrimination and prediction improving it.
野外探测:无监督发音分析下自监督语音表示在普通话次方言中的案例研究
本文通过无监督发音探测进行案例研究,探讨自监督语音模型如何在普通话次方言中编码语音特征,发现唇音性等显著特征保持稳定,而更精细的频谱区别则表现出方言依赖的变化。
自监督语音表示追踪听力损失/听障婴儿和儿童口语向成人模型的趋同
本文提出使用来自HuBERT的自监督语音表示来追踪听力损失/听障婴儿和儿童口语向成人模式的趋同,展示了一种可扩展、语言中立的语言发展评估方法。
非语言发声中的说话人身份识别:条件蒸馏与专家混合方法
本文提出了一种新颖的说话人确认框架,该框架结合了冻结的自监督特征、ECAPA-TDNN和专家混合模块,通过条件蒸馏和对比损失来改进语音和非语言发声中的身份确认,同时防止灾难性遗忘。
自监督语音模型中音调上下文的感知补偿
本文研究wav2vec2.0架构在汉语普通话中是否表现出对音调上下文的感知补偿,发现与人类听众相比,自监督模型中的证据有限,并表明监督微调可能是实现此类音系抽象所必需的。