自监督语音模型中音调上下文的感知补偿
摘要
本文研究wav2vec2.0架构在汉语普通话中是否表现出对音调上下文的感知补偿,发现与人类听众相比,自监督模型中的证据有限,并表明监督微调可能是实现此类音系抽象所必需的。
arXiv:2606.17835v1 公告类型:新
摘要:本研究考察wav2vec2.0架构在多大程度上表现出对音位上下文的补偿证据。我们对汉语普通话声调进行了一项感知补偿实验的伪重复,比较了纯自监督预训练模型和针对汉语ASR微调的模型在嵌入相似性和探测分类器输出上的表现。纯预训练模型的嵌入相似性中没有发现补偿证据。探测分类器除了在分类上预期的逐层改进外,还显示出一些补偿证据,但未能复现人类在孤立测试音节上的表现。我们的发现与之前仅通过预训练就能产生对音位结构敏感性的报告形成对比,并表明监督目标可能是鼓励至少某些类型的音位规律抽象所必需的。
查看缓存全文
缓存时间: 2026/06/17 05:42
# 自监督语音模型中对声调语境的感知补偿
来源:https://arxiv.org/html/2606.17835
Kirby Krehan Gubian
###### 摘要
本研究考察了 wav2vec2.0 架构在多大程度上表现出对音系语境的补偿证据。我们对一个关于普通话声调的感知补偿实验进行了伪复现,并比较了纯自监督预训练模型和针对普通话 ASR 微调的模型之间的嵌入相似性和探测分类器输出。纯预训练模型的嵌入相似性中未发现补偿证据。探测分类器显示出一些补偿迹象,此外还呈现出预期中的逐层分类能力提升,但在孤立测试音节上的表现与人类表现存在显著差异。我们的发现与先前关于仅通过预训练就能涌现出对音系结构敏感性的报告形成对比,并表明监督目标可能对于鼓励至少某些类型的音系规则性抽象是必要的。
###### 关键词:
语音感知、自监督学习、词汇声调、普通话
## 1 引言
本文旨在通过计算建模增进我们对音系语境在语音感知中作用的理解。为此,我们探索了一种神经语音架构——wav2vec2.0 [baevski2020wav2vec2]——如何在不同音系语境中表征词汇声调。通过将 wav2vec2.0 视为一个感知推断的计算模型,并将其行为与人类听者进行比较,我们可以深入了解这些类型的模型在多大程度上编码了音系结构,以及它们使用了何种信息来实现这一编码。
感知补偿 (Perceptual Compensation, PC) 指语音范畴感知中依赖于语境的变异现象,即听者根据语音或音系语境 [sonderegger2010rational] 将声学上相同的语音信号分配到不同的范畴。例如,后续的圆唇元音会使擦音感知偏向于 /s/ 而远离 /ʃ/,尽管预期性的唇圆化使得该擦音在声学上更接近 /ʃ/ [mann1980vocalic, mitterer2006causes]。这类语境效应已在多种语音中记录到,出现在婴儿 [fowler1990young] 甚至非人类动物 [lotto1997perceptual] 中,这引发了关于该效应能否仅由低层语音机制解释的争论 [diehl2004speech, samuel2011speech]。
现代神经语音识别系统通常基于通过自监督学习 (SSL) 预训练的模型。在此框架中,模型首先仅使用音频通过前置任务进行预训练,然后使用监督学习针对特定任务进行微调 [mohamed2022self]。SSL 范式的成功激发了大量兴趣,人们试图理解此类模型学习到的表征中隐含编码了哪些语言信息 [wells2022phonetic, pasad2024what, yang2023what, shen2024encoding, de2024layer],以及模型行为与人类行为如何比较 [scharenborg2018visualizing, millet2022selfsupervised, pouw2024perception, de2024human]。例如,[scharenborg2018visualizing] 展示了监督式 ASR 模型如何以类似人类的方式,根据有歧义的训练样例调整音位范畴边界;而 [pouw2024perception] 则表明,针对英语 ASR 微调的 wav2vec2.0 模型在音位配列可行语境下的同化补偿多于不可行语境。这些发现可以被解释为神经语音模型已经习得了关于语音在不同音系语境中如何实现的知识,至少当它们针对涉及明确语言范畴的任务进行微调时是如此。
更具争议性的是那些声称纯预训练模型也表现出此类行为的报告。与 [pouw2024perception] 类似,[de2024human] 调查了 wav2vec2.0 如何在音位配列可行和不可行语境中编码有歧义的语音。他们在预训练模型和微调模型中都观察到了语境效应,从而认为模型即使没有符号化的训练目标也能隐式学习英语的音位配列结构。这类发现引人注目,因为它们表明 SSL 模型的语境编码器网络可能无需任何关于音系范畴的显式信息就能隐式捕获音系语境信息。这与基于纯语音知识的 PC 解释 [gow2003feature, gow2004crosslinguistic] 是一致的。
本文中,我们通过伪复现一项关于普通话感知补偿的心理语言学研究 [zhang2022influence],测试了一种神经语音架构在词汇声调领域对语境进行补偿的程度,从而为这一研究方向做出贡献。我们假设,通过自监督学习获得的语境化语音表征可能特别擅长补偿超音段语境(如声调)。我们聚焦于 wav2vec2.0 架构,因为它在前述相关工作中被广泛使用,且存在普通话的预训练 (PT) 和微调 (FT) 检查点。我们通过探测分类器以及嵌入相似性研究,分析模型如何编码半受控的心理语言学刺激。
我们发现,虽然 FT 模型的嵌入相似性在网络后期层显示出一些 PC 证据,但 PT 模型在任何层都未显示出对声调语境的补偿证据。使用 PT 和 FT 嵌入测试的探测分类器显示出一些 PC 迹象,但对于没有语境编码的孤立音节,其分类结果与人类听者相差甚远。因此,我们的结果警告人们在得出“自监督预训练目标足以让神经语音模型整合关于音系范畴表征的信息”这一结论时需谨慎;监督学习可能仍然需要用于鼓励至少某些类型音系语境的整合。
## 2 背景
普通话中大多数词汇性音节都带有四个声调之一:高平调 T1 ([ba1] 八 'eight')、高升调 T2 ([ba2] 拔 'to pull')、低降升调 T3 ([ba3] 把 'to take') 或高峰调 T4 ([ba4] 爸 'father')。与音段一样,声调的语音实现也受到延展协同发音的强烈影响。例如,尽管普通话 T3 在停顿后位置通常实现为低降轮廓 (图 1 左),但当其前面是一个以高调结尾的声调(如 T1)时,它会实现为高降轮廓 (图 1 右) [xu1994production]。换句话说,当跟随 T1 或 T2 时,T3 起始点升高,增加了其与标准 T4 的声学相似性;类似地,在前接 T4 的语境中,T4 的起始点降低,增加了其与标准 T3 的声学相似性。
参照图题图 1:左:从 AISHELL-3 语料库 [shi2021aishell] 中提取的普通话四个词汇声调在响音节上的 F0 轮廓。右:Tone 3 在前面声调语境中的实现。然而,在感知中,人类听者会补偿这些协同发音效应 [zhang2022influence, xu1994production, chen2016context, fox1990context]。[zhang2022influence] 通过让受试者使用二选一迫选法对来自 14 步 T4-T3 连续统的刺激进行分类,证明了前面声调语境对低降 T3 和高峰 T4 之间感知边界的影响。每次试验包含一个目标刺激,要么孤立呈现,要么在前面加三个语境音节之一。结果 (图 2) 显示,当前面声调是高偏移 T1 或 T2 时,明显偏好 T3 反应;当前面声调是低偏移 T4 时,偏好 T4 反应。值得注意的是,孤立呈现的刺激(图 2 中标记为 'no-ctx')处于中间位置,这表明声调语境有助于偏向一般性的音系表征。
## 3 方法
### 3.1 刺激
为了研究 wav2vec2.0 是否在其反应中表现出类似的偏向,我们生成了普通话音节连续统,其固定音段材料但 F0 轮廓在标准 T3 和 T4 端点之间变化。典型的心理语言学研究中,[zhang2022influence] 对大量受试者测试了少量刺激。由于模型对单个刺激的反应是确定性的,我们通过从 AISHELL-3 语料库 [shi2021aishell] 的测试集分集中提取 40 位说话人的双音节序列,并使用蒙特利尔强制对齐工具 [mcauliffe17_interspeech] 确定音节边界,从而重新合成了大量带有不同前面声调语境的声调连续统,以此引入变异性。
参照图题图 2:[zhang2022influence] 实验 3 中人类听者的 T4 反应比例。与 [zhang2022influence] 一致,语境音节带有 T1、T2 或 T4 之一,目标音节则带有 T3 或 T4。为了排除嘎裂样本,我们分析了潜在目标音频片段的 F0,并仅选择那些至少存在 10 个 F0 样本且高于相应说话人 F0 第 10 百分位数的片段。然后,我们使用 Parselmouth [parselmouth, praat] 对每个语境-目标双音节应用 [zhang2022influence] 中描述的时长和 F0 操作,以获得 14 步 T4-T3 目标连续统,其前面要么有语境音节(带有 T1、T2 或 T4),要么孤立呈现(标记为无语境)。依赖说话人的第 10 和第 90 百分位数被用于确定连续统端点的 F0 极值。此过程生成了约 13,700 个连续统(约 192,000 个刺激)。
参照图题图 3:T4 嵌入相似性(公式 1)作为 T4-T3 连续统步数的函数;线条粗细表示 95% 置信带。
### 3.2 模型检查点
所有刺激随后由两个 wav2vec2.0 模型检查点处理:一个仅在 1000 小时未转录的普通话语音上预训练的检查点¹¹,以及一个使用 178 小时转录语音针对普通话 ASR 任务微调的检查点²²。两个模型均包含 7 层 CNN 特征编码器,后接 12 层 Transformer。我们使用 Transformers 库 [wolf2020transformers] 下载并处理了两个检查点。
### 3.3 分析方法
我们报告了两种分析 SSL 模型表征的方法的结果:嵌入相似性和探测分类器。我们将两种方法应用于卷积特征提取器(层 0)的 512 维输出以及 Transformer(层 1-12)的 768 维输出。
#### 3.3.1 嵌入相似性
我们通过比较每个刺激步骤与其对应的 T3 和 T4 端点的嵌入相似性(cf. [de2024human])来检查两个模型的内部表征。对于给定刺激 X,基于相同源音节的对应操作步 1 (T4) 和步 14 (T3) 端点被用作参考刺激。对于每个刺激,通过对整个音节上的逐层嵌入进行平均来获得向量。参照 [de2024human],我们随后计算 X 相对于 T4 的相似性(相对于 T3)如下:
sim(X, T4) = 1 - D_cos(X, T4) / (D_cos(X, T4) + D_cos(X, T3)), (1)
其中 D_cos(a, b) = 1 - cos(a, b)。相似性被建模为一个连续、边界为 [0,1] 的贝塔分布响应变量,使用 mgcv R 库 [wood2011fast] 中的广义加性混合模型 (GAMM)。四个关于步的平滑函数模拟了语境(T1、T2、T4 或 无语境)的效应,其中步取值在 2 到 13 之间(极端值被排除,因为它们与参考点 1=T4 和 14=T3 重合)。添加了说话人-语境随机平滑项以控制说话人变异性。为每个检查点和层独立拟合一个 GAMM。
#### 3.3.2 探测分类器
我们训练了探测分类器,从每个模型检查点和层的表征中预测 T3/T4 声调标签,参照 [ma2021probing]。与相似性计算一样,通过对目标音节上的嵌入进行平均得到向量。
探测分类器是线性全连接神经网络,实现带有交叉熵损失的二元逻辑回归,使用学习率 10^{-3} 的 Adam 优化器。分类器在来自 AISHELL-3 语料库训练集分集的 40 位说话人的 T3 和 T4 音节集合上训练。我们针对 36 位说话人(18 位女性)中的每一位训练了 100 个 T3 和 100 个 T4 音节,并在 4 位说话人(2 位女性)上验证。训练进行了五个 epoch。验证准确率在 CNN 层中饱和度达到 82%,在较高 Transformer 层中高达 99%。错误适度偏向于虚假 T3 识别,最极端的是第 12 层,其中预测的虚假 T3 比虚假 T4 多 4-6 倍。
测试在最后一个训练 epoch 后的分类器状态下进行。测试集由第 3.1 节中描述的操作刺激组成。二元结果被建模为 GAMM 中的伯努利分布响应变量,其预测器结构如第 3.3.1 节所述(包括步的极端值)。
参照图题图 4:探测器的 T4 反应比例作为 T4-T3 连续统步数的函数;线条粗细表示 95% 置信带。
## 4 结果
此处仅展示层 0(CNN 输出)以及层 4、8 和 12 的结果;其他层的结果遵循类似趋势。
### 4.1 嵌入相似性
PT 和 FT 检查点的嵌入相似性如图 3 所示。PT 嵌入(上一行)中没有发现对语境的敏感性证据。似乎有添加语境的小效应(与无语境条件相比),但没有 [zhang2022influence] 中所见的那种补偿证据。另一方面,来自 FT 模型(下一行)的嵌入相似性确实显示出一些语境敏感性证据:T1 语境中的模糊刺激具有更接近 T3 而非 T4 的语境表征,这表明微调从根本上改变了模型的内部表征。然而,与人类反应相比,这些偏移非常小,并且似乎也不是相对于无语境嵌入的。此外,语境 T2 和 T4 相对于 T1 被归为一组,T1 显示出最大的偏移,这再次是一种与 [zhang2022influence](图 2)在定性上不同的模式。
### 4.2 探测分类器
图 4 显示了 PT 和 FT 模型在四个层级处每个连续统步上的 T4 反应比例。在最后 CNN 层可见轻微的语境效应,但在第四 Transformer 层已经看到对连续统端点的增强敏感性以及对语境的敏感性。这在 FT 模式的第 8 层中最强。相似文章
野外探测:无监督发音分析下自监督语音表示在普通话次方言中的案例研究
本文通过无监督发音探测进行案例研究,探讨自监督语音模型如何在普通话次方言中编码语音特征,发现唇音性等显著特征保持稳定,而更精细的频谱区别则表现出方言依赖的变化。
预训练的自监督语音模型能够识别未见过的辅音
本文研究了预训练的自监督语音模型(如Wav2Vec2和HuBERT)是否能够准确识别咔嗒辅音(click consonants),这些辅音在训练数据中较为罕见,通过在科伊桑语言(Khoisan languages)上进行微调来测试。结果表明,这些模型识别咔嗒辅音的准确率高于非咔嗒辅音,表明它们能够泛化到不常见的音素。
对北京话和台湾话口语语料库的语音和语义分析表明,轻声是一个词调
本文介绍了一项基于语料库的研究,通过对北京话和台湾话口语语料库的语音和语义分析,使用广义加性模型和上下文嵌入,表明普通话中的轻声是一个具有自身调目标的词调。
基于音调条件的课程学习用于低资源班图语语音识别
本文提出了一种基于音调条件的课程学习框架,用于低资源班图语语音识别,结合了混合难度评分、门控适配器和分阶段课程训练。对六种南部班图语的评估显示,W2V-BERT在恩古尼语上优于Whisper,而Whisper在索托-茨瓦纳语上表现更好。
使用嵌入预测普通话单音节词的口语时长和音高
本研究探讨了来自大型语言模型的上下文嵌入是否能预测普通话单音节词的口语时长和音高轮廓,结果表明其预测能力高于随机水平,并能将归一化基频轮廓反变换回毫秒时间尺度。