哪些语言最适合迁移到瓦尔皮里语?一项基于相似度的低资源语音识别研究
摘要
本文研究了低资源自动语音识别(ASR)中跨语言迁移的问题,针对瓦尔皮里语提出了一种结合声学与语言特征的相似度框架,以选择最优源语言。实验表明,像阿萨姆语和印地语这样声学相似的语言能显著降低词错误率和字符错误率。
查看缓存全文
缓存时间: 2026/07/14 04:21
# 哪些语言最适合迁移到瓦尔皮里语?基于相似性的低资源ASR研究
来源:https://arxiv.org/html/2607.10256
Mylvaganam Ambikairajah Dang Sethu Szalay
###### 摘要
本文研究了在极度低资源环境下,语言相似性如何改进自动语音识别(ASR)的跨语言迁移。瓦尔皮里语是澳大利亚原住民语言,其标注语音数据极为有限,因此迁移学习至关重要。我们提出一个框架,结合来自预训练语音模型的声学相似性与基于类型学、音素库、语法和句法特征的 linguistic 相似性,对高资源源语言进行排序,并评估它们迁移到瓦尔皮里语的 ASR 效果。使用 Whisper 的实验表明,声学和类型学上相似的语言优于单语言和多语言基线。阿萨姆语和印地语在词错误率和字符错误率上均有显著降低。相关性分析进一步表明,声学相似性是微调性能的最强预测因子,而音素库和类型学相似性则更好地解释了零样本迁移。
###### 关键词:
低资源 ASR,跨语言迁移,语言相似性,语音嵌入,原住民语言
## 1 引言
自动语音识别(ASR)已成为一项变革性技术,能够在虚拟助手、语言学习和无障碍工具等应用中实现自然的人机交互。近年来,得益于大规模标注数据集和强大的深度学习模型,ASR取得了显著进展[prabhavalkar2023end]。然而,许多语言,尤其是原住民语言和低资源语言,由于标注语料库有限,仍然代表性不足,表现不如高资源语言[besacier2014automatic]。瓦尔皮里语是澳大利亚北领地一个小社区使用的原住民语言[bavin1993language],其极度有限的数据阻碍了稳健的 ASR 开发,这正体现了这一挑战。
跨语言迁移已成为解决数据稀缺问题的有前景方案,它利用高资源语言的声学和语言学知识来支持低资源语言[das2015cross,khurana2024cross]。然而,其有效性取决于选择合适的目标语言进行知识迁移[malkin2022balanced]。现有研究通常基于数据可用性、语系或启发式方法选择源语言[khare2021low,pandey2024towards,liu2024exploration,hou2021exploiting],但这种方法可能无法反映真实的声学或语言学相似性[gooskens2018mutual,heeringa2023comparing]。相反,近期工作强调声学和语音相似性是更可靠的指标[umar2022investigating],通常比仅依赖谱系或地理邻近性获得更好的迁移效果[wu2021cross,kim2025improving],因为地理或谱系相关的语言在声学属性上仍可能存在显著差异[themistocleous2022sonorant,harnud2021relation,lin2019choosing]。这凸显了在低资源环境下进行系统性的、基于相似性的源语言选择以最大化迁移效果的必要性。
瓦尔皮里语在类型学上与大多数高资源语言相距甚远(即在语法、形态学和句法上存在显著差异)[bavin1987warlpiri,shopen2001explaining,bryant2021contrasting],并且受到的关注有限,因此尚不清楚哪些高资源语言是最合适的迁移源。其音段和超音段属性进一步强调了进行系统性相似性分析的必要性:瓦尔皮里语的元音系统相对较小,而辅音库则非常丰富,包括许多高资源语言中不常见的齿音、齿龈音、卷舌音和腭音[bavin1993language,bavin1987warlpiri,hale1983warlpiri]。在声学上,它表现出独特的重音模式、元音和谐以及韵律结构,这些特征使其与英语等语言区分开来[harvey2005vowel,pentland2005distinguishing,butcher2003acoustic]。这些独特的音系和韵律模式表明,迁移效果不太可能仅通过数据可用性等宽泛标准来捕捉,而是取决于更细粒度的相似性形式。这促使我们进行多层次的相似性分析,考察句法、音素库、语法和类型学相似性,并结合详细的声学测量,以系统地识别与瓦尔皮里语匹配的高资源源语言。
近期一项研究[ambikairajah2025study]使用语言识别框架考察了瓦尔皮里语与几种高资源语言之间的相似性。虽然提供了初步见解,但其仅限于句子级别的声学相似性,没有考虑从低级到高级语音表征的细粒度声学相似性。更重要的是,它排除了语言学相似性度量,导致分析主要停留在描述层面。此外,所提出的相似性度量并未在下游任务上进行评估,因此缺乏其实用性(如改进 ASR)的经验证据。
为解决这些挑战,本研究探讨两个核心问题:(1) 哪些高资源语言在声学和语言学维度上与瓦尔皮里语最为相似?(2) 基于相似性的源语言选择是否能提高 ASR 任务中跨语言迁移的有效性?具体而言,我们考虑两类相似性:(1) 基于嵌入的声学相似性,源自预训练语音模型;(2) 基于语言学特征的相似性,根据句法、音素库、语法和类型学特征计算得出。这些度量用于对高资源语言进行排序,并通过跨语言 ASR 实验识别出有前景的迁移源语言。
据我们所知,这是首次系统性研究,在声学和语言学特征层面分析瓦尔皮里语与高资源语言的相似性,并将其直接与 ASR 性能联系起来。它为开发低资源语言的 ASR 系统提供了一种原则性方法。
## 2 相似性分析
本节详细介绍瓦尔皮里语与选定的高资源语言之间的相似性分析。首先使用基于 LID 的相似性方法[ambikairajah2025study]识别候选语言,该方法选择与瓦尔皮里语音学上接近的语言,为深入相似性分析提供原则性基础,同时通过将研究范围限定在最声学接近的语言上确保计算可行性。
### 2.1 基于LID的相似性
该方法识别出与瓦尔皮里语声学相似的高资源语言,作为使用我们提出的声学和语言学特征方法(第2.2节和第2.3节)进行进一步相似性分析的合适候选。我们采用广泛使用的多语言预训练 ECAPA-TDNN 模型[desplanques2020ecapa],该模型在多样化的 VoxLingua107[valk2021voxlingua107] 上训练,提供跨语系的广泛覆盖,从而实现可靠的跨语言比较。将瓦尔皮里语音语句输入模型,生成在107种语言上的预测概率,较高的预测概率表明与瓦尔皮里语具有更大的声学相似性[ambikairajah2025study]。
### 2.2 声学相似性
我们提出一种仅使用语音信号来量化语言相似性的声学方法。首先使用预训练语音模型 \(f(\cdot)\) 获取语音嵌入。该模型将每个语音话语 \(x\) 映射到一个固定维度的嵌入空间 \(\mathbf{e} = f(x) \in \mathbb{R}^d\)。然后,使用瓦尔皮里语嵌入向量 \(\mathbf{e}_w\) 与高资源语言 \(\ell\) 的嵌入向量 \(\mathbf{e}_\ell\) 之间的余弦相似度来计算语言相似性 \(s\):
\[
s(x^w, x^\ell) = (\mathbf{e}_w \cdot \mathbf{e}_\ell) / (\lVert \mathbf{e}_w \rVert \lVert \mathbf{e}_\ell \rVert) \qquad (1)
\]
对于每个瓦尔皮里语话语,计算其与来自语言 \(\ell\) 的代表性子集(在第3.1节中描述)中话语的相似性。将所得成对余弦相似度求平均,得到每个瓦尔皮里语话语对应语言 \(\ell\) 的相似性得分,再对所有瓦尔皮里语话语的这些得分求平均,即得到整体声学相似性 \(S(w, \ell)\)。
\[
S(w, \ell) = \frac{1}{N_w} \sum_{i=1}^{N_w} \left( \frac{1}{N_\ell} \sum_{j=1}^{N_\ell} s(x_i^w, x_j^\ell) \right) \qquad (2)
\]
其中 \(N_w\) 和 \(N_\ell\) 分别是瓦尔皮里语和语言 \(\ell\) 的话语数量。保留话语级嵌入而非将其压缩为单个全局表示,可以确保对跨语言声学接近度进行稳健且细致的估计。
为了进一步分析声学相似性如何随表示深度变化,我们从基于 Transformer 的语音模型的中间层提取嵌入。然后使用相同的余弦公式逐层计算相似性,得到每层 \(k\) 的 \(S_k(w, \ell)\)。这使我们能够考察相似性模式如何从低级声学表示过渡到高级语音或语言学抽象。
在本研究中,我们评估了多种预训练语音模型,包括 ECAPA-TDNN[desplanques2020ecapa]、wav2vec 2.0[baevski2020wav2vec] 和 XLSR-53[conneau2020unsupervised]。ECAPA-TDNN 捕捉说话人和语言辨别的声学特征,而 wav2vec 2.0 是一个在大规模英语语音上训练的自监督模型,生成包含丰富声学和语音信息的上下文嵌入。使用这两种模型,我们为每个话语提取最终层嵌入。由于 ECAPA-TDNN 缺乏 Transformer 层次结构,且单语言 wav2vec 2.0 不适合跨语言逐层分析,我们将重点放在 XLSR-53[conneau2020unsupervised] 上——这是 wav2vec 2.0 的多语言扩展,在53种语言上训练,非常适合跨语言研究。其分层 Transformer 架构产生的表示从低级声学特征逐步过渡到高级语音和语言学抽象[pasad2021layer],使我们能够详细考察瓦尔皮里语与其他语言的相似性如何跨层演变。
最后,声学相似性分析根据跨模型和跨层与瓦尔皮里语的接近度对高资源语言进行排序。尽管瓦尔皮里语在训练中未见,但嵌入相似性可作为声学和语音亲和性的代理指标。
### 2.3 语言学特征相似性
我们进一步考察了非声学特征,即语言学研究记录的类型学属性[ye2023study]。我们在四个互补维度上分析语言相似性:句法结构、音素库、语法特征和整体类型学,从而基于现有语言资源提供多层次的表征。语言表示为从公开可用的数据库中提取的特征向量,使用余弦距离和海明距离计算瓦尔皮里语与每种高资源语言的相似性。四个维度定义如下:
1. **句法距离**:使用来自世界语言结构地图集(WALS)[wals]、世界语言结构句法(SSWL)[sswl] 和民族语(Ethnologue)[Ethnologue2025] 的数据,测量句法特征向量之间的相似性,编码句子结构和词序。
2. **音素库距离**:测量音素库的相似性,反映语言的语音系统。二元音素向量源自 PHOIBLE 数据库[PHOIBLE2.0]。
3. **语法距离**:捕捉语法结构,如格标记、一致关系、时态-体-语气,使用 Grambank 特征向量[skirgaard2023grambank]。
4. **类型学距离**:整体结构相似性,由上述三个维度的拼接向量计算得出,反映全局类型学相似性。
为确保可靠性,忽略缺失值的特征而非进行预测[kim2025improving,skirgaard2023grambank]。预测缺失特征值可能引入人工模式,扭曲相似性测量,因此仅使用已确认的特征值来计算相似性得分。
## 3 实验
### 3.1 数据集
瓦尔皮里语的语音录音及其对应转录文本来自 DoReCo 数据集[doreco-warl1254]。录音首先经过预处理,移除低质量片段以及包含过多噪声或不相关语音的话语。然后将剩余的音频信号下采样至16 kHz,以匹配本研究使用的语音模型输入要求。最终数据集包含约1.5小时的语音,来自18位说话人。这反映了濒危语言的实际记录条件,通常只有有限数量的转录语音可用。数据被划分为训练集、验证集和测试集,时长分别为1小时、15分钟和15分钟。
对于声学分析(第2.2节),从 VoxLingua107 训练集划分[valk2021voxlingua107]中随机采样每种高资源语言的代表性子集,预训练模型正是基于该数据集优化的,以确保可靠的声学和语音表示。为提高计算效率,每个子集限制为每语言2,500个话语(10小时),同时保留说话人多样性和广泛的语音覆盖。
### 3.2 ASR模型与实现细节
对于瓦尔皮里语的 ASR,我们使用 Whisper 模型[radford2023robust],这是一个大规模多语言编码器-解码器,在多样化的语音数据上训练,已知在低资源 ASR 中具有强大的跨语言迁移能力[gete2025whispering,liu2024exploration]。鉴于瓦尔皮里语语音数据的有限性,我们在所有实验中使用 Whisper small 变体。它包含12层编码器和解码器,模型维度为768,12个注意力头,以及2.44亿个可训练参数。这种配置平衡了识别性能和计算效率,确保了一致且可控的跨语言迁移实验。
我们从多语言 Whisper small 模型开始,分别在每个选定的高资源源语言数据集上进行微调。然后将得到的源域适应模型在瓦尔皮里语数据上进行微调。所有编码器和解码器层均被更新,因为全模型微调能使声学和语言表示更好地适应低资源语言。该流程遵循 Hugging Face 指南[HF]。具体来说,每个模型训练10个 epoch,批次大小为2,使用总步数10%的预热,之后学习率达到 \(10^{-5}\) 并线性衰减。这种设置确保在低资源数据集上稳定且充分的训练。
在训练过程中,每200步保存一次检查点,并在验证集上评估每个检查点。选择词错误率(WER)最低的检查点作为最终模型。相似文章
基于跨语言迁移和LoRA适配器融合的低资源阿拉伯字母语言生物医学机器翻译
本文对面向低资源阿拉伯字母语言的生物医学机器翻译中的跨语言迁移进行了系统研究,以阿拉伯语和波斯语作为枢轴语言。作者评估了LoRA适配器融合作为一种零数据迁移策略,并表明该策略对于达里语等亲缘关系较近的语言效果出乎意料地好。
迈向真正多语言ASR:将代码切换ASR泛化到未见过的语言对
本文研究了从有限的已见语言对学到的代码切换ASR能力是否可以通过模型合并和域泛化方法泛化到未见过的语言对,结果发现只有有限的迁移。
利用双语微调与语言识别改进低资源ASR:一项跨语言评估
本研究评估了使用语言识别令牌进行双语微调以改进低资源语言ASR的方法,涉及九个多样化的语言对。结果发现,高语言识别准确率是有益的,而在语言识别准确率低的情况下,在推理时提供语言识别令牌可以提升性能。
商业ASR系统在代码切换语音上的基准测试:阿拉伯语、波斯语和德语
本文提出了一个基准测试,评估了五个商业ASR系统在阿拉伯语-英语、波斯语-英语和德语-英语代码切换语音上的性能,使用两阶段管道为每个语言对选择300个样本,并通过WER和BERTScore评估性能。ElevenLabs Scribe v2在整体上取得了最低的WER(13.2%)和最高的BERTScore(0.936),并提供公开数据集。
DonorRank:低资源跨语言语音识别中的捐赠语言选择
本文介绍了DonorRank,一种用于低资源跨语言语音识别中选择有效捐赠语言的学习排序框架,并在印度语族和非洲语言语料库上进行了评估。与基于遗传相似性和高资源语言的启发式方法相比,它展示了更好的捐赠语言选择效果,并为多语言ASR的迁移模式提供了见解。