DonorRank:低资源跨语言语音识别中的捐赠语言选择

arXiv cs.CL 论文

摘要

本文介绍了DonorRank,一种用于低资源跨语言语音识别中选择有效捐赠语言的学习排序框架,并在印度语族和非洲语言语料库上进行了评估。与基于遗传相似性和高资源语言的启发式方法相比,它展示了更好的捐赠语言选择效果,并为多语言ASR的迁移模式提供了见解。

arXiv:2608.11441v1 公告类型:新 摘要:低资源自动语音识别(ASR)通常依赖于跨语言迁移,即从资源更丰富的捐赠语言中调整模型。然而,对于资源不足语言社区的自发语音,由于语言变异、拼写规范不断演变以及资源可用性不均,选择捐赠语言仍然具有挑战性。我们提出了DonorRank,一个用于预测零样本ASR有效捐赠语言的学习排序框架。我们在印度语族和非洲语族的两个多语言语音语料库上评估了DonorRank。它能够准确预测捐赠语言排名,并且相比基于遗传相似性或高资源语言的常见启发式方法,改进了捐赠语言的选择。除了改进迁移之外,我们还展示了DonorRank如何成为一个分析捐赠语言选择本身的通用框架。我们的分析表明,捐赠集的组成决定了哪些语言线索在预测成功迁移时是有用的。我们还识别了迁移模式,为低资源环境下的多语言ASR提供了实用指导。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:26

# DonorRank:低资源跨语言语音识别中的捐赠语言选择
来源:https://arxiv.org/html/2608.11441

Aarohi Srivastava, David Chiang  
计算机科学与工程系  
圣母大学  
美国印第安纳州圣母城  
\{adhasman, asrivas2, dchiang\}@nd\.edu

###### 摘要

低资源自动语音识别(ASR)通常依赖跨语言迁移,即从资源较丰富的捐赠语言微调模型,再应用于未见过的目标语言。然而,对于来自资源不足语言社区的自发言语,由于语言变异、不断演变的正字法惯例以及资源可用性不均,捐赠语言的选择仍然具有挑战性。我们提出了 DonorRank,一个用于预测零样本 ASR 中有效捐赠语言的学习排序(learning-to-rank)框架。我们在印度语系和非洲语系的两个多语言语音语料库上评估了 DonorRank。它能准确预测捐赠语言排名,并在基于遗传相似性或高资源语言的常见启发式方法之上改善了捐赠语言选择。除了提升迁移效果,我们还展示了 DonorRank 是一个可用于分析捐赠语言选择本身的通用框架。我们的分析表明,捐赠语言集的组成决定了哪些语言线索在预测成功迁移时是有用的。我们还识别出可重复的迁移模式,为低资源环境下的多语言 ASR 提供了实用指导。

## 1 引言

为世界上数千种语言构建自动语音识别(ASR)系统极具挑战性,因为大多数语言缺乏足够的带转录语音用于监督训练。因此,跨语言迁移已成为低资源 ASR 的常见策略:先在一个或多个资源较丰富的捐赠语言上微调模型,再应用于未见过的目标语言。然而,这种方法中的迁移性能严重依赖于捐赠语言的选择,即使在密切相关的语言之间也可能存在显著差异。因此,是什么使一种捐赠语言有效,对于开发稳健且包容的多语言语音技术是一个重要问题。

低资源 ASR 中的跨语言迁移,其面临的额外挑战超出了多语言语言处理中通常考虑的范围。与许多基于标准化文本或朗读语音构建的基准不同,低资源 ASR 往往依赖于在真实环境中采集的自发言语,其中发音、说话风格和录音条件表现出巨大的变异性。这些挑战因许多低资源语言的正字法标准化有限而进一步加剧,使得词汇相似性不那么可靠。因此,识别有效的捐赠语言需要考虑多种相互作用的语言学因素和数据集特定因素,而不能仅依赖谱系相关性或词汇相似性。

为了更好地理解这些因素如何影响捐赠语言选择,我们考察了两个分别代表截然不同低资源 ASR 场景的多语言语料库。第一个是 VAANI 语料库20 (https://arxiv.org/html/2608.11441#bib.bib6) 的一个子集,包含天城文(Devanagari)书写的印度语言变体(我们称之为 VAANI-D),其中迁移发生在共享同一书写系统的密切相关的语言之间。第二个使用 WAXAL 语料库7 (https://arxiv.org/html/2608.11441#bib.bib16),它涵盖来自多个语系和书写系统的非洲语言,代表了一个更具异质性的多语言环境。研究这两个互补的语料库使我们能够考察控制成功迁移的语言信号在紧密相关的语言生态系统与类型学上多样化的语言生态系统之间如何变化。

我们的研究做出了以下贡献:

1. 我们提出了 DonorRank,一种用于零样本 ASR 中捐赠语言选择的基于学习的框架,并在两个互补的多语言环境中对其进行了评估。
2. 我们提供了对驱动捐赠语言选择特征的实证分析,证明了语言学和数据集特征能够改善完全基于谱系关系的捐赠语言排名。
3. 我们识别出可重复的迁移模式,包括有效的捐赠语言枢纽和非显而易见的捐赠语言,为在经验证据有限的低资源 ASR 场景中提供实用指导。

## 2 相关工作

#### 文本中的捐赠语言选择

在低资源环境中为迁移学习选择捐赠语言,传统上依赖于基于谱系相关性或语言学直觉的启发式方法。为了超越这些方法,文献14 (https://arxiv.org/html/2608.11441#bib.bib2) 引入了 LangRank,这是一个基于学习的框架,用于文本处理任务,它使用 URIEL/lang2vec 数据库15 (https://arxiv.org/html/2608.11441#bib.bib7) 中的类型学、语言库和地理特征,以及数据集特定特征来预测迁移性能。类似地,NN-Rank9 (https://arxiv.org/html/2608.11441#bib.bib3) 使用学习得到的数据集嵌入来为基于文本的自然语言处理任务中的源语言排序。后续的文本处理工作考察了语言特征如何影响迁移18 (https://arxiv.org/html/2608.11441#bib.bib8)。这些方法已在基于文本的 NLP 任务中得到研究,但它们是低资源 ASR 场景中很有前景的候选方法。与此同时,将捐赠语言选择扩展到语音处理并非易事,因为它不仅取决于语言相似性,还取决于声学变异性和数据集特定因素。

#### 语音中的捐赠语言选择

在语音识别中,先前的工作已利用数据驱动的相似性度量来探索捐赠语言选择。这些方法包括基于声学词元分布19 (https://arxiv.org/html/2608.11441#bib.bib5);16 (https://arxiv.org/html/2608.11441#bib.bib4) 的方法,以及利用口语语言识别模型过滤训练数据的方法2 (https://arxiv.org/html/2608.11441#bib.bib11)。这些方法在预测下游 ASR 性能方面已被证明比仅依赖语言特征更有效19 (https://arxiv.org/html/2608.11441#bib.bib5);然而,它们通常需要处理大量音频数据,且可解释性有限。虽然基于特征的相似性已用于 ASR 任务中的捐赠语言选择,但我们提出了一个受 LangRank 启发的学习排序框架,用于低资源语言的捐赠语言选择,并在来自多个非洲和印度语系的若干非标准和小众语言变体上进行了评估和分析。

#### 迁移的语言学预测因子

虽然数据集特征(如训练数据的小时数和唯一出现词的数量)在决定跨语言迁移成功方面起着至关重要的作用,但最近的工作6 (https://arxiv.org/html/2608.

相似文章

利用双语微调与语言识别改进低资源ASR:一项跨语言评估

arXiv cs.CL

本研究评估了使用语言识别令牌进行双语微调以改进低资源语言ASR的方法,涉及九个多样化的语言对。结果发现,高语言识别准确率是有益的,而在语言识别准确率低的情况下,在推理时提供语言识别令牌可以提升性能。

对齐中的语言链:跨语言排序偏好优化

Hugging Face Daily Papers

跨语言排序偏好优化(CRPO)是一种新框架,通过层级排序优化将英语偏好知识转移到目标语言,从而增强多语言LLM的对齐,并在多种语言中展示出在指令遵循和知识利用方面的性能提升。