从僧伽罗语到迪维希语:低资源语音识别的跨语言迁移学习

arXiv cs.CL 论文

摘要

本研究探讨了从僧伽罗语到迪维希语的跨语言迁移学习在自动语音识别中的应用,与仅使用迪维希语的基线相比,词错误率显著降低。

arXiv:2607.06289v1 Announce Type: new 摘要:迪维希语是马尔代夫的国家语言,目前自动语音识别(ASR)和其他自然语言处理(NLP)任务的资源匮乏。本研究探讨了从僧伽罗语(一种语言上相关的、资源相对丰富的岛屿印度-雅利安语支语言)进行跨语言迁移学习是否能改进迪维希语的ASR。我们进行了十七项实验,涵盖五种迁移学习范式:仅使用迪维希语的基线、顺序微调、多语言微调、持续预训练,以及使用土耳其语作为无关语言的对照实验。最强的系统——在僧伽罗语上进行持续预训练,然后使用KenLM在迪维希语上进行微调——实现了12.89%的词错误率(WER)和2.70%的字符错误率(CER),相比仅使用迪维希语的基线,WER降低了13.50%,CER降低了3.02%。然而,适应策略和解码配置对于成功的迁移学习实验同样至关重要。我们进行了十七项对照实验,涵盖五种迁移学习范式:仅使用迪维希语的基线、顺序微调、多语言微调、持续预训练,以及使用土耳其语作为无关语言的对照实验。最强的系统——在僧伽罗语上进行持续预训练,然后使用KenLM在迪维希语上进行微调——实现了12.89%的WER和2.70%的CER,相比仅使用迪维希语的基线,WER降低了13.50%,CER降低了3.02%。土耳其语的对照实验证实,观察到的改进源于语言相关性;适应策略和解码配置也至关重要。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:42

# 从僧伽罗语到迪维希语:面向低资源语音识别的跨语言迁移学习
**来源:** https://arxiv.org/html/2607.06289

###### 摘要

迪维希语是马尔代夫的国语,目前自动语音识别(ASR)及其他自然语言处理任务中资源严重不足。本研究探讨了从僧伽罗语(一种语言上相关、资源相对丰富的岛屿印度-雅利安语)进行跨语言迁移学习是否能改进迪维希语 ASR。我们开展了十七项实验,涵盖五种迁移学习范式:仅迪维希语基线、顺序微调、多语言微调、持续预训练,以及使用土耳其语作为无关语言的对照实验。最强的系统是先对僧伽罗语进行持续预训练,再对迪维希语进行微调并配合 KenLM,实现了 12.89% 的词错误率(WER)和 2.70% 的字错误率(CER),相比仅迪维希语基线分别提升了 13.50% WER 和 3.02% CER。然而,适应策略和解码配置对于成功的迁移学习实验同样至关重要。我们开展了十七项受控实验,涵盖五种迁移学习范式:仅迪维希语基线、顺序微调、多语言微调、持续预训练,以及使用土耳其语作为无关语言的对照实验。最强的系统是先对僧伽罗语进行持续预训练,再对迪维希语进行微调并配合 KenLM,实现了 12.89% WER 和 2.70% CER,相比仅迪维希语基线分别提升了 13.50% WER 和 3.02% CER。土耳其对照实验证实,观察到的改进源于语言相关性;适应策略和解码配置同样至关重要。

## I. 引言

现代 ASR 系统在英语和普通话等高资源语言上表现出色,这得益于大规模的语音数据集 [12](https://arxiv.org/html/2607.06289#bib.bib22)。然而,全球约 7000 种语言中的大多数在语音技术中仍然代表性不足,限制了数亿使用者获取数字服务、教育工具和通信技术的渠道 [24](https://arxiv.org/html/2607.06289#bib.bib11)。迪维希语(也称为马尔代夫语)是马尔代夫的国语 [22](https://arxiv.org/html/2607.06289#bib.bib23),由马尔代夫、米尼科伊(印度)以及海外侨民社区的大约 33.5 万至 41 万人使用 [11](https://arxiv.org/html/2607.06289#bib.bib1)。Mozilla Common Voice 仅提供 61 小时录制的语音,其中 37 小时经过验证可用于迪维希语 [21](https://arxiv.org/html/2607.06289#bib.bib2),远低于竞争性 ASR 系统通常所需的数据量。自监督模型如 Wav2Vec [6](https://arxiv.org/html/2607.06289#bib.bib6) 和多语言扩展如 XLS-R [1](https://arxiv.org/html/2607.06289#bib.bib8) 通过对原始音频进行大规模预训练,显著减少了对标注数据的需求。在有限的目标数据上进行微调通常表现不佳,因为预训练编码器缺乏对目标语言声学特征的接触。利用相关高资源语言的数据进行跨语言迁移提供了一种互补策略,已在多个语系中显示出潜力 [2](https://arxiv.org/html/2607.06289#bib.bib7), [18](https://arxiv.org/html/2607.06289#bib.bib15), [25](https://arxiv.org/html/2607.06289#bib.bib16)。迪维希语和僧伽罗语同属岛屿印度-雅利安语支,共享语音、词汇和结构特征,这在比较语言学研究中已有记载 [11](https://arxiv.org/html/2607.06289#bib.bib1)。图 1 (https://arxiv.org/html/2607.06289#S1.F1) 展示了它们的谱系关系,并与土耳其语形成对比,土耳其语在本研究中作为对照实验使用,属于不同的语系。

引用图注

图 1: 僧伽罗语、迪维希语和土耳其语的谱系关系。注:僧伽罗语和迪维希语属于岛屿印度-雅利安语支,而土耳其语属于突厥语系,在本研究中用作无关的控制语言。

表 I (https://arxiv.org/html/2607.06289#S1.T1) 通过句子级别的比较说明了这一点,其中同源词如 *magu/maga*(“路”)、*gamu/gama*(“村庄”)和 *kan/kana*(“耳朵”)出现在自然话语中。这些共享属性可能对应重叠的声学模式,预训练编码器在跨语言迁移时可以利用这些模式。僧伽罗语提供了大约 220 小时公开可用的转录语音 [20](https://arxiv.org/html/2607.06289#bib.bib24),约为经验证的迪维希语数据的四倍,为评估这一假设提供了必要的资源。

表 I: 迪维希语-僧伽罗语句子比较,显示共享的印度-雅利安同源词(罗马化)。

尽管对多语言 ASR 的兴趣日益增长,但对僧伽罗语和迪维希语的研究仍然非常有限。迪维希语在现有的多语言 ASR 框架中没有得到充分覆盖。Ahmed [5](https://arxiv.org/html/2607.06289#bib.bib12) 在微调 Whisper 用于迪维希语时不得不使用僧伽罗语标记,因为该模型没有明确支持迪维希语。由于僧伽罗语和迪维希语都是印度-雅利安语言,它们共同的历史和结构特征可能为低资源 ASR 中的相关语言迁移提供有利条件。目前的研究尚未系统性地考察这种关系 [3](https://arxiv.org/html/2607.06289#bib.bib25), [23](https://arxiv.org/html/2607.06289#bib.bib35)]。这些差距引出了以下研究问题:
1.  与仅迪维希语基线相比,预训练僧伽罗语语音能在多大程度上改进迪维希语 ASR 性能?
2.  如何有效地将僧伽罗语和迪维希语表示在共享的潜在空间中,以用于跨语言 ASR?
3.  语言相关性在僧伽罗语和迪维希语之间的跨语言迁移性能中起什么作用?
4.  如何标准化 ASR 评估,以确保跨迁移学习策略的公平比较?

通过解决这些研究问题,本研究提供了以下贡献:
- • 僧伽罗语和迪维希语的强基线,超过了现有文献的结果。
- • 对从僧伽罗语到迪维希语 ASR 的三种跨语言迁移范式进行了受控比较,包括持续预训练(CPT)、顺序微调,以及带有或不带显式语言 ID 标记的多语言微调。
- • 使用土耳其语语音进行对照实验,以将语言相关性的影响与通用多语言数据增强区分开。
- • 一个可复现的框架,供未来的跨语言迁移学习研究使用。

## II. 相关工作

### II-A 自监督与多语言语音模型

从监督声学建模到自监督预训练的转变显著推进了低资源 ASR 系统的发展。Wav2Vec [6](https://arxiv.org/html/2607.06289#bib.bib6) 通过掩码预测和对比目标在原始音频上学习上下文化的语音表示,使得仅需十分钟的标注数据即可实现强大的下游 ASR。XLS-R [2](https://arxiv.org/html/2607.06289#bib.bib7) 将该框架扩展到 53 种语言,而 XLS-R [1](https://arxiv.org/html/2607.06289#bib.bib8) 则扩展到 128 种语言和近 50 万小时。MMS [24](https://arxiv.org/html/2607.06289#bib.bib11) 通过大规模多语言预训练进一步将覆盖范围扩大到 1000 多种语言。Whisper 是一个现代的大规模多语言编码器-解码器模型 [4](https://arxiv.org/html/2607.06289#bib.bib10)。通过依赖先前生成的输出,此类模型比纯 CTC 模型更能自然地捕捉语言结构,但它们通常需要更多数据,并且在极低资源设置下可能不够稳定。

### II-B 迪维希语和僧伽罗语的 ASR

已发表的最强迪维希语 ASR 工作比较了基于 XLS-R、MMS 在迪维希语 Common Voice 13.0 上的多语言模型 [5](https://arxiv.org/html/2607.06289#bib.bib12)]。其最重要的发现是,子词建模明显优于纯字符词汇表用于迪维希语。最佳系统结合了 MMS 1B 微调、语言感知的子词词汇表、5-gram KenLM 解码和自动拼写校正,将 WER 降低到 14.26%,并显著优于早期报告的迪维希语基线 20.95% [5](https://arxiv.org/html/2607.06289#bib.bib12)]。对于僧伽罗语,先前的工作比较了混合深度神经网络-隐马尔可夫模型(DNN-HMM)和端到端无格最大互信息(LF-MMI)系统在 40 小时语音上的表现,分别报告了 27.79% 和 28.55% 的 WER [9](https://arxiv.org/html/2607.06289#bib.bib26)]。更近期的研究表明,预训练的 e2e 模型可以达到 23.38% 的 WER [10](https://arxiv.org/html/2607.06289#bib.bib13)],而使用 Mozilla DeepSpeech、KenLM 解码和数据增强的迁移学习进一步将 WER 降低到 17.19% [17](https://arxiv.org/html/2607.06289#bib.bib14)]。综合来看,这些研究表明僧伽罗语 ASR 受益于迁移表示。然而,尚无先前工作研究僧伽罗语是否可以作为针对迪维希语的跨语言迁移的源语言。

### II-C 迁移学习

Yu 等人 [7](https://arxiv.org/html/2607.06289#bib.bib27)] 显示,汉语到土家语的迁移将识别错误率降低到 46.19%,比仅训练土家语提高了 2.11 个百分点。Li [15](https://arxiv.org/html/2607.06289#bib.bib31)] 发现,普通话预训练的 Wav2Vec-XLS-R 模型将粤语的 CER 从约 0.30 降低到 0.20。Pillai 等人 [14](https://arxiv.org/html/2607.06289#bib.bib17)] 显示,泰米尔语到马拉萨尔语的多阶段迁移将 WER 降低到 51.9%,并在标点过滤后进一步降低到 47.3%。Kim 和 Kang [13](https://arxiv.org/html/2607.06289#bib.bib21)] 报告通过进一步在韩语语音上预训练英语 Wav2Vec 2.0,相对 WER 改善了超过 20%。Černiavski [8](https://arxiv.org/html/2607.06289#bib.bib32)] 发现,瑞典语、丹麦语和挪威语之间的零样本迁移仍具有竞争力,相对退化通常在全监督系统的 10-25% 以内,并且多语言解码进一步降低了 WER,相比单语丹麦语和挪威语模型实现了高达 15-20% 的收益。Nowakowski 等人 [18](https://arxiv.org/html/2607.06289#bib.bib15)] 显示,CPT 将萨哈林阿伊努语的 ASR 从 42.3% WER 提高到 29.8%,并且添加相关的北海道阿伊努语得到了 30.5% WER,而不相关的英语表现更差,为 40.1% WER。Elamin 等人 [16](https://arxiv.org/html/2607.06289#bib.bib33)] 报告,斯瓦希里语的 WER 约为 18-22%,基尼亚卢旺达语为 20-25%,卢干达语为 22-28%,在代码切换下只有 2-5% 的相对退化。Anidjar 等人 [19](https://arxiv.org/html/2607.06289#bib.bib34)] 证明,语义对齐的多语言数据集改进了 ASR 性能,例如将俄语-葡萄牙语的 WER 降低到 26.22%,而低语义相似度条件下为 50.93%。Getman 等人 [25](https://arxiv.org/html/2607.06289#bib.bib16)] 显示,对于北萨米语,CPT 和扩展微调优于直接微调,将 XLS-R 的 WER 从 37.25% 降低到 30.14%(使用 20 小时数据),以及 28.84% WER 和 7.36% CER。

## III. 方法论

### III-A 数据收集与预处理

表 II: 本研究中使用的语音数据集摘要。

表 II (https://arxiv.org/html/2607.06289#S3.T2) 总结了本研究中使用的数据集。对于僧伽罗语,我们使用来自 OpenSLR (SLR52) 的大型僧伽罗语 ASR 训练数据集,最初由 Kjartansson 等人 [20](https://arxiv.org/html/2607.06289#bib.bib24)] 引入,通过斯里兰卡的众包收集。对于迪维希语,我们使用 Mozilla Common Voice 24.0 的迪维希语子集 [21](https://arxiv.org/html/2607.06289#bib.bib2)]。尽管完整的迪维希语子集包含约 61 小时的音频,但只有经过验证的 37 小时用于监督训练。Common Voice 数据通过志愿者驱动的流程收集,其中说话者朗读提示句子,其他贡献者验证录音的质量和准确性。来自 Common Voice 的土耳其语数据,体积与僧伽罗语子集匹配,用于对照实验。所有音频都转换为通用格式,重采样为 16 kHz。文本转录进行 Unicode 规范化(NFC)、标点和空格规范化、非语言符号去除、必要的转小写,以及特定语言的文字规范化。对于多语言实验,僧伽罗语被下采样到 30 小时或 60 小时,以减少源语言的主导地位,并在每个转录前添加 `<si>` 和 `<dv>` 标记。

### III-B 模型选择与分词

Wav2Vec 被选为主要 ASR 模型,因为它在低资源下性能强劲,并且在自监督预训练和监督微调之间有清晰的分离,从而能够系统地比较迁移学习策略。它还通过 CTC 解码支持外部语言模型的模块化集成。与 Whisper 等编码器-解码器模型相比,它对于受控实验更灵活,计算效率更高。使用了字符级分词,因为有限的文本数据和文字差异使得子词学习对于僧伽罗语和迪维希语不太可靠。

### III-C 外部语言模型

为了提高解码质量,我们在推理过程中引入了一个外部语言模型。具体来说,我们使用 KenLM [26](https://arxiv.org/html/2607.06289#bib.bib36)],一个广泛使用的用于构建高效 N-gram 语言模型的工具包,以及 pyctcdecode,一个专为 CTC 语音识别系统设计的波束搜索解码器。在转录数据上训练一个 5-gram KenLM 模型,并通过浅融合集成到解码中。在推理过程中,pyctcdecode 将 CTC 声学模型产生的声学分数与外部语言模型的分数结合起来,以选择更合理的词序列。给定音频输入 X 的文本假设 h 的解码分数定义为:

Score(h) = log P_CTC(h|X) + α log P_LM(h) + β|h|,      (1)

其中 P_CTC(h|X) 表示声学模型给出的分数,P_LM(h) 是语言模型概率,|h| 是假设长度。超参数 α=0.5 控制语言模型的贡献,而 β=1.0 在解码过程中提供长度补偿项。波束宽度设为 64。经验调优显示,将波束宽度增加到 128 会降低性能,可能是因为更大的搜索空间在解码过程中保留了更多声学上较弱的假设。

### III-D 实验设计

(1) 仅迪维希语基线:仅在迪维希语数据上微调预训练编码器。这为所有迁移比较建立了主要参考。
(2) 仅僧伽罗语基线:在 30 小时和 60 小时的僧伽罗语子集上微调,以验证源语言性能。60 小时模型作为顺序迁移的源检查点。
(3) 顺序微调:先在 60 小时的僧伽罗语上微调,然后继续在迪维希语上微调。这测试僧伽罗语是否为迪维希语适应提供了更好的初始化。
(4) 多语言微调:在共享模型上联合训练僧伽罗语 + 迪维希语,测试四种变体:带/不带语言 ID 标记,以及僧伽罗语比例为 30/60 小时。这评估是否同时

相似文章

语音识别中的Convex低资源口音鲁棒语言检测

Hugging Face Daily Papers

本文介绍了CLD,一种基于凸优化的轻量级语言检测头(用于ASR),在不到100个训练样本下实现97-98%的准确率,同时将计算成本降低13倍,解决了5种语言和24种子方言的口音和方言鲁棒性问题。

DonorRank:低资源跨语言语音识别中的捐赠语言选择

arXiv cs.CL

本文介绍了DonorRank,一种用于低资源跨语言语音识别中选择有效捐赠语言的学习排序框架,并在印度语族和非洲语言语料库上进行了评估。与基于遗传相似性和高资源语言的启发式方法相比,它展示了更好的捐赠语言选择效果,并为多语言ASR的迁移模式提供了见解。