面向低资源澳大利亚土著语言识别的混合持续学习方法

arXiv cs.CL 论文

摘要

本文提出了两种混合持续学习方法——回放增强弹性权重巩固与约束引导知识蒸馏——用于调整预训练语音模型,以识别低资源澳大利亚土著语言,同时缓解灾难性遗忘。

arXiv:2607.11946v1 公告类型:新 摘要:语言识别是将濒危澳大利亚土著语言(AALs)整合到支持语言复兴和数字包容的语音技术中的重要一步。然而,极端的数据稀缺限制了模型性能。来自高资源语言的迁移学习显示出潜力,但在适应新语言时常常遭受灾难性遗忘。持续学习(CL)可以缓解这一问题,但在数据非常有限的情况下仍然具有挑战性。为了解决这一问题,我们提出了两种混合持续学习方法:回放增强弹性权重巩固(Replay Augmented Elastic Weight Consolidation)和约束引导知识蒸馏(Constraint Guided Knowledge Distillation),以调整预训练语音模型用于AAL识别,同时保留先前学到的知识。在Warlpiri、Dalabon和Dharawal上的实验表明,所提出的方法优于微调和现有的持续学习基线,提高了对多种AAL的适应性,同时保持了对先前学习的高资源语言的性能。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:21

# 面向低资源澳大利亚原住民语言识别的混合持续学习
来源:https://arxiv.org/html/2607.11946
Mylvaganam Dang Ambikairajah Sethu Wu

###### 摘要

语言识别是将濒危的澳大利亚原住民语言(AALs)整合到语音技术中的重要一步,有助于语言复兴和数字包容。然而,极度的数据稀缺限制了模型性能。来自高资源语言的迁移学习显示出潜力,但在适应新语言时常遭遇灾难性遗忘。持续学习(CL)可以缓解这一问题,但在数据极其有限的情况下仍具挑战。为此,我们提出了两种混合持续学习方法:重放增强弹性权重巩固和约束引导知识蒸馏,以调整预训练语音模型用于AAL识别,同时保留先前学到的知识。在Warlpiri、Dalabon和Dharawal上的实验表明,所提方法优于微调和现有的CL基线,提高了对多种AAL的适应能力,同时保持了对先前学习的高资源语言的性能。

###### 关键词:

自动语言识别,低资源,澳大利亚原住民语言,持续学习。

## 1 引言

澳大利亚拥有超过250种原住民语言,但只有约123种仍在活跃使用,其中许多因代际传承有限而极度濒危\[battin2020national\]。随着语言流失风险加剧,技术支持对于记录和复兴至关重要。语言识别(LID)能自动检测音频信号的语言,在此工作中扮演关键角色。它支持语音识别、翻译和语音归档等下游应用,同时有助于高效语料库组织。因此,可靠的LID对于开发促进澳大利亚原住民社区保存、教育和包容的数字工具至关重要。

近年来,由大规模语音语料库支持的多语言语音建模取得了进展,使得高资源语言的LID几乎达到完美\[valk2021voxlingua107\]。然而,这些成果并未有效迁移到低资源场景,由于严重的数据稀缺,性能显著降低\[caswell2020language\]。对澳大利亚原住民语言(AALs)而言,挑战更为突出,因为它们通常表现出受限的说话人多样性以及有限的语言专业知识获取途径。

先前关于低资源语言的工作探索了通过全量或参数高效微调进行领域适应\[feng2019low, gaikwad2021cross, hu2022lora\]。然而,这些方法常常导致灾难性遗忘,即在适应新语言时,先前学习语言的性能显著下降。这一问题在必须同时支持高资源语言和新引入AALs的多语言系统中尤为关键。此外,为每种语言反复微调计算成本高昂,这凸显了对既能持续适应又能保持先前语言性能的方法的需求。

持续学习(CL)通过使模型适应新数据同时保留先前学到的任务来解决这些挑战。CL方法通常分为三类\[qu2021recent\]:(i)基于正则化的方法,如弹性权重巩固(EWC)\[EWC\],通过约束参数更新来保留先前学到的任务;(ii)基于重放的方法,如经验重放(ER)\[fedus2020revisiting\],通过回顾先前任务的代表性样本;(iii)知识蒸馏(KD)方法,通过从先前模型迁移知识来缓解遗忘\[mansourian2025comprehensive\]。然而,将这些方法应用于AALs仍然具有挑战性。在长期适应多种AALs的过程中,由于口音、声学条件和语言的差异可能干扰先验知识\[van2019three\],正则化方法的效果变差,并且随时间累积的惩罚可能导致数值不稳定\[jones2018continual\]。ER和KD也难以应对新引入语言与先前学习语言之间的数据不平衡,这在极端低资源的AALs中很常见,可能阻碍适应或破坏先前知识的稳定性\[qu2021recent, hou2019learning\],表明单独使用ER或KD不足以在此类设置中防止灾难性遗忘。

近期研究探索了结合多种CL方法的混合方法,以克服单一方法在其他领域的局限性\[li2024continual\]。例如,Sun等人\[sun2020distill\]和Cappellazzo等人\[cappellazzo2022investigation\]提出,结合ER和KD比单独使用能提高准确性并减少遗忘,特别是在自然语言和口语语言理解的类增量设置中。然而,混合策略在LID领域,尤其是对于高度低资源语言,仍鲜有探索。现存的ER–KD混合方法可能也适合AALs,但它们对数据不平衡仍然敏感\[qu2021recent, hou2019learning\],这是AALs的一个关键挑战。因此,此类方法仍可能遭受学习偏差和遗忘,突显了专门为极端低资源场景设计的混合CL框架的必要性。

为了解决极端低资源AALs的局限性,我们提出了两种混合持续学习框架,以克服严重的数据稀缺和灾难性遗忘:(1)重放增强弹性权重巩固(RA-EWC),它通过选择性重放过去样本来增强EWC(EWC通过限制重要模型参数的变化来保留先前获得的知识),以强化早期学习;(2)约束引导知识蒸馏(CG-KD),它将EWC与KD(先前训练的模型通过软目标预测指导新模型的学习)相结合,以实现极端稀缺条件下的稳健适应。这些方法特别适合AALs,因为RA-EWC即使在重放记忆非常有限时也能支持稳定学习,而CG-KD保护重要模型参数并保留先前训练模型的行为,使得对新语言的适应更加可靠。

我们在三种极端低资源的AALs(Warlpiri、Dalabon和Dharawal)上评估了所提方法,并针对两种不同任务:(i)单一AAL适应,将预训练模型扩展到学习单一AAL;(ii)跨多种AAL的顺序适应,实现增量学习而不遗忘。据我们所知,这是首个在极端低资源语言识别任务中引入混合CL方法的工作。

## 2 所提出的混合持续学习

我们提出了两种混合方法,RA-EWC和CG-KD,以应对低资源AAL识别中的挑战。RA-EWC通过结合ER来增强EWC,如图1(https://arxiv.org/html/2607.11946#S2.F1)所示。这种混合设计允许模型即使在使用有限的重放样本时也能保留从先前语言中学到的重要参数(\(F_i\)),从而在AAL的持续适应过程中稳定学习并减轻灾难性遗忘。如图2(https://arxiv.org/html/2607.11946#S2.F2)所示,所提出的CG-KD将KD与EWC相结合以指导持续学习。学生模型学习目标低资源语言的表示,同时保持其在高资源语言上的输出,与冻结的教师模型(即持续学习前的预训练模型)相匹配。

参见图注
图1:重放增强弹性权重巩固(RA-EWC)概述,结合了EWC和ER。它使用三种损失:在新AAL数据上的负对数似然损失 \(\mathcal{L}_{\text{LRL}}\)、在存储的重放样本上的重放损失 \(\mathcal{L}_{\text{ER}}\),以及保护重要参数的正则化约束 \(\mathcal{L}_{\text{EWC}}\)。所有损失联合优化以调整模型。

### 2.1 重放增强弹性权重巩固(RA-EWC)

**对代表性缓冲区的约束**。通过维护一个包含先前见过的高资源语言 \(\mathcal{D}_{\mathrm{HRL}}\) 样本的小型重放缓冲区 \(\mathcal{B}\),可以通过周期性地将模型重新暴露于源域来缓解遗忘\[fedus2020revisiting\]。在持续适应AALs期间,每个训练批次包含新观察到的低资源数据 \(\mathcal{D}_{\mathrm{LRL}}\) 和重放样本 \(\mathcal{B} \subset \mathcal{D}_{\mathrm{HRL}}\)。因此,适应目标将低资源数据的负对数似然(NLL)损失 \(\mathcal{L}_{\mathrm{LRL}}\) 与高资源重放数据的NLL损失 \(\mathcal{L}_{\mathrm{ER}}\) 结合,如下所示:

\[\mathcal{L}_{\text{LRL}}(\theta) = \mathbb{E}_{(x,y)\sim\mathcal{D_{\text{LRL}}}} \left[\mathcal{L}\big(f_{\theta}(x),y\big)\right] \tag{1}\]
\[\mathcal{L}_{\text{ER}}(\theta) = \mathbb{E}_{(x,y)\sim\mathcal{B}} \left[\mathcal{L}\big(f_{\theta}(x),y\big)\right] \tag{2}\]

这里,\(f_{\theta}(x)\) 表示持续适应模型对给定输入 \(x\) 的输出,\(y\) 表示相应的真实标签。

**对关键权重的约束**。惩罚对先前学习的高资源语言 \(\mathcal{D_{\text{HRL}}}\) 重要的参数的变化,有助于约束权重更新并防止灾难性遗忘。每个预训练参数 \(\theta_i\) 的重要性通过重要性分数 \(F_i\) 来量化,它是Fisher信息矩阵 \(\mathbf{F}\) 的第 \(i\) 个对角元素\[kirkpatrick2017overcoming\]。\(\mathbf{F}\) 矩阵为对损失影响较大的参数赋予较高值,表明对这些参数的更改会显著影响先前学习任务的性能,而值较低的参数则不那么关键。设 \(\theta_i^*\) 表示持续学习期间更新的模型参数,因此正则化损失为:

\[\mathcal{L}_{\text{EWC}}(\theta) = \sum_i F_i (\theta_i^* - \theta_i)^2 \tag{3}\]

最小化该损失函数可确保重要参数保持接近其先前的值,从而在持续学习新语言的同时减少遗忘。

**总损失**。总损失是新语言的NLL损失 \(\mathcal{L}_{\text{LRL}}\) 与正则化损失的组合:

\[\mathcal{L}_{Total}(\theta) = \mathcal{L}_{\text{LRL}}(\theta) + \beta\,\mathcal{L}_{\text{ER}}(\theta) + \lambda\,\mathcal{L}_{\text{EWC}}(\theta) \tag{4}\]

其中 \(\lambda\) 和 \(\beta\) 是平衡各项之间权衡的超参数。

### 2.2 约束引导知识蒸馏(CG-KD)

参见图注
图2:约束引导知识蒸馏(CG-KD)的整体架构,整合了KD和EWC。学生从新的AAL数据中学习,并通过 \(\mathcal{L}_{\text{KLD}}\) 损失将其高资源语言输出与冻结的教师输出对齐。正则化项 \(\mathcal{L}_{\text{EWC}}\) 保护关键权重,\(\mathcal{L}_{\text{LRL}}\) 支持新语言的准确分类。所有损失联合优化以更新模型。

使用Kullback–Leibler散度(KLD)损失来调整学生模型,使其通过将在先前学习的高资源语言类别 \(i\) 上的输出分布与预训练教师对齐,从而保留知识:

\[\mathcal{L}_{\text{KLD}} = -\sum_i p_i^{\text{te}}(T) \log p_i^{\text{st}}(T) \tag{5}\]

这里,\(p_i^{\text{te}}(T)\) 和 \(p_i^{\text{st}}(T)\) 分别表示教师和学生模型使用温度缩放softmax计算得到的软概率分布:

\[p_i^{\text{te}}(T) = \frac{\exp(z_i^{\text{te}}/T)}{\sum_j \exp(z_j^{\text{te}}/T)}, \quad p_i^{\text{st}}(T) = \frac{\exp(z_i^{\text{st}}/T)}{\sum_j \exp(z_j^{\text{st}}/T)} \tag{6}\]

其中 \(z_i^{\text{te}}\) 和 \(z_i^{\text{st}}\) 分别表示教师和学生对于高资源语言 \(i\) 的逻辑值,\(T\) 是温度超参数。通过在softmax之前除以 \(T\),较高的 \(T\) 会软化输出分布,增加非目标类别的相对概率,从而揭示类别间的相似模式,有助于在知识迁移中捕捉类间关系。

此外,通过公式(3)(https://arxiv.org/html/2607.11946#S2.E3)中的正则化损失应用EWC,约束学生模型的重要参数,并在适应过程中促进稳定性。为了有效学习低资源语言,还包含NLL损失 \(\mathcal{L}_{\text{LRL}}\),以优化新引入语言的分类性能。

**总损失**。CG-KD的总损失是 \(\mathcal{L}_{\text{LRL}}\)、正则化损失和KLD损失的加权和:

\[\mathcal{L}_{\text{total}}(\theta) = (1-\alpha)\,(\mathcal{L}_{\text{LRL}}(\theta) + \lambda\,\mathcal{L}_{\text{EWC}}(\theta)) + \alpha\,\mathcal{L}_{\text{KLD}}(\theta) \tag{7}\]

其中 \(\alpha\) 控制学习新语言与保留先前语言知识之间的平衡。

表1:高资源语言(HRL)和三种AALs(Warlpiri、Dalabon和Dharawal)的性能(F1-score %)。“Source”和“TL”分别指未适应的预训练模型和朴素迁移学习。最佳结果以**粗体**突出显示。

## 3 实验设置

### 3.1 数据集

**AAL数据集**。实验在三种AALs上进行:Warlpiri、Dalabon和Dharawal。Warlpiri\[doreco-warl1254\]和Dalabon\[doreco-ngal1292\]的语音数据来自DoReCo数据集\[doreco\],分别包含18名和4名说话人的录音。Dharawal录音来自Dharawal Words网站¹¹¹https://www.dharawalwords.com.au/\[dang2025characterization\]的公开资源,包含8名说话人。尽管与高资源语言相比规模较小,但这些是可用的最大AAL语音数据集,突显了严重的数据稀缺。所有录音均经过人工检查,并移除了语音不清、静音、过度噪声或损坏的文件,以保持语言完整性和有意义的嵌入。预处理后,音频被降采样至16 kHz并分割成8-10秒的片段,得到Warlpiri的1125条话语(3小时)、Dalabon的284条话语(40分钟)和Dharawal的63条话语(11分钟)。每个数据集按80/10/10的比例划分为训练集、验证集和测试集。

**高资源语言**。高资源语言的语音数据来自VoxLingua107\[valk2021voxlingua107\],选取了

相似文章

语音识别中的Convex低资源口音鲁棒语言检测

Hugging Face Daily Papers

本文介绍了CLD,一种基于凸优化的轻量级语言检测头(用于ASR),在不到100个训练样本下实现97-98%的准确率,同时将计算成本降低13倍,解决了5种语言和24种子方言的口音和方言鲁棒性问题。

基于音调条件的课程学习用于低资源班图语语音识别

arXiv cs.CL

本文提出了一种基于音调条件的课程学习框架,用于低资源班图语语音识别,结合了混合难度评分、门控适配器和分阶段课程训练。对六种南部班图语的评估显示,W2V-BERT在恩古尼语上优于Whisper,而Whisper在索托-茨瓦纳语上表现更好。

面向大型语言模型归因引导的持续学习

arXiv cs.LG

本文提出了一种面向大型语言模型的归因引导持续微调框架,该框架能够估计 Transformer 层中特定任务相关的参数重要性并相应地调节梯度,在保持新任务性能的同时缓解了灾难性遗忘。