基于音调条件的课程学习用于低资源班图语语音识别

arXiv cs.CL 论文

摘要

本文提出了一种基于音调条件的课程学习框架,用于低资源班图语语音识别,结合了混合难度评分、门控适配器和分阶段课程训练。对六种南部班图语的评估显示,W2V-BERT在恩古尼语上优于Whisper,而Whisper在索托-茨瓦纳语上表现更好。

arXiv:2606.31642v1 公告类型: 新 摘要: 南部班图语有超过8000万使用者,但当前的基石ASR模型零样本词错误率仍高于100%,这限制了其在教育和公共服务中的实际应用。我们针对6种南部班图语提出了一种基于音调条件的课程框架,结合了混合难度评分、基于音调统计的门控适配器和分阶段课程训练。我们在社区语料库上训练,并在NCHLT上测试迁移,以评估超出匹配评估的鲁棒性。结果揭示了架构与语言之间的清晰交互:W2V-BERT在恩古尼语上比Whisper的词错误率低3到4个百分点,而Whisper在索托-茨瓦纳语上表现更好。带有音调条件的W2V-BERT在数据集上平均词错误率为28.41%,在Xitsonga迁移上为23.79%。没有单一模型适合所有6种语言,因此部署时应根据语言进行模型选择,并在语料库间进行验证。
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:34

# 基于调值条件课程学习的低资源班图语语音识别
来源: https://arxiv.org/html/2606.31642
Mokgosi Marivate MundiaNetshifhefhe Mogale Sindane

VukosiSitwalaUnarineTsholofelo HopeThapelo1都柏林科技大学, 爱尔兰 2数据科学促进社会影响力, 比勒陀利亚大学, 南非 3Lelapa AId23126641@mytudublin\.ie (https://arxiv.org/html/2606.31642v1/mailto:[email protected])

###### 摘要

南部班图语的使用人数超过8000万,但目前的基础语音识别模型在零次学习场景下的词错误率(WER)仍高于100%,这限制了它们在教育和公共服务中的实际应用。我们针对这一问题提出了一种基于调值条件的课程学习框架,针对6种南部班图语,结合了混合难度评分、基于调值统计的门控适配器以及分阶段课程训练。我们在社区语料库上训练模型,并在NCHLT上测试迁移能力,以评估在匹配评估之外的鲁棒性。结果表明,架构和语言之间存在明显的交互作用:W2V-BERT在恩古尼语族上的WER比Whisper低3到4个百分点,而Whisper在索托-茨瓦纳语族上表现更好。结合调值条件的W2V-BERT在数据集上的平均WER达到28.41%,在茨松加语上的迁移WER为23.79%。没有任何单一模型适用于所有6种语言,因此部署时应根据每种语言选择模型,并在不同语料库上进行验证。

###### 关键词:

班图语、语音识别、课程学习、调值、低资源ASR

## 1 引言

南部班图语,如isiZulu、isiXhosa、Sesotho、Setswana、Tshivenda和Xitsonga,是撒哈拉以南非洲地区使用最广泛的语言之一\[badenhorst2022nchlt\],并在南非拥有官方地位。这些语言仍主要以口头形式存在,其声调和韵律编码着语法和文化差异,而这些并未在书面语中完全体现。随着社区在教育与数字服务中扩大语言使用,有限的语音技术成为了障碍\[sutherland2024navajo,reitmaier2022opportunities\]。Whisper\[radford2023robust\]和MMS\[pratap2024scaling\]等基础模型在零次学习场景下的词错误率(WER)超过100%,需要进行反映每种语言音系特征的有针对性微调。班图语音系给自动语音识别带来了特有挑战:与普通话中声调主要局限在音节层面不同,班图语系统表现出高声调扩展和短语级调形,这些调形编码着词汇意义和语法关系\[zerbian08\_interspeech,mixdorff11\_interspeech\]。标准正字法通常省略声调,因此模型必须跨形态边界恢复调值依赖关系\[mohasi2011acoustic\],这为课程学习创造了自然的难度梯度。

基于WER的课程评分能改进自动语音识别(ASR),但忽略了每种语言的音系特征\[karakasidis22\_interspeech\]。需要一种音系学信息的方法,因为通用微调忽视了班图语特有的声调和形态对比。因此,我们研究结合WER难度与形态调值特征是否能改进课程学习,以及调值条件适配器和课程调度是否对不同ASR架构产生同等益处。

我们的贡献如下:

1. 1\. 提出了一种混合难度评分函数,结合WER与形态调值特征用于课程学习。
2. 2\. 提出了门控调值条件适配器(约210万参数),根据每条话语的调值统计调节编码器表示。
3. 3\. 在Whisper、W2V-BERT和MMS上,基于两个数据集进行评估,揭示了不同语系对架构的偏好。
4. 4\. 跨数据集泛化分析表明,W2V-BERT在恩古尼语族上迁移表现更优。

参见图注图1:所提出框架概览。(a)预训练阶段根据WER和调值特征计算混合难度分数。(b)微调阶段采用课程调度与门控调值条件适配器。(c)推理阶段应用训练好的模型。
## 2 相关工作

ASR中的课程学习按估计难度排序训练样本,使模型先学习稳定模式再处理困难情况\[ranjan2021curriculum,kuznetsova2022curriculum\]。难度定义方式包括时长、信噪比、模型损失和识别错误\[karakasidis22\_interspeech\]。已有报告显示,在低资源设置下优化方差降低,以及结合课程与适配器处理构音障碍语音时WER降低41.02%\[kuznetsova2022curriculum,tan2025cba\]。Hsieh等人\[hsieh2024dysarthric\]进一步表明,模型推断的难度可能优于人工评分。在远场ASR中,Ranjan和Hansen\[ranjan2021curriculum\]比较了CL-DH、CL-DM和CL-DHM,其中CL-DM通过渐进式数据合并实现了高达10.1%的相对WER降低\[ranjan2017curriculum\]。Karakasidis等人\[karakasidis22\_interspeech\]还发现基于WER的排序优于基于时长和损失的评分,而相关方法改进了语音翻译和多语言迁移\[wang2020curriculum,zhou2022exploring\]。

声调建模仍然困难,因为音高轮廓在声调语言中同时区分词义和语法功能\[adams2017phonemic,sarma18\_speechprosody\]。现有方法要么将声调折叠到组合的元音和声调单元中,要么将声调与分段信息分开建模\[lee2002using,coto2021explicit\];基于音高的方法已在粤语和Bribri语中取得改进,包括在显式声调符号设置下4–25%的CER降低\[zhao21c\_interspeech,coto2021explicit\]。南部班图语的声调系统与许多东亚语言不同,因为它涉及跨词边界的扩展规则、边界效应以及与形态的紧密耦合\[mohasi2011acoustic,zerbian08\_interspeech\]。Mohasi等人\[mohasi2011acoustic\]和Mixdorff等人\[mixdorff11\_interspeech\]将这些模式与F0行为和词识别联系起来,而Zerbian和Barnard\[zerbian08\_interspeech\]展示了可测量的ASR影响。现有研究对该现象描述充分,但很少将声调复杂性直接融入课程设计或适配器门控中。

在低资源非洲ASR中,多语言预训练改进了基线性能,但大型模型对南部班图语的零次学习准确率仍然较弱\[ogunremi2023multilingual,nzeyimana2023kinspeak,zhang2023fast\],OpenASR评估仍报告预训练系统的WER在32%到68%之间\[peterson2022openasr21\]。这一差距既有技术维度也有社会技术维度,因为数据集治理和部署环境会影响说话人社区的可用性\[sutherland2024navajo,reitmaier2022opportunities\]。由社区治理的资源(如Swivuriso)比实验室语料库(如NCHLT)记录了更广泛的录音条件,因此为部署训练提供了更现实的测试平台\[marivatee2025swivuriso0,badenhorst2022nchlt\];而跨方言和领域的课程学习与迁移表明,结构化训练顺序能提高在分布偏移下的鲁棒性\[suwanbandit2023thai,caubriere19\_interspeech\]。我们的方法结合了基于WER的课程学习与显式调值条件化,针对南部班图语ASR进行构建。

## 3 方法

表1:各语言在Swivuriso (S) 和 NCHLT (N) 上的词错误率 (%)。每种架构的最佳结果以粗体显示。配置包括:多语言(联合多语言微调,无调值适配器或课程)、调值条件(调值条件适配器)、调值+课程(调值条件适配器与混合课程,WER+调值)和课程(仅基于WER的课程,无调值适配器)。图1 (https://arxiv.org/html/2606.31642#S1.F1) 展示了基于调值条件的课程学习框架,该框架受两个约束条件指导:南部班图语训练数据有限以及保留声调语言结构。该流程包括三个阶段:混合难度评分、带门控适配器的分阶段微调以及推理。

### 3.1 混合难度评分

为了形式化课程难度,我们定义了一个混合分数,平衡经验模型性能和语言复杂度。遵循Karakasidis等人\[karakasidis22\_interspeech\],我们使用WER评分作为主要成分,每条话语的分数s(u) 计算如下:

s(u) = α · WER_norm(u) + β · Tonal_norm(u)   (1)

其中α=0.7,β=0.3,分别加权WER和调值成分。我们设置α > β,因为识别错误是最强的单一难度指标\[karakasidis22\_interspeech\],并且敏感度分析留待未来工作。WER_norm 使用在Swivuriso上训练的冻结微调Whisper基线计算,所有分数在课程训练前预先计算。Tonal_norm 聚合了形态调值特征,对转换密度(0.3)和独特模式多样性(0.2)赋予更高权重,然后将话语映射到难度五分位数,以实现分阶段调度。

### 3.2 调值特征提取

我们的特征流程量化每条话语的调值复杂度,无需强制对齐或手动语音转写,从而避免了对稀缺专家标注的依赖。我们使用Parselmouth\[mohasi2011acoustic\]以10ms间隔提取F0轮廓,音高范围为75–500Hz,在过滤无声帧后计算5个特征:转换率、独特声调数量、声调簇数量、F0标准差和F0范围。特征按语言进行z分数归一化,使用训练集统计量。由于在这些语言中,音高既承载意义也承载语法区分,较高的转换率与较高的识别难度相关。我们将F0离散化为相对于话语平均值的半音,并将值分入5个声调级别(高-高、高、中、低、低-低),阈值设为±2和±6半音\[zerbian08\_interspeech\],从而独立于绝对音高捕获相对声调目标。

### 3.3 调值条件门控适配器

我们在编码器最后一层之后、解码器之前,以话语级别将调值上下文注入编码器,通过4个并行的门控瓶颈适配器实现。一个2层门控MLP将5维调值向量f_tone 映射为门控值 g = σ(MLP(f_tone)),使用128单元隐藏层将5个调值输入映射为4个门控值,激活函数为ReLU和sigmoid。最终编码器输出 y 为:

y = x + Σ_{i=1}^{N} g_i · a_i(LN(x))   (2)

其中 a_i 是瓶颈线性层,将隐藏维度投影到256再投影回隐藏维度。适配器增加了约210万参数(Whisper-large-v3-turbo的0.3%),门控权重在适配器间共享,因此这种轻量设计可在小型社区数据集上训练,无需重新训练整个基础模型。当调值线索信息丰富时,门控值增加适配器贡献;对于调值轮廓更简单的话语,门控降低适配器影响,保留预训练表示。

### 3.4 分阶段课程训练

我们实施了一个灵感来源于CL-DM\[ranjan2021curriculum\]的三阶段调度。由于训练数据有限,一次性暴露全部难度范围可能导致在核心模式学习之前过度拟合最困难、噪声最大的样本,因此我们逐步引入更高难度的五分位数,并采用固定的步数分配。阶段1(步数1–650)使用最易的40%样本;阶段2(步数651–1300)扩展至最易的80%;阶段3(步数1301–2000)使用完整训练集。固定调度提高了可重复性,渐进式合并有助于在适应更难的调值模式时保持对简单结构的性能。

## 4 实验

### 4.1 数据集

我们使用Swivuriso/za-african-next-voices数据集\[marivatee2025swivuriso0\],这是一个由说话人社区开发的语料库,包含6种南部班图语的朗读语音:isiZulu 1,810条、isiXhosa 2,470条、Sesotho 2,717条、Setswana 4,299条、Tshivenda 1,192条、Xitsonga 3,500条。开发测试集包含15,988条样本,共26.7小时。该语料库由其说话人社区管理。为进行跨数据集评估,我们使用NCHLT,包含相同6种语言的41,964条样本。

表2 (https://arxiv.org/html/2606.31642#S4.T2) 报告了训练集难度统计。isiZulu和isiXhosa的平均难度分数最高(0.39),Setswana最低(0.29)。调值列报告了归一化的形态调值复杂度,负值表示低于平均复杂度,正值表示高于平均复杂度。Xitsonga的WER标准差最高(0.508),表明样本难度变异性大。音频重采样至16kHz,移除时长不在0.5–30秒范围内的话语,文本通过小写化、去除噪声标签(如"?"和"cs"标记)、去除标点符号和变音符号以及标准化空白进行归一化。

表2:按语言划分的训练集难度统计。N为每种语言的训练话语数量。WER和σ WER为来自冻结Whisper基线的每个话语WER的平均值和标准差。Diff.为平均混合难度分数,Tonal为归一化的形态调值复杂度。
### 4.2 训练与评估

模型在2块NVIDIA A100 80GB GPU上训练,使用bfloat16精度、AdamW优化器(β2=0.98)、梯度裁剪为1.0,随机种子42。对于W2V-BERT,有效批量大小为32(通过8×4梯度累积),学习率5×10^{-5},500步预热;而Whisper使用有效批量大小32(通过2×16累积),学习率1×10^{-5},预热步数根据配置在100–500之间。训练运行2,000步,课程变体使用每阶段650步。对于W2V-BERT CTC训练,我们构建了80–100个token的统一多语言词汇表,采用交错语言采样,并设置ctc_zero_infinity=True以保证稳定性。所有运行中关闭dropout,数据集从HuggingFace Hub流式加载以减少磁盘使用。评估使用贪心解码以确保CTC和seq2seq模型之间的一致性,报告词错误率、字符错误率和BERTScore F1(使用bert-base-multilingual-cased)。所有模型仅在Swivuriso上训练,在Swivuriso开发测试集(匹配)和NCHLT(迁移)上评估,未进行调整或超参数重新调优。每种架构评估4种配置:多语言基线微调、调值条件(仅门控调值适配器)、调值+课程(调值适配器与混合课程,α=0.7,β=0.3)和课程(仅按WER排序,无调值适配器)。

### 4.3 结果与讨论

表3 (https://arxiv.org/html/2606.31642#S4.T3) 报告了Swivuriso和NCHLT上的综合平均值。在适配之前,Whisper和MMS在这些语言上均失败,这与Reitmaier等人\[reitmaier2022opportunities\]的结果一致;但微调显著降低了错误率。仅在Swivuriso上(表1 (https://arxiv.org/html/2606.31642#S3.T1)),Whisper多语言配置达到了23.34%的WER,相对降低83.6%

相似文章

自监督语音模型中音调上下文的感知补偿

arXiv cs.CL

本文研究wav2vec2.0架构在汉语普通话中是否表现出对音调上下文的感知补偿,发现与人类听众相比,自监督模型中的证据有限,并表明监督微调可能是实现此类音系抽象所必需的。

语音识别中的Convex低资源口音鲁棒语言检测

Hugging Face Daily Papers

本文介绍了CLD,一种基于凸优化的轻量级语言检测头(用于ASR),在不到100个训练样本下实现97-98%的准确率,同时将计算成本降低13倍,解决了5种语言和24种子方言的口音和方言鲁棒性问题。