从单语到多语:评估Mamba在南非语言中的ASR性能

arXiv cs.CL 论文

摘要

本文评估了Mamba状态空间模型在七种南非语言上的ASR性能,发现其在资源更少的情况下达到了与Conformer相当的准确率,并探讨了多语训练策略和低资源场景。

arXiv:2607.01502v1 公告类型:新 摘要:自动语音识别(ASR)的最新研究探索了不同的序列模型,包括基于Conformer的模型和更新的状态空间模型(如Mamba)。尽管先前的工作已在多种语言上评估了这些架构,但它们在非洲语言中的有效性仍未被充分探索。在本工作中,我们评估了Mamba在七种南非语言上的ASR性能。在单语实验中,每个模型每种语言使用50小时的语音进行训练,并将Mamba与参数规模相似的Conformer基线进行比较。Mamba在实现与Conformer相似的识别准确率的同时,使用了更少的计算资源且训练速度更快。我们进一步评估了该场景下的泛化能力,发现两种模型都难以泛化到比训练数据长很多的语音。随后,我们研究了使用Mamba模型的多语ASR,基线是将所有语言数据合并在一起。在此基础上,我们测试了三种扩展:使用语系信息进行训练,将语言和语系嵌入作为偏置添加到下采样的声学表示中;以及使用CTC ASR目标和语言识别(LID)头的多任务学习。我们发现多语训练一致地优于单语训练。然而,添加显式语言信息并未改善域内性能,但提高了跨语料库的鲁棒性。我们使用每种语言5小时和10小时的训练数据进行了低资源多语场景的消融研究,观察到使用语言嵌入带来的增益,并进一步证明移除或改变它们会损害模型性能。最后,我们分析了这些嵌入,发现它们并未从类型学角度捕捉语言相似性,而是充当了任务特定的控制向量。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:40

# 从单语到多语:评估 Mamba 在南非语言语音识别中的表现
来源:https://arxiv.org/html/2607.01502
###### 摘要

近年来,自动语音识别 (ASR) 领域的进展探索了不同的序列模型,包括基于 Conformer 的模型以及 Mamba 等较新的状态空间模型。虽然先前的工作已经在多种语言上评估了这些架构,但它们在非洲语言上的有效性仍未得到充分探索。在这项工作中,我们在七种南非语言上评估了 Mamba 在 ASR 中的表现。在单语实验中,每个模型基于每种语言 50 小时的语音进行训练,并将 Mamba 与参数规模相似的 Conformer 基线进行比较。Mamba 在使用更少计算资源且训练更快的情况下,实现了与 Conformer 相似的识别准确率。我们进一步评估了该设置下的泛化能力,发现两种模型都难以泛化到比训练数据长得多的语音。然后,我们使用 Mamba 模型研究多语 ASR,其中基线是将所有语言的数据合并在一起。在此基础上,我们测试了三种扩展:通过将语言和语系嵌入作为偏置添加到降采样后的声学表示中来使用语系信息进行训练;以及结合 CTC ASR 目标和语言识别 (LID) 头的多任务学习。我们发现,多语训练相比单语训练持续提升了性能。然而,添加显式语言信息虽未提升域内性能,但提升了跨语料库的鲁棒性。我们在低资源多语设置下(每种语言 5 小时和 10 小时训练数据)进行了消融研究,观察到了使用语言嵌入带来的增益,并进一步证明移除或更改它们会损害模型性能。最后,我们分析了这些嵌入,发现它们并未从类型学角度捕捉语言相似性,而是充当了任务特定的控制向量。

## I. 引言

自动语音识别 (ASR) 研究随着强大的序列建模架构的发展取得了显著进展 [1, 2, 3]。诸如 Conformer [4] 这样的基于注意力的模型,通过整合自注意力和卷积模块来捕捉局部和全局依赖关系,已成为强大的基线。最近,基于状态空间模型 (SSM) 的架构,如 Mamba [5],作为高效的替代方案出现,与二次时间复杂度的注意力机制相比,提供了线性时间序列建模和有利的内存扩展,这使其特别适用于长语音处理。

尽管取得了这些进展,但针对 ASR 的 Mamba 研究主要集中在高资源语言、少数低资源语言、长上下文 ASR、多语 ASR 以及流式 ASR 上,且通常与基于 Conformer 及其他架构进行比较 [6, 7, 8]。对非洲语言的关注相对较少,这些语言面临“低资源双重困境” [9]:有限的标注语音数据和受限的计算资源。尽管最近的工作已扩展了非洲语言的语音资源 [10, 11],但仍需了解 Mamba 在数据有限和长语音识别条件下的表现。

长语音 ASR 在低资源环境中非常重要,因为现实中的语音在话语长度上表现出巨大差异,从简短提示短语到长篇自发语音。然而,数据可用性有限通常导致训练期间对长话语结构的覆盖不足,使得模型难以学习跨序列长度鲁棒的表示。先前关于高资源语言长语音 ASR 的工作,包括 [12] 的研究,表明对长话语进行建模会带来在长输入上保持鲁棒性以及处理序列长度分布变化的挑战。这些挑战在低资源环境下可能会被放大。这凸显了在有限监督下构建鲁棒 ASR 系统的难度,并激发了多语训练策略的使用,这些策略常用于缓解低资源 ASR 中的数据稀缺问题。

为弥补这些空白,我们对 Mamba 在七种南非语言的 ASR 应用中进行了系统研究。我们首先在单语环境中将 Mamba 与基于 Conformer 的编码器基线进行比较,其中每个模型基于每种语言约 50 小时的转录语音进行训练。我们的分析聚焦于长上下文识别行为和长度泛化能力。然后,我们将研究扩展到使用基于 Mamba 模型的多语设置。在此设置中,我们考虑一个合并的多语基线和三种用于融入语言信息的扩展:(i) 将语言嵌入作为偏置添加到声学表示中,(ii) 在 (i) 的基础上进一步融入语系嵌入作为偏置,以及 (iii) 一个结合连接时序分类 (CTC) ASR 目标和辅助语言识别 (LID) 头的多任务学习设置。我们进一步在低资源多语条件下(每种语言 5 小时和 10 小时设置,这是 ASR 中常用于缓解数据稀缺的设置)分析了方法 (ii),以研究显式语言条件化的效果。此外,我们还探究了语言嵌入所学到的表示。

我们的结果显示,在单语环境中,不同语言之间存在性能差异,恩古尼语族比索托语族更具挑战性。Mamba 实现了与参数大小相似的 Conformer 模型相当的性能,同时使用更少的计算资源且训练更快,这表明 SSM 能够匹敌南非 ASR 中强大的基于注意力的基线。两种模型对于远长于训练数据的语音都表现出有限的鲁棒性,凸显了长度泛化方面的挑战。在多语环境中,联合训练持续优于单语模型,证实了跨语言参数共享的好处。然而,融入显式语言或语系信息并未提升域内性能,但提升了跨语料库的鲁棒性。此外,在低资源多语环境中,显式语言嵌入提供了持续的性能提升。进一步分析表明,这些嵌入并未在类型学意义上捕捉语言相似性,而是充当了任务特定的引导向量。

表 I:我们实验的数据集统计信息。仅使用了 NCHLT 和 FLEURS 的测试集。
## II. 南非语言 ASR

语言特征:南非是一个多语言国家,宪法承认 11 种官方语言,南非手语最近也被授予官方地位。这些语言大多属于班图语系,而南非语和英语属于日耳曼印欧语系。南非使用的班图语言包括恩古尼语族(祖鲁语、科萨语、斯瓦蒂语和南恩德贝莱语),它们在许多语言学分类中与聪加语(属于茨瓦-龙加语支)一起构成更广泛的恩古尼-聪加语组。它们还包括索托-茨瓦纳语族(南索托语、北索托语和茨瓦纳语),以及文达语,后者属于文达语支,常被归类到更广泛的索托-文达(或索托-马库阿-文达)语组。所有这些语言都使用拉丁字母,并且在非正式口语中,与英语或其他语言的语码转换很常见。

ASR 资源:非洲语言 ASR 研究的一个主要挑战是资源稀缺,尤其是缺乏大规模、高质量的训练和评估数据集 [13, 14]。对于南非语言,存在一些资源,包括 Codeswitch Soap opera [15]、NCHLT Speech 语料库 [16, 17]、Lwazi ASR [18]、Common Voice [19]、FLEURS [20]、Vuk'uzenzele (ViXSD) [21] 以及最近发布的 Swivuriso [10] 数据集,后者涵盖七种语言,而 NCHLT Speech 和 Lwazi ASR 涵盖十种语言。这些数据集为 ASR 开发奠定了基础。

ASR 建模:鉴于非洲语言资源有限,一些工作专注于开发南非语言的 ASR 系统。特别是,先前的工作已经处理了涉及英语的语码转换语音,包括双语和多语系统的比较,以及针对这些语言背景定制的声学建模,重点关注诸如祖鲁语、科萨语、茨瓦纳语和南索托语等语言 [22, 23, 24, 25]。此外,多语语音编码器已被开发出来以改进这些语言的表示 [26, 27]。尽管取得了这些进展,仍然需要资源高效的 ASR 模型,例如基于 Mamba 的模型,这些模型应能在训练数据有限、计算约束以及话语长度变化的情况下保持鲁棒性能。

## III. 实验设置

### III-A. 数据集

在我们的实验和分析中,我们使用了来自三个来源的 ASR 数据,分别是:

Swivuriso:[10] 是一个用于南非语言的大规模语音语料库,涵盖七种语言,包括南恩德贝莱语 (nbl)、南索托语 (sot)、茨瓦纳语 (tsn)、聪加语 (tso)、文达语 (ven)、科萨语 (xho) 和祖鲁语 (zul)。它包含涵盖农业、医疗保健和日常对话等领域的脚本化和非脚本化语音,每种语言有超过 90 位说话者。转录包含变音符号、标点符号、特殊符号,例如 [cs] 表示语码转换,[pause] 表示停顿,以及 [?]。

在本研究中,我们将短话语定义为 0 到 30 秒之间的语音片段,这反映了典型的 ASR 训练条件。长于此长度的片段被视为长话语。我们为每种语言采样 50 小时的短话语,以构建一个平衡的数据集,该数据集包含来自训练集的脚本化和非脚本化语音。使用来自开发集的短话语进行验证,而开发测试集则被分为短话语和长话语子集用于评估。表 I 总结了数据集的统计信息。在测试集中,除祖鲁语外,大多数语言的短话语数量至少是长话语的两倍。

NCHLT Speech 语料库:[16, 17] 是另一个覆盖南非所有 11 种官方语言的大规模语音语料库。它包含超过 100 小时的脚本化语音,每种语言有超过 200 位说话者。我们仅使用了与 Swivuriso 共享的七种语言的测试集。

FLEURS:[20] 是一个多语语音语料库,覆盖 102 种语言,通过录制由人工翻译成相应语言的文本创建而成。它仅包含四种南非语言,但本工作仅使用了其中科萨语和祖鲁语。我们使用了这两种语言的测试集。

### III-B. 数据集预处理

所有音频文件被降采样到 16 kHz。转录文本通过使用 Unicode 规范化形式 C (NFC) 进行规范化预处理,去除除少数符号外的所有标点。保留的标点符号包括 ?\!-́,.;%=\+\*\# 和数字。我们还去除了数据集中注意到的特殊标记,包括 [pause], [um], [cs], 和 [?],并将所有转录文本转换为小写。

### III-C. 模型架构

在我们的实验中,我们使用基于 Mamba 或 Conformer 架构的编码器-仅 ASR 模型,两者均使用连接时序分类 (CTC) 进行训练,并使用字符级建模。我们选择 CTC 是因为其简单性、计算效率以及在相关工作中的先前应用 [12]。为确保公平比较,两种架构共享相同的配置,包括 18 个编码器层、隐藏层大小为 512 以及前馈维度为 2048,从而产生可比较的模型规模(Conformer 为 1.14 亿参数,Mamba 为 1.23 亿参数)。

Conformer 遵循标准架构 [4],由相对位置自注意力 [29]、卷积模块和前馈网络组成。相比之下,Mamba 完全用状态空间序列建模机制取代了自注意力。对于基于 Mamba 的系统,我们采用 ConMamba [30],这是一种为语音处理设计的架构,集成了双向 Mamba 模块(BiMamba; d_state=16, expand=2, d_conv=4)、前馈网络和卷积模块,以高效捕捉局部和长程依赖关系。

### III-D. ASR 训练策略

我们的实验考虑单语和多语训练机制。在单语设置中,我们为每种语言使用特定语言的数据训练单独的模型,并在相应语言上进行评估。对于多语设置,我们通过合并单语数据评估了五种训练策略。

1. 多语隐式 (MI):一个模型在所有语言的合并数据上训练,不使用任何显式语言信息。
2. 多语隐式语系 (MIF):对于每个语系,一个模型在该语系所有语言的合并数据上训练,不使用任何显式语言标识信息。
3. 多语语言嵌入 (MLE):类似于 (1),但引入了一个可学习的语言嵌入矩阵 E^(l) ∈ R^(n_lang × 32)。对于属于语言 l 的每个输入序列,相应的嵌入被添加到由 CNN 下采样模块产生的声学表示中:h'_t = h_t + e_l, ∀t, (1) 其中 h_t ∈ R^32 是帧级声学表示,e_l ∈ R^32 是对应于语言 l 的嵌入。产生的表示随后被馈送到 Mamba 模块中。与 [31]

相似文章

具有自适应退出状态选择的循环状态空间语言模型

arXiv cs.AI

本文探索了使用Mamba和混合Mamba-Transformer骨干网络的循环(递归)状态空间语言模型,表明其在推理任务上优于非循环基线,并在等参数和等FLOPs预训练下保持竞争力,同时自适应退出状态选择改善了中间深度性能。