多语言预训练模型在尼泊尔自动语音识别中的比较分析

arXiv cs.CL 论文

摘要

本文提出了一个受控基准,比较了六种多语言预训练ASR模型在尼泊尔语音上的表现,发现Whisper-Large-v3-Turbo和IndicWav2Vec表现最佳,而CTC解码器的推理速度最高可提升29倍。该研究为尼泊尔ASR提供了首个标准化的、考虑效率的参考数值。

arXiv:2608.12327v1 公告类型:新 摘要:多语言预训练模型名义上支持尼泊尔语,但尚无受控基准在统一的微调协议下对它们进行比较。我们在OpenSLR SLR54尼泊尔语语料库(约165小时)上,使用相同的预处理、数据划分、优化器和系列匹配的学习率计划,微调了六个预训练模型(XLSR-53、IndicWav2Vec、MMS-1B、Whisper-Medium、Whisper-Large-v3-Turbo和Conformer-Hi),涵盖CTC自监督、自回归编码器-解码器和混合Conformer-CTC架构。我们在三个独立测试集(OpenSLR、FLEURS、Common Voice)上评估词错误率(WER)、字符错误率(CER)和实时因子(RTF)。Whisper-Large-v3-Turbo(WER 14.76%)和IndicWav2Vec(WER 14.89%)并列榜首,尽管参数规模相差9倍、预训练数据相差40倍,这提供了直接的经验证据,表明预训练中的语言家族邻近性可以替代原始规模,用于领域内尼泊尔语。在相同准确率下,CTC解码器的运行速度比自回归Whisper快29倍,将任何延迟预算下的实际部署偏好转向CTC。大规模多语言预训练(MMS-1B)在FLEURS上的域外性能下降最小(+12.55个百分点),表明规模带来的是鲁棒性,而非领域内的峰值准确率。由此产生的基准为尼泊尔ASR提供了首个标准化、多模型且考虑效率的参考数值。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:24

# 面向尼泊尔语音识别的多语言预训练模型比较分析
来源:https://arxiv.org/html/2608.12327
Suman Paudel 数学科学学院 科学技术研究所 特里布万大学 尼泊尔加德满都 dastonsuman1997@gmail\.com &助理教授 Sarbin Sayami 计算机科学与信息技术中央系 特里布万大学 尼泊尔加德满都

###### 摘要

多语言预训练模型名义上支持尼泊尔语,但目前尚无对照基准在统一的微调协议下对它们进行比较。我们在 OpenSLR SLR54 尼泊尔语语料库(约 165 小时)上,使用完全相同的预处理、数据划分、优化器以及按模型家族匹配的学习率调度,对六个预训练模型(XLSR-53、IndicWav2Vec、MMS-1B、Whisper-Medium、Whisper-Large-v3-Turbo 和 Conformer-Hi)进行微调,这些模型涵盖 CTC 自监督、自回归编码器–解码器以及混合 Conformer-CTC 架构。我们在三个独立测试集(OpenSLR、FLEURS、Common Voice)上评估词错误率(WER)、字符错误率(CER)和实时因子(RTF)。Whisper-Large-v3-Turbo(WER 14.76%)和 IndicWav2Vec(WER 14.89%)并列最佳,尽管两者参数规模相差 9 倍、预训练数据量相差 40 倍,这为“预训练中的语言家族近缘性可以替代原始规模”提供了针对域内尼泊尔语的直接经验证据。在相同准确率下,CTC 解码器比自回归 Whisper 快最多 29 倍,这使得实际部署偏好转向任何延迟预算下的 CTC。大规模多语言预训练(MMS-1B)在 FLEURS 上展现出最小的域外性能下降(+12.55 个百分点),表明规模带来的是鲁棒性而非峰值域内准确率。由此产生的基准为尼泊尔语 ASR 提供了首个标准化的、多模型、且考虑效率的参考数据。

\[ Extension = \.otf, UprightFont = \*\-regular, BoldFont = \*\-bold, ItalicFont = \*\-italic, BoldItalicFont = \*\-bolditalic \] \[ Extension = \.otf, UprightFont = \*\-Regular, BoldFont = \*\-Bold, Script = Devanagari \]

面向尼泊尔语音识别的多语言预训练模型比较分析

Suman Paudel 数学科学学院 科学技术研究所 特里布万大学 尼泊尔加德满都 dastonsuman1997@gmail\.com 助理教授 Sarbin Sayami 计算机科学与信息技术中央系 特里布万大学 尼泊尔加德满都

## 1 引言

自监督和弱监督多语言预训练已将资源丰富语言的自动语音识别(ASR)推进到接近人类的准确率(Baevski 等,2020 (https://arxiv.org/html/2608.12327#bib.bib4);Radford 等,2023 (https://arxiv.org/html/2608.12327#bib.bib9))。然而,这些进展并未均匀地传播到世界上约 7000 种语言(Besacier 等,2014 (https://arxiv.org/html/2608.12327#bib.bib36);Pratap 等,2024 (https://arxiv.org/html/2608.12327#bib.bib8))。

尼泊尔语(ne)是一种印度-雅利安语系语言,拥有约 3200 万母语使用者,使用天城文书写。它结合了送气/不送气辅音的对立、连字繁多的正字法、黏着形态和自由语序。公开许可的转写尼泊尔语语音数据量约为 165 小时(Kjartansson 等,2018 (https://arxiv.org/html/2608.12327#bib.bib24)),比英语少一个数量级。多个多语言预训练模型名义上支持尼泊尔语,要么通过显式的预训练纳入(MMS-1B、IndicWav2Vec),要么通过零样本多语言能力(Whisper)。然而,目前已发表的尼泊尔语 ASR 结果来自分散的单模型研究,每项研究只在一个数据集上评估一个模型,且使用不同的预处理流程。因此,跨模型比较一直无法实现,尼泊尔语从业者也无法获得站得住脚的模型选择指南。

本文填补了这一空白。我们在 OpenSLR SLR54 尼泊尔语语料库上,采用相同的预处理和训练协议,对来自三个架构家族的六个多语言预训练 ASR 模型进行微调,然后在三个独立测试集上沿三个正交维度评估它们:准确率(WER、CER)、推理效率(RTF)和尼泊尔语特定错误模式。

贡献。(i)尼泊尔语 ASR 的首个标准化多模型多数据集基准。(ii)从经验上分离预训练的“近缘性”与“规模”,表明二者是权衡关系而非叠加关系。(iii)尼泊尔语 ASR 首次 RTF 测量,揭示了 CTC 与自回归之间 29 倍的速度差距。(iv)基于测量的逐场景部署建议。(v)在 Hugging Face Hub 上公开发布全部六个微调检查点以及逐话语参考/预测基准数据集。

## 2 相关工作

#### 自监督语音预训练。

Wav2Vec 2.0(Baevski 等,2020 (https://arxiv.org/html/2608.12327#bib.bib4))通过对遮蔽隐表示进行对比预测来学习语音表示。多语言扩展包括 XLSR-53(Conneau 等,2021 (https://arxiv.org/html/2608.12327#bib.bib5))(53 种语言)、XLS-R(Babu 等,2022 (https://arxiv.org/html/2608.12327#bib.bib6))(128 种语言,43.6 万小时)、HuBERT(Hsu 等,2021 (https://arxiv.org/html/2608.12327#bib.bib32))和 WavLM(Chen 等,2022 (https://arxiv.org/html/2608.12327#bib.bib33))。大规模多语言语音(MMS)项目(Pratap 等,2024 (https://arxiv.org/html/2608.12327#bib.bib8))将该方法扩展到超过 1100 种语言(包括尼泊尔语),发布了带各语言 CTC 头的 MMS-1B。

#### 编码器-解码器与混合架构。

Whisper(Radford 等,2023 (https://arxiv.org/html/2608.12327#bib.bib9))是一个自回归 Transformer 编码器-解码器,在约 68 万小时的弱监督多语言网络音频上训练。Conformer 架构(Gulati 等,2020 (https://arxiv.org/html/2608.12327#bib.bib30))将多头自注意力与深度可分离卷积交替堆叠;多种印度语言的预训练 Conformer-CTC 检查点已经可用。

#### 印度语系 ASR。

IndicWav2Vec(Javed 等,2022 (https://arxiv.org/html/2608.12327#bib.bib7))在约 1.7 万小时、涵盖 40 种印度语言的语音上预训练 Wav2Vec 2.0,将“语言家族近缘的预训练可能优于更广泛的多语言预训练”这一假设形式化。Vakyansh(Chadha 等,2022 (https://arxiv.org/html/2608.12327#bib.bib13))、Vistaar(Bhogale 等,2023 (https://arxiv.org/html/2608.12327#bib.bib14))和 IndicVoices(Javed 等,2024 (https://arxiv.org/html/2608.12327#bib.bib15))通过工具包、基准和多样化语料库扩展了这一生态系统。

#### 尼泊尔语 ASR。

Ghimire 等(2023 (https://arxiv.org/html/2608.12327#bib.bib29))在尼泊尔语上微调 MMS-1B,并使用基于主动学习的数据选择(CER 6.77%)。MMS 和 IndicWav2Vec 论文包含尼泊尔语,但只报告印度语系总体结果。目前没有工作在统一协议下,结合效率和错误模式测量,对多个架构家族在尼泊尔语上进行比较。

## 3 方法

### 3.1 数据集

OpenSLR SLR54(Kjartansson 等,2018 (https://arxiv.org/html/2608.12327#bib.bib24)):约 165 小时、来自 527 名志愿者的尼泊尔语朗读语音,按 80/10/10 划分为训练集、验证集和测试集,且采用说话人不相交划分。FLEURS (ne_np)(Conneau 等,2023 (https://arxiv.org/html/2608.12327#bib.bib22)):约 10 小时、来自 FLoRes-101 提示的精选尼泊尔语朗读语音,作为受控的域外测试集,不做任何改动。Common Voice (ne-NP)(Ardila 等,2020 (https://arxiv.org/html/2608.12327#bib.bib23)):约 5 小时、众包验证的尼泊尔语音频,麦克风、噪声和口音差异很大;用作最具挑战性的域外测试集。

### 3.2 模型

被评估的六个模型跨越三个架构家族(CTC 自监督、自回归编码器-解码器、混合 Conformer-CTC)、五种预训练策略(印度语 SSL、广泛多语言 SSL、大规模多语言 SSL、监督多语言、语言家族近缘监督),参数规模范围超过 30 倍(3050 万到 96500 万)。

表 1:跨越三个架构家族的六个被评估模型。“Whisper-Turbo”即 Whisper-Large-v3-Turbo。Conformer-Hi 是 NVIDIA NeMo 的印地语预训练 Conformer-CTC 检查点。

### 3.3 预处理

所有数据集和所有模型都使用同一条流程,确保比较受控:(1) 音频重采样至 16 kHz;(2) 立体声转单声道;(3) 转写文本进行 NFC Unicode 规范化并去除标点;(4) 删除时长小于 0.5 秒或大于 30 秒的语句;(5) Wav2Vec 2.0 家族使用原始波形输入,Whisper 和 Conformer-CTC 家族使用 80 维 log-Mel 频谱图(25 ms / 10 ms)。

### 3.4 训练配置

所有 Wav2Vec 2.0 家族模型使用 AdamW,学习率 3×10⁻⁴,批大小 8,500 步预热,10 个 epoch 的余弦衰减;卷积特征编码器被冻结。Whisper 模型使用 AdamW,学习率 1×10⁻⁵,批大小 8,3–6 个 epoch 的线性预热和衰减(所有参数可训练)。Conformer-Hi 在 NVIDIA NeMo 中微调,AdamW,学习率 1×10⁻⁴,批大小 16,10 个 epoch 的余弦退火。所有模型都应用 SpecAugment(Park 等,2019 (https://arxiv.org/html/2608.12327#bib.bib39))。当验证 WER 连续三轮评估停滞时触发早停。

### 3.5 实验协议

用于复现下述数字的端到端评估框架和推理脚本已公开。111代码:github.com/p-sumann/nepali-asr-benchmark (https://github.com/p-sumann/nepali-asr-benchmark)。三个阶段依次进行。阶段 1(零样本):每个模型在三个测试集上评估,不做尼泊尔语特定微调,建立开箱即用基线,并证明阶段 2 的成本合理性。阶段 2(受控微调):所有六个模型在共享协议下,在 OpenSLR SLR54 训练划分上微调。阶段 3(多测试集评估与效率):微调后的模型在全部三个测试集上评估,并在单张 NVIDIA L4 GPU、批大小 1 的条件下测量 RTF。

### 3.6 评估指标

WER(公式 1 (https://arxiv.org/html/2608.12327#S3.E1))和 CER(公式 2 (https://arxiv.org/html/2608.12327#S3.E2))使用 jiwer 计算,参考和假设文本均先进行 NFC 规范化。RTF(公式 3 (https://arxiv.org/html/2608.12327#S3.E3))是处理时间与音频时长之比。CER 对尼泊尔语尤其重要,因为词边界歧义会抬高 WER,而字符级保真度才能捕捉天城文正字法细节。

WER=S+D+IN×100%(1)CER=Sc+Dc+IcNc×100%(2)RTF=TprocessingTaudio(3)

## 4 结果

### 4.1 零样本性能

零样本 WER 和 CER 仅针对四个零样本评估有意义的模型报告(Conformer-Hi 和 XLSR-53 没有面向尼泊尔语的解码头)。只有 MMS-1B 产生了可独立使用的输出,且仅在 FLEURS 上(WER 31.75%)。Whisper 模型主要产生印地语或英语的幻觉输出。IndicWav2Vec 的 WER > 200% 反映的是未初始化的尼泊尔语 CTC 头,而非有意义的性能。这些结果证明了阶段 2 的必要性:每个模型都必须进行微调。

表 2:零样本 WER(W)/ CER(C),单位 %。

### 4.2 微调后域内结果

微调之后,最佳验证指标呈现三个值得注意的观察。首先,前三名模型(Whisper-Turbo、IndicWav2Vec、Whisper-Medium)在验证 WER 上彼此相差约一个百分点以内,尽管参数规模跨度达 9 倍,且使用根本不同的解码器(自回归 vs. CTC)。其次,IndicWav2Vec 以 9440 万参数在不到六小时的训练内达到最佳 WER,而 Whisper-Turbo 需要 80900 万参数和约 34 小时。第三,Conformer-Hi(3050 万参数,仅印地语预训练)优于 XLSR-53(31700 万)和 MMS-1B(96500 万),再次表明预训练的语言近缘性比原始模型容量更重要。

表 3:微调期间的最佳验证指标(%)。时长是在单张 NVIDIA L4 上的墙钟训练时间。

### 4.3 多测试集基准

在微调后的基准上,Whisper-Turbo 取得最低的域内 WER(14.76%),IndicWav2Vec(14.89%)和 Whisper-Medium(15.57%)在一个百分点以内。Conformer-Hi、XLSR-53 和 MMS-1B 构成中间梯队,WER 在 26–27% 左右。在 FLEURS 上,Whisper-Medium 以 39.06% WER 微弱领先,但 MMS-1B 是唯一在 FLEURS 上 CER 低于 11% 的模型,这反映了其来自超过 1100 种语言预训练的声学条件多样性。在 Common Voice 上,每个模型都急剧下降;即使最好的模型也超过 48% WER,说明众包尼泊尔语音频是剩余的最大开放问题。

表 4:三个测试集上微调后基准的 WER/CER(%)。

### 4.4 推理效率

实时因子在单张 NVIDIA L4 GPU、批大小 1 的条件下测量,模拟单条话语的实时推理。所有六个模型都远低于实时阈值。IndicWav2Vec 平均 RTF ≈ 0.0026,约为 400 倍实时;Conformer-Hi 由于参数更少而略快。CTC 解码在结构上比自回归解码更便宜,因为它只需要一次编码器前向传播,而不是逐 token 生成。实际后果是:Whisper-Turbo 尽管准确率与 IndicWav2Vec 相当,但速度慢约 29 倍(平均 RTF 0.076 对 0.0026),这在任何严格延迟预算的部署中都是决定性的。

表 5:三个测试集上的实时因子(越低越快)。

### 4.5 泛化能力

从域内(OpenSLR)到域外测试集的 WER 增加直接暴露了泛化差距。MMS-1B 的 FLEURS 差距最小(+12.55 个百分点),约为次佳模型的一半。合理的解释是:MMS-1B 的超过 1100 种语言预训练使其接触到的声学条件比任何单一域内语料库更广,因此从它的视角看,域内到域外的偏移更接近分布内。Whisper-Turbo 是三个测试集中高准确率模型里表现最稳定的。Common Voice 的众包麦克风变异性对每个模型都很困难。

表 6:从 OpenSLR 起的 WER 增加(百分点)。

### 4.6 训练动态

图 1 (https://arxiv.org/html/2608.12327#S4.F1) 显示每个模型的训练损失曲线,x 轴根据每个模型的实际训练时长适配。大多数模型在前一到三个 epoch 内收敛;早停触发于 Whisper-Turbo(epoch 3)、Whisper-Medium(epoch 6)和 MMS-1B(epoch 4)。图 2 (https://arxiv.org/html/2608.12327#S4.F2) 报告相应的验证 WER 轨迹,面板按最终 WER 从优到劣排列。每个面板上平滑单调的下降表明在受控预算内没有训练不稳定,也没有过拟合。

参见图注 图 1:每个模型的训练损失曲线。Y 轴各面板独立;X 轴适应每个模型的实际训练时长。参见图注 图 2:按最终 WER 从优到劣排列的每个模型验证 WER 轨迹。

相似文章

转录儿童语音:ASR性能与获取可靠的正字法转写

arXiv cs.CL

这篇论文评估了九种ASR模型(Whisper、Parakeet、Wav2Vec2)在荷兰语儿童语音数据集JASMIN和DART上的表现,发现微调后的Whisper-medium取得了最佳性能(在JASMIN上WER为5.54%,在DART上为70.37%)。它还提出了一种选择方法,能够以高精度自动识别发音正确的录音片段,从而减少人工验证的需求。

商业ASR系统在代码切换语音上的基准测试:阿拉伯语、波斯语和德语

arXiv cs.CL

本文提出了一个基准测试,评估了五个商业ASR系统在阿拉伯语-英语、波斯语-英语和德语-英语代码切换语音上的性能,使用两阶段管道为每个语言对选择300个样本,并通过WER和BERTScore评估性能。ElevenLabs Scribe v2在整体上取得了最低的WER(13.2%)和最高的BERTScore(0.936),并提供公开数据集。