用于米佐语自动语音识别的语音语料库:Whisper 和 SraVaani 1.0 的形态感知评估微调
摘要
本研究通过微调Whisper和SraVaani 1.0模型,开发了一个用于米佐语(一种低资源语言)的自动语音识别系统,其中Whisper-large-v3实现了7.22%的形态感知词错误率。
查看缓存全文
缓存时间: 2026/08/21 10:01
# 面向米佐语自动语音识别的语音语料库:Whisper 与 SraVaani 1.0 的形态感知评估微调
来源:https://arxiv.org/html/2608.19361
Sarmah Singh
###### 摘要
本研究报告了针对低资源语言米佐语开发的自动语音识别(ASR)系统。开发内容包括收集 17.62 小时的语音数据、进行数据整理,并使用三个 Whisper 多语言模型和 SraVaani 1.0 印度语多语言模型对米佐 ASR 系统进行微调。Whisper-large-v3 达到了最低的传统词错误率(18.08%),而形态感知评估得出的词错误率为 7.22%。SraVaani 1.0 印度语多语言模型的零样本评估词错误率为 58.27%,而针对米佐语的微调将传统词错误率降低至 29.45%,形态感知词错误率降低至 17.93%。结果表明,即使适配于未曾见过的语言,Whisper 模型也能实现显著较低的词错误率。相比之下,SraVaani 1.0 在其多语言模型中支持米佐语;然而,使用精心整理的米佐语音数据进行微调能显著提升其性能。
###### 关键词
ASR, 米佐语, Whisper微调, SraVaani 1.0
††地址:印度语言科学与技术中心,印度理工学院古瓦哈提分校††邮箱:\{priyankoo,ranbir\}@iitg.ac.in, [email protected]
## 1 引言
米佐语是一种低资源的藏缅语系语言,主要在印度米佐拉姆邦以及缅甸和孟加拉国部分地区使用。本文报告了为米佐自动语音识别(ASR)系统开发语音数据资源,以及随后对公开可用的米佐 ASR 模型进行微调以构建该语言 ASR 系统的过程。具体而言,我们在自己的数据上微调了两个多语言模型:Whisper\[7 (https://arxiv.org/html/2608.19361#bib.bib1)\] 和 SraVaani 1.0\[6 (https://arxiv.org/html/2608.19361#bib.bib2)\]。米佐语未包含在 Whisper 的原始语言集中,而 SraVaani 1.0 支持米佐语。因此,我们研究了如何利用可用的训练数据,将预训练的多语言 Whisper 模型有效适配到米佐语。据报道,Whisper 模型可以成功适配到以前未见过的语言\[8 (https://arxiv.org/html/2608.19361#bib.bib8)\]。一项关于 Kildin-Sami 语的研究表明,仅使用 30 分钟转录的 Kildin-Sami 语音,基于俄语的 Whisper 模型微调后可获得 68.55% 的适中词错误率\[5 (https://arxiv.org/html/2608.19361#bib.bib9)\]。这些发现推动了基于 Whisper 适配米佐语的研究。相比之下,SraVaani 1.0\[6 (https://arxiv.org/html/2608.19361#bib.bib2)\] 支持米佐语;因此,我们的首要目标是使用 SraVaani 1.0 多语言模型在米佐测试集上进行零样本测试。随后使用米佐训练数据对该模型进行微调,以评估语言特定适配的效果。米佐语连续 ASR 的发展在过去十年中经历了多个阶段。从简单的米佐语语音和数字识别系统开始\[3 (https://arxiv.org/html/2608.19361#bib.bib4), 9 (https://arxiv.org/html/2608.19361#bib.bib3)\],已发展到领域特定、词汇有限的语音识别和连续语音识别\[2 (https://arxiv.org/html/2608.19361#bib.bib5), 4 (https://arxiv.org/html/2608.19361#bib.bib6)\]。近期研究表明,使用 Wav2vec 2.0 和 XLS-R 模型进行微调是有效的,显著提升了米佐 ASR 的性能\[1 (https://arxiv.org/html/2608.19361#bib.bib7)\]。据报道,Wav2vec-Base-Mizo-Lus 和 XLS-R-300M-Mizo-Lus 模型的词错误率分别为 16.59% 和 11.84%\[1 (https://arxiv.org/html/2608.19361#bib.bib7)\]。米佐 ASR 系统开发的一个主要限制是公开可用的语音数据有限。因此,在本工作中,我们报告了语音数据的收集和整理,这些数据已发布以支持米佐语言技术的进一步发展。语料库的开发报告见第 2 节 (https://arxiv.org/html/2608.19361#S2)。随后,使用米佐语音数据对 Whisper-small、Whisper-medium 和 Whisper-large-v3 多语言模型进行微调,以适配米佐语音。这三个系统的性能报告见第 4 节 (https://arxiv.org/html/2608.19361#S4)。除了 Whisper 模型,我们还使用语料库中的米佐数据对 SraVaani 1.0 模型进行了微调。我们评估了三个微调后的 Whisper 模型、SraVaani 1.0 多语言模型以及 SraVaani 1.0 米佐微调模型。评估结果报告见第 4 节 (https://arxiv.org/html/2608.19361#S4)。
## 2 米佐语音语料库
### 2.1 数据收集
米佐语音语料库是在两个月内远程收集的。准备了一份包含约 8,000 个米佐语句子的列表,并由一位米佐语母语者进行验证。文本领域包括新闻文章和法庭判决,由米佐语母语者从英语翻译成米佐语。通过一个网络界面,以米佐语母语者熟悉的文字系统向米佐语说话者展示这些句子。网络界面的录音功能允许参与者录制他们阅读屏幕上句子的声音。参与者随后通过网络界面提交录音。
参见标题
图 1:语料库中语音文件时长的直方图。
表 1:训练、验证和测试的数据划分。
表 2:语音数据库的时长特征。
共有 200 名米佐语说话者参与了数据录制。录音界面允许每位参与者最多录制 50 个句子。然而,在参与者提交录音后,部分录音损坏,部分文件不含语音。因此,经过自动和人工过滤后,数据库包含 8,274 个句子,如表 1 (https://arxiv.org/html/2608.19361#S2.T1) 所示。根据参与者使用的设备和浏览器,录音有 7 种不同格式:.mov、.mp4、.m4a、.3g、.3g2、.mj2 和 .webm。但是,所有录音的采样率一致为 48000 Hz,且 90% 为 .webm 格式。
### 2.2 数据整理与预处理
录音的文件名中包含句子 ID 和说话者 ID 信息。此外,录音日期也编码在文件名中,因此文件名格式为 SPYYYYMMDD_ABC123_MZ_NXXXX_FORM.wav,其中 YYYYMMDD 是语音录制日期,ABC123 是说话者的字母数字代码,NXXXX 是识别相应文本的句子编号,FORM 是数据录制的七种格式之一。音频文件存储后,被转换为采样率为 16000 Hz 的 .wav 格式以进行进一步处理。转换过程中,任何损坏的文件都从数据库中移除,从而生成包含 8698 个音频文件的语音语料库。随后,一位米佐语母语者审查了所有 8698 份录音,以验证语音与参考转录文本之间的对应关系。此外,仅包含背景噪声或不完整语音的录音被丢弃。最终,构建了一个包含 8274 个 .wav 文件的数据库,每个文件包含一个句子。数据库中句子的平均时长约为 8 秒。表 2 (https://arxiv.org/html/2608.19361#S2.T2) 提供了本研究中录制的语音数据库的统计数据。图 1 (https://arxiv.org/html/2608.19361#S2.F1) 显示了语料库中句子时长的分布。
### 2.3 语料库划分
将包含 8274 个 .wav 文件的语音数据库划分为训练集、验证集和测试集,如表 1 (https://arxiv.org/html/2608.19361#S2.T1) 所示,确保三个集合中没有说话者重叠。相同的说话者独立训练、验证和测试集用于微调 Whisper-small、Whisper-medium、Whisper-large-V3 和 SraVaani 1.0 模型。
## 3 方法论
### 3.1 实验框架概述
实验框架包括四个阶段:模型适配、基于验证的模型选择、留出测试评估和语言特定错误分析。收集的语音数据经过人工验证,以确认与说话者产生的文本一致。确认后,根据模型微调的要求,将数据下采样至 16000 Hz。其次,将预训练的多语言 ASR 模型适配到米佐语。第三,基于验证过程中达到的最低词错误率进行模型选择。第四,使用仅包含米佐语说话者的留出测试集来评估米佐 ASR。考虑到米佐语的形态学和正字法特征,本研究引入了一种针对米佐语的特定词错误率计算指标。整理后的 17.62 小时米佐语料库用于适配三个多语言 Whisper 模型和 SraVaani 1.0。所有系统均使用相同的说话者独立数据划分进行训练和评估。模型选择在验证集上进行,而留出测试集仅用于最终评估。整个方法流程如图 2 (https://arxiv.org/html/2608.19361#S3.F2) 所示。所有模型微调和推理实验均在配备 NVIDIA RTX PRO 4500 Blackwell GPU(32 GB 显存)的工作站上进行。实验使用 Python 3.10、PyTorch、Hugging Face Transformers 和 NVIDIA NeMo 实现。Whisper 模型使用 Hugging Face Transformers 框架进行微调,而 SraVaani 1.0 的微调使用 NVIDIA NeMo 完成。所有训练实验均使用 CUDA 进行 GPU 加速。
参见标题
图 2:显示实验流程的示意图。
### 3.2 Whisper 微调
Whisper 是一个基于多语言编码器-解码器 Transformer 的自动语音识别和语音翻译模型。虽然 Whisper-small 和 Whisper-medium 模型在 68 万小时的数据上训练,但它们的参数数量不同。另一方面,Whisper-large-v3 在超过 550 万小时的语音数据上训练。当前工作中用于微调的三个 Whisper 模型的主要特征见表 3 (https://arxiv.org/html/2608.19361#S3.T3)。如表 3 (https://arxiv.org/html/2608.19361#S3.T3) 所示,三个模型都采用了相同的编码器-解码器 Transformer ASR 框架,但在模型容量上存在差异。虽然 Whisper 模型支持 99 种语言,但米佐语不在其中。因此,原始 Whisper 语言集中没有明确表示米佐语特定的语言知识。这些实验评估了跨越三个 Whisper 模型规模的未见藏缅语系语言的适配性。
表 3:本研究中评估的多语言 ASR 模型的特征。
表 4:用于 ASR 模型的微调配置。
Whisper 训练的微调参数详见表 4 (https://arxiv.org/html/2608.19361#S3.T4)。如表所示,在 Whisper 微调过程中,学习率、批大小和训练轮数是固定的。对于每个模型,在 20 个训练轮中,选择产生具有最佳验证词错误率检查点的那一轮作为进一步测试的模型。
### 3.3 SraVaani 1.0 微调
SraVaani 1.0 是一个多语言印度语音自动语音识别模型,基于 FastConformer 编码器和混合 RNNT/CTC 架构。与 Whisper 不同,SraVaani 1.0 在其预训练模型支持的语言中包含米佐语。我们首先直接在留出的米佐测试集上评估预训练的 SraVaani 1.0 模型,以建立零样本基线。随后使用米佐训练语料库对该模型进行微调,以量化米佐语特定适配的效果。对于米佐语适配,冻结了预训练的 Conformer 编码器,仅对解码器和联合组件进行微调。这种策略在保留多语言模型预训练声学表示的同时,减少了可训练参数的数量。微调使用 AdamW 优化器进行,学习率为 \(1 \times 10^{-4}\),权重衰减为 \(1 \times 10^{-3}\)。使用微批大小为 1,梯度累积为 16,因此有效批大小为 16,如表 4 (https://arxiv.org/html/2608.19361#S3.T4) 所示。在每个训练轮后进行验证,并选择达到最低验证词错误率的检查点用于最终评估。最初进行了 20 轮的训练。虽然最后两轮的词错误率略有上升,但训练扩展到了 25 轮,以确定额外的优化是否能改善验证词错误率。然而,在额外的训练中,验证词错误率并未得到改善。因此,选择了产生最低词错误率的第 18 轮模型用于测试。
### 3.4 模型选择与评估
在每个训练轮后计算验证词错误率,并选择具有最低验证词错误率的检查点用于最终测试评估。表 5 (https://arxiv.org/html/2608.19361#S3.T5) 显示了所有四个微调模型的最佳训练轮及相应的验证词错误率。虽然所有 Whisper 模型都微调到了第 20 轮,但对于 SraVaani 1.0 模型,微调持续到了第 25 轮;然而,如表 5 (https://arxiv.org/html/2608.19361#S3.T5) 所示,第 18 轮产生了最低的词错误率,因此被选中用于进一步测试。
表 5:四个微调模型的最佳训练轮及相应的验证词错误率。
ASR 系统的性能使用词错误率(WER)、字错误率(CER)和一种针对米佐语的形态感知词错误率进行评估。所有指标均在留出测试集上计算,并对参考转录文本和 ASR 假设应用了相同的文本规范化过程。规范化包括转换为小写、删除选定的标点符号、规范化空白字符,并将下划线字符视为等同于米佐语字符 `ṭ`。
#### 3.4.1 词错误率
词错误率(WER)是用于评估自动语音识别系统的传统指标,定义为:
WER = (S + D + I) / N
其中 S、D 和 I 分别表示替换、删除和插入的数量,N 是参考转录中的单词数。较低的词错误率表示更好的识别性能。
#### 3.4.2 字错误率
为了衡量字符级别的识别性能,还计算了字错误率(CER)。CER 的计算方式与 WER 相同,但基本单元是字符而非单词:
CER = (Sc + Dc + Ic) / Nc
其中 Sc、Dc 和 Ic 分别表示字符替换、删除和插入的数量,Nc 是参考转录中的字符数。CER 对于米佐语特别有用,因为识别差异发生在单词边界和正字法层面。
#### 3.4.3 形态感知米佐语词错误率
当识别的字符序列正确,但空白字符的放置与参考转录不同时,标准词错误率可能会高估米佐语中的识别错误。这种差异可能源于书面米佐语中形态边界表示的变化。观察到的大部分单词级别差异与米佐语中空白分割的差异有关。其根本原因在于米佐语中形态边界相似文章
转录儿童语音:ASR性能与获取可靠的正字法转写
这篇论文评估了九种ASR模型(Whisper、Parakeet、Wav2Vec2)在荷兰语儿童语音数据集JASMIN和DART上的表现,发现微调后的Whisper-medium取得了最佳性能(在JASMIN上WER为5.54%,在DART上为70.37%)。它还提出了一种选择方法,能够以高精度自动识别发音正确的录音片段,从而减少人工验证的需求。
openai/whisper-large-v3
OpenAI 发布了 Whisper large-v3,这是一个更新后的自动语音识别模型,使用 128 个梅尔频带和一个新的粤语词元,在 500 万小时的数据上训练,错误率较 large-v2 降低 10-20%。
使基础ASR模型适应构音障碍语音:一项案例研究
本文介绍了一个针对构音障碍说话者的个性化ASR系统,通过对Whisper基础模型进行微调,仅使用22.5小时的适应数据加上8.8小时的用户纠正,实现了9.7%的词错误率。结果表明,个性化微调可以显著提升基础ASR模型对构音障碍语音的效果,并且通过部署的移动应用实现了真实世界的数据收集。
基于音调条件的课程学习用于低资源班图语语音识别
本文提出了一种基于音调条件的课程学习框架,用于低资源班图语语音识别,结合了混合难度评分、门控适配器和分阶段课程训练。对六种南部班图语的评估显示,W2V-BERT在恩古尼语上优于Whisper,而Whisper在索托-茨瓦纳语上表现更好。
基于说话人日志引导的Qwen-ASR多语言双人对话语音自适应
本文介绍了为MLC-SLM 2026挑战赛设计的系统,该系统结合了说话人日志与微调后的Qwen-ASR,采用监督式全参数微调、合成语音上的LoRA以及GRPO强化学习,在最终评测集上实现了17.97的tcpMER。