转录儿童语音:ASR性能与获取可靠的正字法转写

arXiv cs.CL 论文

摘要

这篇论文评估了九种ASR模型(Whisper、Parakeet、Wav2Vec2)在荷兰语儿童语音数据集JASMIN和DART上的表现,发现微调后的Whisper-medium取得了最佳性能(在JASMIN上WER为5.54%,在DART上为70.37%)。它还提出了一种选择方法,能够以高精度自动识别发音正确的录音片段,从而减少人工验证的需求。

arXiv:2605.28833v1 公告类型:新 摘要:自动语音识别(ASR)有望通过生成自动转录来大幅减少儿童语音研究中的手动标注工作量。然而,由于针对儿童的预训练模型有限且噪声条件高度多样化,在低资源语言中为儿童语音获取可靠的高质量ASR转录仍然具有挑战性。本研究通过两个研究问题,对三种模型家族(Whisper、Parakeet和Wav2Vec2)中的九种ASR模型在两个荷兰语儿童语音数据集JASMIN和DART上进行了评估,从而探究了最先进的ASR模型在儿童语音上的有效性。研究问题1考察了ASR模型应用于儿童语音时的性能。微调后的Whisper-medium模型取得了最佳整体性能,在JASMIN上的WER为5.54%,在DART上为70.37%,这表明嘈杂的DART数据显然更具挑战性。研究问题2考察了在何种程度上可以选择一个子集,从而无需人工验证即可自动获得可靠的正字法转录。我们使用一种话语级选择方法,将ASR输出与原始的朗读提示进行比较,以识别发音正确的录音。使用所提出的选择方法,42.0%[JASMIN]和18.1%[DART]的话语可以被自动识别为发音正确且置信度很高,从而在话语级上实现了极低的错误率(精度达到98.3%以上),并减少了人工验证的需求。
查看原文
查看缓存全文

缓存时间: 2026/05/29 09:12

# 转录儿童语音:ASR性能与获取可靠正字法转录
来源:https://arxiv.org/html/2605.28833
Gus Lathouwers∗\\emailguslathouwers@gmail\.com Lingyun Gao∗\\emaillingyun\.gao@ru\.nl Catia Cucchiarini∗\\emailcatia\.cucchiarini@ru\.nl Helmer Strik∗\\emailhelmer\.strik@ru\.nl

###### 摘要

自动语音识别(ASR)有潜力通过生成自动转录,大幅减少儿童语音研究中的手动标注工作。然而,在低资源语言中,由于缺乏针对儿童的预训练模型以及高度多样化的噪声条件,获取可靠的高质量ASR儿童语音转录仍然具有挑战性。本研究通过两个研究问题,评估来自三个模型族(Whisper、Parakeet和Wav2Vec2)的九个ASR模型在两个荷兰语儿童语音数据集(JASMIN和DART)上的表现,从而探讨最先进ASR模型在儿童语音上的有效性。研究问题1考察ASR模型应用于儿童语音的性能。微调后的Whisper-medium模型取得了最佳整体性能,在JASMIN上词错误率为5.54%,在DART上为70.37%,表明噪声较大的DART数据显然更具挑战性。研究问题2探讨在多大程度上能够自动选择出一个子集,使其可靠的正字法转录无需人工验证即可获得。我们采用一种话语级选择方法,将ASR输出与原始朗读提示进行比较,以识别正确发音的录音。使用所提出的选择方法,42.0% [JASMIN] 和18.1% [DART] 的话语可以高置信度地自动识别为正确发音,从而在话语级别实现了极低的错误率(精确度达98.3%以上),并减少了对人工验证的需求。

## 1 引言

自动语音识别(ASR)是指将语音波形自动转换为适当的单词字符串(?)。ASR有多种应用场景,例如在工作环境中自动转录语音、标注语言语料库以及转录档案视频资料(?)。截至目前,最先进的模型在不同语言的基准数据集上表现良好(?,?)。然而,最先进的模型可能无法达到训练有素的标注人员的表现,尤其是在说话人变异性高或语音质量嘈杂的情况下(?)。当语音中含有大量不流畅或说话人错误时,ASR在生成准确转录方面也可能面临更大困难(?)。

ASR的一个关注点是儿童语音,因为集成ASR的媒体工具已成为课堂学习环境的重要组成部分(?)。然而,可靠的儿童ASR一直面临挑战。例如,许多流行的ASR模型(如Whisper或Wav2Vec2)主要基于成人数据集训练,难以很好地泛化到儿童语音场景(?,?)。此外,由于儿童说话人特征多变(?)以及困难的录音条件(如课堂背景噪声水平高)(?),学校中的儿童语音识别变得更加困难。ASR系统在处理逐字转录(例如包含“嗯”和“呃”等非词汇标记)时也表现不佳(?),而这些标记对于儿童语音转录中的语言流利度估计可能很重要。为此,诸如在儿童数据集上微调模型(?,?,?)、数据增强方法(?)以及各种语言处理技术(?)等方法已被证明可以提高准确性。

对于荷兰语,ASR在儿童语音中的应用可能有助于减少转录语音所需的人力,例如在荷兰语儿童阅读评估工具中(?,?)。与其他语言的儿童语音ASR一样,准确的荷兰语儿童语音ASR面临各种挑战,例如缺乏能够很好地应用于荷兰语儿童语音的预训练模型。然而,即使在少量荷兰语儿童语音上进行微调、实验性数据增强以及后处理归一化或LLM处理等技术,都已证明能有效降低错误率(?,?,?,?)。当前最先进模型的性能取决于所使用的数据集和模型,但词错误率范围可能从低噪声最优数据集的5%到高噪声数据集的50%(?,?)。迄今为止,仍然缺乏针对不同噪声条件下荷兰语儿童语音的不同ASR模型进行全面评估的研究。

传统上,词错误率等指标用于衡量ASR模型的整体性能。然而,这种总体指标无法揭示哪些单独的ASR输出可以被认为是足够可靠以供直接使用的,尤其是在嘈杂的儿童语音录音中。因此,已经提出了多种方法来评估单个ASR预测在话语级别的可靠性,包括不确定性估计器、置信度估计器和质量估计方法(?,?,?)。对于儿童语音,此类面向可靠性的方法对于支持新收集数据集的自动转录尤其相关。虽然将ASR模型应用于新数据通常很简单,但确定哪些生成的ASR输出可以高置信度地接受仍然具有挑战性。在本研究中,我们制定了一个基于置信度估计和质量估计原理的系统。它通过一个选择任务来实现:基于ASR输出与原始朗读提示之间的一致性来识别正确朗读的儿童语音话语,目的是减少改善转录所需的手动验证量。

### 1.1 相关研究

关于评估ASR输出可靠性的研究通常分为置信度估计(CE)和质量估计(QE)(?)。置信度估计(CE)方法依赖于ASR输出文本本身之外的信息,例如原始声学信号或内部模型状态,来预测特定ASR输出是否可能正确。相比之下,质量估计(QE)方法不需要访问原始语音信号或内部模型状态,仅使用文本ASR输出即可评估可靠性。因此,QE系统可以分析ASR生成的输出字符串中的文本模式,例如重复或语法不一致,来估计转录正确或错误的可能性(?)。相反,CE方法需要访问声学输入或内部模型信息,例如softmax概率,以估计ASR输出的可靠性。

置信度估计(CE)在ASR领域有着悠久的历史,始于使用统计推断技术检测词汇表外单词(?),后来发展到混合ASR系统,集成各种信息源(如模型状态和信号特征)来确定单词级别的确定性(?)。在更近期的端到端ASR模型中,词元级别的softmax概率是估计模型置信度的一种直接方法。然而,研究表明这种方法在实践中不可靠(?,?)。其他CE方法包括使用熵损失分布(?),以及集成辅助神经网络来估计端到端系统中词元级别ASR预测的可靠性(?)。

质量估计(QE)是一个相对较新的方向,相比置信度估计(CE)方法受到的关注较少。?提出了一种基于对齐多个ASR系统输出的质量估计方法,其中更高级别的决策模块通过比较从不同输出字符串中提取的特征来选择最可能正确的转录。随后,?开发了一个QE系统,在预训练的RoBERTa模型之上训练了一个额外的分类器层。由此产生的系统(称为NoRefER)仅使用语言特征(例如ASR输出文本中存在的句法、语法和拼写模式)来预测转录错误率。因此,这种方法在估计ASR生成的字符串的词错误率时完全绕过了对参考转录的需求。

对于儿童语音ASR,关于QE和CE方法的研究相对较少。?研究了连接主义时间分类(CTC)模型,发现在使用词元级别概率识别应用于儿童语音的Wav2Vec2输出中的错误方面取得了良好结果。?从头开始使用儿童语音数据训练了一个完整的端到端模型,发现注意力分数和语言模型分数等是确定ASR输出可靠性的良好预测因子。虽然不严格属于QE方法,但相关工作表明,通过LLM提示组合多个ASR模型的输出可以降低词错误率,这在概念上类似于?等多系统QE方法。在本研究中,我们从基于选择的角度来处理应用于儿童语音的置信度和质量估计任务,重点是识别可靠的ASR输出,而不是预测连续的可靠性分数。

### 1.2 当前研究

本研究有两个目标:

1. 第一个目标是确定最先进的ASR模型在荷兰语儿童语音上的性能。由于CE、QE以及相关的确定可靠语音的方法通常依赖于底层ASR模型的准确性(?),我们首先评估基线性能,以确定哪些模型最有效地转录荷兰语儿童语音。总共将测试来自三个ASR模型族(Whisper、Wav2Vec2和Parakeet)的模型,涵盖两个数据集。此外,由于提示和微调已被证明可以提高ASR准确性(?,?),我们还包括一个提示的Whisper模型以及所有三个模型族的微调变体,以评估它们对转录性能的影响。第一个研究问题如下:RQ1:最先进的ASR模型在转录荷兰语儿童语音方面效果如何?
2. 本研究的第二个目标是探索一种基于选择的方法,用于自动识别可靠的ASR输出。现有的技术,如基于熵的损失和词元级别softmax分数,在应用于语音数据时已显示出不同程度的成功,但可能无法很好地泛化到儿童产生的高度多变且嘈杂的语音(?)。在当前研究中,我们使用一种选择方法,当ASR输出在话语级别与相应的朗读提示完全匹配时,将其标记为正确。这遵循了一个发现:正确发音的语音比包含语音错误或不流畅的语音更容易转录(?)。因此,逆命题也应该成立,即与语法正确的句子或拼写正确的单词(在本例中为原始朗读提示)匹配的ASR输出,正确的可能性更高。为了我们的目的,可靠的ASR输出被定义为通过话语级提示匹配选择出的、错误率低至非常低的输出。研究问题是:RQ2:在多大程度上可以使用最先进的ASR模型自动获取可靠的正字法转录而无需手动验证?

## 2 方法

总共测试了来自三个ASR模型族(Whisper、Wav2Vec2、Parakeet)的模型,涵盖两个数据集:JASMIN(?)和荷兰语自动阅读导师(DART)(?)。JASMIN被拆分,既作为微调的训练集,也作为评估集;而DART仅用于评估。数据集属性概览见表1(https://arxiv.org/html/2605.28833#S2.T1)。所有使用的模型概览见表2(https://arxiv.org/html/2605.28833#S2.T2)。

| 属性 | JASMIN | DART | DART (子集) |
|---|---|---|---|
| 总语音文件数 (n) | 10,642 | 2,343 | 1,049 |
| 测试或评估集 | 训练/评估 | 评估 | 评估 |
| 总时长 | 9小时51分钟 | 2小时54分钟 | 0小时44分钟 |
| 句子/单词比率 (%) | 90.3 / 9.7 | 12.4 / 87.6 | 8.5 / 91.5 |
| 手动阅读错误 (%) | 53.5 | 45.4-53.9 | 19.8 |

表1:本研究中使用的数据集及其关键属性概览。手动阅读错误(RMM)描述了完整数据集中儿童在朗读提示时至少犯了一个错误的话语总数。

### 2.1 数据集

**JASMIN。** 使用的第一个数据集是JASMIN-CGN语料库(?),它是口语荷兰语语料库(?)的扩展版本。完整的语料库包含来自不同说话人群体的语音,例如老年人、儿童和荷兰语非母语者。在当前研究中,只使用了7-11岁荷兰母语儿童的语音。JASMIN语料库包含两种类型的语音:朗读语音(儿童根据其阅读能力水平,大声朗读文本中的提示,通常是一个短句)和对话语音(儿童自发性地回答机器生成的问题)。语料库中的每个语音话语都有手动正字法转录(MO)。此外,对于朗读话语,还包括儿童被指示朗读的原始提示(PR)。完整数据集包含9小时51分钟的语音,其中7小时50分钟是朗读语音,2小时1分钟是对话语音。在朗读话语中,53.5%包含发音错误,定义为手动正字法转录(MO)与原始提示(PR)不同的情况。

**DART。** 使用的第二个数据集来自荷兰语自动阅读导师(DART)(?)。与JASMIN中的低噪声录音相比,DART语料库包含儿童在不同、更嘈杂环境中朗读的语音,麦克风质量和背景噪声不一。此外,虽然JASMIN包含不同年级儿童的语音,但DART中的朗读语音来自仍在学习阅读过程中的三年级学生。这意味着他们会产生破碎的单词、拼读的单词以及许多其他阅读错误。这里使用的DART子集(n=2343)主要由单个单词(87.6%)组成,其余为完整句子,所有话语均由两名独立的人类标注员进行标注。语音文件的总时长为2小时54分钟。包含发音错误的话语比例在45.4%到53.9%之间,具体取决于标注标准:如果至少一名标注员将单词标记为错误,则最多为53.9%;如果两名标注员都标记为错误,则为45.4%。还准备了DART数据集的一个单独子集用于后续分析(见下面的训练和测试过程)。

| 模型名称 | 基础模型 | 参数量 (M) | 是否微调 |
|---|---|---|---|
| whisper-large | openai/whisper-large-v2 | 1550 | - |
| whisper-large-prompted | openai/whisper-large-v2 | 1550 | - |
| whisper-small-FT | openai/whisper-small | 244 | 是 |
| whisper-medium-FT | openai/whisper-medium | 769 | 是 |
| whisper-large-FT | openai/whisper-large-v2 | 1550 | 是 |
| Wav2Vec2-gronlp | GroNLP/Wav2Vec2-dutch-large | 317 | - |
| Wav2Vec2-FT | amsterdamNLP/Wav2Vec2-NL | 95 | 是 |
| parakeet | nvidia/parakeet-tdt-0.6b-v3 | 600 | - |
| parakeet-FT | nvidia/parakeet-tdt-0.6b-v3 | 600 | 是 |

表2:实验中使用的ASR模型概览,包括基础模型、参数量以及是否在当前研究中针对荷兰语儿童语音进行了自定义微调。

### 2.2 模型

**Whisper。** Whisper是一种基于编码器-解码器Transformer的模型(?),已广泛用于一般语音转录任务(?)以及儿童语音研究(?,?)。应用于荷兰语儿童语音时,

相似文章

使基础ASR模型适应构音障碍语音:一项案例研究

arXiv cs.CL

本文介绍了一个针对构音障碍说话者的个性化ASR系统,通过对Whisper基础模型进行微调,仅使用22.5小时的适应数据加上8.8小时的用户纠正,实现了9.7%的词错误率。结果表明,个性化微调可以显著提升基础ASR模型对构音障碍语音的效果,并且通过部署的移动应用实现了真实世界的数据收集。

多样化语音的人类与自动语音识别基准测试:初步结果

arXiv cs.CL

本文比较了最先进的ASR系统与人类听者在识别多样化荷兰语语音方面的表现,发现ASR系统在某些情况下与人类表现相当甚至更优,其中Google Telephony表现最佳。文章强调了说话者年龄、地方口音及测试集选择对基准测试结论的影响。

商业ASR系统在代码切换语音上的基准测试:阿拉伯语、波斯语和德语

arXiv cs.CL

本文提出了一个基准测试,评估了五个商业ASR系统在阿拉伯语-英语、波斯语-英语和德语-英语代码切换语音上的性能,使用两阶段管道为每个语言对选择300个样本,并通过WER和BERTScore评估性能。ElevenLabs Scribe v2在整体上取得了最低的WER(13.2%)和最高的BERTScore(0.936),并提供公开数据集。

BuzzASR:100+单语语音识别模型的集群

arXiv cs.CL

BuzzASR 是一系列语言特化的 Whisper 模型,用于102种语言的自动语音识别,在77种语言上优于 Whisper-large-v3,并在错误率和压缩效率方面有显著提升。