多样化语音的人类与自动语音识别基准测试:初步结果

arXiv cs.CL 论文

摘要

本文比较了最先进的ASR系统与人类听者在识别多样化荷兰语语音方面的表现,发现ASR系统在某些情况下与人类表现相当甚至更优,其中Google Telephony表现最佳。文章强调了说话者年龄、地方口音及测试集选择对基准测试结论的影响。

arXiv:2607.19049v1 公告类型:新 摘要:人类通常被认为是最佳的听者,并被视为自动语音识别(ASR)系统的性能上限。我们初步比较了最先进的ASR系统与荷兰语母语听者在识别“多样化”语音(特别是荷兰儿童和老年人语音以及弗拉芒语)方面的表现。Google Telephony 优于其他ASR系统。重要的是,ASR系统表现出与听者相似的性能,并且在特定情况下甚至优于听者。在说话者年龄、地方口音和话语长度方面,我们发现听者与ASR系统之间存在细微的性能差异。未来的研究应致力于使ASR系统更鲁棒地应对与衰老和地方口音相关的声学变异性。将ASR在测试刺激集和完整Jasmin-CGN测试集上的识别性能进行比较,显示了特定测试集对关于人类与ASR性能基准测试结论的影响。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:24

# 多样语音的人类与自动语音识别基准测试:初步结果
来源:https://arxiv.org/html/2607.19049

###### 摘要

人类通常被视为最佳听众,也是自动语音识别(ASR)系统性能的上限。本文初步比较了最先进ASR系统与荷兰语母语听众在识别"多样"语音(具体为荷兰儿童、老年人语音及弗拉芒语)上的表现。Google Telephony表现优于其他ASR系统。重要的是,ASR系统的表现与听众相当,甚至在特定情况下超越听众。研究发现,听众与ASR系统之间存在的微小性能差异与说话者年龄、口音区域及话语长度有关。未来研究应聚焦于让ASR系统对与衰老和地域口音相关的声学变化更具鲁棒性。对测试刺激集与完整Jasmin-CGN测试集上ASR识别表现的比较,显示了特定测试集对基准测试人类与ASR性能结论的影响。

11 footnotetext: 作者贡献相同。

## I 引言

自动语音识别(ASR)系统已从Lippmann在其1997年的开创性工作中比较人类听众与ASR系统时所显示的远逊于人类的表现\[21 (https://arxiv.org/html/2607.19049#bib.bib2)\]走过了漫长道路。他得出结论,如果研究重点放在改善声学-语音建模、增强对噪声和信道变化的鲁棒性以及建模自发语音上,ASR性能可以得到提升。此后,ASR系统定期与人类听众进行基准测试,以探究在安静和背景噪声条件下识别音素\[6 (https://arxiv.org/html/2607.19049#bib.bib31)\]、假词\[25 (https://arxiv.org/html/2607.19049#bib.bib30),26 (https://arxiv.org/html/2607.19049#bib.bib32)\]和单词\[6 (https://arxiv.org/html/2607.19049#bib.bib31),25 (https://arxiv.org/html/2607.19049#bib.bib30),26 (https://arxiv.org/html/2607.19049#bib.bib32),35 (https://arxiv.org/html/2607.19049#bib.bib28),2 (https://arxiv.org/html/2607.19049#bib.bib12)\]时的性能差异,从而找出当前ASR系统可能的改进方向。

2017年,ASR在两个英语会话数据库上的表现被证明与人类转录性能相当\[42 (https://arxiv.org/html/2607.19049#bib.bib35)\];然而,人类性能数据来自专业转录员,其表现远优于更接近日常聆听条件的快速转录\[13 (https://arxiv.org/html/2607.19049#bib.bib13)\]。最近,在2024年,Patman及其同事\[30 (https://arxiv.org/html/2607.19049#bib.bib33)\]表明,在噪声环境下,对于佩戴或不戴口罩说话者产生的语音,人类听众始终优于Wav2vec 2.0\[3 (https://arxiv.org/html/2607.19049#bib.bib19)\],而Whisper-large\[28 (https://arxiv.org/html/2607.19049#bib.bib27)\]在除酒吧噪声外的所有条件下都优于人类听众。对ASR系统与人类听众识别错误的比较突显了二者的异同\[42 (https://arxiv.org/html/2607.19049#bib.bib35),23 (https://arxiv.org/html/2607.19049#bib.bib29),24 (https://arxiv.org/html/2607.19049#bib.bib34)\]。

人类听众常被视为ASR系统的性能上限。然而,上述结果表明,当前最先进的ASR系统不仅在不同聆听条件下达到极佳性能,而且在特定条件下,对标准语音的表现甚至优于人类听众。与此同时,越来越多的研究表明,对于偏离语言"标准"本土成人说话者(无强烈口音和言语障碍)的说话者,ASR性能显著下降。例如,儿童语音的识别效果差于成人语音(例如,\[31 (https://arxiv.org/html/2607.19049#bib.bib3),10 (https://arxiv.org/html/2607.19049#bib.bib8),18 (https://arxiv.org/html/2607.19049#bib.bib11),15 (https://arxiv.org/html/2607.19049#bib.bib9)\]),以及由于构音障碍\[32 (https://arxiv.org/html/2607.19049#bib.bib54),41 (https://arxiv.org/html/2607.19049#bib.bib57),22 (https://arxiv.org/html/2607.19049#bib.bib55),17 (https://arxiv.org/html/2607.19049#bib.bib56),1 (https://arxiv.org/html/2607.19049#bib.bib58),9 (https://arxiv.org/html/2607.19049#bib.bib59)\]、口腔癌\[16 (https://arxiv.org/html/2607.19049#bib.bib10)\]或唇腭裂\[33 (https://arxiv.org/html/2607.19049#bib.bib24)\]导致的非典型语音,其识别效果差于典型语音。此外,非母语\[40 (https://arxiv.org/html/2607.19049#bib.bib14),29 (https://arxiv.org/html/2607.19049#bib.bib15),44 (https://arxiv.org/html/2607.19049#bib.bib6)\]和带地域口音\[10 (https://arxiv.org/html/2607.19049#bib.bib8),18 (https://arxiv.org/html/2607.19049#bib.bib11),19 (https://arxiv.org/html/2607.19049#bib.bib23),37 (https://arxiv.org/html/2607.19049#bib.bib16),36 (https://arxiv.org/html/2607.19049#bib.bib21),34 (https://arxiv.org/html/2607.19049#bib.bib17)\]的语音识别效果也差于"标准"语音。

本文呈现初步结果,探讨最先进ASR系统与人类听众在识别非标准或"多样"会话语音方面的比较。我们比较了荷兰语母语听众与三种现成的最先进ASR系统在三个不同说话者群体(儿童语音、老年人语音、以及弗兰德斯地区使用的荷兰语即弗拉芒语)的荷兰语语音上的识别表现。我们旨在找出当前ASR系统在处理多样语音声学变异性方面的潜在改进领域,以使其更具包容性,即无论人们如何说话或使用何种语言,都能无障碍使用。

## II 方法

我们进行了三个独立的聆听实验(见第II-B节 (https://arxiv.org/html/2607.19049#S2.SS2)),以调查人类听众对儿童语音、老年人语音以及弗拉芒青少年和老年人语音的识别表现,并将其识别结果与Google Telephony\[14 (https://arxiv.org/html/2607.19049#bib.bib25)\]、Whisper-large-v3\[28 (https://arxiv.org/html/2607.19049#bib.bib27)\]以及一个自定义荷兰语Conformer模型(见第II-C节 (https://arxiv.org/html/2607.19049#S2.SS3))在完全相同刺激集(见第II-A节 (https://arxiv.org/html/2607.19049#S2.SS1))上的识别表现进行比较。

### II-A 刺激

我们从Jasmin-CGN语料库\[7 (https://arxiv.org/html/2607.19049#bib.bib20)\](一个包含荷兰和弗兰德斯地区人们口语荷兰语的语料库)中为儿童、老年人及弗拉芒语说话者选取了120个刺激。对于每个说话者群体,我们从语料库的人机交互(HMI)测试集中选取了40个刺激,因为这类语音最接近会话语音。对于每个实验,我们尽可能在不同人口统计标签之间平衡语音样本。在所有三个实验中,20个话语来自女性说话者,20个来自男性说话者。此外:

- **儿童语音(7-11岁)**:每个年龄选取四个不同话语长度的刺激,包括1个5-6词话语、1个7-8词话语、1个9-11词话语和1个12-16词话语(不含非言语声音;平均词数:8.0,标准差:2.4)。尽量平衡地域口音。
- **老年人语音(59-96岁)**:为捕捉广泛的地域口音变异性,从Jasmin-CGN中的4个方言区域各选取5名男性和5名女性说话者。年龄在不同区域和性别间尽量平均分布。每个话语至少包含4个词(不含非言语声音;平均词数:6.3,标准差:1.8)。
- **弗拉芒语语音(13-17岁和65-84岁)**:我们测试了青少年和老年人。从4个方言区域各选取10个刺激,每个区域内按年龄组和性别平衡。每个话语包含6-16个词(不含非言语声音;平均词数:7.3,标准差:1.2)。

### II-B 人类聆听实验

#### II-B1 参与者

从实验者的社交和工作圈招募了45名成年荷兰语母语听众。20名听众(10名女性和10名男性,平均年龄39.5岁,标准差9.5)参与了儿童语音实验111最初参与者分为两组:十名有儿童语音经验的和十名无经验的听众,但两组之间未发现性能差异,因此此处报告汇总结果。;14名参与者参与了老年人语音实验(7名女性,7名男性,平均年龄37.2岁,标准差16.7);11名参与了弗拉芒语实验(5名女性,6名男性,平均年龄40.1岁,标准差13.6)。无参与者报告听力问题。参与者未因参与获得报酬。每位听众只参与了一个实验,除了两名参与者同时参与了儿童语音和老年人语音实验。该研究已获所在大学伦理委员会批准。

#### II-B2 实验设置

所有刺激均使用FFmpeg\[38 (https://arxiv.org/html/2607.19049#bib.bib18)\]的loudnorm滤波器标准化为相同音量。实验托管在Qualtrics平台上,使用同一台笔记本电脑和同一副耳机(Sennheiser HD 200 Pro)进行。所有实验均在安静房间内进行。实验前,听众收到说明、签署知情同意书,并通过一个刺激进行简短熟悉,该刺激也用于将音量调整到舒适水平。实验过程中,每页显示一个刺激。刺激顺序在每个参与者之间随机化,以防止顺序效应。听众被允许只收听每个刺激一次,以模拟日常聆听条件;然而,在弗拉芒语实验中,由于实验设置不同,听众被允许收听两次。

参与者被要求输入他们听到的内容。每10个刺激后,听众可按自己意愿休息任意时长。实验期间不显示正确转录,因为这可能因弹出效应\[8 (https://arxiv.org/html/2607.19049#bib.bib26)\]引发学习,从而影响结果。实验结束后,参与者被允许将他们的答案与正确转录进行对比,许多参与者这样做了。

### II-C 自动语音识别系统

本研究使用的三个模型选自最近一项比较12种最先进ASR系统针对Jasmin-CGN多样语音荷兰语表现的研究中表现最佳的系统\[43 (https://arxiv.org/html/2607.19049#bib.bib1)\]。第一个模型是Google Telephony,与本研究中使用的人机交互语音一致,它针对会话式电话语音进行了优化。Google Telephony是第二好的模型(仅次于Google Chirp)。我们通过2.33.0版本的Speech-to-text V2 Python包,使用Google Cloud API进行同步语音识别。Whisper-large-v3(Whisper)是一个常用的基线模型。在\[43 (https://arxiv.org/html/2607.19049#bib.bib1)\]中,它是第4至第6好的模型(取决于语音类型)。Whisper从HuggingFace下载。测试时,我们采用束搜索解码,束宽为10。我们设置任务为"转录",语言为"荷兰语",温度参数为0。第三个模型是一个自定义Conformer模型,使用XLSR-53特征\[5 (https://arxiv.org/html/2607.19049#bib.bib22)\],并用约700小时的荷兰语标准语音(来自《荷兰语口语语料库》CGN;\[27 (https://arxiv.org/html/2607.19049#bib.bib5)\])进行训练,其在\[43 (https://arxiv.org/html/2607.19049#bib.bib1)\]中的表现与Whisper相近。

### II-D 评估

为了使人耳转录与ASR系统的转录保持一致,所有转录文本均转换为小写,去除标点(撇号除外),去除多余空格,数字/数字完全写出,并删除人耳听众和ASR系统转录中的非语言符号、填充词及其他非词汇声音的转录。明显的打字错误和拼写错误在意图单词完全无歧义时予以纠正(例如,"hius" → "huis"(房子);"afentoe" → "af en toe"(有时))。

人耳听众和ASR系统的识别表现以词错误率(WER)衡量。对于人耳听众与三个ASR系统表现的比较,采用配对自助法,进行10000次基于说话者的重采样,置信区间为95% \[4 (https://arxiv.org/html/2607.19049#bib.bib51),11 (https://arxiv.org/html/2607.19049#bib.bib52)\]。如果置信区间不包含零,则认为差异具有统计显著性。仅在结果显著时报告p值。此外,我们比较了人耳听众和ASR系统所犯的错误类型。由于\[24 (https://arxiv.org/html/2607.19049#bib.bib34)\]发现人耳错误与说话者高度相关,并且ASR系统对不同说话者群体存在较大性能差异,我们还调查了说话者年龄、报告性别和地域口音对人耳听众和ASR结果的影响。对于统计显著性检验,采用多因子线性模型

WER\_spk ∼ model × (gender + regional\_accents)

在R中使用估计边际均值包(emmeans)\[20 (https://arxiv.org/html/2607.19049#bib.bib53)\]来探究性别和地域口音的影响。此外,我们还调查了话语中单词数量对WER的影响。

## III 结果

### III-A 多样语音的识别表现

表I (https://arxiv.org/html/2607.19049#S3.T1)显示了人耳听众和三个ASR模型在三个实验(儿童语音、老年人语音和弗拉芒语(分为青少年和老年人语音,并基于完整刺激集取平均))中的WER。对于人耳听众,提供了每个说话者群体的标准差。这些数据显示,虽然儿童语音的人耳听众反应(和错误)相当一致,但对于其他说话者群体,标准差要高得多,表明个别参与者的WER存在较大变异性。关于ASR系统,三个模型之间未发现显著差异。

比较人耳听众和ASR模型的表现,对于儿童语音,人耳听众与ASR系统之间没有显著差异。对于老年人语音,人耳听众与ASR系统之间存在显著差异:Google Telephony模型(95% CI [+3.426%, +16.148%], p=0.0031)和Whisper(95% CI [+2.454%, +12.610%], p=0.0041)都优于人耳听众。对于弗

相似文章

商业ASR系统在代码切换语音上的基准测试:阿拉伯语、波斯语和德语

arXiv cs.CL

本文提出了一个基准测试,评估了五个商业ASR系统在阿拉伯语-英语、波斯语-英语和德语-英语代码切换语音上的性能,使用两阶段管道为每个语言对选择300个样本,并通过WER和BERTScore评估性能。ElevenLabs Scribe v2在整体上取得了最低的WER(13.2%)和最高的BERTScore(0.936),并提供公开数据集。

转录儿童语音:ASR性能与获取可靠的正字法转写

arXiv cs.CL

这篇论文评估了九种ASR模型(Whisper、Parakeet、Wav2Vec2)在荷兰语儿童语音数据集JASMIN和DART上的表现,发现微调后的Whisper-medium取得了最佳性能(在JASMIN上WER为5.54%,在DART上为70.37%)。它还提出了一种选择方法,能够以高精度自动识别发音正确的录音片段,从而减少人工验证的需求。

语音助手能处理双语客户吗?前沿ASR在代码切换语音上的基准测试

Hugging Face Blog

ServiceNow AI 发布了一个基准测试和数据集,用于评估自动语音识别(ASR)在跨四种语言对(西班牙语-英语、法语-英语、加拿大法语-英语、德语-英语)的企业HR和IT场景中的代码切换语音上的表现,发现当前前沿ASR模型在代码切换方面仍存在困难,导致错误率较高。

FFASR排行榜发布:真实场景下的ASR评测

Hugging Face Blog

介绍FFASR排行榜,这是一个开放、社区驱动的基准测试,用于在真实远场声学条件下评估自动语音识别模型,突显了近场和远场场景之间的显著性能差距。