S-DiverSe: 西班牙语多样语音

arXiv cs.CL 论文

摘要

S-DiverSe 是一个3.2小时的西班牙语音语料库,来自22位患有神经系统疾病(肌萎缩侧索硬化症、帕金森病、中风)的说话者,旨在支持病理语音的ASR评估。基线实验表明,在该领域,启发式后处理优于微调。

arXiv:2607.03207v1 公告类型:新 摘要:自动语音识别(ASR)在标准语音方面取得了显著进展,但受神经系统疾病影响的语音仍是一个挑战。我们提出了 S-DiverSe(西班牙语多样语音),这是一个包含 22 位肌萎缩侧索硬化症、帕金森病和中风患者的 3.2 小时真实环境西班牙语语音语料库。该数据集包含 444 个手动转录的音频片段,附有说话者性别、疾病类型和可懂度元数据。S-DiverSe 旨在支持神经性西班牙语语音的 ASR 评估和开发。我们描述了该数据集,分析了其构成,并报告了基线 ASR 结果以及初步的适应实验。我们的发现表明,对于领域外的神经性西班牙语语音,启发式文本后处理比微调更为稳健。这强调了需要专门的真实环境西班牙语基准。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:37

# S-DiverSe:西班牙语多样化语音
来源:https://arxiv.org/html/2607.03207
López Ibañez Martínez Alonso Gómez Kesiraju Luque
FernandoAnaIván PabloSantoshJordi
1西班牙Telefónica创新数字实验室科学研究部,2西班牙马德里自治大学,3捷克布尔诺理工大学
fernando\.lopez@telefonica\.com (https://arxiv.org/html/2607.03207v1/mailto:[email protected])
###### 摘要
自动语音识别(ASR)在标准语音方面取得了显著进展,但受神经系统疾病影响的语音仍然是一个挑战。我们提出S-DiverSe(西班牙语多样化语音),这是一个包含来自22名肌萎缩侧索硬化症、帕金森病和中风患者的3.2小时野外西班牙语音语料库。该数据集包含444个手动转写的音频片段,并附有说话人性别、疾病类型和可懂度等元数据。S-DiverSe旨在支持针对神经系统疾病影响的西班牙语音的ASR评估和开发。我们描述了数据集,分析了其构成,并报告了基线ASR结果以及初步的适配实验。我们的发现表明,针对域外神经系统西班牙语音,启发式文本后处理比微调更为稳健。这凸显了对专用野外西班牙语基准的需求。
###### 关键词:语音识别,病理语音,语音语料库,神经系统疾病
## 1引言
近年来,自动语音识别(ASR)取得了显著进步,最先进的模型在标准基准上实现了较低的字错误率[1 (https://arxiv.org/html/2607.03207#bib.bib1)]。然而,当应用于真实世界的语音场景时,它们仍面临巨大挑战[2 (https://arxiv.org/html/2607.03207#bib.bib2)]。其中一个挑战是识别患有神经运动障碍(如肌萎缩侧索硬化症、帕金森病和中风后遗症)个体的语音。这些疾病常导致构音障碍,损害语音的神经肌肉控制,导致发音清晰度下降、韵律改变和可懂度变化,这些都挑战着ASR系统[3 (https://arxiv.org/html/2607.03207#bib.bib3),4 (https://arxiv.org/html/2607.03207#bib.bib4)]。病理语音识别的一个核心障碍是缺乏大规模、高质量的数据集[5 (https://arxiv.org/html/2607.03207#bib.bib5)]。即使对于英语,尽管有UA-Speech[4 (https://arxiv.org/html/2607.03207#bib.bib4)]、TORGO[3 (https://arxiv.org/html/2607.03207#bib.bib3)]和最近的Interspeech语音无障碍项目(SAP)挑战[6 (https://arxiv.org/html/2607.03207#bib.bib6)]等资源,这一情况依然存在。对于西班牙语,差距更大:公开可用的神经系统疾病语料库非常稀少,且在临床覆盖范围或领域多样性方面通常有限。来自GITA实验室的智利西班牙语数据集[7 (https://arxiv.org/html/2607.03207#bib.bib7)]是一个重要的早期贡献。它涵盖了发声任务,如孤立元音、元音序列和音调变化,以及轮替运动评估、单词和句子重复以及自发言语。然而,它缺乏录音条件的多样性,并且主要偏向老年人口。最近,NeuroVoz[8 (https://arxiv.org/html/2607.03207#bib.bib8),9 (https://arxiv.org/html/2607.03207#bib.bib9)]提供了在医院受控条件下收集的帕金森病卡斯蒂利亚西班牙语数据,包括持续元音、句子重复、轮替运动评估和简短独白。虽然有价值,但它主要包含来自老年参与者的简短、诱导性话语,限制了其捕捉受神经系统影响语音更广泛变异性的能力。因此,在缺乏基准的情况下,对受不同神经系统疾病影响的西班牙语音进行严格评估仍然困难。这一局限阻碍了稳健病理语音ASR的发展,以及辅助沟通和临床评估工具的进展。为弥补这一差距,我们做出了三项贡献:(i) 我们引入了S-DiverSe(西班牙语多样化语音),这是第一个覆盖多种神经系统疾病的野外西班牙语数据集。它包括人工转录和关于性别、疾病和可懂度的元数据,我们发布标注以促进开放研究¹¹¹我们仅分发标注和视频链接:https://github.com/ferugit/s-diverse。(ii) 我们在S-DiverSe上评估了四个最先进的ASR系统,并与其他受神经影响的语料库进行了性能比较。(iii) 我们将S-DiverSe作为受神经影响语音的基准,并评估了两种ASR模型的后处理和微调技术,以量化针对西班牙语神经系统语音适配的益处和局限。
## 2S-DiverSe:西班牙语多样化语音
S-DiverSe被指定用于语音识别任务。它包含3.2小时人工转写的语音,提取自野外录音。它涵盖了22名患有肌萎缩侧索硬化症、帕金森病和中风后遗症的独特说话人。语料库包含444个时长不等的音频片段,并提供说话人性别、疾病和可懂度的元数据。
表1:S-DiverSe上按性别和病理条件统计的时长。
### 2.1统计
表1 (https://arxiv.org/html/2607.03207#S2.T1)报告了按性别和病理条件统计的总时长(小时)。语料库以男性为主,且以肌萎缩侧索硬化症为主。性别和病理的不平衡反映了野外可发现资源的可用性,而非收集选择。图1 (https://arxiv.org/html/2607.03207#S2.F1)展示了按性别和每种病理统计的样本数量。
参见标题 图1:按病理条件划分的性别分布。
图2 (https://arxiv.org/html/2607.03207#S2.F2)展示了按疾病和可懂度划分的样本分布。肌萎缩侧索硬化症和中风呈现偏向中低可懂度的单峰分布,而帕金森病则呈现双峰模式。
参见标题 图2:疾病与可懂度的样本分布。
片段时长主要低于30秒,超过50秒的覆盖稀疏,极少数录音达到约250秒(图3 (https://arxiv.org/html/2607.03207#S2.F3))。
参见标题 图3:音频时长分布。
转录文本的语言复杂度使用salamandra-2b[10 (https://arxiv.org/html/2607.03207#bib.bib10)](一个卡斯蒂利亚西班牙语开源大语言模型)进行估算,得到中位困惑度为33,表明语言复杂度适中。作为参考,我们计算了西班牙语Common Voice v24.0[11 (https://arxiv.org/html/2607.03207#bib.bib11)]训练集的中位困惑度,结果为49。
### 2.2来源与标注
音频源自野外YouTube录音。三位母语为西班牙语的语言学毕业生负责识别候选视频、过滤内容、分割录音并生成转录。使用针对构音障碍语音的西班牙语查询(例如,特定疾病关键词、访谈和纪录片)检索视频,优先选择访谈等自发言语场景。这产生了多样化的声学条件,包括背景噪声、音乐和异质的录音设置。根据自我报告的诊断、视频元数据以及非标准语音的感知证据来过滤候选者。片段由说话人轮次和话语连贯性界定,时长可变以保持语义完整性。每个片段分配给一位标注员,负责生成正字法转录、标记说话人性别和疾病,并分配可懂度分数。无法理解的片段被标记为,常见的填充停顿(如“mmm”、“eh”、“em”)被保留。转录随后在标注员之间进行交叉审核。可懂度按1-5分的顺序量表(1:低可懂度;5:高可懂度)进行评级,基于感知到的转录难度,包括说话人一次轮次内无法理解的片段。在涵盖所有病理和可懂度水平的分层子集(50个样本)上评估了标注者间一致性。加权Cohen's κ(线性)为0.38(一般),相邻一致性为74%(±1级):大多数分歧发生在相邻类别之间,特别是在“中低”与“中”的边界上。因此,我们保留了原始的可懂度标注。
## 3实验设置
S-DiverSe专门用于ASR评估。阻止进一步划分的因素不是其规模小巧,而是其变异性:它涵盖三种病理、多个可懂度水平和异质的声学条件,因此任何训练划分在每个层内都会过于偏斜,无法进行可靠的适配。遵循SAP挑战[6 (https://arxiv.org/html/2607.03207#bib.bib6)]中探索的适配策略,我们研究了文本后处理和微调。微调使用不同语言的数据或同一种语言但受限领域的数据,以评估跨语言迁移和领域不匹配的影响。
### 3.1模型
我们评估了三个开源和一个商业ASR系统,并另外在受神经影响的其他语料库上对开源模型进行了基准测试。
Whisper-large-v3[12 (https://arxiv.org/html/2607.03207#bib.bib12)]是一个1.6B参数的编码器-解码器模型,在100万小时弱标注和400万小时伪标注音频上进行了预训练。
Voxtral-Mini[13 (https://arxiv.org/html/2607.03207#bib.bib13)]是一个4.7B参数模型,集成了一个微调后的Whisper-large-v3编码器,通过连接器与微调后的Ministral-3B大语言模型[14 (https://arxiv.org/html/2607.03207#bib.bib14)]相连。我们使用了Voxtral-Mini-3B-2507检查点。
omniASR_CTC_1B_v2[15 (https://arxiv.org/html/2607.03207#bib.bib15)]采用基于wav2vec2.0的Transformer编码器[16 (https://arxiv.org/html/2607.03207#bib.bib16)],参数近1B。首先在4.3M小时涵盖1600多种语言的未标注数据上通过自监督学习进行预训练,然后使用CTC头进行ASR微调。
ElevenLabs Scribe v2[17 (https://arxiv.org/html/2607.03207#bib.bib17)]是一个商业黑盒基线,通过云端API访问,使用scribe-v2模型,在所有测试条件下设置相同(2026年1月)。
### 3.2数据库
为拓宽分析范围,TORGO和NeuroVoz被用于跨数据集评估以及作为适配训练数据。
TORGO是一个英语构音障碍语音语料库,包括脑瘫患者,涵盖轮替运动任务、持续发声、孤立词以及受限和非受限句子。我们保留了孤立词和受限句子子集,得到来自15个说话人的13.68小时(约16.6k条话语):3名女性构音障碍、3名女性健康对照、5名男性构音障碍和4名男性健康对照。该子集包含8.66小时男性和5.02小时女性语音,其中7.85小时为单词语句,5.83小时为多词语句。
来自NeuroVoz[8 (https://arxiv.org/html/2607.03207#bib.bib8)](在第1节 (https://arxiv.org/html/2607.03207#S1)中介绍)的数据,我们保留了句子重复和简短独白,得到来自111个说话人的2.31小时(1.8k样本):26名女性和28名男性健康对照,20名女性和33名男性PD患者,其中4人性别未知。总时长为男性1.28小时,女性0.95小时,其余来自未知性别说话人。
两个数据集均按说话人身份分层划分成训练/验证/测试集(70/10/20比例),以防止泄漏,每个划分中均包含两种性别以及病理和健康语音。
为补充目标语言数据,我们使用西班牙语Common Voice v24.0[11 (https://arxiv.org/html/2607.03207#bib.bib11)],从原始训练集中筛选出7.3小时(约4.9k样本)的朗读语音,并按说话人分层划分为训练/验证子集。
### 3.3训练
我们使用两种策略适配Whisper-large-v3和Voxtral-Mini:低秩适配(LoRA)和完全微调。我们尝试了:(i) FFT:完全微调;(ii) F-LoRA:将LoRA应用于所有注意力和前馈层;(iii) EFT:音频编码器微调,加上Voxtral-Mini的连接器;(iv) E-LoRA:LoRA仅应用于编码器(加上Voxtral-Mini的连接器)。超参数根据策略定制:FFT使用保守设置(lr=1e-5, 3个epoch)以减轻灾难性遗忘;EFT使用中等设置(lr=2e-5, 5个epoch);基于LoRA的方法使用更激进的设置(lr=3e-4, 10个epoch),r=8, α=16, dropout=0.1。所有策略共享通过梯度累积实现的有效批次大小16、余弦学习率调度(100个warmup步骤)以及基于验证损失的早停(patience=5)。我们评估了三种训练数据配置:(i) TORGO和NeuroVoz组合,其中NeuroVoz过采样3倍以补偿语言不平衡;(ii) 仅NeuroVoz;(iii) TORGO、NeuroVoz和西班牙语Common Voice,后者用于缓解语言不匹配。
### 3.4后处理
我们评估基于规则的后处理(PP)以减轻幻觉,遵循[18 (https://arxiv.org/html/2607.03207#bib.bib18)]。应用三个连续步骤:(i) 超过15个字符的单词被分析内部字符级重复并缩减为其基础单元;(ii) 连续重复的单词被合并(词级去重);(iii) 连续重复的短语被缩减为单一出现(短语级去重)。
### 3.5评估
我们报告了在TORGO和NeuroVoz测试子集以及整个S-DiverSe集上的字错误率(WER)。总WER通过聚合所有话语的误差计算,反映数据集的样本分布而非子组WER的平均值。参考和假设通过小写化、移除标点、去除标记以及将独立数字转换为单词形式进行规范化。填充停顿作为常规标记保留,因此在参考中出现时会影响WER。所有实验在两块A100-SXM4-40GB GPU上使用贪婪解码运行。Whisper-large-v3和omniASR_CTC_1B_v2分别使用30秒和35秒的滑动窗口推理,对于超出模型输入限制的音频,重叠5秒。
## 4结果与讨论
表2 (https://arxiv.org/html/2607.03207#S4.T2)总结了对所有系统和适配设置的NeuroVoz、TORGO和S-DiverSe的WER。
表2:在域内(NeuroVoz, TORGO)和域外(S-DiverSe)语料库上的WER(%)。TORGO报告单/多词语;S-DiverSe报告按病理的WER。**粗体**表示每列最低,<u>下划线</u>表示次低WER。Scribe v2仅因成本和NeuroVoz许可在S-DiverSe上运行。FT:微调;NV:NeuroVoz, TG:TORGO, CV:CommonVoice。
模型方法训练数据FTNeuroVozTORGOS-DiverSe单词语多词语总计ALSPDSTROKE总计Voxtral-Mini无无×6.7546.8316.1325.1546.3224.2639.7340.43Whisper-large-v3无无×19.0339.7113.0220.8638.1624.8892.6136.43omniASR\_CTC\_1B\_v2无无×16.9679.4820.6637.9535.2227.3846.9633.56Scribe\_v2无无×----20.6419.5131.6920.69Voxtral-MiniPP无×6.8746.3312.0022.0922.9623.9139.7323.73Whisper-large-v3PP无×19.1539.6111.8320.0021.9920.3436.2822.01Voxtral-MiniFFT + PPNV+TG✓4.0119.578.6211.8427.3623.0145.5726.81Whisper-large-v3FFT + PPNV+TG✓20.5518

相似文章

SpeechDx:临床语音AI的多任务基准

arXiv cs.AI

SpeechDx 是一个大规模临床语音AI基准,涵盖12个数据集和27个任务,覆盖多种健康状况,并按语音生成阶段进行结构化。它评估了12种最先进的音频编码器,结果表明当前模型在临床语音领域无法可靠地泛化。

DuDi:基于跨语言词语化器的双信号蒸馏方法

arXiv cs.CL

DuDi 是一个双信号多语言蒸馏框架,结合序列级与词元级信号以及跨语言词语化器,旨在提升小型语言模型在东南亚语言上的表现。在 SEA-HELM 上的实验表明,DuDi 在多个模型系列和规模设置下均能持续超越具有竞争力的蒸馏基线方法。

Dolphin-CN-Dialect:中文方言识别的重要性

arXiv cs.CL

Dolphin-CN-Dialect 是一款支持流式处理的 ASR 模型,通过基于温度的采样策略和重新设计的词元化方案提升了方言识别能力,在更小的模型规模下实现了具有竞争力的性能。