SpeechDx:临床语音AI的多任务基准

arXiv cs.AI 论文

摘要

SpeechDx 是一个大规模临床语音AI基准,涵盖12个数据集和27个任务,覆盖多种健康状况,并按语音生成阶段进行结构化。它评估了12种最先进的音频编码器,结果表明当前模型在临床语音领域无法可靠地泛化。

arXiv:2606.17339v1 Announce Type: new 摘要:语音通过同时涉及神经系统、运动系统、呼吸系统和发声系统,提供了一个独特的信息窗口来观察健康状况。当前的临床语音AI方法大多通过孤立的特定疾病研究取得进展,导致结果难以比较且泛化能力难以评估。我们提出了 SpeechDx,一个大规模临床语音AI基准,涵盖12个数据集和27个任务,覆盖多种健康状况。为了在共享的临床机制上进行评估,SpeechDx 根据语音生成过程中受干扰的阶段(概念化、形成和发音)来组织任务。该基准通过包含标注数据有限的任务以及跨多个数据集评估同一健康状况来测试泛化能力,从而区分有临床意义的模式与数据集伪影。我们系统评估了12种最先进的音频编码器在所有任务以及零样本跨条件迁移下的表现。结果表明,大规模语音模型提供了最强的整体基线,领域特定模型仅在高度匹配的任务上提升性能,且当前没有任何表示能在临床语音领域可靠地泛化。SpeechDx 建立了一个共享的评估框架,用于追踪通用临床语音表示的进展。
查看原文
查看缓存全文

缓存时间: 2026/06/17 05:36

# SpeechDx:面向临床语音AI的多任务基准  
来源:https://arxiv.org/html/2606.17339  
Sejal Bhalla, Larry Kieu, Aina Merchant, Eyal de Lara, Alex Mariakakis  
加拿大多伦多大学  
sejal@cs\.toronto\.edu  

###### 摘要  
语音通过同时调动神经系统、运动系统、呼吸系统和发声系统,为健康提供了一个独特的信息窗口。目前的临床语音AI方法主要通过孤立的特定病种研究取得进展,导致结果难以比较,泛化性能也难以评估。我们推出了SpeechDx,这是一个大规模的临床语音AI基准,涵盖12个数据集和27个任务,涉及多种健康状况。为了能在共享的临床机制上进行评估,SpeechDx根据任务所破坏的语音产生阶段对其进行组织:概念化、形成和发音。该基准通过包含有限标注数据的任务,并在多个数据集上评估同一健康状况,来测试泛化能力,从而区分有临床意义的模式与数据集伪影。我们系统性地评估了12种最先进的音频编码器在所有任务上的表现,以及在零样本跨病种迁移下的性能。结果表明,大规模语音模型代表了最强的整体基线,领域特定模型仅在高度匹配的任务上提升性能,而当前没有任何一种表示能在整个临床语音领域可靠地泛化。SpeechDx建立了一个共享的评估框架,用于追踪向通用临床语音表示迈进的进展。

## 1 引言  
语音作为人体健康的数字生物标志物已被广泛研究。其产生需要呼吸系统、发声系统、神经系统和认知系统的协调作用,因此任何因疾病或功能障碍导致的这些系统紊乱都会在语音中留下可测量的痕迹。与许多临床评估工具不同,语音可以无创、远程且以极低成本采集,这使其特别适用于连续监测、人群筛查和疾病纵向追踪。在过去的几十年里,这推动了大量研究探索针对多种病症的语音分析自动化,例如COVID-19(Despotovic et al., 2021 (https://arxiv.org/html/2606.17339#bib.bib38); Usman et al., 2022 (https://arxiv.org/html/2606.17339#bib.bib39))、构音障碍(Shih et al., 2022 (https://arxiv.org/html/2606.17339#bib.bib40); Ríos-Urrego et al., 2023 (https://arxiv.org/html/2606.17339#bib.bib41); Javanmardi et al., 2024a (https://arxiv.org/html/2606.17339#bib.bib43))、帕金森病(Reddy and Alku, 2023 (https://arxiv.org/html/2606.17339#bib.bib42); Khaskhoussy and Ayed, 2023 (https://arxiv.org/html/2606.17339#bib.bib44); Moro-Velazquez et al., 2021 (https://arxiv.org/html/2606.17339#bib.bib45))、阿尔茨海默病(Zolnoori et al., 2023 (https://arxiv.org/html/2606.17339#bib.bib47); Martínez-Nicolás et al., 2021 (https://arxiv.org/html/2606.17339#bib.bib48); Braun et al., 2023 (https://arxiv.org/html/2606.17339#bib.bib46))、抑郁(Wu et al., 2023 (https://arxiv.org/html/2606.17339#bib.bib50); Koops et al., 2023 (https://arxiv.org/html/2606.17339#bib.bib49); Cummins et al., 2015 (https://arxiv.org/html/2606.17339#bib.bib51))以及声带病理(Liu et al., 2024 (https://arxiv.org/html/2606.17339#bib.bib52); Koudounas et al., 2025 (https://arxiv.org/html/2606.17339#bib.bib53))。专门的挑战赛进一步展示了深度学习在语音健康评估中的潜力(Schuller et al., 2022 (https://arxiv.org/html/2606.17339#bib.bib59); Gale et al., 2022 (https://arxiv.org/html/2606.17339#bib.bib57); Luz et al., 2020 (https://arxiv.org/html/2606.17339#bib.bib55); Wu et al., 2025 (https://arxiv.org/html/2606.17339#bib.bib54); Muguli et al., 2021 (https://arxiv.org/html/2606.17339#bib.bib58); Luz et al., 2023b (https://arxiv.org/html/2606.17339#bib.bib56))。然而,尽管潜力巨大,但很少有系统实现了实际的临床部署。一个反复出现的障碍是该领域的碎片化性质。研究在不同孤岛中推进,模型在各自的数据集上使用不一致的协议进行训练和评估,限制了跨病种的泛化能力。即使在同一病种内,在小型受控语料库上训练的模型也经常无法泛化到未见过的数据。这种失败主要归因于模型学习了数据中混杂因素的虚假相关性——记录条件、人口构成和采集硬件的差异——而非底层的临床信号(Berisha et al., 2022 (https://arxiv.org/html/2606.17339#bib.bib86); Schu et al., 2022 (https://arxiv.org/html/2606.17339#bib.bib116); Zhu et al., 2023a (https://arxiv.org/html/2606.17339#bib.bib117))。该领域缺乏标准化的评估框架来量化进展、评估跨数据集和病种的泛化能力,以及确定稳健的建模方法。  
我们通过引入SpeechDx来填补这一空白,这是一个临床语音AI基准,包含12个公开可用的语音数据集,27个任务,涵盖九种健康和情感状况。SpeechDx的一个显著特色是其围绕语音产生过程的组织方式。遵循Berisha和Liss(Berisha and Liss, 2024 (https://arxiv.org/html/2606.17339#bib.bib37))提出的框架,我们根据病种对语音产生的主要影响阶段进行分类:(1) 概念化,即形成交际意图;(2) 形成,即将该意图编码为语言和音韵结构;(3) 发音,即呼吸和运动系统执行语音输出。不同的健康状况会破坏这一级联过程的各个阶段,产生不同类型的声学不规则性。我们使用SpeechDx评估了12种最先进的音频和语音编码器,它们代表了不同的表示学习范式。我们首先在所有任务上对模型进行基准测试,确定预训练表示在多大程度上编码了临床相关信息。其次,我们进行零样本跨病种分析,揭示跨病种的共享声学结构,并识别泛化失败的地方。总之,我们的贡献如下:  
- •我们引入了SpeechDx,这是首个专门为推进临床语音AI而设计的大规模基准。该基准包含12个数据集和27个任务,涵盖九种健康状况。代码库可在https://anonymous.4open.science/r/SpeechDx-F584 (https://anonymous.4open.science/r/SpeechDx-F584)获取。  
- •我们系统性地评估了12种最先进的音频编码器,为跨临床领域的性能比较建立了标准化、可复现的基线。  
- •我们进行了零样本跨病种迁移分析,揭示了哪些病种共享可学习的声学结构,以及迁移在哪些地方退化。

## 2 背景与相关工作

### 2.1 语音作为生物标志物  
音高、强度、共振和时域结构等发声属性的偏差构成了发声障碍的可测量标记。这些偏差源于语音生成所涉及的生物系统的扰动(Verdolini et al., 2006b (https://arxiv.org/html/2606.17339#bib.bib33); Fagherazzi et al., 2021 (https://arxiv.org/html/2606.17339#bib.bib32))。这种敏感性是语音作为生物标志物有用性的基础(Robin et al., 2020 (https://arxiv.org/html/2606.17339#bib.bib34)),并有助于其被认可为一种生命体征(Ramanarayanan et al., 2022 (https://arxiv.org/html/2606.17339#bib.bib31))。其无创和低成本的获取方式进一步支持了重复和纵向测量,从而辅助筛查、监测和预后等应用。Berisha和Liss(Berisha and Liss, 2024 (https://arxiv.org/html/2606.17339#bib.bib37))提出了一个框架,根据健康状况直接破坏语音产生机制的程度进行组织。在频谱的一端,健康状况直接影响声学语音产生的机制。在另一端,健康状况破坏认知-情感过程或语言规划,导致语音内容和形成的变化。SpeechDx采用该框架作为任务选择和组织的基础。

### 2.2 临床语音AI  
临床语音AI领域广泛研究从语音中提取声学、韵律和语言信息以推断临床相关结果的计算方法(Ng et al., 2026 (https://arxiv.org/html/2606.17339#bib.bib71))。该领域的早期工作依赖于手工设计的特征,如MFCC、抖动、闪烁和韵律描述符(Eyben et al., 2010 (https://arxiv.org/html/2606.17339#bib.bib72))。这些表示已被证明在众多任务中有用,包括COVID-19检测(Zhu et al., 2023b (https://arxiv.org/html/2606.17339#bib.bib75))、帕金森病分类(Arias-Vergara et al., 2017 (https://arxiv.org/html/2606.17339#bib.bib73))和抑郁筛查(Afshan et al., 2018 (https://arxiv.org/html/2606.17339#bib.bib76))等(Bhalla et al., 2025 (https://arxiv.org/html/2606.17339#bib.bib77); Vasquez-Correa et al., 2018 (https://arxiv.org/html/2606.17339#bib.bib74); Fang et al., 2017 (https://arxiv.org/html/2606.17339#bib.bib78))。近期工作已转向直接在音频波形或频谱图上训练的深度神经网络(Cummins et al., 2018 (https://arxiv.org/html/2606.17339#bib.bib79); Yang et al., 2022 (https://arxiv.org/html/2606.17339#bib.bib83); Islam et al., 2022 (https://arxiv.org/html/2606.17339#bib.bib84); Coppock et al., 2021 (https://arxiv.org/html/2606.17339#bib.bib80); Herath et al., 2022 (https://arxiv.org/html/2606.17339#bib.bib81); Kim et al., 2023 (https://arxiv.org/html/2606.17339#bib.bib82))。然而,无论是传统方法还是深度方法,通常都针对单个病种进行优化。尽管这些模型通常在数据集内表现强劲,但在分布偏移下常常失败(Berisha et al., 2022 (https://arxiv.org/html/2606.17339#bib.bib86); Ng et al., 2026 (https://arxiv.org/html/2606.17339#bib.bib71); Zhu et al., 2022 (https://arxiv.org/html/2606.17339#bib.bib85))。视觉(He et al., 2021 (https://arxiv.org/html/2606.17339#bib.bib93); Oquab et al., 2024 (https://arxiv.org/html/2606.17339#bib.bib91); Assran et al., 2023 (https://arxiv.org/html/2606.17339#bib.bib92))和语言(Devlin et al., 2019 (https://arxiv.org/html/2606.17339#bib.bib95); Radford and Narasimhan, 2018 (https://arxiv.org/html/2606.17339#bib.bib94); Touvron et al., 2023 (https://arxiv.org/html/2606.17339#bib.bib96))领域的自监督学习创新表明,可以学习到通用的表示,这些表示能通过最小的适应迁移到多个下游任务。在临床语音AI中,类似的能力是可取的,因为标注数据集规模小且收集成本高。一种不依赖于具体病种的表示可以为跨多个临床任务的学习提供共享基础,减少对每个疾病大规模标注数据集的依赖。使用来自wav2vec 2.0(Baevski et al., 2020 (https://arxiv.org/html/2606.17339#bib.bib24))、HuBERT(Hsu et al., 2021 (https://arxiv.org/html/2606.17339#bib.bib25))和WavLM(Chen et al., 2022a (https://arxiv.org/html/2606.17339#bib.bib26))等模型的表示的初步研究已经在临床语音任务上显示出有希望的结果(Javanmardi et al., 2024b (https://arxiv.org/html/2606.17339#bib.bib61); Sanguedolce et al., 2024 (https://arxiv.org/html/2606.17339#bib.bib67); Maji et al., 2024 (https://arxiv.org/html/2606.17339#bib.bib87); Pepino et al., 2021 (https://arxiv.org/html/2606.17339#bib.bib60); Yue et al., 2025 (https://arxiv.org/html/2606.17339#bib.bib65); Chen et al., 2022b (https://arxiv.org/html/2606.17339#bib.bib62)),表明预训练的语音编码器捕捉到了与健康评估相关的信息。因此,近期工作已转向面向健康的音频表示。WavRx(Zhu and Falk, 2025 (https://arxiv.org/html/2606.17339#bib.bib88))通过一个调制动态模块扩展了WavLM,以捕获呼吸和发音异常,而HeAR(Baur et al., 2024 (https://arxiv.org/html/2606.17339#bib.bib70))则包含了一个在3.13亿个健康音频片段上训练的掩码自编码器。两者都是迈向通用健康音频表示的重要步骤。然而,它们的评估范围仍然有限:WavRx覆盖了六个数据集和四种病理,而HeAR在呼吸音(如咳嗽和呼吸)等任务上进行了测试。更广泛的影响语音的疾病范围,包括运动、认知-语言和情感状况,仍未得到充分解决。标准化的基准推动了相邻领域的系统性进展;SUPERB(Yang et al., 2021 (https://arxiv.org/html/2606.17339#bib.bib89))建立了共享的多任务评估协议,加速了语义语音研究,而HEAR(Turian et al., 2022 (https://arxiv.org/html/2606.17339#bib.bib90))提供了一个推动通用音频表示学习的框架。SpeechDx为临床语音AI服务,作为催化剂,推动开发能在临床任务和人群中迁移的通用健康音频表示。

## 3 数据集与任务  
在临床相关性和数据访问限制的前提下,数据集整理过程产生了12个数据集,包含27个下游任务。表1 (https://arxiv.org/html/2606.17339#S3.T1)总结了这些数据集和任务的关键特征,更详细的描述分别见附录A (https://arxiv.org/html/2606.17339#A1)和B (https://arxiv.org/html/2606.17339#A2)。下面,我们描述这些数据集如何被置于Berisha和Liss的语音产生框架之下(Berisha and Liss, 2024 (https://arxiv.org/html/2606.17339#bib.bib37))。

表1:构成SpeechDx的数据集和任务。任务类型为分类(C)、多标签分类(M)或回归(R)。数据集划分要么是单一训练-验证-测试划分(TVT),要么是5折受试者交叉验证(5-fold)。样本数表示录音数量,括号内为独特受试者数量。

| 类别 | 数据集 | ID | 任务 | 类型 | 划分方式 | 样本数(受试者数) |
|------|--------|----|------|------|----------|---------------------|
| 概念化 | EDAIC-WOZ(Gratchet al., 2014 (https://arxiv.org/html/2606.17339#bib.bib2)) | T1 | 抑郁/健康 | C | TVT | 163 (163) / 56 (56) / 56 (56) |
| | | T2 | PHQ-8得分 | R | TVT | 163 (163) / 56 (56) / 56 (56) |
| | RAVDESS(Livingstone and Russo, 2018 (https://arxiv.org/html/2606.17339#bib.bib3)) | T3 | 情感分类 | C | 5-fold | 1,140 (19) / 300 (5) |
| | | T4 | 负面/非负面情感 | C | 5-fold | 1,140 (19) / 300 (5) |
| | IEMOCAP(Bussoet al., 2008 (https://arxiv.org/html/2606.17339#bib.bib4)) | T5 | 情感分类 | C | 5-fold | 5,843 (8) / 1,537 (2) |
| | | T6 | 负面/非负面情感 | C | 5-fold | 5,843 (8) / 1,537 (2) |
| 形成 | DementiaBank(Luzet al., 2023a (https://arxiv.org/html/2606.17339#bib.bib5)) | T7 | 痴呆/健康 | C | TVT | 237 (237) / 8 (8) / 46 (46) |
| | | T8 | MMSE得分 | R | TVT | 236 (236) / 8 (8) / 46 (46) |
| | AphasiaBank(Forbeset al., 2012 (https://arxiv.org/html/2606.17339#bib.bib6)) | T9 | 失语症/健康 | C | TVT | 740 (143) / 160 (21) / 237 (42) |
| 发音(神经肌肉) | TORGO(Rudziczet al., 2010 (https://arxiv.org/html/2606.17339#bib.bib7)) | T10 | 构音障碍/健康 | C | 5-fold | 7,605 (12) / 1,811 (3) |
| | | T11 | 构音障碍严重程度 | R | 5-fold | 2,379 (6) / 802 (2) |
| | UASpeech(Kimet al., 2008 (https://arxiv.org/html/2606.17339#bib.bib8)) | T12 | 构音障碍严重程度 | R | 5-fold | 18,012 (15) / 4,578 (4) |

相似文章

多场景长篇语音生成的综合基准评测

Hugging Face Daily Papers

Swanbench-Speech是一个综合基准评测,用于在多样化场景下评估长篇语音生成,采用涵盖声学、语义和表现力的多维度指标,揭示了当前模型的局限性。

SpeechEditBench:面向指令引导语音编辑的双语多属性基准

Hugging Face Daily Papers

SpeechEditBench是一个双语多属性基准,用于评估指令引导的语音编辑,涵盖七项原子任务和组合任务,并采用基于锚点的评估方案及三项指标。对主流语音大模型的评估表明,没有单一模型能在所有维度上表现出色,而组合编辑仍然极具挑战性。