自监督语音表示追踪听力损失/听障婴儿和儿童口语向成人模型的趋同

arXiv cs.CL 论文

摘要

本文提出使用来自HuBERT的自监督语音表示来追踪听力损失/听障婴儿和儿童口语向成人模式的趋同,展示了一种可扩展、语言中立的语言发展评估方法。

arXiv:2608.20396v1 Announce Type: new 摘要: 语言发展以儿童语音逐渐向成人模式趋同为特征。传统上,测量这一过程需要详细转录和特定语言专业知识,这限制了跨语言和人群的可扩展性。在这里,我们使用语音嵌入直接从声学信号中捕获这种趋同,这些信号来自儿童日常生活中的长形式、以儿童为中心的录音。使用HuBERT-BASE,我们从听力损失/听障儿童和他们的女性成人照料者(超过925小时观察)的语音发声中提取嵌入。儿童和照料者之间的嵌入距离随着听觉年龄的增加而减小,控制了音高和发声长度后,正如预期,表明儿童语音模式在发展过程中向照料者趋同。这一单一距离指标同样与从婴儿期到学龄前的多项标准化语音和语言测量相关。这些结果表明,可以从儿童的日常生活中实现可扩展、语言中立的口语语言发展评估。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:20

# 自监督语音表征追踪失聪/听障婴幼儿口语语言向成人模型收敛的过程
来源:https://arxiv.org/html/2608.20396  
Landon Choy, Ali Sartaz Khan, Sonia Patrizi, Daisy Ye, Julianna Gross, Margaret Cychosz  
美国斯坦福大学 mcychosz@stanford\.edu

###### 摘要
语言发展的特征是儿童言语逐渐向成人模式收敛。传统上衡量这一过程需要详细的转录和特定语言的专业知识,限制了其在不同语言和人群中的可扩展性。本文利用语音嵌入表征,直接从以儿童为中心的长时程录音声学信号中捕捉这一收敛过程,这些录音记录了儿童的日常生活。我们使用HuBERT-BASE模型,提取了失聪/听障儿童及其成年女性照料者的语音发声嵌入表征(>925小时观察数据)。在控制音高和发声长度后,儿童与照料者之间的嵌入距离随听龄增长而减小,这符合预期,表明儿童的言语模式在发展过程中逐渐向照料者靠拢。这一单一距离指标同样与从婴儿期到学龄前期的多种标准化言语和语言测量结果相关。研究结果表明,有一种途径可以从儿童的日常生活中实现可扩展的、语言中立的口语语言发展评估。

自监督语音表征追踪失聪/听障婴幼儿口语语言向成人模型收敛的过程

Landon Choy, Ali Sartaz Khan, Sonia Patrizi, Daisy Ye, Julianna Gross, Margaret Cychosz  
美国斯坦福大学  
mcychosz@stanford\.edu

## 1 引言
儿童自发性语音的自动识别为从音频中推导语言发展的客观指标提供了机会,从而避免了传统上所需的高成本转录和语言专业知识(Demuth et al., 2006 (https://arxiv.org/html/2608.20396#bib.bib24))。然而,自然的、通常以儿童为中心的录音包含背景噪声、重叠语音,并且深受说话人分割错误的困扰,这使得难以提取有意义的语言信号或发展指标(Li et al., 2025 (https://arxiv.org/html/2608.20396#bib.bib11); Peurey et al., 2025 (https://arxiv.org/html/2608.20396#bib.bib12))。开发在这些条件下保持稳健的方法是自动语音识别研究面临的一个开放问题。

最近的工作已开始解决这一挑战。Sy et al.(2023 (https://arxiv.org/html/2608.20396#bib.bib7))提出了一种基于HuBERT-BASE嵌入表征(Hsu et al., 2021 (https://arxiv.org/html/2608.20396#bib.bib19))的离散化语音单元熵的无监督语言发展度量。熵量化了儿童言语在成人训练的语言模型下的“意外程度”,较低的熵表示其向成人言语的收敛度增加。虽然这种方法在嘈杂的自然录音中失效了,但使用干净的合成语音进行的实验恢复了儿童熵值向照料者收敛的预期模式。Ott and Cychosz(即将发表 (https://arxiv.org/html/2608.20396#bib.bib8))表明,从自然、以儿童为中心的音频中提取“规范比例”(即格式良好的辅音-元音转接比例)可以预测学龄前儿童在多项标准化言语和语言测量中的表现。但该指标有些粗糙,可能无法捕捉儿童言语或语言发展中更细微的变化。

在本文中,我们提出了一个简单的框架,将语言发展建模为在嵌入空间中与照料者语音的连续距离,无需转录或离散的语言单元。我们将此框架应用于失聪或听障(DHH)儿童,这些儿童因对口语语言的接触减少而面临语言延迟的更高风险,尤其是在干预之前。在干预(例如,助听器或人工耳蜗)之后,这些儿童接受临床护理以确保发展进步,然而现有的言语语言评估难以频繁可靠地实施,尤其是在婴幼儿和幼儿中。这一差距促使我们寻求可扩展的度量方法,可以直接从儿童日常言语中建模言语语言发展。我们方法的简单性使其计算量小,并且适用于干预后进展的纵向追踪。

我们做出以下贡献:1)引入一个直接从原始音频表征计算的嵌入空间距离指标,捕捉儿童相对于成人模型在言语语言结构上的细微发展变化;2)表明该指标能显著预测10-65个月龄儿童评估的言语语言结果;3)通过自助法和敏感性分析证明了对说话人分割错误的鲁棒性,在输入扰动下得出稳定的估计。

## 2 方法
参与者为34名患有双侧中度至重度听力损失的儿童(16名女性/18名男性;27名双侧人工耳蜗植入,3名双模态人工耳蜗植入+助听器,2名双侧助听器,2名单侧人工耳蜗植入);详见表1 (https://arxiv.org/html/2608.20396#S2.T1)了解年龄详情。34名儿童中有32名接触英语超过50%;有两名儿童还接触部分普通话(N=1)或西班牙语(N=1)。14名儿童(41%)贡献了两个或更多纵向时间点的数据(平均M=2.8,标准差SD=1.1,数据集总观察数=59)。数据收集得到了数据收集时作者所在机构的机构审查委员会的批准。

每个儿童都穿着一件特制衬衫,佩戴一个语言环境分析(LENA)录音设备,捕捉周围的言语和儿童自身的发声。家庭被告知在孩子醒来后激活录音器,并记录长达16小时。每份录音对应一个儿童-时间点,平均时长为15.7小时(SD = 1.3,范围 = 9.2–16),产生了一个包含925小时以儿童为中心音频的数据集。

### 2.1 言语语言评估
儿童/照料者还完成了多项标准化言语语言评估。**父母报告词汇量**:研究开始时年龄≤52个月的儿童父母(注:失聪/听障儿童常有语言延迟;此处采用临床判断,将此评估延伸至超出典型年龄范围)完成了美国英语版麦克阿瑟-贝茨沟通发展量表(MB-CDI)(Fenson et al., 2007 (https://arxiv.org/html/2608.20396#bib.bib15)),该量表列举了儿童知道和理解的单词清单。因为我们拥有儿童在长时程录音中的语音产出记录,而不是例如在受控任务中的言语理解,所以我们在结果中将儿童产出的单词数量建模为我们的结果指标之一。**儿童词汇量**通过皮博迪图片词汇测验-4(PPVT-4)(Dunn and Dunn, 2007 (https://arxiv.org/html/2608.20396#bib.bib16))和表达性词汇测验-2(EVT-2)(Williams, 2007 (https://arxiv.org/html/2608.20396#bib.bib17))进行测量,分别用于衡量儿童的接受性词汇量和表达性词汇量,适用于研究开始时年龄≥37个月的儿童。**儿童语音清晰度**使用高曼-弗里斯托发音测验-2(GFTA-2)(Goldman and Fristoe, 2000 (https://arxiv.org/html/2608.20396#bib.bib18))进行评估,适用于年龄≥37个月的儿童,该测验在图片命名任务中评估不同单词位置(例如,词首、词中)的辅音发音准确性。反应由两名训练有素的研究助理在离线状态下评分。言语语言评估在儿童长时程录音的60天内(平均M=19.3,SD=22.0)进行,以评估长时程自然录音中收集的自发语音与受控言语语言模式之间的共时关系。

### 2.2 处理流程
参考标题图1:处理流程概览。长时程录音经过说话人分割(儿童‘CHD’,成年女性‘FEM’)并使用HuBERT-BASE(Hsu et al., 2021 (https://arxiv.org/html/2608.20396#bib.bib19))进行嵌入。音频以16 kHz采样,20 ms帧率,产生768维向量,这些向量从第7-9层提取,并在时间和层上进行平均池化。发声长度计算为说话人分割的语音段的持续时间。从下采样的关键儿童(CHD)片段中提取基频(\(f_0\))。成年女性(FEM)嵌入表征来自所有录音中代表成年女性照料者(例如,母亲)的片段,经过下采样(小蓝点)以创建一个全局照料者质心(大蓝点;此处可视化为768维嵌入空间的二维投影)。每个录音(红点)测量到该质心的CHD嵌入距离,并与平均\(f_0\)、平均发声长度和听龄一起,在统计模型中作为一个观察/时间点使用。**录音说话人分割**是通过使用LENA解释的时间段‘.its’(每个LENA录音关联的专有数据文件格式)说话人标签,将连续音频流分割为说话人发声来完成的。被分类为关键儿童(CHD;每录音平均M=3530,SD=1346)和靠近儿童的成年女性(FEM;每录音平均M=2391,SD=1141)的音频段被保留(完整处理流程见图1 (https://arxiv.org/html/2608.20396#S2.F1))。

**嵌入表征**从HuBERT-BASE提取,选择它是因为其自监督预训练机制在成人和儿童语音的下游语音任务中能很好地迁移(Zanon Boito et al., 2024 (https://arxiv.org/html/2608.20396#bib.bib6); Charlot et al., 2026 (https://arxiv.org/html/2608.20396#bib.bib14))。遵循Charlot et al.(2026 (https://arxiv.org/html/2608.20396#bib.bib14)),我们从第7-9层提取嵌入表征,他们使用第7层为下游儿童声纹分类生成预训练聚类目标。由于聚类过程识别了与声学语音单元对应的隐藏单元,Charlot et al.(2026 (https://arxiv.org/html/2608.20396#bib.bib14))的预训练程序表明HuBERT的中上层编码了显著的声学结构。

**基频(\(f_0\))** 使用PYIN算法(Mauch and Dixon, 2014 (https://arxiv.org/html/2608.20396#bib.bib26))提取。此处,\(f_0\)是控制变量,因为语音表征编码了与\(f_0\)相关的变异,尤其是在较低的Transformer层(Lin et al., 2023 (https://arxiv.org/html/2608.20396#bib.bib20))。由于\(f_0\)在发育过程中随解剖生长而降低,它可能会混淆语言收敛与声学成熟(Lee et al., 1999 (https://arxiv.org/html/2608.20396#bib.bib21))。因此,我们将每个儿童每次录音的平均\(f_0\)作为协变量,以分离嵌入距离中的语言与非语言方差。

**发声长度**从.its文件中提取,并同样作为协变量纳入,以避免与语言发展存在潜在的混淆,因为儿童的言语话语长度随年龄增长而增加(Rice et al., 2010 (https://arxiv.org/html/2608.20396#bib.bib1); Ramsdell-Hudock et al., 2018 (https://arxiv.org/html/2608.20396#bib.bib5))。

| 变量 | \(N_{\text{obs}}\)/\(N_{\text{child}}\) | M (SD) |
| :--- | :--- | :--- |
| **录音详情** | | |
| 实足年龄(月) | 59/34 | 36.2 (14.4) |
| 听龄(月) | 59/34 | 22.2 (14.3) |
| 每录音关键儿童发声数 | 59/34 | 3531 (1347) |
| 每录音成年女性发声数 | 59/34 | 2392 (1142) |
| 时长(秒) | 59/34 | 16.1 (3.8) |
| **语言结果** | | |
| MB-CDI | 36/16 | 107.0 (166.3) |
| PPVT-4 | 22/17 | 95.6 (19.4) |
| EVT-2 | 23/18 | 100.1 (17.6) |
| GFTA-2 | 22/17 | 72.4 (17.3) |

表1:描述性统计。\(N_{\text{obs}}\)=录音-评估配对数;\(N_{\text{child}}\)=唯一儿童数;tp = 时间点。听龄 = 自植入/放大以来的时间。MB-CDI = 产出单词原始分;PPVT-4, EVT-2, GFTA-2 = 标准分。  
**嵌入距离**的计算方法是:构建一个来自所有成年女性、跨所有录音的全局FEM质心,然后将每次录音中的单个CHD发声与该参考进行比较。距离在儿童-时间点水平上进行平均池化,得出每个配对的单次观察(图1 (https://arxiv.org/html/2608.20396#S2.F1)),以建模每个儿童相对于单个、稳定的成人参考的言语。

### 2.3 敏感性分析
说话人误归属是长时程以儿童为中心的录音中的一个主要问题。遵循Gautheron et al.(2026 (https://arxiv.org/html/2608.20396#bib.bib13)),我们进行了敏感性分析以模拟分割错误,并测试观察到的关系是否可能源于说话人标签污染。具体来说,随机将一定比例的CHD发声(\(k\%\))替换为其他说话人类别的发声(\(k=0\)至100%,以10%为增量)。在每个污染水平重新计算嵌入距离和下游模型。完整细节见附录B.1 (https://arxiv.org/html/2608.20396#A2.SS1)。

## 3 结果
我们首先表征嵌入距离指标,然后评估其与儿童听龄的关系,以确定其在已知语言发展轨迹下的表现。接着,我们评估嵌入距离与标准化言语语言测量之间的关系,以检验向成人言语的更大收敛度是否指示更成熟的言语和语言技能(注:所有分析的代码可在:https://github.com/spoglab-stanford/cld-indexing 获取)。

当数据的纵向结构允许时(即,每个儿童有多个观察),我们使用mixedlm(来自statsmodels)拟合具有儿童随机截距的线性混合效应模型;否则,使用ols(Seabold and Perktold, 2010 (https://arxiv.org/html/2608.20396#bib.bib23))拟合普通最小二乘模型。所有模型中都包含每次录音中CHD的平均\(f_0\)作为协变量,以控制嵌入空间中与音高相关的方差(详见方法部分)。还纳入了听龄和发声长度,以考虑未被\(f_0\)捕捉的残留发展方差。连续预测变量进行了z分数标准化。模型拟合通过AIC和似然比检验(比较包含与不包含嵌入距离项的模型)进行评估,同时报告固定效应系数的显著性。我们还报告了增量解释方差(\(\Delta R^2\)),即每个预测变量加入模型后\(R^2\)的增加量。

对于每次录音,从最多800个观察中抽样200个CHD发声嵌入来计算到FEM质心的平均距离。该子抽样过程重复1000次,每次重新拟合统计模型,以获得估计系数和模型指标的95%自助法置信区间。FEM质心在迭代间固定,并计算自所有儿童-时间点汇集的照料者发声(\(n=59\)),总计11,800次FEM发声(每个时间点200次)。因此,自助法区间捕捉了抽样CHD观察的变异性,并对分割错误具有稳健性。

\\begin{overpic}\[width=346\.89731pt\]\{figures/metric\_model\_fits\.png\}
 \\put\(1\.0,0\.0\)\{\(a\)\}
 \\put\(21\.0,0\.0\)\{\(b\)\}
 \\put\(41\.0,0\.0\)\{\(c\)\}
 \\put\(61\.0,0\.0\)\{\(d\)\}
 \\put\(81\.0,0\.0\)\{\(e\)\}
\\end{overpic\}
图2:关系

相似文章

预训练的自监督语音模型能够识别未见过的辅音

arXiv cs.CL

本文研究了预训练的自监督语音模型(如Wav2Vec2和HuBERT)是否能够准确识别咔嗒辅音(click consonants),这些辅音在训练数据中较为罕见,通过在科伊桑语言(Khoisan languages)上进行微调来测试。结果表明,这些模型识别咔嗒辅音的准确率高于非咔嗒辅音,表明它们能够泛化到不常见的音素。