通过年龄感知训练实现儿童语音的边缘音素识别
摘要
提出了一种用于儿童语音音素识别的年龄感知多任务学习方法,使轻量级94M参数模型能够超越更大的模型,并在手机等边缘设备上运行。
arXiv:2608.10206v1 公告类型:新
摘要:由于训练数据的稀缺以及儿童语音的独特性,从儿童语音中检测音素历来困难。在一次音素检测竞赛中,我们发现训练一个轻量级模型来同时预测学习者的年龄和音素序列,使得一个94M参数的模型能够在目标DrivenData分布上超越WavLM Large模型(317M),并且与参数数量为其90倍的竞赛集成模型相比,CER差距约为0.04。这促成了PhonemeTrainer的诞生,该应用程序可以在大多数现代手机上运行。这将最终为儿童语音实现更好的自动语音识别(ASR)和发音辅助应用,并带来边缘处理带来的隐私和合规优势。
查看缓存全文
缓存时间: 2026/08/12 08:21
# 通过年龄感知训练实现儿童语音的端侧音素识别 Source: https://arxiv.org/html/2608.10206 ,Ryan ArboledaOccidental CollegeLos AngelesCAUSA[rarboleda@oxy\.edu](mailto:[email protected]),Sophie HaakOccidental CollegeLos AngelesCAUSA[haak@oxy\.edu](mailto:[email protected]),Sam HjelmesetOccidental CollegeLos AngelesCAUSA[hjelmeset@oxy\.edu](mailto:[email protected]),Andrew FranckOccidental CollegeLos AngelesCAUSA[franck@oxy\.edu](mailto:[email protected]),Bingrui YangOccidental CollegeLos AngelesCAUSA[byang@oxy\.edu](mailto:[email protected]),Jose Bustamante OrtizOccidental CollegeLos AngelesCAUSA[bustamanteor@oxy\.edu](mailto:[email protected]),Yuanrong ShenOccidental CollegeLos AngelesCAUSA[sheny@oxy\.edu](mailto:sheny@oxy\.edu%20)andJoel WalshOccidental CollegeLos AngelesCAUSA[jwalsh2@oxy\.edu](mailto:[email protected]) \(2026\) ###### 摘要\. 由于训练数据的稀缺以及儿童语音的独特特征,从儿童语音中检测音素历来是一项难题。在一次音素检测竞赛中,我们发现,训练一个轻量级模型同时预测学习者的年龄和音素序列,使得一个94M参数的模型在目标DrivenData分布上超越了WavLM Large模型(317M),并且与参数规模大90倍的竞赛集成模型相比,CER差距在约0.04以内。这促成了PhonemeTrainer的诞生,该应用可在大多数现代手机上运行。这将最终实现更好的儿童语音自动语音识别(ASR)和发音辅助应用,并带来端侧处理所具备的隐私和合规性优势。 儿童语音识别、音素识别、多任务学习、端侧部署、移动语音处理、发音评估 ††copyright:cc††journalyear:2026††conference:The 13th ACM Conference on Learning @ Scale; June 29–July 3, 2026; Seoul, South Korea††ccs:Computing methodologies Speech recognition††ccs:Computing methodologies Multi-task learning††ccs:Applied computing E-learning††ccs:Applied computing Interactive learning environments图1\.多任务CTC与辅助年龄分类。训练流程图显示WavLM编码器分支到CTC和年龄头,并带有组合损失;简化推理流程图显示训练后的模型丢弃年龄输出。## 1\.引言 现代自动语音识别(ASR)和语音转音素流程通常建立在基于大量成人语音训练的自监督学习表示之上(Li et al., 2024 (https://arxiv.org/html/2608.10206#bib.bib10); Sinha et al., 2025 (https://arxiv.org/html/2608.10206#bib.bib16))。这导致这些表示在涉及儿童语音的语音任务中经常失败(Potamianos et al., 1997 (https://arxiv.org/html/2608.10206#bib.bib13); Dubagunta et al., 2019 (https://arxiv.org/html/2608.10206#bib.bib8); Wang et al., 2026 (https://arxiv.org/html/2608.10206#bib.bib17); Block Medin et al., 2024 (https://arxiv.org/html/2608.10206#bib.bib2))。 为此,盖茨基金会发起了“On Top of Pasketti:儿童语音识别挑战赛”,这是一项在DrivenData平台上举办的大规模数据科学竞赛(于2026年4月结束)。(DrivenData, 2026 (https://arxiv.org/html/2608.10206#bib.bib7); Bull et al., 2016 (https://arxiv.org/html/2608.10206#bib.bib3))。该挑战利用了一个精选的儿童语音语料库,来源包括亚利桑那儿童声学数据库(Bunton and Story, 2016 (https://arxiv.org/html/2608.10206#bib.bib4))、TalkBank(Rose and MacWhinney, 2014 (https://arxiv.org/html/2608.10206#bib.bib14); MacWhinney, 2019 (https://arxiv.org/html/2608.10206#bib.bib11))、Jibo Kids(Shankar et al., 2024 (https://arxiv.org/html/2608.10206#bib.bib15))以及ReadNet项目(MIT Integrated Learning Initiative, 2024 (https://arxiv.org/html/2608.10206#bib.bib12))。该挑战的音素赛道要求参赛者构建从儿童语音话语中预测国际音标(IPA)音素序列的模型。数据包含说话者年龄组桶的元数据:3–4岁、5–7岁、8–11岁和12岁以上。 与许多Kaggle等数据竞赛一样,“On Top of Pasketti”的顶尖优胜者使用集成模型以获得最低的字符错误率(CER)。第二名(在盲测竞赛集上CER为0.2607)报告使用了13个模型的集成,每个模型使用的编码器参数规模从3.17亿(WavLM Large)到15亿(Whisper Large)不等(Dieleman, 2026 (https://arxiv.org/html/2608.10206#bib.bib6))。该解决方案在CER上的提升微乎其微,但计算需求却呈指数级增长(NVIDIA A100 GPU,约80 GB内存)。为了在成本受限、隐私强制、网络连接不稳定的中小学环境中规模化部署解决方案,开发者必须能够获得在边缘运行的接近最先进水平的模型。 ## 2\.训练与结果 表1\.按模型配置划分的验证CER。所有运行均使用N=117,500条话语。各年龄段CER基于DD验证子集。(3–4岁:37,377条话语,5–7岁:24,285条话语,8–11岁:58,557条话语)。年龄感知训练使用了WavLM Base+(94M参数)(Chen et al., 2022 (https://arxiv.org/html/2608.10206#bib.bib5))预训练编码器和两个解码头:一个预测年龄桶,另一个使用连接时序分类(Connectionist Temporal Classification)(Graves et al., 2013 (https://arxiv.org/html/2608.10206#bib.bib9))预测国际音标符号(见图1 (https://arxiv.org/html/2608.10206#S0.F1))。预测年龄并非竞赛标准的一部分,但有希望添加这个头能使模型学习到正则化信号。为了竞赛目的,年龄预测被丢弃。 在训练过程中,该模型的收敛速度是我们训练的其他模型的三倍。所有运行共享相同的117,500条话语训练集(10,696条DrivenData + 106,804条TalkBank),按儿童ID分割以防止数据泄漏。如表1 (https://arxiv.org/html/2608.10206#S2.T1)所示,年龄感知模型不仅与WavLM Large(317M参数)配置具有竞争力——它在混合CER上与Large RNN-T持平(均为0.306),并在目标DrivenData分布上优于后者(0.306对0.343),尽管其规模小3.4倍。WavLM Large + RNN-T模型在TalkBank(TB)数据上表现更好,这无疑是由于训练数据的不平衡。在实际竞赛DrivenData(DD)上,年龄感知模型表现显著更好,在数据的两个子集上均未欠拟合或过拟合。
相似文章
基于音系激活映射的音素分割与识别
本文介绍了SPAM(基于S3M的音系激活映射),一种利用自监督语音模型同时进行音素分割与识别的方法,该方法使用轻量级、免梯度下降的预测头,且只需要极少的音标转录数据。
月光之味:面向边缘设备的小型专用ASR模型
本文介绍了“月光之味”(Flavors of Moonshine),一套面向边缘设备的小型专用ASR模型。作者证明,在人类标注、伪标注和合成数据的平衡混合上训练的单一语言模型,优于Whisper等更大的多语言模型,在小型模型中实现了最先进的错误率,并实现了对低资源语言的设备端ASR。
ChildVox:理解与表征儿童声音的语音、音频及大型音频语言模型基准
ChildVox 提出了一个全面的基准,用于分析儿童在不同发育阶段的声学交流,整合了来自17个以儿童为中心的音频和语音数据集的20多个子任务。
转录儿童语音:ASR性能与获取可靠的正字法转写
这篇论文评估了九种ASR模型(Whisper、Parakeet、Wav2Vec2)在荷兰语儿童语音数据集JASMIN和DART上的表现,发现微调后的Whisper-medium取得了最佳性能(在JASMIN上WER为5.54%,在DART上为70.37%)。它还提出了一种选择方法,能够以高精度自动识别发音正确的录音片段,从而减少人工验证的需求。
面向低资源澳大利亚土著语言识别的混合持续学习方法
本文提出了两种混合持续学习方法——回放增强弹性权重巩固与约束引导知识蒸馏——用于调整预训练语音模型,以识别低资源澳大利亚土著语言,同时缓解灾难性遗忘。