使用Whisper进行波斯语语音情感识别中的ASR适应与表示降维研究
摘要
本文研究了使用Whisper进行波斯语语音情感识别,表明基于PCA的降维方法提升了性能和效率,而ASR微调仅带来有限的改进。
arXiv:2608.05165v1 公告类型:新
摘要:低资源语言中的语音情感识别(SER)由于标注数据有限,仍然是一个具有挑战性的问题。在本工作中,我们研究了使用Whisper进行波斯语语音情感识别,特别关注表示降维和特定语言模型适应。我们提出了一种SER框架,其中使用PCA对从Whisper编码器提取的帧级嵌入进行降维,从而无需学习投影层,并大幅减少可训练参数的数量。降维后的表示通过基于注意力的池化机制进行聚合,并使用轻量级预测头进行分类。此外,我们研究了在波斯语自动语音识别(ASR)任务上微调Whisper是否能提升下游SER性能。在ShEMO数据集上、采用说话人无关评估协议进行的实验表明,基于PCA的降维在降低训练延迟和内存占用的同时,持续提升了情感识别性能。ASR微调对SER仅带来有限的提升,表明在评估条件下,从语言适应到情感相关表示的迁移有限。这些发现为在低资源语言中高效使用大型预训练语音模型进行情感识别提供了实用见解。
查看缓存全文
缓存时间: 2026/08/07 07:49
# 使用Whisper的波斯语语音情感识别中的ASR自适应与表示降维研究 来源:https://arxiv.org/html/2608.05165 ###### 摘要 在低资源语言中,语音情感识别(SER)由于标注数据有限,仍然是一个具有挑战性的问题。在这项工作中,我们研究了使用Whisper进行波斯语SER的可能性,特别关注表示降维和语言特定模型自适应。我们提出了一种SER框架,其中从Whisper编码器提取的帧级嵌入使用PCA进行降维,从而无需学习投影层,并大幅减少可训练参数的数量。降维后的表示通过基于注意力的池化机制进行聚合,并使用轻量级分类头进行分类。此外,我们研究了在波斯语自动语音识别(ASR)任务上对Whisper进行微调是否能改善下游SER性能。在ShEMO数据集上、采用说话人独立评估协议进行的实验表明,基于PCA的降维持续改善了情感识别性能,同时减少了训练延迟和内存占用。ASR微调对SER仅带来有限的提升,表明在所评估的条件下,语言自适应向情感相关表示的迁移有限。这些发现为在低资源语言中高效使用大型预训练语音模型进行情感识别提供了实用见解。 ## I 引言 SER已成为语音处理更广泛领域中的一个重要研究课题,其驱动力在于它能够实现更自然、更有效的人机交互。通过分析语音信号中蕴含的情感线索,SER系统可以增强广泛的应用,包括语音助手[1 (https://arxiv.org/html/2608.05165#bib.bib1)]、智能辅导系统[2 (https://arxiv.org/html/2608.05165#bib.bib2)]和客户支持分析[3 (https://arxiv.org/html/2608.05165#bib.bib3),4 (https://arxiv.org/html/2608.05165#bib.bib4)]。在医疗保健和辅助环境中,SER已显示出支持心理状态评估和提高身体或认知障碍人士可访问性的潜力[5 (https://arxiv.org/html/2608.05165#bib.bib5),6 (https://arxiv.org/html/2608.05165#bib.bib6),7 (https://arxiv.org/html/2608.05165#bib.bib7)]。此外,SER在法医和安全相关情境中也日益相关[8 (https://arxiv.org/html/2608.05165#bib.bib8),7 (https://arxiv.org/html/2608.05165#bib.bib7)],例如在调查性访谈、紧急呼叫和司法程序中分析情绪状态,其中理解情感线索可能为决策提供补充信息[9 (https://arxiv.org/html/2608.05165#bib.bib9)]。 尽管深度学习带来了显著进展,但从语音中进行稳健的情感识别仍然是一个挑战性任务。对于波斯语等低资源语言,这项任务尤其困难,因为带有情感标签的语音数据有限,且语言变异性高。这些限制使得训练表现力强的模型而不过拟合变得困难,也阻碍了主要为高资源语言开发的方法的直接迁移。 早期的SER系统在很大程度上依赖于手工设计的声学特征,如韵律、频谱和音质描述符。虽然这些特征捕捉了与情感相关的重要副语言线索,但它们可能无法充分反映通过语音传达的高层信息。情感表达不仅受音高、能量和时序等声学模式的影响,还受语言和语义内容的影响。基于这一观察,最近的研究探索了结合音频和文本信息的多模态SER框架,通常在明确引入语义线索时表现出改进的性能[10 (https://arxiv.org/html/2608.05165#bib.bib10)]。 最近,该领域已转向使用大型预训练语音模型作为SER的特征提取器。诸如Wav2Vec 2.0[11 (https://arxiv.org/html/2608.05165#bib.bib11)]、HuBERT[12 (https://arxiv.org/html/2608.05165#bib.bib12)]和Whisper[13 (https://arxiv.org/html/2608.05165#bib.bib13)]等模型从大规模语音语料库中学习丰富的表示,并在各种下游任务中取得了最先进的性能。与传统的基于手工设计的特征相比,这些表示捕捉了更抽象、更有信息量的语音特征,使其对情感识别特别有吸引力。因此,利用预训练语音表示已成为当代SER研究的主导范式。 然而,在低资源SER环境中使用这种预训练模型会带来两个关键挑战。首先,提取的帧级表示通常具有高维度——例如,Whisper-small产生768维嵌入——当后接可训练投影层时,会导致大量可训练参数。当情感标记数据稀缺时,这通常会导致过拟合并降低训练效率[14 (https://arxiv.org/html/2608.05165#bib.bib14)]。其次,尽管许多预训练语音模型是多语言的,但波斯语等低资源语言在其预训练数据中的代表性不足,可能限制其表示中编码的语言特定信息。例如,在Whisper的预训练数据中,仅有24小时的波斯语ASR语音和392小时的波斯语到英语语音翻译数据。 在这项工作中,我们通过提出一种高效的基于Whisper的波斯语SER框架来解决这些挑战。为了缓解高维表示导致的过拟合,我们采用主成分分析(PCA)作为无监督降维技术,取代可训练的投影层,从而消除额外的可训练参数。此外,基于语言自适应可能改善下游性能的自然预期,我们研究了在SER训练之前对Whisper进行波斯语ASR任务微调的效果。这使我们能够系统地检验改进的语言特定表示是否能转化为情感识别的提升。 实验在ShEMO[15 (https://arxiv.org/html/2608.05165#bib.bib15)]数据集上采用说话人独立评估协议进行。通过广泛的分析,我们评估了基于PCA的降维的性能和效率影响,并评估了ASR微调对波斯语SER的益处程度。结果为了解表示维度和语言自适应在低资源SER中的作用提供了见解。 本工作的主要贡献总结如下: - •我们证明,使用PCA的无监督降维可以有效地替代学习得到的全连接投影层,从而改善SER性能,并大幅减少训练延迟和内存占用。 - •我们系统地研究了Whisper的语言特定ASR微调对波斯语下游SER性能的影响,并表明,在所评估的条件下,由此产生的增益是有限的。 ## II 相关工作 近年来,SER越来越依赖大型预训练语音模型作为特征提取器,取代了传统的手工声学表示。在这些模型中,Whisper因其强大的多语言能力和在广泛下游语音任务中的稳健性能而受到越来越多的关注。 多项研究探索了Whisper表示对SER的有效性。在[16 (https://arxiv.org/html/2608.05165#bib.bib16)]中,从Whisper-large提取的表示与MFCC等手工声学特征相结合,在EMODB和RAVDESS上分别带来约1%和0.1%的性能提升。在[17 (https://arxiv.org/html/2608.05165#bib.bib17)]中对预训练语音模型进行了更广泛的比较,在多个数据集上评估了多种模型的西班牙语SER性能。与我们工作特别相关的是,该研究比较了原始Whisper large-v2模型与西班牙语ASR微调变体,报告语言特定微调仅带来有限或没有增益——我们在波斯语SER背景下复制并进一步检验了这一观察。 Whisper也已在其他低资源语言环境中进行了SER评估。在[18 (https://arxiv.org/html/2608.05165#bib.bib18)]中,使用KEDAS数据集评估Whisper的阿拉伯语情感识别性能。作者报告了相对较低的准确率(五个情感类别约37%),并得出结论:对Whisper进行任务特定微调可能是实现有竞争力结果的必要条件。在[19 (https://arxiv.org/html/2608.05165#bib.bib19)]中提出了一种不同的方法,Whisper-large在IEMOCAP数据集上直接进行SER微调,随后蒸馏成更小的Whisper编码器。该框架实现了7.21倍的模型大小缩减,同时保留了教师模型99.99%的未加权平均召回率,达到79.82%的加权和81.32%的未加权平均召回率。 除了纯声学表示之外,一些工作还探索了利用Whisper的解码器输出将文本信息纳入SER。例如,[20 (https://arxiv.org/html/2608.05165#bib.bib20)]利用Whisper的编码器和解码器组件进行双模态情感识别,证明将语言内容与声学线索结合可以带来显著的性能提升。在相关方向上,[21 (https://arxiv.org/html/2608.05165#bib.bib21)]研究了另一种低资源语言——蒙古语的SER,通过从Whisper的不同编码器层提取表示,并使用注意力融合机制进行聚合。他们的发现强调了层选择和池化策略对代表性不足语言情感识别的重要性。 基于Whisper特征的替代分类方法也被提出。在[22 (https://arxiv.org/html/2608.05165#bib.bib22)]中,从IEMOCAP数据集提取的基于Whisper的表示使用Kolmogorov–Arnold网络进行分类,证明非标准分类器可以有效地与预训练语音嵌入结合。此外,[23 (https://arxiv.org/html/2608.05165#bib.bib23)]对Whisper自适应用于SER的内部机制进行了深入分析,重点关注LoRA微调的效果,并为参数高效自适应如何影响情感相关表示提供了见解。 使用Whisper进行波斯语SER的研究仍然相对有限。在[24 (https://arxiv.org/html/2608.05165#bib.bib24)]中的一项近期研究使用Whisper自动转录ShEMO数据集,然后使用FastText嵌入对生成的文本进行向量化。这些文本特征与MFCC和过零率等手工声学描述符相结合,并使用差分进化算法进行特征选择。虽然具有创新性,但该框架没有直接利用Whisper的编码器或解码器嵌入,尽管ASR推理的计算成本很高,而是依赖经典的文本表示。 在[14 (https://arxiv.org/html/2608.05165#bib.bib14)]中,两种基于注意力的池化技术——多头注意力平均池化和QKV池化——被用于降低Whisper表示的维度,同时保留情感信息。作者在英语(IEMOCAP)和波斯语(ShEMO)数据集上评估了他们的方法,使用了Whisper的Tiny和Small变体。他们的多头QKV架构在ShEMO数据集上取得了最先进的结果,未加权准确率提高了2.47%。此外,他们比较了不同的Whisper编码器层,并观察到中间层在波斯语数据集上的SER表现更好。 在与以模型为中心的进展并行推进的同时,也有一些重要努力来扩展波斯语情感语音数据集的可用性。在[25 (https://arxiv.org/html/2608.05165#bib.bib25)]中,AutESD语料库被介绍为公开可用的波斯语情感语音数据集,包含来自28位母语者的1,428条话语(约2小时音频)。与许多表演型数据集不同,AutESD侧重于半自然情感表达,并包含四个情感类别:中性、快乐、愤怒和悲伤。该数据集在类别上几乎平衡,非常适合公平的SER评估。另一项显著贡献出现在[26 (https://arxiv.org/html/2608.05165#bib.bib26)]中,Ravanbakhsh和Setayeshi描述了灵感来自柏林情感语音数据库的标准波斯语情感语音语料库的设计和初始构建。该数据集包含来自22位母语者在受控录音室条件下表达七种情感状态的录音,并强调通过情感中性话语来隔离韵律线索。 总之,这些研究既突显了将Whisper应用于SER的兴趣日益增长,也突显了与波斯语等低资源语言相关的持续挑战。它们还强调了关于降维、池化策略和语言特定自适应作用的开放性问题——这些问题正是本工作直接解决的。 ## III 方法论 ### III-A 提出的SER框架概述 参考图1:在此框架中,使用预训练Whisper模型的编码器提取帧级表示。利用PCA或全连接投影层进行降维。所得的嵌入通过基于注意力的QKV池化机制聚合成固定长度的话语级表示。随后应用轻量级分类头将话语级嵌入映射到情感类别。此外,在SER训练之前,研究了通过ASR微调使Whisper适应波斯语的效果。图1 (https://arxiv.org/html/2608.05165#S3.F1)展示了所提出的波斯语SER框架的整体架构。给定输入话语,首先使用预训练Whisper模型的编码器提取帧级表示。由于这些表示的高维度以及可用波斯语情感数据的有限规模,应用PCA以无监督方式降低维度。然后,使用基于注意力的查询-键-值(QKV)池化机制[14 (https://arxiv.org/html/2608.05165#bib.bib14)]将所得的帧级嵌入聚合成固定长度的话语级表示。最后,轻量级分类头将话语级嵌入映射到情感类别。除了使用原始Whisper模型外,我们还研究了在SER训练之前通过ASR微调使Whisper适应波斯语的效果。 ### III-B 从Whisper提取情感表示 Whisper是一种基于Transformer的序列到序列语音模型,在大规模多语言数据上训练。在这项工作中,我们采用Whisper-small变体,因为它在表示能力和计算效率之间具有良好的平衡。给定输入语音信号,Whisper的编码器产生一系列帧级隐藏表示
相似文章
使基础ASR模型适应构音障碍语音:一项案例研究
本文介绍了一个针对构音障碍说话者的个性化ASR系统,通过对Whisper基础模型进行微调,仅使用22.5小时的适应数据加上8.8小时的用户纠正,实现了9.7%的词错误率。结果表明,个性化微调可以显著提升基础ASR模型对构音障碍语音的效果,并且通过部署的移动应用实现了真实世界的数据收集。
转录儿童语音:ASR性能与获取可靠的正字法转写
这篇论文评估了九种ASR模型(Whisper、Parakeet、Wav2Vec2)在荷兰语儿童语音数据集JASMIN和DART上的表现,发现微调后的Whisper-medium取得了最佳性能(在JASMIN上WER为5.54%,在DART上为70.37%)。它还提出了一种选择方法,能够以高精度自动识别发音正确的录音片段,从而减少人工验证的需求。
AMRD:面向轻量级语音情感识别的自适应多教师关系蒸馏
本文介绍了AMRD,一种自适应多教师关系蒸馏方法,用于将大型自监督语音情感识别模型压缩为面向边缘设备的轻量级学生模型。它解决了教师可靠性变化和关系结构丢失的问题,在IEMOCAP和CREMA-D数据集上展示了改进。
减少六层:Whisper编码器剪枝与无标签恢复
本文介绍了一种剪枝Whisper ASR模型编码器层的方法,将编码器大小减少18.5%,并通过无标签数据蒸馏恢复性能,同时发布了代码和预训练模型供采用。
用于米佐语自动语音识别的语音语料库:Whisper 和 SraVaani 1.0 的形态感知评估微调
本研究通过微调Whisper和SraVaani 1.0模型,开发了一个用于米佐语(一种低资源语言)的自动语音识别系统,其中Whisper-large-v3实现了7.22%的形态感知词错误率。