通过知识蒸馏和跨模态集成生成的多语言转录的音频情感分析

arXiv cs.CL 论文

摘要

本文提出了一种用于音频情感极性分类的多模态解决方案,通过跨模态转换器集成音频和多语言文本转录,并利用知识蒸馏增强纯音频模型,在推理过程中不增加计算开销。

arXiv:2607.06611v1 公告类型:新论文 摘要:自动从语音中识别正面或负面情感是一项具有挑战性的任务,既需要分析声音的抑扬变化,也需要理解所说的话语。最近的解决方案依赖于音频基础模型来完成这项任务,但目前尚不清楚这些模型是否能考虑到所有方面。为此,我们提出了一种多模态解决方案,通过跨模态转换器集成音频和文本信息,其中文本转录通过自动语音识别(ASR)工具自动生成。此外,我们通过机器翻译工具将转录自动翻译成多种语言,从而创建多个文本模态。音频和多语言文本特征通过一种级联架构进行组合,该架构包含逐次集成模态的跨模态转换器模块。我们进一步将多模态模型(称为教师模型)的知识蒸馏到单模态(仅音频)模型(称为学生模型)中。我们在大规模数据集上进行了实验,结果表明自动生成的文本信息可以显著提升多模态情感极性分类的性能。我们的消融研究证实,自动转录和自动翻译均有助于性能提升。此外,我们证明了纯音频模型可以通过蒸馏得到增强,在推理过程中不增加任何计算开销的情况下提升性能。为复现报告的结果,我们公开了代码:https://github.com/andreidurdun/cross-modal-audio-sentiment。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:48

# 基于蒸馏与生成多语言转录跨模态融合的音频情感分析

来源: https://arxiv.org/html/2607.06611
Victor Constantinescu, Radu Tudor Ionescu
布加勒斯特大学计算机科学系,罗马尼亚布加勒斯特 Iuliu Maniu 大道15G,邮编061075
罗马尼亚PPC数据科学系,罗马尼亚布加勒斯特 Mircea Voda 大道30,邮编030667

###### 摘要

从语音中自动识别情感(积极或消极)是一项具有挑战性的任务,既需要分析语音语调的变化,也需要理解所说词语的含义。最近的解决方案依赖音频基础模型来解决该任务,但这些模型是否能全面考虑所有方面仍不清楚。为此,我们提出了一种多模态解决方案,通过跨模态变换器整合音频和文本信息,其中文本转录通过自动语音识别(ASR)工具自动生成。此外,我们还利用机器翻译工具将转录自动翻译成多种语言,从而创建多个文本模态。音频和多语言文本特征通过级联架构进行融合,该架构包含依次逐个整合模态的跨模态变换器模块。我们进一步将多模态模型(称为教师模型)的知识蒸馏到单模态(仅音频)模型(称为学生模型)中。我们在大规模数据集上进行了实验,证明自动生成的文本信息能够在多模态情感极性分类中带来显著的性能提升。我们的消融研究证实,自动转录和自动翻译均有助于提升性能。此外,我们还表明,通过蒸馏可以增强仅音频模型,在推理时不增加任何计算开销的情况下提升性能。为复现所报告的结果,我们已在https://github.com/andreidurdun/cross-modal-audio-sentiment上公开发布代码。

###### 关键词:

多模态学习;音频情感分析;音频极性分类;跨模态变换器

\\email

[email protected]

## 1 引言

语音情感极性分类是一项活跃的研究任务\[2 (https://arxiv.org/html/2607.06611#bib.bib33),11 (https://arxiv.org/html/2607.06611#bib.bib36),28 (https://arxiv.org/html/2607.06611#bib.bib32),31 (https://arxiv.org/html/2607.06611#bib.bib34),44 (https://arxiv.org/html/2607.06611#bib.bib35)\],具有广泛的实际应用,例如客服电话分析\[5 (https://arxiv.org/html/2607.06611#bib.bib37)\]、虚拟助手适配\[1 (https://arxiv.org/html/2607.06611#bib.bib38)\]、心理健康监测\[42 (https://arxiv.org/html/2607.06611#bib.bib40)\]、驾驶员监控\[52 (https://arxiv.org/html/2607.06611#bib.bib39)\]以及游戏体验适配\[25 (https://arxiv.org/html/2607.06611#bib.bib41)\]等。对于当今大多数语音处理任务而言,深度学习模型\[14 (https://arxiv.org/html/2607.06611#bib.bib48),18 (https://arxiv.org/html/2607.06611#bib.bib46),37 (https://arxiv.org/html/2607.06611#bib.bib45),40 (https://arxiv.org/html/2607.06611#bib.bib47)\],尤其是音频基础模型\[3 (https://arxiv.org/html/2607.06611#bib.bib44),9 (https://arxiv.org/html/2607.06611#bib.bib14),37 (https://arxiv.org/html/2607.06611#bib.bib45),38 (https://arxiv.org/html/2607.06611#bib.bib43)\],因其通常具有高准确率而成为极性分类的主流解决方案。然而,该任务仍具挑战性,因为它需要同时分析多个方面,包括语调(传递情绪)、音高(传达兴奋或平静)、用词(反映所传达信息的极性)、讽刺/反语(往往可能表示与所传达信息相反的观点)。厘清这些方面是提升性能的关键途径,但当前文献中这一领域仍很大程度上未被充分探索。

参见图1 图1: 提出的基于特权信息学习的流水线,该流水线将多模态(音频-文本)教师模型的知识蒸馏到单模态(仅音频)学生模型。教师模型包含冻结的ASR和NMT模型,分别用于生成文本转录和翻译。可训练模型处理生成的文本以提取潜在表示,然后通过跨模态变换器块进一步融合。最佳彩色视图。为此,我们提出了一种新颖的知识蒸馏(KD)流水线\[15 (https://arxiv.org/html/2607.06611#bib.bib26)\],其中教师模型受益于解耦的音频和文本信息。虽然音频模态是现成的,但在现实场景中文本转录并非直接可用。因此,我们采用自动语音识别(ASR)模型来生成文本转录。然而,ASR技术并非完美,因此转录可能受到识别错误的影响。此外,特定语言的预训练模型(如BERT\[10 (https://arxiv.org/html/2607.06611#bib.bib49)\])可能受到训练数据集偏差的影响。为减轻语言特定模型的偏差,我们进一步提议采用神经机器翻译(NMT)系统将ASR转录自动翻译成多种语言,即德语(DE)、法语(FR)和西班牙语(ES)。产生的文本模态连同原始音频模态通过基于级联跨模态变换器块的统一模型进行整合,如图1 (https://arxiv.org/html/2607.06611#S1.F1)所示。每个跨模态变换器将一种模态与上游信息整合,直到所有模态合并到联合模型中。

虽然ASR和NMT模型提供了分离语音和消息信息的手段,但它们也代表了处理瓶颈,即生成文本转录和翻译需要额外的计算资源和处理时间。处理速度对于需要实时情感极性评估的应用(如虚拟助手适配和驾驶员监控)至关重要。为了在保持单模态(仅音频)模型处理时间的同时利用多模态信息,我们采用了特权信息学习(LUPI)\[26 (https://arxiv.org/html/2607.06611#bib.bib28),30 (https://arxiv.org/html/2607.06611#bib.bib50),47 (https://arxiv.org/html/2607.06611#bib.bib27)\],这是一种知识蒸馏(KD)流水线,将能够访问额外数据表示(在我们的案例中,即生成的文本模态)的教师模型学到的知识转移到只能访问原始表示(在我们的案例中,即音频模态)的学生模型。这种蒸馏框架的主要优势在于推理时不需要额外的模态。这意味着ASR、NMT和多个文本嵌入模型仅在训练时使用。由此产生的学生模型代表了音频情感分类的一个有效且可扩展的解决方案。

总之,我们的框架基于两个假设:(i) 生成的转录和翻译提供了额外的情感极性线索,多模态模型可以有效利用这些线索;(ii) 来自重型多模态教师模型的知识可以蒸馏到一个高效的单模态学生模型中。为了验证这两个假设,我们在大规模MSP-Podcast语料库\[7 (https://arxiv.org/html/2607.06611#bib.bib10)\]上进行了实验。我们的实验表明,整合生成的多模态信息带来了显著的性能提升,宏F1提升了+5.89%,准确率提升了+5.15%,从而证实了假设(i)。此外,将多模态教师的知识蒸馏到仅音频学生模型,使学生的宏F1提升了+1.54%,准确率提升了+0.81%,从而验证了假设(ii)。此外,我们展示了消融结果,证明了文本转录和翻译的效用。

总之,我们的贡献有两个方面:

- 1. 我们提出了一种用于音频情感分类的新型知识蒸馏流水线,该流水线通过级联跨模态变换器架构利用生成的文本转录和翻译,能够有效整合多种模态。
- 2. 我们通过实验表明,生成的文本模态带来了显著的性能提升,并且多模态教师模型的知识可以有效转移到高效的单模态学生模型。

## 2 相关工作

语音情感/情绪识别。 语音情感极性分类\[2 (https://arxiv.org/html/2607.06611#bib.bib33),11 (https://arxiv.org/html/2607.06611#bib.bib36),28 (https://arxiv.org/html/2607.06611#bib.bib32),31 (https://arxiv.org/html/2607.06611#bib.bib34),44 (https://arxiv.org/html/2607.06611#bib.bib35)\],又称音频情感分析,是自动判断一个人口头表达的情感极性的任务,典型选项包括积极、中性和消极。该任务与语音情绪识别(SER)\[12 (https://arxiv.org/html/2607.06611#bib.bib11),24 (https://arxiv.org/html/2607.06611#bib.bib12)\]密切相关,后者的目标是在极性分类之外更精确地建立情绪类别,例如快乐、愤怒或恐惧。这两项任务都从手工设计的声学特征和传统分类器演变为直接在原始波形上操作的端到端深度学习模型\[12 (https://arxiv.org/html/2607.06611#bib.bib11),24 (https://arxiv.org/html/2607.06611#bib.bib12)\]。早期的深度学习解决方案依赖于应用于频谱图或梅尔频率倒谱系数的卷积和循环架构,其中基于注意力的池化成为将帧级情感线索聚合到话语级预测的常见策略\[12 (https://arxiv.org/html/2607.06611#bib.bib11)\]。最近,主导范式已转向大规模自监督语音基础模型,例如wav2vec 2.0\[3 (https://arxiv.org/html/2607.06611#bib.bib44)\], HuBERT\[16 (https://arxiv.org/html/2607.06611#bib.bib13)\]和WavLM\[9 (https://arxiv.org/html/2607.06611#bib.bib14)\],它们提供通用的表示,能够很好地迁移到副语言任务。Wang等人\[48 (https://arxiv.org/html/2607.06611#bib.bib15)\]对wav2vec 2.0和HuBERT在SER、说话人验证和口语理解方面进行了基准测试,表明微调自监督编码器始终优于基于频谱图的基线。特别是WavLM,它联合建模掩码语音预测和去噪,并已成为自然条件下SER的强大骨干\[7 (https://arxiv.org/html/2607.06611#bib.bib10),9 (https://arxiv.org/html/2607.06611#bib.bib14)\]。

自然环境中SER的进展主要由MSP-Podcast语料库\[7 (https://arxiv.org/html/2607.06611#bib.bib10)\]推动,这是一个大规模的自发情感语音集合,支持分类和基于属性的任务。INTERSPEECH 2025语音情绪识别挑战赛\[33 (https://arxiv.org/html/2607.06611#bib.bib16)\]进一步证实了现实世界中该任务的难度:在93个参赛队伍中,表现最好的系统将音频基础模型与通过自动语音识别(ASR)获得的基于文本的特征相结合,突出了在参考转录不可用时多模态监督的实际价值。虽然这些方法取得了强劲的结果,但大多数提交采用了重型的多模态推理流水线,这自然引发了一个问题:这些增益是否有一部分可以压缩回仅音频的部署中。我们的工作采用MSP-Podcast和WavLM作为以音频为中心的流水线的基础,并直接通过蒸馏来解决这个效率问题。

多模态音频-文本情感/情绪分析。 另一条研究线是联合建模声学和语言信息,其动机是观察到韵律和词汇内容包含很大程度上互补的情感线索\[24 (https://arxiv.org/html/2607.06611#bib.bib12),51 (https://arxiv.org/html/2607.06611#bib.bib17)\]。Yoon等人\[51 (https://arxiv.org/html/2607.06611#bib.bib17)\]提出了早期用于情绪识别的音频-文本双编码器架构之一,将声学特征上的RNN与文本编码器相结合。Tsai等人\[45 (https://arxiv.org/html/2607.06611#bib.bib18)]引入了多模态变换器(MulT),其中定向跨模态注意力对齐未对齐的音频、文本和视觉流,将跨模态注意力确立为主流融合机制。后续工作探索了替代融合策略,包括多尺度局部聚合描述符\[27 (https://arxiv.org/html/2607.06611#bib.bib19)\]、保留单模态特性的自调整跨模态表示\[50 (https://arxiv.org/html/2607.06611#bib.bib20)\],以及具有双音频路径的分层跨模态注意力\[46 (https://arxiv.org/html/2607.06611#bib.bib21)\]。Ristea等人\[39 (https://arxiv.org/html/2607.06611#bib.bib3),41 (https://arxiv.org/html/2607.06611#bib.bib51)\]进一步提出了级联跨模态变换器(CCMT),将来自同一话语不同翻译的多个文本视图与音频信号融合,这直接启发了我们教师所使用的融合模块。

多模态SER的一个实际限制是,在现实场景中很少有真实的转录可用。Lakomkin等人\[20 (https://arxiv.org/html/2607.06611#bib.bib22)\]表明,使用人工转录的文本训练和评估情感模型会导致性能评估过于乐观,并主张与ASR进行端到端集成。Shon等人\[43 (https://arxiv.org/html/2607.06611#bib.bib23)\]随后表明,在ASR转录上利用预训练语言编码器可以胜过传统的仅音频情感系统,尽管存在识别错误。Li等人\[23 (https://arxiv.org/html/2607.06611#bib.bib24)\]跨多个数据集在不同的词错误率下对使用ASR转录的SER进行了基准测试,发现当采用适当的融合和纠正机制时,SER对中等程度的ASR错误具有惊人的容忍度。Wu等人\[49 (https://arxiv.org/html/2607.06611#bib.bib25)]更进一步,将从非文本模态生成的基于文本的情感描述作为跨模态变换器的额外输入。虽然这些工作确认了自动生成的文本是情感建模的有用信号,但它们在推理时仍然需要文本分支。相比之下,我们严格将生成的转录和翻译作为训练时的特权信息使用,并将所得知识转移到仅音频的学生模型中。

语音和多模态模型的知识蒸馏。 知识蒸馏(KD)\[15 (https://arxiv.org/html/2607.06611#bib.bib26)\]是一种模型压缩技术,其中小型学生网络被训练以匹配大型教师的软化输出分布,从而继承教师的部分“暗知识”。Vapnik等人\[47 (https://arxiv.org/html/2607.06611#bib.bib27)\]的特权信息学习(LUPI)范式提供了一个互补的视角,其中教师可以访问测试时不可用的额外数据(特权信息)。Lopez-Paz等人\[26 (https://arxiv.org/html/2607.06611#bib.bi

相似文章

基于理据引导的知识蒸馏跨语言立场检测

arXiv cs.CL

本文提出了一种基于理据引导的知识蒸馏框架,用于跨语言立场检测,利用大型语言模型的思维链提示,通过双路径蒸馏和对比学习训练一个紧凑的学生模型。

通过合成数据蒸馏实现高效的金融语言理解

arXiv cs.CL

介绍了一种利用合成数据进行蒸馏的金融情感分析框架,将知识从大型教师模型迁移到紧凑学生模型,并采用基于聚类的种子选择方法实现高效的低资源领域适应。