SCoPE:用于对话情感识别的移位感知说话人条件先验
摘要
介绍SCoPE,一个轻量级的对话情感识别模块,该模块对说话人特有的情感先验进行建模,并利用情感移位预测来动态融合先验和多模态证据,在IEMOCAP上达到了最先进的性能。
arXiv:2607.20445v1 Announce Type: new
摘要:在对话中,人类情感是短暂的;然而,它们往往在多个语句中持续存在。例如,我们很少在快乐和愤怒等对立情绪之间瞬间切换。相反,情绪倾向于平滑演变,且这些模式通常是说话人特有的。有些人可能会加剧,而其他人则会随时间逐渐冷静。此外,当对话中情绪发生变化时,通常是由上下文因素驱动的,例如新收到的信息或意外事件。尽管对话情感识别(ERC)已取得进展,但大多数现有方法仍严重依赖显性证据,并未充分建模这些非显性因素。尤其是在多模态场景中,当信号存在噪声(如面部遮挡、俚语表达或麦克风噪声)时,这些模型变得脆弱。为解决这些局限性,我们引入了SCoPE(说话人情感条件先验)。SCoPE是一个轻量模块,它利用每个说话人的情感历史,明确建模其先验,用于后续情感分类。其次,我们整合了情感移位预测(ERC中已建立的概念),以指导模型平衡来自SCoPE的先验和多模态证据。最后,我们提出了一种移位感知融合机制,该机制在多模态证据与说话人先验之间执行精度加权的对数几率整合,形成贝叶斯启发的专家乘积公式。这种动态融合使模型在情绪持续时依赖历史先验,在可能发生移位时优先考虑多模态证据。实验结果表明,我们的模型在多模态场景下在IEMOCAP数据集上取得了优于最新最先进模型的性能。
查看缓存全文
缓存时间: 2026/07/24 05:16
# SCoPE:用于对话情感识别的基于说话者条件的移位感知先验 来源:https://arxiv.org/html/2607.20445 \[1\] Burak Can Kaplan \[1\] 汉堡大学信息学系,地址:Bundesstraße 56b,邮编:20146,汉堡,德国 ###### 摘要 在对话中,人类情感是短暂的;然而,它们往往在多个话语中持续存在。例如,我们很少在快乐和愤怒等对比情感之间瞬间切换。相反,情感倾向于平滑演变,而且这些模式通常具有说话者特异性。有些人可能会逐渐激化,而另一些人则可能随时间慢慢冷却。此外,当情感在对话中发生变化时,通常由上下文因素驱动,例如新接收到的信息或意外事件。尽管对话情感识别(ERC)取得了进展,但大多数现有方法仍然严重依赖显性证据,并未充分建模这些非显性因素。特别是在多模态设置中,当信号存在噪声(例如,面部被遮挡、俚语表达或麦克风噪声)时,这使得模型变得脆弱。为了解决这些限制,我们引入了基于说话者条件的情感先验(SCoPE)。SCoPE 是一个轻量级模块,它利用每个说话者的情感历史,并显式建模它们的先验,用于后续的情感分类。其次,我们引入了情感移位预测(ERC 中一个成熟的概念),以指导模型平衡来自 SCoPE 的先验和多模态证据。最后,我们提出了一种移位感知融合机制,该机制在多模态证据和说话者先验之间执行精度加权的 logit 集成,形成了一种受贝叶斯启发的专家乘积公式。这种动态融合使模型能够在情感持续时依赖历史先验,并在可能发生移位时优先考虑多模态证据。实验结果表明,我们的模型在多模态设置下,在 IEMOCAP 数据集上取得了优于最新模型的性能。 ###### 关键词: 情感计算,情感识别,基于 Transformer 的架构,神经网络 ## 1 引言 对话情感识别是理解和建模交互中人物情感的任务\[1 (https://arxiv.org/html/2607.20445#bib.bib1),2 (https://arxiv.org/html/2607.20445#bib.bib2)\]。ERC 模型以对话为输入,并检查每个说话者的顺序话语。对话可以是轮流进行的,也可以是随机轮次的,后者在多参与者设置中更为自然。ERC 具有巨大的潜力,可用于实现具有情感智能的人机交互(HRI)系统\[3 (https://arxiv.org/html/2607.20445#bib.bib3),4 (https://arxiv.org/html/2607.20445#bib.bib4),5 (https://arxiv.org/html/2607.20445#bib.bib5),6 (https://arxiv.org/html/2607.20445#bib.bib6)\]。与传统情感识别不同,ERC 的目标不是学习孤立的话语级表示\[7 (https://arxiv.org/html/2607.20445#bib.bib7),8 (https://arxiv.org/html/2607.20445#bib.bib8),9 (https://arxiv.org/html/2607.20445#bib.bib9)\]。相反,它学习上下文信息和情感的动态特性,这更接近现实。 ERC 面临着来自日常对话本质的多重挑战\[10 (https://arxiv.org/html/2607.20445#bib.bib10),11 (https://arxiv.org/html/2607.20445#bib.bib11)\]。首先,它需要在多个说话者之间进行强大的推理能力,因为说话者的轮次通常包含相互关联的情感轨迹。实时 ERC 不仅仅是分类,因为它是对多个时间状态的推理。其次,ERC 也需要推理能力来理解说话者真正表达的内容。由于情感不仅仅通过文本表达,其他模态中也存在许多线索。然而,处理多种模态也带来了多重挑战\[12 (https://arxiv.org/html/2607.20445#bib.bib12),13 (https://arxiv.org/html/2607.20445#bib.bib13)\]。它引入了噪声、缺失或误导性信号,有时甚至是矛盾。例如,建模讽刺是一个巨大的挑战,因为面部图像可能与上下文不一致。 参见图注 图1:多模态 ERC 数据示例,来自 MELD\[2 (https://arxiv.org/html/2607.20445#bib.bib2)\]数据集。 图1 (https://arxiv.org/html/2607.20445#S1.F1) 展示了一个多模态 ERC 数据的示例。在 ERC 数据中,我们有可观察的线索,如内容、面部表情、语音韵律等。这些线索为模型提供了显性证据。然而,情感也受到潜在因素的影响,例如: - 说话者的个性 - 说话者的情绪 - 说话者特定的倾向 这些因素通常不可直接观察,但对情感演变有强烈影响\[14 (https://arxiv.org/html/2607.20445#bib.bib14),15 (https://arxiv.org/html/2607.20445#bib.bib15),16 (https://arxiv.org/html/2607.20445#bib.bib16),17 (https://arxiv.org/html/2607.20445#bib.bib17)\]。当前的 ERC 模型仍然主要关注多模态证据,并未显式建模这些信号。然而,一个更好的 ERC 模型也应该考虑这些潜在因素,以理解说话者的情感。 在对话中,情感是暂时的状态;然而,它们仍然倾向于在多个轮次中持续存在\[18 (https://arxiv.org/html/2607.20445#bib.bib18),19 (https://arxiv.org/html/2607.20445#bib.bib19),14 (https://arxiv.org/html/2607.20445#bib.bib14),20 (https://arxiv.org/html/2607.20445#bib.bib20)\]。换句话说,人类不会在对比情感之间瞬间切换,例如从快乐到愤怒。相反,情感距离较远的状态之间的转换是稀疏且大部分是渐进的\[21 (https://arxiv.org/html/2607.20445#bib.bib21),22 (https://arxiv.org/html/2607.20445#bib.bib22),23 (https://arxiv.org/html/2607.20445#bib.bib23)\]。此外,情感的演变对于每个人来说都是不同的,受到前述潜在因素的影响。例如,有些人可能会加剧他们的感受,而另一些人则可能随时间冷却。由于情感的这种渐进演变特性,过去的情感状态为未来的状态提供了一个强大的预测信号,可用于 ERC。 情感持续性通常发生在多个轮次中,但情感不必在整个对话中保持不变。它们可能在几轮中徘徊,然后发生移位。这些移位通常由诸如接收新信息、社会反馈、意外事件或语气或互动动态的变化等因素触发\[24 (https://arxiv.org/html/2607.20445#bib.bib24),25 (https://arxiv.org/html/2607.20445#bib.bib25)\]。因此,当情感移位发生时,检查当前的多模态证据以揭示潜在因素至关重要。因此,ERC 模型必须推理何时信任情感历史,何时覆盖它。 许多当前的 ERC 模型仍然主要关注话语级的多模态特征,这使得情感的时序建模通常是隐式或浅层的。一个仅关注话语级多模态证据的系统在信号有噪声时可能变得脆弱,例如面部被遮挡、俚语文本或麦克风噪声。另一方面,最近的研究表明,追踪情感移位是重要的,并且对 ERC 分类的准确性有积极影响\[9 (https://arxiv.org/html/2607.20445#bib.bib9),26 (https://arxiv.org/html/2607.20445#bib.bib26)\]。然而,这些方法也将情感移位视为标签,而不是控制信号。此外,心理学先验在 ERC 架构中的集成非常有限,这为该领域留下了改进的潜力。 在对话中,人们不将情感视为孤立的观察。相反,随着互动的继续,他们内在地对其他说话者的情感状态持有一种信念\[27 (https://arxiv.org/html/2607.20445#bib.bib27),28 (https://arxiv.org/html/2607.20445#bib.bib28)\]。这种信念作为一种先验:“考虑到这个人的感觉到目前为止以及现在谁在说话,下一个最可能的状态是什么?”重要的是,这种信念并非总是恒定的。当情感移位不太可能时,人类倾向于更多地依赖他们关于说话者情感状态的现有信念,而在潜在变化的时刻,当前上下文和多模态证据变得更具影响力。\[29 (https://arxiv.org/html/2607.20445#bib.bib29),30 (https://arxiv.org/html/2607.20445#bib.bib30)\] 因此,有效的 ERC 不仅需要情感持续性,还需要推理何时应该改变这种持续性。受此直觉启发,我们提出了以下研究问题:(1) 从对话上下文中预测情感移位的准确度如何,(2) 如何以说话者条件化的方式显式建模情感状态持续性,以及 (3) 如何利用移位预测来指导对话设置中的时序情感推理? 为了解决这些研究问题,首先我们引入了一个双头 ERC 框架,它有一个情感分类头和一个情感移位预测头。其次,我们引入了基于说话者条件的情感先验,简称 SCoPE。SCoPE 是一个基于 GRU 的模块,旨在模拟隐式先验状态,以补充我们的双头框架。SCoPE (1) 轻量级,(2) 自回归,以及 (3) 说话者感知。最后,我们引入了一种移位感知融合,以支持模型平衡说话者先验和多模态证据。使用这种移位感知融合,当模型检测到情感移位不太可能时,历史被强调。另一方面,当移位可能时,多模态证据被更多地强调。我们的整个模型保持轻量、快速,并且可以端到端训练。 本文的贡献如下: - 我们引入了 SCoPE 作为一种新颖的基于说话者条件的时序先验生成器,用于 ERC。 - 我们将情感移位用作控制信号,而不是辅助任务。 - 我们提出了一种移位感知融合机制,该机制动态平衡先验和证据,以实现更好的 ERC 分类。 - 我们证明了我们的框架相对于其基线具有一致的性能改进,并在流行的 ERC 基准上表现出卓越的性能。 本文结构如下:第2节 (https://arxiv.org/html/2607.20445#S2) 提供了在人工智能和心理学领域关于 ERC 的先前工作,为我们的动机提供基础。第3节 (https://arxiv.org/html/2607.20445#S3) 解释了我们基线、方法和模块的细节。第4节 (https://arxiv.org/html/2607.20445#S4) 提供了关于数据集和实验设置的详细信息。我们的结果将在第5节 (https://arxiv.org/html/2607.20445#S5) 中讨论。最后,第6节 (https://arxiv.org/html/2607.20445#S6) 提供总体结论,以及未来工作的一些想法。 ## 2 相关工作 ### 2.1 ERC 概述与多模态 ERC 作为一项任务自 2019 年开始受到更多关注\[1 (https://arxiv.org/html/2607.20445#bib.bib1)\],早期的 ERC 模型在上下文感知的话语级别分类情感\[31 (https://arxiv.org/html/2607.20445#bib.bib31)\]。在架构方面,以前的 ERC 模型可以分为基于 RNN 的\[32 (https://arxiv.org/html/2607.20445#bib.bib32),10 (https://arxiv.org/html/2607.20445#bib.bib10)\]、基于 Transformer 的\[33 (https://arxiv.org/html/2607.20445#bib.bib33),34 (https://arxiv.org/html/2607.20445#bib.bib34)\] 和基于图的\[8 (https://arxiv.org/html/2607.20445#bib.bib8),35 (https://arxiv.org/html/2607.20445#bib.bib35)\]。随着最近大语言模型(LLM)的出现,ERC 分类也被通用 LLM 和基于 LLM 的 ERC 架构探索\[35 (https://arxiv.org/html/2607.20445#bib.bib35),36 (https://arxiv.org/html/2607.20445#bib.bib36),37 (https://arxiv.org/html/2607.20445#bib.bib37)\]。然而,它们的训练成本很高,并且已经观察到像 ChatGPT 这样的通用模型的性能仍然不如专门用于多模态 ERC 的模型\[38 (https://arxiv.org/html/2607.20445#bib.bib38)\]。 最初,一些 ERC 模型专注于仅文本分类\[39 (https://arxiv.org/html/2607.20445#bib.bib39),40 (https://arxiv.org/html/2607.20445#bib.bib40)\]。因为视觉和音频特征可能比文本引入更多噪声,这可能导致模型性能下降\[41 (https://arxiv.org/html/2607.20445#bib.bib41)\]。此外,高质量的多模态 ERC 数据非常稀缺,构建这样的数据集成本高昂且具有挑战性。另一方面,增强现有数据集的文本\[42 (https://arxiv.org/html/2607.20445#bib.bib42)\] 或生成更多基于文本的 ERC 数据集更容易,特别是由于 LLM 的可用性\[43 (https://arxiv.org/html/2607.20445#bib.bib43)\]。然而,如今仅文本已经不够了,特别是考虑到高级 AI 助手和 HRI 系统正变得越来越重要并得到更多关注。因此,现有的多模态数据集如 MELD\[2 (https://arxiv.org/html/2607.20445#bib.bib2)\] 和 IEMOCAP\[44 (https://arxiv.org/html/2607.20445#bib.bib44)\] 对该领域仍然具有价值,并且最近的研究越来越多地关注多模态 ERC\[41 (https://arxiv.org/html/2607.20445#bib.bib41)\]。虽然这些方法建模了上下文依赖性,但它们通常专注于提取判别性多模态特征,而不是显式建模情感动态。 ### 2.2 情感移位检测与建模 情感移位检测(ESD)是检测同一说话者在连续话语中情感移位的任务。ESD 被引入作为 ERC 的辅助任务,以显式建模 ERC 场景中的转换\[45 (https://arxiv.org/html/2607.20445#bib.bib45)\]。这是一种经过验证的提高模型分类性能的方法\[46 (https://arxiv.org/html/2607.20445#bib.bib46),45 (https://arxiv.org/html/2607.20445#bib.bib45)\]。最近,一些先前的方法使用 ESD 来显式预测情感转换或移位,用于 ERC\[26 (https://arxiv.org/html/2607.20445#bib.bib26),47 (https://arxiv.org/html/2607.20445#bib.bib47),48 (https://arxiv.org/html/2607.20445#bib.bib48)\]。情感移位已被用作: - 辅助任务\[45 (https://arxiv.org/html/2607.20445#bib.bib45),47 (https://arxiv.org/html/2607.20445#bib.bib47),26 (https://arxiv.org/html/2607.20445#bib.bib26)\], - 正则化约束\[46 (https://arxiv.org/html/2607.20445#bib.bib46),48 (https://arxiv.org/html/2607.20445#bib.bib48)\], - 评估指标(情感翻转)\[49 (https://arxiv.org/html/2607.20445#bib.bib49),50 (https://arxiv.org/html/2607.20445#bib.bib50)\], 然而,情感移位可以被利用得更加有益。许多方法在训练期间将移位用作辅助监督信号,但并未将其作为时序先验的动态控制器集成到推理中。相比之下,我们将情感移位预测用作控制信号,该信号动态调节说话者条件化时序先验相对于多模态证据的影响。 ### 2.3 时序动态与顺序情感建模 建模时序依赖性是 ERC 的一个核心挑战,因为情感状态在话语之间演变,而不是独立出现。早期的 ERC 方法使用循环架构来捕获对话轮次中的上下文依赖性\[11 (https://arxiv.org/html/2607.20445#bib.bib11),10 (https://arxiv.org/html/2607.20445#bib.bib10)\]。另一方面,后来的方法使用基于图的方法\[8 (https://arxiv.org/html/2607.20445#bib.bib8),51
相似文章
利用自定进度课程学习增强多模态对话情感识别中的模态平衡
本文提出了一种基于自定进度课程学习的即插即用模块,用于增强多模态对话情感识别中的模态平衡,在IEMOCAP和MELD数据集上实现了F1分数的一致提升。
评估主动式对话智能体中的多模态情绪识别:一项用户研究
本文介绍了一个用于主动对话智能体的多模态情绪识别模块,该模块结合了面部识别与语言分析。一项涉及20名参与者的用户研究发现了一种“扑克脸”效应,即视觉线索不可靠,而语言分析则更为准确;研究还表明,智能体可以通过对话适应性来引发情绪。
PRISM:基于优先级通道重要性与半监督领域适应的跨被试脑电图情绪识别
PRISM是一个新颖的跨被试脑电图情绪识别框架,它通过轻量级专家集成实现优先级通道重要性加权,并结合使用置信度过滤伪标签的半监督领域适应,在DEAP、DREAMER和SEED数据集上取得了最先进的结果。
EMO-BOOST:情绪增强的视听特征提升深度伪造检测的泛化能力
本文提出Emo-Boost,一种多模态深度伪造检测框架,利用情绪线索(视听情绪识别)作为高层语义信号,提升对未见操纵类型的泛化能力,在FakeAVCeleb数据集上实现了平均AUC提升2.1%。
Scenema Audio:零样本富有表现力的语音克隆与语音生成 [N]
Scenema AI 发布了 Scenema Audio,一个开源的基于扩散模型的零样本富有表现力的语音克隆与语音生成模型,将情感表现与声音身份分离,使任何声音都能演绎任何情感。