C$^2$MOE:基于一致性与互补性引导的混合专家框架用于不完整多模态情感学习
摘要
论文提出C²MOE,一种基于一致性与互补性引导的混合专家框架,用于对话中的不完整多模态情感识别,利用信息论分解在模态缺失时提高鲁棒性。
arXiv:2608.04013v1 公告类型:交叉
摘要:多模态对话情感识别(MERC)的最新进展凸显其对完整多模态输入的依赖。然而,现实世界的数据常常因传输错误或用户行为而出现模态缺失,严重降低模型性能。现有方法通过跨模态一致性学习增强鲁棒性,但很大程度上忽略了模态互补性,导致有偏的重建。为解决这一局限,我们提出C$2$MOE,一种新颖的基于一致性与互补性引导的混合专家框架,用于不完整多模态情感学习。我们的方法在原理化的信息论框架内统一了表示学习和缺失模态插补。具体而言,多模态知识通过交互感知的专家分解为一致性和互补性成分。一致性通过最大化跨模态可预测性来捕获,而互补性通过最大化模态之间的条件熵来保留。基于这种分解,C$2$MOE引入了一种双分支预测机制,用于在模态缺失下进行鲁棒的插补。一致性分支通过最小化不确定性将插补特征与联合分布对齐,互补性分支则通过熵最大化利用模态特有线索。最后,C$2$MOE采用一个可学习的重新加权模块,动态地为每个专家的输出分配重要性分数,从而实现鲁棒且自适应的插补融合。在多个MERC基准上的大量实验表明,C$2$MOE在各种模态缺失设置下持续超越最先进的方法,验证了其鲁棒性和泛化能力。
查看缓存全文
缓存时间: 2026/08/06 07:44
# C2MOE: 一致性和互补性引导的专家混合用于不完整多模态情感学习 来源:https://arxiv.org/html/2608.04013 Yuntao Shou、Tao Meng 中南林业科技大学,湖南,中国 [email protected] (https://arxiv.org/html/2608.04013v1/mailto:[email protected]) Wei Ai 中南林业科技大学,湖南,中国 [email protected] (https://arxiv.org/html/2608.04013v1/mailto:[email protected]) 以及 Keqin Li 纽约州立大学新帕尔茨分校,纽约州新帕尔茨市 12561,美国;西安,中国 [email protected] (https://arxiv.org/html/2608.04013v1/mailto:[email protected]) \(2018\) ###### 摘要。 多模态对话情感识别(MERC)的最新进展凸显了其对完整多模态输入的依赖。然而,真实世界的数据常常因传输错误或用户行为而出现模态缺失,严重降低模型性能。现有方法通过跨模态一致性学习来增强鲁棒性,但大多忽略了模态互补性,导致重建结果存在偏差。为解决这一局限性,我们提出了C2MOE,一种新颖的基于一致性和互补性引导的专家混合(Mixture of Experts)框架,用于不完整多模态情感学习。我们的方法在原则性的信息论框架内统一了表示学习和缺失模态填补。具体来说,通过交互感知的专家将多模态知识分解为一致性成分和互补性成分。一致性通过最大化跨模态可预测性来捕捉,而互补性则通过最大化模态之间的条件熵来保留。基于这一分解,C2MOE引入了一种双分支预测机制,用于在模态缺失下进行鲁棒的填补。一致性分支通过最小化不确定性,将填补后的特征与联合分布对齐;互补性分支则通过熵最大化来利用模态独有的线索。最后,C2MOE采用一个可学习的重加权模块,动态地为每个专家的输出分配重要性分数,从而产生一种鲁棒且自适应的融合用于填补。在多个MERC基准上的大量实验表明,C2MOE在各种模态缺失设置下始终优于最先进的方法,验证了其鲁棒性和泛化能力。 多模态情感识别,特征融合,专家混合,不完整多模态学习 ††copyright:acmcopyright††journalyear:2018††doi:XXXXXXX\.XXXXXXX††price:15\.00††isbn:978\-1\-4503\-XXXX\-X/18/06††ccs:Computing methodologies Discourse, dialogue and pragmatics††ccs:Computing methodologies Non\-negative matrix factorization††ccs:Theory of computation Fixed parameter tractabilityRefer to caption图1。我们从信息论的角度展示了基本观察和理论洞见。\(a\) 黑色实线矩形表示完整模态特征 Z1=R1∪R2∪R3∪R4\{Z\_\{1\}\}=\{R\_\{1\}\}\\cup\{R\_\{2\}\}\\cup\{R\_\{3\}\}\\cup\{R\_\{4\}\},绿色虚线矩形表示不完整模态特征 Z2=R3∪R4∪R6∪R7\{Z\_\{2\}\}=\{R\_\{3\}\}\\cup\{R\_\{4\}\}\\cup\{R\_\{6\}\}\\cup\{R\_\{7\}\},红色实线矩形表示任务相关特征 Y=R2∪R4∪R5∪R6\{Y\}=\{R\_\{2\}\}\\cup\{R\_\{4\}\}\\cup\{R\_\{5\}\}\\cup\{R\_\{6\}\}。其中,R1\{R\_\{1\}\} 和 R7\{R\_\{7\}\} 是模态特有但与任务无关的区域;R2\{R\_\{2\}\} 和 R6\{R\_\{6\}\} 是模态特有且与任务相关(互补)的区域;R3\{R\_\{3\}\} 和 R4\{R\_\{4\}\} 是共享(一致)区域,其中 R3\{R\_\{3\}\} 与任务无关,R4\{R\_\{4\}\} 与任务相关;R5\{R\_\{5\}\} 是与任务相关但未知的区域。\(b\) 最大化一致的任务相关语义需要扩大 R4\{R\_\{4\}\},同时抑制 R1\{R\_\{1\}\} 和 R7\{R\_\{7\}\}。\(c\) 相反,最大化互补的任务相关语义需要缩小 R4\{R\_\{4\}\},并扩大 R2\{R\_\{2\}\} 和 R6\{R\_\{6\}\}。 ## 1\. 引言 对话中的多模态情感识别(MERC)的核心目标是通过整合异构模态来提高情感分析的准确性和鲁棒性(Li et al., 2023 (https://arxiv.org/html/2608.04013#bib.bib19); Tsai et al., 2019 (https://arxiv.org/html/2608.04013#bib.bib51); Li et al., 2024a (https://arxiv.org/html/2608.04013#bib.bib16); Xu et al., 2024 (https://arxiv.org/html/2608.04013#bib.bib56); Shou et al., 2026b (https://arxiv.org/html/2608.04013#bib.bib40), 2022 (https://arxiv.org/html/2608.04013#bib.bib44), 2024c (https://arxiv.org/html/2608.04013#bib.bib46), 2024b (https://arxiv.org/html/2608.04013#bib.bib39))。近期的研究集中于学习判别性的跨模态表征并开发有效的融合策略(Ding et al., 2023 (https://arxiv.org/html/2608.04013#bib.bib8); Ramesh et al., 2021 (https://arxiv.org/html/2608.04013#bib.bib31); Hu et al., 2024 (https://arxiv.org/html/2608.04013#bib.bib13); Shou et al., 2025f (https://arxiv.org/html/2608.04013#bib.bib42); Meng et al., 2024b (https://arxiv.org/html/2608.04013#bib.bib28); Shou et al., 2025b (https://arxiv.org/html/2608.04013#bib.bib35); Meng et al., 2024a (https://arxiv.org/html/2608.04013#bib.bib27); Shou et al., 2025c (https://arxiv.org/html/2608.04013#bib.bib37), h (https://arxiv.org/html/2608.04013#bib.bib45))。然而,真实世界场景中经常出现模态缺失,这严重降低了模型的性能和鲁棒性(Wang et al., 2023a (https://arxiv.org/html/2608.04013#bib.bib53))。因此,设计对不完整模态具有鲁棒性的MERC模型已成为一个关键的研究挑战(Wang et al., 2024 (https://arxiv.org/html/2608.04013#bib.bib55); Zhang et al., 2024a (https://arxiv.org/html/2608.04013#bib.bib61); Liu et al., 2024 (https://arxiv.org/html/2608.04013#bib.bib24); Zhang et al., 2024b (https://arxiv.org/html/2608.04013#bib.bib60); Shou et al., 2026b (https://arxiv.org/html/2608.04013#bib.bib40), 2025c (https://arxiv.org/html/2608.04013#bib.bib37), 2025f (https://arxiv.org/html/2608.04013#bib.bib42), c (https://arxiv.org/html/2608.04013#bib.bib48))。 对于不完整多模态下的MERC,一种常见的解决方案是使用编码器-解码器框架从观测到的模态中恢复缺失模态。编码器从可用的表示中估计缺失模态,解码器则在原始特征空间中重建该模态。例如,Zhao等人(Zhao et al., 2021a (https://arxiv.org/html/2608.04013#bib.bib62))将自编码器与循环一致性相结合以减少失真和噪声,而Lian等人(Lian et al., 2023 (https://arxiv.org/html/2608.04013#bib.bib20))将多模态特征建模为图节点,并利用图神经网络传播信息以完成缺失模态。然而,这些方法对恢复机制的可解释性有限。为解决这一问题,信息论方法(Lin et al., 2021 (https://arxiv.org/html/2608.04013#bib.bib23), 2022 (https://arxiv.org/html/2608.04013#bib.bib22))通过最大化模态之间的互信息来增强跨模态一致性,从而在模态缺失条件下提升性能。然而,这些方法忽略了互补性对多模态学习的影响。 然而,联合建模模态间的一致性和互补性面临着根本性的挑战,因为这两个目标本质上是相互冲突的。促进一致性需要最小化条件熵 H(Zi∣Zj)H(\mathbf{Z}^i\mid\mathbf{Z}^j) 以减少跨模态不确定性,而增强互补性则依赖于最大化同一个量以保留模态特有的信息。为解决这一问题,我们提出了一致性和互补性引导的专家混合框架(C2MOE),通过专门的专家和自适应路由将这两个目标解耦。C2MOE在专家混合架构中采用两个专家。一致性专家最大化互信息 I(Z1,Z2)I(\mathbf{Z}^1,\mathbf{Z}^2) 并最小化条件熵,以使恢复的数据与真实分布对齐。互补性专家则执行相反的优化,以保留模态独有的特征并增强重建鲁棒性。一个动态门控网络根据模态可用性和语义上下文将每个输入分配给合适的专家,一个协调模块将它们的输出融合为一个统一的表示,在一致性和互补性之间取得平衡。总体而言,我们的贡献如下: - •据我们所知,我们首次尝试从信息论的角度将一致性和互补性语义信息整合到一个统一的专家混合(MOE)框架中,以缓解数据缺失问题。 - •为了处理一致性和互补性之间的内在冲突,我们提出了C2MOE模型,通过专门的专家和自适应路由来解耦这两个目标。C2MOE动态地为每个输入选择最合适的专家,实现有针对性且互不干扰的学习。 - •在多个数据集上进行了大量实验,以证明所提出的C2MOE在对话中的不完整多模态情感识别方面优于最先进的方法。 ## 2\. 相关工作 ### 2\.1\. 不完整模态学习 不完整多模态学习旨在解决真实世界场景中的模态缺失问题,在这些场景中,数据采集约束或环境因素常常导致部分观测(Zhao et al., 2021a (https://arxiv.org/html/2608.04013#bib.bib62); Duan et al., 2023 (https://arxiv.org/html/2608.04013#bib.bib9); Li et al., 2024b (https://arxiv.org/html/2608.04013#bib.bib17); Zhu et al., 2025 (https://arxiv.org/html/2608.04013#bib.bib64); Lang et al., 2025 (https://arxiv.org/html/2608.04013#bib.bib15); Dai et al., 2025 (https://arxiv.org/html/2608.04013#bib.bib5); Shou et al., 2026a (https://arxiv.org/html/2608.04013#bib.bib34), 2024a (https://arxiv.org/html/2608.04013#bib.bib33))。现有方法主要分为两种范式:共享子空间学习和模态恢复。共享子空间方法通过学习一个公共的低维表示来对齐模态,从而最大化跨模态相关性(Wang et al., 2015 (https://arxiv.org/html/2608.04013#bib.bib52); Andrew et al., 2013 (https://arxiv.org/html/2608.04013#bib.bib3); Zhang et al., 2020 (https://arxiv.org/html/2608.04013#bib.bib59); Pham et al., 2019 (https://arxiv.org/html/2608.04013#bib.bib30); Shou et al., 2025a (https://arxiv.org/html/2608.04013#bib.bib36); Ai et al., 2026 (https://arxiv.org/html/2608.04013#bib.bib2))。然而,过度强调相关性可能会忽略对下游任务至关重要的模态特有判别线索。相比之下,模态恢复方法显式地从观测到的模态中重建缺失模态。这些方法包括简单的启发式方法,如零填充(Zhang et al., 2020 (https://arxiv.org/html/2608.04013#bib.bib59); Deng et al., 2025 (https://arxiv.org/html/2608.04013#bib.bib7))或均值填补(Andrew et al., 2013 (https://arxiv.org/html/2608.04013#bib.bib3)),以及利用强大表示模型的深度生成策略。值得注意的是,循环一致的跨模态重建(Pham et al., 2019 (https://arxiv.org/html/2608.04013#bib.bib30); Zhao et al., 2021a (https://arxiv.org/html/2608.04013#bib.bib62))、级联残差自编码器(Tran et al., 2017 (https://arxiv.org/html/2608.04013#bib.bib50))以及基于图的方法(Lian et al., 2023 (https://arxiv.org/html/2608.04013#bib.bib20))在捕捉复杂的模态间依赖关系以实现有效恢复方面展现出了潜力。 Refer to caption图2。所提出的C2MOE框架的整体架构。模型首先使用一维卷积以及说话人嵌入和位置嵌入来提取多模态特征。NN\-1执行模态内重建,以保留模态特有信息,从而实现稳定的恢复。NN\-2在信息论空间中引入一致性专家和互补性专家,使多模态知识能够被解耦为共享成分和模态独有成分。一致性专家增强跨模态可预测性,而互补性专家最大化条件熵以保留模态特有线索。基于这两个专家,C2MOE形成了一种双分支预测机制,用于在模态缺失下进行鲁棒的填补。\(b\) NN\-1:模态内重建。\(c\) NN\-2:一致性和互补性对比学习。 ### 2\.2\. 对比学习 作为一种高效的无监督学习模型,对比学习(CL)在特征学习方面取得了显著成果(Lin et al., 2021 (https://arxiv.org/html/2608.04013#bib.bib23); Shou et al., 2025d (https://arxiv.org/html/2608.04013#bib.bib38), g (https://arxiv.org/html/2608.04013#bib.bib43), e (https://arxiv.org/html/2608.04013#bib.bib41), i (https://arxiv.org/html/2608.04013#bib.bib47))。CL的核心思想是构建一个特征空间,在这个空间中,相似的数据被映射到彼此相近的位置,而不同的数据点则被推离到较远的位置(Chen et al., 2020 (https://arxiv.org/html/2608.04013#bib.bib4)),(Deng et al., 2018 (https://arxiv.org/html/2608.04013#bib.bib6)),(Hadsell et al., 2006 (https://arxiv.org/html/2608.04013#bib.bib10)),(Li et al., 2021 (https://arxiv.org/html/2608.04013#bib.bib18)),(Tian et al., 2020 (https://arxiv.org/html/2608.04013#bib.bib49))。近期研究揭示了对比学习成功背后的一个关键因素:互信息最大化。例如,MoCo(He et al., 2020 (https://arxiv.org/html/2608.04013#bib.bib11))通过优化对比学习损失函数,最大化查询特征与对应关键特征之间的相似度,同时最小化查询特征与其他无关关键特征之间的相似度。CPC(Oord et al., 2018 (https://arxiv.org/html/2608.04013#bib.bib29))试图最大化真实未来信息与当前上下文之间的相似度,同时最小化当前上下文与负样本之间的相似度。MoCo和CPC都通过最小化InfoNCE损失来最大化互信息,该损失可以被视为最大化互信息的一个下界。 ## 3\. 问题定义 在多模态学习中,我们将一个包含 MM 个异构模态的样本表示为 (X1,X2,...,XM)(X^\{1\},X^\{2\},\ldots,X^\{M\}),其中 XmX^\{m\} 对应第 mm 个模态的输入。在真实世界应用中,由于传感器噪声、传输错误或数据采集过程中的行为差异,某些模态可能缺失。为了形式化描述这种不完整设置,我们引入一个可观测性指示符 λm∈{0,1}\lambda^\{m\}\in\{0,1\},其中 λm=1\lambda^\{m\}=1 表示模态 mm 可用,λm=0\lambda^\{m\}=0 表示该模态缺失。由此得到观测模态集合 Iobs={m∣λm=1}I^\{\mathrm\{obs\}\}=\{m\mid\lambda^\{m\}=1\} 和缺失模态集合 Imiss={m∣λm=0}I^\{\mathrm\{miss\}\}=\{m\mid\lambda^\{m\}=0\}。我们的目标是利用 IobsI^\{\mathrm\{obs\}\} 中包含的信息来推断和重建 ImissI^\{\mathrm\{miss\}\} 中模态的表示,从而减轻数据不完整带来的不利影响,并为下游任务构建更连贯、信息更丰富且可直接用于融合的多模态表示。 ## 4\. 所提出的方法 ### 4\.1\. 模态编码器 由于文本、音频和视频的原始特征在维度和尺度上存在显著差异,直接使用它们进行缺失模态恢复会导致分布不匹配。
相似文章
LongMoE:基于轨迹感知的混合专家模型的纵向多模态学习
LongMoE提出了一个统一框架,同时解决多模态临床学习中的模态缺失和纵向动态问题,利用上下文感知插补、注意力令牌化、轨迹感知编码和稀疏混合专家路由。在ADNI、OASIS-3和MIMIC-IV上的实验表明,在缺失模态情况下鲁棒性得到提升,同时在完整模态设置下仍具有竞争力。
混合专家模型中的涌现式模块化(8 分钟阅读)
Ai2 发布了 EMO,一个 14B 参数的混合专家语言模型,训练用于发展涌现式模块化。它允许在特定任务中使用一小部分专家,同时保持接近全模型性能。
利用自定进度课程学习增强多模态对话情感识别中的模态平衡
本文提出了一种基于自定进度课程学习的即插即用模块,用于增强多模态对话情感识别中的模态平衡,在IEMOCAP和MELD数据集上实现了F1分数的一致提升。
面向混合专家模型中一致专家选择的多层级上下文建模
本文提出了多层级上下文融合MoE(MCF-MOE)框架,通过集成跨层语义聚合和局部词元级交互,提升了混合专家模型中的路由一致性,在语言建模和理解基准测试上优于强基线。
MODE: 面向MoE多模态大语言模型的模态分解专家级混合精度量化框架
本文介绍MODE,一种用于MoE多模态大语言模型的模态分解专家级混合精度量化框架,通过按模态分解选择频率并过滤冗余视觉标记来解决专家重要性估计中的偏差,在激进量化下实现极小的性能损失。