对比混合提示学习用于未见模态组合的不完整多模态情感分析

arXiv cs.AI 论文

摘要

本文针对未见模态组合的不完整多模态情感分析问题,提出对比混合提示学习(CMPL)模型,该模型利用标签引导的对比学习和模态组合提示来增强泛化能力,在基准数据集上实现了超过5%的准确率提升。

arXiv:2608.20019v1 Announce Type: new Abstract: 不完整多模态情感分析近年来受到了广泛关注。现有方法通常假设数据随机缺失或针对特定缺失模式设计,忽略了训练和测试阶段之间的模态组合不一致性。然而,在实际场景中,测试阶段常遇到训练阶段未出现的模态组合,这导致泛化能力不足和性能不稳定。本文引入了未见模态组合的不完整多模态情感分析(IMSAUMC)问题,旨在增强模型对未见模态组合的泛化能力。为应对这一挑战,我们提出了名为$\textbf{C}$ontrastive $\textbf{M}$ixed $\textbf{P}$rompt $\textbf{L}$earning ($\textsf{CMPL}$) 的模型用于IMSAUMC。它引入标签引导的对比特征学习机制,以学习鲁棒且具有判别性的跨模态表示。此外,我们设计了带有软路由器的模态组合提示,以促进对各种模态组合的更好学习。进一步,我们引入了三种提示对比学习策略,使得能够有效学习对应于未见模态组合的提示,从而显著增强模型在不同测试场景中的泛化能力。在三个广泛使用的数据集上进行的大量实验表明,$\textsf{CMPL}$ 相较于最先进的方法实现了超过5%的准确率提升。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:15

# 面向未见模态组合的不完整多模态情感分析的对比混合提示学习
来源:https://arxiv.org/html/2608.20019
NaiJin LiuYulin KangTangyue JinZixuan YuWenxi ZhaoYibei LiuQianle ZhangYangyang Wu\\correspondingMengying ZhuMeng Xi

###### 摘要

不完整多模态情感分析近年来受到了广泛关注。现有方法通常假设数据随机缺失,或专门针对特定缺失模式设计,忽略了训练与测试阶段之间的模态组合不一致性。然而,在现实场景中,测试阶段常会遇到训练阶段未出现的模态组合,这导致模型泛化能力不足且性能不稳定。本文提出了不完整多模态情感分析中未见模态组合(IMSAUMC)的问题,旨在增强模型对未见模态组合的泛化能力。为应对这一挑战,我们提出名为对比混合提示学习(CMPL)的模型用于IMSAUMC。该模型引入标签引导的对比特征学习机制,以学习鲁棒且有区分性的跨模态表示。此外,我们设计了带有软路由器的模态组合提示,以促进对各种模态组合的更好学习。同时,我们引入了三种提示对比学习策略,使模型能够有效学习对应未见模态组合的提示,从而显著增强模型在不同测试场景中的泛化能力。在三个广泛使用的数据集上进行的大量实验表明,与最先进方法相比,CMPL在准确率上实现了超过5%的提升。

## 引言

多模态情感分析(MSA)近年来已成为一个关键研究领域。通过联合建模文本话语、声学特征和视觉表达,MSA系统旨在推断人类情感状态,与单模态方法相比具有显著增强的鲁棒性。许多工作(7 (https://arxiv.org/html/2608.20019#bib.bib20);40 (https://arxiv.org/html/2608.20019#bib.bib21);10 (https://arxiv.org/html/2608.20019#bib.bib22);19 (https://arxiv.org/html/2608.20019#bib.bib23);28 (https://arxiv.org/html/2608.20019#bib.bib39))通过利用跨模态互补性取得了有希望的结果。

然而,现实部署场景经常违反全模态假设。传感器故障、背景噪声、遮挡和隐私约束等实际挑战常常导致推理时模态缺失。因此,大量研究工作已转向针对缺失模态的MSA(22 (https://arxiv.org/html/2608.20019#bib.bib11);20 (https://arxiv.org/html/2608.20019#bib.bib12);8 (https://arxiv.org/html/2608.20019#bib.bib24);14 (https://arxiv.org/html/2608.20019#bib.bib37);15 (https://arxiv.org/html/2608.20019#bib.bib38))。
图1:通用的缺失模态MSA任务与IMSAUMC任务之间的区别。在通用的缺失模态MSA任务中,训练和测试阶段都包含所有可能的模态组合。然而,在我们的IMSAUMC任务中,训练期间只存在部分模态组合,而测试期间可能出现未见的模态组合。尽管这些方法对随机模态缺失表现出一定的鲁棒性,但它们从根本上假设在训练期间所有模态组合都已被观察到。然而,在现实数据中,缺失模式往往是结构化的而非随机的。例如,摄像头故障导致视觉特征缺失;随后的音频故障则导致视觉-音频模态组合完全缺失。因此,数据集可能仅包含部分可能的组合,而测试集很可能遇到未见的组合。另一个例子是,社交媒体上的用户可能因隐私考虑拒绝上传某些模态(如音频),导致数据集仅包含部分组合。在这种场景下,我们旨在仅使用可用的部分组合训练模型,同时确保在推理时遇到更完整的模态组合时仍具有强大的泛化能力。

对于具有n个模态的数据集,存在2^n-1种可能的组合。如上所述,数据集可能无法覆盖所有缺失模式,尤其当n增长时,测试集可能遇到未见的模态组合。因此,现有方法往往难以有效处理此类场景,亟需能够泛化到未见模态组合的方法。

我们引入了不完整多模态情感分析中未见模态组合(IMSAUMC)的任务,该任务处理测试时的缺失模态和未见模态组合,如图1(https://arxiv.org/html/2608.20019#Sx1.F1)所示。虽然先前在缺失模态MSA方面的工作取得了显著进展,但两个关键挑战仍然存在:第一,许多工作采用对比学习以获得模态不变表示。然而,大多数方法未能考虑数据的内在结构,可能会分离语义相似的样本,导致表示欠佳(CH1)。第二,在涉及未见模态组合的场景中,现有方法常常忽略不同模态组合之间的关系,因此难以有效处理测试数据中那些在训练阶段未遇到的模态组合(CH2)。

为应对这些挑战,我们提出了用于未见模态组合多模态情感分析的对比混合提示学习(CMPL)。具体而言,针对CH1,我们引入了标签引导的对比特征学习,它结合标签相似性约束,将相同标签样本的表示拉近,同时保持其他样本的距离与标签不相似性成正比。对于CH2,我们设计了带有软路由机制的混合模态组合提示,以动态选择提示来全面建模组合间关系。此外,我们开发了三种提示对比学习策略,以进一步增强对未见组合的泛化能力:模态信息保留策略、跨组合互补策略和条件信息对齐策略。主要贡献总结如下:
- •我们提出了CMPL,一种用于IMSAUMC任务的新颖模型,可增强对未见模态组合的泛化能力。据我们所知,这是首个解决此问题的工作。
- •我们提出了一种*标签引导的对比特征学习*机制,该机制强制具有相同标签样本的表示保持一致性,同时约束不相似样本之间的距离与其标签差异成正比。这保留了样本表示内的结构关系。
- •我们引入了一种*混合提示学习*机制,并结合三种*提示对比学习*策略。这些策略全面建模了组合间关系,并增强了模型对未见模态组合的泛化能力。
- •在CMU-MOSI、CMU-MOSEI和SIMS-V2数据集上的大量实验证明了我们方法相较于最先进方法的有效性。

## 相关工作

### 多模态情感分析

多模态情感分析(MSA)旨在通过整合来自多个模态(如文本、视觉和声学信号)的异构数据来推断情感。MSA方法(26 (https://arxiv.org/html/2608.20019#bib.bib25);33 (https://arxiv.org/html/2608.20019#bib.bib1);21 (https://arxiv.org/html/2608.20019#bib.bib26);23 (https://arxiv.org/html/2608.20019#bib.bib2);16 (https://arxiv.org/html/2608.20019#bib.bib3))利用跨模态互补性来提高鲁棒性和准确性,优于单模态方法。例如,33 (https://arxiv.org/html/2608.20019#bib.bib1)提出了self-MM(33 (https://arxiv.org/html/2608.20019#bib.bib1)),通过将单模态子任务作为伪标签监督来联合训练多模态主任务,以学习模态间一致性和跨模态差异。23 (https://arxiv.org/html/2608.20019#bib.bib2)提出了Cube-MLP(23 (https://arxiv.org/html/2608.20019#bib.bib2)),通过MLP单元沿三个轴混合特征。16 (https://arxiv.org/html/2608.20019#bib.bib3)引入了DMD(16 (https://arxiv.org/html/2608.20019#bib.bib3)),通过自适应跨模态蒸馏解耦同质和异质特征,以增强模态可区分性。28 (https://arxiv.org/html/2608.20019#bib.bib39)提出了DLF(28 (https://arxiv.org/html/2608.20019#bib.bib39)),一个解耦的语言聚焦框架,通过减少跨模态冗余来提高MSA性能。
图注 图2:我们的CMPL框架,由三个组成部分构成:*标签引导的对比特征学习*模块、*混合提示学习*机制和*提示对比学习*策略。以训练数据中缺少音频-视觉和文本-音频-视觉模态组合,以及输入中缺失视觉模态为例。
然而,现实数据常常存在模态缺失。许多方法(34 (https://arxiv.org/html/2608.20019#bib.bib4);38 (https://arxiv.org/html/2608.20019#bib.bib27);35 (https://arxiv.org/html/2608.20019#bib.bib28);29 (https://arxiv.org/html/2608.20019#bib.bib6);39 (https://arxiv.org/html/2608.20019#bib.bib7))已被开发用于解决缺失模态的MSA。例如,TFR-Net(34 (https://arxiv.org/html/2608.20019#bib.bib4))采用特征重建模块来生成缺失模态内容。LNLN(39 (https://arxiv.org/html/2608.20019#bib.bib7))通过确保高质量的主导模态表示来提高鲁棒性。HME(42 (https://arxiv.org/html/2608.20019#bib.bib41))利用跨样本语义增强和不确定性感知融合,消除了显式模态重建,同时增强了鲁棒性和泛化能力。MFMB-Net(24 (https://arxiv.org/html/2608.20019#bib.bib42))联合执行全局-局部双流融合和协同特征重建,以鲁棒地处理缺失模态。然而,这些方法忽略了缺失模态场景中模态组合分布的不一致性,即测试集可能包含训练期间未出现的未见模态组合。相比之下,我们的方法侧重于利用已知的模态组合信息来增强对未见组合的泛化能力。

### 提示学习

提示学习已成为将预训练模型(如大型语言模型LLM)适配到下游任务的有力范式(4 (https://arxiv.org/html/2608.20019#bib.bib29);6 (https://arxiv.org/html/2608.20019#bib.bib30);17 (https://arxiv.org/html/2608.20019#bib.bib31);41 (https://arxiv.org/html/2608.20019#bib.bib40))。27 (https://arxiv.org/html/2608.20019#bib.bib8)将视觉嵌入作为前缀提示连接,使冻结的语言模型能够生成合适的描述(27 (https://arxiv.org/html/2608.20019#bib.bib8))。13 (https://arxiv.org/html/2608.20019#bib.bib9)为不同的缺失模态情况设计了缺失感知提示,以增强鲁棒性(13 (https://arxiv.org/html/2608.20019#bib.bib9))。12 (https://arxiv.org/html/2608.20019#bib.bib10)设计了分支感知的多模态提示,以增强语言与视觉模态之间的对齐(12 (https://arxiv.org/html/2608.20019#bib.bib10))。MPLMM(5 (https://arxiv.org/html/2608.20019#bib.bib5))生成缺失模态特征,并通过设计生成式、缺失信号和缺失类型提示来增强模态内和模态间学习。这些方法忽略了模态组合之间的关系,限制了它们对未见组合的泛化能力。相比之下,我们的方法彻底探索了模态间关系,并设计了三种提示对比学习策略来解决未见模态组合的问题。

## 方法论

### 问题表述

给定一个具有三种模态(文本、音频、视觉)的多模态数据集X={Xt,Xa,Xv}\\mathbf\{X\}=\\\{\\mathbf\{X\}^\{t\},\\mathbf\{X\}^\{a\},\\mathbf\{X\}^\{v\}\\\},其中每个Xk={x1k,⋯,xNk}∈RN×lk×dk\\mathbf\{X\}^\{k\}=\\\{\\{\\mathbf\{x\}^\{k\}\_\{1\},\\cdots,\\mathbf\{x\}^\{k\}\_\{N\}\}\\\}\\in\\mathbb\{R\}^\{N\\times l\_\{k\}\\times d\_\{k\}\}表示模态k的特征矩阵,其中N是样本数量,lk和dk分别是序列长度和嵌入维度,k∈{t,a,v}k\\in\\\{t,a,v\\\}。情感标签为Y∈RN\\mathbf\{Y\}\\in\\mathbb\{R\}^\{N\}。对于缺失模态,我们定义掩码矩阵Mt\\mathbf\{M\}^\{t\},Ma\\mathbf\{M\}^\{a\},Mv\\mathbf\{M\}^\{v\},其中Mik=0\\mathbf\{M\}^\{k\}\_\{i\}=0表示第i个样本在模态k缺失,Mik=1\\mathbf\{M\}^\{k\}\_\{i\}=1表示其存在。文本特征来自LLM的文本嵌入,而音频和视觉特征则使用预训练工具包提取。对于这三种模态,排除全缺失的情况,存在T=7种可能的模态组合,记为S={S1,S2,⋯,ST}={{t},{a},{v},{t,a},{t,v},{a,v},{t,a,v}}\\mathcal\{S\}=\\\{S\_\{1\},S\_\{2\},\\cdots,S\_\{T\}\}=\\\{\\\{t\\\},\\\{a\\\},\\\{v\\\},\\\{t,a\\\},\\\{t,v\\\},\\\{a,v\\\},\\\{t,a,v\\\}\}。例如,S4表示文本-音频组合(视觉模态缺失),可用数据为x={xt,xa}。更详细的信息可以在附录A(https://arxiv.org/html/2608.20019#A1)中找到。

*定义。*IMSAUMC的目标是训练一个用于情感分析的模型,条件是训练数据仅包含S中的模态组合子集,而测试数据包含所有可能的模态组合(即S)。模型必须在测试时泛化到未见的模态组合。

### 整体框架

图2(https://arxiv.org/html/2608.20019#Sx2.F2)展示了我们CMPL的框架。首先,在表示学习阶段,我们使用预训练工具为音频和视觉模态提取序列嵌入,并通过自适应平均池化减少序列长度。对于文本模态,我们利用LLM的文本嵌入获得上下文相关的嵌入。然后,在标签相似性的引导下,我们在模态嵌入之间应用对比学习,在保留语义结构的同时学习鲁棒的表示。此外,我们为每种模态组合配备一个提示。然后将多模态嵌入送入路由器以生成混合提示。进一步,采用三种提示对比学习策略来挖掘模态组合之间的关系,提高对未见模态组合的泛化能力。最后,我们使用以下目标函数训练CMPL:
LCMPL=Ltask+α⋅Llcfl+β⋅Lpcl,\\mathcal\{L\}\_\{\\textsf\{CMPL\}\}=\\mathcal\{L\}\_\{task\}\+\\alpha\\cdot\\mathcal\{L\}\_\{lcfl\}\+\\beta\\cdot\\mathcal\{L\}\_\{pcl\},(1)
其中Ltask\\mathcal\{L\}\_\{task\},Llcfl\\mathcal\{L\}\_\{lcfl\} 和Lpcl\\mathcal\{L\}\_\{pcl\}分别是任务特定损失、标签引导对比损失和提示对比损失。这里,Ltask\\mathcal\{L\}\_\{task\}用于指导模型的预测,我们为此采用来自LLM的传统自回归交叉熵损失。参数α和β是Llcfl和Lpcl的平衡因子。

相似文章