基于语义感知的完整性重建的鲁棒多模态情感分析

arXiv cs.CL 论文

摘要

本文提出一种用于处理不完整模态的鲁棒多模态情感分析的语义感知完整性估计方法,旨在提高情感相关线索缺失时的准确性。

arXiv:2609.10950v1 Announce Type: new 摘要:近期多模态情感分析研究越来越多地采用以文本为中心的融合方法,以利用文本模态中固有的丰富情感信息。然而,在现实场景中,由于部分缺失或噪声数据,这些方法在推理时常常出现性能下降,尤其是当情感相关线索缺失时。为解决这一问题,我们提出了一种新的完整性估计方法,该方法量化不完整数据中保留的情感相关信息程度,以指导缺失语义的重建。此外,我们提出一种训练策略,在联合优化情感预测和完整性估计的同时稳定多任务学习。在三个基准数据集上的大量实验和深入分析表明,所提方法能够实现更准确的语义重建,从而带来更精确的情感预测。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:20

# 基于语义感知完整性重构的不完整模态鲁棒多模态情感分析
来源:https://arxiv.org/html/2609.10950
Byunggill Joe11footnotemark:1 Saim Shin Jin Yea Jang††thanks:通讯作者。机构:韩国电子技术研究院 (KETI) 机构:韩国城南市 机构:\{hanjun_c, byunggill, sishin, jinyea.jang\}@keti.re.kr

###### 摘要

近期多模态情感分析研究日益采用以文本为中心的融合方法,以利用文本模态固有的丰富情感信息。然而,在现实场景中,由于部分数据缺失或存在噪声,这些方法在推理时常常性能下降,尤其是当情感相关线索缺失时。为解决此问题,我们引入了一种新的完整性估计方法,该方法量化了不完整数据中保留的情感相关信息程度,以指导缺失语义的重构。此外,我们提出了一种训练策略,该策略在联合优化情感预测和完整性估计时能稳定多任务学习。在三个基准数据集上的广泛实验和深入分析表明,所提出的方法能够实现更准确的语义重构,从而带来更精确的情感预测。

## 1引言

参见标题图1:基于缺失率的完整性与基于语义的完整性的比较。前者计算为 1 - r,其中 r ∈ [0, 1) 表示缺失率,而后者则由我们提出的方法估计。基于文本中丰富的情感相关信息 [Hazarika et al. (2022); Wei et al. (2023)],近期多模态情感分析 (MSA) 研究越来越倾向于探索以文本为中心的方法 [Han et al. (2021); Wang et al. (2023a); Wang et al. (2023b); Zhang et al. (2023)],这些方法将文本视为主导模态,同时将音频和视觉模态视为辅助来源。尽管这些方法在数据完整时表现出强劲的性能,但当模态部分缺失或存在噪声时,特别是当文本模态不完整时,它们会遭受显著的性能下降。

为解决此问题,已提出多种基于重构的方法 [Yuan et al. (2021); Zhang et al. (2024a); Zhu et al. (2025)]。特别是,Zhang et al. (2024a) 提出了一种基于缺失率的完整性估计方法,将缺失率用作重构权重,假设更高的缺失率表示更低的完整性,反之亦然。然而,我们认为,仅依赖缺失率可能无法准确捕捉语义信息量。

图1 通过两个对比案例突出了这一局限性。在案例 1 中,关键情感线索 ['love'] 的缺失导致了显著的语义损失,尽管缺失率很低,但这导致了基于缺失率的完整性被高估。另一方面,在案例 2 中,即使情感含义保持完整,其完整性却被低估。这种不准确的完整性可能导致不可靠的重构,这突显了基于语义感知的完整性的必要性,即根据关键情感线索是否缺失来确定完整性。

受上述观察启发,我们提出了一种语义感知的完整性估计方法,以实现更可靠的缺失文本语义重构。具体而言,我们首先通过语义完整性估计器估计不完整文本的完整性。为了监督该估计器,我们引入了基于目标概率的语义完整性 (TPSC),这是一种生成完整性标签的伪标签策略。同时,重要性感知代理特征生成器 (IPFG) 通过自适应地调整辅助模态对文本重构的贡献权重,从辅助模态生成代理特征。然后,将估计的完整性用作加权因子,自适应地结合代理特征和不完整文本,生成重构的文本表示。此外,我们提出了交替优化策略 (AOS),以缓解由于在共享编码器上联合优化情感预测和完整性估计任务而产生的梯度冲突。本文的贡献总结如下:

- • 据我们所知,我们是首个引入语义感知完整性估计方法来量化不完整数据中语义保留程度的。
- • 我们提出了一种优化策略,可缓解分层多任务学习中的梯度冲突,从而稳定完整性估计和情感预测任务之间的训练。
- • 在三个具有不同缺失率的基准数据集上的广泛实验表明,我们提出的方法持续优于 12 个竞争性基线,证明了所提出的完整性标签在现实数据场景中的有效性。

## 2相关工作

近期 MSA 领域的研究探索了多种多模态融合策略,以整合文本、音频和视觉信息 [Zadeh et al. (2017); Liu et al. (2018); Tsai et al. (2019); Hazarika et al. (2020); Yu et al. (2021); Sun et al. (2022)]。这些方法旨在捕捉跨模态交互作用,并利用跨模态的互补信息来提高情感预测。另一类工作专注于以文本为中心的方法 [Han et al. (2021); Wang et al. (2023a); Wang et al. (2023b); Zhang et al. (2023)],这些方法将文本视为主导模态,并利用音频和视觉信号作为辅助来源来增强文本表示。然而,大多数现有方法假设在推理期间所有模态都完全可用,这限制了它们在现实场景中的鲁棒性。这个问题对于以文本为中心的方法尤为关键,因为文本中重要语义信息的丢失会直接削弱以文本为中心的融合的有效性。

为缓解上述问题,近期研究探索了基于重构的方法,旨在从缺失模态中恢复语义信息 [Yuan et al. (2021); Lin and Hu (2023); Zhang et al. (2024a); Zhu et al. (2025); Yang et al. (2025); Shi et al. (2025); Li et al. (2025); Lin et al. (2025)]。特别是,LNLN [Zhang et al. (2024a)] 引入了一种重构方法,使用从音频和视觉输入导出的代理特征恢复缺失的文本语义,其中重构权重是从不完整文本的缺失率估计的。P-RMF [Zhu et al. (2025)] 引入了一种代理驱动的策略,通过跨模态特征生成和自适应融合动态重构不完整的多模态输入,进一步提高了在不确定缺失条件下的鲁棒性。此外,TF-Mamba [Li et al. (2025)] 提出了一种基于 Mamba 的文本增强框架,通过文本感知模态增强模块对齐和增强辅助模态来重构缺失的文本语义,同时通过高效的基于 Mamba 的融合建模多模态依赖关系。虽然这些方法提高了对缺失模态的鲁棒性,但它们并未明确考虑不完整文本中的语义信息损失。

参见标题图2:所提框架概述。浅紫色框中的模型仅在预训练或伪标签阶段使用,不是 TCMR 训练流程的一部分。
## 3提出的方法

### 3.1问题定义

给定来自同一话语的文本 \(t\)、音频 \(a\) 和视觉 \(v\) 的多模态输入,MSA 任务旨在预测一个连续的情感分数 \(y \in \mathbb{R}\)。

### 3.2框架概述

在本文中,我们引入了一个基于文本完整性的缺失重构 (TCMR) 框架,该框架从不完整文本估计文本完整性,并根据估计的完整性自适应地加权代理特征和不完整文本特征,以重构缺失的语义信息。

TCMR 的整体工作流程如图2所示。首先,每种模态的输入被随机掩码,然后通过模态特定编码器嵌入为特征表示 (1)。接下来,一个完整性估计器预测不完整文本中保留了多少语义信息,并利用从辅助模态导出的代理特征(通过预测的完整性加权)重构缺失的语义 (2-4)。最后,一个多模态融合模块执行以文本为中心的融合,产生最终的情感分数 (5)。请注意,多模态融合模块采用自 LNLN,因为设计新的融合模块不是本工作的主要目标(参见附录 A.4)。

### 3.3输入处理

原始多模态输入被处理为高级嵌入(图2 (1))。首先,每种模态 \(m \in \{v, a, t\}\) 的完整多模态输入 \(I_{m}^{c}\) 由模态特定的特征提取器处理:文本使用 BERT,音频使用 Librosa,视觉使用 OpenFace [Devlin et al. (2019); McFee et al. (2015); Baltrušaitis et al. (2016)]。

沿用先前工作 [Zhang et al. (2024a); Zhu et al. (2025)],我们采用随机缺失场景来生成不完整特征 \(X_{m} \in \mathbb{R}^{T_{m} \times d_{m}}\),其中 \(T_{m}\) 和 \(d_{m}\) 分别表示序列长度和特征维度。对于文本,根据从 \([0, 1)\) 采样的缺失率,\(I_{t}^{c}\) 中的一部分标记被随机替换为 \([UNK]\)。对于音频和视觉特征,序列的一部分被零向量替换。随后,不完整特征由模态特定的 Transformer 编码器 [Vaswani et al. (2017)] 处理,以获得高级嵌入 \(H_{m} \in \mathbb{R}^{T \times d}\):

\[
H_{m} = \text{Transformer}(X_{m}; \theta_{m}^{\text{trans}})
\]

### 3.4缺失语义重构

本节详细阐述了 TCMR 的完整性引导的语义重构流程(图2 (2-4)),这是本工作的核心贡献。

#### 文本完整性估计

为了估计不完整文本的完整性,我们设计了一个语义完整性估计器 CompNet,它由全连接层和 sigmoid 激活函数组成(图2 (2-1))。

给定 BERT \([CLS]\) 嵌入 \(S_{t} \in \mathbb{R}^{d}\),CompNet 估计一个完整性权重 \(\hat{w} \in [0, 1]\):

\[
\hat{w} = \text{CompNet}(S_{t}; \theta^{\text{comp}})
\]

模型通过最小化预测分数 \(\hat{w}\) 和完整性标签 \(w\) 之间的均方误差来训练:

\[
\mathcal{L}_{\text{comp}} = \frac{1}{N} \sum_{i=1}^{N} \left\| \hat{w}^{(i)} - w^{(i)} \right\|^{2}
\]

其中 \(i\) 表示数据样本索引。

#### 伪标签生成

在我们的研究中,我们将文本完整性定义为不完整文本中情感相关语义信息的保留程度。根据此定义,我们引入了一种伪标签策略来为训练 CompNet 生成完整性标签 \(w\)(图2 (2-2))。

为了量化完整性,我们扩展了真实类别概率 (TCP) [Corbière et al. (2019)] 的概念,其定义为分配给目标类别的概率。我们的假设是,如果一个在完整文本上训练的分类器为给定的完整文本分配了高的 TCP,那么只要情感相关标记得以保留,相应不完整文本的 TCP 也会保持较高。相反,如果关键情感标记缺失,TCP 可能会显著降低。

基于这一洞察,我们设计了一个仅以文本模态作为输入的情感极性分类器。首先,该分类器在完整文本 \(I_{t}^{c}\) 上训练:

\[
\hat{y}_{\text{sp}} = \text{Classifier}(\text{BERT}^{\text{cls}}(I_{t}^{c}); \theta^{\text{cls}})
\]
\[
\mathcal{L}_{\text{ce}} = -\sum_{c=1}^{C} y_{\text{sp}}^{(c)} \log \hat{y}_{\text{sp}}^{(c)}
\]

其中 \(y_{\text{sp}}\) 表示通过根据预定义阈值离散化连续情感分数获得的极性类别。训练后,我们使用预训练的分类器对不完整文本进行推理,并将分配给真实极性类别 \(y_{\text{sp}}\) 的概率用作伪完整性标签 \(w \in [0, 1]\):

\[
w^{(i)} \triangleq p\left(y_{\text{sp}}^{(i)} \mid \text{BERT}^{\text{cls}}(I_{t}); \theta_{\text{pre}}^{\text{cls}}\right)
\]

其中 \(\theta_{\text{pre}}^{\text{cls}}\) 是预训练分类器的参数。情感极性类别的定义和最佳类别数量的选择分别在附录 B.1 和附录 B.2 中提供。

#### 代理特征生成

先前的工作 [Zhang et al. (2024a)] 在生成代理特征时未考虑辅助模态对重构的相对重要性。然而,在随机缺失条件下,每种模态对重构的贡献可能不同。

因此,我们设计了一个重要性感知代理特征生成器 (IPFG),它由基于 Transformer 的模态特定生成器和一个基于 MLP 的门控网络(带有 sigmoid)组成:

\[
H_{m^{\prime}}^{p} = \text{Gen}(H_{m^{\prime}}; \theta_{m^{\prime}}^{\text{gen}})

相似文章

多模态情感分析中缺失模态是否总是需要修复?

arXiv cs.CL

本文挑战了多模态情感分析中缺失模态的传统“修复优先”范式,表明全模态输入仅对一小部分样本是最优的。作者提出了SIEVE,一种即插即用的方法,学习在样本级别决定是否修复缺失模态,并持续改进现有的修复框架。