分离、细化、整合:为情感分析分解多模态融合

arXiv cs.CL 论文

摘要

一篇研究论文,提出了SeRIn,一种多模态融合方案,将模态特定细化与跨模态交互分离,在CH-SIMS和CMU-MOSEI情感分析基准上取得了最先进的结果。

arXiv:2607.12686v1 公告类型: 新 摘要: 多模态融合必须同时细化模态特定信号并建模跨模态交互;这两个相互竞争的目标通常在同一操作中纠缠在一起。我们提出 \textbf{SeRIn}(\textbf{Se}gregate, \textbf{R}efine, \textbf{In}tegrate),一种多模态LM融合方案,将这种分离作为架构先验强制实现。模态特定表示沿隔离路径演变,每个表示根据其编码器上下文进行细化,而专用的跨模态路径累积它们的联合演化,而不污染单模态流。完整的跨模态交互推迟到最终的预测步骤——消融实验证实,结构化交互(而非增加容量)推动了性能提升;视觉损坏下的门控分析揭示了在没有显式监督的情况下出现的模态重加权。SeRIn在CH-SIMS和CMU-MOSEI上取得了最先进的结果,在两个基准上改进了所有指标。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:23

# 分离、细化、融合:分解多模态融合用于情感分析
来源:https://arxiv.org/html/2607.12686
Filippakopoulos Kallioras Xiros Georgiou Potamianos

EliasNikolaosEfthymiosAlexandros1希腊雅典国家技术大学,2希腊雅典娜研究中心,3瑞士伯尔尼大学,4希腊Archimedes AI,5美国Synaptic Bloom PBC
alexiosfilippakopoulos@mail\.ntua\.gr, eliaskallioras@gmail\.com, n\.xiros@athenarc\.gr, efthymios\.georgiou@unibe\.ch, potam@central\.ntua\.gr (https://arxiv.org/html/2607.12686v1/mailto:[email protected],%[email protected],%[email protected],%[email protected],%[email protected])

###### 摘要

多模态融合必须同时细化模态特定信号并建模跨模态交互;这两个相互竞争的目标通常纠缠在同一操作中。我们提出SeRIn(分离、细化、融合),这是一种多模态语言模型融合方案,将这种分离作为架构先验加以强制。模态特定表示沿隔离的路径演化,各自根据其编码器上下文进行细化,而专门的跨模态路径则累积它们的联合演化,而不会污染单模态流。完全的跨模态交互被推迟到最终的预测步骤——消融实验证实,结构化的交互(而非增加的容量)驱动了性能提升;在视觉损坏条件下的门控分析揭示了无需显式监督即可出现的模态重新加权。SeRIn在CH-SIMS和CMU-MOSEI上达到了最先进水平,在两个基准测试中所有指标均有提升。

###### 关键词:

多模态情感分析,多模态融合,注意力机制,语音与语言模型

## 1 引言

多模态情感分析旨在通过联合建模语言内容、声学信号和视觉线索来预测说话者情感的极性和强度。它是情感计算应用的关键能力,包括对话代理、心理健康评估和社交媒体意见挖掘[1 (https://arxiv.org/html/2607.12686#bib.bib1),2 (https://arxiv.org/html/2607.12686#bib.bib2)]。核心的技术挑战*多模态融合*涉及学习既捕获单模态线索又捕获跨模态交互的表示。这并非易事,因为三种模态携带不同类型的信息,并且位于不同的几何空间和时间尺度上[3 (https://arxiv.org/html/2607.12686#bib.bib3)]。此外,它们的交互可能很微妙:声学和视觉线索可以加强、细化或直接反驳词汇内容,例如在讽刺或情绪抑制中[4 (https://arxiv.org/html/2607.12686#bib.bib4),5 (https://arxiv.org/html/2607.12686#bib.bib5),6 (https://arxiv.org/html/2607.12686#bib.bib6)]。

多模态融合中自然产生两个目标:细化每个模态和建模它们的交互。这些目标通常纠缠在单个融合操作中。张量和基于注意力的方法[7 (https://arxiv.org/html/2607.12686#bib.bib7),8 (https://arxiv.org/html/2607.12686#bib.bib8),9 (https://arxiv.org/html/2607.12686#bib.bib9),10 (https://arxiv.org/html/2607.12686#bib.bib10),11 (https://arxiv.org/html/2607.12686#bib.bib11)]同时执行这两个操作,两者之间没有架构分离。解耦和辅助目标方法[12 (https://arxiv.org/html/2607.12686#bib.bib12),13 (https://arxiv.org/html/2607.12686#bib.bib13),14 (https://arxiv.org/html/2607.12686#bib.bib14),15 (https://arxiv.org/html/2607.12686#bib.bib15)]鼓励模态特定表示,但在前向传播过程中对多模态融合没有结构性限制;专业化取决于学习到的惩罚而非架构约束。我们从DeepMLF[16 (https://arxiv.org/html/2607.12686#bib.bib16)]中汲取灵感,该方法在冻结的语言模型中引入了可学习的融合令牌,提供了文本流与多模态路径之间有意义的分离。然而,在作为多模态信息载体的融合令牌本身之间,模型被留给隐式决定何时保留模态特定信号以及何时整合它们。更广泛地说,*交互拓扑*——即指定哪些表示可以交换信息、在何种条件下以及在哪个处理阶段的模式——仍然是多模态融合中一个未被充分探索的设计轴,与深度和容量互补。特别是,我们认为单模态细化和跨模态整合应被视为不同的阶段,而不是耦合在单个融合操作中。

我们提出SeRIn¹¹¹代码可在GitHub上获取:SeRIn\-MSA (https://github.com/alexisfilippakopoulos/SeRIn-MSA)。²²²被Interspeech 2026接收(分离、细化、融合),该方法将这种分离作为架构先验而非优化惩罚加以强制。基于DeepMLF[16 (https://arxiv.org/html/2607.12686#bib.bib16)]的可学习融合令牌设计,SeRIn (i)**分离**融合令牌到每个模态的组中,限制在隔离的路径内,同时还有一个跨模态路径,该路径读取并聚合它们但从不写回;(ii)**细化**每个路径针对其自身的编码器上下文,通过内部门控注意力;(iii)只有在最终预测步骤才**融合**所有表示,允许无限制的跨模态交互。分离通过模态约束的注意力遮罩在结构上强制实现,不增加任何参数,使得每个模态在混合之前先被细化。在融合深度和令牌数量固定为DeepMLF的最优值时,交互拓扑是唯一的自由变量,我们的消融实验将性能提升归因于这种结构,而非增加的容量。我们的贡献可总结为:

1. 1.我们将交互拓扑框定为与深度和容量互补的融合设计轴,并在SeRIn中实现它:通过无参数遮罩分离每个模态的路径,每个路径针对其自身的编码器上下文进行细化,让音视频路径只读不写,并将无限制交互推迟到最终头部。
2. 2.SeRIn在CH-SIMS和CMU-MOSEI上所有指标均达到SOTA,且深度和令牌数量固定;一个容量匹配的消融实验保留了增加的参数但去除了拓扑,其性能低于DeepMLF;在视觉损坏条件下的门控分析揭示了无需监督即可出现的模态重新加权。

## 2 相关工作

标准的MSA分类法(早期/晚期/深度融合、融合机制)捕获了整合时机,但未捕获控制模态路径在前向传播过程中如何交互的结构性约束。为了启发SeRIn,我们从两个轴重新解释先前工作:(i) 融合深度与交互拓扑,以及 (ii) 单模态专业化的机制:优化目标与架构约束。

### 2.1 从浅层到深层交互建模

早期的多模态情感模型在单个整合阶段执行跨模态交互。张量融合网络[7 (https://arxiv.org/html/2607.12686#bib.bib7)]和低秩多模态融合[8 (https://arxiv.org/html/2607.12686#bib.bib8)]计算显式的跨模态交互,但未在架构内分离单模态细化和多模态整合。

基于注意力的模型引入了更灵活的交互模式。MulT[9 (https://arxiv.org/html/2607.12686#bib.bib9)]建模每个有序模态对之间的定向成对注意力,限制了跨模态影响的方向。跨模态注意力架构如CENet[11 (https://arxiv.org/html/2607.12686#bib.bib11)]和MAG-BERT[10 (https://arxiv.org/html/2607.12686#bib.bib10)]通过注意力模块将声学和视觉上下文注入文本表示。尽管这些方法提高了跨模态表达能力,但单模态细化和多模态整合通常发生在相同的注意力操作中,且一旦引入跨模态通信就变得无限制。

冻结的预训练语言模型允许在固定骨干网络内进行逐层融合,其中将融合模块与预训练层交错使得交互结构成为一种显式的设计选择。Flamingo[17 (https://arxiv.org/html/2607.12686#bib.bib17)]和Audio Flamingo[18 (https://arxiv.org/html/2607.12686#bib.bib18)]在冻结的解码器层之间插入带门控的跨注意力模块,使用标量残差门来调节注入的多模态信号的整体幅度。这些门应用标量调制,而SeRIn在投影前对注意力输出使用内容依赖的、逐元素的门控。MSA中的深度融合可追溯到DHF[19 (https://arxiv.org/html/2607.12686#bib.bib19)],这是第一个此类范式,它学习单模态编码器,然后接一个融合网络。DeepMLF[16 (https://arxiv.org/html/2607.12686#bib.bib16)]将这一传承带入冻结LM设置,展示了融合深度和多模态容量是关键因素,并引入了可学习融合令牌来跨层调节跨模态交互。然而,融合令牌池是无差别的,允许每个融合令牌积累相同的预融合联合音视频上下文。因此,模态特定结构不是由前向架构显式强制的,而是(如果有的话)通过优化出现。SeRIn采用了DeepMLF,其融合令牌接口提供了研究交互拓扑(一个DeepMLF和大多数先前工作未加约束的变量)所需的受控基底。具体而言,SeRIn将这些令牌划分为具有受限交互的模态特定路径,添加一个只读的音视频路径以维护跨模态状态而不修改单模态流,并将无限制的跨模态交互推迟到最终的整合头部。

### 2.2 基于目标 vs 架构专业化

并行的工作线通过表示级约束促进单模态专业化。这些方法将每个模态分解为共享(模态不变)和模态私有子空间:MISA[12 (https://arxiv.org/html/2607.12686#bib.bib12)]通过软正交损失强制分解,而FDMER[13 (https://arxiv.org/html/2607.12686#bib.bib13)]通过模态判别器对抗性地学习两个子空间。DRTSC[15 (https://arxiv.org/html/2607.12686#bib.bib15)]通过时间平滑损失和对抗对齐扩展了这一框架,以鼓励一致性同时保留模态特定组件。其他方法通过训练目标、学习重新加权或输入重新表示来引导专业化。Self-MM[14 (https://arxiv.org/html/2607.12686#bib.bib14)]、JTUM[20 (https://arxiv.org/html/2607.12686#bib.bib20)]、TETFN[21 (https://arxiv.org/html/2607.12686#bib.bib21)]和MTFN[22 (https://arxiv.org/html/2607.12686#bib.bib22)]引入辅助监督或多任务目标以加强单模态结构;KuDA[23 (https://arxiv.org/html/2607.12686#bib.bib23)]注入情感知识以动态重新加权每个模态对每个样本的贡献;DEVA[24 (https://arxiv.org/html/2607.12686#bib.bib24)]将原始音频和视觉信号转换为细粒度的文本情感描述,然后再进行文本引导的渐进式融合。然而,在所有这些情况下,前向计算图对跨模态混合没有任何结构性限制;模态特定行为是由学习到的目标或输入重新表示塑造的,而非架构约束。

架构专业化最近在DLF[25 (https://arxiv.org/html/2607.12686#bib.bib25)]中得到了探索,该方法强制对语言进行非对称注意力(V→L, A→L, L→L)作为结构性约束。虽然这控制了影响的方向,但每个交互都被汇入语言流中——音频和视觉特征仅作为源,彼此从不交互——并且语言自我细化(L→L)和跨模态整合(V/A→L)在每个层内仍然交织在一起。

相比之下,SeRIn通过构造封闭了单模态路径,并将跨模态交互限制在专门的只读路径和最终整合阶段,这是DLF和先前工作未强制执行的约束。这在前向传播过程中从架构上将单模态细化和多模态整合解耦,而不是将权衡委托给优化——据我们所知,这与现有的MSA融合策略有显著不同。

## 3 预备知识

我们形式化MSA任务,并建立本文使用的符号。

### 3.1 问题形式化

MSA被表述为一个监督回归任务,从三种模态推断情感极性和强度:文本、音频和视觉。令M=\{t,a,v}\mathcal{M}=\{t,a,v\}为模态索引集。对于每个m∈Mm\in\mathcal{M},样本ii的输入为Xi,m∈RLm×Dm\mathbf{X}_{i,m}\in\mathbb{R}^{L_{m}\times D_{m}},其中LmL_m是最大序列长度,DmD_m是特征维度。目标是学习fθ:∏m∈MXm→Rf_{\theta}:\prod_{m\in\mathcal{M}}\mathcal{X}_{m}\to\mathbb{R},将每个多模态输入Xi={Xi,m}m∈M\mathcal{X}_{i}=\{\mathbf{X}_{i,m}\}_{m\in\mathcal{M}}映射到标量情感标签yi∈Ry_i\in\mathbb{R}。

### 3.2 Transformer骨干网络

SeRIn实例化在一个冻结的预归一化解码器仅Transformer[26 (https://arxiv.org/html/2607.12686#bib.bib26),27 (https://arxiv.org/html/2607.12686#bib.bib27)]中。每个LM块应用因果自注意力(CSA)后接一个前馈网络:

H~\(l\)=H\(l−1\)+SA(Norm(H\(l−1\));Mcausal)\tilde{\mathbf{H}}^{(l)} = \mathbf{H}^{(l-1)} + \mathrm{SA}\bigl(\mathrm{Norm}(\mathbf{H}^{(l-1)});\mathbf{M}^{\mathrm{causal}}\bigr)
H\(l\)=H~\(l\)+FFN(Norm(H~\(l\))).\mathbf{H}^{(l)} = \tilde{\mathbf{H}}^{(l)} + \mathrm{FFN}\bigl(\mathrm{Norm}(\tilde{\mathbf{H}}^{(l)})\bigr).

因果遮罩Mcausal\mathbf{M}^{\mathrm{causal}}限制每个令牌只能关注自身及其前面的位置。当融合令牌附加到文本序列时,Mcausal\mathbf{M}^{\mathrm{causal}}被替换为模态约束的遮罩MLMmc\mathbf{M}^{\mathrm{mc}}_{\mathrm{LM}},这是SeRIn在冻结LM内部强制模态分离的结构机制(参见第4.4.1节)。

#### 3.2.1 注意力遮罩

二进制遮罩M∈{0,1}nq×nk\mathbf{M}\in\{0,1\}^{n_{q}\times n_{k}}通过在softmax之前注入−∞-\infty来阻止选定的查询-键交互:

Attn(Q,K,V;M)=σ(QK⊤dk+(1−M)(−∞))V.\mathrm{Attn}(\mathbf{Q},\mathbf{K},\mathbf{V};\mathbf{M}) = \sigma\left(\frac{\mathbf{Q}\mathbf{K}^{\top}}{\sqrt{d_{k}}} + (1-\mathbf{M})(-\infty)\right)\mathbf{V}.

Mij=1M_{ij}=1允许查询ii关注键jj,而Mij=0M_{ij}=0阻止它。此公式直接在第4.4.1节和第4.4.2节中用于定义MLMmc\mathbf{M}^{\mathrm{mc}}_{\mathrm{LM}}和MMMmc\mathbf{M}^{\mathrm{mc}}_{\mathrm{MM}}。单模态编码器Ea,Ev\mathcal{E}_a,\mathcal{E}_v(图1 (https://arxiv.org/html/2607.12686#S3.F1))是标准的预归一化Transformer编码器[2

相似文章

面向多模态情感分析的语义对齐结构抽象

arXiv cs.CL

本文提出了SentiLLM,一个利用语义对齐结构抽象将非语言模态提炼为类文本标记的框架,用于基于大语言模型的多模态情感分析。它引入了一种双流显著性-上下文校准机制,并在四个数据集上取得了优越的性能。

多模态情感分析中缺失模态是否总是需要修复?

arXiv cs.CL

本文挑战了多模态情感分析中缺失模态的传统“修复优先”范式,表明全模态输入仅对一小部分样本是最优的。作者提出了SIEVE,一种即插即用的方法,学习在样本级别决定是否修复缺失模态,并持续改进现有的修复框架。