基于SHAP加权的跨模态专家融合用于情感与情绪识别:证据与局限

arXiv cs.AI 论文

摘要

本文提出基于SHAP加权的跨模态专家融合(XGAF)用于情感与情绪识别,证明在MELD和CMU-MOSEI数据集上,sum-abs SHAP聚合达到了早期融合级别的性能。

arXiv:2607.08573v1 Announce Type: new Abstract: 多模态情感与情绪识别通常通过早期融合(在分类前拼接模态)或晚期融合(组合独立训练的单模态预测器)来处理。早期融合准确但单一,晚期融合模块化但可能丢失跨模态交互。本文重新审视了基于XAI的自适应融合(\xgaf),这是一种基于树的单模态与跨模态专家混合方法,其样本级权重由TreeSHAP归因幅度得出。我们重点研究了当专家具有不均等特征维度时,SHAP归因缩减的影响。在此设置下,均值绝对值和中间绝对值缩减可能抑制高维跨模态专家,而总和绝对值缩减则保留了总归因质量。在MELD的7类情绪识别任务中,总和绝对值的\xgaf{}在三种人脸序列聚合器上几乎匹配早期融合;Transformer变体达到0.5983 \wf{},而早期融合为0.6018,概率平均晚期融合为0.4598。McNemar检验显示,在MELD上总和绝对值\xgaf{}与早期融合无显著差异($p=1.000$),而\xgaf{}始终显著优于晚期融合($p<0.0001$)。在CMU-MOSEI的3类情感识别任务中,总和绝对值\xgaf{}达到0.6519 \wf{},略超早期融合(0.6485)和晚期融合(0.5696)。消融研究表明,主要增益来自添加跨模态专家(尤其是三模态专家),而非复杂的每样本路由。诊断进一步显示,均值绝对值和中间绝对值权重近乎均匀,而总和绝对值权重集中于三模态专家。因此,主要贡献在于对SHAP缩减、专家维度及跨模态专家设计如何影响模块化多模态融合的透明实证分析。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:09

# SHAP加权跨模态专家融合用于情绪与情感识别:实证与边界
来源:https://arxiv.org/html/2607.08573
\[1\]\\fnmAdis\\surAlihodzic

\[1\]\\orgdiv数学与计算机科学系,\\orgname理学院, 萨拉热窝大学,\\orgaddress\\city萨拉热窝,\\country波斯尼亚和黑塞哥维那

###### 摘要

多模态情绪与情感识别通常依赖早期融合(在分类前拼接模态)或晚期融合(组合独立训练的单模态预测器)。早期融合往往准确但缺乏模块化,晚期融合则模块化但可能丢失跨模态交互。本文重新审视了基于XAI的自适应融合(XGAF),这是一种基于树的单模态与跨模态专家混合模型,其样本级权重由TreeSHAP属性量级推导。本研究的焦点在于一个当专家具有不等特征维度时变得重要的方法问题:用平均绝对SHAP值缩减特征属性会压制高维跨模态专家,而用求和绝对SHAP值则保留了总属性量。在MELD七类情绪识别任务上,所提出的求和绝对值缩减方案使跨模态专家混合与早期融合之间的差距在三种人脸序列聚合器下均得以弥合;其中Transformer变体达到0.5983加权F1分数,早期融合为0.6018,概率平均晚期融合为0.4598。McNemar检验显示,在MELD上求和绝对值XGAF与早期融合无显著差异(\(p=1.000\)),而XGAF仍显著优于晚期融合(\(p<0.0001\))。在CMU-MOSEI三类情感识别任务上,求和绝对值XGAF达到0.6519加权F1分数,早期融合为0.6485,晚期融合为0.5696,且相对于早期融合有微弱但统计显著的提升(\(p=0.0452\))。专家池消融表明,大部分增益来自添加跨模态专家,尤其是三模态专家,而非丰富的逐样本路由。进一步的三方消融确认,中位数绝对值SHAP的表现与平均值绝对值SHAP相似(在MELD上分别为0.5682与0.5669加权F1),而求和绝对值SHAP则达到早期融合水平的性能(0.5957对0.5955)。诊断分析显示,平均值与中位数绝对值权重近乎均匀分布,而求和绝对值权重则高度集中于三模态专家。因此,本文的主要贡献并非一个新的最先进识别模型,而是一个关于SHAP属性缩减、专家维度与跨模态专家设计如何影响模块化多模态融合的透明实证研究。

###### 关键词:

多模态融合,情绪识别,情感分析,可解释人工智能,SHAP,XGBoost,MELD,CMU-MOSEI,专家混合

## 1 引言

多模态情感计算试图从若干互补通道(最常见的是文本、语音和视觉线索)推断人类情绪、情感或相关情感状态。一个句子在文本中可能显得积极,但在语音中可能听起来带有讽刺意味;一个中性短语在考虑面部表情时可能变得富有情感信息。这一简单观察解释了为何融合不仅仅是一个实现细节,而是多模态情绪识别中的核心设计选择之一。诸如MELD\[poria2019meld\]和CMU-MOSEI\[zadeh2018mosei\]等基准数据集使得在受控实验协议下比较建模策略成为可能,但模态应如何融合的问题仍然是核心。近期综述强调,现代多模态情绪识别系统不仅需按准确率评估,还需考虑融合设计、对缺失或噪声模态的鲁棒性、跨用户与数据集的泛化能力以及多模态决策的可解释性\[yazici2026survey\]。实践中,两种简单策略仍被广泛使用。早期融合将模态特定特征向量拼接,并在联合表示上训练单一预测器。晚期融合则训练独立预测器并组合其输出概率。早期融合能利用跨模态特征交互,但缺乏模块化且在模态层面透明度较低。晚期融合模块化且易于扩展,但常未充分利用跨模态交互。

大量工作已提出针对多模态语言与情感识别的更复杂融合机制,包括张量融合\[zadeh2017tensor\]、低秩多模态融合\[liu2018efficient\]、跨模态翻译\[pham2019found\]、多模态Transformer\[tsai2019multimodal\]以及将表示分解为模态不变与模态特定分量\[hazarika2020misa\]。在对话情绪识别中,对话感知模型进一步利用说话者状态、话语结构、图或常识知识\[majumder2019dialoguernn,ghosal2019dialoguegcn,ghosal2020cosmic,chudasama2022m2fnet\]。在近期多模态情绪识别综述的分类中,这些方法主要占据混合与模型级融合分支,而特征拼接与概率平均分别对应早期特征级与决策级融合\[yazici2026survey\]。这些方法功能强大,但当操作目标不仅是最大化基准准确率,还追求模块化、可复现性以及模态特定组件的可解释行为时,它们可能更难诊断和部署。

本文研究一个刻意简单的替代方案:由单模态和跨模态XGBoost分类器\[chen2016xgboost\]组成的基于树的专家池。专家通过从TreeSHAP属性量级\[lundberg2017unified\]导出的样本依赖门控进行组合。其动机直截了当:如果模型的解释表明某专家在样本上具有强属性量级,则该专家应获得更高的融合权重。这一思路产生了一种模块化架构,其中纯文本、纯音频、纯面部、双模态和三模态专家可分别被检视,同时仍被组合成单一决策。

本文的核心发现比最初的“自适应融合”动机更为微妙。当特征属性通过其绝对值的均值缩减时,具有不同输入维度的专家被隐式置于每个特征的尺度上。这可能会标准化掉高维跨模态专家的总属性量,导致近乎均匀的权重。将平均绝对SHAP替换为求和绝对SHAP,则恢复了跨模态专家的规模,并显著提升了性能。第三个自然统计量是绝对SHAP值的中位数。它对极端个体属性更鲁棒,测量了典型特征贡献,但也可能低估那些预测证据集中在少数高信息特征上的专家。为此,本文形式化并实证评估了平均值、中位数和求和绝对值缩减。中位数绝对值消融之所以重要,是因为它是一个统计上自然的鲁棒替代方案;然而结果显示,其行为更接近均值绝对值而非求和绝对值。诊断分析还表明,改进的求和绝对值门控在所评估的数据集上并未产生丰富的逐样本路由。相反,增益很大程度上可归因于跨模态专家(尤其是三模态专家)的可用性。这一局限性很重要:它防止了方法被过度夸大,同时也使该实验成为关于基于属性门控的有益经验教训。

本文的贡献如下:

1. 1. 提出一个可复现的SHAP加权专家融合框架,用于多模态情绪与情感识别,采用单模态、双模态和三模态XGBoost专家。
2. 2. 通过形式化并评估三种自然SHAP缩减(均值绝对值、中位数绝对值、求和绝对值)来阐明专家分数构建。实验表明,中位数绝对值提供了一个有用的鲁棒基线,但当专家具有不等特征维度时,用求和绝对值保留总属性量至关重要。
3. 3. 在MELD和CMU-MOSEI上的实验显示,求和绝对值变体在MELD上与早期融合持平,在CMU-MOSEI上略优于早期融合,并持续优于概率平均晚期融合。
4. 4. 专家池消融识别出一个紧凑的四专家变体(记为XGAF-Lite),在MELD上足以匹配完整的七专家池。
5. 5. 报告了一项诊断可解释性分析,表明当前的SHAP门控主要产生专家主导而非多样化的逐样本路由。该负面结果作为局限性和未来工作指导被明确讨论。

本文有意定位为融合方法研究,而非最先进的对话情绪模型。对话上下文未被建模,目标是分析在透明且可复现的经典机器学习流程下的模块化专家融合。

## 2 相关工作

### 2.1 多模态情绪与情感识别

MELD扩展了EmotionLines语料库,加入了多方对话的多模态信息,广泛用于对话情绪识别\[poria2019meld\]。CMU-MOSEI是一个大规模多模态情感与情绪数据集,基于观点视频和对齐的语言、声学与视觉信号\[zadeh2018mosei\]。两个数据集在任务设定、标签结构和模态质量上有所不同,便于测试融合机制是否具有数据集特异性。

多模态语言分析的融合方法从简单拼接到高阶交互的显式建模。张量融合网络通过外积表示捕获单模态、双模态和三模态交互\[zadeh2017tensor\]。低秩多模态融合减少了此类交互的计算负担\[liu2018efficient\]。多模态Transformer采用跨模态注意力处理非对齐多模态序列\[tsai2019multimodal\],而MISA分离了模态不变与模态特定因子\[hazarika2020misa\]。Self-MM进一步引入了用于多模态情感分析的自监督多任务表示学习\[yu2021selfmm\]。这些模型通常针对强端到端表示学习,而本文则聚焦于模块化的基于树专家池,并辅以显式诊断分析。

同一综述还强调了直接激发本文设计选择与局限性的三个趋势:更强的跨模态融合、在缺失或退化模态下的鲁棒性,以及用于可信情感计算的可解释性\[yazici2026survey\]。XGAF通过使用TreeSHAP分数作为门控信号来解决可解释性与模块化问题,但尚未应对日益被视为核心部署挑战的缺失模态和噪声模态场景。这一区分很重要,因为本文实验使用干净的预提取特征;因此,结果应被解释为基于属性的专家加权的受控分析,而非一个完整鲁棒的多模态情绪识别系统。

对于对话情绪识别,DialogueRNN\[majumder2019dialoguernn\]、DialogueGCN\[ghosal2019dialoguegcn\]、COSMIC\[ghosal2020cosmic\]和M2FNet\[chudasama2022m2fnet\]说明了对话上下文和说话者交互的重要性。由于本文在特征提取后将每个话语独立处理,因此预计不会超越这些对话感知方法。这一设计选择使融合分析更干净,但也定义了一个重要局限。

### 2.2 专家混合与可解释门控

专家混合模型通过门控机制组合若干个专门化预测器,稀疏或条件计算已在大型神经模型中得到成功应用\[shazeer2017outrageously\]。在多模态设置中,专家专门化可自然出现,因为不同模态具有不同的噪声模式和缺失情况。然而,端到端训练的门控可能难以解释,尤其是当最终模型是深度架构时。

TreeSHAP为树集成模型提供一致的特征属性,广泛用于解释个体预测\[lundberg2017unified\]。本文不仅将TreeSHAP用于事后解释,还用作门控信号。其想法简单:当某专家在当前样本上的绝对属性量级更大时,其获得更高的权重。然而,实验表明,事后属性信号并非自动成为可靠的路由信号。属性缩减为每个专家一个标量的方式对最终门控有强烈影响。

## 3 方法

### 3.1 专家池

令每个样本由三个模态特定特征向量表示:文本\(x_t\)、语音\(x_v\)和面部\(x_f\)。完整模态集为\(M=\{t,v,f\}\)。对于每个非空子集\(S\subseteq M\),可在拼接特征向量\(x_S\)上训练专家\(h_S\)。在完整配置中,专家池为

\[\mathcal{E}=\{h_t,h_v,h_f,h_{tv},h_{tf},h_{vf},h_{tvf}\}. \tag{1}\]

本文还评估了较小的池,包括仅单模态池以及包含三个单模态专家加上三模态专家的紧凑池。所有专家均实现为XGBoost分类器。每个专家返回一个类别概率向量\(p_e(y\mid x)\)。

早期融合是仅使用三模态分类器\(h_{tvf}\)的特例。晚期融合实现为单模态输出概率的未加权平均。所提出的框架通过允许一个由单模态和跨模态专家组成的池通过SHAP导出权重进行组合,对两者进行了推广。从近期多模态情绪识别综述分类的角度看,此设计最佳被视为一个可解释的专家级融合层,而非端到端的模型级融合架构:它保持了表示和专家的模块化,但利用样本依赖的属性证据来组合其预测\[yazici2026survey\]。

### 3.2 SHAP导出的专家分数

对于样本\(x\)和专家\(e\),TreeSHAP生成特征属性值。对于多类分类,实现会在类和特征上聚合绝对属性量级。令\(d_e\)表示专家\(e\)的输入特征数,\(\phi_{e,j}(x)\)表示在类别级聚合后与特征\(j\)相关的属性贡献。可定义三种自然的标量专家分数:

\[
\begin{aligned}
a_e^{\mathrm{mean}}(x) &= \frac{1}{d_e}\sum_{j=1}^{d_e}|\phi_{e,j}(x)|, \tag{2}\\
a_e^{\mathrm{median}}(x) &= \operatorname{median}_{j=1,\ldots,d_e}|\phi_{e,j}(x)|, \tag{3}\\
a_e^{\mathrm{sum}}(x) &= \sum_{j=1}^{d_e}|\phi_{e,j}(x)|. \tag{4}
\end{aligned}
\]

均值绝对值分数测量每个特征的平均属性。中位数绝对值分数测量典型属性,并对异常大的单个特征贡献具有鲁棒性。求和绝对值分数测量整个专家携带的总属性量。这一区

相似文章