CONFER:多模态情绪识别中基于冲突感知的证据协商与状态校准弱监督
摘要
本文提出CONFER,一种基于图的冲突感知证据协商框架,用于弱监督多模态情绪识别,解决自我报告不可靠和跨模态冲突问题。在AMIGOS、MAHNOB-HCI和DEAP基准上取得了具有竞争力的准确率。
arXiv:2608.07867v1 公告类型:新
摘要:多模态情绪识别通常将自我报告标签视为可靠监督,而忽略了自我报告的不可靠性和跨模态冲突。我们提出\textbf{CONFER},一种基于图的冲突感知证据协商框架,用于弱监督多模态情绪识别。CONFER将每个模态专家表示为一个节点,具有预测信念、基于边界的不确定性以及根据历史折叠外性能和当前样本不确定性估计的运行时可靠性。不确定性感知的兼容性和可靠性导向的非对称边权重控制迭代消息传递协商,随后进行同伴支持的预测读出。冲突减少、残余分歧和平均模态不确定性进一步表征三种状态——共识、异议和模糊——用于样本特定的弱标签校准。我们在AMIGOS、MAHNOB-HCI和DEAP上,在受试者依赖的10折和严格的留一受试者(LOSO)协议下评估CONFER。CONFER取得了有竞争力的性能,在严格的LOSO评估下,在AMIGOS-V上达到\textbf{0.873}的准确率,在MAHNOB-V上达到\textbf{0.854}的准确率。进一步的分析显示,在高冲突样本上协商增益更大,并且对弱标签损坏的鲁棒性更强,表明跨模态冲突为方向性模态协调和监督可靠性估计都提供了有用信息。
查看缓存全文
缓存时间: 2026/08/11 08:07
# CONFER:面向多模态情感识别的冲突感知证据协商与状态自适应弱监督框架
###### 摘要
多模态情感识别通常将自我报告标签视为可靠监督,却忽视了自我报告的不可靠性和跨模态冲突。我们提出 CONFER,一个基于图的冲突感知证据协商框架,用于弱监督多模态情感识别。CONFER 将每个模态专家表示为带预测信念、基于边界的置信度不确定性以及由历史折叠外表现和当前样本不确定性估计的运行时可靠性的节点。不确定性感知的兼容性和可靠性导向的不对称边权重控制迭代消息传递协商,随后进行同伴支持预测读出。冲突减少、残余分歧和模态平均不确定性进一步刻画三种状态——共识、异议和模糊——用于样本特定的弱标签校准。我们在 AMIGOS、MAHNOB-HCI 和 DEAP 上,采用受试者相关十折和严格留一受试者交叉验证协议进行评价。CONFER 取得了有竞争力的性能,在严格 LOSO 评估下,在 AMIGOS-V 上达到 0.873 准确率,在 MAHNOB-V 上达到 0.854 准确率。进一步分析表明,在高冲突样本上协商增益更大,对弱标签扰动的鲁棒性也更强,这表明跨模态冲突能为模态方向协调和监督可靠性估计提供有用信息。
## 引言
多模态情感识别旨在从异质的神经、生理、声学和行为信号中推断潜在情绪状态。虽然这些模态提供互补证据,但大多数现有方法仅将自我报告效价和唤醒度分数视为可靠监督。实际上,自我报告受个体评分习惯、认知解释、记忆偏差和实验情境的影响(Mauss and Robinson 2009;Barrett 2017),因此更应被视为潜在情绪的弱观测。
这一挑战因跨模态冲突而进一步复杂化。我们将跨模态冲突定义为各模态预测之间的不一致。这种冲突可能源于模态间异质的不可靠来源(如感知噪声、模态特有局限性或证据不足)(Bezirganyan et al. 2025;Lu et al. 2025)。然而,跨模态冲突也能揭示互补证据并引导模态间选择性知识交换。但融合预测与自我报告标签之间的差异本身无法确定不一致是源于不可靠的模态预测还是弱标签。因此,MER 必须联合建模模态可靠性、不确定性和跨模态冲突,以确定模态间的一致或冲突何时具有信息量,以及弱标签监督应如何校准。
现有 MER 方法通过注意力、门控、跨模态交互、共享与模态特定表征学习以及专家路由来处理模态异质性,但通过融合权重强行统一模态间冲突,而没有明确判断当前样本中某一模态是否应影响另一模态(Han et al. 2024;Xin et al. 2025)。同时,弱标签方法从置信度、损失或全局统计量中估计监督可靠性,而忽视了模态特定预测之间的成对一致性和冲突。在现有框架中,模态可靠性估计、跨模态冲突建模和弱标签校准相互脱节。因此,模态间的信息传递无法被高效协调或稳健学习。
为解决这一空白,我们提出 CONFER(冲突感知证据协商与状态自适应弱监督)。每个模态专家产生预测信念和基于边界的置信度不确定性分数,同时其历史折叠外表现与当前不确定性结合以估计运行时可靠性。这些量共同构成模态证据。受多智能体协商启发,CONFER 将模态专家表示为动态图中的节点,其中成对兼容性和可靠性感知的方向边权重控制迭代消息传递。同伴支持读出产生最终多模态预测,而残余冲突和不确定性刻画三种状态——*共识*、*异议*和*模糊*——以校准每个样本对弱标签训练的贡献。因此,CONFER 将模态可靠性、跨模态协商和弱标签校准连接在一个统一框架中。
我们在 AMIGOS、MAHNOB-HCI 和 DEAP 上,采用受试者相关十折和严格 LOSO 协议评估 CONFER。CONFER 取得了有竞争力的性能,包括在 LOSO 下 AMIGOS-V 上的 0.873 准确率/0.879 F1 和 MAHNOB-V 上的 0.854 准确率。进一步分析表明,在高冲突样本上增益更大,在合成标签扰动下鲁棒性增强,并且监督可靠性估计提供了预测置信度之外的信息。
主要贡献总结如下:
- 我们提出 CONFER,一个统一的基于图的框架,根据样本特定的模态可靠性协商跨模态冲突,并校准自我报告弱标签的学习。
- 我们开发了一种动态图机制,将不确定性感知的兼容性转化为可靠性导向的非对称消息传递,使跨模态冲突既能指导专家协调,又能指导监督可靠性估计。
- 在三个 MER 基准上的系统性实验表明,CONFER 取得了有竞争力的跨受试者性能,并提高了对弱标签扰动的鲁棒性。
## 相关工作
多模态情感识别整合视觉、声学、神经和生理信号(Baltrušaitis et al. 2019;Mittal et al. 2020;Rayatdoost et al. 2020;Zhang et al. 2020)。代表性融合方法包括 TFN、MulT、MISA、Self-MM 和 MMIM(Zadeh et al. 2017;Tsai et al. 2019;Hazarika et al. 2020;Yu et al. 2021;Han et al. 2021a),而近期专家路由方法根据单个输入调整模态贡献(Han et al. 2024;Fang et al. 2025;Xin et al. 2025;Gao et al. 2024)。然而,这些方法主要优化特征聚合或模态权重,而没有显式地将跨模态冲突与监督可靠性联系起来。
模态可靠性随噪声、信息缺失和个体差异而变化(Liu et al. 2024;Zeng et al. 2022),已通过注意力、门控、置信度、不确定性估计和不确定性感知融合进行建模(Guo et al. 2017;Kendall and Gal 2017;Sensoy et al. 2018;Han et al. 2021b, 2023)。同时,自我报告情绪标签受主观感知和实验条件影响(Mauss and Robinson 2009;Barrett 2017)。噪声标签方法采用鲁棒损失、重加权、协同训练、样本选择和标签校正(Song et al. 2023;Zhang and Sabuncu 2018;Wang et al. 2019;Han et al. 2018;Li et al. 2020;Shu et al. 2023;Wang et al. 2024),通常从置信度、损失、训练动态或表征邻域中估计监督可靠性(Liu et al. 2020;Xia et al. 2022;Li et al. 2022;Huang et al. 2023;Kim et al. 2024)。这些方向很少利用成对跨模态关系来联合协调模态交互并校准弱标签监督,而这正是 CONFER 的关注点。
请参阅图 1 说明:CONFER 框架总览。(a) 模态特定编码器提取窗口级表征。(b) 模态专家产生试验级信念和基于边界的置信度不确定性分数。(c) 动态兼容性和方向边控制消息传递协商和同伴支持预测读出。(d) 冲突和不确定性指导状态自适应的弱监督。(e) 冻结的内部 OOF 统计量提供历史可靠性先验。
表 1:严格 LOSO 评估下 AMIGOS-V 的模态级预测误差和不确定性统计。
| 模态 | 平均误差↓ | 误差标准差 | 平均 u~\_m ↓ | 中位数 u~\_m |
| Audio | 0.225 | 0.331 | 1.22 | 1.00 |
| Face | 0.263 | 0.499 | 1.55 | 1.02 |
| EEG | 0.350 | 0.497 | 2.10 | 0.98 |
| Physio | 0.375 | 0.499 | 2.00 | 1.01 |
## 方法
### 概述与问题定义
多模态情感识别旨在从异质的神经、生理、声学和行为观测中推断潜在情绪状态。给定试验 i,其多模态输入表示为
\mathcal{X}_i = \left\{X_i^m\right\}_{m\in\mathcal{M}},\quad X_i^m = \left\{x_{i,k}^m\right\}_{k=1}^{K_m}. (1)
这里,\mathcal{M} 是模态集合,x_{i,k}^m 是模态 m 的第 k 个窗口,K_m 是窗口数。每个试验有一个自我报告弱标签 y_i^w。我们将 MER 定义为联合估计样本相关的模态可靠性、协商跨模态冲突并校准弱标签监督。
如图 1 所示,CONFER 包括模态专家构建、动态图协商和状态自适应弱监督。历史可靠性和校准统计量通过冻结的内部 OOF 预测估计,仅使用外层训练受试者。在无歧义时省略试验索引 i。
### 模态专家构建
固定模态权重假设模态质量在受试者和样本间保持稳定。然而,表 1 显示,在严格留一受试者评估下,不同模态的预测误差和不确定性存在明显差异。因此,我们将每个模态建模为独立专家,其可靠性既取决于历史表现,也取决于当前样本。
如图 1 所示,(a) 部分,模态特定编码器将模态 m 的时间窗口映射为嵌入序列 Z^m = {z_k^m}_{k=1}^{K_m}。随后,图 1 (b) 中的模态专家构造器对序列应用全局均值池化以捕捉持久的试验级响应、稀疏 top-k 注意力以保留信息量大的时间事件,以及时间离散度以刻画被平均池化掩盖的变化。它们的输出 g_mean^m、g_topk^m 和 g_disp^m 连接成试验级表征 g_m。
信念头产生初始预测信念,并由此计算基于边界的置信度不确定性分数:
\mu_m^{(0)} = \sigma\left(h_\mu^m(g_m)\right), \quad u_m = \mu_m^{(0)}(1-\mu_m^{(0)}) + \varepsilon. (2)
这里,h_\mu^m 是信念头,\sigma(\cdot) 是 sigmoid 函数,\varepsilon > 0 是为数值稳定性引入的小常数。初始预测信念记为 \mu_m^{(0)},而 u_m 是基于边界的置信度不确定性分数,其值在预测接近决策边界时增大。
### 冲突感知证据协商
CONFER 将模态专家表示为动态协商图中的节点。在第 t 轮协商时,预测信念 \mu_m^{(t)} 作为节点 m 的状态,而基于边界的置信度不确定性 u_m 和运行时可靠性 c_m 刻画该状态的可靠性。成对兼容性 A_{mn}^{(t)} 定义图边,接收者特定的消息权重 \gamma_{m\leftarrow n}^{(t)} 控制方向信息交换和节点更新。协商后的节点状态随后被读出以产生多模态预测,如图 1 (c) 所示。仅靠可靠性估计不能解决样本级分歧,因为不同专家的预测不应在未考虑其分歧是否与其不确定性一致的情况下直接组合。
#### 模态专家节点状态与可靠性刻画
如图 1 (c1) 所总结,每个模态专家节点由其预测状态、基于边界的置信度不确定性和运行时可靠性刻画。为了同时捕捉历史模态质量和样本特定不确定性,运行时可靠性通过结合 OOF 可靠性先验与当前不确定性来估计。具体地,r_{d,m} 是模态 m 在外层训练受试者上的内部 OOF 平衡准确率,其中 d 表示数据集-情感维度设置。从相同 OOF 预测中记录的中位基于边界的置信度不确定性记为 u_{m,\mathrm{med}}。在运行时,不确定性被归一化为 \tilde{u}_m = u_m/u_{m,\mathrm{med}},并与历史先验结合:
c_m = r_{d,m}\exp\left(-\tilde{u}_m\right). (3)
这里,c_m 是与模态 m 关联的专家的运行时可靠性。它控制该专家的传出贡献,而其最大归一化形式 \overline{c}_m(通过将 c_m 除以当前试验内最大运行时可靠性得到)控制对传入同伴信念的接收。所有 OOF 统计量仅由外层训相似文章
CORE:面向冲突的通用多模态篡改检测推理
提出了CORE框架,赋予多模态大语言模型显式的冲突捕获能力,以实现可泛化的篡改检测,能够通过少量或零样本适应未见过的篡改类型。
C$^2$MOE:基于一致性与互补性引导的混合专家框架用于不完整多模态情感学习
论文提出C²MOE,一种基于一致性与互补性引导的混合专家框架,用于对话中的不完整多模态情感识别,利用信息论分解在模态缺失时提高鲁棒性。
一种冲突感知的证据框架用于可靠的睡眠阶段分类
ConfSleepNet 是一种冲突感知的证据框架,使用多模态数据进行可靠的睡眠阶段分类。它引入了混合类别结构和冲突感知聚合方法来解决视角间冲突,在睡眠分期任务上展示了有效性。
利用自定进度课程学习增强多模态对话情感识别中的模态平衡
本文提出了一种基于自定进度课程学习的即插即用模块,用于增强多模态对话情感识别中的模态平衡,在IEMOCAP和MELD数据集上实现了F1分数的一致提升。
AMRD:面向轻量级语音情感识别的自适应多教师关系蒸馏
本文介绍了AMRD,一种自适应多教师关系蒸馏方法,用于将大型自监督语音情感识别模型压缩为面向边缘设备的轻量级学生模型。它解决了教师可靠性变化和关系结构丢失的问题,在IEMOCAP和CREMA-D数据集上展示了改进。