SynIB:多模态学习中最大化协同的信息瓶颈

arXiv cs.LG 论文

摘要

本文介绍了SynIB,一种基于信息瓶颈原则的可扩展目标函数,通过在被遮蔽一个模态时对自信预测进行惩罚,来定位多模态学习中的协同信息,从而提升需要跨模态推理的任务的性能。

arXiv:2606.09853v1 Announce Type: new \n 摘要:多模态学习的一个核心目标是捕捉协同信息:即只有通过联合使用多种模态才能获得的、与任务相关的信息,而这些信息无法从任何单一模态单独获得。虽然大多数方法在架构层面通过更大或更复杂的融合模型来运作,但我们提出一个互补的维度:塑造训练目标本身。标准训练通常强调单模态或冗余信息,在需要跨模态推理的示例上表现不足。我们通过信息论形式化定义了多模态协同,并介绍了协同信息瓶颈(SynIB),一种直接针对协同的可扩展目标函数。为了优先学习协同,SynIB激励模型从所有模态进行准确预测,同时当任何模态的信息被隐藏时对预测的置信度进行惩罚。除了标准的任务损失,模型会依次在遮蔽一个模态的情况下进行前向传播,如果模型仍然保持高置信度(表明依赖单模态线索而非跨模态交互)则会受到惩罚。我们在两个场景中验证了SynIB。在合成XOR任务中(其真实协同信息通过构造已知),标准训练无法恢复协同,而SynIB能够做到。在五个真实世界基准测试中,包括三个MultiBench情感任务、使用CLIP-ViT和DeBERTa骨干网络的仇恨表情包任务,以及我们引入的CREMA-D可控讽刺扩展,SynIB在依赖协同的示例上准确率提升高达7.8%,总体准确率提升高达3.8%。
查看原文
查看缓存全文

缓存时间: 2026/06/10 06:13

# SynIB:最大化多模态学习中协同的信息瓶颈

来源:https://arxiv.org/html/2606.09853

SynIB:最大化多模态学习中协同的信息瓶颈

Konstantinos Kontras¹,², Teodora Gagaleska¹, Thomas Strypsteen¹, Christos Chatzichristos¹, Matthew Blaschko¹, Maarten De Vos¹,†, Paul Pu Liang²,†

¹KU Leuven, ²MIT, †共同指导

多模态学习的一个核心目标是捕捉协同信息:即仅通过联合使用多个模态才能获得的与任务相关的信息,而任何单一模态单独都无法提供。虽然大多数方法在架构层面通过更大或更复杂的融合模型来操作,但我们提出了一个互补的轴:塑造训练目标本身。标准训练通常强调单模态或冗余信息,在面对需要跨模态推理的样本时表现欠佳。我们通过信息论形式化了多模态协同,并引入了可扩展的目标——协同信息瓶颈(SynIB),该目标直接针对协同。为了优先学习协同,SynIB 激励模型利用所有模态进行准确预测,同时当任何模态的信息被屏蔽时对模型的置信度进行惩罚。除了标准任务损失外,模型会依次屏蔽一个模态进行前向传播,如果模型仍然保持高置信度(表明依赖单模态线索而非跨模态交互)则受到惩罚。我们在两种场景下验证了 SynIB。在合成 XOR 任务中(真实协同信息通过构造已知),标准训练无法恢复协同,而 SynIB 能做到。在五个真实世界基准测试中,包括三个 MultiBench 情感任务、使用 CLIP-ViT 和 DeBERTa 骨干网络的 Hateful Memes,以及我们引入的可控讽刺扩展 CREMA-D,SynIB 在依赖协同的样本上准确率提升了最多 7.8%,总体准确率提升了最多 3.8%。

联系方式:[email protected] (https://arxiv.org/html/2606.09853v1/mailto:[email protected])

![[无标题图片]](https://arxiv.org/html/2606.09853v1/Figures/logos/mit_lockup_std-three-line_rgb_black.png)
![[无标题图片]](https://arxiv.org/html/2606.09853v1/Figures/logos/KU-Leuven-logo.png)

## 1 引言

多模态学习旨在结合来自多个来源的信息以改进预测。一个核心挑战是捕捉协同信息:即源于模态之间交互而非任何单一模态的预测信号(Liang et al., 2024b (https://arxiv.org/html/2606.09853#bib.bib3))。在单模态学习中,非线性激活使特征交互成为可能,而权重衰减(Krogh and Hertz, 1991 (https://arxiv.org/html/2606.09853#bib.bib108))和 Dropout(Srivastava et al., 2014 (https://arxiv.org/html/2606.09853#bib.bib85))等技术减少了模型对单个特征的依赖(Goodfellow et al., 2016 (https://arxiv.org/html/2606.09853#bib.bib109));然而,针对跨模态交互的类似机制仍未得到充分探索。多模态模型有时会在训练期间过度依赖单一模态,偏向于能实现更快优化进度的信号,这种现象被称为多模态竞争(Huang et al., 2022 (https://arxiv.org/html/2606.09853#bib.bib19))。许多方法通过估计模态贡献并通过梯度调制、辅助损失或相关干预来重新平衡学习,但在协同场景下收益有限(Kontras et al., 2025 (https://arxiv.org/html/2606.09853#bib.bib110)),这表明仅纠正模态不平衡不足以诱发跨模态协同。另一条互补的研究线通过架构设计捕捉跨模态交互,从融合机制(Zadeh et al., 2017 (https://arxiv.org/html/2606.09853#bib.bib63); Tsai et al., 2019 (https://arxiv.org/html/2606.09853#bib.bib62))到掩码多模态预训练(Singh et al., 2022 (https://arxiv.org/html/2606.09853#bib.bib131)),扩展了交互容量,但并未直接针对协同预测。表示级别的目标如对比对齐(Radford et al., 2021 (https://arxiv.org/html/2606.09853#bib.bib61))确实塑造了训练,但促使模态趋于一致,这种特性更接近冗余而非协同。这些工作缺乏的是一个直接优先考虑下游任务上协同预测的训练信号。我们的方法填补了这一空白:它在损失层面针对协同,与架构和预训练选择正交,并与重平衡方法互补(后者解决的是相关但不同的失效模式)。

为此,我们通过信息论视角形式化了多模态协同,并引入了*协同信息瓶颈*(SynIB)。其思路遵循定义:协同信息是指当任意单一模态被移除时就会消失的信息。因此,依赖协同的模型在屏蔽一个模态时必须变得不确定;保持高置信度的模型则依赖于单模态或冗余线索。SynIB 通过惩罚模态屏蔽下的高置信度预测,将此观察转化为训练信号,迫使模型在最重要样本上建立跨模态依赖关系。我们的主要贡献是:

1. SynIB 是一个训练目标,通过惩罚模态屏蔽下的高置信度预测来直接针对协同,无需预先知道数据中是否存在协同。
2. 一项动机分析表明,学习协同失败并非由单模态信号的干扰引起;相反,协同线索被学习但快速过拟合,限制了泛化能力。
3. 在多个真实世界基准测试(包括 MultiBench 和 Hateful Memes,使用预训练 CLIP-ViT 和 DeBERTa 骨干网络)、一个新的 CREMA-D 讽刺扩展以及受控的高斯 XOR 任务上进行了广泛评估。在这些任务上,SynIB 将依赖协同的测试集准确率提升了最多 7.8%,总体准确率提升了最多 3.8%。

## 2 相关工作

##### 部分信息分解(PID)。PID 形式化了多个源相对于一个目标(Williams and Beer, 2010 (https://arxiv.org/html/2606.09853#bib.bib111); Griffith and Koch, 2014 (https://arxiv.org/html/2606.09853#bib.bib112); Bertschinger et al., 2014 (https://arxiv.org/html/2606.09853#bib.bib113))的协同、冗余和独特信息。在多模态学习中,它主要被用作事后分析工具,用于量化训练模型中的信息分布(Liang et al., 2023 (https://arxiv.org/html/2606.09853#bib.bib114)),其中协同被操作化为融合模型与单模态模型集成之间的预测差距。最近的工作通过对比因子分解(Liang et al., 2024a (https://arxiv.org/html/2606.09853#bib.bib83); Wen et al., 2025 (https://arxiv.org/html/2606.09853#bib.bib119))和交互感知架构(Xin et al., 2025 (https://arxiv.org/html/2606.09853#bib.bib120))将 PID 启发的量纳入训练目标。虽然这些方法在解缠、归因和可解释性方面有效,但它们将协同视为一种需要隔离的结构属性,而非一种学习优化信号。

##### 多模态表示学习。大量工作通过架构和表示设计来捕捉跨模态交互:从张量融合(Zadeh et al., 2017 (https://arxiv.org/html/2606.09853#bib.bib63))到交叉注意力变换器(Tsai et al., 2019 (https://arxiv.org/html/2606.09853#bib.bib62); Lu et al., 2019 (https://arxiv.org/html/2606.09853#bib.bib133))的融合机制,以及多模态对比学习(Radford et al., 2021 (https://arxiv.org/html/2606.09853#bib.bib61))等对齐目标,掩码多模态预训练(Singh et al., 2022 (https://arxiv.org/html/2606.09853#bib.bib131); Baevski et al., 2022 (https://arxiv.org/html/2606.09853#bib.bib132)),以及将表示分解为模态不变和模态特定子空间(Liang et al., 2024a (https://arxiv.org/html/2606.09853#bib.bib83))。这些方法扩展了跨模态交互的容量,但都没有直接塑造下游任务上的训练信号来惩罚忽略协同线索的模型,使得即使富有表现力的架构也容易在那些更快最小化损失的方案下退化为单模态或冗余解决方案(Huang et al., 2022 (https://arxiv.org/html/2606.09853#bib.bib19))。我们的目标是互补的:它在损失层面运作,并且可以与这些架构选择中的任意一种结合使用。

##### 多模态竞争。另一条互补的工作线将跨模态学习失败视为多模态竞争,评估模态贡献并相应重新平衡学习。策略包括通过单模态性能衡量贡献(Yao and Mihalcea, 2022 (https://arxiv.org/html/2606.09853#bib.bib28); Peng et al., 2022 (https://arxiv.org/html/2606.09853#bib.bib12); Vielzeuf et al., 2018 (https://arxiv.org/html/2606.09853#bib.bib30); Kontras et al., 2024 (https://arxiv.org/html/2606.09853#bib.bib67); Fan et al., 2023 (https://arxiv.org/html/2606.09853#bib.bib13)),并通过梯度调制或分解强制执行平衡(Wei and Hu, 2024 (https://arxiv.org/html/2606.09853#bib.bib103)),重新初始化模态特定组件以逃离次优轨迹(Wei et al., 2024 (https://arxiv.org/html/2606.09853#bib.bib105)),基于扰动的归因如 Shapley 近似(Li et al., 2023 (https://arxiv.org/html/2606.09853#bib.bib25))、排列重要性(Kontras et al., 2025 (https://arxiv.org/html/2606.09853#bib.bib110))、反事实模态移除(Ji et al., 2022 (https://arxiv.org/html/2606.09853#bib.bib52)),以及避免融合的集成策略(Hua et al., 2024 (https://arxiv.org/html/2606.09853#bib.bib104))。虽然这些方法在防止模态崩溃方面有效,但它们假设平衡的贡献对于多模态学习就足够了。然而,正如 MCR(Kontras et al., 2025 (https://arxiv.org/html/2606.09853#bib.bib110))所示,纠正模态不平衡本身并不足以诱发协同。

## 3 方法

##### 问题设定。我们考虑一个监督式多模态预测任务,包含两个输入模态 X₁ 和 X₂ 以及一个目标 Y:(X₁ ∈ ℝ^(d₁), X₂ ∈ ℝ^(d₂), Y ∈ 𝒴) ∼ p(x₁, x₂, y)。¹ 为清晰起见,我们针对两个模态给出公式;SynIB 目标在模态之间是对称的,并且通过将反事实传递扩展到模态子集来适应 n > 2 的设置。

模态特定编码器 f_{θ_i}: ℝ^(d_i) → ℝ^(m_i) 对于 i ∈ {1,2} 产生 Z_i = f_{θ_i}(X_i);融合网络 f_{θ_12}: ℝ^(m₁) × ℝ^(m₂) → Δ(𝒴) 产生多模态输出 Ŷ_12 = f_{θ_c12}(Z₁, Z₂);单模态编码器 f_{θ_ci}: ℝ^(m_i) × ℝ 产生单模态输出 Ŷ_i = f_{θ_ci}(Z_i)。我们将所有可训练参数收集为 θ = {θ₁, θ₂, θ_c1, θ_c2, θ_c12}。

##### 协同作为学习目标。部分信息分解(Williams and Beer, 2010 (https://arxiv.org/html/2606.09853#bib.bib111); Bertschinger et al., 2014 (https://arxiv.org/html/2606.09853#bib.bib113))将预测互信息分解为四个原子:
I(Y; X₁, X₂) = R(Y; X₁, X₂) + U₁(Y; X₁ | X₂) + U₂(Y; X₂ | X₁) + S(Y; X₁, X₂), (1)
其中 R 是跨模态的冗余,U_i 是 X_i 的独特信息,S 只有从联合 (X₁, X₂) 才可获得。根据 Bertschinger 等人(2014 (https://arxiv.org/html/2606.09853#bib.bib113)),协同是 I_p(Y; X₁, X₂) 与其在保持双变量边缘分布 (Y, X₁) 和 (Y, X₂) 的分布上的最小值之间的差距:
S(Y; X₁, X₂) = ⏟(I_p(Y; X₁, X₂))_联合分布中的预测信息 − ⏟(min_{q ∈ Δ_p} ∫ q(y, x₁, x₂) log(q(y|x₁, x₂)/q(y)) dy dx₁ dx₂)_来自单模态边缘的最大预测信息, (2)
其中 Δ_p = { q : q(y, x_i) = p(y, x_i), i ∈ {1,2} }。第一项是联合分布下可获得的预测信息;第二项限定了任何依赖于 (X₁, X₂) 但通过双变量边缘进行分解的预测器的上界。标准交叉熵训练将 I(Y; X₁, X₂) 视为单个标量最大化,但没有提供机制将梯度信号分配给 S 而不是 R、U₁ 或 U₂(Liang et al., 2023 (https://arxiv.org/html/2606.09853#bib.bib114)),这激发了一个直接针对 S 的目标。

### 3.1 动机分析:是什么让协同难以学习?

一个常见的假设将学习协同的困难归因于模态之间或 PID 源之间的梯度干扰(Wei and Hu, 2024 (https://arxiv.org/html/2606.09853#bib.bib103))。我们在双模态 XOR 任务上探究这一点,该任务包含单源样本(附录 F.2 (https://arxiv.org/html/2606.09853#A6.SS2)),并将梯度信号归因到特定组件。

##### 观察结果。我们使用两个源于经验神经正切核(NTK)(Jacot et al., 2018 (https://arxiv.org/html/2606.09853#bib.bib116); Chizat et al., 2019 (https://arxiv.org/html/2606.09853#bib.bib115))的每源量来诊断标准训练。NTK 通过每个样本梯度的内积来表征训练动态:*学习信号强度* λ_g,衡量来自 PID 源 g 的样本驱动参数更新的强烈程度;*梯度对齐* cos(g, h),衡量源之间的干扰(推导见附录 K (https://arxiv.org/html/2606.09853#A11))。图 1 (https://arxiv.org/html/2606.09853#S3.F1) 显示协同样本获得了最大的 λ_g(左图),而逐对对齐接近零(中图):协同既没有缺乏梯度信号,也没有与其他源发生破坏性竞争。然而,其训练损失下降而验证损失上升(右图),表明在稀缺子集上过拟合,而非无法学习。这定位了失败在于训练动态而非表示能力。SynIB 正是针对这种情形设计,激励模型在整个训练过程中从跨模态预测中学习;附录 A.1 (https://arxiv.org/html/2606.09853#A1.SS1) 报告了 SynIB 下的诊断结果。

请参阅图注

图 1:标准融合下跨 PID 源的梯度几何。模型在来自三个 PID 源(U₁、R 和 S)的样本上训练,U₂ 构造为零(详见第 4.2 节 (https://arxiv.org/html/2606.09853#S4.SS2))。左图:每组的

相似文章

信息论分解用于多模态交互学习

arXiv cs.LG

本文提出一种多模态学习的信息论分析,揭示了捕捉样本特定交互的必要性,并提出了DMIL范式,通过变分分解和微调显式建模和学习这些交互,实现了优越性能。

模态如何共同学习(49分钟阅读)

TLDR AI

来自Meta FAIR、Reality Labs和牛津大学的一项关于多模态预训练的系统性研究,揭示了模态之间的不对称知识流动、协同与竞争动态、早期统一的益处,以及通过13.5B MoE模型验证的高效训练方案。