通过标签空间重塑平衡多模态学习
摘要
介绍了平衡多模态标签重塑(BMLR),该方法通过重塑标签空间来平衡跨模态的映射难度,从而解决多模态学习中的模态不平衡问题,并在多种架构上提升性能。
arXiv:2605.28869v1 公告类型: 新
摘要:多模态学习常常面临模态不平衡问题,即收敛速度较快的模态主导优化,而其他模态则训练不足。现有方法通常通过增强弱模态或调整优化梯度来缓解这一问题。然而,这些策略主要补偿优化速率的差异,往往以牺牲强模态的优化能力为代价,并且没有从模态层面分析这些差异是如何产生的。基于理论洞见和实证观察,我们认为学习速度的差异源于模态特定特征空间与共享标签空间之间映射难度的不同。为了解决这一问题,我们提出了平衡多模态标签重塑(BMLR),这是第一种从标签侧设计促进多模态平衡的方法。BMLR重塑跨模态标签空间以均衡各模态的映射难度,从而促进模态交互并为每个模态注入更丰富的类间信息。在多种架构上的广泛实验表明,BMLR持续提升多模态性能,并与多种模型设计展现出强兼容性。源代码即将发布。
查看缓存全文
缓存时间: 2026/05/29 09:12
# 通过标签空间重塑平衡多模态学习
来源:https://arxiv.org/html/2605.28869
###### 摘要
多模态学习常受模态不平衡问题困扰,其中收敛较快的模态主导优化过程,而其他模态则训练不足。现有方法通常通过强化弱模态或调整优化梯度来缓解该问题。然而,此类策略主要补偿的是优化速率的差异,且往往以牺牲强模态的优化能力为代价,并未从模态层面分析这些差异产生的根源。基于理论洞见与经验观察,我们认为学习速度的差异源于各模态特定特征空间与共享标签空间之间映射难度的不同。为解决该问题,我们提出平衡多模态标签重塑(Balanced Multimodal Label Reshaping, BMLR),这是首个从标签侧设计促进多模态平衡的方法。BMLR重塑跨模态标签空间以均衡各模态的映射难度,从而促进模态交互,并为每个模态注入更丰富的类间信息。在多种架构上的广泛实验表明,BMLR能持续提升多模态性能,并与多种模型设计展现出良好的兼容性。源代码即将发布。
††publicationid:pubid: 0000–0000/00$00.00 © 2021 IEEE
## I引言
多模态学习[1 (https://arxiv.org/html/2605.28869#bib.bib1),2 (https://arxiv.org/html/2605.28869#bib.bib2)]旨在整合来自不同模态的信息[3 (https://arxiv.org/html/2605.28869#bib.bib3)],以实现复杂场景下的全面感知与推理。尽管跨模态互补性具有优势[4 (https://arxiv.org/html/2605.28869#bib.bib4)],但研究已识别出“模态惰性”(Modality Laziness)问题[5 (https://arxiv.org/html/2605.28869#bib.bib5),6 (https://arxiv.org/html/2605.28869#bib.bib6)],即部分模态因模态不平衡(Modality Imbalance)[7 (https://arxiv.org/html/2605.28869#bib.bib7)]而无法有效学习。在联合训练过程中,模型常表现出“贪婪”(Greedy)倾向[8 (https://arxiv.org/html/2605.28869#bib.bib8)],优先进化强模态而忽视弱模态,导致多模态学习性能次优。
参见图注:图1:特征空间与标签空间的映射关系。特征空间源自CREMAD数据集并通过t-SNE可视化。标签空间以CREMAD中的三个类别为例进行说明。现有关于平衡多模态学习(Balanced Multimodal Learning, BML)[9 (https://arxiv.org/html/2605.28869#bib.bib9)]的研究强调增强弱模态以实现平衡并充分利用多模态输入。一个研究方向聚焦于优化目标,设计模态特定的学习目标[5 (https://arxiv.org/html/2605.28869#bib.bib5),10 (https://arxiv.org/html/2605.28869#bib.bib10),13 (https://arxiv.org/html/2605.28869#bib.bib13),11 (https://arxiv.org/html/2605.28869#bib.bib11),12 (https://arxiv.org/html/2605.28869#bib.bib12)]以强化弱模态。代表性技术包括细化任务监督[5 (https://arxiv.org/html/2605.28869#bib.bib5)]、引入基于原型的约束[10 (https://arxiv.org/html/2605.28869#bib.bib10)]以及利用知识蒸馏[11 (https://arxiv.org/html/2605.28869#bib.bib11)]来缓解模态惰性。另一个研究方向针对优化动态,根据单模态性能自适应地修改学习率[7 (https://arxiv.org/html/2605.28869#bib.bib7),14 (https://arxiv.org/html/2605.28869#bib.bib14),15 (https://arxiv.org/html/2605.28869#bib.bib15)]或梯度更新[16 (https://arxiv.org/html/2605.28869#bib.bib16),17 (https://arxiv.org/html/2605.28869#bib.bib17)],以对齐各模态的优化步调,防止训练偏差。总之,现有研究虽观察到模态优化步调的不一致性,并试图通过监督或优化调整进行补偿,但并未从模态层面分析这些差异产生的原因,也未提出直接解决问题的方案。
我们认为,学习速率的不一致可以从标签侧解释,因为它源于特征空间与标签空间之间映射难度的差异。在多模态分类中,模型通常受到独热标签(one-hot labels)的监督,这些标签的离散和不连续特性在标签空间中形成孤立的正交点[18 (https://arxiv.org/html/2605.28869#bib.bib18)]。这种尖锐的标签分布造成了高度非线性的优化景观,迫使模型在类别边界附近学习陡峭的决策边界[19 (https://arxiv.org/html/2605.28869#bib.bib19)]。如图1 (https://arxiv.org/html/2605.28869#S1.F1)所示,不同模态展现出不同的特征特性:那些具有更清晰、更易区分特征的模态能更轻松地拟合标签空间,而语义嘈杂或模糊的模态则面临更大的优化困难。先前的工作也支持这一见解。LFM[20 (https://arxiv.org/html/2605.28869#bib.bib20)]注意到了独热标签对模态不平衡的影响,并通过引入对比学习来削弱标签依赖以缓解该问题,但并未从标签空间本身入手解决。文献[21 (https://arxiv.org/html/2605.28869#bib.bib21)]从理论上证明,与目标分布更对齐的模态会更早被优化。我们进一步拓展了这一视角,分析了现实场景中各模态特征空间与标签空间之间的映射难度。这促使我们直接从标签侧解决模态不平衡问题,我们认为这是一种更根本、更有效的方法,因为独热标签无法完全捕获数据输入的所有信息[22 (https://arxiv.org/html/2605.28869#bib.bib22)]。通过重塑标签空间,我们能够对齐各模态的学习速率,融入类间信息,并促进跨模态交互,从而进一步提升性能。
基于这一动机,我们提出了平衡多模态标签重塑(Balanced Multimodal Label Reshaping, BMLR),该方法利用单模态输出和置信度差异为每个模态构建平衡且类别感知的标签空间,从而实现更公平的多模态学习,如图2 (https://arxiv.org/html/2605.28869#S1.F2)所示。具体而言,我们首先基于每个模态的单模态预测进行跨模态标签空间重塑。重塑矩阵(Reshaping Matrix)根据另一模态的预测进行定制,它决定了标签空间变换的结构,而重塑强度(Reshaping Intensity)则受模态间置信度差异的调控,控制变换的程度。这种重塑后的标签空间不仅对齐了各模态的学习速率,还通过跨模态交互丰富了类间关系。为了缓解动态标签空间变化带来的学习不稳定性,我们采用了目标参数优化(Targeted Parameter Optimization)策略,对模型的不同部分应用不同的优化目标。这确保了单模态表示学习和多模态决策能力的同时提升。我们的标签侧平衡学习方法通过在样本级别构建平衡且类别关系感知的标签空间,对齐了各模态的学习步调并增强了模型能力。总结而言,本文的贡献如下:
- •我们实证分析了模态优化速率差异的根本原因,即特征空间与标签空间之间不同的映射难度。
- •据我们所知,我们提出了第一个从标签侧缓解模态不平衡的方法。BMLR构建了一个平衡、类别关系感知的标签空间,在提供更丰富的跨模态类间信息的同时,对齐了各模态的优化速率。
- •在多个数据集、模型架构和融合方法上的实验表明,BMLR持续实现了显著的性能提升,证实了其强大的泛化能力和有效性。
参见图注:图2:BMLR方法的流程。我们利用跨模态预测比较与交互,构建平衡且类别关系感知的标签空间,同时使用模态特定的目标优化模型的不同部分。
## II相关工作
### II-A 平衡多模态学习
当使用统一目标训练多模态模型时,模态不平衡会导致强模态主导优化过程,进而使其他模态学习不充分[5 (https://arxiv.org/html/2605.28869#bib.bib5)]。
为了解决不平衡问题,一些方法设计了模态特定的目标来强化弱模态[5 (https://arxiv.org/html/2605.28869#bib.bib5),11 (https://arxiv.org/html/2605.28869#bib.bib11),10 (https://arxiv.org/html/2605.28869#bib.bib10),20 (https://arxiv.org/html/2605.28869#bib.bib20),23 (https://arxiv.org/html/2605.28869#bib.bib23)]。其他工作则调整训练过程以平衡优化步调[15 (https://arxiv.org/html/2605.28869#bib.bib15),7 (https://arxiv.org/html/2605.28869#bib.bib7),14 (https://arxiv.org/html/2605.28869#bib.bib14),26 (https://arxiv.org/html/2605.28869#bib.bib26),25 (https://arxiv.org/html/2605.28869#bib.bib25),27 (https://arxiv.org/html/2605.28869#bib.bib27),24 (https://arxiv.org/html/2605.28869#bib.bib24)]。为了解决训练中的冲突,一些方法解耦了多模态学习[28 (https://arxiv.org/html/2605.28869#bib.bib28),29 (https://arxiv.org/html/2605.28869#bib.bib29)]或调整优化方向[12 (https://arxiv.org/html/2605.28869#bib.bib12)]。虽然这些方法有助于对齐学习速率,但它们忽略了学习难度差异的根源[21 (https://arxiv.org/html/2605.28869#bib.bib21)]。我们认为,这种差异源于特征空间与标签空间之间映射的复杂性,这促使我们通过重构标签空间来对齐学习难度。
由于我们的方法是从标签侧设计的,因此每个模态需要学习相对独立且动态的监督信号。受DGL[30 (https://arxiv.org/html/2605.28869#bib.bib30)]的启发(该工作通过解耦编码器梯度与决策层梯度来避免优化冲突),我们每个模态编码器都使用自己的单模态目标进行优化,而多模态预测损失仅用于更新决策层。
### II-B 标签平滑与知识蒸馏
标签平滑(Label Smoothing, LS)是一种正则化技术,它将硬标签替换为硬标签与所有类别均匀分布的混合,防止模型变得过于自信[31 (https://arxiv.org/html/2605.28869#bib.bib31),32 (https://arxiv.org/html/2605.28869#bib.bib32)]。知识蒸馏(Knowledge Distillation, KD)是一种知识迁移范式,其中紧凑的学生模型被训练来模仿更准确的教师模型[34 (https://arxiv.org/html/2605.28869#bib.bib34),33 (https://arxiv.org/html/2605.28869#bib.bib33),35 (https://arxiv.org/html/2605.28869#bib.bib35)]。KD的核心见解是,训练好的模型输出的概率包含了超越硬标签的丰富知识。扩展这一概念,KD可以被视为LS的一种特殊形式,它构建了捕捉更真实类间关系的软标签[36 (https://arxiv.org/html/2605.28869#bib.bib36)]。在这项工作中,我们基于这一思想,在模态特定学习动态的引导下,为每个模态构建一个更平衡、类别关系感知的标签空间。重要的是,我们的方法与基于蒸馏的平衡方法(如UMT[11 (https://arxiv.org/html/2605.28869#bib.bib11)])有本质区别,后者依赖于模态内的知识迁移,无法促进跨模态交互,并且需要额外的资源来预训练单模态模型。
## III方法
### III-A 模型形式化
我们聚焦于多模态判别任务,遵循相关工作[9 (https://arxiv.org/html/2605.28869#bib.bib9)]。为简化起见,我们考虑包含两个模态的输入场景:\(m_a\) 和 \(m_v\)。训练数据集为 \(\mathcal{D} = \{\boldsymbol{x}_i, \boldsymbol{y}_i\}_{i=1,2,\dots,N}\),其中每个 \(\boldsymbol{x}_i\) 由多模态输入组成,即 \(\boldsymbol{x}_i = (\boldsymbol{x}_i^a, \boldsymbol{x}_i^v)\),且 \(\boldsymbol{y}_i \in \{0,1\}^C\),\(C\) 表示类别数量。我们采用一个多模态模型,包含两个专用的单模态编码器和一个融合网络。每个单模态编码器处理其对应的输入,生成模态特定的表示。编码器记为 \(\phi^a\) 和 \(\phi^v\),从 \(\boldsymbol{x}\) 的相应模态中提取特征。输出表示为 \(\boldsymbol{z}^a = \phi^a(\theta^a, \boldsymbol{x}^a)\) 和 \(\boldsymbol{z}^v = \phi^v(\theta^v, \boldsymbol{x}^v)\),其中 \(\theta^a\) 和 \(\theta^v\) 是编码器参数。单模态输出经过融合[37 (https://arxiv.org/html/2605.28869#bib.bib37),38 (https://arxiv.org/html/2605.28869#bib.bib38)]得到多模态表示。在不失一般性的前提下,我们使用拼接作为融合方法,并记产生logits的线性分类器参数为 \(\boldsymbol{W} \in \mathbb{R}^{C \times (d_{z^a} + d_{z^v})}\) 和 \(\boldsymbol{b} \in \mathbb{R}^C\)。采用交叉熵(Cross-entropy, CE)损失 \(\mathcal{L}\) 来衡量模型预测与目标标签空间之间的差异。
### III-B 平衡多模态标签空间重塑
#### III-B1 方法概述
我们方法的总体框架如图2 (https://arxiv.org/html/2605.28869#S1.F2)所示。我们首先获得每个样本的单模态预测结果,并基于这些预测构建标签空间重塑函数 \(\mathcal{F}\)。通过 \(\mathcal{F}\),原始标签空间 \(\mathbf{Y}\) 被重塑,产生一个平衡且类别关系感知的标签空间 \(\widetilde{\mathbf{Y}}^u\),如公式1 (https://arxiv.org/html/2605.28869#S3.E1)所定义。随后,我们设计了一种目标参数优化(Targeted Parameter Optimization)策略,对模型的不同部分应用不同的优化目标,从而实现单模态表示学习与多模态融合能力的同步提升。
\[\widetilde{\mathbf{Y}}^u = \mathcal{F}(\mathbf{Y}), \quad u \in \{a,v\} \tag{1}\]
#### III-B2 标签空间重塑函数
考虑到不同样本对模态的依赖程度不同[39 (https://arxiv.org/html/2605.28869#bib.bib39)],我们设计了一种基于单模态预测的样本级标签空间重塑策略。具体来说,我们构建了一族重塑函数 \(\mathcal{F} = \{\mathbf{F}_i\}_{i=1}^N\),其中 \(\mathbf{F}_i\) 表示应用于第 \(i\) 个样本的标签空间重塑。每个 \(\mathbf{F}_i\) 由该样本的单模态预测和标签重塑阈值 \(\beta\) 自适应地决定。重塑过程表述如下:
\[\widetilde{\boldsymbol{y}_i}^u = \mathbf{F}_i(\boldsymbol{y}_i, \boldsymbol{z}_i^a, \boldsymbol{z}_i^v, \beta), \quad u \in \{a,v\}. \]相似文章
BalCapRL:一种用于基于强化学习的 MLLM 图像描述生成的平衡框架
本文介绍了 BalCapRL,这是一种针对多模态大语言模型(MLLM)的平衡强化学习框架,旨在联合优化图像描述生成中的准确性、覆盖率和语言质量。通过奖励解耦和长度条件屏蔽来解决实用性与流畅性之间的权衡,该方法在性能上优于现有方法。
内部松弛,全局均衡:面向视觉-语言混合专家模型的几何引导负载均衡方法
本文提出 ReBA(Relax Within, Balance Across),一种面向视觉-语言混合专家模型的几何引导负载均衡方法。该方法通过分别平衡图像和文本标记,并对相关的视觉标记进行分组,来解决特定模态的路由不平衡问题,从而提升在不同分辨率和组合变化下的鲁棒性。
基于查询的跨模态投影器增强 Mamba 多模态大语言模型
本文提出了一种基于查询的跨模态投影器,通过交叉注意力机制对视觉标记进行压缩,以提升基于 Mamba 的多模态大语言模型的性能。该方法在视觉语言基准测试中同时提高了模型性能和吞吐量,并消除了手动设计二维扫描顺序的需求。
TokenSwap:基准测试并缩小多模态大语言模型中的模态差距
本文介绍了TokenSwap,一种将纯文本基准测试转换为图像交错对应物的方法,以及TokenSwap-Bench,用于衡量42个多模态大语言模型的模态差距。研究发现推理模型的差距较小,并表明基于TokenSwap的训练可以缩小这一差距。
针对噪声标签不平衡学习的有界调整与可靠性引导嵌入
BARGE 提出了一种单阶段目标函数,结合有界调整和可靠性引导嵌入,以处理不平衡学习中的噪声标签,在 CIFAR-10 和 Tiny ImageNet 等基准测试上取得了有竞争力的性能。