融合之前,先问保留什么:多模态信号的上下文校准
摘要
本文介绍了一种即插即用的校准模块,该模块在融合前调整多模态表示,利用跨模态上下文抑制误导信号,增强可靠信号,从而在多个基准测试上提升性能。
arXiv:2606.02679v1 公告类型:新
摘要:多模态系统通常受益于跨语言、声音和视觉流的信息整合,但这种收益并非总是有保障。一个对某个输入有用的模态可能对另一个输入造成干扰,同一模态内的局部特征响应也可能与其他来源的证据不一致。本文研究如何在下游预测器合并多模态表示之前对其进行调整。我们开发了一个紧凑的校准模块,在摘要层面将各模态与其他模态进行比较,提取跨源支持与冲突的线索,并将这些线索转换为实例级和维度级的调制信号。校准应用于原始模态特征而非已融合的表示,使模型能够抑制误导成分、保留微弱但有用的证据,并增强在当前多模态上下文中得到更好支持的响应。该模块设计为即插即用组件,可附加到不同融合主干上,无需改变其预测头。在覆盖情感理解、动作识别、音视频事件检测和音视频情感分类的五个基准测试上,所提出的预组合校准策略在基于序列和卷积的融合设置下均提升了性能。此外,模态移除、合成破坏、训练动态以及特征级可视化等分析表明,融合前的信号校准可以减少来自不可靠模态的干扰,并实现更稳定的多模态优化。
查看缓存全文
缓存时间: 2026/06/03 09:39
# 融合之前,先问保留什么:多模态信号的上下文校准 来源:https://arxiv.org/html/2606.02679 ##### 摘要 多模态系统通常受益于跨语言、声音和视觉流的信息整合,但这种收益并非必然。对某个输入有用的模态可能对另一个输入造成干扰,同一模态内的局部特征响应也可能与其他来源的证据产生冲突。本研究探讨如何在多模态表示被下游预测器合并之前对其进行调整。我们开发了一个紧凑的校准模块,该模块在摘要层面比较每个模态与其他模态,提取跨源支持与冲突的线索,并将这些线索转化为实例级和维度级的调制信号。该校准应用于原始模态特征,而非已融合的表示,从而使模型能够抑制误导性成分、保留微弱但有用的证据,并强调在当前多模态上下文中得到更好支持的响应。该模块设计为即插即用组件,可附加到不同的融合骨干网络,而无需改变其预测头。在涵盖情感理解、动作识别、音视频事件检测和音视频情感分类的五个基准测试中,所提出的预融合校准策略在基于序列和卷积的融合设置下均能提升性能。通过模态移除、合成损坏、训练动态和特征级可视化等附加分析表明,在融合前校准信号可以减少不可靠模态的干扰,并实现更稳定的多模态优化。 ††版权:无 ## 1. 引言 多模态学习旨在通过整合来自不同模态的异构信号(如文本、视觉、知识图谱和领域特定信号)来改进预测 (Zadehet al., 2017; Sunet al., 2025; Tanet al., 2026a, b)。原则上,不同模态为同一事件提供互补视角,多模态融合已被广泛用于建模模态内和模态间动态 (Zadehet al., 2017; Tsaiet al., 2019)。然而,增加更多模态并不总能提升性能。先前工作表明,多模态网络可能不如单模态模型,因为不同模态以不同速率过拟合和泛化 (Wanget al., 2020)。模态不平衡还可能导致主导模态抑制较弱模态,使得某些单模态表示优化不足 (Penget al., 2022)。当弱或不太可靠的模态可能向多模态学习引入噪声、冗余或冲突信息时,这一问题变得更加严峻 (Zouet al., 2023)。因此,不太可靠的模态仍可能提供有用的互补线索,但它们也可能包含有害或冲突的成分,当直接融合到骨干网络中时会干扰全模态预测。 现有研究主要从优化层面的模态不平衡角度处理这一问题。诸如 Grad-Blending、OGM-GE、PMR、MMPareto 和 ARL 等方法通过调整损失、梯度、模态贡献或表示学习动态来改进多模态学习 (Wanget al., 2020; Penget al., 2022; Fanet al., 2023; Wei and Hu, 2024; Weiet al., 2025; Zhaiet al., 2025)。尽管有效,但这些方法大多在模态特征进入联合优化之后才进行干预。因此,它们未能完全回答一个更早的问题:在多模态融合之前,模型如何识别上下文中有影响但可能不可靠的模态成分,并决定它们应被增强、保留还是抑制? 这个问题之所以重要,是因为直接融合可能在模型有机会显式区分有用证据与不可靠信号之前,就将它们混合在一起。这激发了价值估计作为一种机制,用于在预融合阶段指导模态精炼。 表1. 在MOSEI上,朴素融合、优化级平衡和增强预融合变换的初步比较。如表格1所示,简单拼接表现较差,而 Concat+MLP 达到了与 MMPareto 相当的性能范围。这表明轻量级的预融合变换可以在联合优化之前部分缓解模态干扰。然而,Concat+MLP 仍然执行通用的特征变换,并未显式估计在跨模态一致或差异下哪些模态成分具有上下文影响。这激发了我们基于价值感知的预融合精炼设计。 在本文中,我们将模态价值定义为对多模态预测具有上下文条件的冲击证据。价值并非作为直接保留概率,而是指示在哪些地方可能需要更强的上下文感知调制,而最终的门控学习每个成分应被增强、保留还是减少。 基于注意力的方法主要建模标记级或跨模态相关性 (Vaswaniet al., 2017; Tsaiet al., 2019),而通用门控机制通常学习自适应特征或模态权重 (Ovalleet al., 2017; Huet al., 2018)。近期的多模态门控方法进一步探索了基于置信度的门控,用于灵活或不完整的模态输入 (Zhenget al., 2025)。然而,在我们的设定中,相关性、置信度或重要性并不一定指示价值,因为一个显著或高置信度的模态在跨模态上下文冲突时仍可能是有害的。 基于这一定义,我们提出价值门控模态精炼器 (VGMR),一种用于鲁棒多模态学习的预融合精炼模块。VGMR 首先通过捕获目标模态与其余模态之间的一致和差异,建模摘要级跨模态交互。然后,它在全局和通道层面估计价值信号,并将这些信号作为细粒度门控生成器的上下文指导,在原始模态特征进入骨干网络之前对其进行精炼。通过这样做,VGMR 允许模型根据跨模态价值证据和特征级上下文,在融合前保留、增强或减少模态成分。 我们进行了大量实验和分析,以检验 VGMR 是否在简单特征聚合、通用门控或训练阶段重平衡之外改进多模态学习。结果表明,预融合的价值条件精炼能够提升多模态性能,增强在损坏输入下的鲁棒性,并支持更稳定的优化行为。 本文的主要贡献总结如下: - • 我们从预融合视角重新审视多模态不平衡问题,强调弱模态可能同时包含互补线索与噪声或有害响应。 - • 我们提出 VGMR,一种价值条件的模态精炼器,它估计全局级和通道级冲击证据,并利用这些证据在融合前对原始模态特征进行细粒度门控。 - • 我们进行了大量实验和诊断分析,表明 VGMR 能提升多模态性能,增强在噪声输入下的鲁棒性,并支持更稳定的优化行为。 ## 2. 相关工作 ### 2.1. 模态不平衡与优化平衡 模态不平衡是多模态学习中的一个常见挑战,其中不同模态在联合训练中贡献不均。主导模态可能抑制较弱模态,并且添加更多模态并不总能改善预测。现有方法主要通过训练期间调整模态贡献来解决这一问题,包括损失平衡、梯度调制、模态重加权和表示再学习。 Grad-Blending 从模态间过拟合和泛化差异的角度处理多模态不平衡 (Wanget al., 2020)。OGM-GE 动态测量模态之间的贡献差异,并调制梯度以给优化不足的模态更多优化努力 (Penget al., 2022)。PMR 引入模态原型来刺激慢学习模态并重新平衡其学习进度 (Fanet al., 2023),而 AGM 根据估计的模态贡献自适应调整模态梯度 (Liet al., 2023)。MMPareto 从帕累托优化角度制定多模态和单模态目标以减少梯度冲突 (Wei and Hu, 2024)。D&R 诊断每个模态的学习状态并重新学习模态编码器,以避免过度强调信息量少的模态 (Weiet al., 2024)。MLA 将联合多模态训练重构成交替的单模态适应,在减少干扰的同时维持共享预测 (Zhanget al., 2024b)。ARL 进一步认为完全平衡的模态学习并非总是最优,并根据模态方差和偏差使用非对称表示学习 (Weiet al., 2025)。 总体而言,这些方法表明多模态不平衡与模态间不等的学习动态密切相关。然而,它们主要在联合训练期间通过调整损失、梯度、模态权重或表示学习策略进行干预。相比之下,本研究探讨是否可以在噪声或不可靠的模态响应成分进入融合或联合优化之前对其进行精炼。 ### 2.2. 多模态融合与跨模态交互 多模态融合旨在组合异构模态特征并利用跨模态的互补信息。早期融合方法通过求和、拼接或基于 MLP 的融合聚合模态表示,而更具表达力的方法则对高阶跨模态交互进行建模。例如,张量融合网络显式捕获单模态、双模态和三模态交互 (Zadehet al., 2017),基于 Transformer 的多模态模型使用注意力机制捕获长程和跨模态依赖关系 (Vaswaniet al., 2017; Tsaiet al., 2019)。多模态融合也在特定领域应用中得到广泛研究,包括医学多模态学习 (Sunet al., 2025)。 近期研究进一步表明,有效的融合需要超越直接聚合。MISA 学习模态不变和模态特定的子空间,以减少模态差距同时保留私有模态特征 (Hazarikaet al., 2020)。MAG 引入多模态适应门,将声学和视觉信息注入预训练语言模型 (Rahmanet al., 2020)。MMIM 通过在模态间水平和融合输出水平最大化互信息来改进融合 (Hanet al., 2021)。Self-MM 通过自监督单模态标签生成学习模态特定表示 (Yuet al., 2021)。TETFN 通过基于文本的注意力增强非语言模态,并学习跨模态的一致性和差异化信息 (Wanget al., 2023)。PCAG 引入预门控和上下文注意力门,以过滤非信息性的跨模态交互,减少交叉注意力引入的不确定性 (Zhanget al., 2024a)。 这些研究表明,多模态融合已从简单聚合演变为表达性的对齐、交互、信息保留和基于门控的机制。然而,大多数面向融合的方法关注如何组合、对齐或交互模态表示。即使使用了注意力或门控,学习到的权重通常反映相关性、显著性、置信度或特征重要性。它们并未显式估计用于在融合前精炼原始模态特征的上下文条件价值证据。 ### 2.3. 信息分解视角 这一问题也与信息分解视角相关。部分信息分解 (PID) 提供了一种信息论视角,通过分离冗余、独特和协同信息来理解多个源如何贡献于目标变量 (Williams and Beer, 2010)。这一视角对多模态学习很有用,因为模态的贡献无法仅通过单一重要性分数完全描述。一个模态可能包含与其他模态共享的冗余信息、自身拥有的独特信息,或仅在与其他模态组合时才变得有用的协同信息。 我们的方法在概念上受到这一观点的启发,但并未旨在显式估计 PID 量。相反,PID 促使我们考虑模态成分在跨模态一致与差异下可能具有不同的上下文效果。VGMR 通过可学习的全局级和通道级价值估计来操作这一直觉,从而在融合前保留有用的模态特定或互补信息,同时减少噪声或有害成分。 ### 2.4. 本工作的定位 VGMR 补充了优化级平衡方法和面向融合的交互方法。优化级方法在联合训练期间调整损失、梯度或模态权重,而融合方法主要关注在模态表示进入融合阶段后如何聚合、对齐或交换信息。相比之下,VGMR 通过使用上下文条件价值证据精炼原始模态特征,在融合之前发挥作用。 与注意力、置信度估计、可靠性加权或通用门控不同,VGMR 不将价值视为直接保留分数或独立的模态可靠性。相反,它在跨模态一致与差异下估计全局级和通道级价值信号,作为上下文条件的冲击证据。高价值表明在当前上下文中,某个模态或通道可能强烈影响最终预测,但本身并不
相似文章
FeatCal: 后合并模型的特征校准
FeatCal是一种校准方法,通过逐层权重更新(无需梯度下降)来缩小后合并模型的性能差距,在CLIP和GLUE基准测试上以高样本效率取得了优异结果。
口语对话中的上下文感知多模态声明验证
本文介绍了MAD2,一个用于口语对话中多模态声明验证的新基准,并提出了音频和文本模型的校准融合,利用对话上下文来提高验证准确性。
质量感知多模态融合何时真正发挥作用?一种用于决策级依赖的防泄漏诊断方法
本文提出了一种防泄漏诊断方法,通过跨测试样本打乱可靠性分数,来检验质量感知多模态融合方法在推理时是否真的使用了这些分数。在StressID和CMU-MOSEI上的实验表明,打乱后的可靠性分数并未改变性能,说明质量信号仅在能可靠预测单模态正确性时才会影响决策。
探测、融合与可信度:面向多模态癌症分析的基础模型表征系统评估
本文系统评估了用于多模态癌症分析的基础模型表征,在真实世界队列上对单模态与多模态融合策略进行基准测试,并通过共形预测评估可信度。
MuteBench:不完整多模态融合中的模态不可用容忍度评估
MuteBench是一个基准测试,用于评估多模态融合模型在临床数据集上的模态缺失和模态内部缺失条件下的性能。它提供了关于架构鲁棒性的见解,并表明基于扩散的插补方法可以有所帮助。