CAT-GS:通过校准门控和融合手术实现平衡的多模态学习

arXiv cs.LG 论文

摘要

CAT-GS 提出一种基于神经动力学的优化控制器,通过解决模态不平衡和融合干扰来稳定多模态学习,在各种基准测试中实现更高的准确率。

arXiv:2608.24947v1 公告类型:新 摘要:多模态神经网络的端到端训练常常表现出不稳定的神经动力学,其特征是三种耦合的失败模式会降低学习效果:(i) 模态不平衡,其中一个分支主导基于梯度的优化;(ii) 不稳定的门控,噪声置信度线索导致不稳定的模态选择;(iii) 融合干扰,模态特定的梯度在共享融合层发生冲突。我们提出 CAT-GS(校准、自适应、阈值门控与融合手术),一种用于智能计算应用的基于神经动力学的优化控制器。CAT-GS 在反向传播期间运行,不修改模型架构、融合模块或任务损失。通过温度缩放和 EMA 平滑校准教师派生的可靠性,CAT-GS 使用边界阈值策略来稳定神经动力学,该策略在预热丢弃、弱模态优先和弱偏置混合之间切换;通过上限梯度预算重新归一化来稳定激进门控下的梯度大小;并应用仅融合的 PCGrad 来减少主要共享瓶颈处的破坏性跨模态干扰。我们在音频-视觉多模态模式识别基准(CREMA-D、AV-MNIST 和 VGGSound)、三模态设置(UR-FUNNY)、受控合成数据(CG-MNIST)以及其他跨域基准(AVE 和 CMU-MOSI)上评估 CAT-GS。CAT-GS 在各种设置中,与强不平衡感知基线(包括 OGM-GE、G$^2$D 和 UMT)相比,提高或匹配了融合多模态准确率,并产生更平滑的门控行为和更少的冲突融合梯度。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:28

# CAT-GS:通过校准门控与融合手术实现平衡的多模态学习  
来源:https://arxiv.org/html/2608.24947  
Mahir Shahriar Tamim  
邮箱:[[email protected]](mailto:[email protected])  
通讯作者  
单位:孟加拉国达卡,南北大学电气与计算机工程系  
Sharjil Khan  
单位:孟加拉国达卡,南北大学电气与计算机工程系  
Md. Samiul Alim  
单位:孟加拉国达卡,南北大学电气与计算机工程系  
Tanvir Ahmed Khan  
单位:孟加拉国达卡,南北大学电气与计算机工程系  
Shafin Rahman  
单位:孟加拉国达卡,南北大学电气与计算机工程系  
Nabeel Mohammed  
单位:孟加拉国达卡,南北大学电气与计算机工程系  

###### 摘要  
多模态神经网络的端到端训练常表现出不稳定的神经动力学,其特征是三种耦合的失败模式,会降低学习效果:\(i\)*模态失衡*,即一个分支主导基于梯度的优化;\(ii\)*不稳定的门控*,噪声置信度线索导致模态选择不稳定;以及\(iii\)*融合干扰*,模态特定梯度在共享融合层发生冲突。我们提出CAT-GS(校准、自适应、阈值化门控与融合手术),这是一种基于神经动力学的优化控制器,适用于智能计算应用。CAT-GS在反向传播期间运行,无需修改模型架构、融合模块或任务损失。通过对教师导出的可靠性进行温度缩放和指数移动平均(EMA)平滑校准,CAT-GS使用基于边界阈值的策略在热身丢弃、弱模态优先和弱偏融合之间切换以稳定神经动态;通过有上限的梯度预算重新归一化,在激进门控下稳定梯度幅度;并在主要共享瓶颈处应用*仅融合*的PCGrad,以减少破坏性的跨模态干扰。我们在音频-视觉多模态模式识别基准(CREMA-D、AV-MNIST和VGGSound)、三模态设置(UR-FUNNY)、受控合成数据(CG-MNIST)以及额外的跨域基准(AVE和CMU-MOSI)上评估了CAT-GS。在各种设置下,CAT-GS在融合多模态准确率上改进或匹配了强大的失衡感知基线(包括OGM-GE、G2D和UMT),并产生更平滑的门控行为和更少的冲突融合梯度。

###### 关键词:神经动态,多模态学习,智能计算,基于梯度的优化,学习动态,知识蒸馏,校准,模式识别  

## 1 引言  
深度多模态学习将异构信号(例如音频/语音和视觉)整合到神经网络架构中,以超越任何单一模态,提高模式识别能力和鲁棒性(https://arxiv.org/html/2608.24947#bib.bib1)。从神经动力学的角度看,智能计算系统需要在整个训练过程中保持梯度流的稳定时间演化和自适应控制机制。CAT-GS是一种基于神经动力学的优化控制器,在反向传播期间运行以调节学习动态,而不修改模型架构、融合模块或任务损失。  
在一个理想的系统中,模型会动态地依赖于*当前样本和训练阶段*最可靠的模态。然而在实践中,联合优化经常因*模态失衡现象*(https://arxiv.org/html/2608.24947#bib.bib17)而受阻:一个分支(通常是更容易或信噪比更高的模态)快速主导梯度流,而较弱的分支接收到的更新逐步减少。结果是脆弱的融合、欠训练的模态特定编码器以及多模态增益的降低。图1(https://arxiv.org/html/2608.24947#S1.F1)在CREMA-D上说明了这些失败模式,突出显示了在标准联合训练下,主导模态失衡和融合梯度冲突如何阻碍收敛。  
现有方法主要通过两类技术来缓解失衡。*梯度调制方法*衰减主导模态的梯度以放大较弱模态的梯度(https://arxiv.org/html/2608.24947#bib.bib17),(https://arxiv.org/html/2608.24947#bib.bib14),而*基于置信度的门控方法*则根据校准感知的置信度估计降低权重或掩蔽不可靠的模态(https://arxiv.org/html/2608.24947#bib.bib11)。尽管这些策略单独有效,但它们未能解决端到端多模态优化的学习动态中出现的三个紧密耦合的挑战。  
首先,用于模态门控的置信度信号通常源自原始对数几率(logits),这些原始对数几率通常校准不准且有噪声(https://arxiv.org/html/2608.24947#bib.bib12)。没有时间上的稳定化,这些不可靠的估计会导致门控决策在批次间剧烈波动,导致“门控抖动”而非可靠性感知的控制。其次,激进或持续地抑制一个模态可能导致*梯度饥饿*:当一个分支在较长时间内接收到接近零的梯度时,其表征相对于主导模态会停滞,这会加剧失衡并使恢复变得越来越困难(https://arxiv.org/html/2608.24947#bib.bib9)。第三,即使模态特定梯度在个体上平衡,它们在共享融合层中的相互作用仍可能是破坏性的;具有负余弦相似度的梯度(https://arxiv.org/html/2608.24947#bib.bib10)在瓶颈处产生干扰,阻碍了联合收敛,尽管单模态更新本身表现良好。  
为了解决这些限制,我们引入了CAT-GS,这是一个基于神经动力学的智能计算应用优化框架,为校准、平衡和冲突感知的多模态学习提供了对这些耦合失败模式的统一处理。CAT-GS包裹了现有的多模态训练循环,并且*仅*修改*后向阶段*的优化信号。它使用由稳定化教师可靠性分数驱动的*基于边界的控制器*,在热身丢弃、优势抑制和弱偏融合之间切换。这产生了可解释的区间转换并避免了振荡的门控行为。  
实证上,CAT-GS在不同设置下提高了融合多模态准确率,相比强大的失衡感知基线取得了增益(例如,在UR-FUNNY A-V-TXT任务中;表2(https://arxiv.org/html/2608.24947#S4.T2)),同时表现出更平滑的门控动态和更少的负融合梯度余弦事件(图4(https://arxiv.org/html/2608.24947#S4.F4))。与先前孤立解决失衡、门控或冲突解决的工作不同,CAT-GS将基于知识蒸馏的校准可靠性估计、区间感知门控、预算保持梯度重新归一化以及局部冲突解决耦合在单个优化步骤中。  
**新颖性和贡献。** 我们引入了CAT-GS,这是一个优化阶段的多模态后向传播控制器,在单个优化步骤中共同解决门控不稳定、模态饥饿和融合干扰。构建模块借鉴了现有技术;两个新元素是将PCGrad限制在融合瓶颈而非整个网络,以及防止被门控模态饥饿的预算保持重新归一化。我们的贡献如下:  
- • 我们将自适应模态门控构建为一种*基于区间的门控控制器*,由来自知识蒸馏的校准可靠性边界驱动,无需修改模型架构或任务损失,即可在热身丢弃、优势抑制和弱偏融合之间实现可解释的转换。  
- • 我们将门控与*预算保持的梯度重新归一化机制*相耦合,该机制使用具有硬性上限的EMA目标幅度,在激进的(硬性)门控下稳定更新幅度,从而缓解了诸如长期失衡和脆弱收敛等失败模式。  
- • 我们采用*仅融合的梯度手术策略*,在跨模态梯度首次交互的共享融合瓶颈处专门应用PCGrad,从而在保留单模态编码器动态的同时,以远低于全局投影的成本减少破坏性干扰。  
- • 我们在音频-视觉、三模态和受控合成基准上,以及额外的AVE和CMU-MOSI评估上进行了广泛的实证验证,证明了在融合准确率、优化稳定性和对模态失衡的鲁棒性方面的持续改进。  
> **图1:CREMA-D上的优化动态。** 展示了在标准联合训练(左)和CAT-GS(右)下训练行为的实验推导可视化。注释是对观察到的梯度统计的概括性说明。联合训练表现出不稳定的动态,存在主导模态失衡和频繁的融合梯度冲突,收敛到次优解(≈67%准确率)。CAT-GS通过校准门控、梯度预算保持和仅融合梯度手术稳定优化,平滑收敛到一个鲁棒的解(86.3%准确率)。

## 2 相关工作  
**多模态学习中的模态失衡。** 在联合训练期间特定模态的主导性是多模态学习中普遍存在的问题。早期通过辅助损失或特征范数正则化来解决这一问题(https://arxiv.org/html/2608.24947#bib.bib17)。更新的梯度调制技术,如动态缩放(https://arxiv.org/html/2608.24947#bib.bib17)和多损失平衡(https://arxiv.org/html/2608.24947#bib.bib23),会动态调整更新以防止一个模态压倒其他模态。近期的平衡导向方法包括MMCosine(https://arxiv.org/html/2608.24947#bib.bib2),它使用基于余弦的特征归一化来提高细粒度判别力;DRL(https://arxiv.org/html/2608.24947#bib.bib4),它诊断模态学习状态并应用软性重学习;以及MCR(https://arxiv.org/html/2608.24947#bib.bib3),它引入博弈论正则化来缓解模态竞争。虽然这些方法改善了平衡,但许多方法仍然依赖于预定义或粗略的优势线索,并且可能无法明确防止被抑制分支中的长期梯度饥饿(https://arxiv.org/html/2608.24947#bib.bib24)。相比之下,CAT-GS利用校准的置信边界进行上下文感知的调制,确保抑制是暂时性的,并与预算保持的重新缩放配对。  
**基于置信度的门控与动态融合。** 多模态融合已在广泛的任务中进行研究,从结合音频、视觉和文本线索的情感分析(https://arxiv.org/html/2608.24947#bib.bib38)到通过层次注意力融合进行视频描述(https://arxiv.org/html/2608.24947#bib.bib39)。门控机制长期以来一直支持多模态系统中的自适应融合(https://arxiv.org/html/2608.24947#bib.bib28)。当代方法使用软注意力(https://arxiv.org/html/2608.24947#bib.bib6)或熵驱动门来根据可靠性为模态加权。教师引导的融合通过蒸馏单模态先验进一步增强了这一点(https://arxiv.org/html/2608.24947#bib.bib22)。然而,依赖于未校准的教师对数几率会导致不稳定的决策(https://arxiv.org/html/2608.24947#bib.bib12),加剧了门控抖动。很少有工作将直接校准集成到门控循环中;CAT-GS通过结合温度缩放、EMA平滑和边界阈值化来推进这一点,以实现稳健的、区间感知的控制。  
**梯度冲突解决。** 梯度冲突阻碍了多任务和多模态优化(https://arxiv.org/html/2608.24947#bib.bib25)。基于投影的方法(如PCGrad和CAGrad)剔除破坏性分量,而其他方法通过方差减少进行归一化。在多模态设置中,冲突在融合层尤为尖锐(https://arxiv.org/html/2608.24947#bib.bib25),但先前的应用是全局性的而非局部性的。据我们所知,先前的工作尚未系统地探索在融合头选择性地应用PCGrad;CAT-GS采用这种局部策略,在解决瓶颈干扰的同时保留单模态编码器动态。  
**多模态设置中的知识蒸馏。** 从单模态教师进行蒸馏是多模态学生的标准做法(https://arxiv.org/html/2608.24947#bib.bib29),(https://arxiv.org/html/2608.24947#bib.bib22)。像UMT(https://arxiv.org/html/2608.24947#bib.bib22)这样的方法匹配对数几率和特征,但将教师输出视为不会出错的,忽略了校准误差(https://arxiv.org/html/2608.24947#bib.bib12)。最近的校准感知变体侧重于事后调整,而不是在线集成。CAT-GS将温度缩放和EMA稳定化嵌入到蒸馏引导的门控过程中,为自适应优化提供可靠的信号。  
总之,先前的工作通常孤立地处理失衡、基于置信度的融合和梯度冲突。CAT-GS将这些想法整合到单个优化阶段控制器中,为跨不同融合设计的稳定且平衡的多模态训练提供了实用方案。因此,贡献在于优化阶段的集成本身,以及它引入的融合定位投影和预算保持的重新归一化。

## 3 方法论  
图2(https://arxiv.org/html/2608.24947#S3.F2)和图3(https://arxiv.org/html/2608.24947#S3.F3)总结了整体模型和CAT-GS训练迭代。图2显示了前向架构和监督流(可训练的学生编码器和融合头,以及冻结的单模态教师),而图3详细说明了优化阶段控制器:校准/EMA稳定的教师可靠性驱动基于区间的门控,随后是梯度预算稳定化和仅融合手术,然后进行优化器更新。为了可读性,我们按照严格的控制流呈现CAT-GS:可靠性估计(第3.3节),区间选择和门控(第3.4节),幅度稳定化(第3.5节),以及融合冲突处理(第3.6节),随后是算法1中的统一训练步骤。  
> **图2:高级前向架构和监督流。** 音频和视频输入由可训练的学生编码器处理并融合以产生预测。冻结的单模态教师直接接收相同的原始模态输入(\(x^a\),\(x^v\))(而非学生导出的特征),并在整个训练过程中保持冻结;它们通过知识蒸馏提供辅助监督,并提供供CAT-GS使用的每模态可靠性信号。优化阶段控制(CAT-GS)仅在反向传播期间运行,单独在图3(https://arxiv.org/html/2608.24947#S3.F3)中展示。  
> **图3:CAT-GS概览。** 学生模型包含可训练的单模态编码器和融合头,而单模态教师是冻结的,仅用于估计每模态可靠性。教师置信度经过校准和稳定化以驱动基于边界的门控,随后是梯度预算稳定化...

相似文章