信息论分解用于多模态交互学习
摘要
本文提出一种多模态学习的信息论分析,揭示了捕捉样本特定交互的必要性,并提出了DMIL范式,通过变分分解和微调显式建模和学习这些交互,实现了优越性能。
arXiv:2606.11614v1 公告类型:新
摘要:多模态学习依赖于跨模态的冗余、独特和协同信息,这些信息共同构成多模态交互。一个关键但未被充分探索的挑战是,这些隐式交互在不同样本之间动态变化。在这项工作中,我们首次进行了系统的信息论分析,突出了为什么学习这些动态的、样本特定的交互对于有效的多模态学习至关重要。我们的分析进一步揭示了传统范式在学习这些不同交互类型方面的缺陷:模态集成方法难以捕捉协同,而联合学习范式往往未能充分利用冗余信息。这凸显了需要一种能够基于每个样本自适应地学习不同交互类型的方法。为此,我们提出了基于分解的多模态交互学习(DMIL),一种新颖的范式,显式建模并从样本特定交互中学习。首先,我们设计了一个变分分解架构来分离组成交互组件。其次,我们采用了一种新的学习策略,在微调过程中利用这些显式的交互组件来实现全面的交互学习。在多种任务和架构上的广泛实验表明,DMIL通过适应整体样本特定交互,始终实现了优越的性能。我们的框架灵活且广泛适用,建立了一种以交互为中心的多模态学习范式。代码可在 https://github.com/GeWu-Lab/DMIL 获取。
查看缓存全文
缓存时间: 2026/06/11 13:49
# 多模态交互学习的信息论分解 来源:https://arxiv.org/abs/2606.11614 查看PDF (https://arxiv.org/pdf/2606.11614) > 摘要:多模态学习的关键在于捕捉跨模态的冗余、独特和协同信息,这些信息共同构成了多模态交互。一个关键但尚未充分探索的挑战是,这些隐式交互在不同样本间动态变化。在本工作中,我们首次进行了系统性的信息论分析,阐明了学习这些动态、样本特定的交互对于有效多模态学习至关重要。我们的分析进一步揭示了传统范式在学习这些不同交互类型方面的缺陷:模态集成方法难以捕捉协同信息,而联合学习范式往往未能充分利用冗余信息。这凸显了一种能够逐样本自适应学习不同交互类型的方法的必要性。为此,我们提出了基于分解的多模态交互学习(DMIL),一种显式建模并学习样本特定交互的新范式。首先,我们设计了一种变分分解架构来分离组成交互分量。其次,我们采用一种新的学习策略,在微调过程中利用这些显式交互分量来实现全面的交互学习。跨多种任务和架构的大量实验表明,DMIL 通过适应全面的样本特定交互,始终取得更优性能。我们的框架灵活且广泛适用,建立了一种以交互为中心的多模态学习范式。代码可在此 https URL (https://github.com/GeWu-Lab/DMIL) 获取。 ## 提交历史 来自:Zequn Yang [查看邮箱 (https://arxiv.org/show-email/cb896b1a/2606.11614)] **[v1]** 2026年6月10日星期三 03:27:13 UTC (3,575 KB)
相似文章
模态如何共同学习(49分钟阅读)
来自Meta FAIR、Reality Labs和牛津大学的一项关于多模态预训练的系统性研究,揭示了模态之间的不对称知识流动、协同与竞争动态、早期统一的益处,以及通过13.5B MoE模型验证的高效训练方案。
配对时正确,拆分时错误:解耦与编辑多模态大语言模型中的模态特定神经元
本文识别并解决了多模态大语言模型中的“编辑解耦失败”问题,即通过多模态输入进行知识更新后,当查询变为单模态时更新效果无法泛化。作者提出DECODE方法,用于解耦并定位模态特定神经元,从而实现更有效的知识编辑。
SynIB:多模态学习中最大化协同的信息瓶颈
本文介绍了SynIB,一种基于信息瓶颈原则的可扩展目标函数,通过在被遮蔽一个模态时对自信预测进行惩罚,来定位多模态学习中的协同信息,从而提升需要跨模态推理的任务的性能。
CL-DMDF:基于对比学习的动态多模态数据融合模型
本文提出了CL-DMDF,一种基于对比学习和双维度注意力机制的动态多模态数据融合模型,用于处理缺失模态并提升判别学习能力。
跨视觉、语言、视频和音频的多模态遗忘:方法、数据集和基准综述
对跨视觉、语言、视频和音频的多模态遗忘方法、数据集和基准的综合综述,提供了分类法并强调了未解决问题。