信息论分解用于多模态交互学习

arXiv cs.LG 论文

摘要

本文提出一种多模态学习的信息论分析,揭示了捕捉样本特定交互的必要性,并提出了DMIL范式,通过变分分解和微调显式建模和学习这些交互,实现了优越性能。

arXiv:2606.11614v1 公告类型:新 摘要:多模态学习依赖于跨模态的冗余、独特和协同信息,这些信息共同构成多模态交互。一个关键但未被充分探索的挑战是,这些隐式交互在不同样本之间动态变化。在这项工作中,我们首次进行了系统的信息论分析,突出了为什么学习这些动态的、样本特定的交互对于有效的多模态学习至关重要。我们的分析进一步揭示了传统范式在学习这些不同交互类型方面的缺陷:模态集成方法难以捕捉协同,而联合学习范式往往未能充分利用冗余信息。这凸显了需要一种能够基于每个样本自适应地学习不同交互类型的方法。为此,我们提出了基于分解的多模态交互学习(DMIL),一种新颖的范式,显式建模并从样本特定交互中学习。首先,我们设计了一个变分分解架构来分离组成交互组件。其次,我们采用了一种新的学习策略,在微调过程中利用这些显式的交互组件来实现全面的交互学习。在多种任务和架构上的广泛实验表明,DMIL通过适应整体样本特定交互,始终实现了优越的性能。我们的框架灵活且广泛适用,建立了一种以交互为中心的多模态学习范式。代码可在 https://github.com/GeWu-Lab/DMIL 获取。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:49

# 多模态交互学习的信息论分解
来源:https://arxiv.org/abs/2606.11614
查看PDF (https://arxiv.org/pdf/2606.11614)

> 摘要:多模态学习的关键在于捕捉跨模态的冗余、独特和协同信息,这些信息共同构成了多模态交互。一个关键但尚未充分探索的挑战是,这些隐式交互在不同样本间动态变化。在本工作中,我们首次进行了系统性的信息论分析,阐明了学习这些动态、样本特定的交互对于有效多模态学习至关重要。我们的分析进一步揭示了传统范式在学习这些不同交互类型方面的缺陷:模态集成方法难以捕捉协同信息,而联合学习范式往往未能充分利用冗余信息。这凸显了一种能够逐样本自适应学习不同交互类型的方法的必要性。为此,我们提出了基于分解的多模态交互学习(DMIL),一种显式建模并学习样本特定交互的新范式。首先,我们设计了一种变分分解架构来分离组成交互分量。其次,我们采用一种新的学习策略,在微调过程中利用这些显式交互分量来实现全面的交互学习。跨多种任务和架构的大量实验表明,DMIL 通过适应全面的样本特定交互,始终取得更优性能。我们的框架灵活且广泛适用,建立了一种以交互为中心的多模态学习范式。代码可在此 https URL (https://github.com/GeWu-Lab/DMIL) 获取。

## 提交历史

来自:Zequn Yang [查看邮箱 (https://arxiv.org/show-email/cb896b1a/2606.11614)] **[v1]** 2026年6月10日星期三 03:27:13 UTC (3,575 KB)

相似文章

模态如何共同学习(49分钟阅读)

TLDR AI

来自Meta FAIR、Reality Labs和牛津大学的一项关于多模态预训练的系统性研究,揭示了模态之间的不对称知识流动、协同与竞争动态、早期统一的益处,以及通过13.5B MoE模型验证的高效训练方案。

SynIB:多模态学习中最大化协同的信息瓶颈

arXiv cs.LG

本文介绍了SynIB,一种基于信息瓶颈原则的可扩展目标函数,通过在被遮蔽一个模态时对自信预测进行惩罚,来定位多模态学习中的协同信息,从而提升需要跨模态推理的任务的性能。