无配对数据的跨模态知识蒸馏:理论基础与算法

arXiv cs.AI 论文

摘要

本文提出了一种无需配对数据的跨模态知识蒸馏框架,通过对齐特征分布与标签分布,提供了理论保证,并在多模态基准测试中优于先前方法。

arXiv:2606.10504v1 公告类型:新 摘要:跨模态知识蒸馏(CMKD)研究如何将在一个数据类型(如图像)上训练的(大型)教师模型,指导构建在另一个数据类型(如文本/音频)上的(较小)学生模型。现有的CMKD方法通常需要具有对齐语义的配对多模态数据,但获取此类配对数据往往成本高昂且不切实际。为缓解这一限制,我们针对更困难的未配对数据设置,开发了一种新的CMKD框架。具体而言,我们建立了教师模型与学生模型之间的跨模态分布关系,揭示了有效蒸馏的两个基本量:特征对齐和标签对齐。这些量分别从表示分布和预测分布层面刻画了模态间的语义差异。受此启发,我们提出了一个具有理论保证的原则性框架,通过对齐分布而非单个样本来实现有效的跨模态知识蒸馏。在广泛的多模态基准测试上进行的大量实验表明,我们的框架在未配对和配对数据设置中均非常有效,显著优于先前的工作。
查看原文
查看缓存全文

缓存时间: 2026/06/10 06:15

# 跨模态知识蒸馏无需配对数据:理论基础与算法
来源:https://arxiv.org/abs/2606.10504
查看PDF(https://arxiv.org/pdf/2606.10504)

> 摘要:跨模态知识蒸馏(CMKD)研究如何利用在一种数据类型(如图像)上训练的(大型)教师模型来指导建立在另一种数据类型(如文本/音频)上的(较小)学生模型。现有的CMKD方法通常需要具有对齐语义的配对多模态数据,但获取此类配对数据往往成本高昂且不切实际。为缓解这一局限,我们针对更困难的未配对数据场景开发了一种新的CMKD框架。具体而言,我们建立了教师模型与学生模型之间的跨模态分布关系,揭示了有效蒸馏的两个基本量:特征对齐与标签对齐。这两个量分别从表征和预测分布层面刻画了模态间的语义差异。受此洞察启发,我们提出一个具有理论保证的原则性框架,通过对齐分布而非单个样本实现有效的跨模态知识蒸馏。在广泛的多模态基准上的大量实验表明,我们的框架在未配对和配对数据设置下均非常有效,显著超越了先前工作。

## 提交历史

来自:Khiem Tran Trong [查看电子邮件(https://arxiv.org/show-email/9b266a36/2606.10504)] **[v1]** 2026年6月9日星期二 07:29:12 UTC(1,693 KB)

相似文章

基于理据引导的知识蒸馏跨语言立场检测

arXiv cs.CL

本文提出了一种基于理据引导的知识蒸馏框架,用于跨语言立场检测,利用大型语言模型的思维链提示,通过双路径蒸馏和对比学习训练一个紧凑的学生模型。

Switch-KD:面向视觉语言模型的视觉开关知识蒸馏

Hugging Face Daily Papers

Switch-KD提出了一种新颖的视觉开关知识蒸馏框架,通过在共享的文本概率空间内统一多模态知识迁移,高效压缩视觉语言模型。该方法在将0.5B TinyLLaVA学生模型从3B教师模型中蒸馏时,在10个多模态基准测试上实现了平均3.6个百分点的提升。

让知识蒸馏的成本低到足以大规模运行

Hugging Face Blog

Multiverse Computing 发布了一篇论文,介绍如何通过离线 top-K logits 和融合的分块 KL 损失来降低 LLM 知识蒸馏的成本,从而减少大规模蒸馏时的显存占用。

知识蒸馏对小型语言模型偏见的非对称影响

arXiv cs.CL

本文表明,知识蒸馏对小型语言模型中的偏见具有非对称影响:在无歧义任务上,它提升了上下文遵循能力,但在有歧义任务上却损害了拒答校准;并提出了PCCD,一种用于诊断聚合指标遗漏的逐项损害的协议。