大型语言模型教导视觉学生:细粒度概念知识的跨模态迁移
摘要
本文介绍了LaViD框架,该框架通过生成多项选择题作为概念签名,将语义知识从纯语言大语言模型转移到视觉学生模型,实现了优越的细粒度分类性能和鲁棒性。
arXiv:2606.27527v1 Announce Type: cross
摘要:大型语言模型(LLMs)通过大规模文本预训练获得了广泛的概念知识,但其在监督其他模态模型方面的潜力仍未得到充分探索。在这项工作中,我们提出了LaViD——语言到视觉知识蒸馏(Language-to-Visual Knowledge Distillation)——一个简单而有效的框架,用于将高级语义知识从纯语言教师模型转移到纯视觉学生模型。LaViD不依赖于配对的多模态数据,而是通过提示LLM生成探测视觉类别间语义差异的多项选择题(MCQ)来激发概念信号。每个类别被映射到这些MCQ上的软标签分布,形成一个丰富的概念签名,通过辅助蒸馏损失指导学生模型。值得注意的是,尽管使用了一个无法访问图像数据的纯语言教师,LaViD在多个细粒度基准上始终优于最近的方法(如从视觉-语言模型蒸馏的MaKD)。与最先进的视觉蒸馏方法(如DKD和MLKD)相比,LaViD也取得了有竞争力或更优的性能,并且在与logit标准化结合时获得了进一步提升。在Waterbirds数据集上,LaViD大幅提高了最差组准确率,展示了通过蒸馏增强对虚假相关性的鲁棒性。代码可在https://github.com/lliangthomas/lavid获取。
查看缓存全文
缓存时间: 2026/06/29 05:28
# 大语言模型教授视觉学生:细粒度概念知识的跨模态迁移
来源:https://arxiv.org/html/2606.27527
###### 摘要
大语言模型(LLMs)通过大规模文本预训练获得了广泛的概念知识,但其在监督其他模态模型方面的潜力仍未被充分探索。在这项工作中,我们提出LaViD——语言到视觉知识蒸馏(Language\-to\-Visual Knowledge Distillation)——一个简单而有效的框架,用于将高层语义知识从纯语言教师模型迁移到纯视觉学生模型。LaViD不依赖成对的多模态数据,而是通过提示LLM生成探索视觉类别间语义差异的多选题(MCQs)来激发概念信号。每个类别都被映射到这些MCQ上的软标签分布,形成一个丰富的概念签名,通过辅助蒸馏损失来指导学生。值得注意的是,尽管使用了无法访问图像数据的纯语言教师,LaViD在多个细粒度基准测试中始终优于近期的方法(如从视觉语言模型蒸馏的MaKD)。与最先进的视觉蒸馏方法(如DKD和MLKD)相比,它也达到了有竞争力或更优的性能,并在结合logit标准化时获得进一步提升。在Waterbirds数据集上,LaViD显著提升了最差组准确率,展示了通过蒸馏增强对虚假相关性的鲁棒性。代码可访问 https://github.com/lliangthomas/lavid。
机器学习, ICML, 知识蒸馏, 跨模态学习, 细粒度视觉分类, 大语言模型
## 1 引言
知识蒸馏(KD)(buciluǎ2006model; Hinton et al., 2015; Romero et al., 2014) 是一种将知识从大型教师模型迁移到较小学生模型的基础技术。这种方法 (Tian et al., 2019; Chen et al., 2022; Yang et al., 2021; Zhao et al., 2022; Hao et al., 2023) 通常需要一个数据集特定的教师模型,通过logits (Hinton et al., 2015; Tian et al., 2019; Hao et al., 2023; Sun et al., 2024; Zhao et al., 2022) 或教师的特征表示 (Romero et al., 2014; Chen et al., 2022; Zhang and Ma, 2020; Park et al., 2019; Tung and Mori, 2019) 来指导学生的学习过程。然而,这种对纯视觉监督的依赖通常不足以应对细粒度视觉分类,因为模型需要辨别微妙的类间差异,并且容易过拟合到虚假的背景相关性,而不是学习稳健的特征。
大语言模型(LLMs)的发展 (Touvron et al., 2023a; Grattafiori et al., 2024; Touvron et al., 2023b; Chowdhery et al., 2023; Brown et al., 2020; Yang et al., 2024; Raffel et al., 2020) 彻底改变了这个领域。大型语言模型中编码的知识特别有趣之处在于其概念性质:它通常超越了它所训练的文本模态。例如,用语言描述一只“猫”——“一种有尖耳朵和胡须的小型毛茸茸动物”——与在图像中视觉识别猫具有相同的概念意义。尽管输入的模态不同(文本与图像),但“猫性”这一底层概念是相同的。这一观察表明,存储在LLM中的知识并不局限于语言,而是反映了通用的、与模态无关的概念,正如 (Hu et al., 2024) 中所假设的那样。这引发了一个引人深思的问题:这种纯粹编码在文本中的概念知识,能否被迁移来指导视觉学习?
在这项工作中,我们引入了语言到视觉知识蒸馏(LaViD),这是一种简单而有效的方法,将通用知识从纯文本大语言模型(LLMs)蒸馏到视觉学生模型中。LaViD不依赖成对的多模态数据或任务特定的监督,而是利用LLM中编码的广泛世界知识来提供概念指导。它通过多选题来激发结构化和可解释的信号,这些多选题探索类别之间的语义差异。这使得视觉模型不仅可以从标记数据中学习,还可以从外部文本知识中学习——无需对齐的输入,就弥合了语言和视觉之间的鸿沟。
LaViD通过两阶段过程从纯语言教师中蒸馏概念知识到视觉学生模型。首先,我们使用数据集元数据提示LLM生成探索类间语义差异的多选题(MCQs)。每个问题包含一个占位符 token(),该 token 被替换为每个类别的名称以实例化特定类别的提示。提取LLM在答案选项上的预softmax logits,并将其归一化为软标签分布,形成每个类别的语义签名。接下来,学生处理输入图像并预测与LLM问题空间对齐的辅助logits。训练最小化标准分类损失以及学生辅助预测与LLM派生目标之间的均方误差(MSE)损失。
LaViD的核心直觉在于,LLM编码了结构化的世界知识,使它们能够表达类别之间细微的概念关系。通过用类别特定的多选题提示LLM,我们激发语义差异——例如颜色、形状或行为——这些差异定义了不同类别在概念层面上的关系。由此产生的logits提供了类间相似性和差异的结构化视图,我们将其用作监督来指导学生模型。与固定的类别嵌入或相似性目标不同,这些概念签名跨由不同问题诱导的多个语义维度进行结构化,提供比传统标签平滑或表示匹配更丰富的关联监督。这个信号促使学生围绕有意义的属性组织其内部表示,促进超越死记硬背类别标签的更深层泛化。
我们在六个细粒度分类基准上评估LaViD,发现它始终优于传统的KD方法和基于多模态LLM的基线。值得注意的是,尽管使用了无法访问图像数据的纯语言教师,LaViD超越了最近的方法MaKD (Lee et al., 2025)(该方法从视觉语言模型InternVL (Chen et al., 2024) 蒸馏)。与最先进的KD方法如DKD (Zhao et al., 2022) 和MLKD (Jin et al., 2023) 相比,它也取得了有竞争力或更优的性能,并且可以进一步与logit标准化 (Sun et al., 2024) 结合以获得额外收益。除了准确率之外,我们证明LaViD减轻了数据集偏差:在Waterbirds数据集 (Sagawa et al., 2019) 上,它显著提高了最差组准确率,表明了对虚假相关性的鲁棒性有所提升。大量的消融研究进一步验证了我们的设计选择的重要性,包括使用MCQ、LLM及其语义结构。
## 2 相关工作
**知识蒸馏**。知识蒸馏(KD)通常关注于将知识从较大的教师迁移到较小的学生 (buciluǎ2006model; Hinton et al., 2015)。在单模态设置中,此过程发生在同一模态内,早期工作侧重于匹配logits (Hinton et al., 2015) 或中间特征 (Romero et al., 2014)。后来的研究将KD扩展到异构架构 (Liu et al., 2022; Zhu et al., 2023),并在教师-学生性能差距较大时展示了更大的收益 (Huang et al., 2022; Fan et al., 2024)。然而,传统的KD通常需要训练一个数据集特定的教师,这增加了计算开销并有转移数据集偏差的风险 (Ojha et al., 2023)。
**跨模态知识蒸馏**将监督信息跨越不同模态进行转移 (Xue et al., 2021, 2022; Garcia et al., 2018; Gupta et al., 2016)。这支持了开放词汇识别中的语义泛化,其中学生与文本嵌入对齐或利用CLIP的图像编码器 (Radford et al., 2021; Gu et al., 2021; Wu et al., 2023; Xu et al., 2023)。与这些依赖成对输入或多模态编码器的方法不同,LaViD在无需配对数据、模态对齐或共享嵌入空间的情况下,将通用世界知识从纯语言教师蒸馏到纯视觉学生。
**细粒度分类**。细粒度视觉分类侧重于区分更广泛的元类中的类别,通常包含微妙且具有挑战性的类间差异。通常,这些方法分为定位(显式判别区域)(Ge et al., 2019; Wang et al., 2020b; Schmidt et al., 2025) 和特征编码(隐式或概念差异)(Lin et al., 2017; Zheng et al., 2019)。虽然DFKD-FGVC (Shao et al., 2024) 最近提出了一种用于细粒度任务的KD方法,但它仍然局限于同质教师-学生架构。我们的工作与众不同之处在于,我们证明了一个视觉学生可以直接从**概念知识**中学习这些细微区别,而无需对齐模态或同质教师。
## 3 方法
参考图标题
图1:LaViD的概览。**阶段#1**:使用类别元数据和名称提示LLM生成多样的多选题(MCQs),捕获高层语义差异。用每个类别实例化这些题目,提取答案选项上的软标签分布,形成每个类别的概念签名。**阶段#2**:学生通过视觉骨干网络和辅助头处理图像,预测与LLM问题空间对齐的logits。使用标准分类损失(未显示)和针对LLM派生目标的辅助MSE损失进行训练。
在本节中,我们介绍语言到视觉知识蒸馏(LaViD),这是一个将概念知识从**纯文本大语言模型(LLM)** 转移到**纯视觉学生模型**的框架。与依赖成对视觉-语言输入的多模态方法不同,LaViD仅从语言中提取结构化的语义监督来指导视觉表示学习。具体来说,LaViD通过结构化的语义查询从LLM中激发关系概念知识,并使学生与由此产生的多维类别关系对齐。虽然LaViD采用了蒸馏风格的目标,但它与传统知识蒸馏有根本区别,传统蒸馏从任务训练的教师中迁移实例级预测;相反,它将蒸馏重新定义为跨模态概念迁移的机制,将外部世界知识注入视觉学习者,而不是模仿教师输出。重要的是,LaViD中的概念目标每个类别是固定的,但跨由生成的问题诱导的多样语义维度进行结构化,这使其区别于仅捕获粗略相似性结构的类别嵌入或标签平滑方案。这种结构化的语义正则化鼓励视觉表示与有意义的概念因素对齐,我们发现在实践中这有助于提高对虚假相关性的鲁棒性。
### 3.1 概述
令X为数据集,其中X = {x_i}_{i=1}^N,x_i ∈ R^{3×H×W}表示大小为3×H×W的输入图像。令Y = {y_i}_{i=1}^N为对应的标签集,其中y_i ∈ {0,1}^k是第i个样本的独热编码类别标签,k是类别数。我们将总损失L定义为监督损失L_sup和蒸馏损失L_LaViD之和:
L = L_sup + λ L_LaViD
监督损失L_sup是标准的分类交叉熵损失:
L_sup = - (1/N) ∑_{i=1}^N ∑_{c=1}^k y_{i,c} log p(y_i = c | x_i)
其中p(y_i = c | x_i)是第i个样本属于类别c的预测概率。
参考图标题 参考图标题 参考图标题 参考图标题
Cardinal European Goldfinch American Goldfinch
图2:来自LLM监督的结构化语义。热图显示了两个问题的LLM logits,其中European Goldfinch在头部颜色上与Cardinal对齐(左),但在是否有冠羽上与American Goldfinch对齐(右)。这些模式提供了超越标准类别标签的关系监督。
### 3.2 从LLM中提取Logits
为了构建LaViD损失中使用的蒸馏目标,我们首先提示LLM生成一组多选题,探索类别之间的语义差异。然后,每个类别实例化这些题目,并用于查询LLM在答案选项上的logits。由此产生的分布作为训练期间指导学生模型的监督信号。我们强调,MCQ生成和logit提取每个数据集只执行一次(而不是每个训练样本),因此相较于学生训练,监督成本可以忽略不计,并且无需训练相似文章
看见还是知道?多模态大语言模型中的视觉上下文敏感性
本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。
从文本到视觉迁移了什么?VLM的能力缩放定律与迁移动态
本文提出了一种能力驱动的多模态缩放定律,该定律可从LLM文本基准能力预测VLM性能,从而在不进行昂贵训练扫描的情况下,实现跨模型家族的原则性骨干选择。
大型视觉-语言模型在注意力机制中迷失
这篇研究论文利用信息论分析了大型视觉-语言模型(LVLM)的内部机制,揭示了注意力机制可能存在冗余,而前馈网络才是推动语义创新的关键。作者证明,将学习到的注意力权重替换为随机值仍可获得相当的性能,这表明当前模型“在注意力中迷失”。
Switch-KD:面向视觉语言模型的视觉开关知识蒸馏
Switch-KD提出了一种新颖的视觉开关知识蒸馏框架,通过在共享的文本概率空间内统一多模态知识迁移,高效压缩视觉语言模型。该方法在将0.5B TinyLLaVA学生模型从3B教师模型中蒸馏时,在10个多模态基准测试上实现了平均3.6个百分点的提升。
LLaVA-UHD v4:高效视觉编码在 MLLMs 中的关键要素是什么?
本文介绍了 LLaVA-UHD v4,该模型通过采用基于切片(slice-based)的编码和 ViT 内部早期压缩,提高了多模态大语言模型中的视觉编码效率。它在保持或提升高分辨率图像任务性能的同时,将计算成本降低了 55% 以上。