视觉对比自蒸馏
摘要
VCSD通过使用内容擦除的对照图像产生对比信号,消除了在策略自蒸馏中对外部教师、特权答案或视觉证据的需求,在视觉语言基准测试中持续优于现有方法。
查看缓存全文
缓存时间: 2026/07/24 05:06
论文页面 - 视觉对比自蒸馏
来源:https://huggingface.co/papers/2607.21556
摘要
在线自蒸馏(OPSD)前景广阔,因为它消除了在线蒸馏(OPD)所需的外部教师模型,但仍需在教师与学生之间保持信息不对称,以确保自教师能为学生提供比其自身更强的学习信号。现有方法通过特权答案或视觉证据来创建这种不对称性。我们研究是否可以将两者都去除,从而得到一种更简单、纯粹由输入条件驱动的OPSD形式。为此,我们提出了视觉对比自蒸馏(Visual Contrastive Self-Distillation,简称VCSD),该方法将图像内容去除转化为在线自蒸馏信号。在每个学生生成的响应前缀处,EMA教师在同一提示和前缀下生成两个下一个词元分布——一个以原始图像为条件,另一个以内容擦除后的控制版本为条件。两者逐词元的对数概率差异突显了那些因实例级视觉内容而可能性显著增加的候选词。我们利用这种对比来锐化教师原始图像分布在其合理支持集内的概率,并将由此产生的全分布目标蒸馏到学生中。使用ViRL39K数据集,VCSD在Qwen3-VL和Qwen3.5模型上持续优于匹配的OPSD方法。例如,在Qwen3-VL上,它将七个基准测试的聚合得分从62.27%提升至67.04%(2B模型),从71.30%提升至73.16%(4B模型),从72.51%提升至76.26%(8B模型)。此外,VCSD不需要外部教师、特权答案、视觉证据信号、推理轨迹或额外的推理时间成本。
查看arXiv页面 (https://arxiv.org/abs/2607.21556) 查看PDF (https://arxiv.org/pdf/2607.21556) 项目页面 (https://joliang17.github.io/VisualCSD/) GitHub (https://github.com/joliang17/VCSD) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.21556)
在您的代理中获取此论文:
hf papers read 2607.21556
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接到此论文
在模型README.md中引用arxiv.org/abs/2607.21556以从此页面链接。
引用此论文的数据集0
没有数据集链接到此论文
在数据集README.md中引用arxiv.org/abs/2607.21556以从此页面链接。
引用此论文的Space0
没有Space链接到此论文
在Space README.md中引用arxiv.org/abs/2607.21556以从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection)以从此页面链接。
相似文章
基于噪声学生在线策略自蒸馏的自增强视觉语言模型
提出NOPD,一种自蒸馏方法,通过利用干净输入和损坏输入之间的预测差异,在没有外部监督的情况下改进视觉语言模型。在视觉推理任务上取得了显著提升,匹配或超过了强化学习和来自外部模型的蒸馏。
@sheriyuo: Qwen Tongyi Lab提出RLCSD,一个关于同策略自蒸馏的简单但重要的批评。他们的关键观察是…
Qwen Tongyi Lab提出RLCSD以解决同策略自蒸馏中的风格漂移问题,该问题中学习信号集中在风格标记上,而非任务关键推理标记。他们的方法使用对比监督来聚焦于任务相关标记,在推理基准测试中取得了相较先前方法一致的改进。
自监督视觉在线策略蒸馏
本文介绍了S^2VOPD,一种自监督方法,通过将原始图像蒸馏到强增强的学生视图中,改进视觉语言模型,在基准测试中性能超越GPT-5.4。
OPD-V:具有模态平衡的视觉在策略自蒸馏
介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。
VAD:多模态在线策略蒸馏中用于目标重建的视觉证据归因
介绍了视觉归因蒸馏(VAD),这是一种用于多模态在线策略蒸馏的反事实目标重建方法,可估计教师纠正中可归因于视觉的部分。在4B和9B规模下的细粒度视觉基准测试中,该方法优于现有方法。