视觉对比自蒸馏

Hugging Face Daily Papers 论文

摘要

VCSD通过使用内容擦除的对照图像产生对比信号,消除了在策略自蒸馏中对外部教师、特权答案或视觉证据的需求,在视觉语言基准测试中持续优于现有方法。

在策略自蒸馏(OPSD)很有前景,因为它去除了在策略蒸馏(OPD)所需的外部教师,但仍需要教师和学生之间的不对称信息,以确保自教师提供的学习信号强于学生。现有方法通过特权答案或视觉证据来创建这种不对称性。我们探讨是否两者都可以去除,从而得到一种更简单的、仅由输入条件驱动的OPSD形式。为此,我们提出了视觉对比自蒸馏,即VCSD,它将图像内容移除转化为在策略自蒸馏信号。在每个学生生成的响应前缀处,EMA教师在相同的提示和前缀下生成两个下一个词元的分布——一个以原始图像为条件,另一个以内容擦除的对照图像为条件。它们逐词元的对数概率差异突出了那些由实例级视觉内容特别提高可能性的候选词。我们利用这种对比来在教师的合理支持范围内锐化其原始图像分布,并将得到的完整分布目标蒸馏到学生中。使用ViRL39K数据集,VCSD在Qwen3-VL和Qwen3.5模型上持续优于匹配的OPSD。例如,在Qwen3-VL上,它将七个基准的聚合分数从2B规模的62.27%提升至67.04%,4B规模从71.30%提升至73.16%,8B规模从72.51%提升至76.26%。此外,VCSD不需要外部教师、特权答案、视觉证据信号、推理轨迹或额外的推理时间开销。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:06

论文页面 - 视觉对比自蒸馏

来源:https://huggingface.co/papers/2607.21556

摘要

在线自蒸馏(OPSD)前景广阔,因为它消除了在线蒸馏(OPD)所需的外部教师模型,但仍需在教师与学生之间保持信息不对称,以确保自教师能为学生提供比其自身更强的学习信号。现有方法通过特权答案或视觉证据来创建这种不对称性。我们研究是否可以将两者都去除,从而得到一种更简单、纯粹由输入条件驱动的OPSD形式。为此,我们提出了视觉对比自蒸馏(Visual Contrastive Self-Distillation,简称VCSD),该方法将图像内容去除转化为在线自蒸馏信号。在每个学生生成的响应前缀处,EMA教师在同一提示和前缀下生成两个下一个词元分布——一个以原始图像为条件,另一个以内容擦除后的控制版本为条件。两者逐词元的对数概率差异突显了那些因实例级视觉内容而可能性显著增加的候选词。我们利用这种对比来锐化教师原始图像分布在其合理支持集内的概率,并将由此产生的全分布目标蒸馏到学生中。使用ViRL39K数据集,VCSD在Qwen3-VL和Qwen3.5模型上持续优于匹配的OPSD方法。例如,在Qwen3-VL上,它将七个基准测试的聚合得分从62.27%提升至67.04%(2B模型),从71.30%提升至73.16%(4B模型),从72.51%提升至76.26%(8B模型)。此外,VCSD不需要外部教师、特权答案、视觉证据信号、推理轨迹或额外的推理时间成本。

查看arXiv页面 (https://arxiv.org/abs/2607.21556) 查看PDF (https://arxiv.org/pdf/2607.21556) 项目页面 (https://joliang17.github.io/VisualCSD/) GitHub (https://github.com/joliang17/VCSD) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.21556)

在您的代理中获取此论文:

hf papers read 2607.21556

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接到此论文

在模型README.md中引用arxiv.org/abs/2607.21556以从此页面链接。

引用此论文的数据集0

没有数据集链接到此论文

在数据集README.md中引用arxiv.org/abs/2607.21556以从此页面链接。

引用此论文的Space0

没有Space链接到此论文

在Space README.md中引用arxiv.org/abs/2607.21556以从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection)以从此页面链接。

相似文章

基于噪声学生在线策略自蒸馏的自增强视觉语言模型

arXiv cs.LG

提出NOPD,一种自蒸馏方法,通过利用干净输入和损坏输入之间的预测差异,在没有外部监督的情况下改进视觉语言模型。在视觉推理任务上取得了显著提升,匹配或超过了强化学习和来自外部模型的蒸馏。

自监督视觉在线策略蒸馏

Hugging Face Daily Papers

本文介绍了S^2VOPD,一种自监督方法,通过将原始图像蒸馏到强增强的学生视图中,改进视觉语言模型,在基准测试中性能超越GPT-5.4。

OPD-V:具有模态平衡的视觉在策略自蒸馏

Hugging Face Daily Papers

介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。