自监督视觉在线策略蒸馏

Hugging Face Daily Papers 论文

摘要

本文介绍了S^2VOPD,一种自监督方法,通过将原始图像蒸馏到强增强的学生视图中,改进视觉语言模型,在基准测试中性能超越GPT-5.4。

视觉在线策略蒸馏严重依赖于信息性的教师-学生不对称性,这可以通过更大的、更强的教师模型或特权监督来实现,例如参考答案或真实兴趣区域。这引发了一个基本问题:当没有特权信息可用时,信息性的不对称性从何而来?我们通过颠倒不对称性的来源来回答这个问题。我们不是向教师添加特权信息,而是从学生中减去信息。这种不对称性免费创造了与能够访问学生无法获取的信息的教师相同的有效学习信号,而不需要真实标注、奖励或单独的更强教师模型。基于这一原理,我们引入了自监督视觉在线策略蒸馏(S^2VOPD),这是一种简单而有效的方法,通过非对称增强视图构建在线策略学习信号。S^2VOPD 将教师在原始图像条件下的分布在线蒸馏到学生在相同图像的强增强视图条件下的分布。我们系统地探索了视觉增强的广泛设计空间,并发现:(1)不对称性很重要:所有四个增强族都能提高性能,而对称自蒸馏则会降低性能;(2)强度很重要:性能在中等强度时达到峰值;(3)差距必须保持任务一致性:完全移除问题相关证据的增强可能引起大但无信息的差异。在六个细粒度感知基准测试上,S^2VOPD 将 Qwen3.5-4B 从 70.7% 提高到 77.4%,高于所有比较的开源模型,最高到 Qwen3-VL 的 235B,并超越了 GPT-5.4。在保持训练数据不变的情况下,它恢复了 96% 的特权信息方法所实现的改进。网站位于 https://williamium3000.github.io/s2vopd
查看原文
查看缓存全文

缓存时间: 2026/08/17 11:46

论文页面 - 自监督视觉在策略蒸馏

来源:https://huggingface.co/papers/2608.14144

摘要

自监督视觉在策略蒸馏通过将原始图像蒸馏到强增强的学生视图中,无需特权标注或更大的教师模型,从而提升小型视觉-语言模型的性能。

视觉在策略蒸馏 (https://huggingface.co/papers?q=Visual%20on-policy%20distillation) 在很大程度上依赖于具有信息量的教师-学生不对称性 (https://huggingface.co/papers?q=teacher-student%20asymmetry),这种不对称性要么通过更大、更强的教师模型,要么通过特权监督 (https://huggingface.co/papers?q=privileged%20supervision)(例如参考答案或真实兴趣区域)来实现。这引发了一个根本性的问题:当没有任何特权信息可用时,信息性不对称从何而来?我们通过反转不对称性的来源来回答这个问题。我们不是向教师添加特权信息,而是从学生那里减去信息。这种不对称性免费创建了与能够访问学生无法获取信息的教师相同的有效学习信号,无需真实标注、奖励或单独的更强教师模型。基于这一原则,我们提出了自监督视觉在策略蒸馏 (https://huggingface.co/papers?q=Self-Supervised%20Visual%20On-Policy%20Distillation) (S²VOPD),这是一种简单而有效的方法,它从不对称增强视图 (https://huggingface.co/papers?q=asymmetric%20augmented%20views) 中构建在策略学习信号。S²VOPD 将教师在原始图像条件下的分布,在策略地蒸馏到学生在同一图像的强增强视图条件下的分布。我们系统地探索了广泛的视觉增强设计空间,并发现:(1)不对称性很重要:所有四个增强族都能提高性能,而对称自蒸馏 (https://huggingface.co/papers?q=self-distillation) 则会降低性能;(2)强度很重要:性能在中等强度时达到峰值;(3)差距必须保持任务一致性:完全移除与问题相关证据的增强可能引发大但信息量不高的差异。在六个细粒度感知 (https://huggingface.co/papers?q=fine-grained%20perception) 基准测试中,S²VOPD 将 Qwen3.5-4B 从 70.7% 提升至 77.4%,优于所有比较的开源模型,最高可达 235B 参数的 Qwen3-VL,并超越了 GPT-5.4。在保持训练数据不变的情况下,它恢复了使用特权信息的方法所实现改进的 96%。项目网站为 https://williamium3000.github.io/s2vopd

查看 arXiv 页面 (https://arxiv.org/abs/2608.14144) 查看 PDF (https://arxiv.org/pdf/2608.14144) 项目页面 (https://williamium3000.github.io/s2vopd/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.14144)

在您的代理中获取此论文:

hf papers read 2608.14144

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文。

在模型 README.md 中引用 arxiv.org/abs/2608.14144 以从此页面链接它。

引用此论文的数据集0

没有数据集链接此论文。

在数据集 README.md 中引用 arxiv.org/abs/2608.14144 以从此页面链接它。

引用此论文的空间0

没有空间链接此论文。

在空间 README.md 中引用 arxiv.org/abs/2608.14144 以从此页面链接它。

包含此论文的收藏集0

没有收藏集包含此论文。

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

基于噪声学生在线策略自蒸馏的自增强视觉语言模型

arXiv cs.LG

提出NOPD,一种自蒸馏方法,通过利用干净输入和损坏输入之间的预测差异,在没有外部监督的情况下改进视觉语言模型。在视觉推理任务上取得了显著提升,匹配或超过了强化学习和来自外部模型的蒸馏。

OPD-V:具有模态平衡的视觉在策略自蒸馏

Hugging Face Daily Papers

介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。

Weak-to-Strong On-Policy Distillation

arXiv cs.LG

介绍了 Weak-to-Strong On-Policy Distillation(W2S-OPD)框架,该框架通过使用对比对在 logit 空间中对多个较弱模型进行蒸馏,从而改进强语言模型,在数学和代码基准测试上始终优于标准同策略蒸馏。

无需任何监督的同策略自蒸馏

Hugging Face Daily Papers

介绍了U-OPSD,一种无监督的同策略自蒸馏方法,利用内部一致性和多数投票伪解决方案来改进大语言模型,无需外部监督,在数学基准上达到或超过有监督方法。

学会预见:揭示 On-Policy 蒸馏效率的解锁机制

arXiv cs.CL

本文研究了大型语言模型中 On-Policy 蒸馏(OPD)效率背后的参数级机制,将其归因于模块分配和更新方向上的早期“预见性”。本文提出了 EffOPD,一种即插即用方法,可在不损害最终性能的情况下将 OPD 训练速度提高 3 倍。