自监督视觉在线策略蒸馏
摘要
本文介绍了S^2VOPD,一种自监督方法,通过将原始图像蒸馏到强增强的学生视图中,改进视觉语言模型,在基准测试中性能超越GPT-5.4。
查看缓存全文
缓存时间: 2026/08/17 11:46
论文页面 - 自监督视觉在策略蒸馏
来源:https://huggingface.co/papers/2608.14144
摘要
自监督视觉在策略蒸馏通过将原始图像蒸馏到强增强的学生视图中,无需特权标注或更大的教师模型,从而提升小型视觉-语言模型的性能。
视觉在策略蒸馏 (https://huggingface.co/papers?q=Visual%20on-policy%20distillation) 在很大程度上依赖于具有信息量的教师-学生不对称性 (https://huggingface.co/papers?q=teacher-student%20asymmetry),这种不对称性要么通过更大、更强的教师模型,要么通过特权监督 (https://huggingface.co/papers?q=privileged%20supervision)(例如参考答案或真实兴趣区域)来实现。这引发了一个根本性的问题:当没有任何特权信息可用时,信息性不对称从何而来?我们通过反转不对称性的来源来回答这个问题。我们不是向教师添加特权信息,而是从学生那里减去信息。这种不对称性免费创建了与能够访问学生无法获取信息的教师相同的有效学习信号,无需真实标注、奖励或单独的更强教师模型。基于这一原则,我们提出了自监督视觉在策略蒸馏 (https://huggingface.co/papers?q=Self-Supervised%20Visual%20On-Policy%20Distillation) (S²VOPD),这是一种简单而有效的方法,它从不对称增强视图 (https://huggingface.co/papers?q=asymmetric%20augmented%20views) 中构建在策略学习信号。S²VOPD 将教师在原始图像条件下的分布,在策略地蒸馏到学生在同一图像的强增强视图条件下的分布。我们系统地探索了广泛的视觉增强设计空间,并发现:(1)不对称性很重要:所有四个增强族都能提高性能,而对称自蒸馏 (https://huggingface.co/papers?q=self-distillation) 则会降低性能;(2)强度很重要:性能在中等强度时达到峰值;(3)差距必须保持任务一致性:完全移除与问题相关证据的增强可能引发大但信息量不高的差异。在六个细粒度感知 (https://huggingface.co/papers?q=fine-grained%20perception) 基准测试中,S²VOPD 将 Qwen3.5-4B 从 70.7% 提升至 77.4%,优于所有比较的开源模型,最高可达 235B 参数的 Qwen3-VL,并超越了 GPT-5.4。在保持训练数据不变的情况下,它恢复了使用特权信息的方法所实现改进的 96%。项目网站为 https://williamium3000.github.io/s2vopd
查看 arXiv 页面 (https://arxiv.org/abs/2608.14144) 查看 PDF (https://arxiv.org/pdf/2608.14144) 项目页面 (https://williamium3000.github.io/s2vopd/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.14144)
在您的代理中获取此论文:
hf papers read 2608.14144
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文。
在模型 README.md 中引用 arxiv.org/abs/2608.14144 以从此页面链接它。
引用此论文的数据集0
没有数据集链接此论文。
在数据集 README.md 中引用 arxiv.org/abs/2608.14144 以从此页面链接它。
引用此论文的空间0
没有空间链接此论文。
在空间 README.md 中引用 arxiv.org/abs/2608.14144 以从此页面链接它。
包含此论文的收藏集0
没有收藏集包含此论文。
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
基于噪声学生在线策略自蒸馏的自增强视觉语言模型
提出NOPD,一种自蒸馏方法,通过利用干净输入和损坏输入之间的预测差异,在没有外部监督的情况下改进视觉语言模型。在视觉推理任务上取得了显著提升,匹配或超过了强化学习和来自外部模型的蒸馏。
OPD-V:具有模态平衡的视觉在策略自蒸馏
介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。
Weak-to-Strong On-Policy Distillation
介绍了 Weak-to-Strong On-Policy Distillation(W2S-OPD)框架,该框架通过使用对比对在 logit 空间中对多个较弱模型进行蒸馏,从而改进强语言模型,在数学和代码基准测试上始终优于标准同策略蒸馏。
无需任何监督的同策略自蒸馏
介绍了U-OPSD,一种无监督的同策略自蒸馏方法,利用内部一致性和多数投票伪解决方案来改进大语言模型,无需外部监督,在数学基准上达到或超过有监督方法。
学会预见:揭示 On-Policy 蒸馏效率的解锁机制
本文研究了大型语言模型中 On-Policy 蒸馏(OPD)效率背后的参数级机制,将其归因于模块分配和更新方向上的早期“预见性”。本文提出了 EffOPD,一种即插即用方法,可在不损害最终性能的情况下将 OPD 训练速度提高 3 倍。