SCOPD:用于高效视觉语言模型的稀疏上下文在策略自蒸馏

Hugging Face Daily Papers 论文

摘要

SCOPD引入了一个稀疏上下文在策略自蒸馏框架,通过改进对剪枝后视觉token的利用来提升视觉语言模型的效率,在无额外推理成本的情况下实现了更高的性能保留。

推理型视觉语言模型(VLMs)将图像和视频处理为长序列的视觉token,导致推理成本高昂。无需训练的token剪枝可以降低成本,但激进的压缩可能导致性能急剧下降,这通常归因于任务相关视觉信息的不可逆丢失。我们表明这一解释并不完整。在固定上下文Pass@K分析中,从相同的剪枝视觉表示中重复采样可以恢复许多被贪婪解码遗漏的示例,表明有用的视觉证据可能仍然可访问但使用不可靠。我们将此称为表示-利用差距。基于这一观察,我们引入了SCOPD,一个稀疏上下文在策略自蒸馏框架,其中学生从剪枝后的视觉token生成推理轨迹,而特权全上下文教师监督相同的在策略前缀。SCOPD不需要真实响应、架构更改或额外的推理时间计算。我们进一步引入了SCOPD+,它使用一个小的视觉预算干预来识别视觉敏感的响应位置并选择性地蒸馏它们。在10%视觉token保留率下,原始模型在13个基准测试中保留了其未剪枝性能的86.37%。SCOPD将此提升至90.49%,而SCOPD+进一步改善至92.43%。跨token预算、基准测试和剪枝操作符,我们的结果表明,高效推理不仅取决于哪些视觉信息在剪枝后保留下来,还取决于模型学会使用它的可靠性。
查看原文
查看缓存全文

缓存时间: 2026/09/29 16:11

论文页面 - SCOPD:基于稀疏上下文的策略内自蒸馏实现高效视觉-语言模型

来源:https://huggingface.co/papers/2609.34044
作者:

摘要

推理视觉-语言模型(VLMs)将图像和视频处理为长序列的视觉token,导致推理成本高昂。无需训练的token剪枝技术可以降低这一成本,但过度压缩会显著降低性能,通常归因于任务相关视觉信息的不可逆丢失。我们发现这种解释并不完整。在固定上下文Pass@K分析中,从同一剪枝视觉表示中重复采样能够恢复贪心解码遗漏的许多案例,表明有用的视觉证据可能仍然存在但未被可靠使用。我们将此称为表示-利用差距。基于此观察,我们提出SCOPD——一种稀疏上下文策略内自蒸馏框架,其中学生模型从剪枝的视觉token生成推理轨迹,而享有完整上下文特权的教师模型监督相同的策略内前缀。SCOPD无需真实响应、架构更改或额外的推理时计算。我们进一步引入SCOPD+,通过小规模视觉预算干预来识别对视觉敏感的响应位置,并选择性地蒸馏这些部分。在10%视觉token保留率下,Vanilla模型在13个基准测试中保留了未剪枝性能的86.37%。SCOPD将其提升至90.49%,而SCOPD+进一步改善至92.43%。在不同token预算、基准测试和剪枝算子下,我们的结果表明高效推理不仅取决于哪些视觉信息在剪枝后保留,还取决于模型学会可靠地使用这些信息的程度。

查看arXiv页面(https://arxiv.org/abs/2609.34044)查看PDF(https://arxiv.org/pdf/2609.34044)项目页面(https://armenjeddi.github.io/scopd/)GitHub0(https://github.com/Enmingzz/scopd-repo)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.34044)

引用本文的模型0

暂无模型链接本文

在模型README.md中引用arxiv.org/abs/2609.34044以从本页面链接。

引用本文的数据集0

暂无数据集链接本文

在数据集README.md中引用arxiv.org/abs/2609.34044以从本页面链接。

引用本文的空间0

暂无空间链接本文

在空间README.md中引用arxiv.org/abs/2609.34044以从本页面链接。

包含本文的收藏0

暂无收藏包含本文

将本文添加到收藏(https://huggingface.co/new-collection)以从本页面链接。

相似文章

自监督视觉在线策略蒸馏

Hugging Face Daily Papers

本文介绍了S^2VOPD,一种自监督方法,通过将原始图像蒸馏到强增强的学生视图中,改进视觉语言模型,在基准测试中性能超越GPT-5.4。

基于噪声学生在线策略自蒸馏的自增强视觉语言模型

arXiv cs.LG

提出NOPD,一种自蒸馏方法,通过利用干净输入和损坏输入之间的预测差异,在没有外部监督的情况下改进视觉语言模型。在视觉推理任务上取得了显著提升,匹配或超过了强化学习和来自外部模型的蒸馏。

OPD-V:具有模态平衡的视觉在策略自蒸馏

Hugging Face Daily Papers

介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。