SCOPD:用于高效视觉语言模型的稀疏上下文在策略自蒸馏
摘要
SCOPD引入了一个稀疏上下文在策略自蒸馏框架,通过改进对剪枝后视觉token的利用来提升视觉语言模型的效率,在无额外推理成本的情况下实现了更高的性能保留。
查看缓存全文
缓存时间: 2026/09/29 16:11
论文页面 - SCOPD:基于稀疏上下文的策略内自蒸馏实现高效视觉-语言模型
来源:https://huggingface.co/papers/2609.34044
作者:
摘要
推理视觉-语言模型(VLMs)将图像和视频处理为长序列的视觉token,导致推理成本高昂。无需训练的token剪枝技术可以降低这一成本,但过度压缩会显著降低性能,通常归因于任务相关视觉信息的不可逆丢失。我们发现这种解释并不完整。在固定上下文Pass@K分析中,从同一剪枝视觉表示中重复采样能够恢复贪心解码遗漏的许多案例,表明有用的视觉证据可能仍然存在但未被可靠使用。我们将此称为表示-利用差距。基于此观察,我们提出SCOPD——一种稀疏上下文策略内自蒸馏框架,其中学生模型从剪枝的视觉token生成推理轨迹,而享有完整上下文特权的教师模型监督相同的策略内前缀。SCOPD无需真实响应、架构更改或额外的推理时计算。我们进一步引入SCOPD+,通过小规模视觉预算干预来识别对视觉敏感的响应位置,并选择性地蒸馏这些部分。在10%视觉token保留率下,Vanilla模型在13个基准测试中保留了未剪枝性能的86.37%。SCOPD将其提升至90.49%,而SCOPD+进一步改善至92.43%。在不同token预算、基准测试和剪枝算子下,我们的结果表明高效推理不仅取决于哪些视觉信息在剪枝后保留,还取决于模型学会可靠地使用这些信息的程度。
查看arXiv页面(https://arxiv.org/abs/2609.34044)查看PDF(https://arxiv.org/pdf/2609.34044)项目页面(https://armenjeddi.github.io/scopd/)GitHub0(https://github.com/Enmingzz/scopd-repo)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.34044)
引用本文的模型0
暂无模型链接本文
在模型README.md中引用arxiv.org/abs/2609.34044以从本页面链接。
引用本文的数据集0
暂无数据集链接本文
在数据集README.md中引用arxiv.org/abs/2609.34044以从本页面链接。
引用本文的空间0
暂无空间链接本文
在空间README.md中引用arxiv.org/abs/2609.34044以从本页面链接。
包含本文的收藏0
暂无收藏包含本文
将本文添加到收藏(https://huggingface.co/new-collection)以从本页面链接。
相似文章
自监督视觉在线策略蒸馏
本文介绍了S^2VOPD,一种自监督方法,通过将原始图像蒸馏到强增强的学生视图中,改进视觉语言模型,在基准测试中性能超越GPT-5.4。
基于噪声学生在线策略自蒸馏的自增强视觉语言模型
提出NOPD,一种自蒸馏方法,通过利用干净输入和损坏输入之间的预测差异,在没有外部监督的情况下改进视觉语言模型。在视觉推理任务上取得了显著提升,匹配或超过了强化学习和来自外部模型的蒸馏。
OPD-V:具有模态平衡的视觉在策略自蒸馏
介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。
更少的令牌,更多的自我教学:极端视觉令牌缩减的策略内自蒸馏
本文提出了LT-OPD,一个用于多模态大语言模型中极端视觉令牌缩减的策略内自蒸馏框架,在低令牌预算下显著提升性能,同时减少KV缓存使用和FLOPs。
dOPSD:扩散语言模型中的在线策略自蒸馏方法
本文介绍了 dOPSD,一种面向扩散语言模型的在线策略自蒸馏方法,该方法利用内部去噪轨迹来提升数学推理和代码生成能力。