VisCo:利用大语言模型作为视觉令牌压缩的内在编码器
摘要
VisCo是一个高效训练的自压缩框架,它重用预训练的视觉-语言模型作为视觉令牌压缩的内在编码器,在所有压缩比率下均实现优越性能,且无需外部模块。
查看缓存全文
缓存时间: 2026/07/27 05:39
论文页面 - VisCo:利用大语言模型作为视觉令牌压缩的内在编码器
来源:https://huggingface.co/papers/2607.12756
摘要
视觉-语言模型(VLMs)需要处理大量的视觉令牌,导致显著的推理延迟和内存开销。这促使人们对视觉令牌压缩进行了广泛研究。无训练策略依赖于启发式度量,在高压缩比下性能下降严重;而许多基于训练的方法引入外部压缩模块,迫使 VLM 主干网络进行适配,带来了高昂的重新训练成本,并损害了 VLM 的先前知识。有效的视觉令牌压缩依赖于强大的信息编码能力,这种能力已经存在于预训练的 VLM 中,但现有方法并未充分利用。受此启发,我们提出了 VisCo,一个训练高效的自我压缩框架,将预训练的 VLM 本身重新用作内在压缩器。VisCo 是一个参数共享的自编码器,使用少量记忆令牌压缩视觉信息,并将层级信息从编码阶段传递到解码阶段。实验表明,VisCo 在所有评估的压缩比下都超越了先前的方法,在更激进的压缩下取得了更大的增益,甚至在极端的单令牌设置下也保持稳定。此外,当与原始视觉令牌结合时,学习到的记忆令牌甚至能够提升基础模型的性能,表明 VisCo 捕捉到了压缩之外的互补表示。
查看 arXiv 页面 (https://arxiv.org/abs/2607.12756) 查看 PDF (https://arxiv.org/pdf/2607.12756) GitHub11 (https://github.com/Zyvpeng/VisCo) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.12756)
引用该论文的模型0
暂无模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.12756,以便从此页面链接该模型。
引用该论文的数据集0
暂无数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.12756,以便从此页面链接该数据集。
引用该论文的 Spaces0
暂无 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.12756,以便从此页面链接该 Space。
包含该论文的集合0
暂无集合包含此论文
将此论文添加到一个集合 (https://huggingface.co/new-collection) 中,以便从此页面链接它。
相似文章
ViCo:基于自我反思的视觉导向编码用于图表复制
ViCo是一个训练框架,使用迭代自我反思来改进AI生成的图表复制,在学术基准上实现了接近专有LLM的性能。
OmniScope:全模态大语言模型的模态解耦令牌压缩
OmniScope是一个面向全模态大语言模型的无训练令牌压缩框架,它使用查询作为共享锚点,分别评估音频和视频的相关性,实现了高达3.53倍的预填充加速和超过15%的GPU内存减少,且精度损失极小。
Stateful Visual Encoders for Vision-Language Models
本文介绍了一种用于视觉-语言模型的有状态视觉编码器,该编码器基于先前的特征来调节视觉表示,从而在多图像和智能体设置中实现更好的视觉比较。该方法在跨图像空间聚合、纵向放射学等任务上展现出一致的改进。
选择、压缩、再投资:长视频多模态语言模型中视觉令牌分配的控制性研究
本文对长视频多模态语言模型的视觉令牌分配进行了控制性研究,发现帧选择显著提升准确性,而空间压缩在节省的令牌重新投资到更多帧时几乎是免费的,强调了统一比较框架的必要性。
CaVe-VLM-CoT:一个可解释的视觉-语言模型框架
CaVe-VLM-CoT是一个基于模块化反思的智能体RAG框架,专为视觉-语言模型设计,通过五阶段流水线强制执行基于证据的推理,在ScienceQA上达到87.1%的准确率,并提出了一套包含23项指标的评估体系。