VisCo:利用大语言模型作为视觉令牌压缩的内在编码器

Hugging Face Daily Papers 论文

摘要

VisCo是一个高效训练的自压缩框架,它重用预训练的视觉-语言模型作为视觉令牌压缩的内在编码器,在所有压缩比率下均实现优越性能,且无需外部模块。

视觉-语言模型(VLM)处理大量视觉令牌,导致显著的推理延迟和内存开销。这推动了对视觉令牌压缩的大量研究。虽然免训练策略依赖于启发式指标,在高压缩比率下性能显著下降,但许多基于训练的方法引入外部压缩模块,迫使VLM主干网络适应,导致大量重新训练成本并损害VLM的先验知识。有效的视觉令牌压缩依赖于强大的信息编码能力,这种能力已存在于预训练的VLM中,但现有方法未能充分利用。受此启发,我们提出了VisCo,一种训练高效的自压缩框架,它将预训练的VLM本身重新用作内在压缩器。VisCo是一个参数共享的自编码器,通过少量记忆令牌压缩视觉信息,并将分层信息从编码传递到解码。实验表明,VisCo在所有评估的压缩比率上均超越了先前方法,在更激进的压缩下增益更大,甚至在极端的单令牌设置下也保持稳定。此外,当与原始视觉令牌结合时,学习到的记忆令牌甚至能改进基础模型,这表明VisCo捕获了超越压缩的互补表示。
查看原文
查看缓存全文

缓存时间: 2026/07/27 05:39

论文页面 - VisCo:利用大语言模型作为视觉令牌压缩的内在编码器

来源:https://huggingface.co/papers/2607.12756

摘要

视觉-语言模型(VLMs)需要处理大量的视觉令牌,导致显著的推理延迟和内存开销。这促使人们对视觉令牌压缩进行了广泛研究。无训练策略依赖于启发式度量,在高压缩比下性能下降严重;而许多基于训练的方法引入外部压缩模块,迫使 VLM 主干网络进行适配,带来了高昂的重新训练成本,并损害了 VLM 的先前知识。有效的视觉令牌压缩依赖于强大的信息编码能力,这种能力已经存在于预训练的 VLM 中,但现有方法并未充分利用。受此启发,我们提出了 VisCo,一个训练高效的自我压缩框架,将预训练的 VLM 本身重新用作内在压缩器。VisCo 是一个参数共享的自编码器,使用少量记忆令牌压缩视觉信息,并将层级信息从编码阶段传递到解码阶段。实验表明,VisCo 在所有评估的压缩比下都超越了先前的方法,在更激进的压缩下取得了更大的增益,甚至在极端的单令牌设置下也保持稳定。此外,当与原始视觉令牌结合时,学习到的记忆令牌甚至能够提升基础模型的性能,表明 VisCo 捕捉到了压缩之外的互补表示。

查看 arXiv 页面 (https://arxiv.org/abs/2607.12756) 查看 PDF (https://arxiv.org/pdf/2607.12756) GitHub11 (https://github.com/Zyvpeng/VisCo) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.12756)

引用该论文的模型0

暂无模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.12756,以便从此页面链接该模型。

引用该论文的数据集0

暂无数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.12756,以便从此页面链接该数据集。

引用该论文的 Spaces0

暂无 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.12756,以便从此页面链接该 Space。

包含该论文的集合0

暂无集合包含此论文

将此论文添加到一个集合 (https://huggingface.co/new-collection) 中,以便从此页面链接它。

相似文章

OmniScope:全模态大语言模型的模态解耦令牌压缩

Hugging Face Daily Papers

OmniScope是一个面向全模态大语言模型的无训练令牌压缩框架,它使用查询作为共享锚点,分别评估音频和视频的相关性,实现了高达3.53倍的预填充加速和超过15%的GPU内存减少,且精度损失极小。

Stateful Visual Encoders for Vision-Language Models

Hugging Face Daily Papers

本文介绍了一种用于视觉-语言模型的有状态视觉编码器,该编码器基于先前的特征来调节视觉表示,从而在多图像和智能体设置中实现更好的视觉比较。该方法在跨图像空间聚合、纵向放射学等任务上展现出一致的改进。

CaVe-VLM-CoT:一个可解释的视觉-语言模型框架

arXiv cs.AI

CaVe-VLM-CoT是一个基于模块化反思的智能体RAG框架,专为视觉-语言模型设计,通过五阶段流水线强制执行基于证据的推理,在ScienceQA上达到87.1%的准确率,并提出了一套包含23项指标的评估体系。

视觉-语言模型智能体间潜在通信的事后稀疏编码

arXiv cs.AI

本文通过将事后稀疏自编码器拟合到冻结的Vision Wormhole激活上,研究了视觉-语言模型智能体之间潜空间通信的可压缩性。结果表明,传输字节数减少了128倍,同时准确率损失极小,揭示了密集通信信道具有高度冗余性。