VisCo:利用大语言模型作为视觉令牌压缩的内在编码器
摘要
VisCo是一个高效训练的自压缩框架,它重用预训练的视觉-语言模型作为视觉令牌压缩的内在编码器,在所有压缩比率下均实现优越性能,且无需外部模块。
查看缓存全文
缓存时间: 2026/07/27 05:39
论文页面 - VisCo:利用大语言模型作为视觉令牌压缩的内在编码器
来源:https://huggingface.co/papers/2607.12756
摘要
视觉-语言模型(VLMs)需要处理大量的视觉令牌,导致显著的推理延迟和内存开销。这促使人们对视觉令牌压缩进行了广泛研究。无训练策略依赖于启发式度量,在高压缩比下性能下降严重;而许多基于训练的方法引入外部压缩模块,迫使 VLM 主干网络进行适配,带来了高昂的重新训练成本,并损害了 VLM 的先前知识。有效的视觉令牌压缩依赖于强大的信息编码能力,这种能力已经存在于预训练的 VLM 中,但现有方法并未充分利用。受此启发,我们提出了 VisCo,一个训练高效的自我压缩框架,将预训练的 VLM 本身重新用作内在压缩器。VisCo 是一个参数共享的自编码器,使用少量记忆令牌压缩视觉信息,并将层级信息从编码阶段传递到解码阶段。实验表明,VisCo 在所有评估的压缩比下都超越了先前的方法,在更激进的压缩下取得了更大的增益,甚至在极端的单令牌设置下也保持稳定。此外,当与原始视觉令牌结合时,学习到的记忆令牌甚至能够提升基础模型的性能,表明 VisCo 捕捉到了压缩之外的互补表示。
查看 arXiv 页面 (https://arxiv.org/abs/2607.12756) 查看 PDF (https://arxiv.org/pdf/2607.12756) GitHub11 (https://github.com/Zyvpeng/VisCo) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.12756)
引用该论文的模型0
暂无模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.12756,以便从此页面链接该模型。
引用该论文的数据集0
暂无数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.12756,以便从此页面链接该数据集。
引用该论文的 Spaces0
暂无 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.12756,以便从此页面链接该 Space。
包含该论文的集合0
暂无集合包含此论文
将此论文添加到一个集合 (https://huggingface.co/new-collection) 中,以便从此页面链接它。
相似文章
OmniScope:全模态大语言模型的模态解耦令牌压缩
OmniScope是一个面向全模态大语言模型的无训练令牌压缩框架,它使用查询作为共享锚点,分别评估音频和视频的相关性,实现了高达3.53倍的预填充加速和超过15%的GPU内存减少,且精度损失极小。
Stateful Visual Encoders for Vision-Language Models
本文介绍了一种用于视觉-语言模型的有状态视觉编码器,该编码器基于先前的特征来调节视觉表示,从而在多图像和智能体设置中实现更好的视觉比较。该方法在跨图像空间聚合、纵向放射学等任务上展现出一致的改进。
CaVe-VLM-CoT:一个可解释的视觉-语言模型框架
CaVe-VLM-CoT是一个基于模块化反思的智能体RAG框架,专为视觉-语言模型设计,通过五阶段流水线强制执行基于证据的推理,在ScienceQA上达到87.1%的准确率,并提出了一套包含23项指标的评估体系。
UltraViT:面向大型视觉语言模型的延迟优化端侧视觉编码器
UltraViT 是一个面向大型视觉语言模型的延迟优化视觉编码器,专为端侧部署设计,采用金字塔架构和两阶段生成式预训练策略,以1.7倍速度实现最先进的性能。
视觉-语言模型智能体间潜在通信的事后稀疏编码
本文通过将事后稀疏自编码器拟合到冻结的Vision Wormhole激活上,研究了视觉-语言模型智能体之间潜空间通信的可压缩性。结果表明,传输字节数减少了128倍,同时准确率损失极小,揭示了密集通信信道具有高度冗余性。