所有视觉标记都同等重要吗?面向视觉-语言检索的保留对象证据的标记合并

Hugging Face Daily Papers 论文

摘要

介绍了SaMer,一种面向对象的标记合并框架,用于压缩视觉-语言检索中的图像侧标记,同时保留对象级证据,显著减少存储并提升检索性能。

多向量视觉-语言检索通过最大相似度后期交互保留细粒度视觉证据,但密集的图像侧标记使得存储和评分成本高昂。现有的标记压缩方法降低了这一成本,但它们可能移除或折叠未来查询标记可能需要的对象级和区域级证据。我们提出了SaMer,一种面向对象的标记合并框架,将图像侧投影后标记压缩为K个代表性质心,同时保留原有的后期交互接口。SaMer仅在训练期间使用对象标注作为合并先验,以防止跨实例混合,推理时无需真实边界框或检测器,并且仅适应共享投影层,视觉和语言骨干网络保持冻结。当K=64时,SaMer移除了超过93%的图像侧标记,并将ColPali存储减少了16.09倍,同时在Flickr30K和MSCOCO上提升了R@1。这些收益源于面向对象的合并保留了查询可选取的对象证据,而剪枝或仅特征池化会移除或折叠这些证据。SaMer还优于压缩基线方法,并展现出更强的短语级对齐能力,这表明高效的多向量检索不仅依赖于减少标记数量,还依赖于保留未来查询标记所需选择的证据。
查看原文
查看缓存全文

缓存时间: 2026/07/07 06:42

论文页面 - 所有视觉 Token 都同等重要吗?面向视觉-语言检索的物体证据保留型 Token 合并

来源:https://huggingface.co/papers/2607.04605

摘要

面向物体的 Token 合并框架 SaMer 在保留查询可选的视觉证据的同时压缩图像侧 Token,实现了显著的存储缩减与检索性能提升。

多向量视觉-语言检索 (https://huggingface.co/papers?q=vision-language%20retrieval) 通过最大相似度迟交互 (https://huggingface.co/papers?q=late%20interaction) 保留了细粒度的视觉证据,但密集的图像侧 Token 导致存储和评分成本高昂。现有 Token 压缩 (https://huggingface.co/papers?q=token%20compression) 方法降低了这一成本,但它们可能移除或坍缩物体级与区域级证据,而这些证据可能是未来查询 Token 需要选择的。我们提出 SaMer,这是一个面向物体的 Token 合并框架,它将图像侧投射后 Token (https://huggingface.co/papers?q=post-projector%20tokens) 压缩为 K 个代表性质心,同时保留原有的迟交互接口。SaMer 仅在训练阶段将物体标注作为合并先验,以抑制跨实例混合,推理时无需真实边界框或检测器,并且仅调整共享的投射层,视觉与语言骨干网络保持冻结。当 K=64 时,SaMer 移除了超过 93% 的图像侧 Token,将 ColPali 存储量降低了 16.09 倍,同时在 Flickr30K 和 MSCOCO 上提升了 R@1 指标。这些增益源于面相物体的合并 (https://huggingface.co/papers?q=object-aware%20merging) 保留了查询可选的物体证据,而剪枝或仅特征池化则可能移除或坍缩这些证据。SaMer 还优于压缩基线,并展现出更强的短语级定位 (https://huggingface.co/papers?q=phrase-level%20grounding) 能力,这表明高效的多向量检索 (https://huggingface.co/papers?q=multi-vector%20retrieval) 不仅依赖于减少 Token 数量,更在于保留未来查询 Token 需要选择的证据。

查看 arXiv 页面 (https://arxiv.org/abs/2607.04605) 查看 PDF (https://arxiv.org/pdf/2607.04605) 项目页面 (https://suhyeong10.github.io/samer-project-page/) GitHub (https://github.com/dmis-lab/SaMer) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.04605)

在您的 agent 中获取这篇论文:

hf papers read 2607\.04605

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型0

无模型链接至此论文

在模型 README.md 中引用 arxiv.org/abs/2607.04605 即可从本页链接。

引用该论文的数据集0

无数据集链接至此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.04605 即可从本页链接。

引用该论文的 Space0

无 Space 链接至此论文

在 Space README.md 中引用 arxiv.org/abs/2607.04605 即可从本页链接。

包含该论文的收藏集0

无收藏集包含此论文

将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 即可从本页链接。

相似文章

从二维网格到一维标记:改革多模态图像融合的共享表示

Hugging Face Daily Papers

本文提出了一种多模态图像融合方法,该方法使用来自预训练图像标记器的一维标记接口,通过选择性标记编辑(STE)来增强全局外观一致性,同时保留局部细节。在四个基准上的实验表明,该方法在全局一致性和局部保真度方面均达到了最先进性能。

EarlyTom:早期Token压缩实现快速视频理解

Hugging Face Daily Papers

EarlyTom是一个无需训练即可在视觉编码器早期压缩视觉token的框架,可减少首个token生成时间和计算成本,同时保持准确性,实现高达2.65倍的TTFT降低。