所有视觉标记都同等重要吗?面向视觉-语言检索的保留对象证据的标记合并
摘要
介绍了SaMer,一种面向对象的标记合并框架,用于压缩视觉-语言检索中的图像侧标记,同时保留对象级证据,显著减少存储并提升检索性能。
查看缓存全文
缓存时间: 2026/07/07 06:42
论文页面 - 所有视觉 Token 都同等重要吗?面向视觉-语言检索的物体证据保留型 Token 合并
来源:https://huggingface.co/papers/2607.04605
摘要
面向物体的 Token 合并框架 SaMer 在保留查询可选的视觉证据的同时压缩图像侧 Token,实现了显著的存储缩减与检索性能提升。
多向量视觉-语言检索 (https://huggingface.co/papers?q=vision-language%20retrieval) 通过最大相似度迟交互 (https://huggingface.co/papers?q=late%20interaction) 保留了细粒度的视觉证据,但密集的图像侧 Token 导致存储和评分成本高昂。现有 Token 压缩 (https://huggingface.co/papers?q=token%20compression) 方法降低了这一成本,但它们可能移除或坍缩物体级与区域级证据,而这些证据可能是未来查询 Token 需要选择的。我们提出 SaMer,这是一个面向物体的 Token 合并框架,它将图像侧投射后 Token (https://huggingface.co/papers?q=post-projector%20tokens) 压缩为 K 个代表性质心,同时保留原有的迟交互接口。SaMer 仅在训练阶段将物体标注作为合并先验,以抑制跨实例混合,推理时无需真实边界框或检测器,并且仅调整共享的投射层,视觉与语言骨干网络保持冻结。当 K=64 时,SaMer 移除了超过 93% 的图像侧 Token,将 ColPali 存储量降低了 16.09 倍,同时在 Flickr30K 和 MSCOCO 上提升了 R@1 指标。这些增益源于面相物体的合并 (https://huggingface.co/papers?q=object-aware%20merging) 保留了查询可选的物体证据,而剪枝或仅特征池化则可能移除或坍缩这些证据。SaMer 还优于压缩基线,并展现出更强的短语级定位 (https://huggingface.co/papers?q=phrase-level%20grounding) 能力,这表明高效的多向量检索 (https://huggingface.co/papers?q=multi-vector%20retrieval) 不仅依赖于减少 Token 数量,更在于保留未来查询 Token 需要选择的证据。
查看 arXiv 页面 (https://arxiv.org/abs/2607.04605) 查看 PDF (https://arxiv.org/pdf/2607.04605) 项目页面 (https://suhyeong10.github.io/samer-project-page/) GitHub (https://github.com/dmis-lab/SaMer) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.04605)
在您的 agent 中获取这篇论文:
hf papers read 2607\.04605
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
无模型链接至此论文
在模型 README.md 中引用 arxiv.org/abs/2607.04605 即可从本页链接。
引用该论文的数据集0
无数据集链接至此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.04605 即可从本页链接。
引用该论文的 Space0
无 Space 链接至此论文
在 Space README.md 中引用 arxiv.org/abs/2607.04605 即可从本页链接。
包含该论文的收藏集0
无收藏集包含此论文
将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 即可从本页链接。
相似文章
每个多模态证据一个Token:面向资源受限问答的Latent Memory
潜在记忆(Latent Memory)引入了一种用于问答中外部记忆的压缩表示方法,在减少Token消耗和存储需求的同时,在纯文本和多模态基准测试中保持有竞争力的表现。
从二维网格到一维标记:改革多模态图像融合的共享表示
本文提出了一种多模态图像融合方法,该方法使用来自预训练图像标记器的一维标记接口,通过选择性标记编辑(STE)来增强全局外观一致性,同时保留局部细节。在四个基准上的实验表明,该方法在全局一致性和局部保真度方面均达到了最先进性能。
OmniFocus: 查询引导的模态平衡令牌压缩方法用于全模态大语言模型
OmniFocus 是一种无需训练、查询引导的令牌压缩方法,用于全模态大语言模型,它独立估计视频和音频的重要性,以保留模态特定的证据同时保持对齐,在低令牌保留比率下实现了显著的推理加速,同时精度损失极小。
AVOC: 通过检索启发的令牌压缩增强全模态大语言模型中的小时级音视频理解
AVOC 提出了一种针对全模态大语言模型的检索启发的令牌压缩方法,通过基于相关性、重要性和多样性选择信息丰富的令牌,有效处理长达一小时的音视频输入。该框架在长时音视频理解基准测试中取得了最先进的结果,大幅超越了先前的方法。
EarlyTom:早期Token压缩实现快速视频理解
EarlyTom是一个无需训练即可在视觉编码器早期压缩视觉token的框架,可减少首个token生成时间和计算成本,同时保持准确性,实现高达2.65倍的TTFT降低。