ReToken:一个Token提升视觉语言模型的视觉检索能力
摘要
ReToken引入了一个可学习的检索Token,从预填充的视觉KV缓存中选择与查询相关的稀疏视觉Token,从而提升视觉语言模型在视觉检索任务上的长上下文性能。它在图像和视频基准上均取得了一致的性能提升,同时可在单张H100上实现高效的长视频推理。
查看缓存全文
缓存时间: 2026/07/31 05:53
论文页面 - ReToken:用单个 Token 提升视觉语言模型的视觉检索能力
来源:https://huggingface.co/papers/2607.28627
摘要
长视觉上下文对视觉语言模型构成挑战:随着干扰项数量的增加,性能会下降,而且在 GPU 内存限制下,一次性处理所有 Token 在计算上是不可行的。我们提出了 ReToken,一个可学习的嵌入向量,将其训练为显式的检索目标,用于从预填充的视觉 KV 缓存中选择一组稀疏的、与查询相关的视觉 Token。ReToken 仅在小规模图像问答数据集上训练,就在图像和视频基准上取得了一致的提升:在 Visual Haystacks 上,它使 Qwen3VL-8B 提升了 13.4 个百分点,使 InternVL3.5 提升了 12.4 个百分点(相对提升超过 20%);在 LVBench 上,它能零样本迁移到长视频场景,为 Qwen3VL-8B 带来 8.0 个百分点的提升。得益于其轻量级设计,训练和长视频推理都可以在单块 H100 上完成。代码地址:https://github.com/avaxiao/ReToken
查看 arXiv 页面 (https://arxiv.org/abs/2607.28627) 查看 PDF (https://arxiv.org/pdf/2607.28627) GitHub1 (https://github.com/avaxiao/ReToken) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28627)
将此论文放入你的智能体:
hf papers read 2607.28627
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
暂无关联此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2607.28627,即可在本页面关联该模型。
引用此论文的数据集 0
暂无关联此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2607.28627,即可在本页面关联该数据集。
引用此论文的 Space 0
暂无关联此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2607.28627,即可在本页面关联该 Space。
包含此论文的收藏集 0
暂无包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以在本页面关联它。
相似文章
所有视觉标记都同等重要吗?面向视觉-语言检索的保留对象证据的标记合并
介绍了SaMer,一种面向对象的标记合并框架,用于压缩视觉-语言检索中的图像侧标记,同时保留对象级证据,显著减少存储并提升检索性能。
Reroute,而非移除:面向视觉语言模型的可恢复视觉令牌路由
提出Reroute,一种无需训练的视觉语言模型插件,用可恢复的路由替代不可逆的视觉令牌剪枝,允许令牌在后续阶段重新进入流水线,从而在激进的令牌缩减下提升接地性能,同时保持VQA性能。
EasyVideoR1:让视频理解的强化学习更简单
# 论文页面 - EasyVideoR1:让视频理解的强化学习更简单 来源:[https://huggingface.co/papers/2604.16893](https://huggingface.co/papers/2604.16893) ## 摘要 EasyVideoR1 提出了一个高效的视频理解强化学习框架,可提升训练吞吐量,支持多种视频任务,并实现图像-视频联合训练,在多个基准测试上进行全面评估。[可验证奖励强化学习](https://huggingface.co/papers
HYDRA-X: 原生统一多模态模型与整体视觉分词器
HYDRA-X 提出了一种统一的多模态模型,将图像和视频分词集成到单个视觉变换器中,在理解和生成任务上均取得了强劲性能。
Video2LoRA: 视觉-语言模型的参数化视频内化
本文介绍Video2LoRA,一种直接从视频表示预测低秩适配(LoRA)权重的方法,能够在冻结的视觉-语言模型中实现高效的视频处理。它将视觉令牌负载降低最多1500倍,查询TTFT降低6-80倍,同时在视频摘要和字幕生成基准上保持性能。