ReToken:一个Token提升视觉语言模型的视觉检索能力

Hugging Face Daily Papers 论文

摘要

ReToken引入了一个可学习的检索Token,从预填充的视觉KV缓存中选择与查询相关的稀疏视觉Token,从而提升视觉语言模型在视觉检索任务上的长上下文性能。它在图像和视频基准上均取得了一致的性能提升,同时可在单张H100上实现高效的长视频推理。

长视觉上下文对视觉语言模型构成挑战:随着干扰物数量的增加,性能会下降,而在GPU内存限制下一次性处理所有Token在计算上不可行。我们提出了ReToken,一个可学习的嵌入向量,将其作为显式检索目标进行训练,从预填充的视觉KV缓存中选择一组稀疏的、与查询相关的视觉Token。仅在一个小型图像问答数据集上训练,ReToken就在图像和视频基准上取得了持续的性能提升:在Visual Haystacks上,它将Qwen3VL-8B提升了13.4个百分点,将InternVL3.5提升了12.4个百分点(相对提升>20%);在LVBench上,它以零样本方式迁移到长视频任务,为Qwen3VL-8B带来了8.0个百分点的提升。得益于其轻量级设计,训练和长视频推理都可以在单张H100上完成。代码可在 https://github.com/avaxiao/ReToken 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/31 05:53

论文页面 - ReToken:用单个 Token 提升视觉语言模型的视觉检索能力

来源:https://huggingface.co/papers/2607.28627

摘要

长视觉上下文对视觉语言模型构成挑战:随着干扰项数量的增加,性能会下降,而且在 GPU 内存限制下,一次性处理所有 Token 在计算上是不可行的。我们提出了 ReToken,一个可学习的嵌入向量,将其训练为显式的检索目标,用于从预填充的视觉 KV 缓存中选择一组稀疏的、与查询相关的视觉 Token。ReToken 仅在小规模图像问答数据集上训练,就在图像和视频基准上取得了一致的提升:在 Visual Haystacks 上,它使 Qwen3VL-8B 提升了 13.4 个百分点,使 InternVL3.5 提升了 12.4 个百分点(相对提升超过 20%);在 LVBench 上,它能零样本迁移到长视频场景,为 Qwen3VL-8B 带来 8.0 个百分点的提升。得益于其轻量级设计,训练和长视频推理都可以在单块 H100 上完成。代码地址:https://github.com/avaxiao/ReToken

查看 arXiv 页面 (https://arxiv.org/abs/2607.28627) 查看 PDF (https://arxiv.org/pdf/2607.28627) GitHub1 (https://github.com/avaxiao/ReToken) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28627)

将此论文放入你的智能体:

hf papers read 2607.28627

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

暂无关联此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2607.28627,即可在本页面关联该模型。

引用此论文的数据集 0

暂无关联此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2607.28627,即可在本页面关联该数据集。

引用此论文的 Space 0

暂无关联此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2607.28627,即可在本页面关联该 Space。

包含此论文的收藏集 0

暂无包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以在本页面关联它。

相似文章

EasyVideoR1:让视频理解的强化学习更简单

Hugging Face Daily Papers

# 论文页面 - EasyVideoR1:让视频理解的强化学习更简单 来源:[https://huggingface.co/papers/2604.16893](https://huggingface.co/papers/2604.16893) ## 摘要 EasyVideoR1 提出了一个高效的视频理解强化学习框架,可提升训练吞吐量,支持多种视频任务,并实现图像-视频联合训练,在多个基准测试上进行全面评估。[可验证奖励强化学习](https://huggingface.co/papers

Video2LoRA: 视觉-语言模型的参数化视频内化

Hugging Face Daily Papers

本文介绍Video2LoRA,一种直接从视频表示预测低秩适配(LoRA)权重的方法,能够在冻结的视觉-语言模型中实现高效的视频处理。它将视觉令牌负载降低最多1500倍,查询TTFT降低6-80倍,同时在视频摘要和字幕生成基准上保持性能。