优质令牌狩猎:视觉几何变换器中令牌选择的搭车指南

Hugging Face Daily Papers 论文

摘要

本文提出了一种用于视觉几何变换器的两阶段令牌选择框架,通过在全局注意力中限制键/值令牌来降低计算成本,在包含500张图像的场景上实现了超过85%的加速,同时保持了基线性能。

视觉几何变换器已成为多视图三维重建的强大架构,能够以前馈方式联合预测多个三维属性。然而,由于这些模型内部的全局注意力层,其计算成本随输入序列长度呈二次方增长,这限制了它们的可扩展性和效率。在这项工作中,我们通过一种简单而通用的策略来解决这一挑战:在全局注意力中限制每个查询所交互的键/值令牌数量。为了实现有效的令牌选择,我们引入了一个两阶段框架。首先,帧间选择步骤在帧级别运作,识别应保留的帧。其次,帧内选择步骤进一步丢弃所选帧中更冗余的令牌。我们的分析强调了基于多样性的帧间选择策略的优势,该策略确保对场景的广泛覆盖。对于帧内选择,我们表明需要层感知稀疏化,选择过程由全局注意力模式的熵引导。与现有解决方案相比,我们的方法提供了优越的速度-精度权衡。大量实验表明,对于包含500张图像的场景,它使视觉几何变换器加速超过85%,同时保持甚至提高基线性能,这暗示了我们的令牌选择策略如何在视觉几何变换器的未来应用中发挥关键作用。我们的项目网站可在 https://zsh2000.github.io/good-token-hunting.github.io 访问。
查看原文
查看缓存全文

缓存时间: 2026/05/25 06:36

论文页面 - 优质Token狩猎:视觉几何Transformer的Token选择指南

来源:https://huggingface.co/papers/2605.23892

摘要

视觉几何Transformer通过一个两阶段token选择框架实现加速,在降低计算成本的同时保持性能。

Visual geometry transformers (https://huggingface.co/papers?q=Visual%20geometry%20transformers)已成为多视图3D重建 (https://huggingface.co/papers?q=multi-view%203D%20reconstruction)的强大架构,能够以前馈方式联合预测多个3D属性。然而,由于这些模型内部使用了全局注意力层 (https://huggingface.co/papers?q=global%20attention%20layers),其计算成本随输入序列长度呈二次增长。这限制了它们的可扩展性和效率。在本工作中,我们通过一个简单而通用的策略来应对这一挑战:限制每个查询在全局注意力中交互的键/值token数量。为了实现有效的token选择 (https://huggingface.co/papers?q=token%20selection),我们引入了一个两阶段框架。首先,帧间选择 (https://huggingface.co/papers?q=inter-frame%20selection)步骤在帧级别操作,以识别需要保留的帧。其次,帧内选择 (https://huggingface.co/papers?q=intra-frame%20selection)步骤进一步丢弃所选帧中更冗余的token。我们的分析突出了基于多样性的策略在帧间选择 (https://huggingface.co/papers?q=inter-frame%20selection)中的优势,该策略确保了场景的广泛覆盖。对于帧内选择 (https://huggingface.co/papers?q=intra-frame%20selection),我们表明层感知稀疏化 (https://huggingface.co/papers?q=layer-aware%20sparsification)是必要的,选择过程由全局注意力模式的熵来指导。与现有解决方案相比,我们的方法提供了更优的速度-精度权衡。大量实验表明,对于包含500张图像的场景,该方法将visual geometry transformers (https://huggingface.co/papers?q=visual%20geometry%20transformers)加速超过85%,同时保持甚至提升基线性能,这暗示了我们的token选择 (https://huggingface.co/papers?q=token%20selection)策略在visual geometry transformers (https://huggingface.co/papers?q=visual%20geometry%20transformers)的未来应用中可以发挥关键作用。我们的项目网站可在 https://zsh2000.github.io/good-token-hunting.github.io/ 访问。

查看arXiv页面 (https://arxiv.org/abs/2605.23892)查看PDF (https://arxiv.org/pdf/2605.23892)项目页面 (https://zsh2000.github.io/good-token-hunting.github.io/)GitHub4 (https://github.com/zsh2000/gotohunt)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.23892)

在你的agent中获取此论文:

hf papers read 2605.23892

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

请在一个模型的 README.md 中引用 arxiv.org/abs/2605.23892,以从该页面链接到此论文。

引用此论文的数据集0

没有数据集链接此论文

请在一个数据集的 README.md 中引用 arxiv.org/abs/2605.23892,以从该页面链接到此论文。

引用此论文的Spaces0

没有Space链接此论文

请在一个Space的 README.md 中引用 arxiv.org/abs/2605.23892,以从该页面链接到此论文。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到一个收藏集 (https://huggingface.co/new-collection)中,以从该页面链接到此论文。

相似文章

星系的分词器指南:科学基础模型的基准测试

Hugging Face Daily Papers

本文在统一的transformer框架内,比较了四种分词方法(Affine、AIM、JetFormer、VQ-VAE)用于天文图像,使用64万张星系图像评估重构质量、物理属性预测和形态保持能力。研究发现,没有单一方法在所有任务中表现最佳,突显了表示学习中的权衡。

ReToken:一个Token提升视觉语言模型的视觉检索能力

Hugging Face Daily Papers

ReToken引入了一个可学习的检索Token,从预填充的视觉KV缓存中选择与查询相关的稀疏视觉Token,从而提升视觉语言模型在视觉检索任务上的长上下文性能。它在图像和视频基准上均取得了一致的性能提升,同时可在单张H100上实现高效的长视频推理。

从二维网格到一维标记:改革多模态图像融合的共享表示

Hugging Face Daily Papers

本文提出了一种多模态图像融合方法,该方法使用来自预训练图像标记器的一维标记接口,通过选择性标记编辑(STE)来增强全局外观一致性,同时保留局部细节。在四个基准上的实验表明,该方法在全局一致性和局部保真度方面均达到了最先进性能。