GridProbe:针对长视频 VLM 自适应推理时计算的后验探测方法

Hugging Face Daily Papers 论文

摘要

GridProbe 是一种无需训练的长视频 VLM 推理范式,它通过后验探测自适应地选择相关帧,在几乎不损失准确率的情况下实现了低于二次方的注意力计算成本。

在 VLM(视觉语言模型)中,长视频理解的瓶颈在于对数千帧画面进行单次整体前向传播时产生的二次方注意力计算成本。一种常见的缓解策略是在前向传播之前先筛选出一小部分信息量大的帧;现有的无训练选择器通常通过辅助编码器空间中的相似度来实现。然而,这类信号受限于对比预训练的能力,通常难以处理需要强推理能力的查询(如否定判断、跨帧计数、整体摘要等)。我们提出了 GridProbe,这是一种高效的、无需训练的后验探测推理范式。它利用冻结的 VLM 自身的推理能力在答案空间中评估证据得分,并自适应地选择与问题相关的帧,从而以极小甚至无准确率损失实现低于二次方的注意力计算成本。我们将帧排列在 K×K 的网格上,并执行轻量级的行 R 和列 C 探测,其中每次探测将其峰值后验概率作为由查询条件确定的置信度。R 和 C 的外积生成一个可解释的重要性图,其偏度和峰度驱动“形状自适应选择”(Shape-Adaptive Selection)规则——这是一种闭式规则,能够可靠地用每道题目的有效帧数 $M_{eff}$ 替代固定的帧预算 M。实证研究表明,$M_{eff}$ 能够追踪问题的内在难度,且无需看到答案,这是测试时自适应计算的显著特征。在 Video-MME-v2 基准测试中,GridProbe 在计算量降低至 3.36 倍的同时,平均准确率与整体基线相差仅 1.6 个百分点;而在 LongVideoBench 基准上,它在计算量仅为基线 0.35 倍的情况下以帕累托优势超越基线(准确率提升 0.9 个百分点)。由于选择器与问答模型可以解耦,将一个小型的 2B 参数选择器与更强的 4B 或 8B 参数问答模型配对,在所有情况下都严格帕累托优于 2B 参数的整体基线模型(平均而言,在计算量仅为 0.52 倍时准确率最高提升 4.0 个百分点),且无需重新训练。最后,重要性图的可解释性为行为诊断、视觉 grounding 以及帧选择蒸馏的未来研究开辟了新的途径。
查看原文
查看缓存全文

缓存时间: 2026/05/13 00:19

论文页面 - GridProbe:用于长视频 VLM 测试时计算自适应的后验探测

来源:https://huggingface.co/papers/2605.10762

摘要

GridProbe 通过利用冻结的 VLM 的推理能力自适应地选择相关帧,实现了高效的长视频理解。通过形状自适应选择和可解释的重要性映射,它在极少损失准确性的同时,将注意力成本降低至亚二次方。

VLM 中的长视频理解受限于在数千帧上进行单次大规模前向传播所导致的二次方注意力成本 (https://huggingface.co/papers?q=attention%20cost)。一种常见的缓解方法是在前向传播之前先选择一小部分信息量大的帧;训练免选的常见做法是通过辅助编码器空间相似度进行筛选。然而,此类信号受限于对比预训练,通常难以应对推理密集型查询(如否定、跨帧计数、整体总结)。我们提出了 GridProbe,这是一种高效的训练免后验探测推理 (https://huggingface.co/papers?q=posterior-probing%20inference) 范式,它利用冻结 VLM 自身的推理在答案空间中评估证据,进而自适应地选择与问题相关的帧 (https://huggingface.co/papers?q=question-relevant%20frames),从而实现亚二次方注意力成本 (https://huggingface.co/papers?q=attention%20cost),且几乎没有准确性损失。我们将帧排列在 K \times K 网格上,并运行轻量级的行 R 和列 C 探测,其中每次探测将其峰值后验值作为查询条件的置信度读取。RC 的外积生成了一个可解释的重要性映射,其偏度和峰度驱动了形状自适应选择 (https://huggingface.co/papers?q=Shape-Adaptive%20Selection),这是一种闭式规则,能够可靠地用每问专属的 M_{\text{eff}} 替换固定的帧预算 M。实证表明,M_{\text{eff}} 能够追踪内在的问题难度,而无需预先知晓答案,这是测试时自适应计算 (https://huggingface.co/papers?q=test-time%20adaptive%20compute) 的标志。在 Video-MME-v2 上,GridProbe 在减少 3.36 倍 TFLOPs 计算量的情况下,平均准确率与大规模基线相差 1.6 个百分点;而在 LongVideoBench 上,它以帕累托优势超越基线(计算量仅为 0.35 倍时提升 +0.9 个百分点)。由于选择器模型和问答模型可以解耦,将较小的 2B 选择器与更强的 4B 或 8B 问答模型配对,相比 2B 大规模基线具有严格的帕累托优势(平均计算量为 0.52 倍时最高提升 +4.0 个百分点),且无需重新训练。最后,重要性映射 (https://huggingface.co/papers?q=importance%20maps) 的可解释性 (https://huggingface.co/papers?q=interpretability) 为行为诊断、定位和帧选择蒸馏开辟了未来的研究途径。

查看 arXiv 页面 (https://arxiv.org/abs/2605.10762) 查看 PDF (https://arxiv.org/pdf/2605.10762) GitHub0 (https://github.com/mohammad2012191/GridProbe) 添加到集合 (https://huggingface.co/login?next=%2Fpapers%2F2605.10762)

在你的代理中获取这篇论文:

hf papers read 2605.10762

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有链接到此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2605.10762 以从此页面链接它。

引用此论文的数据集 0

没有链接到此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2605.10762 以从此页面链接它。

引用此论文的 Spaces 0

没有链接到此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2605.10762 以从此页面链接它。

包含此论文的集合 0

没有包含此论文的集合

将这篇论文添加到一个集合 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章