GridProbe:针对长视频 VLM 自适应推理时计算的后验探测方法
摘要
GridProbe 是一种无需训练的长视频 VLM 推理范式,它通过后验探测自适应地选择相关帧,在几乎不损失准确率的情况下实现了低于二次方的注意力计算成本。
查看缓存全文
缓存时间: 2026/05/13 00:19
论文页面 - GridProbe:用于长视频 VLM 测试时计算自适应的后验探测
来源:https://huggingface.co/papers/2605.10762
摘要
GridProbe 通过利用冻结的 VLM 的推理能力自适应地选择相关帧,实现了高效的长视频理解。通过形状自适应选择和可解释的重要性映射,它在极少损失准确性的同时,将注意力成本降低至亚二次方。
VLM 中的长视频理解受限于在数千帧上进行单次大规模前向传播所导致的二次方注意力成本 (https://huggingface.co/papers?q=attention%20cost)。一种常见的缓解方法是在前向传播之前先选择一小部分信息量大的帧;训练免选的常见做法是通过辅助编码器空间相似度进行筛选。然而,此类信号受限于对比预训练,通常难以应对推理密集型查询(如否定、跨帧计数、整体总结)。我们提出了 GridProbe,这是一种高效的训练免后验探测推理 (https://huggingface.co/papers?q=posterior-probing%20inference) 范式,它利用冻结 VLM 自身的推理在答案空间中评估证据,进而自适应地选择与问题相关的帧 (https://huggingface.co/papers?q=question-relevant%20frames),从而实现亚二次方注意力成本 (https://huggingface.co/papers?q=attention%20cost),且几乎没有准确性损失。我们将帧排列在 K \times K 网格上,并运行轻量级的行 R 和列 C 探测,其中每次探测将其峰值后验值作为查询条件的置信度读取。R 和 C 的外积生成了一个可解释的重要性映射,其偏度和峰度驱动了形状自适应选择 (https://huggingface.co/papers?q=Shape-Adaptive%20Selection),这是一种闭式规则,能够可靠地用每问专属的 M_{\text{eff}} 替换固定的帧预算 M。实证表明,M_{\text{eff}} 能够追踪内在的问题难度,而无需预先知晓答案,这是测试时自适应计算 (https://huggingface.co/papers?q=test-time%20adaptive%20compute) 的标志。在 Video-MME-v2 上,GridProbe 在减少 3.36 倍 TFLOPs 计算量的情况下,平均准确率与大规模基线相差 1.6 个百分点;而在 LongVideoBench 上,它以帕累托优势超越基线(计算量仅为 0.35 倍时提升 +0.9 个百分点)。由于选择器模型和问答模型可以解耦,将较小的 2B 选择器与更强的 4B 或 8B 问答模型配对,相比 2B 大规模基线具有严格的帕累托优势(平均计算量为 0.52 倍时最高提升 +4.0 个百分点),且无需重新训练。最后,重要性映射 (https://huggingface.co/papers?q=importance%20maps) 的可解释性 (https://huggingface.co/papers?q=interpretability) 为行为诊断、定位和帧选择蒸馏开辟了未来的研究途径。
查看 arXiv 页面 (https://arxiv.org/abs/2605.10762) 查看 PDF (https://arxiv.org/pdf/2605.10762) GitHub0 (https://github.com/mohammad2012191/GridProbe) 添加到集合 (https://huggingface.co/login?next=%2Fpapers%2F2605.10762)
在你的代理中获取这篇论文:
hf papers read 2605.10762
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有链接到此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2605.10762 以从此页面链接它。
引用此论文的数据集 0
没有链接到此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2605.10762 以从此页面链接它。
引用此论文的 Spaces 0
没有链接到此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2605.10762 以从此页面链接它。
包含此论文的集合 0
没有包含此论文的集合
将这篇论文添加到一个集合 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
VLM是通过自适应测试时优化进行视频推理的优秀教师
本文提出一种新范式:视觉-语言模型(VLM)作为测试时教师,通过可微分奖励和LoRA优化引导视频生成模型(VGM),在视频推理基准测试上平均提升16.7个百分点。
AnyGroundBench: 视觉语言模型中视频定位的专业领域基准
介绍 AnyGroundBench,这是一个面向时空视频定位的领域自适应基准,评估了五个专业领域的15个视觉语言模型,发现当前模型在零样本和上下文学习适应中均失败。
通过通用关键帧提取桥接VideoQA与视频引导的代理任务
本文介绍了VG-GUIBench,一个用于评估基于MLLM的GUI代理遵循视频教程能力的基准,并提出了TASKER,一种关键帧提取方法,可提升VideoQA和视频引导的代理任务的性能。
哪种预训练范式更能服务于空间智能?视觉语言模型与视频生成模型的实证比较
本文通过系统性的冻结特征探测研究,比较了视觉语言模型(VLMs)和视频生成模型(VGMs)在空间智能任务上的表现。研究发现,VLMs在语义标签和实例分组方面表现优异,而VGMs则提供更好的密集几何和相机运动信号。两种模型的简单融合在所有维度上均展现出强劲性能。
LongLive-2.0:用于长视频生成的NVFP4并行基础设施
LongLive-2.0 引入了一种基于NVFP4的并行基础设施,用于长视频生成,在训练上实现了高达2.15倍的加速,推理上实现了1.84倍的加速,5B模型达到了45.7 FPS。