AnyGroundBench: 视觉语言模型中视频定位的专业领域基准

Hugging Face Daily Papers 论文

摘要

介绍 AnyGroundBench,这是一个面向时空视频定位的领域自适应基准,评估了五个专业领域的15个视觉语言模型,发现当前模型在零样本和上下文学习适应中均失败。

视觉语言模型在时空视频定位(STVG)领域展现出巨大潜力。然而,当前的评估协议主要局限于对通用日常生活基准的零样本测试。这与专业领域的实际应用之间存在严重脱节,因为模型必然遇到罕见的视觉概念和复杂的时空动态。由于跨无限数据分布进行穷举预训练不可行,模型必须具备适应新领域的能力。为弥补这一缺口,我们提出 AnyGroundBench,这是一个领域自适应基准,旨在将 STVG 评估范式从静态零样本测试转向严格的领域自适应。针对五个专业领域(动物、工业、体育、手术和公共安全),AnyGroundBench 将新录制的视频(例如专家标注的小鼠行为视频)与现有数据集配对,并通过密集、高保真的时空标注统一它们。关键的是,该基准提供了专门的训练子集,用于系统性地衡量领域适应性。我们广泛评估了15个最先进的视觉语言模型,考察其在实际计算约束下的零样本泛化和上下文学习(ICL)能力。最终,我们的发现表明,当面对专业领域时,当前模型在零样本和基于上下文学习的适应中均失败,暴露了时空推理中的关键缺陷,未来的研究必须解决这些问题。
查看原文
查看缓存全文

缓存时间: 2026/07/03 03:52

论文页面 - AnyGroundBench: 面向视觉语言模型中视频定位的专业领域基准

来源:https://huggingface.co/papers/2607.02269

摘要

视觉语言模型在专业时空视频定位任务中的域适应能力存在不足,暴露了其在零样本泛化和上下文学习能力上的局限性。

视觉语言模型(VLMs)在时空视频定位(STVG)领域展现出巨大潜力。然而,当前的评估方案主要局限于对通用日常生活基准的零样本评估。这与专业领域的实际应用存在严重脱节——在这些领域中,模型不可避免地会遇到罕见的视觉概念和复杂的时空动态。由于对无限数据分布进行穷举预训练不可行,适应新领域的能力至关重要。为弥补这一差距,我们提出了AnyGroundBench,这是一个域适应基准,旨在将STVG评估范式从静态的零样本测试转向严格的域适应评估。该基准针对五个专业领域(动物、工业、体育、手术和公共安全),将新拍摄的视频(例如专家标注的小鼠行为)与已有数据集配对,通过密集、高保真的时空标注将其统一。关键在于,该基准提供了专门的训练子集,以系统性地衡量领域适应能力。我们广泛评估了15个最先进的视觉语言模型,在实际计算约束下评估其零样本泛化和上下文学习(ICL)能力。最终,我们的研究结果表明,当前模型在面对专业领域时,在零样本和基于ICL的适应方面均失败,暴露了时空推理中的关键缺陷,这将是未来研究必须解决的方向。

查看 arXiv 页面 (https://arxiv.org/abs/2607.02269) | 查看 PDF (https://arxiv.org/pdf/2607.02269) | 项目页面 (https://rinost081.github.io/AnyGroundBench-page/) | GitHub1 (https://github.com/rinost081/AnyGroundBench) | 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.02269)

在您的 agent 中获取本文:

hf papers read 2607.02269

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

尚无模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.02269,以在此页面建立链接。

引用本文的数据集 1

rinost081/AnyGroundBench 查看器 • 更新于约2小时前 • 282 • 25 • 1 (https://huggingface.co/datasets/rinost081/AnyGroundBench)

引用本文的 Spaces 0

尚无 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.02269,以在此页面建立链接。

包含本文的收藏集 0

尚无收藏集包含此论文

请将本文添加至一个收藏集 (https://huggingface.co/new-collection),以在此页面建立链接。

相似文章

GST-Bench:VLMs能否从视频中形成全局空间意识?

Hugging Face Daily Papers

GST-Bench是一个新的VQA基准,用于评估视频理解中的全局空间意识,测试VLMs能否从长时间的第一人称视频中构建连贯的全局场景表示。对22个最先进的VLMs的评估显示,它们与人类之间存在巨大差距,最佳模型得分42.68,而人类为79.08。