AnyGroundBench: 视觉语言模型中视频定位的专业领域基准

Hugging Face Daily Papers 论文

摘要

介绍 AnyGroundBench,这是一个面向时空视频定位的领域自适应基准,评估了五个专业领域的15个视觉语言模型,发现当前模型在零样本和上下文学习适应中均失败。

视觉语言模型在时空视频定位(STVG)领域展现出巨大潜力。然而,当前的评估协议主要局限于对通用日常生活基准的零样本测试。这与专业领域的实际应用之间存在严重脱节,因为模型必然遇到罕见的视觉概念和复杂的时空动态。由于跨无限数据分布进行穷举预训练不可行,模型必须具备适应新领域的能力。为弥补这一缺口,我们提出 AnyGroundBench,这是一个领域自适应基准,旨在将 STVG 评估范式从静态零样本测试转向严格的领域自适应。针对五个专业领域(动物、工业、体育、手术和公共安全),AnyGroundBench 将新录制的视频(例如专家标注的小鼠行为视频)与现有数据集配对,并通过密集、高保真的时空标注统一它们。关键的是,该基准提供了专门的训练子集,用于系统性地衡量领域适应性。我们广泛评估了15个最先进的视觉语言模型,考察其在实际计算约束下的零样本泛化和上下文学习(ICL)能力。最终,我们的发现表明,当面对专业领域时,当前模型在零样本和基于上下文学习的适应中均失败,暴露了时空推理中的关键缺陷,未来的研究必须解决这些问题。
查看原文
查看缓存全文

缓存时间: 2026/07/03 03:52

论文页面 - AnyGroundBench: 面向视觉语言模型中视频定位的专业领域基准

来源:https://huggingface.co/papers/2607.02269

摘要

视觉语言模型在专业时空视频定位任务中的域适应能力存在不足,暴露了其在零样本泛化和上下文学习能力上的局限性。

视觉语言模型(VLMs)在时空视频定位(STVG)领域展现出巨大潜力。然而,当前的评估方案主要局限于对通用日常生活基准的零样本评估。这与专业领域的实际应用存在严重脱节——在这些领域中,模型不可避免地会遇到罕见的视觉概念和复杂的时空动态。由于对无限数据分布进行穷举预训练不可行,适应新领域的能力至关重要。为弥补这一差距,我们提出了AnyGroundBench,这是一个域适应基准,旨在将STVG评估范式从静态的零样本测试转向严格的域适应评估。该基准针对五个专业领域(动物、工业、体育、手术和公共安全),将新拍摄的视频(例如专家标注的小鼠行为)与已有数据集配对,通过密集、高保真的时空标注将其统一。关键在于,该基准提供了专门的训练子集,以系统性地衡量领域适应能力。我们广泛评估了15个最先进的视觉语言模型,在实际计算约束下评估其零样本泛化和上下文学习(ICL)能力。最终,我们的研究结果表明,当前模型在面对专业领域时,在零样本和基于ICL的适应方面均失败,暴露了时空推理中的关键缺陷,这将是未来研究必须解决的方向。

查看 arXiv 页面 (https://arxiv.org/abs/2607.02269) | 查看 PDF (https://arxiv.org/pdf/2607.02269) | 项目页面 (https://rinost081.github.io/AnyGroundBench-page/) | GitHub1 (https://github.com/rinost081/AnyGroundBench) | 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.02269)

在您的 agent 中获取本文:

hf papers read 2607.02269

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

尚无模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.02269,以在此页面建立链接。

引用本文的数据集 1

rinost081/AnyGroundBench 查看器 • 更新于约2小时前 • 282 • 25 • 1 (https://huggingface.co/datasets/rinost081/AnyGroundBench)

引用本文的 Spaces 0

尚无 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.02269,以在此页面建立链接。

包含本文的收藏集 0

尚无收藏集包含此论文

请将本文添加至一个收藏集 (https://huggingface.co/new-collection),以在此页面建立链接。

相似文章

PlanBench-V: 面向视觉语言模型的空间规划地图基准

arXiv cs.CL

本文介绍了PlanBench-V,这是首个用于评估视觉语言模型在空间规划地图解读方面能力的综合性基准,包括一个专家标注的数据集和一个四维度评估框架。实验显示取得了显著进展,但也突显了在面向实施的任务中持续存在的挑战。

OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试

Papers with Code Trending

OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。