AnyGroundBench: 视觉语言模型中视频定位的专业领域基准
摘要
介绍 AnyGroundBench,这是一个面向时空视频定位的领域自适应基准,评估了五个专业领域的15个视觉语言模型,发现当前模型在零样本和上下文学习适应中均失败。
查看缓存全文
缓存时间: 2026/07/03 03:52
论文页面 - AnyGroundBench: 面向视觉语言模型中视频定位的专业领域基准
来源:https://huggingface.co/papers/2607.02269
摘要
视觉语言模型在专业时空视频定位任务中的域适应能力存在不足,暴露了其在零样本泛化和上下文学习能力上的局限性。
视觉语言模型(VLMs)在时空视频定位(STVG)领域展现出巨大潜力。然而,当前的评估方案主要局限于对通用日常生活基准的零样本评估。这与专业领域的实际应用存在严重脱节——在这些领域中,模型不可避免地会遇到罕见的视觉概念和复杂的时空动态。由于对无限数据分布进行穷举预训练不可行,适应新领域的能力至关重要。为弥补这一差距,我们提出了AnyGroundBench,这是一个域适应基准,旨在将STVG评估范式从静态的零样本测试转向严格的域适应评估。该基准针对五个专业领域(动物、工业、体育、手术和公共安全),将新拍摄的视频(例如专家标注的小鼠行为)与已有数据集配对,通过密集、高保真的时空标注将其统一。关键在于,该基准提供了专门的训练子集,以系统性地衡量领域适应能力。我们广泛评估了15个最先进的视觉语言模型,在实际计算约束下评估其零样本泛化和上下文学习(ICL)能力。最终,我们的研究结果表明,当前模型在面对专业领域时,在零样本和基于ICL的适应方面均失败,暴露了时空推理中的关键缺陷,这将是未来研究必须解决的方向。
查看 arXiv 页面 (https://arxiv.org/abs/2607.02269) | 查看 PDF (https://arxiv.org/pdf/2607.02269) | 项目页面 (https://rinost081.github.io/AnyGroundBench-page/) | GitHub1 (https://github.com/rinost081/AnyGroundBench) | 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.02269)
在您的 agent 中获取本文:
hf papers read 2607.02269
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
尚无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.02269,以在此页面建立链接。
引用本文的数据集 1
rinost081/AnyGroundBench 查看器 • 更新于约2小时前 • 282 • 25 • 1 (https://huggingface.co/datasets/rinost081/AnyGroundBench)
引用本文的 Spaces 0
尚无 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.02269,以在此页面建立链接。
包含本文的收藏集 0
尚无收藏集包含此论文
请将本文添加至一个收藏集 (https://huggingface.co/new-collection),以在此页面建立链接。
相似文章
RoboSemanticBench:诊断VLA模型动作预测中的语义基础
RoboSemanticBench 是一个基准测试,用于诊断视觉-语言-动作模型在动作预测中的语义基础,揭示机器人虽然能够抓取物体,但无法根据指令语义选择语义上正确的目标。
VGenST-Bench:通过主动视频合成进行时空推理的基准测试
VGenST-Bench是一个基准测试,利用生成模型主动合成受控的时空推理场景,配备多智能体流水线和人工质量控制,用于评估多模态大语言模型。
VIABench:一项由视障人士收集的全面视频基准,用于视觉障碍辅助
介绍了VIABench,这是一个全面的视频基准,用于评估多模态大语言模型在真实世界中对盲人和视障人士的视觉辅助能力,涵盖了761个视频和14,526个标注,涉及三个任务。
PlanBench-V: 面向视觉语言模型的空间规划地图基准
本文介绍了PlanBench-V,这是首个用于评估视觉语言模型在空间规划地图解读方面能力的综合性基准,包括一个专家标注的数据集和一个四维度评估框架。实验显示取得了显著进展,但也突显了在面向实施的任务中持续存在的挑战。
OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试
OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。