AnyGroundBench: 视觉语言模型中视频定位的专业领域基准
摘要
介绍 AnyGroundBench,这是一个面向时空视频定位的领域自适应基准,评估了五个专业领域的15个视觉语言模型,发现当前模型在零样本和上下文学习适应中均失败。
查看缓存全文
缓存时间: 2026/07/03 03:52
论文页面 - AnyGroundBench: 面向视觉语言模型中视频定位的专业领域基准
来源:https://huggingface.co/papers/2607.02269
摘要
视觉语言模型在专业时空视频定位任务中的域适应能力存在不足,暴露了其在零样本泛化和上下文学习能力上的局限性。
视觉语言模型(VLMs)在时空视频定位(STVG)领域展现出巨大潜力。然而,当前的评估方案主要局限于对通用日常生活基准的零样本评估。这与专业领域的实际应用存在严重脱节——在这些领域中,模型不可避免地会遇到罕见的视觉概念和复杂的时空动态。由于对无限数据分布进行穷举预训练不可行,适应新领域的能力至关重要。为弥补这一差距,我们提出了AnyGroundBench,这是一个域适应基准,旨在将STVG评估范式从静态的零样本测试转向严格的域适应评估。该基准针对五个专业领域(动物、工业、体育、手术和公共安全),将新拍摄的视频(例如专家标注的小鼠行为)与已有数据集配对,通过密集、高保真的时空标注将其统一。关键在于,该基准提供了专门的训练子集,以系统性地衡量领域适应能力。我们广泛评估了15个最先进的视觉语言模型,在实际计算约束下评估其零样本泛化和上下文学习(ICL)能力。最终,我们的研究结果表明,当前模型在面对专业领域时,在零样本和基于ICL的适应方面均失败,暴露了时空推理中的关键缺陷,这将是未来研究必须解决的方向。
查看 arXiv 页面 (https://arxiv.org/abs/2607.02269) | 查看 PDF (https://arxiv.org/pdf/2607.02269) | 项目页面 (https://rinost081.github.io/AnyGroundBench-page/) | GitHub1 (https://github.com/rinost081/AnyGroundBench) | 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.02269)
在您的 agent 中获取本文:
hf papers read 2607.02269
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
尚无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.02269,以在此页面建立链接。
引用本文的数据集 1
rinost081/AnyGroundBench 查看器 • 更新于约2小时前 • 282 • 25 • 1 (https://huggingface.co/datasets/rinost081/AnyGroundBench)
引用本文的 Spaces 0
尚无 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.02269,以在此页面建立链接。
包含本文的收藏集 0
尚无收藏集包含此论文
请将本文添加至一个收藏集 (https://huggingface.co/new-collection),以在此页面建立链接。
相似文章
当眼见不为实:交互式视觉定位在LVLMs中的基准测试
本文介绍了一个用于大型视觉语言模型(LVLMs)中交互式视觉定位的受控评估框架,表明当前LVLMs的表现低于人类基线,并在主动问题驱动定位方面存在困难。
GST-Bench:VLMs能否从视频中形成全局空间意识?
GST-Bench是一个新的VQA基准,用于评估视频理解中的全局空间意识,测试VLMs能否从长时间的第一人称视频中构建连贯的全局场景表示。对22个最先进的VLMs的评估显示,它们与人类之间存在巨大差距,最佳模型得分42.68,而人类为79.08。
CLBench-V: 从上下文基础到知识获取的多模态上下文学习评估
CLBench-V是一个用于评估多模态上下文学习的基准,涵盖上下文基础、新信息应用和新知识学习。最佳模型仅达到0.2847,表明该任务仍然具有挑战性。
RoboSemanticBench:诊断VLA模型动作预测中的语义基础
RoboSemanticBench 是一个基准测试,用于诊断视觉-语言-动作模型在动作预测中的语义基础,揭示机器人虽然能够抓取物体,但无法根据指令语义选择语义上正确的目标。
VGenST-Bench:通过主动视频合成进行时空推理的基准测试
VGenST-Bench是一个基准测试,利用生成模型主动合成受控的时空推理场景,配备多智能体流水线和人工质量控制,用于评估多模态大语言模型。