GST-Bench:VLMs能否从视频中形成全局空间意识?
摘要
GST-Bench是一个新的VQA基准,用于评估视频理解中的全局空间意识,测试VLMs能否从长时间的第一人称视频中构建连贯的全局场景表示。对22个最先进的VLMs的评估显示,它们与人类之间存在巨大差距,最佳模型得分42.68,而人类为79.08。
查看缓存全文
缓存时间: 2026/08/07 05:56
论文页面 - GST-Bench:VLMs能否从视频中发展出全局空间意识?
Source: https://huggingface.co/papers/2608.05747
摘要
空间智能对具身智能体至关重要,然而现有基准大多聚焦于从单一或少数视角进行的局部空间感知,忽视了在连续、长时程视觉流中的全局空间意识。为解决这一局限,我们提出了全局-空间-时间基准(GST-Bench),这是一个面向视频理解中全局空间智能的VQA基准,包含由6,790分钟合成生成视频得出的人工验证问题。它要求模型从输入视频中未见过的全新视角进行准确的空间推理,并将自我中心的观察映射到全局自顶向下图像上。对22个最先进VLM的综合评估暴露了模型与人类之间的显著差距:最强的零样本模型仅达到42.68,远低于人类的79.08。为了探究这一差距的原因,我们构建了GST-Bench-Local,并发现尽管模型在相同任务设置下具有强大的局部空间理解能力,它们仍然无法将长时程观察整合为全局一致的场景表示。我们还提供了GST-Train,一个用于全局空间推理的数据集,作为补充资源以促进未来对这一挑战的研究。
查看arXiv页面 (https://arxiv.org/abs/2608.05747) 查看PDF (https://arxiv.org/pdf/2608.05747) 项目页面 (https://qwerirwq.github.io/GST-Bench/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.05747)
在你的智能体中获取此论文:
hf papers read 2608\.05747
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接到此论文
在模型README.md中引用arxiv.org/abs/2608.05747,即可从本页链接到该模型。
引用此论文的数据集 0
没有数据集链接到此论文
在数据集README.md中引用arxiv.org/abs/2608.05747,即可从本页链接到该数据集。
引用此论文的Spaces 0
没有Space链接到此论文
在Space的README.md中引用arxiv.org/abs/2608.05747,即可从本页链接到该Space。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接它。
相似文章
OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试
OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。
AnyGroundBench: 视觉语言模型中视频定位的专业领域基准
介绍 AnyGroundBench,这是一个面向时空视频定位的领域自适应基准,评估了五个专业领域的15个视觉语言模型,发现当前模型在零样本和上下文学习适应中均失败。
VGenST-Bench:通过主动视频合成进行时空推理的基准测试
VGenST-Bench是一个基准测试,利用生成模型主动合成受控的时空推理场景,配备多智能体流水线和人工质量控制,用于评估多模态大语言模型。
哪种预训练范式更能服务于空间智能?视觉语言模型与视频生成模型的实证比较
本文通过系统性的冻结特征探测研究,比较了视觉语言模型(VLMs)和视频生成模型(VGMs)在空间智能任务上的表现。研究发现,VLMs在语义标签和实例分组方面表现优异,而VGMs则提供更好的密集几何和相机运动信号。两种模型的简单融合在所有维度上均展现出强劲性能。
多模态视频理解中视觉状态追踪的基准测试
介绍VSTAT,一个用于评估多模态大语言模型(MLLMs)中视觉状态追踪的基准,包含834个片段和1,500个问题。当前MLLMs表现远逊于人类,问题出在视觉感知而非推理上。