GST-Bench:VLMs能否从视频中形成全局空间意识?

Hugging Face Daily Papers 论文

摘要

GST-Bench是一个新的VQA基准,用于评估视频理解中的全局空间意识,测试VLMs能否从长时间的第一人称视频中构建连贯的全局场景表示。对22个最先进的VLMs的评估显示,它们与人类之间存在巨大差距,最佳模型得分42.68,而人类为79.08。

空间智能是具身智能体的基础,然而现有基准侧重于从单一或少量视角进行局部空间感知,忽视了在连续、长时程视觉流中的全局空间意识。为解决这一局限,我们引入了Global-Spatial-Temporal Benchmark(GST-Bench),一个面向视频理解中全局空间智能的VQA基准,包含由6,790分钟合成生成视频中衍生并经人工验证的问题。该基准要求模型从输入视频中未见过的全新视角进行准确的空间推理,并将第一人称观测映射到全局俯视图像上。对22个最先进的VLMs的综合评估揭示了模型与人类之间的惊人差距:最强的零样本模型仅达到42.68,远低于人类的79.08。为了探究这一差距的原因,我们构建了GST-Bench-Local,发现尽管模型在相同任务形式下具有较强的局部空间理解能力,它们仍无法将长时程观测整合为全局一致的场景表示。我们进一步提供了GST-Train,一个用于全局空间推理的数据集,作为补充资源,以促进未来对这一挑战的研究。
查看原文
查看缓存全文

缓存时间: 2026/08/07 05:56

论文页面 - GST-Bench:VLMs能否从视频中发展出全局空间意识?

Source: https://huggingface.co/papers/2608.05747

摘要

空间智能对具身智能体至关重要,然而现有基准大多聚焦于从单一或少数视角进行的局部空间感知,忽视了在连续、长时程视觉流中的全局空间意识。为解决这一局限,我们提出了全局-空间-时间基准(GST-Bench),这是一个面向视频理解中全局空间智能的VQA基准,包含由6,790分钟合成生成视频得出的人工验证问题。它要求模型从输入视频中未见过的全新视角进行准确的空间推理,并将自我中心的观察映射到全局自顶向下图像上。对22个最先进VLM的综合评估暴露了模型与人类之间的显著差距:最强的零样本模型仅达到42.68,远低于人类的79.08。为了探究这一差距的原因,我们构建了GST-Bench-Local,并发现尽管模型在相同任务设置下具有强大的局部空间理解能力,它们仍然无法将长时程观察整合为全局一致的场景表示。我们还提供了GST-Train,一个用于全局空间推理的数据集,作为补充资源以促进未来对这一挑战的研究。

查看arXiv页面 (https://arxiv.org/abs/2608.05747) 查看PDF (https://arxiv.org/pdf/2608.05747) 项目页面 (https://qwerirwq.github.io/GST-Bench/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.05747)

在你的智能体中获取此论文:

hf papers read 2608\.05747

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接到此论文

在模型README.md中引用arxiv.org/abs/2608.05747,即可从本页链接到该模型。

引用此论文的数据集 0

没有数据集链接到此论文

在数据集README.md中引用arxiv.org/abs/2608.05747,即可从本页链接到该数据集。

引用此论文的Spaces 0

没有Space链接到此论文

在Space的README.md中引用arxiv.org/abs/2608.05747,即可从本页链接到该Space。

包含此论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接它。

相似文章

OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试

Papers with Code Trending

OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。

多模态视频理解中视觉状态追踪的基准测试

Hugging Face Daily Papers

介绍VSTAT,一个用于评估多模态大语言模型(MLLMs)中视觉状态追踪的基准,包含834个片段和1,500个问题。当前MLLMs表现远逊于人类,问题出在视觉感知而非推理上。