VGenST-Bench:通过主动视频合成进行时空推理的基准测试

Hugging Face Daily Papers 论文

摘要

VGenST-Bench是一个基准测试,利用生成模型主动合成受控的时空推理场景,配备多智能体流水线和人工质量控制,用于评估多模态大语言模型。

时空推理是在现实世界中运行的多模态大语言模型(MLLMs)的核心能力。因此,精确评估它已成为一项基本挑战。然而,现有的时空推理基准数据集主要依赖于静态图像集或被动整理的视频数据,这限制了对细粒度推理能力的评估。在本文中,我们介绍了VGenST-Bench,一个视频基准测试,它采用生成模型主动合成高度可控且多样化的评估场景。为了构建VGenST-Bench,我们提出了一个多智能体流水线,并引入了人工质量控制阶段,以确保所有生成的视频和问答对的质量。我们建立了一个全面的3x2x2视频分类体系,涵盖空间尺度、视角和场景动态,以覆盖多样化的场景。此外,我们设计了一个分层任务套件,将低层视觉感知与高层时空推理解耦。通过将范式从被动整理转变为主动合成,VGenST-Bench能够实现对MLLM中时空理解的细粒度诊断。
查看原文
查看缓存全文

缓存时间: 2026/05/25 06:36

论文页面 - VGenST-Bench:通过主动视频合成进行时空推理的基准测试

来源:https://huggingface.co/papers/2605.22570

摘要

VGenST-Bench 提出了一种视频基准,利用生成模型主动合成受控的时空推理场景,并辅以人工质量控制。

时空推理(https://huggingface.co/papers?q=Spatio-temporal%20reasoning)是现实世界中运行的多模态大语言模型(https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models)(MLLM)的核心能力。因此,精确评估这一能力已成为一项关键挑战。然而,现有的时空推理(https://huggingface.co/papers?q=spatio-temporal%20reasoning)基准数据集主要依赖静态图像集或被动整理的视频数据,这限制了细粒度推理能力的评估。在本文中,我们介绍了 VGenST-Bench,一个视频基准(https://huggingface.co/papers?q=video%20benchmark),它采用生成模型(https://huggingface.co/papers?q=generative%20models)主动合成高度可控且多样化的评估场景。为了构建 VGenST-Bench,我们提出了一个多智能体流水线(https://huggingface.co/papers?q=multi-agent%20pipeline),并结合了人工质量控制阶段,以确保所有生成视频和问答对的质量。我们建立了一个全面的 3x2x2 视频分类体系(https://huggingface.co/papers?q=video%20taxonomy),涵盖空间尺度、视角和场景动态,以覆盖多样化的场景。此外,我们设计了一个层次化任务套件(https://huggingface.co/papers?q=hierarchical%20task%20suite),将低层视觉感知与高层时空推理(https://huggingface.co/papers?q=spatio-temporal%20reasoning)解耦。通过将范式从被动整理转变为主动合成,VGenST-Bench 能够对 MLLM 中的时空理解进行细粒度诊断。

查看 arXiv 页面(https://arxiv.org/abs/2605.22570)查看 PDF(https://arxiv.org/pdf/2605.22570)项目页面(https://zinosii.github.io/VGenST-Bench/)GitHub4(https://github.com/zinosii/VGenST-Bench)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.22570)

在您的代理中获取此论文:

hf papers read 2605\.22570

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.22570 以在此页面链接它。

引用此论文的数据集1

zino1/VGenST-Bench 查看器 • 更新于3天前 • 11k • 35 (https://huggingface.co/datasets/zino1/VGenST-Bench)

引用此论文的 Space0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.22570 以在此页面链接它。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到一个收藏集(https://huggingface.co/new-collection)以在此页面链接它。

相似文章

超大视频推理套件

Papers with Code Trending

本文介绍了超大视频推理(VBVR)数据集和基准,这是一个大规模资源,包含超过一百万个视频片段,涵盖200个推理任务,能够系统研究时空推理,并展示了早期出现的涌现泛化迹象。

GST-Bench:VLMs能否从视频中形成全局空间意识?

Hugging Face Daily Papers

GST-Bench是一个新的VQA基准,用于评估视频理解中的全局空间意识,测试VLMs能否从长时间的第一人称视频中构建连贯的全局场景表示。对22个最先进的VLMs的评估显示,它们与人类之间存在巨大差距,最佳模型得分42.68,而人类为79.08。

SVI-Bench:战略视频智能的动态微世界

Hugging Face Daily Papers

介绍了SVI-Bench,这是一个利用团队运动进行战略视频智能的大规模基准,旨在评估模型在动态场景理解、因果推理、战略模拟和代理综合方面的能力。该基准揭示了一个能力断崖:模型在感知任务上表现良好,但在更高层次的战略推理上急剧下降。