VGenST-Bench:通过主动视频合成进行时空推理的基准测试
摘要
VGenST-Bench是一个基准测试,利用生成模型主动合成受控的时空推理场景,配备多智能体流水线和人工质量控制,用于评估多模态大语言模型。
查看缓存全文
缓存时间: 2026/05/25 06:36
论文页面 - VGenST-Bench:通过主动视频合成进行时空推理的基准测试
来源:https://huggingface.co/papers/2605.22570
摘要
VGenST-Bench 提出了一种视频基准,利用生成模型主动合成受控的时空推理场景,并辅以人工质量控制。
时空推理(https://huggingface.co/papers?q=Spatio-temporal%20reasoning)是现实世界中运行的多模态大语言模型(https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models)(MLLM)的核心能力。因此,精确评估这一能力已成为一项关键挑战。然而,现有的时空推理(https://huggingface.co/papers?q=spatio-temporal%20reasoning)基准数据集主要依赖静态图像集或被动整理的视频数据,这限制了细粒度推理能力的评估。在本文中,我们介绍了 VGenST-Bench,一个视频基准(https://huggingface.co/papers?q=video%20benchmark),它采用生成模型(https://huggingface.co/papers?q=generative%20models)主动合成高度可控且多样化的评估场景。为了构建 VGenST-Bench,我们提出了一个多智能体流水线(https://huggingface.co/papers?q=multi-agent%20pipeline),并结合了人工质量控制阶段,以确保所有生成视频和问答对的质量。我们建立了一个全面的 3x2x2 视频分类体系(https://huggingface.co/papers?q=video%20taxonomy),涵盖空间尺度、视角和场景动态,以覆盖多样化的场景。此外,我们设计了一个层次化任务套件(https://huggingface.co/papers?q=hierarchical%20task%20suite),将低层视觉感知与高层时空推理(https://huggingface.co/papers?q=spatio-temporal%20reasoning)解耦。通过将范式从被动整理转变为主动合成,VGenST-Bench 能够对 MLLM 中的时空理解进行细粒度诊断。
查看 arXiv 页面(https://arxiv.org/abs/2605.22570)查看 PDF(https://arxiv.org/pdf/2605.22570)项目页面(https://zinosii.github.io/VGenST-Bench/)GitHub4(https://github.com/zinosii/VGenST-Bench)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.22570)
在您的代理中获取此论文:
hf papers read 2605\.22570
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.22570 以在此页面链接它。
引用此论文的数据集1
zino1/VGenST-Bench 查看器 • 更新于3天前 • 11k • 35 (https://huggingface.co/datasets/zino1/VGenST-Bench)
引用此论文的 Space0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.22570 以在此页面链接它。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到一个收藏集(https://huggingface.co/new-collection)以在此页面链接它。
相似文章
VGI-BENCH: 探测视频生成模型中的视觉智能
VGI-BENCH 通过27项任务评估视频生成模型中的视觉推理,揭示当前系统在可靠性和自我纠正方面的局限性。
Sci-VBench:评估科学领域中知识与推理密集型视频生成
介绍了Sci-VBench,这是一个用于评估跨科学领域知识和推理密集型视频生成的基准,发现视觉真实性尚未转化为可靠的科学和因果正确性。
超大视频推理套件
本文介绍了超大视频推理(VBVR)数据集和基准,这是一个大规模资源,包含超过一百万个视频片段,涵盖200个推理任务,能够系统研究时空推理,并展示了早期出现的涌现泛化迹象。
GST-Bench:VLMs能否从视频中形成全局空间意识?
GST-Bench是一个新的VQA基准,用于评估视频理解中的全局空间意识,测试VLMs能否从长时间的第一人称视频中构建连贯的全局场景表示。对22个最先进的VLMs的评估显示,它们与人类之间存在巨大差距,最佳模型得分42.68,而人类为79.08。
SVI-Bench:战略视频智能的动态微世界
介绍了SVI-Bench,这是一个利用团队运动进行战略视频智能的大规模基准,旨在评估模型在动态场景理解、因果推理、战略模拟和代理综合方面的能力。该基准揭示了一个能力断崖:模型在感知任务上表现良好,但在更高层次的战略推理上急剧下降。