@PinzhiHuang: 状态追踪是视频理解的核心支柱:它需要识别实体和事件,并映射它们如何随时间演变…

X AI KOLs Following 论文

摘要

介绍VSTAT,一个衡量多模态大语言模型在视频中追踪状态能力的新基准,揭示前沿模型在人类认为简单的任务上表现不佳。

状态追踪是视频理解的核心支柱:它需要识别实体和事件,并映射它们的状态如何随时间演变。 前沿多模态模型在这方面出奇地差,因此我们构建了一个基准来评估它。 认识一下VSTAT!
查看原文
查看缓存全文

缓存时间: 2026/06/03 03:42

状态追踪是视频理解的核心支柱:它需要识别实体和事件,并映射它们的状态如何随时间演变。

前沿多模态模型在此方面表现惊人地糟糕,因此我们构建了一个基准来评估它。

认识一下 VSTAT!

论文:https://arxiv.org/abs/2606.03920 网站:https://vision-x-nyu.github.io/vstat-site/ GitHub:https://github.com/vision-x-nyu/vstat… HF:https://huggingface.co/datasets/nyu-visionx/vstat…

我很感激能与这些出色的合作者共事:@sihyun_yu 和 @ma_nanye,以及 @hyunseok_i @shushengyang @ellisbrown @ojmichel4 @boyangzheng @JinwooShin0417!!!

感谢 @sainingxie 指导这个项目,并且还设计了一个有趣的 VSTAT 任务!

相似文章

多模态视频理解中视觉状态追踪的基准测试

Hugging Face Daily Papers

介绍VSTAT,一个用于评估多模态大语言模型(MLLMs)中视觉状态追踪的基准,包含834个片段和1,500个问题。当前MLLMs表现远逊于人类,问题出在视觉感知而非推理上。

LLaVA-OneVision-2:迈向下一代感知智能

Hugging Face Daily Papers

LLaVA-OneVision-2 引入了编解码流分词和窗口注意力机制以实现高效的视频理解,在包括视频、空间和跟踪任务在内的多个多模态基准测试中取得了最先进的性能。

OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试

Papers with Code Trending

OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。