@PinzhiHuang: 状态追踪是视频理解的核心支柱:它需要识别实体和事件,并映射它们如何随时间演变…
摘要
介绍VSTAT,一个衡量多模态大语言模型在视频中追踪状态能力的新基准,揭示前沿模型在人类认为简单的任务上表现不佳。
查看缓存全文
缓存时间: 2026/06/03 03:42
状态追踪是视频理解的核心支柱:它需要识别实体和事件,并映射它们的状态如何随时间演变。
前沿多模态模型在此方面表现惊人地糟糕,因此我们构建了一个基准来评估它。
认识一下 VSTAT!
论文:https://arxiv.org/abs/2606.03920 网站:https://vision-x-nyu.github.io/vstat-site/ GitHub:https://github.com/vision-x-nyu/vstat… HF:https://huggingface.co/datasets/nyu-visionx/vstat…
我很感激能与这些出色的合作者共事:@sihyun_yu 和 @ma_nanye,以及 @hyunseok_i @shushengyang @ellisbrown @ojmichel4 @boyangzheng @JinwooShin0417!!!
感谢 @sainingxie 指导这个项目,并且还设计了一个有趣的 VSTAT 任务!
相似文章
多模态视频理解中视觉状态追踪的基准测试
介绍VSTAT,一个用于评估多模态大语言模型(MLLMs)中视觉状态追踪的基准,包含834个片段和1,500个问题。当前MLLMs表现远逊于人类,问题出在视觉感知而非推理上。
@ma_nanye: VSTAT 强调了人类与多模态大模型之间巨大的感知差距,但其意义远不止于此。其多样化的任务……
VSTAT 是一个用于视频视觉状态追踪的新基准,揭示了人类与多模态大模型之间的感知差距。
观看、记忆、推理:基于MLLMs的人类视角视频理解
一篇综述,以人类视角呈现对多模态大语言模型(MLLMs)进行视频理解的研究,围绕观看、记忆和推理能力组织,涵盖挑战、方法和应用。
LLaVA-OneVision-2:迈向下一代感知智能
LLaVA-OneVision-2 引入了编解码流分词和窗口注意力机制以实现高效的视频理解,在包括视频、空间和跟踪任务在内的多个多模态基准测试中取得了最先进的性能。
OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试
OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。