@PinzhiHuang: 状态追踪是视频理解的核心支柱:它需要识别实体和事件,并映射它们如何随时间演变…
摘要
介绍VSTAT,一个衡量多模态大语言模型在视频中追踪状态能力的新基准,揭示前沿模型在人类认为简单的任务上表现不佳。
查看缓存全文
缓存时间: 2026/06/03 03:42
状态追踪是视频理解的核心支柱:它需要识别实体和事件,并映射它们的状态如何随时间演变。
前沿多模态模型在此方面表现惊人地糟糕,因此我们构建了一个基准来评估它。
认识一下 VSTAT!
论文:https://arxiv.org/abs/2606.03920 网站:https://vision-x-nyu.github.io/vstat-site/ GitHub:https://github.com/vision-x-nyu/vstat… HF:https://huggingface.co/datasets/nyu-visionx/vstat…
我很感激能与这些出色的合作者共事:@sihyun_yu 和 @ma_nanye,以及 @hyunseok_i @shushengyang @ellisbrown @ojmichel4 @boyangzheng @JinwooShin0417!!!
感谢 @sainingxie 指导这个项目,并且还设计了一个有趣的 VSTAT 任务!
相似文章
多模态视频理解中视觉状态追踪的基准测试
介绍VSTAT,一个用于评估多模态大语言模型(MLLMs)中视觉状态追踪的基准,包含834个片段和1,500个问题。当前MLLMs表现远逊于人类,问题出在视觉感知而非推理上。
@ma_nanye: VSTAT 强调了人类与多模态大模型之间巨大的感知差距,但其意义远不止于此。其多样化的任务……
VSTAT 是一个用于视频视觉状态追踪的新基准,揭示了人类与多模态大模型之间的感知差距。
StateSight: 视觉语言模型中潜在空间状态重建的基准测试
StateSight是一个用于评估视觉语言模型空间状态重建的新基准,显示像GPT-5.5和Claude Sonnet 5这样的模型在空间推理任务上与人类表现相比存在困难。
观看、记忆、推理:基于MLLMs的人类视角视频理解
一篇综述,以人类视角呈现对多模态大语言模型(MLLMs)进行视频理解的研究,围绕观看、记忆和推理能力组织,涵盖挑战、方法和应用。
LLaVA-OneVision-2:迈向下一代感知智能
LLaVA-OneVision-2 引入了编解码流分词和窗口注意力机制以实现高效的视频理解,在包括视频、空间和跟踪任务在内的多个多模态基准测试中取得了最先进的性能。