@ma_nanye: VSTAT 强调了人类与多模态大模型之间巨大的感知差距,但其意义远不止于此。其多样化的任务……
摘要
VSTAT 是一个用于视频视觉状态追踪的新基准,揭示了人类与多模态大模型之间的感知差距。
查看缓存全文
缓存时间: 2026/06/03 23:56
VSTAT 凸显了人类与多模态大语言模型(MLLMs)之间巨大的感知差距,但其意义远不止于此。其多样化的任务设计不仅旨在评估简单的像素空间追踪能力,更在于衡量模型如何在视频的潜在空间中捕捉并理解不断变化的世界状态。文本只是探测这种能力的一种方式,我们期待未来的评估能探索新的模态,如像素、动作等!
开发这一基准测试的过程充满乐趣——衷心感谢我优秀的合作者们!
Sihyun Yu (@sihyun_yu):
MLLMs 真的能追踪视频中发生的情况吗?
介绍 VSTAT 🎯,我们全新的视觉状态追踪基准测试。任务很简单:数杯子、阅读打出的文字、数翻页次数。人类能轻松完成,MLLMs 却不行。
https://t.co/ZKqIDH5PcN
🧵 [1/11]
相似文章
多模态视频理解中视觉状态追踪的基准测试
介绍VSTAT,一个用于评估多模态大语言模型(MLLMs)中视觉状态追踪的基准,包含834个片段和1,500个问题。当前MLLMs表现远逊于人类,问题出在视觉感知而非推理上。
@PinzhiHuang: 状态追踪是视频理解的核心支柱:它需要识别实体和事件,并映射它们如何随时间演变…
介绍VSTAT,一个衡量多模态大语言模型在视频中追踪状态能力的新基准,揭示前沿模型在人类认为简单的任务上表现不佳。
Mind's Eye:面向多模态大模型的视觉抽象、变换与组合基准
研究者推出 Mind’s Eye,一项包含八道视觉认知任务的基准测试,显示顶级多模态大模型得分不足 50%,而人类可达 80%,暴露出视觉抽象、关系映射与心理变换方面的巨大差距。
MuseBench: 对多模态大语言模型中意图层面视听艺术理解的基准评估
MuseBench是一个全面基准,旨在评估多模态大语言模型对视听艺术中细微意图层面的理解,结果显示即使最佳模型也仅达到48.29%的准确率,而人类专家为87.18%。
LLaVA-OneVision-2:迈向下一代感知智能
LLaVA-OneVision-2 引入了编解码流分词和窗口注意力机制以实现高效的视频理解,在包括视频、空间和跟踪任务在内的多个多模态基准测试中取得了最先进的性能。