@ma_nanye: VSTAT 强调了人类与多模态大模型之间巨大的感知差距,但其意义远不止于此。其多样化的任务……

X AI KOLs Following 论文

摘要

VSTAT 是一个用于视频视觉状态追踪的新基准,揭示了人类与多模态大模型之间的感知差距。

VSTAT 强调了人类与多模态大模型之间巨大的感知差距,但其意义远不止于此。其多样化的任务不仅旨在评估简单的像素空间追踪,更在于衡量模型在视频潜在空间中捕捉和理解不断变化的世界状态的能力。文本只是探测这种能力的一种方式,我们期待未来的评估探索新模态,如像素、行动及其他! 开发这个基准的过程充满乐趣——衷心感谢我出色的合作者们!
查看原文
查看缓存全文

缓存时间: 2026/06/03 23:56

VSTAT 凸显了人类与多模态大语言模型(MLLMs)之间巨大的感知差距,但其意义远不止于此。其多样化的任务设计不仅旨在评估简单的像素空间追踪能力,更在于衡量模型如何在视频的潜在空间中捕捉并理解不断变化的世界状态。文本只是探测这种能力的一种方式,我们期待未来的评估能探索新的模态,如像素、动作等!

开发这一基准测试的过程充满乐趣——衷心感谢我优秀的合作者们!

Sihyun Yu (@sihyun_yu):
MLLMs 真的能追踪视频中发生的情况吗?
介绍 VSTAT 🎯,我们全新的视觉状态追踪基准测试。

任务很简单:数杯子、阅读打出的文字、数翻页次数。人类能轻松完成,MLLMs 却不行。

https://t.co/ZKqIDH5PcN

🧵 [1/11]

相似文章

多模态视频理解中视觉状态追踪的基准测试

Hugging Face Daily Papers

介绍VSTAT,一个用于评估多模态大语言模型(MLLMs)中视觉状态追踪的基准,包含834个片段和1,500个问题。当前MLLMs表现远逊于人类,问题出在视觉感知而非推理上。

LLaVA-OneVision-2:迈向下一代感知智能

Hugging Face Daily Papers

LLaVA-OneVision-2 引入了编解码流分词和窗口注意力机制以实现高效的视频理解,在包括视频、空间和跟踪任务在内的多个多模态基准测试中取得了最先进的性能。