visual-state-tracking

标签

Cards List
#visual-state-tracking

@ma_nanye: VSTAT 强调了人类与多模态大模型之间巨大的感知差距,但其意义远不止于此。其多样化的任务……

X AI KOLs Following · 2026-06-03 缓存

VSTAT 是一个用于视频视觉状态追踪的新基准,揭示了人类与多模态大模型之间的感知差距。

0 人收藏 0 人点赞
#visual-state-tracking

多模态视频理解中视觉状态追踪的基准测试

Hugging Face Daily Papers · 2026-06-02 缓存

介绍VSTAT,一个用于评估多模态大语言模型(MLLMs)中视觉状态追踪的基准,包含834个片段和1,500个问题。当前MLLMs表现远逊于人类,问题出在视觉感知而非推理上。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈