active-observation

标签

Cards List
#active-observation

主动观察者的测试

arXiv cs.CL · 2天前 缓存

本文介绍了ActiveVision,一个用于评估多模态大语言模型主动观察能力的基准测试。前沿模型如GPT-5.5和Claude Fable 5表现不佳,分别仅解决了10.6%和3.5%的任务,而人类达到了96.1%,凸显了迭代视觉感知的缺失。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈