GPT-5.5 在 ActiveVision 上得分 10.6%,人类达到 96.1% [R]

Reddit r/MachineLearning 论文

摘要

一篇新的 arXiv 论文引入了 ActiveVision 基准测试,旨在测试重复视觉感知能力,发现前沿视觉模型如 GPT-5.5 和 Claude Fable 5 分别仅得分 10.6% 和 3.5%,而人类达到了 96.1%。

一篇新 [arXiv 论文](https://arxiv.org/abs/2607.16165) 中的一个有趣发现并非前沿视觉模型在新基准测试中失败——这种事情每周都会发生——而是失败的具体形态,以及模型无法通过编写自己的代码来修补这一事实。该基准测试名为 ActiveVision,包含 3 个类别下的 17 个任务,用作者的话说,旨在“强制进行重复视觉感知,而非单一的静态描述”。GPT-5.5 在最高暴露推理努力层级下解决了 10.6% 的题目,并在 17 个任务中的 11 个上得分为零。作者指出在大多数推理和编程排行榜上名列前茅的 Claude Fable 5,仅获得了 3.5%。三名人类参与者的平均正确率为 96.1%。
查看原文

相似文章

主动观察者的测试

arXiv cs.CL

本文介绍了ActiveVision,一个用于评估多模态大语言模型主动观察能力的基准测试。前沿模型如GPT-5.5和Claude Fable 5表现不佳,分别仅解决了10.6%和3.5%的任务,而人类达到了96.1%,凸显了迭代视觉感知的缺失。