GPT-5.5 在 ActiveVision 上得分 10.6%,人类达到 96.1% [R]
摘要
一篇新的 arXiv 论文引入了 ActiveVision 基准测试,旨在测试重复视觉感知能力,发现前沿视觉模型如 GPT-5.5 和 Claude Fable 5 分别仅得分 10.6% 和 3.5%,而人类达到了 96.1%。
一篇新 [arXiv 论文](https://arxiv.org/abs/2607.16165) 中的一个有趣发现并非前沿视觉模型在新基准测试中失败——这种事情每周都会发生——而是失败的具体形态,以及模型无法通过编写自己的代码来修补这一事实。该基准测试名为 ActiveVision,包含 3 个类别下的 17 个任务,用作者的话说,旨在“强制进行重复视觉感知,而非单一的静态描述”。GPT-5.5 在最高暴露推理努力层级下解决了 10.6% 的题目,并在 17 个任务中的 11 个上得分为零。作者指出在大多数推理和编程排行榜上名列前茅的 Claude Fable 5,仅获得了 3.5%。三名人类参与者的平均正确率为 96.1%。
相似文章
配备工具后的GPT-5.5在BabyVision基准上已超越10岁儿童水平
GPT-5.5在配备工具后,在BabyVision基准测试中的表现已超越10岁儿童,标志着AI视觉推理能力的显著进步。
Claude Fable 在 ZeroBench(高难度视觉基准测试)上已赶超 GPT
Claude Fable 在具有挑战性的 ZeroBench 视觉基准测试中与 GPT 性能持平,pass@5 和 pass^5 得分相当。
@xeophon: 51与GPT-5.4 xhigh得分相同,顺便说一下。该模型于3个月前发布,当时处于前沿
Z AI的GLM-5.2开放权重模型在Artificial Analysis Intelligence Index上获得51分,与GPT-5.4 xhigh持平,并且处于智能与每任务成本的帕累托前沿。
GPT-5.6 系列 (2分钟阅读)
OpenAI发布了GPT-5.6系列模型,其中Sol是突出模型,在ARC-AGI-3公开测试中取得13.33%的成绩,并成为首个赢得游戏的模型,展示了在陌生环境中自我定位能力的提升。
GPT-4V(ision) 系统卡
OpenAI 发布了 GPT-4V(ision) 的系统卡,详细说明其安全属性和评估结果。GPT-4V(ision) 在 GPT-4 的基础上增加了图像输入功能,支持多模态指令跟随和视觉分析。