GPT-5.5 在 ActiveVision 上得分 10.6%,人类达到 96.1% [R]
摘要
一篇新的 arXiv 论文引入了 ActiveVision 基准测试,旨在测试重复视觉感知能力,发现前沿视觉模型如 GPT-5.5 和 Claude Fable 5 分别仅得分 10.6% 和 3.5%,而人类达到了 96.1%。
一篇新 [arXiv 论文](https://arxiv.org/abs/2607.16165) 中的一个有趣发现并非前沿视觉模型在新基准测试中失败——这种事情每周都会发生——而是失败的具体形态,以及模型无法通过编写自己的代码来修补这一事实。该基准测试名为 ActiveVision,包含 3 个类别下的 17 个任务,用作者的话说,旨在“强制进行重复视觉感知,而非单一的静态描述”。GPT-5.5 在最高暴露推理努力层级下解决了 10.6% 的题目,并在 17 个任务中的 11 个上得分为零。作者指出在大多数推理和编程排行榜上名列前茅的 Claude Fable 5,仅获得了 3.5%。三名人类参与者的平均正确率为 96.1%。
相似文章
主动观察者的测试
本文介绍了ActiveVision,一个用于评估多模态大语言模型主动观察能力的基准测试。前沿模型如GPT-5.5和Claude Fable 5表现不佳,分别仅解决了10.6%和3.5%的任务,而人类达到了96.1%,凸显了迭代视觉感知的缺失。
配备工具后的GPT-5.5在BabyVision基准上已超越10岁儿童水平
GPT-5.5在配备工具后,在BabyVision基准测试中的表现已超越10岁儿童,标志着AI视觉推理能力的显著进步。
Claude Fable 在 ZeroBench(高难度视觉基准测试)上已赶超 GPT
Claude Fable 在具有挑战性的 ZeroBench 视觉基准测试中与 GPT 性能持平,pass@5 和 pass^5 得分相当。
GPT 5.6 Sol 是 OpenAI 迄今发布的最佳“视觉”模型
OpenAI 的 GPT-5.6 Sol 在基准测试中被评估为该公司迄今最强的视觉模型,与 GPT-5.5 等前代模型相比,在物体检测和其他视觉任务上表现出显著提升。
GPT-5.6 vs. Claude Fable 5 物理AI对决:谁更胜一筹?
JuliaHub 在五个物理建模问题上对 GPT-5.6 和 Claude Fable 5 进行了测试。Claude Fable 5 以 0.889 的加权得分名列前茅,而 GPT-5.6 的变体得分较低,但更便宜且速度更快。