GPT-5.5 在 ActiveVision 上得分 10.6%,人类达到 96.1% [R]

Reddit r/MachineLearning 论文

摘要

一篇新的 arXiv 论文引入了 ActiveVision 基准测试,旨在测试重复视觉感知能力,发现前沿视觉模型如 GPT-5.5 和 Claude Fable 5 分别仅得分 10.6% 和 3.5%,而人类达到了 96.1%。

一篇新 [arXiv 论文](https://arxiv.org/abs/2607.16165) 中的一个有趣发现并非前沿视觉模型在新基准测试中失败——这种事情每周都会发生——而是失败的具体形态,以及模型无法通过编写自己的代码来修补这一事实。该基准测试名为 ActiveVision,包含 3 个类别下的 17 个任务,用作者的话说,旨在“强制进行重复视觉感知,而非单一的静态描述”。GPT-5.5 在最高暴露推理努力层级下解决了 10.6% 的题目,并在 17 个任务中的 11 个上得分为零。作者指出在大多数推理和编程排行榜上名列前茅的 Claude Fable 5,仅获得了 3.5%。三名人类参与者的平均正确率为 96.1%。
查看原文

相似文章

GPT-5.6 系列 (2分钟阅读)

TLDR AI

OpenAI发布了GPT-5.6系列模型,其中Sol是突出模型,在ARC-AGI-3公开测试中取得13.33%的成绩,并成为首个赢得游戏的模型,展示了在陌生环境中自我定位能力的提升。

GPT-4V(ision) 系统卡

OpenAI Blog

OpenAI 发布了 GPT-4V(ision) 的系统卡,详细说明其安全属性和评估结果。GPT-4V(ision) 在 GPT-4 的基础上增加了图像输入功能,支持多模态指令跟随和视觉分析。