标签
一篇新的 arXiv 论文引入了 ActiveVision 基准测试,旨在测试重复视觉感知能力,发现前沿视觉模型如 GPT-5.5 和 Claude Fable 5 分别仅得分 10.6% 和 3.5%,而人类达到了 96.1%。