opus 4.8 仍然非常盲目 - EyeBench-V3 视觉基准测试(类似于 IBench)
摘要
EyeBench-V3 视觉基准测试评估了 Claude Opus 4.8,发现它仍然无法完成基本视觉任务,这与 IBench 类似。该基准测试是通过 Adonis Singh 的 Twitter 帖子介绍的。
https://preview.redd.it/22texjo58l4h1.png?width=3340&format=png&auto=webp&s=73039f304a4ee253ca214b3378cc14a83909fc62 [https://x.com/adonis\_singh/status/2060133072482324521](https://x.com/adonis_singh/status/2060133072482324521) [https://x.com/search?q=eyebench-v3%20(from%3Aadonis\_singh)&f=top&src=typed\_query](https://x.com/search?q=eyebench-v3%20(from%3Aadonis_singh)&f=top&src=typed_query) [https://x.com/adonis\_singh/status/2031516746570469837](https://x.com/adonis_singh/status/2031516746570469837) \- 基准测试介绍帖子
相似文章
OpenAI的新芯片在基准测试中超越了Vera Rubin
OpenAI发布了一款新芯片,其性能超越了Vera Rubin基准测试,标志着AI硬件开发取得了进展。
GameXpert-Bench: 编程代理距离专家游戏开发还有多远?
本文介绍了GameXpert-Bench,一个包含三个轨道的基准测试,用于评估编程代理在游戏创建、错误修复和优化方面的开发能力。研究发现,当前代理在初始生成方面优于缺陷发现和多轮优化。
大型语言模型中的激活控制测量
本文介绍了激活可控性基准测试,用于衡量大型语言模型通过自然语言指令调节其残差流的能力,发现大多数模型都能在一定程度上做到这一点,这可能会逃避基于激活的监控方法,并对人工智能安全构成风险。
K-Bench:评估模型在真实科学代理请求中的性能
论文介绍了 K-Bench 01,一个用于评估 AI 代理在真实科学请求中性能的基准,揭示了没有模型能持续达到可接受性能的阈值,过度声明是常见的失败模式。
GUI-Primitives:诊断视觉-语言GUI定位中的空间推理失败
本文介绍了GUI-Primitives,这是一个包含994个对比指令对的基准,用于诊断视觉-语言模型在GUI定位中的空间推理失败,揭示了大多数失败源于候选定位而非关系理解。