Humanity's Last Exam 当前基准测试成绩思考?

Reddit r/singularity 新闻

摘要

讨论近期AI模型在'Humanity's Last Exam'基准测试中的得分,指出从2024年5月GPT-4o的2.7%提升至2026年6月左右45%,并对该考试的难度提出疑问。

那么,一些最近的模型在该考试中得了大约45%的分数。这是2026年6月的成绩……但在2024年5月,GPT-4o得了2.7%。就我看来,这似乎是不错的进步。但我想问,这个考试真的那么难吗?
查看原文

相似文章

Human Bench 3.0,Humanity-2 AI-0

Reddit r/singularity

介绍 Human Bench 3.0,一个用于评估 AI 系统与人类表现对比的基准,Humanity-2 AI-0 可能表示特定的分数或版本。