Humanity's Last Exam 当前基准测试成绩思考?
摘要
讨论近期AI模型在'Humanity's Last Exam'基准测试中的得分,指出从2024年5月GPT-4o的2.7%提升至2026年6月左右45%,并对该考试的难度提出疑问。
那么,一些最近的模型在该考试中得了大约45%的分数。这是2026年6月的成绩……但在2024年5月,GPT-4o得了2.7%。就我看来,这似乎是不错的进步。但我想问,这个考试真的那么难吗?
相似文章
Fable 通过“当 AI 通过这项测试,务必警惕”测试
Claude Fable 在“人类最后的考试”(Humanity's Last Exam)基准测试中取得 53% 的成绩,比预期的 2025 年底里程碑更早达到,表明 AI 进展迅速。
当所有AI都在基准测试上达到100%之后会发生什么
这篇文章推测当所有AI模型在基准测试上都达到100%时会发生什么,质疑它们将如何展示优越性。
研究警告:AI已能比人类更出色地通过图灵测试
一项发表在PNAS上的新研究表明,诸如GPT-4.5等先进LLM已能通过图灵测试,且参与者认为它们比真人更具人性,这一结果促使学界重新审视该测试的衡量标准。
还有人觉得AI基准测试在预测实际性能方面越来越没用了吗?
本文讨论了AI基准测试高分与实际真实表现之间日益扩大的差距,重点强调了诸如一致性、延迟和上下文处理等问题。
@cline:5个月前,Artificial Analysis Intelligence Index上的最高分是51(GPT-5.4 xhigh)。本周DeepSeek V4-…
一条推文指出,DeepSeek V4-Flash在Artificial Analysis Intelligence Index上获得了50分,接近五个月前GPT-5.4的51分,并预测本地模型将在两年内成为主流选择。