@paul_cal: 对Humanity's Last Exam声称的问题进行了怀疑性的深入研究... 是的,我检查的所有问题都确实是错的。
摘要
一次怀疑性的深入研究发现Humanity's Last Exam基准测试中存在许多错误,官方的o3-mini评分器错误地标记正确答案为错误。
查看缓存全文
缓存时间: 2026/09/20 13:18
对“人类终极考试“的争议点做了一番深入调查……果然,我查阅的所有题目确实都有问题。其中一个案例里,我检验了官方评卷系统(o3-mini)对照答案卷的评判结果:每一次都会把正确答案标为错误。
Ben Spitz(63/100 即兴餐食改进率)(@DiracDeltaFunk): 让我惊讶的是大多数基准测试似乎都糟糕得离谱。《人类终极考试》居然有约50%的答案是错误的???这么多明显错误怎么能在基准测试发布前无人发现?
相似文章
Humanity's Last Exam 当前基准测试成绩思考?
讨论近期AI模型在'Humanity's Last Exam'基准测试中的得分,指出从2024年5月GPT-4o的2.7%提升至2026年6月左右45%,并对该考试的难度提出疑问。
[论文] 主要基准测试被发现存在污染,多达12%的问题有缺陷
本文审查了主要的LLM基准测试(GPQA、MMLU-Pro、MMMU-Pro),发现4.5%至11.8%的项目存在错误答案键或格式错误,并发布了修正后的‘Clean’版本供直接使用。
我在SWE-bench Verified Mini(50个任务)上基准测试了Ox Alpha:96%的问题已解决。现在我对自己产生了怀疑。
作者在SWE-bench Verified Mini上对Ox Alpha进行了基准测试,达到了96%的解决率,但对分数的有效性提出了担忧,原因包括数据污染、小样本量和不可比较的基线。
不良基准测试与评估:Senior SWE-Bench、粗略估算及冬季轮胎
本文批判了多种基准测试中的缺陷,涵盖性能评估工具如粗略估算、AI模型评估如DeepSWE与Senior SWE-Bench,以及使用汽车轮胎的类比,旨在揭示基准测试的常见问题。
@FudanUniversity: 复旦大学期末考试:学生不回答问题,而是出题——旨在难倒AI。51名学生,每人10道题,3个AI模型…
复旦大学举办了一场别开生面的期末考试,51名学生每人编写了10道问题,旨在难倒三个AI模型(Claude、DeepSeek、MiniMax),成绩根据这些问题对AI的难度而定。