@paul_cal: 对Humanity's Last Exam声称的问题进行了怀疑性的深入研究... 是的,我检查的所有问题都确实是错的。

X AI KOLs Timeline 新闻

摘要

一次怀疑性的深入研究发现Humanity's Last Exam基准测试中存在许多错误,官方的o3-mini评分器错误地标记正确答案为错误。

对Humanity's Last Exam声称的问题进行了怀疑性的深入研究... 是的,我检查的所有问题都确实是错的。在一个例子中,我检查了官方的HLM评分器设置(o3-mini)遵循答案键并标记正确答案为错误的频率:每次都是。
查看原文
查看缓存全文

缓存时间: 2026/09/20 13:18

对“人类终极考试“的争议点做了一番深入调查……果然,我查阅的所有题目确实都有问题。其中一个案例里,我检验了官方评卷系统(o3-mini)对照答案卷的评判结果:每一次都会把正确答案标为错误。

Ben Spitz(63/100 即兴餐食改进率)(@DiracDeltaFunk): 让我惊讶的是大多数基准测试似乎都糟糕得离谱。《人类终极考试》居然有约50%的答案是错误的???这么多明显错误怎么能在基准测试发布前无人发现?

相似文章