[论文] 主要基准测试被发现存在污染,多达12%的问题有缺陷

Reddit r/singularity 论文

摘要

本文审查了主要的LLM基准测试(GPQA、MMLU-Pro、MMMU-Pro),发现4.5%至11.8%的项目存在错误答案键或格式错误,并发布了修正后的‘Clean’版本供直接使用。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/28 20:28

adamallcock/answer-key-audit

来源:https://github.com/adamallcock/answer-key-audit

当答案键是错的

GPQA、MMLU-Pro 和 MMMU-Pro 的校准审计——附修正版发布

Adam Allcock,2026

📄 阅读论文(PDF) · DOI (https://doi.org/10.5281/zenodo.21613590) · arXiv:即将发布

各基准测试中有问题题目的比例

公共大语言模型排行榜将模型排名精确到千分之一——但凭借的却是本身就有错的答案键。对四个最常被引用的选择题基准测试按照同一分类体系(错误答案键、格式错误题目、存在多个可辩护答案的问题)进行审计后发现,4.5%–11.8% 的题目无法公平地为模型评分,而对照饱和的 MATH-500 测试,其问题率几乎为零。

我们不仅仅是诊断——我们还提供了修复方案:所有四个基准测试都已发布修正后的 即插即用的“-Clean”版本,附带每个题目置信度等级、完整的被标记题目明细,以及原始与修正后的双评分结果,因此现有评估框架无需任何代码改动即可重新评分。

有两个结果超越了这些数据集:我们的模型裁定结果与 GPQA 自身记录中的专家分歧情况一致(外部验证,非循环验证);而标准的一次性分歧方法将问题率 低估了 2.3 倍。审计本身也是一种测量工具,因此我们针对注入的缺陷和从未被标记的对照组进行了校准,并以区间(而非单点)的形式报告比率。结果经过了模型裁定和校准——而非人工认证。

修正后的即插即用版本(-Clean 系列)

版本来源原题数 → 清理后许可证
gpqa-diamond-clean (https://github.com/adamallcock/gpqa-diamond-clean)GPQA Diamond198 → 189CC BY 4.0
gpqa-ext-complement-clean (https://github.com/adamallcock/gpqa-ext-complement-clean)GPQA Extended(不含 Diamond)348 → 309CC BY 4.0
mmlu-pro-clean (https://github.com/adamallcock/mmlu-pro-clean)MMLU-Pro12,032 → 10,689MIT
mmmu-pro-clean (https://github.com/adamallcock/mmmu-pro-clean)MMMU-Pro(标准版,10选项)1,730 → 1,526Apache-2.0

每个版本均为即插即用:能运行原始版本的框架无需改动即可运行 -Clean 版本,并且每次删除的题目都可逐题审计。

引用

Allcock, A. (2026). When the Answer Key Is Wrong: A Calibrated Audit of GPQA, MMLU-Pro, and MMMU-Pro, with Corrected Releases. Zenodo. https://doi.org/10.5281/zenodo.21613590

@misc{allcock2026answerkey,
  title     = {When the Answer Key Is Wrong: A Calibrated Audit of GPQA, MMLU-Pro, and MMMU-Pro, with Corrected Releases},
  author    = {Allcock, Adam},
  year      = {2026},
  doi       = {10.5281/zenodo.21613590},
  publisher = {Zenodo}
}

相似文章

量化LLM基准中的排名不确定性

arXiv cs.LG

本文分析了MMLU等LLM基准中排名不确定性的来源,提出了对假设检验的修改,以构建排名置信区间,并表明不同主题间的变异性很大。

对概率算子进行逻辑推理的LLM能力基准测试

arXiv cs.CL

本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。

使用项目反应理论审计LLM基准测试

arXiv cs.CL

本文介绍了一种基于项目反应理论的方法,能够以95%的准确率检测LLM基准测试中的错误标注示例,并将错误追溯到标注启发式方法和注释问题。