为什么净化报告无法解决基准污染问题,评估者应如何应对 [D]
摘要
文章指出,由于自我审计、数据泄露等限制,净化报告无法解决AI模型的基准污染问题,并提出应采用评估者控制的测试以确保可重复性。
二月份,OpenAI停止报告SWE-bench Verified成绩,并建议其他实验室也停止使用。在他们测试的所有前沿模型中,每个模型都能针对部分任务复现人工编写的参考修复方案,或逐字重复问题描述的细节。六个月来,进步仅止于六个百分点,且无法确定剩余分数中究竟有多少代表真实能力。构建该基准测试的实验室——本应最有理由保留它——却选择终止它。惯常的回应是提交净化报告:实验室声称检查了训练数据并一无所获。我撰文解释了此法不可行的三个原因,且这些原因不会因搜索技术改进而消失:- 实验室自查自纠。外部人员无权获取训练语料库,因此无法重新执行搜索。- 语料库无法公开。其中包含受版权保护的作品清单,公开将导致法律诉讼风险。- 匹配遗漏占大多数。改写文本、论坛教程、GitHub解决方案、基于基准测试生成的合成数据——模型可从任何来源习得答案,而无需逐字匹配。承诺和私有集合交集协议的效果不如表面所见:它们仅能证明实验室声明的语料库情况,而非模型实际训练数据。现有的训练证明方案已被证实可被欺骗。因此我认为应当反其道而行。由评估者控制测试:提交内容不得包含标签;评估过程断网运行;评估者根据指定提交记录自主构建代码并复现分数;尽可能在提交冻结后生成测试数据。只有被成功复现的结果才计数。我已搭建了一个简化版系统(表格模型、私有测试集、资助者发布问题及基准线)。该帖坦诚说明了其无法证明的事项:基准测试本身的质量、隐藏测试集是否会被反复提交榨取信息、资助者是否泄露标签、第三方是否能在无数据情况下重新运行。其中第二点是我希望最先弥补的缺口。https://holdoutlabs-ai.github.io/reproduce-it-or-it-doesnt-count/ 若论证存在疏漏,望指正。
相似文章
要么复现,否则无效:为何训练端去污无法验证,以及评估端规则是什么样的 [D]
文章认为,由于固有的信任和检查问题,AI模型的训练端去污无法验证,并提出了一个评估端规则,通过控制评估过程来确保可复现性。
When Is Benchmark Contamination Detectable? Information Limits and Power-Calibrated Audits
This paper formalizes when benchmark contamination is detectable, deriving information-theoretic limits and proposing power-calibrated audits that distinguish a clean benchmark from a powerless detector. It reports two-sided empirical findings on calibration efficacy and validity gates.
@charliermarsh: 这些报告中有很多好的例子。例如:在DeepSWE v1.1中,验证器会丢弃智能体对某些…
Epoch AI 推出了 Benchmark Reviews,用于审计 AI 基准测试,揭示了 DeepSWE v1.1 等案例中验证器在不通知模型的情况下丢弃更改,导致失败的缺陷。
基准审计中的可靠性差距:分布偏移与规模作为污染检测的失效模式
本文识别出分布偏移和规模约束是LLM基准审计中统计污染检测方法的关键失效模式。对27个模型评估三种范式的结果显示,在335次评估中仅有199次正确结果,表明存在系统性可靠性差距,使得这些方法无法替代透明数据溯源。
AI模型构建者的不稳定指标与基准测试文化
本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。