为什么净化报告无法解决基准污染问题,评估者应如何应对 [D]

Reddit r/MachineLearning 新闻

摘要

文章指出,由于自我审计、数据泄露等限制,净化报告无法解决AI模型的基准污染问题,并提出应采用评估者控制的测试以确保可重复性。

二月份,OpenAI停止报告SWE-bench Verified成绩,并建议其他实验室也停止使用。在他们测试的所有前沿模型中,每个模型都能针对部分任务复现人工编写的参考修复方案,或逐字重复问题描述的细节。六个月来,进步仅止于六个百分点,且无法确定剩余分数中究竟有多少代表真实能力。构建该基准测试的实验室——本应最有理由保留它——却选择终止它。惯常的回应是提交净化报告:实验室声称检查了训练数据并一无所获。我撰文解释了此法不可行的三个原因,且这些原因不会因搜索技术改进而消失:- 实验室自查自纠。外部人员无权获取训练语料库,因此无法重新执行搜索。- 语料库无法公开。其中包含受版权保护的作品清单,公开将导致法律诉讼风险。- 匹配遗漏占大多数。改写文本、论坛教程、GitHub解决方案、基于基准测试生成的合成数据——模型可从任何来源习得答案,而无需逐字匹配。承诺和私有集合交集协议的效果不如表面所见:它们仅能证明实验室声明的语料库情况,而非模型实际训练数据。现有的训练证明方案已被证实可被欺骗。因此我认为应当反其道而行。由评估者控制测试:提交内容不得包含标签;评估过程断网运行;评估者根据指定提交记录自主构建代码并复现分数;尽可能在提交冻结后生成测试数据。只有被成功复现的结果才计数。我已搭建了一个简化版系统(表格模型、私有测试集、资助者发布问题及基准线)。该帖坦诚说明了其无法证明的事项:基准测试本身的质量、隐藏测试集是否会被反复提交榨取信息、资助者是否泄露标签、第三方是否能在无数据情况下重新运行。其中第二点是我希望最先弥补的缺口。https://holdoutlabs-ai.github.io/reproduce-it-or-it-doesnt-count/ 若论证存在疏漏,望指正。
查看原文

相似文章

AI模型构建者的不稳定指标与基准测试文化

arXiv cs.AI

本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。