污染虚增分数,但很少重排大型语言模型排行榜
摘要
本文表明,基准污染会提高大型语言模型的绝对分数,但很少改变排行榜排名。通过使用一种控制释义的措施,表明污染在公共模型中大体上是均匀的。
查看缓存全文
缓存时间: 2026/09/04 05:52
# 数据污染会抬高分数,但极少改变大语言模型排行榜顺序 来源:https://arxiv.org/abs/2609.02899 查看PDF(https://arxiv.org/pdf/2609.02899) > 摘要:基准测试污染——测试题目泄露至训练数据——被普遍视为威胁大语言模型(LLM)排行榜的可靠性。我们认为这种担忧混淆了两个不同问题:污染是否会抬高绝对分数,以及是否会改变模型间的排序。我们将污染重新定义为对锚定题目不变性原则的违反,并通过原始题目与语义等效改写题目之间的差异功能表现来量化这一影响——这种单题目对比方法能固定被测技能维度,将记忆能力与真实能力区分开来。基于47个公开发布的模型和74个使用已知污染剂量进行微调的模型在四项基准测试(ARC、GSM8K、HellaSwag、MMLU)上的逐实例响应数据,我们首先依据真值校准该度量方法:它能够准确反映注入污染的剂量效应(测试集泄露带来+0.187准确率点的校正效应),且从未对仅使用合法训练集训练的负控制模型产生误报(-0.012)。随后我们量化了对排行榜的影响:标准排行榜与改写控制排行榜的秩相关性高达0.997,敏感性分析表明观察到的差异污染水平远低于影响排名所需的阈值,在188个模型-基准测试案例中仅有3例出现经两份参考文献交叉验证的差异污染。因此这些公开模型中的污染程度大体均匀:它抬高绝对分数但不改变排行榜顺序,排名失真仅在罕见的差异化污染情况下才会发生。我们提供了经过校准的不变性审计方法,并作为参考实现发布,同时建议排行榜在呈现排名时附带改写控制排名及置信区间。 ## 提交历史 来自:肖兴耀[查看邮箱 (https://arxiv.org/show-email/51cdad11/2609.02899)] **[版本1]** 2026年7月5日(周日)00:55:18 UTC(91 KB)
相似文章
Excess Separability: Nuisance-Controlled Residual-Stream Probing for Benchmark Contamination Detection
This paper proposes a nuisance-controlled residual-stream probing protocol to detect benchmark contamination in language models, showing that naive probing fails and their corrected method controls false positives while achieving reasonable power.
Know2Guess:一种面向大型语言模型知识边界评估的污染感知多区域基准
本文介绍了Know2Guess,一种污染感知的多区域基准,旨在评估大型语言模型从可回答知识到预期拒答的转换,解决数据污染、提示敏感性和拒绝行为问题。作者评估了FLAN-T5、Qwen2.5-Instruct和Llama-3-Instruct模型,发现更强的模型表现出选择性但不完全的拒答。该基准和数据集已公开发布。
多大型语言模型基准测试的可证明联合去污
提出联合包络符合选择(JECS),一种用于多模型基准去污的符合程序,可证明地控制全局污染率,同时保持比基线更高的统计功效。
评估盲点:大语言模型基准覆盖的体视学理论
本文运用体视学理论分析大语言模型基准,揭示当前排行榜仅测量3-5个独立维度,产生的几何盲点主导统计噪声。文章提供了基准覆盖的理论界限,并提出一个用于高效基准选择的子模算法。
不确定但确信:揭示扩散语言模型中的表征-置信度差距
本文识别出扩散语言模型中的“表征置信度差距”:内部状态能准确检测输入噪声,但报告的置信度在高噪声下仍保持高位,答案排序能力下降。本文引入了一种轻量级、无需训练的信息提取工具,利用隐藏状态改进排序,而无需修改基础模型。