污染虚增分数,但很少重排大型语言模型排行榜

arXiv cs.CL 论文

摘要

本文表明,基准污染会提高大型语言模型的绝对分数,但很少改变排行榜排名。通过使用一种控制释义的措施,表明污染在公共模型中大体上是均匀的。

arXiv:2609.02899v1 公告类型:新 摘要:基准污染,即测试项目泄露到训练数据中,被广泛描述为对大型语言模型(LLM)排行榜可靠性的威胁。我们认为这一担忧混淆了两个不同的问题:污染是否虚增绝对分数,以及是否重排模型排名。我们将污染重新定义为违反锚项不变性,并通过原始与语义等价释义项目的差异功能来测量,这是一种项目内对比,固定了测量的技能,将记忆与能力隔离。使用47个公开发布的模型和74个使用已知剂量污染微调的模型的每个实例响应,跨四个基准(ARC, GSM8K, HellaSwag, MMLU),我们首先针对基准事实校准测量:它响应性恢复注入的污染剂量(测试集泄露的校正效应为+0.187准确率点),并且从未标记仅在合法训练集上训练的负对照模型(-0.012)。然后我们量化排行榜影响:标准排行榜与控制释义排行榜之间的排名相关性为0.997,敏感性分析表明观察到的差异污染远低于移动排名所需的水平,只有188个模型-基准案例中的3个显示出跨两个参考确认的差异污染。因此,这些公共模型之间的污染大体上均匀:它虚增绝对分数而不重排排行榜,排名扭曲需要罕见的差异污染情况。我们提供了一个校准的不变性审计,作为参考实现发布,并建议排行榜在报告置信区间的同时报告控制释义的排名。
查看原文
查看缓存全文

缓存时间: 2026/09/04 05:52

# 数据污染会抬高分数,但极少改变大语言模型排行榜顺序
来源:https://arxiv.org/abs/2609.02899
查看PDF(https://arxiv.org/pdf/2609.02899)

> 摘要:基准测试污染——测试题目泄露至训练数据——被普遍视为威胁大语言模型(LLM)排行榜的可靠性。我们认为这种担忧混淆了两个不同问题:污染是否会抬高绝对分数,以及是否会改变模型间的排序。我们将污染重新定义为对锚定题目不变性原则的违反,并通过原始题目与语义等效改写题目之间的差异功能表现来量化这一影响——这种单题目对比方法能固定被测技能维度,将记忆能力与真实能力区分开来。基于47个公开发布的模型和74个使用已知污染剂量进行微调的模型在四项基准测试(ARC、GSM8K、HellaSwag、MMLU)上的逐实例响应数据,我们首先依据真值校准该度量方法:它能够准确反映注入污染的剂量效应(测试集泄露带来+0.187准确率点的校正效应),且从未对仅使用合法训练集训练的负控制模型产生误报(-0.012)。随后我们量化了对排行榜的影响:标准排行榜与改写控制排行榜的秩相关性高达0.997,敏感性分析表明观察到的差异污染水平远低于影响排名所需的阈值,在188个模型-基准测试案例中仅有3例出现经两份参考文献交叉验证的差异污染。因此这些公开模型中的污染程度大体均匀:它抬高绝对分数但不改变排行榜顺序,排名失真仅在罕见的差异化污染情况下才会发生。我们提供了经过校准的不变性审计方法,并作为参考实现发布,同时建议排行榜在呈现排名时附带改写控制排名及置信区间。

## 提交历史
来自:肖兴耀[查看邮箱 (https://arxiv.org/show-email/51cdad11/2609.02899)] **[版本1]** 2026年7月5日(周日)00:55:18 UTC(91 KB)

相似文章

Know2Guess:一种面向大型语言模型知识边界评估的污染感知多区域基准

arXiv cs.CL

本文介绍了Know2Guess,一种污染感知的多区域基准,旨在评估大型语言模型从可回答知识到预期拒答的转换,解决数据污染、提示敏感性和拒绝行为问题。作者评估了FLAN-T5、Qwen2.5-Instruct和Llama-3-Instruct模型,发现更强的模型表现出选择性但不完全的拒答。该基准和数据集已公开发布。

评估盲点:大语言模型基准覆盖的体视学理论

arXiv cs.LG

本文运用体视学理论分析大语言模型基准,揭示当前排行榜仅测量3-5个独立维度,产生的几何盲点主导统计噪声。文章提供了基准覆盖的理论界限,并提出一个用于高效基准选择的子模算法。

不确定但确信:揭示扩散语言模型中的表征-置信度差距

arXiv cs.CL

本文识别出扩散语言模型中的“表征置信度差距”:内部状态能准确检测输入噪声,但报告的置信度在高噪声下仍保持高位,答案排序能力下降。本文引入了一种轻量级、无需训练的信息提取工具,利用隐藏状态改进排序,而无需修改基础模型。