使用项目反应理论审计LLM基准测试
摘要
本文介绍了一种基于项目反应理论的方法,能够以95%的准确率检测LLM基准测试中的错误标注示例,并将错误追溯到标注启发式方法和注释问题。
arXiv:2605.30504v1 公告类型:新
摘要:LLM基准测试的标签在发布时被冻结,并连同错误一起无声地传播到下游基准测试中。我们引入了一种基于项目反应理论的指标,在七个偏好和多项选择基准测试中,使用114个模型的响应,在前200个示例中以95%的准确率识别出可能的错误标签,优于监督分类器。我们将这些错误追溯到机械标注启发式方法、从源数据集中继承的未改变的上级注释错误,以及根本上模糊且没有合理单一标签的项目。相同的模型拟合揭示,奖励模型专门研究风格偏好而非事实知识,并识别出一个前沿奖励模型,其对检测到的错误标签的准确率为78%,而同类模型为38%,这与基准污染或基准特定过度优化一致。
查看缓存全文
缓存时间: 2026/06/01 09:24
# 使用项目反应理论审计大语言模型基准测试 来源:https://arxiv.org/abs/2605.30504 查看PDF (https://arxiv.org/pdf/2605.30504) > 摘要:大语言模型(LLM)基准测试的标签在发布时即被冻结,并连同所有错误一起无声地传播到下游基准测试中。我们引入了一种基于项目反应理论的指标,能够根据114个模型的响应,在七个偏好和多项选择基准测试的前200个样本中,以95%的精确度识别出可能的错误标签,其性能优于有监督分类器。我们将这些错误追溯至机械式标注启发法、从源数据集中继承且未经更改的上游注释错误,以及本质上不具有明确单一答案的模糊条目。同样的模型拟合还揭示,奖励模型专门优化风格偏好而非事实知识,并识别出一个前沿奖励模型,其与检测到的错误标签的一致性达到78%,而同类模型仅为38%,这符合基准测试污染或基准测试特定过度优化的特征。 ## 提交历史 来自:Sander Land [查看邮件 (https://arxiv.org/show-email/607baf0b/2605.30504)] **\[v1\]** 2026年5月28日星期四 19:38:44 UTC (421 KB)
相似文章
基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测
本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。
LLM置信度估计的不同方法基准测试
本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。
量化LLM基准中的排名不确定性
本文分析了MMLU等LLM基准中排名不确定性的来源,提出了对假设检验的修改,以构建排名置信区间,并表明不同主题间的变异性很大。
真实场景下的对比归因:针对现实基准中大模型失效的可解释性分析
研究者采用基于LRP的对比归因方法,分析大模型在现实基准中失败的原因,发现该方法在某些场景下能提供有用信号,但并非始终可靠。
对概率算子进行逻辑推理的LLM能力基准测试
本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。