基准并非铁板一块:面向LLM评估的样本级审计与编排

arXiv cs.CL 论文

摘要

本文提出了一种以数据集为中心的元评估框架,在五个潜在维度上对LLM基准进行样本级审计,揭示其内部异质性,并支持基于标准的基准子集组合,以实现针对性的模型评估。

arXiv:2607.28801v1 公告类型:新 摘要:基准数据集对于评估大型语言模型(LLM)至关重要,然而它们通常被视为单一整体的任务,掩盖了个别样本需求上的显著差异。我们提出了一种以数据集为中心的元评估框架,沿五个潜在维度对基准数据集进行样本级审计:1. 认知与知识需求,2. 语言与内容质量,3. 任务属性,4. 上下文,5. 伦理、安全与公平性。应用该框架,我们对五个有影响力的基准——MMLU、ARC、WinoGrande、HellaSwag和TruthfulQA——进行了标注,揭示出聚合准确率分数无法捕捉的显著内部异质性。我们展示了这些标注如何实现跨数据集的、由标准驱动的复合基准子集编排,支持对模型能力(如推理深度或伦理敏感性)进行针对性评估。这种方法将基准评估重新定义为数据集内省,为分析和重新组合现有基准提供了一种原则性方法,以更好地反映多样化的评估需求。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:33

# 面向LLM评估的样本级审计与编排 来源: https://arxiv.org/html/2607.28801

## ![[未附图]](https://arxiv.org/html/2607.28801v1/media/crystal_ball_emoji.png)基准并非铁板一块:面向LLM评估的样本级审计与编排

###### 摘要

基准数据集在评估大型语言模型(LLM)中处于核心地位,但它们通常被视为单一整体的任务,掩盖了单个样本需求上的显著差异。我们引入了一个以数据集为中心的元评估框架,该框架在样本层面沿五个潜在维度审计基准数据集:1. 认知与知识需求,2. 语言与内容质量,3. 任务属性,4. 语境,5. 伦理、安全与公平。应用该框架,我们对五个有影响力的基准——MMLU、ARC、WinoGrande、HellaSwag 和 TruthfulQA——进行了标注,揭示了聚合准确率分数无法捕获的显著内部异质性。我们展示了这些标注如何实现跨数据集的标准驱动的复合基准子集编排,支持对推理深度或伦理敏感性等模型能力进行定向评估。这种方法将基准评估重新定义为数据集内省,为分析和重新组合现有基准提供了一种有原则的方法,以更好地反映多样化的评估需求。机器学习,ICML \UseRawInputEncoding

表1:本研究所考虑的五个有影响力基准的概览。所选基准的响应类型为对数似然。

## 1 引言

基准数据集长期以来一直是自然语言处理(NLP)和语言模型发展进步的基石。从早期里程碑如 ARC(AI2推理挑战)(Clarket al.,2018 (https://arxiv.org/html/2607.28801#bib.bib34))(它揭示了浅层文本匹配方法的局限性),到像 MMLU(大规模多任务语言理解)(Hendryckset al.,2021 (https://arxiv.org/html/2607.28801#bib.bib180))这样广泛的评估,基准使研究人员能够以标准化的方式衡量模型和系统的性能。它们深深植根于研究生态系统中,不仅塑造了科学进步,也塑造了公众对模型能力的认知。尽管基准扮演着核心角色,但它们通常被视为产生单一分数或排行榜排名的静态工具。这类评估优先考虑模型是否正确完成基准任务,而很少关注基准样本本身的内部属性。这种视角忽略了基准的本质:它们是不同质的(non homogeneous)项目集合。其中包含的样本在推理深度、语言清晰度、语境框架或伦理敏感性方面往往存在显著差异(例如

相似文章

金融服务业LLM评估的元基准

arXiv cs.AI

本文提出了一种元基准测试框架,将452个现有的公开基准测试整合为41个工作活动和38个银行业务领域,从而为金融机构实现更精确的LLM评估和治理。

LLM基准测试

Reddit r/AI_Agents

一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。

BenchMIRT:LLM 基准测试实际在测量什么?

Hugging Face Blog

BenchMIRT 介绍了一种方法,使用多维项目反应理论在单个提示词级别审计 LLM 基准测试,分离安全性和一般推理等底层能力,以揭示基准测试实际测量的内容。