Benchmark Radar:一个面向AI基准测试和评估的动态数据库与搜索引擎

arXiv cs.AI 论文

摘要

Benchmark Radar引入了一个用于AI基准测试的动态数据库和搜索引擎,使研究人员能够跨各种AI领域发现、检索和分析评估资源。

arXiv:2609.11115v1 公告类型:新 摘要:基准测试研究人员和大型语言模型(LLMs)及其他AI系统的开发者需要找到相关评估,定位其基准数据集和代码,并理解报告分数背后的设置。我们推出Benchmark Radar,一个用于AI基准测试检索和发现的动态数据库和搜索引擎,涵盖LLM评估、代理和工具使用基准测试、编码、推理、安全性和特定领域评估。该系统结合了基准论文、仓库、数据集和发布的日常发现,以及可搜索的基准目录、模型卡和技术报告中的提及,以及分数历史。它保留来源身份和引用,以便读者可以检查候选基准及其评估证据。日常发现来自37个来源:13个直接连接器和24个第一方研究和工程源。目录包含1,283条源记录,来自4个基准目录,并有790条记录的12,916个数值观察。我们描述收集和检索,审核整个目录,并探讨基准饱和度、采用趋势和分数比较的局限性。一个工作示例演示了完整的现有技术搜索,展示在设计新评估时如何查询目录和检查基准证据。我们发布带有基准排行榜、分数与测量使用情况的帕累托前沿视图、饱和度和趋势视图、每日源、可下载证据、用于离线查询的命令行界面(CLI)以及可重现分析的Web仪表板。
查看原文
查看缓存全文

缓存时间: 2026/09/12 08:22

# 基准雷达:面向AI基准测试与评估的动态数据库与搜索引擎
来源:https://arxiv.org/html/2609.11115
吴口田、周俊杰(杭州电子科技大学)| 尚尔根(卡内基梅隆大学)| 王家宇(西安交通大学)| 韩鹏千(奥克兰大学)| 王俊凯(清华大学)| 徐望晗(上海交通大学)

###### 摘要

大型语言模型(\(LLMs\))及其他AI系统的基准测试研究人员与开发者需要查找相关评估、定位其基准数据集与代码,并理解报告分数背后的具体设置。我们推出Benchmark Radar——一个动态数据库与搜索引擎,用于检索与发现AI基准测试,涵盖LLM评估、智能体与工具使用基准测试、编程、推理、安全及特定领域评估。该系统结合每日发现的基准论文、代码仓库、数据集与版本更新,构建可搜索的基准目录、模型卡片与技术报告中的提及记录,以及分数历史。系统保留来源标识与引用信息,以便读者核查候选基准及其评估证据。每日发现机制基于37个信息源运作:13个直接连接器与24个官方研究与工程动态渠道。目录包含1,283条来源记录(源自4个基准目录)以及790条记录的12,916项数值观测。我们详述了数据收集与检索方法,审计完整目录,并分析基准测试饱和度、采用趋势及分数比较的局限性。通过实例演示完整的现有技术搜索流程,展示如何在设计新评估时查询目录与核查基准证据。我们发布包含基准排行榜、分数与使用量帕累托前沿视图、饱和度与趋势视图、每日动态、可下载证据数据、命令行界面(CLI)支持离线查询及可复现分析的Web仪表板。

![[未标注图像]](https://arxiv.org/html/2609.11115v1/figures/abstract_overview.png)

图1:Benchmark Radar连接发现、检索与来源核查功能。命名基准、柱状图及连接线为示意示例。目录计数基于v0.11.0版本。

## 1引言

Transformer架构确立了基于注意力机制的序列建模作为现代大型语言模型(\(LLMs\))的基础[55]。GPT-6 Astra与Claude Fable 5.1专为编程、研究及跨工具任务设计[38,2]。比较这些模型需要能够暴露故障并将能力提升与提示词、数据划分或评估流程变化区分开来的基准测试[15,42,40,47]。

评估的重要性不仅限于通用对话场景。在推荐系统中,Transformer式序列模型与基于LLM的方法支持用户、物品与偏好建模,生产环境下的高效训练至关重要[22,52,45]。基础模型也被用于模拟生物、地理科学及物理过程[54,10,46,64,58]。在社会与政治分析中,语言模型支持文本标注与模拟人类样本,而网络方法则量化平衡与极化动态[27,12,3,28,37,48]。基准测试分数为这些科研、工业与决策支持场景的进展声明提供依据。

不同基准测试考察的能力各异。知识与推理的广泛评估包括MMLU[15]、GPQA[42]与《人类最终考试》[40]。其他基准则聚焦特定能力:SWE-bench衡量模型解决真实GitHub问题的能力[21],LiveCodeBench采用基于日期的划分测试代码生成以减少训练数据污染[20],Terminal-Bench与Long-Horizon-Terminal-Bench则测试命令行智能体执行操作任务的能力[33,29]。领域特定评估包括面向金融经济的FinanceBench[19]、面向数学的MATH[16]、面向科学问题解决的SciBench[56]、面向生物学的LAB-Bench[26]以及面向化学的ChemBench[34]。ESM-BENCH测试智能体对地球系统模型物理原理与代码的理解[59];ResearchClawBench评估端到端的自主科学研究[62];ASI-Bench则研究在方法论指导逐渐减少情况下的科学探索与执行能力[65]。它们的任务与评分规则明确了哪些模型行为可被视为成功表现。

查找某个基准测试、其数据集或代码仓库,以及其使用报告需要搜索论文服务器、代码托管平台、数据集中心、厂商发布、博客与基准目录。现有资源如LLM Stats、OpenCompass与Artificial Analysis提供排行榜、评估平台与模型分析视图[31,39,4]。但将新发布的基准与其任务材料及后续在模型报告中的应用联系起来,往往需要查阅多个独立资源。Benchmark Radar通过结合目录检索、每日发现、模型报告中的提及记录,以及带有完整评估设置与来源的分数数据来填补这一空白。

Benchmark Radar从公开来源收集基准相关成果,使用匹配标识符分组观测数据,并提供带有来源标签、日期、基准提及与分数的可搜索索引(图1)。我们展示搜索系统,描述重现其输出所需的数据收集与排序方法,并审视跨所有目录来源的基准覆盖度、文档与评分模型覆盖度、来源集中度以及评估设置缺口。111源代码:https://github.com/ktwu01/benchmark-radar。

系统为每个来源基准保留一条记录,包括无分数、日期或引用的条目。经审核的身份链接连接相关记录,同时保留其独立的测量值。我们贡献此动态搜索系统、对其证据的Web与离线共享访问,以及可复现的全目录普查。第5节展示了贡献者如何利用检索与来源核查来整合现有技术。

## 2相关工作与范围

#### 基准目录与评估。

LLM Stats发布基准描述与报告的模型结果[31]。OpenCompass提供评估平台与带成果元数据的基准注册表[39]。Artificial Analysis发布模型评估及其方法论[4]。Benchmark Radar使用这些来源的记录以及模型报告证据。Benchmark Radar增加了每日发现、成果历史、基准检索以及通过Web与离线共享访问进行的来源核查,帮助读者调查跨各贡献目录的评估情况。

#### 记录评估证据。

模型卡片与数据表促使记录评估条件与数据集特征[35,11]。当收集的来源提供相关信息时,Benchmark Radar保留这些信息,并提供引用以供后续审查。GPQA[42]、SWE-bench[21]与SciBench[56]等基准定义了不同任务。普查衡量哪些证据可供核查,哪些元数据仍需审核。

#### 评估基准本身。

近期研究考察基准饱和度、项目质量及综合分数的解读。在对60个语言模型基准的系统研究中,[Akhtar等人[1]]定义了饱和度并报告近半数基准表现出此特性,且其普遍性随基准年龄增长而增加。他们认为韧性源于专家策展而非测试数据保密性。对MMLU、ARC、WinoGrande、HellaSwag与TruthfulQA的样本级审计揭示了被聚合准确率掩盖的基准内变异[49]。一个无参考评判框架从一致性、复杂性与策略覆盖度评估对话智能体基准[25]。对于为更大模型开发的安全基准,较小模型的排名随对模糊响应的处理方式而变化[44]。逆密度加权降低了基准多样性对聚合分数的影响[30]。[Gilda与Gilda[13]]认为评估分数应说明其证据范围与有效窗口,并在组成信号可靠性不同时采用保守聚合。

Benchmark Radar通过使基准记录、可用测量及溯源信息可检索来补充这些方法。我们使用其命令行客户端为本节确定候选论文,以合著者推荐补充结果,并审阅原始论文。

## 3系统与方法

### 3.1系统概述与每日发现

Benchmark Radar采用BuilderPulse的每日公开来源收集方法[61]。图2将基准目录与发现历史分开。模型报告包括模型卡片、技术报告、系统卡片和发布公告;它们通过与基准注册表相同的记录结构贡献信息。

表1总结了v0.11.0版本中的四个目录来源及其主要用途。

表1:v0.11.0版本中的目录来源。行数统计各来源特定的基准记录,包括无分数的记录。

### 3.2发现收集

每日发现观测描述在公开来源中找到的提及、发布与更新。观测是一条收集的记录;成果是通过精确标识符链接的论文、代码仓库、数据集、发布或页面。这些对象与来源特定的基准记录不同。我们将其历史与目录并列保存,而不将发现观测添加到基准总数中。

每次收集运行搜索48小时窗口,按来源记录计数与错误,移除未来日期的行,并在发布前确保核心来源运行正常。截止时,arXiv[5]、Hugging Face Hub[18]与GitHub Search[14]是核心来源。在13个直接连接器与24个官方动态渠道之外,其他途径覆盖学术索引、数据集托管、代码仓库发布与机构动态。附录D记录其截止状态。

图2:两条输入路径支持发布:带日期的发现快照保留提及与发布证据,而基准注册表与模型报告填充共享目录。客户端使用目录的稳定来源记录ID。表2描述接口。搜索与导出保留完整目录;显示过滤器仅影响所选视图。

表2:读者问题与证据范围。

### 3.3在比较测量值前保留记录

来源记录是来自一个贡献来源的一条基准条目。我们将名称、标识符、成果链接、分数观测、模型身份及引用文档规范化为通用字段。即使缺少分数、日期或引用,记录仍保留在目录中。经审核的身份链接连接相关记录,同时保留其独立观测与计数。

每日发现贡献了不同类型的证据:收集的提及、发布与更新。精确标识符(如DOI、arXiv ID与代码仓库URL)将这些观测与成果链接起来。发现观测不增加基准目录总数。附录C记录详细的收集设置与显示过滤器;附录D记录截止时的来源健康状况。

### 3.4检索候选项及其证据

相同的基准ID可访问Web搜索、详情页、数据集导出与离线客户端。词汇搜索使用BM25F(一种字段加权单词匹配分数[43]),对名称与短语匹配设置有界加成。每个结果显示匹配与缺失的查询词、出现字段及分数成分。来源归属不影响排序。共享查询服务为CLI与HTTP接口提供相同响应格式与本地数据溯源。

候选检索先于适用性判断。分析师或智能体可以尝试聚焦查询变体,检查记录的任务与分数设置,并跟踪其引用。界面保留了该审查所需的证据。本文评估目录与测量覆盖度;贡献者案例演示使用方式,不测量检索准确性或节省的时间。

### 3.5审计完整总体

普查从重建目录索引中的每条记录开始,并读取其详情文件。不应用日期、分数或界面过滤器。我们按观测ID统计一次有限数值分数观测。在每个基准记录内,我们按来源模型ID统计有分数的模型(保留独立评估的配置),并按文档ID统计引用文档。重复观测不会创建额外模型或文档。全局模型注册表使用其记录的身份链接;每个基准的模型计数不累加到全局总数。

资格取决于计算所需的测量值。声明的百分比...

相似文章

BEAMS: AI在建模与仿真中的基准测试与评估

arXiv cs.AI

BEAMS倡议提出了一套基准测试集,用于评估建模与仿真中的AI工具,重点关注以人为本和负责任的AI实践。测试显示,基于LLM的引擎存在差异,在定性任务上的表现优于因果推理。

AI模型构建者的不稳定指标与基准测试文化

arXiv cs.AI

本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。