UK AISI 与 EvalEval 如何使基准测试结果可复现

Hugging Face Blog 新闻

摘要

UK AISI 与 EvalEval 正在合作,通过标准化架构和平台公开共享人工智能评估结果,从而提升人工智能模型基准测试的可复现性和透明度。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/22 21:01

英国人工智能安全研究所与EvalEval如何实现基准测试结果的可复现性

来源:https://huggingface.co/blog/evaleval-aisi
EvalEval联盟 (https://evalevalai.com/) 高兴地宣布,英国人工智能安全研究所 (AISI) (https://www.aisi.gov.uk/) 正在使用EvalEval的基础设施公开共享评估结果,以支持更具可复现性和可验证性的评估科学研究。

此前,AISI与EvalEval已在NeurIPS 2025 (https://evalevalai.com/events/workshop-2025/) 期间的联合研讨会上开展了合作研究。研究所的反馈帮助塑造了“每一次评估” (Every Eval Ever, EEE) (https://evalevalai.com/projects/every-eval-ever/) 模式。本次合作的下一阶段将把这一共享基础设施投入实践。

https://huggingface.co/blog/evaleval-aisi#why-reproducible-evaluation-reporting-matters 为何可复现的评估报告至关重要

随着人工智能部署的加速,评估已成为衡量模型和系统性能的日益重要的证据来源。然而,评估结果的报告形式、平台和渠道各异,且通常缺乏足够的复现信息。重新运行评估本身可能成本高昂。

EvalEval的使命是通过共享的报告模式“每一次评估” (https://evalevalai.com/projects/every-eval-ever/) 和开放平台“评估卡片” (Evaluation Cards) (https://evalcards.evalevalai.com/) 来改善这一生态系统。该平台将评估结果及其解释所需的信息纳入统一结构。

这自然延续了AISI在提高评估效率(通过OptStop (https://arxiv.org/abs/2608.14425))、增强统计严谨性(通过HiBayES (https://www.aisi.gov.uk/blog/hibayes-improving-llm-evaluation-with-hierarchical-bayesian-modelling))以及在转录分析和能力激发等领域推动标准化方面所做的工作。AISI与EvalEval正携手诊断评估报告中的差距,并构建共享基础设施来弥合这些差距。

https://huggingface.co/blog/evaleval-aisi#what-aisi-is-sharing AISI正在共享的内容

转录级别的透明度不仅对可复现性至关重要,也对分析和诊断具有重要意义。在本次合作的新阶段,AISI在适当时通过“评估卡片”公开分享其评估方法和发现。此次发布包含论文主要实验中五个基准测试的已验证结果、背景信息和配置信息:

  • HealthBench
  • FrontierMath
  • Humanity’s Last Exam
  • SWE-Bench Pro
  • Terminal-Bench 2.0

这些结果涵盖了六个前沿模型:Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 和 GPT-5.4。此次发布还包含两项相关网络安全评估——Cyber CTFs和The Last Ones——的结果,这两项评估使用了一组部分重叠的不同模型。数据随附AISI的论文《推理计算如何塑造前沿大语言模型评估》 (https://arxiv.org/abs/2606.17930),该论文研究了基准性能如何依赖于推理时计算和评估协议。

在Humanity’s Last Exam上的表现随评估协议和推理计算而变化。每条曲线显示在给定token数量内,使用每个任务的最早观察到的成功结果,所尝试任务的累计解决比例。当模型每次尝试后从神谕获得正确性反馈时,随着token使用量的增加,它们继续解决额外的任务。

当评估结果与设置信息一同公开发布时,研究人员和实践者可以更深入地考察个别研究,并在整个生态系统中进行比较。在其他报告缺乏这些细节的情况下,像AISI这样的发布提供了经过验证的参考点,有助于在特定背景下解释评估——例如,帮助研究人员理解设置选择如何影响报告的性能。随着更多评估者采用EEE模式,此类开放比较可以支持更广泛、更可靠的元研究。

AISI的Terminal-Bench 2.0结果与其他针对相同模型但在不同评估设置下报告的评估结果并列。

我们对这一采纳感到兴奋,并期待与AISI及其他人工智能评估组织共同推进评估的标准化和共享。

https://huggingface.co/blog/evaleval-aisi#contribute-to-the-shared-mission 为共同使命贡献力量

  • 模型开发者: 报告已验证的评估结果 (https://evalcards.evalevalai.com/help/get-verified)。
  • 评估开发者: 使用“每一次评估”模式 (https://github.com/evaleval/every_eval_ever) 报告基准测试和运行数据。
  • 评估、治理和政策研究人员: 按基准或模型浏览“评估卡片” (https://evalcards.evalevalai.com/),或用其整体审视评估报告的现状。

https://huggingface.co/blog/evaleval-aisi#about-the-evaleval-coalition 关于EvalEval联盟

EvalEval联盟是一个研究社区,致力于为评估生态系统开发有科学依据的研究和稳健的部署基础设施。其目标是改善评估科学,解决在评估适用性和效用记录方面缺乏共识的问题,并拓宽对科学研究和政策分析具有重要影响的覆盖范围。

该联盟的旗舰项目包括“每一次评估” (https://evalevalai.com/projects/every-eval-ever/),一个用于评估结果的共享模式和仓库,以及“评估卡片” (https://evalevalai.com/projects/eval-cards/),它将基准元数据、评估运行数据和模型元数据结合成可解释的记录。它们共同使得理解在看似相似的分数背后存在的实质差异变得更加容易。

https://huggingface.co/blog/evaleval-aisi#about-the-uk-ai-security-institute 关于英国人工智能安全研究所

英国人工智能安全研究所 (https://www.aisi.gov.uk/) 是英国政府科学、创新与技术部内的一个研究机构。其使命是为政府提供对先进人工智能所带来风险的科学理解。AISI开展研究并建设基础设施,以理解先进人工智能的能力与影响,开发和测试缓解措施,并为政策制定提供信息。

https://huggingface.co/blog/evaleval-aisi#further-reading 延伸阅读

  • 《推理计算如何塑造前沿大语言模型评估》 (https://arxiv.org/abs/2606.17930)
  • HiBayES:利用层次贝叶斯建模改进大语言模型评估 (https://www.aisi.gov.uk/blog/hibayes-improving-llm-evaluation-with-hierarchical-bayesian-modelling)
  • HiBayES论文 (https://arxiv.org/abs/2505.05602)
  • OptStop论文 (https://arxiv.org/abs/2608.14425)
  • 每一次评估 (Every Eval Ever) (https://evalevalai.com/projects/every-eval-ever/)
  • 评估卡片 (Evaluation Cards) (https://evalcards.evalevalai.com/)

相似文章

Evaluation Cards: 一种AI评估报告的解释层

Hugging Face Daily Papers

本文介绍了EvalCards,这是一种操作框架,通过将基准元数据、评估运行数据和模型元数据组合成一个统一记录,并包含可重现性、完整性、来源、风险和分数可比性的解释性信号,从而标准化AI评估报告。作者在数千个模型和基准测试中部署了一个监控工具,揭示了当前报告实践中的系统性差距。

AI模型构建者的不稳定指标与基准测试文化

arXiv cs.AI

本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。