K-Bench:评估模型在真实科学代理请求中的性能

arXiv cs.AI 论文

摘要

论文介绍了 K-Bench 01,一个用于评估 AI 代理在真实科学请求中性能的基准,揭示了没有模型能持续达到可接受性能的阈值,过度声明是常见的失败模式。

arXiv:2608.21601v1 Announce Type: new 摘要:科学人工智能的基准大多是为了评分而设计的:包括多项选择题、带有参考解决方案的精选代理任务,或具有已知生成结构的模拟器。真实的科学请求则有所不同。它们缺乏明确说明,带有附件,且没有基本事实。我们报告了 K-Bench 01,一个基于 K-Dense Web 实时用户流量中首次请求构建的评估,由九个前沿模型在相同的沙箱环境中端到端运行,产生了 1,602 次完成的代理运行。三个盲审的语言模型评审根据八维评分标准对每次运行进行评分。在该评分标准中,八个锚点指示评审,领域科学家会在小幅编辑后接受该工作,没有模型在所有三个评审中都达到线。gpt-5.6-sol 的综合平均分最高,为 8.04,但其 95% 置信区间 [7.80, 8.23] 跨越了阈值,且三个评审中有两个将 claude-opus-5 排在第一。因此,我们报告系统的排序作为可复现的量,绝对水平作为工具的属性,且表格顶部尚未确定。在所有 39,934 个评分判断中——包括八个维度的分数和每个评估的整体评价,排除不适用单元格——47.6% 低于 8 分阈值。难度在评分标准中并非均匀:科学准确性平均为 6.22,而沟通为 7.33,在相同分母和所有九个模型中方向一致。主要的失败标签是过度声明,占评估的 31.4%。我们认为,科学代理的信息量不是排行榜位置,而是交付内容、声称内容和产出物的联合分布。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:20

# 衡量模型在真实科学智能体请求上的表现
来源:https://arxiv.org/html/2608.21601

Darshil Patel  
所属机构:K\-Dense, Inc\.  
Yuhuan He  
所属机构:K\-Dense, Inc\.  
Timothy Kassis  
所属机构:K\-Dense, Inc\.  
所属机构:通讯作者:timothy\.kassis@k\-dense\.ai  

###### 摘要  
科学人工智能的基准测试大多为可评分而设计:多选题、带有参考答案的精选智能体任务,或已知生成结构的模拟器。真实的科学请求则不同。它们通常定义不明确,带有附件,且缺乏标准答案。我们报告 K\-Bench 01,这是一个基于 K\-Dense Web 实时用户流量首轮请求构建的评估,由九个前沿模型在相同沙箱环境中端到端执行,共产生 1,602 次完整的智能体运行。三位盲审语言模型评委根据八维评分标准对每次运行进行评分。在该标准中,锚点8分指示评委,领域科学家会接受该工作(仅需微小修改),但在三位评委中,没有任何模型在所有评审中都达到此线。gpt\-5\.6\-sol 的池化平均分最高,为 8.04,但其95%置信区间 \[7.80, 8.23\] 跨越了该阈值,并且三位评委中有两位将claude\-opus\-5排在首位。因此,我们报告系统排序作为可复现的量,绝对水平作为工具的一个属性,而榜单顶部结果尚无定论。在全部39,934个评分判断中——每次评估的八维分数加上一个整体印象分,排除不适用项——47.6%低于8分阈值。难度在评分标准各维度上并不均匀:科学准确性平均为6.22,而沟通能力为7.33(在九个模型中,每个模型在相同维度上都呈现相同趋势)。导致失败的首要标签是过度主张(overclaiming),占31.4%的评估。我们认为,对于科学智能体而言,有意义的数据不是排行榜名次,而是所交付成果、所声称内容和所产生制品的联合分布。

参见图注  
图1:图形摘要。K\-Bench 01 从178个真实用户会话的第一条消息中,逐字且附带附件地提取每个请求,在九个前沿模型相同的沙箱中端到端运行每个请求,并由三位身份盲审的评委在打开每次运行遗留下的制品文件后,对产生的1,602次运行进行评分。左侧面板的文件图标代表附件类型的混合情况,而非按领域的格式分布;在整个数据集中,最常附带的格式是.docx(表30(https://arxiv.org/html/2608.21601#A1.T30))。单元格中的数值是主要结果:最佳模型平均分(8.04/10,一个区间跨越可接受线的点估计,且仅三位评委中的一位得出此结果;见第5.4节(https://arxiv.org/html/2608.21601#S5.SS4)以及第5.2节(https://arxiv.org/html/2608.21601#S5.SS2)了解根据评委不同,达到8分的模型数量为0、1或2个的原因),39,934个评分判断中低于可接受线的比例(47.7%,约48%),带有“过度主张”标签的评估比例(31.4%),以及无模型解决的任务比例(12.4%,约12%)。下方的条形图对比了执行维度(6.93)和实质性维度(6.34)的平均值,第4.2节(https://arxiv.org/html/2608.21601#S4.SS2)给出了更精确且维度匹配的版本,即在所有九个模型中,科学准确性均落后沟通能力1.11分。

## 1 引言  
一位科学家向智能体发送一个RNA-seq实验的计数矩阵,并询问哪些基因存在差异表达,以及批次效应是否真实存在。另一位附带三篇论文,询问某种效应是否可以重现。这些请求形态各异;它们是真实工作会话的第一条消息,可能附带文件,通常部分指明目标,且普遍缺乏经过验证的参考答案。如今,很少有用于跟踪科学人工智能进展的基准测试具有这种形态,且理由充分:基准测试必须可评分。这催生了考试式的测试套件。每个设计选择都在典型现实世界请求所在之处留下了空隙。这个空隙是一个构念效度问题(Bean et al\. 2025(https://arxiv.org/html/2608.21601#bib.bib3))。迄今为止,K\-Dense Web平台已处理超过75,000次交互,涉及约18,000个用户会话。我们利用了178个来自K\-Dense Web实时流量的首轮请求(K\-Dense Inc\. 2026(https://arxiv.org/html/2608.21601#bib.bib22)),并在相同的通用框架(第3节(https://arxiv.org/html/2608.21601#S3))下,使用九个模型分别运行了每个请求。图1(https://arxiv.org/html/2608.21601#S0.F1)总结了该流程和主要结果。设计的核心问题是:一个源自流量的数据集是否仍能区分前沿系统,以及是在哪些维度上进行区分。本文中的每个分数都由一个语言模型评委小组授予,他们应用书面评分标准对运行记录和其留在磁盘上的文件进行评判。因此,测量的量是经过评委评估的评分标准符合度,第5.2节(https://arxiv.org/html/2608.21601#S5.SS2)阐明了这能证明什么以及不能证明什么。简而言之:评委小组对系统的排序在不同评委间是可复现的,但其设定的评分尺度水平则不然。我们的结果显示,这些维度并非能力优先解读所预测的那些。这些发现支持了两个框架性共识。第一,流畅表达不等于可交付成果;一个无法区分优美文本与空目录的评估系统,将系统性高估进展(Si et al\. 2024(https://arxiv.org/html/2608.21601#bib.bib53); Si et al\. 2025(https://arxiv.org/html/2608.21601#bib.bib54))。第二,单一的排行榜数字是对智能体科学基准测试的错误概括。本文的贡献如下:

- • 我们从未经修改的部署流量构建了一个基准测试:178个逐字取自真实用户的首轮科学请求,附带其原始附件,无参考答案(第3节(https://arxiv.org/html/2608.21601#S3))。
- • 我们对运行留下的文件进行评分,而不仅仅是其文本。评委获得对运行输出树的只读访问权限(第3节(https://arxiv.org/html/2608.21601#S3))。
- • 我们进行了一次大规模的均衡测试:九个前沿模型在相同任务、相同沙箱环境中运行,1,602次运行,三位盲审评委,4,806次评估和39,934个评分判断(第4节(https://arxiv.org/html/2608.21601#S4))。
- • 我们将评委小组本身视为研究对象而非工具,区分了可复现的部分和其断言的部分,并表明达到评分标准阈值的模型数量取决于评委小组(第5节(https://arxiv.org/html/2608.21601#S5))。
- • 我们报告了不足之处:在该领域的所有模型中,科学准确性均落后于沟通能力;过度主张是首要失败标签,占评估的31.4%;47.9%的运行结束时磁盘上无文件(第4.2节(https://arxiv.org/html/2608.21601#S4.SS2)– 4.7节(https://arxiv.org/html/2608.21601#S4.SS7))。

## 2 相关工作:2020–2026年评估格局  
六年来,科学人工智能的评估经历了三代重叠的发展。解读该领域的一个有用方式是看每一代将什么作为测量对象(图2(https://arxiv.org/html/2608.21601#S2.F2))。第一代测量回忆和推理的知识。第二代测量书面程序。第三代(当前一代)测量执行的工作,只有在第三代,制品质量的问题才真正可被讨论。

参见图注  
图2:2020-2026年科学与智能体能力的代表性基准测试,按测量内容分组。水平位置是所引作品首次公开发布的日期;该图是定位辅助,而非详尽的普查,且若干套件可能合理地归于多个类别。为清晰起见,此处省略了文中讨论的几个套件;表1(https://arxiv.org/html/2608.21601#S2.T1)提供了更完整的比较。其中包括 BenchBench\-Protocol,它在构建哲学上是 K\-Bench 最接近的前身,将于2026年出现在中间类别。K\-Bench 01 被置于右侧。从部署流量构建基准测试本身并非新事物:WildBench 和 Arena\-Hard 从聊天日志中策划项目,RealClawBench 重建开发者-智能体会话(Lin et al\. 2024(https://arxiv.org/html/2608.21601#bib.bib30); Li et al\. 2024(https://arxiv.org/html/2608.21601#bib.bib28); Lv et al\. 2026(https://arxiv.org/html/2608.21601#bib.bib38)),而在科学领域,AstaBench 是最近的先例,其问题灵感来源于对其部署智能体的请求。K\-Bench 01 的独特之处在于,其项目是用户首轮的逐字记录,附带原始附件且未经过重建,并且评分过程打开运行产生的文件,而非匹配参考答案。

### 2.1 知识与考试套件  
第一代建立了可复现评分的规范。MMLU 设定了大规模多选题覆盖的模板(Hendrycks et al\. 2020(https://arxiv.org/html/2608.21601#bib.bib16)),BIG\-bench 将广度推向数百个任务(Srivastava et al\. 2022(https://arxiv.org/html/2608.21601#bib.bib60)),HELM 则形式化了跨场景的多指标报告(Liang et al\. 2022(https://arxiv.org/html/2608.21601#bib.bib29))。在科学领域,SciBench 针对大学水平的问题解决,提供带解答的数值答案(Wang et al\. 2023(https://arxiv.org/html/2608.21601#bib.bib65)),SciEval 构建了涵盖知识和推理的多层次科学评估(Sun et al\. 2023(https://arxiv.org/html/2608.21601#bib.bib62)),GPQA 通过设计旨在抵抗搜索的研究生水平问题提高了上限(Rein et al\. 2023(https://arxiv.org/html/2608.21601#bib.bib49))。Humanity’s Last Exam 将相同的逻辑延伸至封闭式难度的前沿(Phan et al\. 2026(https://arxiv.org/html/2608.21601#bib.bib47))。这些套件仍然是衡量其设计属性的正确工具,其弱点已从领域内部被充分记录:基准测试的选择本身就塑造结论(Dehghani et al\. 2021(https://arxiv.org/html/2608.21601#bib.bib9)),公开的基准测试项目中存在可测量的污染(Golchin and Surdeanu 2023(https://arxiv.org/html/2608.21601#bib.bib13)),以及排行榜动态可能奖励选择性报告而非能力(Singh et al\. 2025(https://arxiv.org/html/2608.21601#bib.bib56))。反对意见的一般形式是构念效度。对445个基准测试的系统性回顾发现,测量的现象、任务和评分指标常常不一致(Bean et al\. 2025(https://arxiv.org/html/2608.21601#bib.bib3)),这就是当关于不应将单一测试套件视为通用进展衡量标准的旧有警告应用于语言模型时的样子(Raji et al\. 2021(https://arxiv.org/html/2608.21601#bib.bib48))。

### 2.2 专家创作的研究技能与实验室程序  
第二代将内容转向实践科学家的工作方式。LAB\-Bench 汇集了涵盖文献推理、方案理解、序列操作和图像解释的生物学研究任务(Laurent et al\. 2024(https://arxiv.org/html/2608.21601#bib.bib24)),LABBench2 在更真实的情境中设置了自由作答任务,对该套件进行了修订(Laurent et al\. 2026(https://arxiv.org/html/2608.21601#bib.bib25))。LifeSciBench 评估语言模型在专家级生命科学任务上的表现,采用自由作答评分标准而非选项键(Liu et al\. 2026a(https://arxiv.org/html/2608.21601#bib.bib31))。聚焦程序的工作是一个独立且清晰的子领域:BioPlanner 自动化评估方案规划(O’Donoghue et al\. 2023(https://arxiv.org/html/2608.21601#bib.bib45)),BioLP\-bench 通过注入和检测错误来衡量对实验室方案的理解(Ivanov 2024(https://arxiv.org/html/2608.21601#bib.bib19)),BioProBench 将方案推理扩展到语料库-基准测试配对(Liu et al\. 2025(https://arxiv.org/html/2608.21601#bib.bib35)),ChemReason\-Bench 为实验化学做类似工作(Zhang et al\. 2026(https://arxiv.org/html/2608.21601#bib.bib69)),PhysDox 审计提出的生理传感方案在物理上是否可行(Liu et al\. 2026b(https://arxiv.org/html/2608.21601#bib.bib32))。Benchling 的 BenchBench\-Protocol 是迄今为止在构建哲学上与 K\-Bench 最接近的前身(Sivakumar et al\. 2026(https://arxiv.org/html/2608.21601#bib.bib57))。它并非创作项目,而是从科学家对已发表湿实验方案的真实编辑中恢复项目,因此任务分布继承自实践而非为测量而发明。关键区别在于范围和容器:BenchBench\-Protocol 局限于方案推理和修改,对自由作答答案使用加权评分标准,而 K\-Bench 则处理用户发送给智能体的整个异质性分布。两种设计都接受了相同的权衡:为保真于真实科学工作而牺牲清晰的参考答案。

### 2.3 智能体、代码与发现  
第三代评估执行过程(M\. Bran et al\. 2024(https://arxiv.org/html/2608.21601#bib.bib39); Boiko et al\. 2023(https://arxiv.org/html/2608.21601#bib.bib4); Lu et al\. 2024(https://arxiv.org/html/2608.21601#bib.bib36))。通用智能体套件确立了测试框架约定:AgentBench 用于多环境智能体评估(Liu et al\. 2023a(https://arxiv.org/html/2608.21601#bib.bib33)),GAIA 用于需要工具使用的助手任务(Mialon et al\. 2023(https://arxiv.org/html/2608.21601#bib.bib42)),SWE\-bench 用于仓库规模的软件工程(Jimenez et al\. 2023(https://arxiv.org/html/2608.21601#bib.bib20)),以及τ\-bench 用于工具–智能体–用户交互(Yao et al\. 2024(https://arxiv.org/html/2608.21601#bib.bib67))。Terminal\-Bench 将容器纳入规范,在本次测试中使用的命令行环境类别的困难任务上对智能体评分(Merrill et al\. 2026(https://arxiv.org/html/2608.21601#bib.bib41)),而 Holistic Agent Leaderboard 将测试框架本身作为首要变量,在模型、脚手架和基准测试上运行21,730次试验,以显示报告结果中有多少归功于脚手架而非模型(Kapoor et al\. 2025(https://arxiv.org/html/2608.21601#bib.bib23))。数据分析套件将范围缩小至类似科学分析核心的工作,它们在评分对象上有所不同:InfiAgent\-DABench 将开放式分析问题转换为封闭式格式以便自动检查答案(Hu et al\. 2024a(https://arxiv.org/html/2608.21601#bib.bib17)),DSBench 对来自数据科学竞赛的端到端分析和建模交付成果评分(Jing et al\. 2024(https://arxiv.org/html/2608.21601#bib.bib21)),BLADE 则评估分析决策本身——智能体选择了哪些变量、转换和模型——并与从独立专家分析中收集的真相进行对比(Gu et al\. 2024b(https://arxiv.org/html/2608.21601#bib.bib15))。研究工程套件进一步提升了视野:MLE\-bench(Chan et al\. 2024(https://arxiv.org/html/2608.21601#bib.bib6)),MLGym(Nathani et al\. 2025(https://arxiv.org/html/2608.21601#bib.bib44)),RE\-bench,该套件在前沿任务上对比智能体与人类专家。

相似文章

跨尺度科学挑战的AI智能体基准测试

arXiv cs.AI

介绍SciAgentArena,一个约200个任务的基准测试,用于评估真实科学研究中的AI智能体。发现智能体在明确指定的数据分析工作流程中表现有效,但在产生新颖见解和开放式探索方面存在困难。