BenchBench-Protocol:评估真实世界湿实验流程推理与修改

arXiv cs.AI 论文

摘要

本文介绍了BenchBench-Protocol,这是一个包含149个真实世界湿实验流程修改任务的基准测试,用于评估大语言模型的推理能力,其中Claude Opus 5得分最高,为59.2%。

arXiv:2608.23898v1 公告类型:新 摘要:我们介绍了BenchBench-Protocol,这是一个针对大语言模型的基准测试,包含149个协议修改任务,这些任务源自科学家在真实实验工作中对已发布协议所做的修改。将已发布协议适应新实验是湿实验科学家的常规任务,正确的修改需要考虑先前的选择和后续步骤。近期的生命科学基准测试倾向于开放式、基于评分标准的任务,但这些任务通常由专家提出,而非从现实世界的修改中重建。BenchBench-Protocol的任务来源于已发布协议与科学家修改版本之间的差异,这为查询和正确响应的加权评分标准元素提供了基础。该基准测试从9个湿实验生物学领域的96个源协议中汲取内容,仅包括经过领域专家审查后评分较高的任务。我们评估了9个闭源和开源模型;Claude Opus 5得分最高,为59.2%的标准化评分分数,其他模型在34.1%到47.1%之间,且在进行十次尝试中取最佳时,基准测试仍未饱和。随着模型在生命科学研究中的日益有用,评估它们在常规湿实验任务中的表现变得相应重要。我们提出BenchBench-Protocol,既作为湿实验推理的扎实评估,也作为现实世界实验用于构建基准测试任务的效用证据。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:15

# BenchBench-Protocol:评估现实世界湿实验协议推理与修改
来源:https://arxiv.org/html/2608.23898
Ashu Singhal Benchling Nicholas Larus-Stone Benchling Nithin Parsan Benchling

###### 摘要
我们推出 BenchBench-Protocol,这是一个包含 149 项协议修改任务的基准测试,用于评估大语言模型。这些任务源于科学家在真实实验工作中对已发布协议所做的修改。将已发布的协议适配到新实验是湿实验科学家的常规任务,而正确的修改需要考虑先前的选择和后续步骤。近期的生命科学基准测试倾向于开放式的、按评分标准评分的任务,但这些任务通常由专家构思,而非从现实世界的修改中重构而来。BenchBench-Protocol 的任务源自已发布协议与科学家修改版本之间的差异,这为查询和加权评分标准要素(用于判断正确回答)提供了依据。该基准测试涵盖了湿实验生物学九个领域的 96 个源协议,并且只包括经过领域专家评审后获得高评价的任务。我们评估了九个闭源和开源模型;Claude Opus 5 以 59.2% 的标准化评分标准得分最高,其他模型得分在 34.1% 到 47.1% 之间,并且在尝试十次取最佳的情况下,该基准测试仍未饱和。随着模型在生命科学研究中日益有用,评估它们在常规湿实验任务上的表现也变得相应重要。我们提出 BenchBench-Protocol,既作为湿实验推理的实地评估,也作为利用现实世界实验构建基准测试任务有效性的证据。

1脚注:贡献均等。2脚注:通讯作者及团队负责人:[email protected]。

## 1 引言
为新的实验调整现有的实验室协议是湿实验科学家的常见任务。正确的决策需要对先前的选择和预期的后续步骤进行推理,而不仅仅是回忆事实或检索现有知识。因此,一项重要的实践技能是能够在预见到下游影响的情况下修改或扩展现有协议。

近期生命科学研究的前沿语言模型基准测试转向了更开放式的、按评分标准评分的任务,这些任务类似于研究请求。这些任务通常通过询问专家来编写代表其工作的任务来构建。虽然这个过程产生了科学正确且合理、高质量的任务,但它们可能偏离现实工作流中使用的修改分布,这些工作流受到可用试剂、仪器访问权限和先前结果的限制。

我们推出 BenchBench-Protocol,一个协议修改任务的基准测试。我们没有从头创建任务,而是从科学家对已发布协议所做的实际修改中恢复它们。任务是现实的、开放式的、自由回答的。然后,每个任务和评分标准都由多位拥有相关领域博士学位且至少有三年实验室经验的科学家独立评审。图 1 (https://arxiv.org/html/2608.23898#S1.F1) 总结了此构建过程。

(图片说明:图 1:基准测试构建概览。来自贡献者在 Benchling 上的已发布协议和科学家适配版本进行比较,以生成任务和加权评分标准,这些内容在专家质量控制后保留下来。)

我们贡献:
- BenchBench-Protocol:一个包含 149 项经专家评审的协议修改任务的基准测试,涵盖湿实验生物学的九个领域,其表述方式是科学家向 LLM 提问的方式,而非正式的问题陈述。
- 加权评分标准:经专家验证的评分标准,基于科学家所做的修改,用于根据正确答案必须处理的特定下游依赖关系来对开放式回答进行评分。

## 2 相关工作
近期的基准测试已超越简单的生物学事实回忆,越来越关注科学家可能执行的多样化任务。一些基准测试评估了模型的研究助手能力:LAB-Bench 拥有一套广泛的生物学研究任务(Laurent 等,2024 (https://arxiv.org/html/2608.23898#bib.bib4)),而 LABBench2 通过自由回答问题(如 ProtocolQA2, LitQA3, FigQA2 等)扩展了这些测试,以检验模型是否能够排除协议故障以及理解并评估来自研究论文和数据库的图表、表格和数据(Laurent 等,2026 (https://arxiv.org/html/2608.23898#bib.bib5))。BioProBench 评估了模型在错误纠正和协议生成方面的能力(Liu 等,2025 (https://arxiv.org/html/2608.23898#bib.bib9)),而 TroubleshootingBench 则评估了识别和纠正专家创建的湿实验错误场景的能力(OpenAI,2025 (https://arxiv.org/html/2608.23898#bib.bib11))。BioLP-bench 与 ProtocolQA 和 TroubleshootingBench 类似,在协议中引入一个关键错误,并衡量模型是否能识别出问题步骤(Ivanov,2024 (https://arxiv.org/html/2608.23898#bib.bib3))。

还有一些基准测试涉及端到端研究任务的代理和长时程能力。BixBench 测试代理执行代码和推理生物信息学结果的能力(Mitchener 等,2025 (https://arxiv.org/html/2608.23898#bib.bib10))。ScienceAgentBench 和 AstaBench 将代理评估扩展到更广泛的科学工作流中(Chen 等,2025 (https://arxiv.org/html/2608.23898#bib.bib2); Bragg 等,2025 (https://arxiv.org/html/2608.23898#bib.bib1))。GeneBench 和 GeneBench-Pro 是前沿评估,用于评估多阶段定量生物学,并精心构建任务以限制有效解决方案路径的数量并允许精确验证(Li 和 Ho,2026b (https://arxiv.org/html/2608.23898#bib.bib6); Li 和 Ho,2026a (https://arxiv.org/html/2608.23898#bib.bib7))。虽然这些基准测试任务需要强大的生物学推理能力,但大多数仅限于计算生物学。

LifeSciBench 是最相似的基准测试,包含专家编写、带有评分标准且采用单轮自由回答格式的任务(Liu 等,2026 (https://arxiv.org/html/2608.23898#bib.bib8))。其七个工作流程中的一个明确涵盖了检测、构建体和协议的设计与优化。LifeSciBench 由领域专家构建,并有严格的质量审核,但与 LABBench2 ProtocolQA2 类似,专家可能建议的合理修改可能与现实工作流中的修改分布不同。BenchBench-Protocol 通过从科学家在真实实验中对已发布协议所做的修改中推导任务,来补充和扩展生命科学能力基准测试套件。

## 3 基准测试设计与构建
### 3.1 任务表述
在每个任务中,模型接收一个第一人称、自然表述的科学家查询和一个待扩展或修改的已发布协议,并返回带有推理的自由文本答案。在评估期间,如第 4.2 节 (https://arxiv.org/html/2608.23898#S4.SS2) 和附录 B (https://arxiv.org/html/2608.23898#A2) 中所述的指定搜索配置内,模型工具使用不受限制。答案由一个 LLM 作为评判者进行评分,该评判者接收系统提示、任务、评分标准和待评估的回答。所有评估尝试都使用 GPT-5.6 Terra(中等推理模式)进行评分,以标准化评分并最小化模型家族之间的差异。在测试中,未观察到两个代表性评判模型之间存在显著的评分差异(附录 C (https://arxiv.org/html/2608.23898#A3))。每个评分标准项都会单独呈现给评判者,以便其评分反映回答是否专门满足该标准。

### 3.2 基准测试覆盖范围
BenchBench-Protocol 包含 149 个评估任务,源自湿实验生物学九个领域的 96 个已发布协议,如表 1 (https://arxiv.org/html/2608.23898#S3.T1) 所列。已发布协议与贡献者在 Benchling(一个用于跨主要生命科学领域湿实验工作的平台)上创建的协议进行了比较。

表 1:按协议领域划分的基准测试覆盖范围。显示了九个领域中每个领域的任务数和源协议数。

### 3.3 基准测试构建
任务是通过比较已发布协议与科学家在 Benchling 上修改过的协议版本来构建的。版本之间的差异记录了科学家为适应新实验目标对协议所做的调整。这些差异为任务提供了基本事实,定义了相关的修改以及必须处理的下游后果。从每个差异中,起草一个问题和相应的评分标准,然后通过质量控制过程剔除无法回答、格式错误或模棱两可的问题。审查还验证了差异在科学上有意义且相关。

任务可能带有多个意图标签,这些标签并非互斥,每个任务还额外分配一个主要意图。这些标签允许根据任务所需判断的类型来分解性能表现,而不仅仅是按生物学主题。每个源协议领域和任务意图的定义见附录 A (https://arxiv.org/html/2608.23898#A1)。表 2 (https://arxiv.org/html/2608.23898#S3.T2) 报告了主要意图。

表 2:主要任务意图分布。显示了七种意图中每种的任务数量和比例。

### 3.4 专家评审
一组初步任务由领域专家进行评审,并进行了完善或修正,最终得到 149 个问题和相关评分标准。评审者从五个维度对每个任务进行评分:问题相关性、问题科学严谨性、评分标准推理深度、评分标准科学准确性以及问题整体质量。只有在问题相关性、问题科学严谨性、评分标准科学准确性和整体质量方面被评为“非常强”或“卓越”的任务才被保留在最终数据集中。

(图片说明:图 2:按评估维度划分的专家评审评分。显示了在五个维度中每个维度上被保留的任务被评为卓越、非常强或低于非常强的比例。)

每个任务至少由两位独立的评审者进行审查,每位评审者都拥有相关领域的博士学位,并在学术界或工业界担任科学家至少三年。图 2 (https://arxiv.org/html/2608.23898#S3.F2) 显示了各测量维度的整体指标。

![无标题图片](https://arxiv.org/html/2608.23898v1/figures/example_1.png)

示例 1:来自基因组学、转录组学和测序领域的样本任务。展示了科学家查询、源协议和加权评分标准项。

更多样本任务见附录 F (https://arxiv.org/html/2608.23898#A6)。

## 4 实验设置
### 4.1 评估的模型
评估了九个模型:Claude Opus 5、GPT-5.6 Sol、GPT-5.6 Terra、GPT-5.6 Luna、Gemini 3.6 Flash、Grok 4.5、Kimi K3、GLM 5.2 和 Inkling。所有模型均以最高可用推理设置运行。开源模型在 Baseten 上运行,具体设置详见附录 B (https://arxiv.org/html/2608.23898#A2)。结果汇总自每个任务的十次尝试。因回答格式错误或拒绝而未能产生有效回答的尝试得分为零;各模型的无效回答率在附录 I (https://arxiv.org/html/2608.23898#A9) 中报告。

### 4.2 评估方法
每个模型接收查询、一个已发布协议和互联网访问权限,并返回一个自由文本回答,如第 3.1 节 (https://arxiv.org/html/2608.23898#S3.SS1) 所述。Claude Opus、GPT 系列、Gemini 和 Grok 模型可以访问其提供商的第三方搜索工具,而开源模型则通过 Exa 配置为“自动”努力级别获得互联网访问权限。在这些配置内,工具使用不受限制。LLM 评判者未获得网络搜索或工具。附录 C (https://arxiv.org/html/2608.23898#A3) 报告了两个评判模型之间的代表性一致性结果。

### 4.3 指标
模型性能使用 0 到 1 之间的标准化评分标准得分来报告。每个评分标准项评分为 0、1 或 2,其中 2 为满分,1 为部分分数。每个标准项还有权重,反映其对整体任务的相对重要性。使用粗略的三分制而非更宽的数字范围,以提高 LLM 作为评判者的稳定性。回答的标准化得分是加权标准项得分总和除以可用总加权分数,报告的是每个任务十次尝试的平均值。置信区间通过在源协议级别进行自助重采样计算,因为源自同一协议的任务并非独立。预期最佳-k 得分通过从每个问题的十次尝试中不放回地抽取 k 次,取最大标准化得分,并在重采样中取平均值来计算。

## 5 结果
在 BenchBench-Protocol 上的性能在不同模型、任务意图和源协议领域之间差异显著。Claude Opus 5 是整体最强的模型,平均标准化得分为 59.2%(95% CI:56.8–61.5%)。其他被评估模型的得分范围在 34.1% 到 47.1% 之间。所有评估模型的得分如图 3 (https://arxiv.org/html/2608.23898#S5.F3) 所示。BenchBench-Protocol 在所有模型家族中至少有 40% 未获得的加权评分标准分数空间,为未来的前沿模型评估提供了可能。

(图片说明:图 3:各模型平均标准化评分标准得分。显示了 149 个任务的平均值及 95% 置信区间。)

### 5.1 重复采样下的性能
由于科学家可以在执行一个候选答案之前比较多个候选答案,因此报告了预期最佳-k 性能作为单模型性能的上限。

模型性能在 k 值上的排序并不稳定。GPT-5.6 Sol 和 Kimi K3 在 k=1 时在统计上难以区分,但在 k=10 时明显分开,Kimi K3 表现更好。由于绝对增益受限于 k=1 时的未得分空间,增益以捕获的空间比例表示。完整结果见附录 E (https://arxiv.org/html/2608.23898#A5);附录 D (https://arxiv.org/html/2608.23898#A4) 显示了模型在任务上的性能分布。

(图片说明:图 4:三个代表性模型的预期最佳-k 得分。显示了每个任务十次尝试中 k 次尝试的预期最大得分及 95% 置信带。完整的九个模型结果见表 E2 (https://arxiv.org/html/2608.23898#A5.T2)。)

在十次尝试时,Claude Opus 5 捕获了 39.5% 的可用空间,Kimi K3 捕获了 31.5%,而所有三个 GPT-5.6 模型捕获了 19.6% 到 22.5% 之间。在多次尝试中捕获较少空间的模型往往更具可预测性。在预言机选择下,最强的模型仍留下大约四分之一的评分标准分数未获得,这表明在任何 k 值下基准测试都未饱和。

### 5.2 按任务意图划分的性能
图 5 (https://arxiv.org/html/2608.23898#S5.F5) 显示了不同任务意图之间性能的显著差异。

(图片说明:图 5:按主要任务意图划分的平均标准化评分标准得分。单元格给出平均得分(百分比),并列出每个意图的任务数。)

通过启发式分析失败案例,模型在需要从实验证据推理到其支持的结论的任务上表现相对较好。模型在需要隐性知识或专家直觉的任务上表现相对较差……

相似文章

ResearchClawBench:面向端到端自主科学研究的基准测试

Hugging Face Daily Papers

ResearchClawBench 是一个用于评估端到端自主科学研究的基准测试,涵盖来自10个领域的40个任务,结果显示当前AI智能体和LLM的重新发现准确率较低,其中Claude Code平均得分为21.5,Claude-Opus-4.7平均得分为20.7(在可能的总分中)。

基准测试的基准测试:检验常识基准的预测效度

arXiv cs.CL

本文通过评估23个大语言模型在四个基准测试及其改进版本上的表现,检验常识基准分数是否能预测现实世界下游任务的表现,发现改进版本保持了排名,但仅提供依赖于任务的预测效度。

WildClawBench:真实世界长周期智能体评估基准

Hugging Face Daily Papers

WildClawBench 使用真实的命令行界面环境和实际工具,评估语言和视觉-语言模型在现实长周期任务上的表现。该基准测试显示,即使最佳模型也仅达到62.2%的准确率,表明长周期智能体评估仍具有挑战性。