BixBench3:前沿AI智能体现在可以复现约48%的真实计算生物学研究工作流程
摘要
本文介绍BixBench3,一个用于评估AI代理在计算生物学任务上的基准,表明前沿LLMs可以复现约48%的真实研究工作流程,但在处理大型数据集和顺序步骤方面存在困难。
暂无内容
查看缓存全文
缓存时间: 2026/08/27 15:25
# 1 引言 来源: https://arxiv.org/html/2608.25286 **BixBench3:在研究规模计算生物学任务上评测AI智能体** Zane Koch<sup>1</sup>, Asmamaw T. Wassie<sup>1</sup>, Javier Valdes-Aleman<sup>1</sup>, Jason Lee<sup>1</sup>, Michaela M. Hinks<sup>1</sup>, Samuel G. Rodriques<sup>1</sup>, Andrew D. White<sup>1</sup>, Jon M. Laurent<sup>1</sup>,\* **摘要** 人工智能(AI)有望通过自动化计算分析加速生物研究。然而,AI智能体执行完整研究规模的计算生物学能力尚未得到系统评估。在此,我们推出 **BixBench3**,这是一个衡量AI智能体从原始生物数据处理到得出科学结论能力的基准测试。我们设计了 **BixBench3** 的任务,以模拟科学家将工作委托给智能体的过程:科学家选择研究问题和高级方法,然后将所有分析的实施委托给智能体。在每个任务中,智能体接收研究目标、方法指导以及源自已发表科学研究的原始数据,并必须执行一系列分析以实现研究目标。这些分析产生的数据产物(如峰值调用矩阵或差异表达表)会根据原始研究中生成和报告的相应产物进行程序化评分。在涵盖生成138个独特产物的20个 **BixBench3** 任务中,我们发现13个前沿大语言模型(LLM)的得分范围从Gemini 3.1 Flash Lite的0.00到GPT 5.6 Sol的0.48。智能体在原始数据集更大的任务(小于100GB的任务得分为0.36,大于100GB的任务得分为0.10)和需要更多顺序步骤的分析(1-2步得分为0.36,3步及以上得分为0.24)上表现较差。平均而言,智能体完成每个任务使用6.8小时、1.02亿个代币和43美元,而最长的尝试消耗了24小时、10.7亿个代币和525美元。值得注意的是,得分最高的智能体使用的代币更少,成本也低于性能较差的选项。这些结果揭示,大语言模型在(1)连贯执行多个顺序分析步骤、(2)管理大量原始数据以及(3)跨科学领域工作方面的能力存在显著差异。 <sup>1</sup> Edison Scientific, Inc., 旧金山,加利福尼亚州,美国 \* 通讯作者:Jon M. Laurent,邮箱:[email protected] 预印本。2026年8月27日。 ![[无标题图像]](https://arxiv.org/html/2608.25286v1/edison.png) ## 1 引言 基于大语言模型(LLM)的智能体正日益被部署用于执行科学研究。近期的智能体将大语言模型与代码执行、检索和特定领域工具相结合,以完成研究工作流的部分环节,而非孤立的问答。在生物学领域,Robin 推动了一项实验室循环的迭代工作,为干性年龄相关性黄斑变性提出了一个治疗候选药物 (Ghareeb et al., 2026 (https://arxiv.org/html/2608.25286#bib.bib6))。Kosmos 在代谢组学、材料科学、神经科学和统计遗传学领域产生了七项发现,其中三项独立地复现了未发表或预印的发现 (Mitchener et al., 2025b (https://arxiv.org/html/2608.25286#bib.bib7))。诸如 Biomni 和 Claude Science 等科学助手打包了生物医学工具和数据库,以实现AI辅助研究 (Huang et al., 2026 (https://arxiv.org/html/2608.25286#bib.bib2); Anthropic, 2026 (https://arxiv.org/html/2608.25286#bib.bib8)),而更广泛的智能体则针对单细胞工作流、生物信息学流程设计和自动化机器学习实验 (Xin et al., 2024 (https://arxiv.org/html/2608.25286#bib.bib1); Mehandru et al., 2025 (https://arxiv.org/html/2608.25286#bib.bib3); Martinek et al., 2025 (https://arxiv.org/html/2608.25286#bib.bib4); Jin et al., 2025 (https://arxiv.org/html/2608.25286#bib.bib5))。与此同时,近期的压力测试和生物医学智能体综述警告称,自主科学智能体仍然存在脆弱性,失败源于虚构的主张、薄弱的不确定性处理以及计划与可执行分析之间的脱节 (Agrawal et al., 2026 (https://arxiv.org/html/2608.25286#bib.bib11); Gao et al., 2024 (https://arxiv.org/html/2608.25286#bib.bib12); Zhou et al., 2025 (https://arxiv.org/html/2608.25286#bib.bib13))。 尽管取得了这些进展,AI智能体是否能够从原始数据开始执行完整的计算研究尚未得到衡量。为解决这一不确定性,我们推出了 **BixBench3**。在 **BixBench3** 中,智能体接收一个高级研究目标、源自已发表生物学论文的方法指导以及与该研究相关的原始数据。智能体的任务是分析提供的数据以实现研究目标。因此,**BixBench3** 评估了智能体遵循特定指令构建和执行长分析流程的能力。性能通过比较智能体生成的产物与原始出版物中的产物来进行评分。该基准测试由20项研究构建而成,涵盖17种实验类型和9个科学领域,共有138个待评分的产物。与评估智能体能否回答生物学问题或执行单一生物信息学分析的基准测试 (Laurent et al., 2024 (https://arxiv.org/html/2608.25286#bib.bib19); Laurent et al., 2026 (https://arxiv.org/html/2608.25286#bib.bib20); Liu et al., 2025 (https://arxiv.org/html/2608.25286#bib.bib18); Mitchener et al., 2025a (https://arxiv.org/html/2608.25286#bib.bib14); Nair et al., 2026 (https://arxiv.org/html/2608.25286#bib.bib9)) 不同,**BixBench3** 测试了端到端进行整个计算研究所必需的长期能力。 ### 1.1 相关工作 **BixBench3** 位于先前两个工作流的交叉点:长期基准测试,测试AI智能体是否能够使用工具执行扩展的多步骤任务;以及生物学和生物信息学基准测试,测试科学和分析能力。**BixBench3** 结合了前者的长期挑战和后者的领域特定性。 长期智能体基准测试评估了在多个步骤上的工具使用、规划和执行能力。随着智能体能力的提高,模型能够完成的任务长度已从2024年那些需要人类几分钟的任务 (Zhou et al., 2024 (https://arxiv.org/html/2608.25286#bib.bib21); Xie et al., 2024 (https://arxiv.org/html/2608.25286#bib.bib27)) 增加到2026年那些需要人类16小时以上的任务 (METR, 2026 (https://arxiv.org/html/2608.25286#bib.bib29))。SWE-bench 和 SWE-bench Verified 挑战智能体解决真实的 GitHub 问题,截至2026年7月,性能最高的模型(gpt-5.6-sol)平均每个 SWE-bench Verified 任务耗时3分钟 (Jimenez et al., 2024 (https://arxiv.org/html/2608.25286#bib.bib22); Vals AI, 2026 (https://arxiv.org/html/2608.25286#bib.bib23))。在 Terminal-Bench-2 上测试智能体在基于终端的软件、数据科学和系统任务上的表现,截至2026年7月,排名最高的模型(Fable 5)完成最长任务大约需要一小时 (Merrill et al., 2026 (https://arxiv.org/html/2608.25286#bib.bib28); Terminal-Bench, 2026 (https://arxiv.org/html/2608.25286#bib.bib30))。RE-Bench 比较了人类和智能体在机器学习研究任务上的能力,智能体平均消耗2900万个输入代币 (Wijk et al., 2025 (https://arxiv.org/html/2608.25286#bib.bib24))。PaperBench 给智能体最多36小时来复现机器学习论文,尽管性能大多在第一小时后趋于平稳 (Starace et al., 2025 (https://arxiv.org/html/2608.25286#bib.bib10))。HCAST 在189个软件、机器学习工程和网络安全任务上评估智能体,每个任务人类最多需要八小时 (Rein et al., 2025 (https://arxiv.org/html/2608.25286#bib.bib25))。在已报告的最长时限内,SWE-Marathon 在20个软件工程规模的任务上评估智能体,每个任务有2-10小时的智能体时限和40-400小时的专家人类估计;智能体尝试平均消耗2720万个代币 (Desai et al., 2026 (https://arxiv.org/html/2608.25286#bib.bib31))。相比之下,现有的生物学和生物信息学基准测试通常相对较短,以问答格式测试领域知识,或测试孤立分析上的智能体能力。LAB-Bench 和 LABBench2 通过关于文献检索、方案故障排除和序列操作的问题来测试领域知识和实际研究技能,而 BioProBench 专注于生物协议理解 (Laurent et al., 2024 (https://arxiv.org/html/2608.25286#bib.bib19); Laurent et al., 2026 (https://arxiv.org/html/2608.25286#bib.bib20); Liu et al., 2025 (https://arxiv.org/html/2608.25286#bib.bib18))。DISCOVERYWORLD 要求智能体在虚拟环境中进行科学发现,人类和智能体都需要大约100-1,000步来完成每个任务 (Jansen et al., 2024 (https://arxiv.org/html/2608.25286#bib.bib26))。BixBench、GenoTEX 和 BioDSA-1K 要求智能体执行短的生物数据分析任务 (Mitchener et al., 2025a (https://arxiv.org/html/2608.25286#bib.bib14); Liu et al., 2024a (https://arxiv.org/html/2608.25286#bib.bib16); Wang et al., 2025 (https://arxiv.org/html/2608.25286#bib.bib15))。在 GenoTEX 上,OpenAI o1 平均每个任务消耗112,000个输入代币、12,000个输出代币和192秒 (Liu et al., 2024a (https://arxiv.org/html/2608.25286#bib.bib16))。复杂度逐渐增加,CompBioBench 包含100个孤立的计算生物学问题,模型平均完成时间为11-18分钟 (Nair et al., 2026 (https://arxiv.org/html/2608.25286#bib.bib9))。BAISBench 要求智能体从单细胞 h5ad 数据集中注释细胞类型并回答发现性问题,被评估的系统消耗高达约500,000个代币 (Luo et al., 2025 (https://arxiv.org/html/2608.25286#bib.bib17))。GeneBench-Pro 更直接地针对多阶段分析:其129个基因组学和转化生物医学问题向智能体提供指导最少、可能出错的模拟数据集,并要求3-13个相关的统计决策来恢复待评分的目标估计值,作者估计每个问题需要10-40小时的无辅助专家工作 (Li and Ho, 2026 (https://arxiv.org/html/2608.25286#bib.bib32))。SpatialBench-Long(每个任务2-45分钟)和 scBench-Long(每个任务4-65分钟)要求智能体从原始或接近原始的空间和单细胞数据中恢复研究水平的结论,而 VariantBench(6小时上限)包含118个任务,涵盖变异发现、质量控制和解释 (Diks et al., 2026a (https://arxiv.org/html/2608.25286#bib.bib57); Diks et al., 2026b (https://arxiv.org/html/2608.25286#bib.bib58); Bhowmick et al., n.d. (https://arxiv.org/html/2608.25286#bib.bib59); LatchBio, 2026 (https://arxiv.org/html/2608.25286#bib.bib60))。 ## 2 结果 ### 2.1 基准测试描述 **BixBench3** 评估AI智能体能否从原始数据重构已发表的计算生物学研究的分析过程,生成结构化的产物,并根据相应的已发表结果进行评分(图1 (https://arxiv.org/html/2608.25286#S2.F1)A)。在20个任务中,得分最高的模型复现了48%的请求产物,且足够接近以保留其主要生物学意义(图1 (https://arxiv.org/html/2608.25286#S2.F1)B)。 *参考图注* 图1:**BixBench3** 构建与顶尖性能。 **(A)** 每个基准任务通过将已发表的研究分解为产生数据产物的分析有向无环图(DAG)来构建。智能体生成的这些产物版本根据相应的已发表产物进行程序化评分。 **(B)** 13个模型在20个 **BixBench3** 任务上的产物级通过情况,每个模型包含138个请求产物和1,794个模型-产物评估。实心方块表示程序化评分至少为0.80的产物,这是专家校准的阈值,表明该产物保留了主要生物学解释(第4.4节 (https://arxiv.org/html/2608.25286#S4.SS4));空心方块表示低于此阈值的产物。右侧的条形图显示每个模型的整体 **BixBench3** 得分:其在20个任务上的平均任务得分,其中每个任务得分是通过产物的比例。 **BixBench3** 由20个任务组成,这些任务选自已发表的论文,涵盖广泛的科学领域并分析多样化的数据类型(图2 (https://arxiv.org/html/2608.25286#S2.F2)A–B;附录表1 (https://arxiv.org/html/2608.25286#A1.T1))。转录组学是最常见的数据类型(16个任务),其次是表观基因组学(6个任务)、蛋白质组学(2个任务)、基因组学(1个任务)和微生物组测序(1个任务);6个任务分析多种数据类型。**BixBench3** 中代表的科学领域的分布与最近发布在 bioRxiv 上的论文覆盖的许多领域相同,药物发现相关研究的比例过高(图2 (https://arxiv.org/html/2608.25286#S2.F2)B)。原始输入数据量平均每个任务67 GB,范围从7到241 GB(图2 (https://arxiv.org/html/2608.25286#S2.F2)C)。每个任务至少产生四个数据产物,中位数为五个,最大为14个,任务总计138个产物(图2 (https://arxiv.org/html/2608.25286#S2.F2)D)。在这些产物中,56个是原始数据的直接衍生(深度1;例如,读数计数矩阵),44个是距离原始数据两步的分析(深度2;例如,差异基因表达表),38个是三步或更多步(深度3+;例如,通路富集,图2 (https://arxiv.org/html/2608.25286#S2.F2)E)。 *参考图注* 图2:**BixBench3** 的构成。 **(A)** 分析每种数据类型的任务数量。分析多种数据类型的任务计入多个条形。 **(B)** **BixBench3** 和500篇 bioRxiv 论文随机样本中分配给每个科学领域的任务份额。 **(C)** 每个任务的原始数据大小。 **(D)** 每个任务的待评分数产物数量。 **(E)** 产物分析深度。深度1表示直接从原始数据派生的输出,深度2表示从深度1产物派生的输出,深度3+表示所有后续步骤。 *参考图注* 图3:**BixBench3** 上的总体模型性能。 **(A)** 每个模型在20个任务上的平均得分。 **(B)** 按模型和分析深度划分的平均二元产物通过分数,包括56个深度1产物、44个深度2产物和38个深度3+产物。 **(C)** 每个模型的任务得分,任务按模型中位数得分排序。 **(D)** 按模型和科学领域划分的平均任务得分。 **(E)** 按原始数据规模分层的模型-任务得分分布;黑点表示单个模型-任务得分,括号中的值给出每个规模类别的任务数量。(A)和(B)中的误差线表示标准误差。(B)中的星号表示双侧 Mann–Whitney U 检验 *p* < 0.05;(E)中的 *p* 值来自双侧 Mann–Whitney U 检验。 *参考图注* 图4:准确性与计算开销。 **(A)** 每个模型在20个任务上的任务成本,以对数尺度显示。对于 GLM 5.2,单独的框显示观察到的 OpenRouter 成本以及将每个任务重新缩放为其他模型平均缓存命中率后的成本。 **(B)** 平均成本与平均任务得分。 **(C, E, G)** 每个任务的代币使用量、壁钟时间和模型轮次。 **(D, F, H)** 平均任务得分与相应的计算效率度量。误差线表示标准误差,虚线标记帕累托前沿。 *参考图注* 图5:按模型和得分划分的处理判断失败模式。 **(A)** 每个模型在所有任务中分配的失败模式标签累积数量。从左到右显示的模型...
相似文章
基准测试生物学 AI 智能体:ML@B 与 LatchBio 的合作
加州大学伯克利分校机器学习团队(ML@B)与 LatchBio 合作,对其 AI 智能体在空间转录组工作流程中的性能进行了基准测试,评估其自动化复杂生物信息学任务的能力。
HealthAgentBench: 面向前沿AI智能体的统一真实医疗智能体环境基准套件
本文介绍了HealthAgentBench,一个包含54个真实医疗任务的套件,用于评估前沿AI智能体。研究发现,即使是最强的智能体(Codex GPT-5.5)也仅能达到约42%的成功率,凸显了巨大的改进空间。
Collider-Bench: 以粒子物理分析复现基准测试AI代理
Collider-Bench是一个新基准,评估LLM代理仅使用公开论文和开源软件复现大型强子对撞机粒子物理分析的能力,需要物理推理来填补缺失的实现细节。
TxBench-PP:分析AI代理在小分子临床前药理学上的表现
TxBench-PP是一个用于评估AI代理在小分子临床前药理学任务上表现的基准测试。在16种模型-框架配置中,最佳系统仅达到59.3%的准确率,表明仍有很大的改进空间。
@Lyubh22:编程基准测试正在趋于饱和。AI4Research 是下一个前沿领域。很高兴看到我们的 MLS-Bench(https://mls-bench.co…)
正式发布 MLS-Bench,这是首个获得社区广泛采用的 AI4Research 基准测试,它在 12 个领域的 140 个可执行任务上测试 AI 智能体,以提出模块化的机器学习改进方案。该帖子还包含 Claude Opus 4.6 和 GPT-5.4 等模型的排行榜分数。