@OpenAI: 我们正在推出GeneBench-Pro,这是一个研究级基准测试,用于衡量一种更难实现的AI进步:智能体在导航…
摘要
OpenAI推出了GeneBench-Pro,这是一个研究级基准测试,用于测试AI智能体在计算生物学中导航混乱的生物数据、选择分析路径以及做出判断的能力。
查看缓存全文
缓存时间: 2026/06/30 17:46
我们正式推出GeneBench-Pro——一个研究级基准测试,用于衡量一项更难的AI进步:智能体如何在混乱的生物数据中导航、选择正确的分析路径,并做出真正计算研究所依赖的判断。 https://t.co/AsilnnSxnE
介绍 GeneBench-Pro
来源:https://openai.com/index/introducing-genebench-pro/ 科学数据很少附带说明书。研究人员必须判断一个模式反映的是生物学现象还是噪声,数据能否支撑所提出的问题,以及每个结果应该如何改变他们下一步的行动。AI智能体在执行复杂分析方面越来越有能力,但真正的科学研究不仅仅依赖于回忆事实或遵循预定义的工作流程,还取决于做出这些更高阶的判断。
今天,我们推出GeneBench-Pro——一个具有挑战性的研究级基准测试,用于测试模型能否处理真实世界计算生物学所需的、充满判断的复杂分析。它扩展了GeneBench(在新窗口中打开)(https://www.biorxiv.org/content/10.64898/2026.04.22.720113v1),涵盖了基因组学、定量生物学和转化医学中更困难、更现实的任务,捕捉了计算生物学科学研究中的复杂性、迭代性和模糊性。
迄今为止,很少有令人信服的评估能够衡量那些使真实世界计算研究变得困难的系统级判断能力。这些能力包括处理模糊性、修正假设、选择正确的分析路径,以及判断结果何时可以用于决策。由于这些技能难以形式化,因此也难以严格评估,尽管它们的不足正日益限制AI的整体性能。
GeneBench-Pro旨在精确衡量这些更高层次的能力。在GeneBench-Pro中,我们将“研究品味”定义为塑造分析的一系列判断链条:数据能支持哪些问题,早期诊断应如何改变模型或估计目标,以及何时需要修改初始计划。每个GeneBench-Pro问题都会给模型一个真实的、混乱的数据集、简短的实验背景,以及一个与下游决策相关的目标估计量。要正确回答,模型必须探索数据、选择合适的分析方法、进行迭代实验过程,并给出最终答案。
数据集构建
在生物学中,数据生成(例如基因组测序)的成本已大幅下降,一些研究人员现在认为(在新窗口中打开)(https://www.nature.com/articles/s41576-022-00551-z),限制因素不再是样本收集,而是下游的计算和分析。GeneBench-Pro旨在评估解决这一瓶颈方面的进展,包含129个问题,涵盖计算生物学广泛的场景和方法。
领域图谱:10个领域、21个子领域的129个问题
点击上方圆点了解一个基准问题。
此图谱提供了GeneBench-Pro广度的预览。请访问案例研究页面(在新窗口中打开)(https://openai.com/index/genebench-pro/case-studies/),详细探索10个有代表性的问题。
GeneBench-Pro的设计还旨在避免常见的基准测试失败。许多长周期生物学基准测试围绕混乱的历史数据集构建多步骤问题,这些问题可能没有单一的正确分析路径。一个智能体可能选择一个可辩护的阈值,另一个可能选择不同但同样可辩护的选项,这更多地反映了基准创建者的任意选择,而不是模型性能的根本差异。反之亦然:如果问题在数值上不够敏感,智能体可能在分析中犯下根本性错误,但仍能产生一个及格结果。
为了避免这些失败模式,每个GeneBench-Pro问题都是合成构建的:我们知道完整的因果结构,并直接模拟数据生成过程。这使我们能够调整每个问题的复杂度,确保主观分析选择上的合理差异仍然能产生可接受的数值结果,并通过消融研究验证那些看似合理但错误的分析路径会失败。然后,我们通过详细的追踪分析来审计问题草案,检查信息泄露和意外的解题路径。这让我们有信心认为,获得正确答案取决于选择正确的分析路径,而不是利用捷径或匹配某个任意作者的偏好。
我们将129个GeneBench-Pro问题中的82个发送给了外部领域专家,包括研究生、博士后研究员、产业界科学家和教授。评审员评估了每个问题的真实性、目标答案是否可识别,以及方法和估计量是否恰当。反馈被用于改进问题。
评估与评分
每个GeneBench-Pro问题都是一个独立的科学分析。智能体可以访问一个隔离的工作区,其中包含简短的提示、数据文件和一个标准的生物信息学软件栈,包括Python、科学计算库以及PLINK 2.0等基本基因组学软件包(尽管问题不需要特定领域的工具)。
由于我们控制了完整的数据生成过程,我们可以根据已知目标确定性地评判正确性,避免了标准评分标准评估中出现的模型选择可变性和冗长效应。
每个问题还附带有丰富的元数据,包括预期的分析结构、附件数据文件、详细的多页案例研究以及专家评审结果。我们将在Hugging Face(在新窗口中打开)(https://huggingface.co/datasets/ajh-oai/genebench-pro-public-package)上完全开源10个有代表性的GeneBench-Pro问题,并提供一个交互式网页界面(在新窗口中打开)(https://openai.com/index/genebench-pro/case-studies/)。最后,我们将在不久的将来向Artificial Analysis(在新窗口中打开)(https://artificialanalysis.ai/)提供一个包含50个问题的子集,用于独立的第三方基准测试。
结果
我们最强的模型GPT‐5.6 Sol 在最高推理水平下的通过率为28.7%(启用Pro模式后为31.5%)。这比我们开始构建原始GeneBench时有了显著提升;当时我们最强的前沿模型GPT‐5的得分低于5%。在此基准测试上的进展表明,即使在不太具体的、系统级的科学推理方面,前沿模型也在快速改进。按照目前的速度,这个基准测试可能在今年年底前就会饱和。
结果还显示了扩展测试时计算的重要性。在最低推理水平下,GPT‐5.6 Sol 的通过率仅为个位数。在最高推理水平下,GPT‐5.6 Sol 解决的问题数量几乎是GPT‐5.2的六倍,而使用的token数大约只有其三分之二。
跨模型家族的比较表明,在定量不确定性下的高层次科学推理中,GPT模型是最强的系统之一。GPT‐5.6、GPT‐5.5与领先的开源模型(如GLM 5.2)之间的性能差距,远大于我们根据编码基准测试(在新窗口中打开)(https://deepswe.datacurve.ai/)进行外推时的预期,这表明开源模型更专注于编码而非更广泛的推理能力。
在开发过程中,我们使用了前沿的GPT模型来评估和强化问题。因此,我们怀疑GeneBench-Pro可能对GPT模型存在偏向,而有利于其他模型家族。然而,竞争模型在最佳情况下也只能达到相应GPT模型在发布时的性能水平,并且往往相差甚远。
这些评估结果——在GPT‐5.6 Sol (Pro)上高达31.5%——鉴于GeneBench-Pro问题的难度,是非常引人注目的。在一项调查中,我们的评审员估计,一个典型的GeneBench-Pro问题需要人类专家大约20-40小时才能完成。按保守的每小时200美元计算,单个问题的人力成本就在数千美元。目前的AI智能体还太不可靠,无法取代人类专家,但成本差距是巨大的,每个问题的推理成本仅为几美元。这意味着,即使以目前的能力进行部分自动化,也能创造可观的经济和科学价值。
然而,前沿模型仍然解决不了这些问题中的三分之一,这表明还有很大的改进空间。模型可以在具有挑战性的问题上取得部分进展,但它们难以完成推理循环。这种失败模式反映了人类专家与新手之间的对比。专家利用经验来构建问题并调整方法,而新手则能做出观察,但难以将它们整合到问题的更广泛背景中。
要实现近乎完美的性能,需要既能可靠衡量进展,又能识别模型仍在哪些方面失败的评估方法。像GeneBench-Pro这样的基准测试可以帮助将模糊的能力缺陷转化为我们可以诊断和改进的东西。
如果智能体能够可靠地自动化这类分析,它们就能显著加速科学发现。人类遗传证据已经是靶点优先排序和转化追踪的核心,因为具有遗传支持的机制更有可能催生获批的治疗方法。
与此同时,测序成本已大幅下降,生物库规模的数据集现在以前所未有的广度连接了分子、表型和健康记录信息。限制因素正从数据生成转向将信息转化为可操作的洞见。能够持续执行目前由人类专家团队处理的分析的模型,可以通过加速假设筛选、靶点追踪以及数据生成与决策之间的迭代周期,来变革工业研究。
GeneBench-Pro代表了评估有经验的研究人员所具备的良好科学判断中更抽象技能的第一步。这些技能使他们能够直觉地发现并识别最有希望的初始分析,在数据与初始假设矛盾时迭代和修正自己的思路,并得出可能影响下游临床、学术或商业决策的结论。
我们预计,随着模型能力的进步,那些在更高抽象层次上探究模型能力的基准测试将变得越来越有用,而不仅仅是测试书本知识或执行常规分析的能力。
相似文章
GeneBench-Pro 介绍
OpenAI 推出 GeneBench-Pro,这是一个研究级基准,旨在测试 AI 代理在计算生物学中进行需要大量判断的分析的能力,涵盖基因组学、定量生物学和转化医学。
深入解读GeneBench-Pro
GeneBench-Pro 是 OpenAI 推出的一项全面基准测试,旨在评估人工智能模型在复杂基因组学任务上的表现,包括体细胞肿瘤学、功能基因组学以及临床携带者筛查。
@OkhayIea: 每个人都在竞相构建“AI科学家”。因此我们提出了一个直白的问题:当今最好的编码代理能打败公开发表的…
介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。
介绍 LifeSciBench
OpenAI 推出 LifeSciBench,这是一个包含 750 个专家编写任务的基准测试,用于评估 AI 系统在现实生命科学研究工作流中的表现,包括证据处理、分析和科学推理。
@IntologyAI:编码智能体能做研究吗?我们发布 NanoGPT-Bench,这是我们用来测试编码智能体在 AI 研发问题上的一项内部评估…
IntologyAI 发布了 NanoGPT-Bench,这是一个用于评估编码智能体在 AI 研发任务上表现的内部基准。当前的智能体仅恢复了人类进展的 9.3%,主要通过超参数调优,凸显了算法研究能力方面的差距。