GeneBench-Pro 介绍
摘要
OpenAI 推出 GeneBench-Pro,这是一个研究级基准,旨在测试 AI 代理在计算生物学中进行需要大量判断的分析的能力,涵盖基因组学、定量生物学和转化医学。
推出 GeneBench-Pro,这是一个新的基准测试,使用复杂、真实世界的数据集,测试 AI 在基因组学、生物学和科学研究中的性能。
查看缓存全文
缓存时间: 2026/06/30 18:38
# 介绍 GeneBench-Pro
来源:https://openai.com/index/introducing-genebench-pro/
科学数据很少附带使用说明。研究人员必须判断一个模式反映的是生物学现象还是噪声,数据是否足以支持所提出的问题,以及每个结果应如何改变他们下一步的行动。AI 智能体执行复杂分析的能力日益增强,但真正的科学研究不仅依赖于回忆事实或遵循预定义的工作流程,还取决于进行这些更高层次的判断。
今天,我们推出 GeneBench-Pro——一个具有挑战性的、研究级别的基准测试,用于检验模型是否能处理真实世界计算生物学所需的、需要大量判断的分析。它在 GeneBench(在新窗口中打开)(https://www.biorxiv.org/content/10.64898/2026.04.22.720113v1) 的基础上进行了扩展,涵盖了基因组学、定量生物学和转化医学中更难、更现实的任务,捕捉了计算生物学科学研究中的复杂性、迭代性和模糊性。
迄今为止,对于使真实世界计算研究变得困难的系统级判断能力,很少有令人信服的评估。这些能力包括处理模糊性、修正假设、选择正确的分析路径,以及判断结果何时可以用于决策。由于这些技能难以形式化,因此也难以进行严格评估,即使它们上的弱点正日益制约着 AI 的整体性能。
GeneBench-Pro 旨在精确衡量这些更高级的能力。在 GeneBench-Pro 中,我们将“研究品味”定义为塑造分析的一系列判断:数据能支持哪些问题,早期诊断应如何改变模型或估计量,以及初始计划何时需要修改。每个 GeneBench-Pro 问题都会给模型提供一个真实且杂乱的数据集、简短的实验背景,以及一个与下游决策相关的目标估计量。要正确回答,模型必须探索数据、选择合适的分析途径、进行迭代实验过程,并提供最终答案。
## 数据集构建
在生物学中,数据生成(例如基因组测序)的成本已大幅下降,一些研究人员现在认为(在新窗口中打开)(https://www.nature.com/articles/s41576-022-00551-z),限制因素不再是样本收集,而是下游计算和分析。GeneBench-Pro 旨在评估解决这一瓶颈方面的进展,包括 129 个问题,涵盖广泛的计算生物学设置和方法。
## 领域图谱:涵盖 10 个领域和 21 个子领域的 129 个问题
点击上方圆点可了解一个基准问题。
此图谱提供了 GeneBench-Pro 广度预览。请访问案例研究页面(在新窗口中打开)以更详细地探索 10 个代表性问题。
GeneBench-Pro 还旨在避免常见的基准测试失败。许多长期生物学基准测试围绕混乱的历史数据集构建多步骤问题,其中可能没有单一正确的分析路径。一个智能体可能选择一个合理的截断值,而另一个可能选择不同但同样合理的选项,这更多反映了基准创建者的任意选择,而非模型性能的根本差异。反过来也可能发生:如果一个问题在数值上太不敏感,智能体可能在分析中犯下根本性错误,但仍能产生一个及格的答案。
为避免这些失败模式,每个 GeneBench-Pro 问题都是合成构建的:我们知道完整的因果结构,并直接模拟数据生成过程。这使我们能够调整每个问题的复杂性,确保分析选择上的合理差异仍能产生可接受的数值结果,并通过消融研究验证虽然看似合理但错误的分析会失败。然后,我们通过详细的追踪分析来审计问题草案,检查是否存在信息泄漏和意外的解决路径。这让我们确信,获得正确答案依赖于选择正确的分析路径,而不是利用捷径或匹配作者的任意偏好。
我们将 129 个 GeneBench-Pro 问题中的 82 个发送给了外部领域专家,包括研究生、博士后研究人员、工业界科学家和教授。审阅者评估了每个问题的现实性、目标答案是否可识别,以及方法和估计量是否合适。反馈用于改进问题。
## 评估与评分
每个 GeneBench-Pro 问题都是一个独立的科学分析。智能体可以访问一个隔离的工作环境,其中包含简短提示、数据文件以及标准的生物信息学工具集,包括 Python、科学计算库和基本基因组学软件包(如 PLINK 2.0),尽管这些问题不需要特定领域的工具。
由于我们控制完整的数据生成过程,我们可以根据已知目标确定性地对正确性进行评分,避免了基于标准评分标准评估中发现的模型选择变异性和冗长效应。
每个问题还附带丰富的元数据,包括预期的分析结构、附加的数据文件、详细的多页案例研究以及专家评审结果。我们将在 Hugging Face(在新窗口中打开)上完全开源 10 个代表性的 GeneBench-Pro 问题,并提供一个交互式网页界面供浏览。最后,我们将在不久的将来向 Artificial Analysis(在新窗口中打开)提供一个包含 50 个问题的子集,用于独立的第三方基准测试。
## 结果
我们最强的模型 GPT-5.6 Sol 在最高推理级别下达到了 28.7% 的通过率(启用 Pro 模式时为 31.5%)。这相比我们开始构建原始 GeneBench 时有了显著提升;当时,我们最好的前沿模型 GPT-5 得分低于 5%。在这个基准测试上的进展表明,前沿模型正在快速改进,即使在不太具象的系统级科学推理上也是如此。按照目前的速度,这个基准测试可能在今年年底被饱和。
结果还显示了扩展测试时计算的影响力。在最低推理级别下,GPT-5.6 Sol 的通过率仅为个位数。在最高推理级别下,GPT-5.6 Sol 解决的问题数量几乎是 GPT-5.2 的六倍,而使用的 token 数量大约只有三分之二。
跨模型家族的比较表明,GPT 模型是在数量不确定性下进行高级科学推理的最强系统之一。GPT-5.6、GPT-5.5 与领先开源模型(如 GLM 5.2)之间的性能差距,比我们从编码基准测试(在新窗口中打开)外推时预期的要大得多,这表明开源模型更专精于编码,而非更广泛的推理能力。
在开发过程中,我们使用前沿 GPT 模型来评估和强化问题。因此,我们怀疑 GeneBench-Pro 可能对其他模型家族存在对 GPT 模型的偏见。然而,竞争对手模型最多只能匹配相应 GPT 模型在发布时的性能,并且往往远不及。
鉴于 GeneBench-Pro 问题的难度,这些评估结果——GPT-5.6 Sol(Pro)高达 31.5%——令人瞩目。在一项调查中,我们的审阅者估计,一个典型的 GeneBench-Pro 问题需要人类专家大约 20-40 小时才能完成。按保守的每小时 200 美元计算,单个问题的人力成本就在数千美元。目前的 AI 智能体仍然太不可靠,无法取代人类专家,但成本差距巨大,推理成本每个问题仅需几美元。这意味着即使在当前能力下,部分自动化也能创造可观的经济和科学价值。
尽管如此,前沿模型仍然能解决不到三分之一的问题,这表明还有很大的改进空间。模型可以在具有挑战性的问题上取得部分进展,但在完成推理闭环方面存在困难。这种失败模式反映了人类专家和新手之间的对比。专家利用经验来构建问题框架并调整方法,而新手则进行观察,但难以将其整合到问题的更广泛背景中。
要实现近乎完美的性能,需要既能可靠衡量进展,又能识别模型失败之处的评估。像 GeneBench-Pro 这样的基准测试可以帮助将模糊的能力缺陷转化为我们可以诊断和改进的东西。
如果智能体能够可靠地自动化这类分析,它们将能显著加速科学发现。人类遗传学证据对于靶点优先排序和转化后续研究已经至关重要,因为具有遗传支持的机制更有可能导致获批的治疗方法。
与此同时,测序成本已大幅下降,生物银行规模的数据集现在以前所未有的广度将分子、表型和健康记录信息联系起来。限制因素正从数据生成转向将信息转化为可操作的见解。能够持续执行现在由人类专家团队处理的分析的模型,可以加速假设筛选、靶点后续研究以及数据生成与决策之间的迭代周期,从而改变工业研究。
GeneBench-Pro 是对评估经验丰富者所具备的良好科学判断中更抽象技能的初步尝试。这些技能使他们能够凭直觉发现最有前景的初始分析,在数据与初始假设矛盾时迭代修正思路,并得出可能影响下游临床、学术或商业决策的结论。
我们预计,随着模型能力的进步,那些在更高抽象层次上探究模型能力的基准测试将变得越来越有用,超越了单纯测试书本知识或执行常规分析能力的测试。
相似文章
@OpenAI: 我们正在推出GeneBench-Pro,这是一个研究级基准测试,用于衡量一种更难实现的AI进步:智能体在导航…
OpenAI推出了GeneBench-Pro,这是一个研究级基准测试,用于测试AI智能体在计算生物学中导航混乱的生物数据、选择分析路径以及做出判断的能力。
深入解读GeneBench-Pro
GeneBench-Pro 是 OpenAI 推出的一项全面基准测试,旨在评估人工智能模型在复杂基因组学任务上的表现,包括体细胞肿瘤学、功能基因组学以及临床携带者筛查。
介绍 LifeSciBench
OpenAI 推出 LifeSciBench,这是一个包含 750 个专家编写任务的基准测试,用于评估 AI 系统在现实生命科学研究工作流中的表现,包括证据处理、分析和科学推理。
介绍 HealthBench
OpenAI 推出了 HealthBench,这是一个用于评估医疗保健环境中人工智能系统的新基准。该基准由来自 60 个国家的 262 名医生共同创建,包含 5,000 个逼真的健康对话和医生编写的评分标准,用于评估模型在有意义、可信和可改进的指标上的性能。
@Lyubh22:编程基准测试正在趋于饱和。AI4Research 是下一个前沿领域。很高兴看到我们的 MLS-Bench(https://mls-bench.co…)
正式发布 MLS-Bench,这是首个获得社区广泛采用的 AI4Research 基准测试,它在 12 个领域的 140 个可执行任务上测试 AI 智能体,以提出模块化的机器学习改进方案。该帖子还包含 Claude Opus 4.6 和 GPT-5.4 等模型的排行榜分数。