衡量AI加速生物学研究的能力

OpenAI Blog 新闻

摘要

OpenAI展示了GPT-5通过与Red Queen Bio合作自主优化分子克隆方案的能力,通过新型酶机制实现了克隆效率79倍的提升。该工作展示了AI在湿实验室环境中支持实验迭代和实证验证的潜力,同时强调了生物安全考虑。

OpenAI引入了一个真实世界的评估框架,用于衡量AI如何在湿实验室中加速生物学研究。通过使用GPT-5优化分子克隆方案,该工作探讨了AI辅助实验的前景与风险。
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:52

# 衡量AI在湿实验室中加速生物研究的能力 来源:https://openai.com/index/accelerating-biological-research-in-the-wet-lab/ 加速科学进步是AI造福人类最有价值的途径之一。通过GPT-5,我们已开始看到早期迹象(https://openai.com/index/accelerating-science-gpt-5/)——不仅在帮助研究人员更快地梳理科学文献方面,还体现在支持新形式的科学推理上,例如发现意想不到的联系、提出证明策略或建议专家可以评估和测试的合理机制。 迄今为止,在数学、理论物理学和理论计算机科学等领域取得的进展最为显著,这些领域的想法可以在无需物理实验的情况下进行严格检验。生物学则不同:大多数进展依赖于实验执行、迭代和实验室中的经验验证。 为了了解前沿模型在这些场景中的表现,我们与生物安全初创公司Red Queen Bio合作,构建了一个评估框架,用于测试模型如何提出、分析和迭代湿实验室中的想法。我们设置了一个简单的分子生物学实验系统,并让GPT-5优化一个分子克隆方案以提高效率。 经过多轮实验,GPT-5引入了一种新机制,使克隆效率提高了79倍。克隆是分子生物学的基础工具。克隆方法的效率对于创建大型复杂文库至关重要,这些文库是蛋白质工程(在新窗口中打开)(https://www.nature.com/articles/s41592-025-02740-0)、遗传筛选(在新窗口中打开)(https://www.nature.com/articles/s41467-025-67256-9)和生物菌株工程(在新窗口中打开)(https://www.nature.com/articles/s41467-019-13189-z)的核心。该项目让我们得以一窥AI如何与生物学家并肩工作,加速研究。改进实验方法将帮助人类研究人员提高速度、降低成本,并将发现转化为现实世界的影响。 由于生物推理领域的进步会带来生物安全影响,我们在严格控制的条件下进行了这项工作——使用良性的实验系统,限制任务范围,并评估模型行为,以帮助我们进行生物安全风险评估,并开发模型和系统级别的防护措施,如我们的准备框架(在新窗口中打开)(https://cdn.openai.com/pdf/18a02b5d-6b67-4cec-ab64-68cdfbddebcd/preparedness-framework-v2.pdf)所述。 在这个设置中,GPT-5自主推理克隆方案,提出修改意见,并结合新实验的数据提出更多改进。唯一的人工干预是让科学家执行修改后的方案并上传实验数据。 经过多轮实验,GPT-5优化了克隆程序,使效率提高了79倍以上——这意味着对于固定量的输入DNA,我们回收的序列验证克隆数量是基线方案的79倍。最值得注意的是,它引入了两种酶,构成了一种新机制:来自*大肠杆菌*的重组酶RecA,以及噬菌体T4基因32单链DNA结合蛋白(gp32)。两者协同工作,gp32抚平并解开松散的DNA末端,然后RecA引导每条链找到其正确的匹配。 初步筛选和二次实验确定了RecA辅助配对完成HiFi组装(RAPF)和转化7(T7)分别是效果最佳的酶促和转化方案。相对于基础的HiFi反应克隆方案,RAPF组装和T7转化各自独立地将克隆效率提高了2.6倍和36倍;两者结合提供了79倍的累加性性能提升。所有克隆均通过测序确认。(误差线:n=3个独立验证实验的标准差)。 虽然还处于早期,但这些结果令人鼓舞。这些改进特定于我们在模型系统中使用的特定克隆设置,并且仍然需要人类科学家来设置和运行方案。即便如此,这些实验表明AI系统可以有意义地协助实际实验室工作,并可能在未来加速人类科学家的研究。 值得注意的是,AI-实验室循环是在固定提示且无人干预的情况下运行的。这种框架有助于揭示模型在没有人类指导的情况下提出真正新颖方案变化的能力,但也将系统锁定在探索阶段,限制了其最大化新发现想法性能的能力。在探索和利用之间取得更好的动态平衡可能会带来更大的收益,因为酶促和转化方面的改进都有很大的优化空间。我们期望规划和任务范围推理方面的进步将提高简单固定提示支持发现和后续优化的能力。 Gibson组装(在新窗口中打开)(https://www.nature.com/articles/nmeth.1318)反应自2009年发明以来一直是主要的克隆方法,在分子生物学领域被广泛采用。Gibson组装让分子生物学家能够通过短暂熔化DNA末端,使匹配序列可以密封成单个分子,从而将DNA片段“粘合”在一起。Gibson组装的一大吸引力在于其简单性:一切都在单管中、单一温度下进行。这些限制自然留下了改进空间。此外,以下特性使其非常适合评估AI模型改进湿实验室技术的能力: - 定义明确且组件可控,与基于细胞的系统不同 - 具有明确的优化函数:由固定量的线性DNA输入生成可转化的环化DNA - 实验周期相对较快(1-2天) - 高维设计空间,需要机制推理才能优化:最佳缓冲液、试剂和温度都是相互依赖的 我们使用HiFi组装(在新窗口中打开)(https://www.neb.com/en-us/applications/cloning-and-synthetic-biology/dna-assembly-and-cloning/nebuilder-hifi-dna-assembly?srsltid=AfmBOoo1sNIc0ELdZ6rZXK8ERV18f4x8nNd7WTyKXyCWClhMmGCPxRFM)作为优化起点,这是New England Biolabs开发的基于Gibson组装的专有酶系统。我们探索了当单步和等温限制被移除后,AI是否能够创新并从实验反馈中学习,从而在这种情况下识别出方案改进。 具体来说,我们使用绿色荧光蛋白(GFP)基因和广泛使用的pUC19质粒(一种标准的DNA“载体”,用于将基因携带进入细菌以便复制)进行了两片段克隆反应。目标是增加成功菌落的数量。 我们通过引入一个迭代提案的进化框架来优化克隆反应,使模型能够从其过去的实验中“在线”学习。在每一轮中,GPT-5提出一批8-10个不同的反应,如果反应需要实验室尚未备有的定制试剂,则推迟到后续轮次。然后,人类科学家执行这些反应,并在初步筛选中测量相对于基线HiFi Gibson组装的菌落数量。上一轮中表现最佳的数据随后被输入下一轮。重要的是,提示是标准化的,除了澄清性问题外没有人工输入,这使我们能够将新颖的机制见解直接归因于AI,而非人类指导。 我们使用更广泛的DNA稀释度重新测试了整个优化系列中表现最佳的八个反应,发现许多反应的效应比初始筛选中小;最终,最强验证候选是来自第5轮的一个反应,它重现了其原始性能。许多高性能者属于连接酶-抛光家族,该家族似乎对感受态细胞状态和/或反应后DNA处理中的微小变化特别敏感。由于这些反应使用了较短的HiFi步骤,我们假设许多产物可能仅以一个连接处密封、另一个通过退火保持的方式进入*大肠杆菌*,将下游拯救留给细胞修复途径。这造成了高方差和“头奖”动态:即使大多数时候这种反应的变体没有表现出色,单个强异常值也可能将该家族带入后续轮次。 虽然我们由于机制复杂性而专注于多轮优化克隆反应,但我们同时使用单“一轮”回合优化了转化程序,在该回合中模型提出了许多独立变化,我们采用了表现最佳的反应。 两步克隆工作流程的初始优化筛选:酶促组装和转化。(左)在五轮(共44个反应)中迭代优化酶促组装。从HiFi组装基线开始,GPT-5每轮提出8-10个组装方案变体;表现最佳的结果数据被纳入后续提示中。在每一轮,我们绘制到目前为止(包括前几轮)表现最佳的反应。(右)测试13种不同方案的单轮优化转化条件。对于两个优化筛选,数据代表每个条件的单次测量(n=1);对最佳候选者单独进行了重复验证。 使用无人工输入的标准化提示,GPT-5将端到端克隆效率提高了79倍,并在实验重复中得到确认。 值得注意的是,模型提出了一种新的酶促程序,该程序被模型称为RecA辅助配对完成HiFi组装(RAPF-HiFi),向反应中添加了两种新蛋白质:来自*大肠杆菌*的重组酶RecA,以及噬菌体T4基因32单链DNA结合蛋白(gp32)。此外,模型对孵育温度和时间以及酶添加时间进行了深思熟虑的修改:它提议在初始50°C HiFi反应后添加RecA和gp32,让这些蛋白质在37°C下工作,然后回到50°C完成组装。这些新修改共同将效率提高了2.5倍以上。需要注意的是,这代表了在没有对反应条件和时间进行迭代优化的情况下的初始性能。 在转化方面,最有效的修改出乎意料地简单:在4°C下沉淀细胞(在离心机中旋转使其聚集在管底),移除一半的供应体积,重新悬浮细胞,然后添加DNA。虽然高效化学感受态细胞通常被认为很脆弱,但细胞能很好地耐受浓缩,增加的分子碰撞显著提高了转化效率(最终验证时>30倍)。 T5核酸外切酶产生3'突出端,gp32通过抑制二级结构来稳定这些突出端。然后RecA从3'端入侵,置换gp32并促进同源性搜索和退火。加热至50°C会去除这两种蛋白质,使聚合酶填补缺口和连接酶发挥作用。 Gibson组装的工作原理是给DNA片段匹配的“粘性”末端,使它们能够相互找到并连接。该反应使用两种不同的酶(聚合酶和连接酶)来密封连接的片段。在RAPF-HiFi中,引入了两种蛋白质以使匹配步骤更好地工作。第一种,gp32,像梳子一样抚平并解开松散的DNA末端。第二种,RecA,像向导一样搜索每条链的正确伙伴,并将匹配的片段拉到一起。较高的温度会导致两种辅助蛋白从DNA上脱落,使正常的Gibson酶完成反应。 总之,我们假设性能改进是通过以下机制介导的: - Gp32覆盖未退火的单链DNA(ssDNA)尾部,去除二级结构 - 通常受结构抑制的RecA从3'端入侵并置换gp32丝状体 - RecA介导ssDNA:ssDNA同源性搜索(在新窗口中打开)(https://www.pnas.org/doi/10.1073/pnas.82.2.297),驱动退火 - 回到50°C会置换recA和gp32丝状体,使聚合酶和连接酶完成反应。 为了测试新酶是否具有功能,并排除性能改进完全由热步骤或缓冲液变化驱动的可能性,我们测试了不含RecA以及不含RecA和gp32的RAPF-HiFi的性能。两种反应的性能相对于RAPF-HiFi均有所降低,表明两种蛋白质对于RAPF-HiFi的作用机制都是必需的。 为了测试潜在机制,我们将反应中的两种新酶分离出来:RecA和gp32。我们发现,任何一种单独使用都会降低相对于HiFi基线的效率。两者结合时,性能优于基线,效率提升2.6倍。(误差线:n=3个独立实验的标准差) RAPF-HiFi的开发表明GPT-5能够进行复杂的多维推理: - RecA受到DNA结构的抑制(在新窗口中打开)(https://www.pnas.org/doi/10.1073/pnas.151242898),值得注意的是,模型同时引入了两个协同修改:添加RecA,并辅以gp32以去除DNA二级结构。 - *大肠杆菌*RecA的天然搭档是*大肠杆菌*单链结合蛋白(SSB)。SSB在基因组复制、重组和修复过程中扮演与gp32类似的角色。然而,*大肠杆菌*SSB不会自发地从DNA上快速脱落以允许RecA丝状体生长,RecFOR复合体在体内促进RecA在SSB丝状体上的成核(在新窗口中打开)(https://www.sciencedirect.com/science/article/pii/S1097276503001886)。SSB以稳定的四聚体形式结合,解离速率极慢(在新窗口中打开)(https://pubs.acs.org/doi/10.1021/bi020122z)。相比之下,gp32丝状体更具动态性(在新窗口中打开)(https://www.sciencedirect.com/science/article/pii/S0022283624001396),允许RecA置换。 据我们所知,RecA和gp32尚未在分子生物学方法中被功能性联合使用。与许多新颖的分子生物学技术一样,其潜在的生化活性已被研究,但将它们用作实用、可推广的方法才构成进步。 例如,RecA和gp32的相互作用已在体外重建实验中得到研究:在D环形成的研究中,gp32被证明能够增强RecA活性(在新窗口中打开)(https://www.pnas.org/doi/10.1073/pnas.77.5.2606?url_ver=Z39.88-2003&rfr_id=ori%3Arid%3Acrossref.org&rfr_dat=cr_pub++0pubmed)。Gp32已与其天然的T4重组酶伴侣UvsX和重组酶加载因子uvsY结合使用,用于重组酶聚合酶扩增(RPA)(在新窗口中打开)(https://journals.plos.org/plosbiology/article?id=10.1371/journal.pbio.0040204)。尽管一项RPA专利说明书指出(在新窗口中打开)(https://patents.google.com/patent/US20090029421A1/en),已证明使用*大肠杆菌*RecA在含有功能受损(即经工程改造的非野生型)gp32蛋白的异源系统中可实现有效的RPA反应,但这一断言仅出现在一些专利公开中作为旁注,据我们所知,尚未得到已发表数据的支持,也未作为稳健的基于RecA的RPA系统被采用。一种名为SLiCE(在新窗口中打开)(https://academic.oup.com/nar/article/40/8/e55/2411705)的克隆方法使用含有λ Red重组系统的*大肠杆菌*全细胞提取物,其中Red beta可能发挥

相似文章

加速生命科学研究

OpenAI Blog

OpenAI 与 Retro Biosciences 合作开发了 GPT-4b micro,这是 GPT-4o 的专门版本,用于蛋白质工程,实现了干细胞重编程标志物表达提高 50 倍,并增强了 DNA 损伤修复能力。这些发现已在多个供体和细胞类型中得到验证,证明了人工智能加速生命科学研究的潜力。

评估AI执行科研任务的能力

OpenAI Blog

OpenAI推出FrontierScience,这是一个新的基准测试,用于衡量人工智能在物理、化学和生物学领域的专家级科学能力。GPT-5.2在奥林匹克式任务中达到77%,在研究型任务中达到25%。该论文提供了早期证据,表明GPT-5能显著加速真实的科学工作流程,将工作周期从数周缩短至数小时,同时建立了度量标准,以追踪朝着AI加速科学研究的进展。

用GPT-5加速科学研究的早期实验

OpenAI Blog

OpenAI发布了一篇研究论文,记录了GPT-5在数学、物理、生物学等多个领域加速科学发现的早期实验成果,包括该模型帮助识别疾病机制、解决开放性问题以及与领先大学和国家实验室合作改进优化算法的案例。

GPT-5在医学研究中的应用

OpenAI Blog

OpenAI宣布将GPT-5应用于医学研究,突出展示该模型在医疗健康和科学发现领域的能力。