加速生命科学研究
摘要
OpenAI 与 Retro Biosciences 合作开发了 GPT-4b micro,这是 GPT-4o 的专门版本,用于蛋白质工程,实现了干细胞重编程标志物表达提高 50 倍,并增强了 DNA 损伤修复能力。这些发现已在多个供体和细胞类型中得到验证,证明了人工智能加速生命科学研究的潜力。
了解专门的人工智能模型 GPT-4b micro 如何帮助 OpenAI 和 Retro Bio 为干细胞疗法和长寿研究工程设计更有效的蛋白质。
查看缓存全文
缓存时间: 2026/04/20 14:53
# 加速生命科学研究
来源:https://openai.com/index/accelerating-life-sciences-research-with-retro-biosciences/
在 OpenAI,我们相信 AI 能够显著加速生命科学创新。为了验证这一信念,我们与 Retro Bio(一家长寿生物技术初创公司)的应用 AI 团队合作,创建并研究了 GPT-4b micro 的影响——这是一个专门为蛋白质工程优化的 GPT-4o 微型版本。
在体外,这些重新设计的蛋白质实现了**比野生型对照高 50 倍以上的干细胞重编程标志物表达**。它们还表现出增强的 DNA 损伤修复能力,相比基线显示出更高的返老还童潜力。这一发现于 2025 年初取得,现已通过多个供体、细胞类型和传递方法的复制得到验证,并确认了导出的 iPSC 细胞系具有完整多能性和基因组稳定性。为了确保这些发现可被发现和复制,以造福生命科学产业,我们现在分享有关 GPT-4b micro 研发的见解。
显微镜图像显示了致密的细长纺锤形细胞层,主要呈平行方向对齐。图像为灰度,可见细致的细胞边界和纹理。右下角的标尺表示 400 微米。
第 10 天用 SOX2、KLF4、OCT4 和 MYC 重编程的细胞的显微镜图像,显示细长的成纤维细胞样形态和聚集的细胞区域;标尺表示 400 μm。
用 **SOX2**、**KLF4**、OCT4、MYC 重编程的细胞(第 10 天)
第 10 天用 RetroSOX、RetroKLF、OCT4 和 MYC 重编程的细胞的显微镜图像,显示由紧密排列的细胞组成的密集菌落,具有明确的边界,周围环绕着细长的成纤维细胞样细胞;标尺表示 400 μm。
用 **RetroSOX**、**RetroKLF**、OCT4、MYC 重编程的细胞(第 10 天)
*图 1:左侧是初始条件;中间是标准蛋白质;右侧是使用我们的新型蛋白质。圆形白色细胞数量的增加表明重编程增加。更具体地说:人成纤维细胞诱导前的相位对比图像(左)以及用野生型山中因子(中)和我们重新设计的变体(右)转导后 10 天的图像。工程化的混合物促进了具有紧凑圆形形态的菌落的出现,这种形态通常在向类 iPSC 状态进行的过程中看到。*
为了测试我们关于 AI 能够加速生命科学研究的信念,我们设计并训练了一个定制模型——GPT-4b micro——使其拥有跨越生物学的广泛知识和技能基础,特别关注可操纵性和灵活性,以实现蛋白质工程等高级用例。我们从 GPT-4o 的缩小版本初始化它,以利用 GPT 模型现有的知识,然后在一个主要由蛋白质序列、生物文本和标记化 3D 结构数据组成的数据集上进一步训练它——这些是大多数蛋白质语言模型所忽略的元素。
数据的大部分都经过了丰富处理,包含关于蛋白质的额外上下文信息,形式为文本描述、共进化同源序列和已知相互作用的蛋白质组。这种背景使得 GPT-4b micro 能够被提示生成具有特定所需属性的序列,由于大多数数据不含结构信息,该模型处理具有本质无序区域的蛋白质效果与结构化蛋白质一样好。这对于山中因子等目标特别有用,其活性取决于与多种结合伙伴形成众多瞬间相互作用,而不是采用单一稳定结构(图 2)。
*图 2:山中因子 KLF4(左)和 SOX2(右)的 3D 结构可视化。注意这些蛋白质的大部分是无结构的,具有附着到其他蛋白质的灵活臂。来源:AlphaFold 蛋白质结构数据库(**左**、**右**)*
通过在用额外进化和功能背景信息丰富的蛋白质上进行训练,我们大幅增加了我们训练样例的有效上下文长度,超过了独立序列的长度。因此,我们发现在推理过程中可以运行多达 64,000 令牌的提示,并继续观察可控性和输出质量的提升。虽然在文本 LLM 中很常见,但这种上下文大小在蛋白质序列模型中是前所未有的。
在开发过程中,我们观察到了类似于语言模型中看到的缩放规律的出现——在更大数据集上训练的更大模型在困惑度和下游蛋白质基准方面产生了可预测的收益,允许我们在小规模上迭代,然后再训练最终的 GPT-4b micro 模型。然而,蛋白质 AI 模型的计算机模拟评估往往价值有限,因为不清楚这样的改进是否能转化为现实世界中的实用性增加。为了证明该模型能够加速治疗开发,我们与 Retro 的科学家合作,他们使用该模型重新设计了与其细胞重编程研究计划相关的蛋白质。
山中因子——OCT4、SOX2、KLF4 和 MYC(OSKM)——是当今再生生物学中最重要的一些蛋白质,以发现其将成人细胞重编程为多能干细胞能力的山中伸弥命名,这一突破为他赢得了 2012 年诺贝尔生理学或医学奖。不幸的是,它们效率很低:通常治疗过程中不足 0.1% 的细胞发生转换,整个过程可能需要三周或更长时间。来自老龄或患病供体的细胞效率进一步下降,因此寻找更高效的变体仍是一个积极且重要的研究焦点。
直接优化蛋白质序列是困难的。SOX2 含有 317 个氨基酸,KLF4 含有 513 个;可能的变体数量的量级为 10^1000,所以传统的"定向进化"筛选——每次改变少数几个残基——只能探索设计空间的极小部分。一项领先的学术努力测试了几千个 SOX2 突变体,发现了少数几个三突变体有适度的收益,而 15 年的嵌合 SOX 蛋白工作仅产生了与天然 SOX 成分相差只有 5 个残基的变体。
Retro 团队建立了一个使用人成纤维细胞(皮肤和结缔组织)细胞的湿实验室筛选平台,最初用基线 OSKM 和由 Retro 科学家手动设计的 SOX2 变体来验证它,作为其试点筛选的一部分(图 3)。然后,他们要求 GPT-4b micro 提出一组多样化的"RetroSOX"序列。模型建议中超过 30% 在筛选中的表现优于野生型 SOX2 在表达关键多能性标志物方面,尽管它们平均相差 100 多个氨基酸。相比之下,在传统筛选中,低于 10% 的命中率是典型的。
*图 3:在我们的湿实验室实验中,用标准 OSKM 或工程变体池重编程时表达早期(SSEA4)多能性标志物的细胞百分比(左),以及表达晚期(TRA-1-60)标志物的细胞分数(右)。试点筛选(绿色)使用标准方法,效能率较低,约为 0.1%,解释了 TRA-1-60 表达率为 0%。*
*图 4:筛选命中率,即引发重编程相关标志物以高于基线的速率的蛋白质候选物分数(左),相对于人类中发现的野生型变体改变的蛋白质序列百分比(右)。"常规"方法指少氨基酸突变筛选。*
结合顶级 RetroSOX 和 RetroKLF 变体产生了最大的收益。在三次独立实验中,成纤维细胞显示了早期(SSEA-4)和晚期(TRA-1-60、NANOG)标志物的戏剧性上升,晚期标志物出现时间比野生型 OSKM 鸡尾酒早几天(图 5)。
*图 5:两个晚期标志物(TRA-1-60 和 NANOG)在第 10 天强烈富集,而在此时间点,用野生型 OSKM 重编程的细胞中无法检测到任何表达。RK1 至 RK4 对应于不同的 RetroSOX 和 RetroKLF 变体。*
此外,RetroSOX 和 RetroKLF 变体通过第 10 天的碱性磷酸酶(AP)染色得到了验证,确认菌落不仅表达晚期多能性标志物,而且表现出强健的 AP 活性,指示多能性(图 6)。
*图 6:紫色菌落表示成功的干细胞重编程;更强烈和更多的菌落表示更高的效率。在用 RetroSOX 和 RetroKLF 变体转导后第 10 天的成纤维细胞衍生菌落的碱性磷酸酶(AP)染色展示了强健的 AP 活性,表明工程变体已在菌落中诱导了多能性。*
为了进一步确认改进的重编程效率并探索临床潜力,我们测试了不同的传递方法(mRNA 而不是病毒向量)和另一种细胞类型——来自三位中年人类供体(50 岁以上)的间充质干细胞(MSCs)。在短短 7 天内,超过 30% 的细胞开始表达关键多能性标志物(SSEA4 和 TRA-1-60),到第 12 天,许多菌落出现了形态类似于典型 iPSC 的形态(图 7,左和中)。超过 85% 的这些细胞激活了关键干细胞标志物的内源表达,包括 OCT4、NANOG、SOX2 和 TRA-1-60。
然后我们验证了这些 RetroFactor 衍生的 iPSC 能够成功分化为三个主要胚层(内胚层、外胚层和中胚层)。此外,我们在多个次代扩增了多个单克隆 iPSC 细胞系,确认了健康的核型(图 7,右)以及适合细胞疗法的基因组稳定性。这些结果始终超过了由合同研究机构使用标准因子生成的传统 iPSC 细胞系的基准,进一步支持了我们工程变体的稳健性。此外,它们提供了证据,表明在不同传递方式和细胞类型中增强的 iPSC 生成。
显微镜图像显示干细胞菌落具有成功重编程干细胞典型的圆形、紧密排列的形态;标尺表示 400 μm。
荧光显微镜图像显示用绿色 TRA-1-60 标志物染色的干细胞菌落,表明成功的重编程和多能干细胞表面蛋白的存在。
核型图像显示完整的人类染色体组(22 对加 X 和 Y),确认重编程干细胞中正常的染色体数量和结构。
*图 7:三个图板显示成功干细胞重编程的关键标志物:具有干细胞特征的圆形、紧密排列外观的菌落(左)、TRA-1-60 干细胞标志物的阳性染色显示为绿色(中),以及正常的染色体结构(右)——共同确认了健康、完全重编程的干细胞。*
总的来说,高命中率、深度序列编辑、加速的标志物出现和 AP+ 菌落形成提供了早期证据,表明 AI 引导的蛋白质设计能够大幅加速干细胞重编程研究的进展。
受这些结果的激励,我们接下来调查了我们重新设计的变体的返老还童潜力,特别是检查它们恢复老化细胞年轻特征的能力。我们关注 DNA 损伤,它导致细胞功能受损,是衰老的典型特征。早期工作已证明山中因子能够在源自小鼠的细胞中消除与 DNA 损伤相关的衰老标志物,而不完全恢复细胞身份。我们想要找出我们的变体相对于基线 OSKM 是否显示了增强的返老还童能力。
*图 8:多柔比星应激后的 DNA 损伤测定,越低越好。人成纤维细胞用多柔比星处理以诱导双链断裂,然后用 GFP(阴性对照)、野生型 OSKM 或工程化的 RetroSOX + RetroKLF 变体以及剩余的重编程因子(O、K/S、M)重编程。γ-H2AX 免疫染色被用于量化 DNA 损伤:较低的荧光强度意味着断裂较少和修复更好。表达 Retro 变体的细胞相对于两种对照显示 γ-H2AX 信号明显下降(GFP vs RS4:p=0.03;GFP vs RS5:p=0.01;OSKM vs RS4:p=0.04),表明在相同地诱变挑战后修复更有效。*
在我们的 DNA 损伤测定中,用 RetroSOX/KLF 鸡尾酒处理的细胞显示出的 γ-H2AX 强度——双链断裂的标志物——明显低于用标准 OSKM 或荧光对照重编程的细胞(图 8)。
这些结果表明 RetroSOX/KLF 鸡尾酒比原始山中因子更有效地减少 DNA 损伤。通过改善细胞衰老的核心特征之一,这些工程变体提供了通向改进的细胞返老还童和未来治疗应用的潜在途径。
对于 OpenAI 来说,这项工作说明了特定领域模型如何能够在专注的科学问题上快速取得突破性成果。OpenAI 研究伙伴关系负责人 Boris Power 说:"当研究人员将深厚的领域洞察带到我们的语言模型工具中时,曾经需要多年的问题可能在数天内就会发生转变。我们期待看到当更多团队将他们的专业知识与我们正在构建的模型相结合时会出现哪些其他进展。"
相似文章
衡量AI加速生物学研究的能力
OpenAI展示了GPT-5通过与Red Queen Bio合作自主优化分子克隆方案的能力,通过新型酶机制实现了克隆效率79倍的提升。该工作展示了AI在湿实验室环境中支持实验迭代和实证验证的潜力,同时强调了生物安全考虑。
推出用于生命科学研究的 GPT-Rosalind
OpenAI 推出 GPT-Rosalind,这是一种前沿推理模型,旨在通过优化科学工作流程和工具使用,加速生物学、药物发现和转化医学领域的研究。
GPT-5在医学研究中的应用
OpenAI宣布将GPT-5应用于医学研究,突出展示该模型在医疗健康和科学发现领域的能力。
设计更快速的生命科学实验
OpenAI 的 GPT-Rosalind 加上生命科学插件,可在几秒内将高优先级靶点转化为可直接运行的 96 孔湿实验方案,每一步试剂选择都基于公开数据,并将实验结果反馈回来,把设计周期缩短至数小时。
用GPT-5加速科学研究的早期实验
OpenAI发布了一篇研究论文,记录了GPT-5在数学、物理、生物学等多个领域加速科学发现的早期实验成果,包括该模型帮助识别疾病机制、解决开放性问题以及与领先大学和国家实验室合作改进优化算法的案例。