团队利用AlphaFold AI重新设计基因编辑蛋白以提高安全性
摘要
研究人员利用AlphaFold AI识别并重新设计基因编辑蛋白(Cas9)中导致脱靶效应的部分,通过减少意外编辑显著提高了安全性。
暂无内容
查看缓存全文
缓存时间: 2026/07/24 19:12
# 团队利用AlphaFold AI重新设计基因编辑蛋白以提升安全性
来源:https://arstechnica.com/science/2026/07/team-uses-alphafold-ai-to-redesign-gene-editing-proteins-to-make-them-safer/
谷歌的AlphaFold能帮助识别基因编辑蛋白中导致错误的部位。
在发现能够选择性靶向DNA的系统几十年后,我们开始看到首批基于基因编辑的疗法问世。这些发展面临的一大挑战是安全性。虽然我们可以让它们对想要编辑的基因具有相当高的特异性,但人类基因组非常庞大,即便罕见的DNA序列也可能偶然出现几次。
因此,所有最初的基因编辑系统都有已知的所谓"脱靶效应"发生率,即它们简单地编辑了错误的序列。这可能是低概率事件,但编辑足够多的细胞(而疗法通常需要编辑大量细胞),错误就成为不可避免之事。
大量努力都投入到了寻找最小化或消除脱靶编辑的方法中。在最近一期的《自然》杂志上,研究人员描述了他们如何修改AI蛋白质折叠软件AlphaFold,以帮助识别基因编辑蛋白中导致脱靶效应的关键区域。随后对这些区域进行了修改以减少问题。
## 基因编辑与脱靶效应
基因编辑系统有三个关键组成部分。第一个是引导RNA,它可以与目标基因组序列进行碱基配对。可以设计许多靶向同一基因的引导RNA,因此提高系统安全性的一种方法是选择与其他基因组位置共享很少相似性的序列。这现在已广泛用于基因编辑系统的基本设计过程。
第二个组成部分是以CRISPR系统的Cas9蛋白命名的Cas蛋白。它与引导RNA和基因组RNA都有相互作用,并有助于强化相互作用的特异性。
如果RNA和DNA之间的碱基配对有太多错配,Cas9(或其他Cas家族成员)就不会附着在那里。各种方法已经培育出改进的Cas家族成员,它们降低了导致脱靶编辑的倾向。
系统的最后一个关键组成部分是与结合DNA的Cas9相互作用并修改DNA的蛋白质。在最初的CRISPR系统中,这会切断双螺旋的两条链,产生难以控制的损伤。此后研究人员修改了其他蛋白质,使其与Cas9相互作用,但催化对DNA更微妙的改变,例如切掉单个碱基或进行化学修饰以改变其碱基配对方式。
总体而言,引导RNA与基因组之间的碱基配对长度大约为18个碱基。这在随机DNA序列中大约每700亿个碱基才出现一次,而我们的基因组只有约30亿个碱基。以此衡量,我们应该是安全的。但事实证明,Cas9可以容忍少量错配碱基而不失去其附着DNA的能力。变异被容忍的碱基的确切数量和位置可能有所不同,这使得很难提前识别哪些引导RNA可能构成危险。
提高安全性的一条途径是更好地理解这些脱靶相互作用是如何发生的。
## 建立接触
这项新工作的团队由来自中国多家机构的研究人员组成,他们提前推理出了方法。完美匹配的DNA-RNA杂交体具有一种结构,而含有一个或多个错配碱基的杂交体则具有略微不同的结构。进化已经优化了Cas9的结构以附着于前者。但显然这并没有阻止Cas9采用不同的构象来与错配结构相互作用。
如果我们能够识别Cas9中介导这些有问题相互作用的部位,我们就可以修改并可能阻断它们。
该团队的第一步是建立一个大型的脱靶编辑位点库。他们通过使用改良的CRISPR系统将DNA碱基腺嘌呤转换为相关化学物质肌苷,然后分离任何含有它的DNA片段来实现这一点。他们用10种不同的引导RNA重复了这一过程,并从每种引导RNA中分析了大量修饰后的DNA片段,以获得存在的脱靶序列类型的广泛图景。
下一步是研究CRISPR复合物如何与它们相互作用,使用的是基于AlphaFold AI的蛋白质折叠软件。更新版本被设计用于处理蛋白质与核酸(https://arstechnica.com/science/2024/05/deepmind-adds-a-diffusion-engine-to-latest-protein-folding-software/)以及多种蛋白质复合物之间的相互作用。因此,团队向AlphaFold输入了目标DNA序列、引导RNA、Cas9序列以及一种能够化学修饰碱基并附着于Cas9的酶的版本。
不幸的是,它卡住了,将其中一个蛋白质放置在了明显错误的位置。
团队没有气馁,简化了事情,只向AlphaFold输入DNA、RNA和Cas9蛋白,因为后者是决定其序列特异性的主要因素。这次效果好多了,产生了一个与实际核酸和蛋白质实验确定的结构一致的结构。
通过比较AlphaFold在输入不同靶向和脱靶位点时生成的结构,研究人员发现了一个普遍模式。许多(约三分之二)脱靶位点导致Cas9蛋白采用了略微不同的结构。但几乎所有(超过95%)脱靶位点都改变了与RNA接触的氨基酸。因此,显然有些情况下Cas9保持了其正常结构,但其内部的氨基酸会灵活移位,以适应脱靶位点的错配碱基。
方便的是,AlphaFold已经能够识别所谓的"接触概率",即任何两个项目(如氨基酸或核苷酸)处于非常小距离(8埃)内的概率。研究人员可以获取靶向和脱靶位点的接触概率分析输出并进行比较,精确识别出当引导RNA与DNA之间存在错配时Cas9中哪些氨基酸的接触发生了改变。他们将这种计算机分析设置命名为"ContactSeek"。
## 更好的靶向
就其本身而言,ContactSeek会产生一大串在结合脱靶位点时移位的氨基酸列表。因此,研究人员聚焦于Cas9蛋白中这些氨基酸聚集的区域,将此视为这些区域正在适应错配碱基引起的差异的标志。然后他们开始测试在这些位点具有不同氨基酸的Cas9变体。
总共,研究人员进行了23次不同的交换,将不同的氨基酸放入通过AlphaFold工作识别出的10个关键位置之一。这使得他们能够找到一个变体,其在匹配目标序列的位点上的活性与正常Cas9相似,而其脱靶活性从28%下降到5%。当研究人员使用不同的引导RNA时,也得到了类似的结果。他们还表明,该方法对使用不同Cas蛋白(Cas12)识别DNA/引导RNA组合的类似系统也有效。
如前所述,其他研究团队使用了不同的方法,如定向进化,来开发不易发生脱靶编辑的Cas9变体。当与这些变体进行测试时,新设计的版本往往产生相似甚至略微更好的活性和特异性。这里的一大区别是,这种方法识别出的变化可能对特定的引导RNA/错配组合更为特异,而不是更普遍有效。
当然,这里识别出的一些个体变化有可能与先前开发的Cas9版本中的变化相结合,以获得更大的改进,尽管这里没有进行测试。
无论如何,这项工作很有用,因为它描述了一种通用方法,用于生产针对已知脱靶事件定制的基因编辑系统。如果这最终成为开发疗法中的瓶颈,这项工作可能会成为重大突破。但研究人员也表明,这种方法对于微调蛋白质-DNA相互作用更普遍适用,其应用可能远远超出基因编辑领域。
《自然》,2026年。DOI:10.1038/s41586-026-10794-z (http://dx.doi.org/10.1038/s41586-026-10794-z)(关于DOI (http://arstechnica.com/science/news/2010/03/dois-and-their-discontents-1/))。
John Timmer 的照片 (https://arstechnica.com/author/john-timmer/)
John是Ars Technica的科学编辑。他拥有哥伦比亚大学生物化学学士学位和加州大学伯克利分校分子与细胞生物学博士学位。当离开键盘时,他往往会去找一辆自行车,或者一个风景优美的地方,与他的徒步靴相伴。
9条评论 (https://arstechnica.com/science/2026/07/team-uses-alphafold-ai-to-redesign-gene-editing-proteins-to-make-them-safer/#comments)
1. 热门阅读中第一篇文章的配图:微软回应LG显示器在Windows上安装McAfee广告 (https://arstechnica.com/gadgets/2026/07/microsoft-responds-to-lg-monitors-installing-mcafee-ads-on-windows/)
相似文章
@Nature: Nature研究论文:AI重新设计的起点和结果增强了蛋白质进化
该Nature研究论文介绍了一种AI方法,该方法重新设计起点和结果以增强蛋白质进化。
AlphaGenome:用于更好地理解基因组的人工智能
DeepMind 推出 AlphaGenome,这是一个能够预测 DNA 序列变异如何影响基因调控和生物过程的 AI 模型,可应用于多种细胞类型和组织。该模型可处理多达 100 万个碱基对,通过 API 向非商业研究提供,完整论文已在《自然》杂志上发表。
加速生命科学研究
OpenAI 与 Retro Biosciences 合作开发了 GPT-4b micro,这是 GPT-4o 的专门版本,用于蛋白质工程,实现了干细胞重编程标志物表达提高 50 倍,并增强了 DNA 损伤修复能力。这些发现已在多个供体和细胞类型中得到验证,证明了人工智能加速生命科学研究的潜力。
科学家以惊人精度编辑人类胚胎基因
科学家在人类胚胎基因编辑方面取得了惊人精度,标志着基因工程的重大进展。
为生物学领域的未来AI风险做准备
OpenAI发布了一套管理高级AI模型在生物领域的两用风险的综合方案,通过专家协作、模型训练、检测系统和安全控制等策略,既能推动有益的科学发现,又能防止其被滥用于生物武器开发。