自然界蛋白质折叠的不合理冗余

Hacker News Top 论文

摘要

来自Ligo的一篇博客文章,讨论了天然蛋白质折叠的冗余性,以及为生成式生物分子模型扩展结构数据所面临的挑战,文中提及了AlphaFold3和其他最新模型。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/06/03 06:37

# 自然蛋白质折叠中不合理的冗余性 来源:https://research.ligo.bio/posts/unreasonable-redundancy-of-natural-protein-folds/ Arda Goreci · 2026年5月20日 过去几年,深度神经网络使生成式语言建模变得极其强大,催生了大型语言模型。类似的技术飞跃也出现在连续模态(如图像和视频)上。最近,这些技术被成功应用于生物分子的生成式建模。DeepMind 的 AlphaFold3 等模型大幅降低了预测生物分子相互作用的难度,包括药物-蛋白质和抗体-蛋白质复合物,不久后,人们便学会了如何将这些能力重新用于设计类药分子。 Chai-2 (https://www.chaidiscovery.com/news/chai-2-mab)、Latent-X2 (https://www.latentlabs.com/latent-x2/) 和 Nabla (https://www.nabla.bio/platform) 都报告了可开发的抗体或生物制剂设计。 在不久的将来,我们可能会看到大多数进入临床的抗体在很大程度上由基于深度学习的生成模型设计,这些抗体可能具有更优的药理特性,并能靶向那些湿实验方法难以攻克的受体。 你会如何改进这些系统?我们当然希望拥有更好的生物分子建模能力,从而将更优质的药物推向临床。改进深度学习系统的高层配方出奇简单:扩展模型、扩展算力、扩展数据。LLM 通过激进扩展而进步,这显而易见。AlphaFold3 也是一项大规模扩展模型和数据的重大工程;它基于大量已知生物分子复合物进行训练,从实验结构、蛋白质-配体复合物,到基因组学和宏基因组学(如 MGnify)产生的海量序列数据库。DeepMind 内部曾一度将这个项目称为“all-PDB”,指的是蛋白质数据库中包含的所有相互作用。AlphaFold3 扩展策略的关键一步是将序列规模转化为结构规模:利用结构预测将大型蛋白质序列数据库转化为预测的 3D 结构。 基因组学和宏基因组学已为我们提供了数十亿条蛋白质序列,其中许多是从从未在实验室培养过的生物体环境 DNA 中推断而来。然而,对于训练基于结构的设计模型而言,有用的对象往往是 3D 结构。结构预测模型使我们能够将部分序列规模转化为结构数据:提取数百万条天然序列,预测它们采用的折叠方式,并将这些预测结构用作下一代生物分子模型的训练样本。 在 Ligo,我们关心这个配方,因为我们训练用于设计酶的生成模型。当我们试图通过折叠更多天然序列来扩展结构训练数据时,遇到了一个问题:天然蛋白质序列的规模极其庞大,但它们的折叠方式比序列数量所显示的冗余得多。这篇文章正是关于这种不匹配,以及为什么简单折叠更多天然序列可能无法带来我们期望的新结构多样性。我们将描述用于对已知蛋白质宇宙进行聚类的数据工程技巧,以及我们的结果对如何看待酶设计问题所蕴含的意义。 ## 现代生物分子模型依赖序列规模 现代结构预测模型严重依赖多序列比对。多序列比对(MSA)将来自不同生物体的相关蛋白质版本对齐起来。当比对中两个位置倾向于共同变化时(共进化意味着两个位置在相关蛋白质中协同变化。例如,如果一个位置通常带负电且接触带正电的位置,进化可能会同时翻转两者,同时避免产生相互排斥的组合),这可能暗示相应残基在 3D 空间中接近,或通过功能联系在一起。我对 AlphaFold2 的心智模型是,它利用这种共进化信号来约束蛋白质的大致几何形状,然后学习如何填补结构的其余部分。 AlphaFold3 似乎在做更广泛的事情。它在抗体-抗原上的表现特别有趣,因为没有 MSA 可以提供线索。抗体及其靶标没有共同的进化历史。要在这一领域表现出色,模型必须学习关于蛋白质表面本身的一些东西:哪些形状、化学性质和局部几何形状可能彼此兼容。这是一种不同于单一家族内残基共进化的信号。 这可能是 MGnify 规模数据重要的地方。宏基因组序列资源让模型接触到数量巨大的天然变异体,其中许多来自我们从未培养过的生物体。经验线索是,使用 MGnify 规模的蛋白质蒸馏训练的模型在抗体-抗原预测上区分效果最明显,而直接共进化无法解释这种相互作用信号(补充信息 (https://research.ligo.bio/posts/unreasonable-redundancy-of-natural-protein-folds/#supplementary-interface-benchmarks))。这种序列空间覆盖度的增加看起来很有价值。问题在于,它是否也伴随着蛋白质折叠方面的可比多样性。 ## 序列多样性并非折叠多样性 理论上的蛋白质序列空间大得离谱:长度为 N 的蛋白质有 20^N 种可能的氨基酸序列。天然蛋白质只占据其中极小、高度结构化的部分。进化倾向于重复使用那些稳定、可表达且适应性强的折叠,而不是将蛋白质均匀散布在所有可能的序列和形状中。这对训练数据至关重要。当我们扩展预测结构时,我们不一定是在添加独立的样本。我们可能还在添加大量同一折叠家族、域组合和进化妥协的序列变体。 下面的例子展示了基本问题:通过序列相似性测量时,蛋白质可能看起来相距甚远,但在折叠空间中却非常接近。来自我们 AFDB 片段聚类的一个具体例子:在结构簇 `A0A242HMU2_f1` 中,三个蛋白质的序列一致性仅为 23.9–28.3%,却共享相同的折叠(TM-score > 0.75)。 裁剪后成对全局一致性:28.2%、28.3% 和 23.9%。预测结构上的局部 TM-align 得分为 0.768–0.813(使用平均长度归一化)。同一 AFDB 结构簇,与展示代表物 A0A518BRX6 比较 | 片段 | UniProt 注释 | 长度 | 与代表物的序列一致性 | 与代表物的 TM | |------|--------------|------|----------------------|---------------| | `A0A518BRX6_f1` | 3-氧酰基-[酰基载体蛋白]还原酶 FabG,细菌 | 249 aa | 100% | 1.000 | | `A0A1Q3EPK1_f1` | NAD 结合蛋白,*Lentinula edodes* | 283 aa | 28.2% | 0.768 | | `A0A6I8MDZ6_f1` | 短链脱氢酶/还原酶 SDR,*Oceanivirga miroungae* | 261 aa | 23.9% | 0.793 | ### 相同折叠,低序列一致性 来自同一结构簇的三个 AFDB 预测,使用局部 TM-align 对齐。 `A` FabG 还原酶 `B` SDR 蛋白 `C` 裁剪后 NAD 结合核心 正在加载对齐折叠叠加... NAD 结合蛋白在比对前裁剪为残基 201-483。移除的 N 端尾部平均 pLDDT 为 31.9,而保留的核心平均 pLDDT 为 91.3。叠加使用 A0A518BRX6 作为参考框架。 当我们扩展序列数据集时,应该期望看到多少真正的新折叠?如果 MGnify 增长 10 倍,其中有多少新序列实际上是结构新颖的?为了在整个空间中系统地回答这个问题,我们需要一个可扩展的聚类算法。Foldseek 是解决此问题的绝佳工具,其作者已经用它对 AlphaFold 数据库进行了聚类,报告了 230 万个非单例结构簇 (https://www.nature.com/articles/s41586-023-06510-w)。但聚类预测结构存在实际问题,并且聚类问题本身是病态的。我们认为可重复使用的结构邻域的真正数量**更接近数万,而不是那次快速 Foldseek 扫描报告的 230 万个非单例簇**——根据我们当前的分析,更接近 25,000 个而非 230 万个。以下是推理过程。 ## 预测结构的聚类问题 预测结构不同于晶体结构。序列和 MSA 是真实的,但结构缺少上下文,AlphaFold 会预测整个链:有序域、松散尾部、长连接子、信号肽,以及相对位置可能没有意义的多域蛋白。这使得聚类问题变得病态。两个蛋白质因为一个域匹配而成为相同折叠吗?它们因为有一个无序延伸而不同吗?预测结构的形状对于在此数据上训练生成模型也是问题。你不想浪费模型容量去拟合无序区域,也不想像糟糕地生成怪异、拉长的链。你可以根据全局 pLDDT、回转半径及类似全链指标进行过滤,但这些过滤器对于这种形状的数据过于粗糙——它们会丢弃附着在糟糕尾部上的良好域。我们需要一种更精细的方法来保留信号并去除噪声。 ### 预测链并非干净域 非常高 高 低 很低 `A0A5B2Z7Q7`,ArsR 家族转录调控因子 正在加载... `P38398-3`,乳腺癌 1 型易感蛋白异构体(BRCA1) 正在加载... ## 第一遍:去除明显噪声 我们的第一次尝试很简单。删除低于 pLDDT 阈值的残基,将剩余部分分割为连续序列片段,然后在空间上重新连接明显接触的片段。重新连接步骤是一个并查集问题:如果片段 A 接触 B,B 接触 C,那么 A、B、C 成为一个连接的片段。 - pLDDT 低于 65 的残基标记为不可用。 - 剩余残基成为连续序列片段。 - 具有足够紧密接触的片段在空间上合并。 - 得到的候选片段在聚类前进行进一步过滤。 这去除了大量明显的无序区域。同时保留了那些全链过滤器会丢弃的(因为完整蛋白质看起来太长、太伸展或太杂乱)的有序域。 **朴素片段化的局限性。** 明显的失败模式是高置信度的连接子。如果连接子通过了 pLDDT 过滤并建立了足够多的接触,空间合并可能会连接我们宁愿分开处理的两个域。并查集随后会精确完成所要求的任务:它将连接在一起的链变成一个片段。问题在于,这实际上并不是一个局部置信度问题。残基可能被预测得很自信,但仍然是不正确的训练单元。我们需要检测空间图中的瓶颈:连接其他独立片段的狭窄路径。 ### A0A0E0RCK4 第一遍 完整链被保留;短于 20 个残基的片段未被编号。 正在加载... ## 图论分割 我们需要一种基于残基之间如何连接来分割蛋白质的方法。为此,蛋白质自然可以视为一个图:每个残基是一个节点,空间距离较近的残基之间连边。我们使用来自预测中置信部分的 C-α 原子,将每个残基连接到其空间最近邻,并赋予近邻更强的权重。在当前版本中,每个残基看到其 15 个空间最近邻。这将片段化问题转化为连通性问题。一个紧凑域变成一个密集局部图。一个高置信度连接子变成两个密集区域之间的狭窄桥梁。图论为我们提供了询问该桥梁是否真正属于一个单元,还是连接两个独立部分的工具。 ### 最近邻蛋白质图的图论分割 正在加载... Fiedler 向量 蛋白质卡通显示为 Mol* 绿色;叠加图为实际的 k-最近邻图,每条边根据其端点残基的平均 Fiedler 值着色。 谱二分法询问该图中全局最弱连接(为什么我们计算的量能发现这个连接,对我而言有点玄学,请教图论专家)。我们发现蛋白质的谱二分点与我们在手动识别不同蛋白质区域时可能切割的点非常吻合。分割器的独立版本包含在补充信息 (https://research.ligo.bio/posts/unreasonable-redundancy-of-natural-protein-folds/#supplementary-spectral-split) 中。 ### 对于好奇者:Fiedler 向量 给定图的加权邻接矩阵 \(W\),归一化图拉普拉斯矩阵为: \[ L_{\mathrm{sym}} = I - D^{-1/2} W D^{-1/2} \] 其中 \(D\) 为对角度矩阵。\(L_{\mathrm{sym}}\) 的特征向量揭示图结构: - 最小特征值始终为 0。 - 第二小特征值 \(\lambda_2\) 衡量代数连通性。 - 相应的 Fiedler 向量给出一个有用的两路分割:符号相反的残基位于切割的两侧。 这就是上面图中显示的相同量。蛋白质只是绿色背景,而图边根据其两个端点残基的平均 Fiedler 值着色。强烈负值的边为蓝色,强烈正值的边为红色,接近零的边为浅色。这些接近零的残基是两侧之间的瓶颈,因此我们在分配片段之前移除这些残基。 ### 递归二分法 一次二分法只找到一个切割。多域蛋白质需要重复切割,因此在每次分割后,我们单独检查每个分区。如果分区的 \(\lambda_2 > \text{阈值}\),我们将其视为内部连接良好,停止分割。否则,继续分割。 ### 朴素合并与谱流水线 两个面板都加载一个全链 CIF;短于 20 个残基的片段未被编号。 朴素 pLDDT 过滤 + 空间并查集 正在加载... 谱流水线 Fiedler 向量切割,然后空间重新合并 正在加载... 右面板显示了当前的分割-再合并流水线:首先基于谱二分法提出切割,然后通过空间聚类重新合并看起来仍像一个紧凑单元的部分。 ## 对片段进行聚类 一旦我们将蛋白质分割成它们的“相互作用单元”,聚类的单位就不再是一个预测蛋白质,而是一个紧凑片段。我们可以通过结构相似性对这些片段进行聚类,并询问蒸馏集实际上包含了多少独立的折叠信号。我们使用 MMseqs2 在约 30% 序列一致性水平上对 MGnify 进行聚类,得到约 4000 万个序列簇。从那里,我们丢弃序列单例,然后对剩余的 MGnify 序列使用通过 OpenFold 数据集门户 (https://portal.openfold.omsf.io/datasets) 发布的 OpenFold3 预测结构。 这是从序列空间清理到结构空间清理的交接点:首先移除序列单例,然后对 OpenFold3 预测进行片段化和过滤。 我们对这些预测结构进行片段化,并使用质量指标过滤片段,旨在保留适合训练生成模型的样本(我们将在后续文章中详细说明)。下面的结构聚类从最终集合开始:约 200 万个 MGnify 片段。我们使用 Foldseek 进行第一遍聚类 (https://research.ligo.bio/posts/unreasonable-redundancy-of-natural-protein-folds/#supplementary-foldseek-command)。Foldseek 的快速模式同时使用结构和序列派生信号,这使其实用,但也意味着它可能分割结构非常相似但序列...

相似文章

折叠、推理与扩展:开源药物发现引擎

arXiv cs.AI

介绍OpenDDE,一个开源的全原子生物分子基础模型,该模型利用共折叠作为药物发现的共享结构推理层,实现了高精度,并识别出用于进一步改进的缩放定律。

结构蛋白质组学引导的共折叠模型

arXiv cs.LG

介绍了AIMS-Fold,一种推理时引导扩散框架,整合了交联质谱(XL-MS)和氢-氘交换(HDX-MS)数据,以改善针对诱导接近药物靶点的蛋白质共折叠预测。