深度学习在蛋白质复合物预测与设计中的应用

arXiv cs.LG 论文

摘要

本博士论文介绍了用于蛋白质复合物预测和设计的深度学习方法,包括用于接触预测的 GLINTER、用于同源配对的 ESMPair 以及用于结合子设计的 RedNet。

arXiv:2605.11189v1 公告类型:new 摘要:准确建模和设计蛋白质复合物结构是计算结构生物学中的核心问题,对于理解细胞功能和开发治疗药物具有广泛的意义。本论文利用深度学习研究了该问题的两个基本方面:能够捕捉蛋白质结构层级特性的领域特定架构,以及能够在蛋白质复合物的庞大序列空间中高效搜索的算法,以识别相互作用同源物来改进复合物结构预测,并设计蛋白质序列。
查看原文
查看缓存全文

缓存时间: 2026/05/13 06:34

# 致谢
来源:https://arxiv.org/html/2605.11189
《利用深度学习进行蛋白质复合物预测与设计》
作者:Ziwei Xie
提交至丰田伊利诺伊理工学院(TOYOTA TECHNOLOGICAL INSTITUTE AT CHICAGO),伊利诺伊州芝加哥,2026年3月,作为计算机科学哲学博士部分要求的学位论文。

**论文委员会:**
Jinbo Xu(论文导师)
Madhur Tulsiani
Aly Azeem Khan
Gabriel Rocklin

版权所有 © 2026 Ziwei Xie
保留所有权利

###### 摘要

准确建模和设计蛋白质复合物结构是计算结构生物学中的一个核心问题,对于理解细胞功能和发展治疗手段具有广泛的意义。本论文利用深度学习研究了该问题的两个基本方面:捕捉蛋白质结构层次特性的领域专用架构,以及在蛋白质复合物巨大的序列空间中高效导航的搜索算法,旨在识别相互作用同源物以改善复合物结构预测,并设计蛋白质序列。

首先,我开发了 GLINTER,这是一种基于图神经网络的预测蛋白质界面接触的方法。GLINTER 结合了来自单体结构的结构表示以及通过 Transformer 提取的共进化信号,在异源二聚体和同源二聚体靶标上均优于现有方法,并能有效指导蛋白质-蛋白质对接。

随后,我解决了复合物结构预测中的一个关键瓶颈:跨物种识别相互作用同源物。我提出了 ESMPair,该方法利用蛋白质语言模型将来自单个链的同源物进行配对。ESMPair 显著提高了异源二聚体的结构预测精度。

最后,我引入了 RedNet,这是一种用于固定骨架蛋白质结合剂设计的多尺度图 Transformer。RedNet 整合了骨架和侧链信息,并结合对比解码算法以优化结合亲和力和特异性,生成具有改进热力学性质的结合剂,能够区分结构高度相似的靶标。

综上所述,这些贡献表明,领域专用的深度学习架构与原则性的搜索策略相结合,可以从蛋白质结构、进化数据和实验测量中提取互补信息,从而推动蛋白质复合物结构预测及其逆问题——固定骨架蛋白质结合剂设计的发展。

我要感谢我的导师 Jinbo Xu 教授在我整个博士期间给予的支持、指导和富有洞察力的反馈。我要感谢委员会成员 Madhur Tulsiani 教授、Aly Khan 教授和 Gabriel Rocklin 教授,感谢他们对我的提案和论文提出的反馈,并帮助我应对各种流程。我还要感谢 Avrim Blum 教授在2024年担任我的本地导师,以及 Greg Shakhnarovich 教授帮助我完成论文的最后步骤。感谢我的实验室伙伴带来许多启发性的讨论,感谢工作人员、同事和教职员工让 TTIC 成为一个学习和开展研究的绝佳之地。最后,我要感谢我的父母、祖父母以及家人的无条件爱、信任和支持。没有他们,这篇论文是不可能完成的。

###### 目录

1. [致谢](https://arxiv.org/html/2605.11189#Chx1)
2. [1 引言](https://arxiv.org/html/2605.11189#Ch1)
    1. [1.1 蛋白质结构预测](https://arxiv.org/html/2605.11189#Ch1.S1)
        1. [1.1.1 实验性蛋白质结构测定](https://arxiv.org/html/2605.11189#Ch1.S1.SS1)
        2. [1.1.2 计算蛋白质结构预测](https://arxiv.org/html/2605.11189#Ch1.S1.SS2)
    2. [1.2 计算蛋白质设计](https://arxiv.org/html/2605.11189#Ch1.S2)
        1. [1.2.1 实验性蛋白质工程方法](https://arxiv.org/html/2605.11189#Ch1.S2.SS1)
        2. [1.2.2 计算蛋白质设计](https://arxiv.org/html/2605.11189#Ch1.S2.SS2)
    3. [1.3 用于蛋白质建模的深度学习](https://arxiv.org/html/2605.11189#Ch1.S3)
    4. [1.4 贡献](https://arxiv.org/html/2605.11189#Ch1.S4)
    5. [参考文献](https://arxiv.org/html/2605.11189#bib)
3. [2 蛋白质界面接触的图学习](https://arxiv.org/html/2605.11189#Ch2)
    1. [2.1 引言](https://arxiv.org/html/2605.11189#Ch2.S1)
    2. [2.2 数据与方法](https://arxiv.org/html/2605.11189#Ch2.S2)
        1. [2.2.1 网络架构](https://arxiv.org/html/2605.11189#Ch2.S2.SS1)
        2. [2.2.2 特征](https://arxiv.org/html/2605.11189#Ch2.S2.SS2)
        3. [2.2.3 数据集](https://arxiv.org/html/2605.11189#Ch2.S2.SS3)
        4. [2.2.4 训练与评估](https://arxiv.org/html/2605.11189#Ch2.S2.SS4)
        5. [2.2.5 对比方法](https://arxiv.org/html/2605.11189#Ch2.S2.SS5)
    3. [2.3 结果](https://arxiv.org/html/2605.11189#Ch2.S3)
        1. [2.3.1 界面接触预测评估](https://arxiv.org/html/2605.11189#Ch2.S3.SS1)
        2. [2.3.2 消融研究](https://arxiv.org/html/2605.11189#Ch2.S3.SS2)
        3. [2.3.3 应用于对接诱饵的选择](https://arxiv.org/html/2605.11189#Ch2.S3.SS3)
    4. [2.4 结论](https://arxiv.org/html/2605.11189#Ch2.S4)
    5. [参考文献](https://arxiv.org/html/2605.11189#biba)
4. [3 利用蛋白质语言模型改进蛋白质异源二聚体结构预测](https://arxiv.org/html/2605.11189#Ch3)
    1. [3.1 引言](https://arxiv.org/html/2605.11189#Ch3.S1)
    2. [3.2 数据与方法](https://arxiv.org/html/2605.11189#Ch3.S2)
        1. [3.2.1 PLM 增强的 MSA 配对流程](https://arxiv.org/html/2605.11189#Ch3.S2.SS1)
        2. [3.2.2 设置](https://arxiv.org/html/2605.11189#Ch3.S2.SS2)
        3. [3.2.3 基线](https://arxiv.org/html/2605.11189#Ch3.S2.SS3)
        4. [3.2.4 时间/内存需求分析](https://arxiv.org/html/2605.11189#Ch3.S2.SS4)
    3. [3.3 结果](https://arxiv.org/html/2605.11189#Ch3.S3)
        1. [3.3.1 ESMPair 概述](https://arxiv.org/html/2605.11189#Ch3.S3.SS1)
        2. [3.3.2 ESMPair 在异源二聚体预测中优于其他 MSA 配对方法](https://arxiv.org/html/2605.11189#Ch3.S3.SS2)
        3. [3.3.3 集成提高了预测精度](https://arxiv.org/html/2605.11189#Ch3.S3.SS3)
        4. [3.3.4 影响预测精度的因素](https://arxiv.org/html/2605.11189#Ch3.S3.SS4)
    4. [3.4 结论](https://arxiv.org/html/2605.11189#Ch3.S4)
    5. [参考文献](https://arxiv.org/html/2605.11189#bibb)
5. [4 使用对比解码重新设计选择性蛋白质结合剂](https://arxiv.org/html/2605.11189#Ch4)
    1. [4.1 引言](https://arxiv.org/html/2605.11189#Ch4.S1)
        1. [4.1.1 相关工作](https://arxiv.org/html/2605.11189#Ch4.S1.SS1)
    2. [4.2 数据与方法](https://arxiv.org/html/2605.11189#Ch4.S2)
        1. [4.2.1 蛋白质图表示](https://arxiv.org/html/2605.11189#Ch4.S2.SS1)
        2. [4.2.2 网络架构](https://arxiv.org/html/2605.11189#Ch4.S2.SS2)
        3. [4.2.3 对比解码与评分](https://arxiv.org/html/2605.11189#Ch4.S2.SS3)
        4. [4.2.4 数据集](https://arxiv.org/html/2605.11189#Ch4.S2.SS4)
    3. [4.3 结果](https://arxiv.org/html/2605.11189#Ch4.S3)
        1. [4.3.1 全原子图 Transformer 提高了单体和二聚体结构的序列恢复率](https://arxiv.org/html/2605.11189#Ch4.S3.SS1)
        2. [4.3.2 对比评分提高了零样本结合亲和力预测](https://arxiv.org/html/2605.11189#Ch4.S3.SS2)
        3. [4.3.3 对比解码提高了结合剂的结构自一致性](https://arxiv.org/html/2605.11189#Ch4.S3.SS3)
        4. [4.3.4 对比解码提高了结合剂的结合特异性](https://arxiv.org/html/2605.11189#Ch4.S3.SS4)
        5. [4.3.5 重新设计的选择性结合剂的结构分析](https://arxiv.org/html/2605.11189#Ch4.S3.SS5)
    4. [4.4 结论](https://arxiv.org/html/2605.11189#Ch4.S4)
    5. [参考文献](https://arxiv.org/html/2605.11189#bibc)
6. [5 结论与未来方向](https://arxiv.org/html/2605.11189#Ch5)
    1. [5.1 未来改进](https://arxiv.org/html/2605.11189#Ch5.S1)
    2. [参考文献](https://arxiv.org/html/2605.11189#bibd)

###### 图表列表

1. [图 1.1 不同方法空间分辨率的示意图。AFM,原子力显微镜;EM,电子显微镜;FRET,弗斯特共振能量转移;NMR,核磁共振。引自 [23],依据署名-非商业性使用-相同方式共享 3.0 未移植许可协议 (http://creativecommons.org/licenses/by-nc-sa/3.0/) 授权。](https://arxiv.org/html/2605.11189#Ch1.F1)
2. [图 1.2 深度学习蛋白质设计流程概览,展示了骨架生成、序列设计和基于结构预测的过滤。图改编自 [18]。](https://arxiv.org/html/2605.11189#Ch1.F2)
3. [图 2.1 GLINTER 架构概览。$L_{1}$ 和 $L_{2}$ 是两条蛋白质链的长度,$K$ 是 CaConv 层中的通道数,144 是 Facebook 的 MSA Transformer (Rao et al., 2021) 生成的行注意力权重的总头数。](https://arxiv.org/html/2605.11189#Ch2.F1)
4. [图 2.2 CNN+ESM-Attention 模型](https://arxiv.org/html/2605.11189#Ch2.F2)
5. [图 2.3 x 轴是预测单体结构的 TMscore。y 轴是实验单体结构与预测单体结构导致的前 10 名精度之差。(A)“残基,D-cut=8”。(B)“残基 + 原子,D-cut=8,6” (C)“残基 + 表面,D-cut=8,6” (D)“残基 + 原子 + 表面,D-cut=8,6,6” (E)“残基 + 原子 + 表面 + ESM,D-cut=8,6,6”。在所有箱线图中,箱体上边缘为第三四分位数(Q3),箱体下边缘为第一四分位数(Q1),橙色线为中位数,上须为 Q3 + 1.5(Q3 - Q1) 以下的最高数据点,下须为 Q1 - 1.5(Q3-Q1) 以上的最低数据点。](https://arxiv.org/html/2605.11189#Ch2.F3)
6. [图 2.4 三种模型前 10 名精度的比较:ESM、Residue+Atom+Surface 和 Residue+Atom+Surface+ESM。(A)比较 Residue+Atom+Surface 和 ESM,(B)比较 Residue+Atom+Surface+ESM 和 ESM,(C)比较 Residue+Atom+Surface 和 Residue+Atom+Surface+ESM](https://arxiv.org/html/2605.11189#Ch2.F4)
7. [图 2.5 $\ln(\text{Meff})$(x 轴)与 ESM-Attention 模型正确的前 10 名预测数量(y 轴)之间的相关性。排除了没有正确前 10 名预测的靶标。($R^2=0.3093$)](https://arxiv.org/html/2605.11189#Ch2.F5)
8. [图 2.6 由预测接触选择的前列诱饵的平均质量(通过 TMscore 测量)。x 轴是选择的前列诱饵数量。图例中,“top-10”、“top-25” 和 “top-50” 分别表示使用前 10、25 和 50 个预测接触来选择对接诱饵。“best decoy” 表示由 HDOCK 生成的最佳诱饵的质量。](https://arxiv.org/html/2605.11189#Ch2.F6)
9. [图 3.1 ESMPair 的示意图。给定一对查询序列:(1)JackHMMER 搜索 UniProt[24] 为每个查询生成 MSA,(2)按物种对同源物进行分组,(3)ESM-MSA-1b 估计每个同源物与查询之间的列注意力得分,(4)来自同一物种且排名相同的同源物被配对并连接成交互同源物(interologs),(5)AlphaFold-Multimer 将交互同源物 MSA 作为输入以预测复合物结构。](https://arxiv.org/html/2605.11189#Ch3.F1)
10. [图 3.2 不同 pConf 得分区域和分类域的预测性能。(a–b)ESMPair 相对于 AF-Multimer 的相对改进与 pConf 得分之间的负相关性。(c–f)Eucaryote、Bacteria 和 Eucaryote&Bacteria 域中 ESMPair、AF-Multimer 和 Genome 的 DockQ 得分比较。Eucaryote&Bacteria 表示两条链属于不同域的异源二聚体。我们数据集中的异源二聚体源自真核生物、细菌、病毒和古菌;我们将细菌、病毒和古菌归为细菌域。在所有测试集中,ESMPair 在真核生物靶标上显著优于两个基线。](https://arxiv.org/html/2605.11189#Ch3.F2)
11. [图 3.3 ESMPair 与 AF-Multimer 在新发布靶标(a–f)和未解析案例(g)上的比较。(a–f)评估2018年4月30日后发布的74个靶标。(a)条形图显示 ESMPair 和 AF-Multimer 在三类中的相对性能差距:ESMPair 优于 AF-Multimer,AF-Multimer 优于 ESMPair,以及性能相当。(b)ESMPair(紫色)和 AF-Multimer(黄色)预测结构的界面和配体 RMSD 分布。(c–f)四个代表性案例:AF-Multimer 预测 7VSI 和 7AQU 的配体取向错误,以及 7SL9 和 6FYH 的结合位点错误。(g)ESMPair 预测的中间丝 NFM–INA 异源二聚体形成四螺旋束。灰色框表示两个蛋白质的 coil 1A、coil 1B 和 coil 2 的相互作用基序。](https://arxiv.org/html/2605.11189#Ch3.F3)
12. [图 3.4 ESMPair 与四种替代 MSA 配对方法(a–d)和集成策略(e)在 pConf70 靶标上的比较。(a–d)每个点显示 ESMPair(x 轴)与对比方法(y 轴)针对某个靶标的 DockQ 得分。对角线以下的点表示 ESMPair 优于替代方法。高亮区域表示 DockQ 得分判定的不正确(白色)、可接受(灰色)、中等(黄色)和高质量(紫色)预测。(e)灰色条显示单一策略性能,其中 G. = Genome,A. = AF-Multimer,E. = ESMPair。ESMPair 实现了最佳单一策略结果(0.259 DockQ,42.4% 成功率)。黄色条显示成对集成,其中 ESMPair + Genome 表现最佳(0.277 DockQ,44.6% 成功率)。紫色条显示三种策略集成实现了最高整体性能(0.285 DockQ,46.8% 成功率)。](https://arxiv.org/html/2605.11189#Ch3.F4)
13. [图 3.5 影响结构预测性能的因素。平均 Top-5 最佳 DockQ 得分与(a)ESM-MSA-1b 预测的列注意力得分(对数尺度)、(b)有效序列数量(Meff)、(c)物种数量和(d)配对 MSA 深度(对数尺度)之间的相关性。(e)列注意力得分与有效交互同源物数量的分布。红色曲线显示拟合的线性回归模型(Pearson $r \approx -0.70$),表明较高的列注意力得分对应较少的有效交互同源物。](https://arxiv.org/html/2605.11189#Ch3.F5)
14. [图 4.1 RedNet 架构概览。图神经网络将蛋白质结构编码为节点和边表示,然后通过因果 Transformer 解码以自回归预测氨基酸序列。](https://arxiv.org/html/2605.11189#Ch4.F1)
15. [图 4.2 6FOE–5WHJ 选择性结合剂对的结构分析。(A)重新设计的结合剂(红色为目标复合物的设计链,白色为非目标复合物的设计链)与其各自的目标(青色)和非目标(灰色)伙伴的相互作用。(B)天然结合剂与其各自的目标和非目标伙伴的相互作用。](https://arxiv.org/html/2605.11189#Ch4.F2)
16. [图 4.3 5FFN–1LW6 选择性结合剂对的结构分析。(A)重新设计的结合剂(红色为目标复合物的设计链,白色为非目标复合物的设计链)与其各自的目标(青色)和非目标(灰色)伙伴的相互作用。(B)天然结合剂与其各自的目标和非目标伙伴的相互作用。](https://arxiv.org/html/2605.11189#Ch4.F3)

###### 表格列表

1. [表 2.1 空间图中使用的特征,其中 $L$ 是残基数量,$N$ 是原子数量,$M$ 是采样的表面顶点数量,$E$ 是原子图中的边数量。](https://arxiv.org/html/2605.11189#Ch2.T1)
2. [表 2.2 平均接触预测](https://arxiv.org/html/2605.11189#Ch2.T2)

相似文章