DeepRHP:一种用于设计随机杂聚物作为蛋白质模拟物的混合变分自编码器
摘要
DeepRHP是一种混合变分自编码器,能够指导随机杂聚物作为蛋白质模拟物的设计,并通过稳定非天然环境中的膜蛋白(如Aquaporin Z)得到了验证。
arXiv:2606.11651v1 公告类型:新发布
摘要:合成随机杂聚物(RHP)由一组预定义的单体组成,为设计类蛋白质材料提供了一种途径。这些RHP若设计得当,可以模拟蛋白质的行为和功能。因此,需要开发计算工具来高效指导RHP的设计。我们通过开发DeepRHP(一种在半监督框架下改进的变分自编码器模型)填补了这一空白。通过为经典VAE配备一个额外的基于特征的VAE,DeepRHP迫使隐空间同时捕捉关键化学特征的结构以及单个RHP序列模式。从这个意义上说,我们的方法具有通用性,能够以混合方式整合任何相关特征。我们通过建议能够稳定非天然环境中膜蛋白(如Aquaporin Z)的潜在单体组成,并将我们的预测与已发表结果进行交叉验证,证明了DeepRHP的有效性。我们的模型与真实RHP功能之间的一致性表明,利用混合自编码器架构来指导RHP设计以模拟蛋白质及其他生物化合物具有巨大潜力。
查看缓存全文
缓存时间: 2026/06/11 13:51
# DeepRHP: 一种用于设计模拟蛋白质的随机杂聚物的混合变分自编码器
来源:https://arxiv.org/html/2606.11651
###### 摘要
由预定义单体集合组成的合成随机杂聚物(RHP),为设计类蛋白质材料提供了一种途径。若设计得当,这些RHP能够模拟蛋白质的行为与功能。因此,亟需高效的计算工具来指导RHP设计。我们开发了DeepRHP来弥补这一空缺,它是一种在半监督框架下改进的变分自编码器(VAE)模型。通过为经典VAE配备一个额外的基于特征的VAE,DeepRHP强制潜在空间捕获关键化学特征的结构以及单个RHP序列模式。就此而言,我们的方法具有通用性,能够以混合方式整合任何相关特征。我们通过建议能够稳定非天然环境中膜蛋白(如Aquaporin Z)的潜在单体组成,并与已发表结果进行交叉验证,展示了DeepRHP的有效性。模型预测与真实RHP功能之间的一致性表明,利用混合自编码器架构指导针对蛋白质及其他生物化合物的RHP设计具有巨大潜力。
## 1 引言
工程化能够复制蛋白质功能同时满足器件制造与集成的稳定性和兼容性的合成材料,引起了极大兴趣。然而,合成序列特异性聚合物仍是一个难以逾越的挑战。这引发了近期对设计类蛋白质随机杂聚物的研究热潮。随机杂聚物(RHP)是众多聚合物链的集合,每条链由随机排列的单体组成(Hilburg et al. 2020 (https://arxiv.org/html/2606.11651#bib.bib1))。最新研究表明,RHP可作为分子伴侣蛋白质,在非生物环境中稳定蛋白质(Panganiban et al. 2018 (https://arxiv.org/html/2606.11651#bib.bib2)),这是制造用于终极塑料降解的蛋白质嵌入塑料的关键瓶颈(DelRe et al. 2021 (https://arxiv.org/html/2606.11651#bib.bib13))。此外,RHP可被设计为通道蛋白,实现快速、选择性质子传输(Jiang et al. 2020 (https://arxiv.org/html/2606.11651#bib.bib3)),这对燃料电池和能量存储至关重要。
尽管RHP可作为优异的生物功能材料,但设计具有所需功能的RHP仍具挑战性,因为合成RHP链的确切单体序列和构象并非确定性的。传统蛋白质设计方法严重依赖高通量测序数据和三维结构。例如,定向进化方法通过迭代突变选定的蛋白质序列来进化蛋白质功能(Arnold 2018 (https://arxiv.org/html/2606.11651#bib.bib16)),而从头设计方法则构建折叠成特定结构的新型蛋白质(Huang et al. 2016 (https://arxiv.org/html/2606.11651#bib.bib17))。缺乏确切序列和结构,就无合理的设计原则来创建功能合适的RHP链。目前的RHP设计很大程度上依赖经验,并需对多种单体组成和链长进行耗时的实验室筛选。对于实验室中制备的每种RHP,在相同单体组成下模拟数千条序列的集合,以理解为何某些组成优于其他。在此过程中,科学家面临两个实际设计问题,若能解答则可加速进展:
- • RHP系统应包含多少种单体?最新结果显示,仅用四种单体的RHP即可模仿蛋白质功能(Panganiban et al. 2018 (https://arxiv.org/html/2606.11651#bib.bib2);Jiang et al. 2020 (https://arxiv.org/html/2606.11651#bib.bib3)),但字母表中包含多少单体才足够仍不清楚。
- • 如何找到与特定蛋白质功能对应的单体组成?
回答这些问题需要新的方法来建模和分析RHP序列整体,而非单个链。据我们所知,关于RHP建模的计算方法文献非常有限。仅有的两个例子是:Zhou等人 (https://arxiv.org/html/2606.11651#bib.bib4)(2022 (https://arxiv.org/html/2606.11651#bib.bib4))使用隐马尔可夫模型表征质子传输RHP的功能性,以及Tamasi等人 (https://arxiv.org/html/2606.11651#bib.bib14)(2022 (https://arxiv.org/html/2606.11651#bib.bib14))利用高斯过程回归结合贝叶斯优化进行最优共聚物识别。
在此,我们提出DeepRHP,一种以半监督方式训练的改进变分自编码器,用于建模通用RHP序列数据并发现用于蛋白质功能的RHP组成。该工具作为第一步,可通过检查其模拟蛋白质行为来指导RHP设计。本研究的主要贡献如下:
- • 我们是首个用深度学习回答RHP设计问题的。DeepRHP学习RHP序列的可解释潜在表征,并提供一个平台在整体层面上对目标蛋白质和RHP序列进行相似性分析。
- • DeepRHP对两个重要设计参数(单体字母表大小和单体组成)提供了见解。我们表明DeepRHP建议的最佳单体组成与已发表的实验结果吻合。
- • DeepRHP足够灵活,能够整合多种蛋白质功能相关的化学特征。
基于VAE的架构是最早用于识别生物序列潜在表示的模型类别之一,并在下游任务中很有用,如识别突变效应(Sinai et al. 2017 (https://arxiv.org/html/2606.11651#bib.bib7);Riesselman et al. 2018 (https://arxiv.org/html/2606.11651#bib.bib8))和设计新型功能性蛋白质(Greener et al. 2018 (https://arxiv.org/html/2606.11651#bib.bib10);Costello and Martin 2019 (https://arxiv.org/html/2606.11651#bib.bib9))。因此,我们应预期将相同的机器学习理论应用于大分子化学信息学,特别是在使用RHP模拟天然生物聚合物这一实例中。
参见图注图1:DeepRHP模型架构,包含一个经典VAE并配备一个额外的基于特征的VAE。
## 2 数据
我们的工作利用了Panganiban等人 (https://arxiv.org/html/2606.11651#bib.bib2)(2018 (https://arxiv.org/html/2606.11651#bib.bib2))和Jiang等人 (https://arxiv.org/html/2606.11651#bib.bib3)(2020 (https://arxiv.org/html/2606.11651#bib.bib3))开发的RHP系统。该系统包含四种甲基丙烯酸酯类单体:甲基丙烯酸甲酯(MMA)、甲基丙烯酸2-乙基己酯(EHMA)、低聚(乙二醇)甲基丙烯酸酯(OEGMA)和3-磺丙基甲基丙烯酸钾盐(SPMA)。MMA和EHMA是疏水性单体,用于调节整体疏水性,而OEGMA和SPMA是亲水性单体,用于降低RHP的聚集倾向。
我们使用了Compositional Drift,这是Smith等人 (https://arxiv.org/html/2606.11651#bib.bib11)(2019 (https://arxiv.org/html/2606.11651#bib.bib11))开发的软件,为表1 (https://arxiv.org/html/2606.11651#S2.T1) 中列出的每种单体组成模拟了10,000条序列。该软件使用已建立的数学共聚物模型结合蒙特卡洛模拟,根据实验条件计算RHP序列。作者表明,尽管模拟的每条链在序列层面是随机的,但它包含具有明确统计分布的特征片段(Smith et al. 2019 (https://arxiv.org/html/2606.11651#bib.bib11))。每种特定RHP单体组成的理由在第4节进一步讨论。
我们还从UniProt数据库(UniProt Consortium 2020 (https://arxiv.org/html/2606.11651#bib.bib12))收集了30,000条膜蛋白序列和30,000条球状蛋白序列,采用50%同一性阈值。进行了一些常见的预处理步骤,包括丢弃含有不常见氨基酸和长度异常的序列。然后根据表2 (https://arxiv.org/html/2606.11651#S2.T2) 中的分配,将每种蛋白质简化为其单体等效形式。注意,蛋白质字母表的缩减在蛋白质序列分析中并不罕见,参见Liang等人 (https://arxiv.org/html/2606.11651#bib.bib15)(2022 (https://arxiv.org/html/2606.11651#bib.bib15))的全面综述。这里我们的缩减规则基于单体疏水性和电荷。
表1:用于训练的两单体及四单体RHP组成表2:氨基酸(蛋白质)到单体(RHP)转换
## 3 DeepRHP 方法
为了解决第1节中提出的领域问题,我们开发了DeepRHP,一种在半监督框架下改进的变分自编码器,用于学习低维RHP序列表示。模型架构如图1 (https://arxiv.org/html/2606.11651#S1.F1) 所示。我们假设序列族\(X\)遵循概率分布\(p(x)\),并且存在一个潜在变量\(z \sim N(\mu_z, \Sigma_z)\),捕获内在的未观测序列属性。对于每条序列\(x\),还存在一个功能相关特征\(y\),可被视为\(x\)的确定性变换。在第4节的应用案例中,\(y\)是沿每条序列滑动窗口的平均亲水-亲脂平衡(HLB)值(Kyte and Doolittle 1982 (https://arxiv.org/html/2606.11651#bib.bib18))。HLB衡量局部疏水性和溶解性分布,与RHP功能密切相关(Panganiban et al. 2018 (https://arxiv.org/html/2606.11651#bib.bib2);Jiang et al. 2020 (https://arxiv.org/html/2606.11651#bib.bib3))。引入其他功能相关化学特征(如HLB)的动机是为了引导潜在空间的形成。
为了将化学特征\(y\)纳入我们的VAE模型,我们在经典VAE旁边并行添加一个特征驱动的VAE。\(y\)和\(x\)共享共同的潜在变量\(z\)。这相当于同时训练两个具有共享潜在嵌入的VAE,并且编码器仅依赖于\(x\),因为\(y\)是\(x\)的直接变换,如图1 (https://arxiv.org/html/2606.11651#S1.F1) 中虚线所示。
目标仍然是最大化给定序列数据\(X\)的对数似然\(\log p(x)\),如下式所示:
\[
\log p(x) = \log \int p(x \mid z) p(z) \, dz.
\] (1)
在常规VAE设置下,公式 (1) (https://arxiv.org/html/2606.11651#S3.E1) 可以通过众所周知的证据下界(ELBO)(Kingma and Welling 2013 (https://arxiv.org/html/2606.11651#bib.bib5); Rezende et al. 2014 (https://arxiv.org/html/2606.11651#bib.bib6))来界定:
\[
\log p(x) \geq \mathbb{E}_q \left[ \log p(x \mid z) \right] - D_{KL} \left( q(z \mid x) \| p(z) \right),
\] (2)
其中\(q\)是正态分布族的学习后验。实践中,\(p\)和\(q\)由编码器和解码器学习,其权重通过梯度下降优化。
传统上,重建损失项对于连续输入用均方误差近似,对于离散输入用交叉熵损失近似。通过采用这种混合架构,我们可以通过经典VAE对\(x\)、特征驱动VAE对\(y\),或两者的加权和来近似重建损失。我们考虑序列结构和化学特征的修改ELBO公式如下:
\[
\log p(x) \geq \alpha \mathbb{E}_q \left[ \log p(x \mid z) \right] + (1-\alpha) \mathbb{E}_q \left[ \log p(y \mid z) \right] - D_{KL} \left( q(z \mid x) \| p(z) \right),
\] (3)
其中\(\alpha\)是一个超参数,决定每个近似项的权重。在我们的情况下,公式 (3) 的前两项近似如下:
\[
\mathbb{E}_q \left[ \log p(x \mid z) \right] \approx \sum_x \sum_l p(x_l) * \log(p(x_l \mid z))
\] (4)
\[
\mathbb{E}_q \left[ \log p(y \mid z) \right] \approx - \sum_y \| y - y' \|_2^2,
\] (5)
其中\(y'\)是基于特征的解码器的输出,如图1 (https://arxiv.org/html/2606.11651#S1.F1) 中蓝色阴影所示。
通过以这种混合方式优化重建损失,我们获得一个有意义的低维潜在空间,捕获与所需蛋白质功能相关的序列结构。此外,我们的方法具有经典VAE常缺乏的可解释性优势。现有工作通常将所有特征连接成一个单一向量供编码器使用。这样得到的潜在空间变得模糊,因为无法推导出主方向的物理意义。相反,我们的混合训练实现了有意义的可视化,因为潜在变量直接与化学特征相关联。
编码器和解码器均使用多层感知机通过PyTorch实现。每个网络有三个全连接层,隐藏单元数分别为256、128和64。特征解码器有两个全连接层,隐藏单元数为32。除解码器输出层使用Sigmoid激活函数外,整个网络使用ReLU激活函数作为非线性。模型使用Adam优化器训练,学习率为0.0001。当验证损失停止改善时,使用学习率调度器。
## 4 结果与讨论
参见图注图2:RHP和蛋白质潜在因子的PCA投影。图 (a) 和 (b) 分别将膜蛋白和球状蛋白投影到两单体及四单体RHP空间。图 (c) 和 (d) 将AqpZ投影到相同的两个RHP空间。水通道蛋白(Aqp)是膜通道蛋白,促进细胞间水传输。即使温和实验条件下,膜蛋白也不稳定且易聚集。Panganiban等人 (https://arxiv.org/html/2606.11651#bib.bib2) 成功地在非天然环境中借助RHP稳定了水通道蛋白Z(AqpZ)并保持其功能。我们展示如何利用DeepRHP通过识别有前景的单体组成来加速RHP设计。
Panganiban等人 (https://arxiv.org/html/2606.11651#bib.bib2)(2018 (https://arxiv.org/html/2606.11651#bib.bib2))基于对四个蛋白质序列的粗略表面分析,选择在其RHP系统中使用70%疏水性单体和30%亲水性单体。我们首先使用模型验证这种单体疏水性分布。两单体RHP和天然蛋白质的潜在因子通过主成分分析(PCA)投影到二维空间,如图2 (https://arxiv.org/html/2606.11651#S4.F2) (a) 所示。所有两单体RHP均由一种疏水性单体(EHMA)和一种亲水性单体(OEGMA)组成。表1 (https://arxiv.org/html/2606.11651#S2.T1) 中列出的RHP A到RHP E的组成被选为充分反映该疏水性范围。相似文章
深度学习在蛋白质复合物预测与设计中的应用
本博士论文介绍了用于蛋白质复合物预测和设计的深度学习方法,包括用于接触预测的 GLINTER、用于同源配对的 ESMPair 以及用于结合子设计的 RedNet。
从全息口袋到电子密度:基于密度的GPT式药物设计
本文介绍了EDMolGPT,这是一种自回归框架,能够从低分辨率电子密度点云生成3D分子构象,通过利用具有物理意义的密度信号来改进基于结构的药物设计。
Design-CP:蛋白质纳米颗粒设计的上下文并行技术
Design-CP 为 RFdiffusion 3 引入了上下文并行推理策略,通过将二次激活分布到多个 GPU 上,实现了大型多聚体蛋白质纳米颗粒的全原子设计,从而在较小的 GPU 集群上使大规模组装蛋白质设计变得可行。
基于内存高效等变变压器的可扩展肽设计
介绍了MEET,一种用于全原子肽设计的内存高效E(3)等变变压器,与VAE和潜在扩散管道集成,实现了线性内存缩放和改善的生成质量。
@BioSpace9:利用基于扩散的系综采样进行蛋白质开关的从头设计
这篇bioRxiv预印本介绍了Diff-Switch框架,该框架利用基于扩散的系综采样生成构象状态,用于从头设计蛋白质开关,从而提高找到开关兼容序列的成功率。