APCyc:通过自动化环化进行性质导向的环肽设计

arXiv cs.AI 论文

摘要

APCyc是一个靶点感知的生成框架,通过显式建模环化模式并利用贝叶斯后验引导,设计具有可控理化性质的环肽。

arXiv:2606.12991v1 公告类型:新 摘要:环肽是现代药物发现中一类有前景的治疗性化合物,通常具有更高的稳定性和结合亲和力。然而,环肽的从头设计仍然具有挑战性,因为方法必须识别口袋适应性环化模式和连接位点,同时控制药物相关性质。对于主要在线性肽数据上训练的最近生成模型而言,这一挑战尤为突出,因为它们可能无法捕捉环化特异性约束。为了解决这一局限性,我们提出了APCyc,一种靶点感知的从头环肽生成框架,它显式建模环化并联合优化多个关键理化性质。通过使用扩展的残基词汇表并显式编码环化位点和连接类型信息,APCyc学习环化感知表示,并利用贝叶斯后验引导将采样导向满足多个性质目标的环肽。实验结果表明,我们的模型学习了靶点依赖的环化偏好,并实现了对环肽设计的有效且可控的多性质优化。本文的源代码可在 https://github.com/HKUSTGZ-ML4Health-Lab/APCyc 获取。
查看原文
查看缓存全文

缓存时间: 2026/06/12 08:54

# APCyc:通过自动环化实现环肽的性质知情设计 来源:https://arxiv.org/html/2606.12991 Yifan Zhaoyzhao642@connect\.hkust\-gz\.edu\.cn (https://arxiv.org/html/2606.12991v1/mailto:[email protected])AI ThrustThe Hong Kong University of Science and Technology \(Guangzhou\)ChinaLang Qinlqin969@connect\.hkust\-gz\.edu\.cn (https://arxiv.org/html/2606.12991v1/mailto:[email protected])AI ThrustThe Hong Kong University of Science and Technology \(Guangzhou\)China和Jintai Chenjintaichen@hkust\-gz\.edu\.cn (https://arxiv.org/html/2606.12991v1/mailto:[email protected])AI\-Peptide Drug Design Joint LaboratoryThe Hong Kong University of Science and Technology \(Guangzhou\)China \(2026\) ###### 摘要。环肽是现代药物发现中一类有前景的治疗化合物,通常具有更高的稳定性和结合亲和力。然而,环肽的从头设计仍然充满挑战,因为方法必须识别口袋自适应的环化模式和连接位点,同时控制药物相关性质。这一挑战对于近期主要在线性肽数据上训练的生成模型尤为突出,这些模型可能无法捕捉环化特有的约束。为解决这一局限,我们提出了APCyc,一个靶点感知的从头环肽生成框架,该框架显式建模环化并联合优化多种关键的理化性质。通过使用扩展的残基词汇表并显式编码环化位点和连接类型信息,APCyc学习环化感知的表示,并利用贝叶斯后验引导将采样导向满足多个性质目标的环肽。实验结果表明,我们的模型能够学习依赖靶点的环化偏好,并实现环肽设计的有效且可控的多性质优化。本文的源代码可在 https://github\.com/HKUSTGZ\-ML4Health\-Lab/APCyc 获取。环肽;生成模型;扩散模型††journalyear:2026††copyright:cc††conference:Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V\.2; August 9–13, 2026; Jeju Island, Republic of Korea。††booktitle:Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V\.2 \(KDD 2026\), August 9–13, 2026, Jeju Island, Republic of Korea††isbn:979\-8\-4007\-2259\-2/2026/08††doi:10\.1145/3770855\.3818908††ccs:Applied computing Bioinformatics††ccs:Applied computing Computational biology††ccs:Computing methodologies Artificial intelligence††ccs:Computing methodologies Machine LearningAccepted at the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining \(KDD 2026\)。DOI:10\.1145/3770855\.3818908 (https://doi.org/10.1145/3770855.3818908)。 ## 1.引言 环肽是短且可合成的氨基酸序列,其特征是大环结构约束,这种约束将肽骨架预组织成生物活性构象\(Fosgerau and Hoffmann,2015 (https://arxiv.org/html/2606.12991#bib.bib17); Ji et al\.,2024 (https://arxiv.org/html/2606.12991#bib.bib22)\),从而最小化与靶蛋白结合时的熵代价,使其在治疗应用中具有吸引力\(Vlieghe et al\.,2010 (https://arxiv.org/html/2606.12991#bib.bib54); Lau and Dunn,2018 (https://arxiv.org/html/2606.12991#bib.bib30); Driggers et al\.,2008 (https://arxiv.org/html/2606.12991#bib.bib15); Zorzi et al\.,2017 (https://arxiv.org/html/2606.12991#bib.bib59); Liu et al\.,2024 (https://arxiv.org/html/2606.12991#bib.bib37)\)。这些优势推动了环肽发现的计算方法发展,近年来基于AI的方法越来越多地被用于建模序列-结构-性质关系,并从庞大的组合序列空间中优先选择候选分子。然而,设计具有治疗价值的环肽仍然充满挑战,因为候选分子除了靶点结合外,还必须满足多种耦合的药物相关约束,包括溶解度、渗透性、蛋白酶抗性、代谢稳定性和安全性相关性质\(Otvos Jr and Wade,2014 (https://arxiv.org/html/2606.12991#bib.bib40)\)。因此,环肽设计本质上是一个多目标优化问题,需要能够平衡治疗约束而非仅优化活性的方法。 最近的靶点感知肽设计方法主要侧重于生成条件于靶点(受体)序列和口袋几何结构的线性肽。在这一范式下,几何感知的生成模型,包括潜在扩散方法\(Kong et al\.,2024 (https://arxiv.org/html/2606.12991#bib.bib28)\)或多模态扭转流匹配\(Lin et al\.,2024 (https://arxiv.org/html/2606.12991#bib.bib36); Li et al\.,2024b (https://arxiv.org/html/2606.12991#bib.bib33)\),已展示了在靶点界面进行全原子线性肽设计的能力。同时,利用自回归生成\(Li et al\.,2024a (https://arxiv.org/html/2606.12991#bib.bib32)\)、强化学习范式\(Oh et al\.,2025 (https://arxiv.org/html/2606.12991#bib.bib39)\)或口袋条件扩散模型\(Sayuti et al\.,2025 (https://arxiv.org/html/2606.12991#bib.bib47)\)的方法,进一步推动了针对不同靶点的线性肽结合物的有效设计\(Bhat et al\.,2025 (https://arxiv.org/html/2606.12991#bib.bib8)\)。然而,这些框架通常将环化视为事后结构修饰,而非一个集成的设计变量\(Li et al\.,2024c (https://arxiv.org/html/2606.12991#bib.bib34); Rettie et al\.,2025a (https://arxiv.org/html/2606.12991#bib.bib44)\),未能捕捉高亲和力结合中固有的、复杂且靶点特异性的拓扑要求\(Rettie et al\.,2025a (https://arxiv.org/html/2606.12991#bib.bib44),b (https://arxiv.org/html/2606.12991#bib.bib45); Wang et al\.,2024 (https://arxiv.org/html/2606.12991#bib.bib55)\)。除了这种结构集成上的缺失\(Jiang et al\.,2025 (https://arxiv.org/html/2606.12991#bib.bib23)\),现有框架依赖于僵化的、先验的环化启发式方法\(Zhou et al\.,2025 (https://arxiv.org/html/2606.12991#bib.bib58)\)。在这些方法中,环化类型和连接位点位置通常基于启发式、先验假设或试错法预定义,而非直接从靶点结合口袋的结构要求推断出来。这种解耦存在根本性缺陷,因为结合位点表现出显著的几何多样性,从深槽状口袋到平坦或浅表面\(Guo et al\.,2015 (https://arxiv.org/html/2606.12991#bib.bib19); Garcia Jimenez et al\.,2023 (https://arxiv.org/html/2606.12991#bib.bib18)\),这内在地决定了最佳肽拓扑结构\(Keeling et al\.,2016 (https://arxiv.org/html/2606.12991#bib.bib25)\)。因此,在实际环肽发现中识别口袋自适应的环化策略通常需要成本高昂的候选环化策略枚举和迭代筛选\(Li et al\.,2022 (https://arxiv.org/html/2606.12991#bib.bib35); Kim et al\.,2025 (https://arxiv.org/html/2606.12991#bib.bib26)\),这促使了条件于靶点结合位点自动选择环化策略的模型的发展。 同时,渗透性等关键药物相关性质与环化策略紧密耦合,最佳选择因靶点而异\(Chandramohan et al\.,2024 (https://arxiv.org/html/2606.12991#bib.bib9); Ji et al\.,2024 (https://arxiv.org/html/2606.12991#bib.bib22)\)。在现有方法中,环肽的重要类药物性质,包括膜渗透性、溶解度、蛋白酶抗性和免疫原性,在很大程度上被忽视,给治疗性肽设计带来了额外挑战。 为共同应对上述挑战,我们提出了APCyc,一个生成框架,能够实现环化连接类型和位点的自动生成,以及环肽设计的性质知情优化。与依赖固定环化策略的现有方法不同\(Zhou et al\.,2025 (https://arxiv.org/html/2606.12991#bib.bib58); Jiang et al\.,2025 (https://arxiv.org/html/2606.12991#bib.bib23)\),APCyc将环化拓扑选择显式表述为一个离散的、条件于靶点的决策问题。这一设计使得环化类型和残基层面连接位点能够基于受体口袋上下文自动生成。具体来说,APCyc将环化拓扑分解为残基层面参与信号和成对连接信号,使模型能够显式学习环化残基、连接位点和连接类型。我们首先通过显式区分参与环化的残基与未环化残基(即使它们共享相同的氨基酸身份)来扩展肽残基词汇表。然后,将这些环化感知的嵌入整合到潜在扩散模型的去噪网络中\(Kong et al\.,2024 (https://arxiv.org/html/2606.12991#bib.bib28)\),使有监督的环化信号能够条件化并引导去噪轨迹。对于性质知情优化,我们在潜在空间中训练基于能量的代理模型,通过梯度将扩散过程导向联合多目标。图1 (https://arxiv.org/html/2606.12991#S1.F1)总结了APCyc的高层设计概念。 我们总结贡献如下: - •自动的口袋条件环化:与需要预定义环化类型或连接位点的先前方法不同,APCyc直接从靶点结合口袋上下文中学习选择两者。 - •性质知情的可控生成:APCyc利用贝叶斯后验引导,在亲和力、渗透性、蛋白酶抗性、溶解度和免疫原性之间引导环肽生成,实现了最佳的渗透性代理分数(0.1070.107)和蛋白酶抗性分数(−1.474\-1.474)。 - •端到端的环肽设计:APCyc统一了环化选择、全原子生成和性质知情引导。在各种引导设置下,APCyc实现了领先的结构质量,包括最佳的Rosetta总分数(−758.545\-758.545)和一致性(0.9710.971),同时保持了较强的结合亲和力。 参见图注图1。APCyc概念。(A)受体口袋为靶点条件环肽生成提供结构上下文。(B)APCyc通过预测环化位点和连接类型,将环化显式建模为一个离散决策过程。环化建模矩阵编码成对位点概率,同时将化学上不同的连接模式(包括酰胺键、二硫键和异肽键)整合到生成过程中。多目标性质引导进一步将采样导向期望的治疗特征,如膜渗透性、蛋白酶抗性和低免疫原性。(C)APCyc在不同的设计性质目标下生成多样的候选环肽。预告图展示受体口袋上下文、APCyc环化和性质引导机制,以及优化了亲和力、膜渗透性和多性质平衡的候选环肽。 ## 2.相关工作 ### 2.1.靶点感知的环肽设计 传统的环肽发现主要依赖于实验筛选方法,如噬菌体展示技术\(Heinis et al\.,2009 (https://arxiv.org/html/2606.12991#bib.bib20)\),以及基于药物化学启发式方法的理性大环化\(Driggers et al\.,2008 (https://arxiv.org/html/2606.12991#bib.bib15); Zorzi et al\.,2017 (https://arxiv.org/html/2606.12991#bib.bib59); Deyle et al\.,2017 (https://arxiv.org/html/2606.12991#bib.bib13)\)。然而,这些方法劳动强度大,且联合探索序列、结构和环化拓扑空间的能力有限\(Newman and Cragg,2016 (https://arxiv.org/html/2606.12991#bib.bib38)\)。随着深度学习的兴起以及AlphaFold2\(Jumper et al\.,2021 (https://arxiv.org/html/2606.12991#bib.bib24)\)等蛋白质结构预测模型的进步,环肽设计的计算方法开始出现。AfCycDesign\(Rettie et al\.,2025a (https://arxiv.org/html/2606.12991#bib.bib44)\)通过修改位置编码来编码N到C末端环化,将AlphaFold2适应于环肽,实现了环肽的结构预测、序列重设计和从头幻觉生成。同时,基于等变架构\(Satorras et al\.,2021 (https://arxiv.org/html/2606.12991#bib.bib46)\)的扩散生成模型改进了环肽生成的几何建模。RFpeptides\(Rettie et al\.,2025b (https://arxiv.org/html/2606.12991#bib.bib45)\)进一步通过去噪扩散流水线将深度生成设计扩展到蛋白质结合大环。DiffPepBuilder\(Wang et al\.,2024 (https://arxiv.org/html/2606.12991#bib.bib55)\)应用SE(3)-等变扩散,环化通过事后二硫键处理完成。此外,CPSDE\(Zhou et al\.,2025 (https://arxiv.org/html/2606.12991#bib.bib58)\)利用基于化学图的谐波SDE进行原子-键建模,而CP-Composer\(Jiang et al\.,2025 (https://arxiv.org/html/2606.12991#bib.bib23)\)通过几何约束组合进行环肽设计。这些方法虽然有效,但主要在线性肽上训练,并且通常要求环化约束先验固定。相比之下,APCyc将环化拓扑视为一个条件于靶点的设计变量,从而能够从受体口袋上下文中推断出环化类型和连接位点。 ### 2.2.梯度引导的贝叶斯扩散 扩散模型通过修改逆向去噪过程中的引导信号来支持可控生成。早期工作引入了分类器引导\(Dhariwal and Nichol,2021 (https://arxiv.org/html/2606.12991#bib.bib14)\),它利用单独训练的分类器(预测所需条件或属性)的梯度来引导采样。Ho and Salimans \(2022 (https://arxiv.org/html/2606.12991#bib.bib21)\)提出了无分类器引导,通过结合条件和无条件分数估计实现条件生成,无需显式分类器。除了分类条件外,引导已被扩展到基于能量的形式,其中在贝叶斯后验解释下,代理模型梯度引导采样朝向期望目标\(Bao et al\.,2022 (https://arxiv.org/html/2606.12991#bib.bib6); Chung et al\.,2022 (https://arxiv.org/html/2606.12991#bib.bib11)\)。进一步的扩展探索了多约束引导,其中多个目标或约束通过分数组合结合。例如,Bansal et al\.\(2023 (https://arxiv.org/html/2606.12991#bib.bib5)\)提出了通用引导,使用任意引导函数或现成的辅助网络控制扩散采样,而MolJO\(Qiu et al\.,2024 (https://arxiv.org/html/2606.12991#bib.bib42)\)将基于梯度的引导应用于联合结构基分子优化。我们的工作利用基于回归器的梯度引导,将来自多个理化性质代理的梯度作为后验引导项组合,用于药物相关性质的联合优化。 参见图注图2.APCyc用于口袋条件

相似文章

物理约束MCMC与化学信息高斯过程协同用于反应网络发现

arXiv cs.LG

本文提出了PC-MCMC-CIGP,这是一种灰盒工作流,结合了spike-and-slab拓扑采样、物理约束和化学信息高斯过程用于反应网络发现。该方法在苯乙烯环氧化反应中提高了产率,并在氢-溴基准测试中区分了基本反应路径与欺骗性拟合。

Design-CP:蛋白质纳米颗粒设计的上下文并行技术

arXiv cs.LG

Design-CP 为 RFdiffusion 3 引入了上下文并行推理策略,通过将二次激活分布到多个 GPU 上,实现了大型多聚体蛋白质纳米颗粒的全原子设计,从而在较小的 GPU 集群上使大规模组装蛋白质设计变得可行。