FAR-DPO: 面向环肽设计的可行性感知与稳健直接偏好优化

arXiv cs.LG 论文

摘要

FAR-DPO 是一个可行性感知且稳健的直接偏好优化框架,通过使生成模型与结构和生物物理约束对齐,增强药物发现中的环肽设计,提高 PepGLAD 和 PepFlow 等基准测试的成功率。

arXiv:2608.19808v1 公告类型:新 摘要:环肽因其高结合亲和力和结构稳定性,正在成为药物发现中有前景的分子支架。然而,将生成模型从线性肽扩展到环肽设计仍然具有挑战性,因为环化通过耦合的几何和生物物理约束急剧限制了可行的设计空间。此外,有限的训练数据导致现有方法主要依赖零样本生成或事后过滤,导致可行设计产量低且对多目标权衡控制有限。为了解决这些局限性,我们提出了 FAR-DPO(可行性感知与稳健直接偏好优化),一个与架构无关的框架,引导生成模型朝向结构和生物物理上可行的环肽设计,特别是针对具有挑战性的靶标。FAR-DPO 集成了可行性感知的偏好构建与难度感知的组稳健优化。具体而言,它通过可行性门控的多目标支配构建靶标内偏好对,并根据当前的偏好损失自适应地重新加权预定义的难度组。在 CPSea LNR 基准测试中,在固定的生成预算下,FAR-DPO 将 PepGLAD 的整体成功率从 46.89% 提高到 57.79%,将 PepFlow 从 47.96% 提高到 49.57%。这些收益也扩展到最难靶标的四分位数,并伴有更优的每个靶标最佳结合分数。总之,这些结果证明了 FAR-DPO 在提高可行性和靶标级稳健性方面的有效性。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:29

# FAR-DPO:面向环肽设计的可行性感知与鲁棒直接偏好优化
来源:https://arxiv.org/html/2608.19808
Rong Han11脚注标记:1 Xiaoyu Wang Zhiyun Li Zongbo Han Xiaohong Liu 通讯作者:Guangyu Wang22脚注标记:2

###### 摘要

环肽因其高结合亲和力和结构稳定性,正成为药物发现中前景广阔的分子支架。然而,将生成模型从线性肽扩展到环肽设计仍具挑战性,因为环化通过耦合的几何与生物物理约束急剧限制了可行设计空间。此外,有限的训练数据导致现有方法主要依赖零样本生成或事后筛选,可行设计产量低且对多目标权衡控制有限。为解决这些局限,我们提出FAR-DPO(可行性感知与鲁棒直接偏好优化),这是一个与架构无关的框架,旨在引导生成模型产生结构和生物物理上可行的环肽设计,尤其针对具有挑战性的靶点。FAR-DPO集成了可行性感知偏好构建与难度感知分组鲁棒优化。具体而言,它通过可行性门控的多目标支配关系构建靶点内偏好对,并根据当前偏好损失自适应地重新加权预定义的难度组。在CPSea LNR基准测试中,在固定生成预算下,FAR-DPO将PepGLAD的整体成功率从46.89%提升至57.79%,PepFlow从47.96%提升至49.57%。这些提升同样适用于最难的靶点四分位数,并伴随着更优的每个靶点最佳结合分数。这些结果共同证明了FAR-DPO在提升可行性和靶点级鲁棒性方面的有效性。

## 1引言

环肽作为潜在治疗剂正引起显著关注,特别是由于其调节传统药物难以靶向的蛋白质-蛋白质相互作用的独特能力(Dougherty、Sahni和Pei 2019 (https://arxiv.org/html/2608.19808#bib.bib5);Villar等人 2014 (https://arxiv.org/html/2608.19808#bib.bib28))。通过末端或侧链共价连接将肽骨架约束为闭环架构,环化显著限制了构象灵活性。这种刚性化结构稳定了生物活性构象,提高了靶点结合亲和力,并显著增强了对蛋白水解降解的抵抗能力(Zorzi、Deyle和Heinis 2017 (https://arxiv.org/html/2608.19808#bib.bib38))。

最近的基于扩散和流的生成模型可以根据靶点结构直接协同设计肽序列和三维结构(Kong等人 2024 (https://arxiv.org/html/2608.19808#bib.bib12);Li等人 2024 (https://arxiv.org/html/2608.19808#bib.bib13)),为靶点特异性环肽设计开辟了新途径。然而,这些模型学习到的生成分布并未明确与环肽耦合的结构和生物物理要求对齐。一个实际可行的设计必须结合有利的结合、有效的闭环几何、正确的立体化学、有利的相互作用能以及合理的空间构型(Bhardwaj等人 2016 (https://arxiv.org/html/2608.19808#bib.bib2);Hosseinzadeh等人 2017 (https://arxiv.org/html/2608.19808#bib.bib8);Yang等人 2025 (https://arxiv.org/html/2608.19808#bib.bib32))。因此,在单一结合指标上表现良好的候选物在其他关键维度上可能仍然无效或不理想。核心挑战不仅仅是通过大量采样恢复少数高分候选物,而是在固定生成预算下,将生成分布转向在多个质量维度上联合可行且有利的设计。现有方法通过特定架构建模和多阶段计算筛选来改进环肽设计(Rettie等人 2025a (https://arxiv.org/html/2608.19808#bib.bib21);Rettie等人 2025b (https://arxiv.org/html/2608.19808#bib.bib22)),而近期的训练时对齐方法主要针对特定的几何约束,如环闭合(Zhang等人 2026a (https://arxiv.org/html/2608.19808#bib.bib33))。尽管取得了这些进展,但一种能够使靶点条件生成器与多个结构和生物物理目标对齐,同时在异构靶点间保持鲁棒性能的通用方法仍有待探索。

为缓解这一瓶颈,近期研究主要遵循两种不同的范式。一种研究路线通过专用架构或几何条件将环化要求融入生成过程(Rettie等人 2025a (https://arxiv.org/html/2608.19808#bib.bib21);Rettie等人 2025b (https://arxiv.org/html/2608.19808#bib.bib22);Jiang等人 2025 (https://arxiv.org/html/2608.19808#bib.bib10))。另一种研究路线使用推理时引导、属性优化或事后筛选来提高候选物质量(Tang、Zhang和Chatterjee 2025 (https://arxiv.org/html/2608.19808#bib.bib26);Wang等人 2025 (https://arxiv.org/html/2608.19808#bib.bib31);Zhang等人 2026a (https://arxiv.org/html/2608.19808#bib.bib33))。尽管这些方法推动了环肽生成,但它们往往依赖于特定的生成架构或环化机制,主要优化单个属性或特定结构约束。当环化可行性、结构质量和靶点结合都必须满足时,任何单一指标的提升并不一定转化为联合可行候选物产量的提高(Jin、Barzilay和Jaakkola 2020 (https://arxiv.org/html/2608.19808#bib.bib11);Ren、He和Zhang 2025 (https://arxiv.org/html/2608.19808#bib.bib20))。此外,不同靶点的设计难度差异很大,因此更好的总体性能并不能保证在所有靶点上获得一致提升(Duchi和Namkoong 2021 (https://arxiv.org/html/2608.19808#bib.bib6);Sagawa等人 2020 (https://arxiv.org/html/2608.19808#bib.bib24))。训练时对齐方法,包括基于奖励的微调和直接偏好优化,提供了一种互补的方式来重塑生成分布(Olivecrona等人 2017 (https://arxiv.org/html/2608.19808#bib.bib18);Rafailov等人 2023 (https://arxiv.org/html/2608.19808#bib.bib19);Wallace等人 2024 (https://arxiv.org/html/2608.19808#bib.bib29))。然而,对于在不依赖特定生成架构的情况下,使模型与多个可行性要求对齐并在异构靶点间保持鲁棒性能的系统解决方案仍然缺乏。

为此,我们提出FAR-DPO,一种可行性感知与鲁棒直接偏好优化算法。通过训练时偏好对齐,FAR-DPO将模型的生成分布转向结合结构可行性与更好结合亲和力的环肽。我们的主要贡献如下:

- •针对环肽的可行性感知偏好数据构建策略。从相同的包含12,000个CPCore口袋的平衡集中,冻结的CPSea训练的PepGLAD和PepFlow基础模型分别为每个口袋生成16个候选物,每个骨架共生成192,000个候选物。通过结构可行性筛选和口袋内多目标比较,我们分别为PepGLAD和PepFlow构建了90,408和92,099个偏好对(附录A)。
- •难度感知的鲁棒偏好优化。对于每个骨架,我们进一步根据其冻结参考模型自身的生成来估计口袋难度,并为相应的偏好对分配固定的难度组标签。随后,我们在直接偏好优化中引入分组鲁棒目标。该目标根据各难度组当前的偏好损失动态调整优化权重,对高损失组给予更大关注,以降低总体目标掩盖靶点间性能差异的风险。
- •跨生成骨架的普适性。我们在两种环肽设计骨架PepGLAD和PepFlow上评估了FAR-DPO。在固定生成预算下,FAR-DPO在两种方法上均提高了可行候选物产量,同时改善了结合质量,证明了其适用于不同的生成架构。

## 2相关工作

### 2.1环肽生成

在深度生成模型之前,基于物理的采样和设计就能实现稳定的约束肽(Bhardwaj等人 2016 (https://arxiv.org/html/2608.19808#bib.bib2);Hosseinzadeh等人 2017 (https://arxiv.org/html/2608.19808#bib.bib8))。最近,PepGLAD(Kong等人 2024 (https://arxiv.org/html/2608.19808#bib.bib12))、PepFlow(Li等人 2024 (https://arxiv.org/html/2608.19808#bib.bib13))和PPFlow(Lin等人 2024 (https://arxiv.org/html/2608.19808#bib.bib16))使用几何扩散或流匹配生成了靶点条件的线性肽序列和结构。AfCycDesign(Rettie等人 2025a (https://arxiv.org/html/2608.19808#bib.bib21))则调整了位置编码,而RFpeptides(Rettie等人 2025b (https://arxiv.org/html/2608.19808#bib.bib22))和CPSDE(Zhou等人 2025 (https://arxiv.org/html/2608.19808#bib.bib36))生成了全原子大环。DiffPepBuilder(Wang等人 2024 (https://arxiv.org/html/2608.19808#bib.bib30))在生成后添加二硫键,CP-Composer(Jiang等人 2025 (https://arxiv.org/html/2608.19808#bib.bib10))组合几何约束,APCyc(Zhao、Qin和Chen 2026 (https://arxiv.org/html/2608.19808#bib.bib35))选择环化类型和位点。CYC_BUILDER(Wang等人 2025 (https://arxiv.org/html/2608.19808#bib.bib31))使用搜索和强化学习进行片段组装,而GeoCycler(Zhang等人 2026a (https://arxiv.org/html/2608.19808#bib.bib33))使用基于奖励的微调来处理闭环约束。FAR-DPO同样保持生成器不变,但使用基于偏好的后训练来增加同时满足结构和生物物理要求的候选物数量。

### 2.2生成模型的偏好对齐

基于似然的训练不能保证特定的设计目标,这促使了强化学习、多目标搜索和引导生成(Olivecrona等人 2017 (https://arxiv.org/html/2608.19808#bib.bib18);Jin、Barzilay和Jaakkola 2020 (https://arxiv.org/html/2608.19808#bib.bib11);Tang、Zhang和Chatterjee 2025 (https://arxiv.org/html/2608.19808#bib.bib26))。这些方法通常需要显式奖励、属性预测器或在线采样。相反,直接偏好优化(DPO)从相对比较中学习,无需单独的奖励模型(Rafailov等人 2023 (https://arxiv.org/html/2608.19808#bib.bib19))。Diffusion-DPO和Linear-DPO将此原则扩展到扩散和流匹配生成器(Wallace等人 2024 (https://arxiv.org/html/2608.19808#bib.bib29);Li等人 2026 (https://arxiv.org/html/2608.19808#bib.bib14))。偏好对齐也已应用于抗体(Zhou等人 2024 (https://arxiv.org/html/2608.19808#bib.bib37);Ren、He和Zhang 2025 (https://arxiv.org/html/2608.19808#bib.bib20))、基于结构的药物设计(Cheng等人 2025 (https://arxiv.org/html/2608.19808#bib.bib3);Huang和Zhang 2025 (https://arxiv.org/html/2608.19808#bib.bib9))和肽(Tang、Zhang和Chatterjee 2025 (https://arxiv.org/html/2608.19808#bib.bib26);Zhang等人 2026b (https://arxiv.org/html/2608.19808#bib.bib34))。大多数此类方法针对特定的表示、模型家族或属性。FAR-DPO则结合了每个口袋内的可行性门控多目标偏好对,并采用难度感知目标进行跨靶点优化。

### 2.3分组鲁棒优化

平均损失训练可能掩盖困难组的持续误差。DRO在对抗性分布下优化风险(Duchi和Namkoong 2021 (https://arxiv.org/html/2608.19808#bib.bib6));Group DRO动态强调高损失的预定义组(Sagawa等人 2020 (https://arxiv.org/html/2608.19808#bib.bib24)),而TERM使用指数倾斜来平衡平均和尾部性能(Li等人 2021 (https://arxiv.org/html/2608.19808#bib.bib15))。这些方法主要在监督学习中研究。相比之下,FAR-DPO根据口袋难度定义组,并在基于偏好的靶点条件生成后训练中应用分组鲁棒加权。

## 3方法

参见图注图1:FAR-DPO概述。(A)可行性门过滤生成候选物以形成离线可行池。在每个口袋内,使用容差感知支配关系构建偏好对,冻结的口袋难度组提供其组标签。(B)FAR-DPO使用分组平衡采样、参考相对对评分(带优选候选物锚定)和损失自适应组重加权在这些偏好对上进行训练。(C)在相同口袋、采样预算和可行性标准下,对齐后的策略在不同靶点难度组中增加了联合可行产量。### 3.1问题建模与方法概述

给定一个蛋白质结合口袋P,一个预训练的口袋条件参考生成器πref(x∣P)\\pi_{\\mathrm{ref}}(x\\mid P)生成环肽候选物x,每个候选物包含一个肽序列及其全原子结构。在不修改底层生成架构的情况下,FAR-DPO使用离线偏好对对模型进行后训练,以获得一个策略πθ(x∣P)\\pi_{\\theta}(x\\mid P),该策略相对于冻结的参考模型更倾向于优选候选物而非非优选候选物。

如图1 (https://arxiv.org/html/2608.19808#S3.F1)所示,FAR-DPO包含三个阶段。首先,我们对参考生成器为每个口袋生成的离线候选物应用资格筛选,并在该口袋内构建多目标偏好对。其次,我们根据参考模型的生成性能定义口袋难度,并为每个偏好对分配固定的难度组标签。第三,我们用冻结的πref\\pi_{\\mathrm{ref}}约束策略更新,并根据每个难度组当前的偏好损失动态调整训练权重。由此产生的偏好数据集为Dpref={(Pi,xi+,xi−,gi)}i=1N\\mathcal{D}_{\\mathrm{ref}}=\\{(P_i, x_i^{+}, x_i^{-}, g_i)\\}_{i=1}^N,其中xi+x_i^{+}和xi−x_i^{-}分别表示优选和非优选候选物,gi是它们所在口袋的难度组。

### 3.2可行性感知偏好构建

#### 离线候选物与可行性门控

为了构建基于偏好的后训练离线数据,我们从冻结的参考模型πref\\pi_{\\mathrm{ref}}中独立采样K个候选物,并记所得集合为CP\\mathcal{C}_P。候选物池涵盖12,000个口袋,K=16,包含192,000个候选物复合物。关于口袋来源、生成设置和数据处理流程的详细信息见附录A。

在定义候选物之间的偏好之前,我们应用三个资格门,涵盖环化几何、残基手性和相互作用能。通过所有三个

相似文章

GroupDPO:内存高效的分组直接偏好优化

arXiv cs.CL

GroupDPO 引入了一种内存高效的分组直接偏好优化算法,该算法利用每个提示的多个候选响应,通过解耦反向传播来减少峰值内存使用。该方法在离线和在线对齐设置中均展现出相比标准 DPO 的持续改进。

DOG-DPO:面向安全对齐的几何动态优化

arXiv cs.LG

DOG-DPO 是一种无需训练的数据选择框架,它将偏好对视为结构化几何信号,将多数据集偏好几何分解为锚定子空间和残差子空间,以选择多样化的子集用于安全对齐。该框架在六个安全基准测试中仅使用 11% 的偏好对就实现了强大的效用-鲁棒性权衡。

xi-DPO:通过比率奖励边际的直接偏好优化

arXiv cs.LG

本文介绍了 xi-DPO,这是一种新颖的偏好优化方法,通过将目标重构为最小化与最优比率奖励边际的距离,解决了 SimPO 中的超参数调整难题。实验结果表明,xi-DPO 在开放基准测试中优于现有方法。