针对靶向氨基酸组成的蛋白质序列生成的两阶段微调

arXiv cs.LG 论文

摘要

本文提出了一种两阶段微调流程,结合领域自适应微调和强化学习,生成匹配所需氨基酸组成分布并保持序列质量的蛋白质序列。

arXiv:2606.27939v1 Announce Type: new Abstract: 蛋白质语言模型是生物序列生成的标准先验,但如何引导它们朝向显式的分布设计目标仍未得到充分探索。我们研究了一个受约束的蛋白质生成问题,其中序列必须匹配所需的氨基酸(AA)组成分布,同时保持合理的序列统计特性和多样性。其推动性应用是合成饲料蛋白质设计,其中膳食蛋白质的AA组成直接决定其营养价值。我们提出了一种两阶段流程,首先在域内蛋白质数据集上进行领域自适应微调(FT),然后通过强化学习(RL)进行迭代奖励加权微调,并以FT模型作为冻结参考。我们在两种AA组成上评估该流程,发现FT使平均组成接近目标,而后续的RL强制执行了单独FT无法满足的特定序列约束。我们还针对两个基线和一种消融变体评估了所提出的组成奖励项的设计选择,分离了每个训练阶段的贡献,并验证了在实现AA组成对齐的同时没有降低序列质量。
查看原文
查看缓存全文

缓存时间: 2026/06/29 05:26

# 面向目标氨基酸组成的蛋白质序列生成的两阶段微调方法  
来源:https://arxiv.org/html/2606.27939  
Rubén Muñoz-Tafalla, Anna María Díaz-Rovira, Bertran Miquel-Oliver, Isaac Filella-Merce, Víctor Guallar  

###### 摘要  
蛋白质语言模型是生物序列生成的标准先验,但如何引导它们实现显式的分布设计目标仍鲜有探索。本文研究一个受约束的蛋白质生成问题:生成的序列必须在匹配目标氨基酸(AA)组成分布的同时,保持合理的序列统计特性和多样性。该问题的驱动应用是合成饲料蛋白质设计,其中膳食蛋白质的AA组成直接决定其营养价值。我们提出一个两阶段流水线:首先在域内蛋白质数据集上进行领域自适应微调(FT),然后通过强化学习(RL)进行迭代奖励加权微调,并以FT模型作为冻结参考。我们在两种目标AA组成上评估该流水线,发现FT使平均组成接近目标,而后续RL能强制满足FT单独无法实现的特定序列约束。此外,我们针对所提出的组成奖励项的设计选择,与两个基线及一个消融变体进行了对比评估,孤立了每个训练阶段的贡献,并验证了AA组成对齐并未以牺牲序列质量为代价。  

**关键词:** 蛋白质设计,语言模型,强化学习,组成控制,奖励加权回归  

## 1 引言  
蛋白质语言模型(PLM),如 ProtGPT2(Ferruz 等,2022 (https://arxiv.org/html/2606.27939#bib.bib3))、ProGen2(Nijkamp 等,2023 (https://arxiv.org/html/2606.27939#bib.bib19))和 RITA(Hesslow 等,2022 (https://arxiv.org/html/2606.27939#bib.bib14)),已成为从头序列生成的标准先验。然而,在大多数设计场景中,仅具有合理性是不够的:序列还必须满足明确的外部目标。因此,PLM 可被引导向一系列设计目标,包括特定的家族折叠(Madani 等,2023 (https://arxiv.org/html/2606.27939#bib.bib12))、预测的结构置信度(Stocco 等,2024 (https://arxiv.org/html/2606.27939#bib.bib16);Subramanian 等,2024 (https://arxiv.org/html/2606.27939#bib.bib18))、酶活性(Munsamy 等,2024 (https://arxiv.org/html/2606.27939#bib.bib15);Stocco 等,2024 (https://arxiv.org/html/2606.27939#bib.bib16))、热稳定性和结合适应性(Widatalla 等,2024 (https://arxiv.org/html/2606.27939#bib.bib17))以及抗菌活性(Cao 等,2025 (https://arxiv.org/html/2606.27939#bib.bib1))。这些目标通过多种引导策略实现,包括基于提示的条件化(使用模型训练时识别的条件标签)(Madani 等,2023 (https://arxiv.org/html/2606.27939#bib.bib12);Munsamy 等,2024 (https://arxiv.org/html/2606.27939#bib.bib15))、监督微调(FT)(Madani 等,2023 (https://arxiv.org/html/2606.27939#bib.bib12)),以及更近期的基于强化学习(RL)的奖励引导微调(Cao 等,2025 (https://arxiv.org/html/2606.27939#bib.bib1);Stocco 等,2024 (https://arxiv.org/html/2606.27939#bib.bib16);Subramanian 等,2024 (https://arxiv.org/html/2606.27939#bib.bib18))。这些引导策略将设计目标定义为分类(即预测是否属于预定义类别)或回归(即优化来自实验测量或计算评分的标量)。因此,它们并不直接适用于需要匹配目标分布剖面(如电荷分布、疏水模式或氨基酸组成)的设计目标。  

生成具有受控AA组成的蛋白质,可在生物治疗与免疫学、生物材料以及营养学等领域催生应用。聚焦于营养学应用,本文的设计目标是合成饲料蛋白质设计:候选蛋白质不仅应匹配反映理想营养状况的指定AA组成,还应保持可合成性和多样性(Cambra-López 等,2022 (https://arxiv.org/html/2606.27939#bib.bib10);Ravindran,2013 (https://arxiv.org/html/2606.27939#bib.bib11))。蛋白质源的营养价值很大程度上由其AA组成决定。实践中,膳食蛋白质的AA组成往往不能完全满足生物体的营养需求,从而降低蛋白质消化率和氮保留率(Emmert and Baker,1997 (https://arxiv.org/html/2606.27939#bib.bib20))。因此,理想营养状况指的是一个最大化满足这些膳食需求的目标AA组成。  

为此,我们提出一个两阶段流水线,用于在明确的AA组成目标下进行训练后对齐。从预训练PLM(ProtGPT2)出发,第一阶段对AA组成最接近目标组成的天然蛋白质子集进行领域自适应微调,从而将先验锚定在序列空间中靠近所需区域的点上。第二阶段应用基于RL的迭代奖励加权微调:每次迭代生成候选序列,用我们提出的组成奖励形式进行评分,过滤长度和多样性,并更新策略。我们在两个不同的目标组成上评估该流水线,其中包括一个已发表参考(Cambra-López 等,2022 (https://arxiv.org/html/2606.27939#bib.bib10))和一个域内理想组成。最后,我们报告每个训练阶段的贡献,对我们组成奖励形式的设计选择进行评估,并分析保留的序列质量。  

## 2 相关工作  
本文工作隶属于更广泛的蛋白质序列可控生成研究。近年来,越来越多的工作使用基于RL的奖励引导微调,将预训练PLM引导向超越序列合理性的设计目标。Stocco 等(2024 (https://arxiv.org/html/2606.27939#bib.bib16))引入了 DPO_pLM,将直接偏好优化(Rafailov 等,2023 (https://arxiv.org/html/2606.27939#bib.bib8))应用于自回归PLM,针对诸如ESMFold pLDDT和CLEAN酶分类器等预测器。Widatalla 等(2024 (https://arxiv.org/html/2606.27939#bib.bib17))将DPO应用于ESM-IF1,使用实验热稳定性测量值,将标量稳定性标签(如ΔG或ΔΔG)转换为成对、排序或加权的偏好目标。Cao 等(2025 (https://arxiv.org/html/2606.27939#bib.bib1))使用近端策略优化对ProGen2-XL进行微调,优化目标是一个组合奖励,包含学习到的最小抑制浓度分类器和物理化学描述符,设计了经过实验验证的抗菌肽。Subramanian 等(2024 (https://arxiv.org/html/2606.27939#bib.bib18))在PLM上使用RL,以从ESMFold蒸馏出的结构置信度奖励作为目标。  

这些方法将PLM与外部标量、序数或分类预测器对齐,例如结构置信度分数、酶类预测、热稳定性测量或抗菌活性标签。我们的设置是互补的:奖励直接衡量与目标AA组成的对齐程度,且可从序列本身解析计算,无需外部模型或实验测量。我们的目标最接近奖励加权和优势加权回归(Peters and Schaal,2007 (https://arxiv.org/html/2606.27939#bib.bib7);Peng 等,2019 (https://arxiv.org/html/2606.27939#bib.bib6)),并借鉴了DPO(Rafailov 等,2023 (https://arxiv.org/html/2606.27939#bib.bib8))和PPO的KL信任域思想(使用冻结参考模型)。与DPO构建偏好对不同,我们在每个批次候选池上使用softmax奖励加权,自然地处理连续值奖励,无需显式构建偏好对。损失函数见§3.3 (https://arxiv.org/html/2606.27939#S3.SS3)。  

## 3 方法  

### 3.1 问题形式化  
设p(s)∈S20表示蛋白质序列s的经验AA频率向量,其中S20={x∈R≥120:∑ixi=1}是二十种标准AA的概率单纯形;设q∈S20为目标组成。我们希望调整预训练PLM,使其生成的序列满足p(s)≈q,同时保留序列合理性、有效长度和两两多样性。  

### 3.2 第一阶段:基础模型与领域自适应微调  
在域内数据上进行预训练是领域自适应的标准做法(Gururangan 等,2020 (https://arxiv.org/html/2606.27939#bib.bib4))。我们将其用作组成条件化自适应,将πref锚定在序列空间中既具有生物学合理性、又在组成上与q相似的区域。从UniProtKB/TrEMBL版本(The UniProt Consortium,2023 (https://arxiv.org/html/2606.27939#bib.bib21))(UniProt中未经审核、自动标注的部分;以FASTA格式从UniProt联盟FTP仓库下载,约2.5×10^8条序列)出发,我们应用三个过滤器:(i) 长度过滤器 100-500 个AA(保留约1.8×10^8条序列);(ii) 针对q的余弦相似度过滤器,阈值≥0.95,保留约2.5×10^5条其自身组成与目标组成相似的序列;(iii) 序列同一性过滤器,<70%配对同一性,以去除近似重复序列并避免对过度代表家族的偏倚,最终保留约1.0×10^5条序列。对两个目标组成(qA和qB;§4.1 (https://arxiv.org/html/2606.27939#S4.SS1))应用相同的流水线,得到两个不同的FT数据集。  

得到的FT数据集包含既具有生物学合理性、又在组成上接近q的天然蛋白质,为基础模型提供了训练信号,使其在奖励引导的RL优化之前就偏向目标组成。基础模型为ProtGPT2(Ferruz 等,2022 (https://arxiv.org/html/2606.27939#bib.bib3))。我们在FT数据集上进行因果语言模型的领域自适应微调,并将得到的检查点(FT先验)作为所有后续RL运行的冻结参考策略πref(超参数见附录A (https://arxiv.org/html/2606.27939#A1))。  

### 3.3 第二阶段:奖励加权RL  
给定冻结参考策略πref,我们使用奖励加权的对数比值目标优化可训练策略πθ。对于一批采样序列{si},我们计算标量奖励r(si),在批次内标准化并裁剪得到r̃i,然后转换为权重wi=softmax(r̃i),使得奖励更高的序列对更新贡献更大。目标为:  

L(θ) = −∑i wi η (log πθ(si) − log πref(si)) + λKL KL(πθ ∥ πref).   (1)  

其中η是对数比值缩放因子。这与奖励加权和优势加权回归(Peters and Schaal,2007 (https://arxiv.org/html/2606.27939#bib.bib7);Peng 等,2019 (https://arxiv.org/html/2606.27939#bib.bib6))相关,πref扮演的角色类似于DPO(Rafailov 等,2023 (https://arxiv.org/html/2606.27939#bib.bib8))中的角色。KL散度项KL(πθ ∥ πref)衡量πθ相对于πref的漂移程度。对其进行惩罚起到信任域的作用,防止πθ以牺牲序列合理性为代价利用奖励捷径。  

每次迭代t:(i) 使用随机解码生成候选序列池;(ii) 使用更热的解码(更高温度和top-p;§H (https://arxiv.org/html/2606.27939#A8))生成并行的“多样性脉冲”池;(iii) 用r(s)对两者进行评分;(iv) 按长度、去重复和低于0.85的配对同一性(使用MMseqs2(Steinegger and Söding,2017 (https://arxiv.org/html/2606.27939#bib.bib9)))过滤序列;(v) 将多样性脉冲池的一部分重新注入候选池,重新注入比例随训练增加,以抵消后期迭代的模式崩塌;(vi) 构建奖励加权批次,并在等式(1) (https://arxiv.org/html/2606.27939#S3.E1)下更新πθ。  

奖励由组成项和长度项组成:  
r(s) = wc Comp(s,q) + wl Len(s),   (2)  
所有运行中静态权重 (wc,wl) = (0.97, 0.03)。组成项是主要信号,长度项防止崩塌到极端值,因此采用了非对称权重。这些权重是在少量探索后选定的默认值;未做系统扫描,因此不声称最优。Len(s)是分段线性整形项,在[70,400]个AA范围内非零,在[110,250]处有一个峰值平台(附录B (https://arxiv.org/html/2606.27939#A2))。该训练范围不必与FT数据集的长度过滤器[100,500]个AA一致。长度项和权重在本文分析的所有奖励变体中相同,仅Comp(s,q)不同。  

我们提出一个“差异化”组成项作为主要的Comp(s,q)项,并在同等计算量下将其与一个消融变体和两个基线进行比较,以评估其设计选择的贡献。“差异化”组成项使用非对称的每个残基核(对必需AA(生物体无法合成、必须通过饮食摄入的氨基酸)的缺乏惩罚重于过量)、两个残基池(其成员被视为生化上可互换:硫池(Met/Cys)和芳香前体池(Phe/Tyr))以及一个零目标残基放大器(对目标频率为零的残基进行加权的项)。作为消融,我们评估“差异化”项的一个“对称”变体,其中非对称的每个残基权重被替换为均匀绝对偏差。作为基线,我们还评估了一个余弦相似度项和一个全局偏差L1组成项,两者均缺乏“差异化”组成项的每个残基结构。完整公式和超参数见附录B (https://arxiv.org/html/2606.27939#A2)。  

每个组成项在外部exp(−β[·])内有一个锐度系数β,将每个序列的组成误差映射到有界奖励;β在训练期间逐渐增加,以逐步锐化奖励信号。评估时使用一个固定的参考值βref,应用于“差异化”项,以便所有变体在共同的评分函数上进行比较(每个变体的完整ramp见附录B (https://arxiv.org/html/2606.27939#A2);循环超参数见附录

相似文章

ProtSent:蛋白质句子转换器

arXiv cs.LG

本文介绍了 ProtSent,这是一个用于蛋白质语言模型的对比微调框架,能够提升嵌入质量,从而优化远程同源性检测和结构检索等下游任务。