基于偏好的抗体表达排序:利用大规模弱监督进行扩展
摘要
本文提出了一种基于偏好的学习框架,用于抗体表达排序,将稀缺的定量数据与来自免疫序列的大规模弱正监督相结合。该方法通过引入联合掩码对数似然近似和基于IMGT的比对,将直接偏好优化(DPO)适配到蛋白质语言模型,从而在多样化的内部数据集上实现了改进的排序性能。
arXiv:2607.16263v1 Announce Type: new
摘要: 抗体表达排序是抗体设计中的关键任务,但其建模受到标记实验数据稀缺的严重阻碍。为了解决这一问题,我们提出了一种统一的基于偏好的学习框架,将稀缺的定量表达数据与来自免疫数据的大规模弱正监督相结合。我们通过引入联合掩码对数似然近似和基于IMGT的比对,将直接偏好优化(DPO)适配到蛋白质语言模型,从而实现对变长序列的高效训练。在包含1254条标记序列和400万条未标记的骆驼科动物来源抗体的多样化内部数据集上进行评估,结果表明我们的方法在大多数指标上持续优于基线。我们的结果表明,偏好学习能够有效地从弱监督中学习,为数据受限条件下的抗体表达优化提供了一种可扩展的解决方案。项目页面:https://kisoji-biotechnology-inc.github.io/Preference-Expression-Ranking/.
查看缓存全文
缓存时间: 2026/07/21 06:48
# 基于大规模弱监督的抗体表达排序:扩展与弱监督学习
## 基于偏好的抗体表达排序:利用大规模弱监督进行扩展
###### 摘要
抗体表达排序是抗体设计中的关键任务,但该任务的建模严重受限于标记实验数据的稀缺性。为解决此问题,我们提出一个统一的基于偏好的学习框架,该框架将稀缺的定量表达数据与来自免疫数据的大规模弱正监督进行整合。我们通过引入联合掩码对数似然近似和基于IMGT的序列对齐,将直接偏好优化(DPO)适配到蛋白质语言模型上,从而实现对可变长度序列的高效训练。我们在包含1254条标记序列和400万条未标记骆驼科抗体的多样化内部数据集上进行评估,结果表明我们的方法在大多数指标上持续优于基线方法。我们的研究结果表明,偏好学习能够有效地从弱监督中学习,为数据受限场景下的抗体可表达性优化提供了一种可扩展的解决方案。项目页面:https://kisoji-biotechnology-inc.github.io/Preference-Expression-Ranking/ 。
AI for science, AI for drug discovery, protein language model.
## 1 引言
抗体表达排序是抗体开发中的关键瓶颈,然而,决定某些序列能实现高产量而其他序列失败的基本生物物理原理仍然知之甚少。这种不可预测性促使人们使用计算模型来指导候选物的选择。在实际的抗体筛选活动中,富集和基于AI的生成通常会常规性地产生成百上千个候选物,因此相关目标并非精确预测单个序列的产量,而是对具有最高可表达性可能性的候选物进行排序优先化。然而,由于标记实验数据极度稀缺,实现这一目标面临挑战;公开基准通常仅包含数百条序列,且抗体的长度和产量分布多样性有限,未能反映真实设计的复杂性(表1 (https://arxiv.org/html/2607.16263#S1.T1))。同时,工业抗体发现工作流程会生成额外的监督来源,而这些来源在现有基准中基本缺失。标准的基于免疫的发现流程通常会从免疫反应中常规性地产生数百万条独特的抗体序列(Hanke等, 2020 (https://arxiv.org/html/2607.16263#bib.bib14); Tsuruta等, 2024 (https://arxiv.org/html/2607.16263#bib.bib6))。尽管这些序列没有关联的定量表达测量值,但内部实验研究的经验证据表明,超过90%的骆驼科来源抗体是可表达的,而来自转基因小鼠或由AI模型生成的抗体的表达率则降至约60%。这提供了一种弱正监督形式,这是一种信息量大但未被充分利用的信号,介于监督学习和无监督学习之间。
在本工作中,我们研究如何将稀缺的定量表达测量与大规模弱正监督相结合用于抗体优化。我们利用Exp-1K,一个包含1254条序列的专有数据集,与现有基准(表1 (https://arxiv.org/html/2607.16263#S1.T1))不同,该数据集既包含可表达也包含不可表达的样本,且长度变异性大。为了补充该数据集,我们利用另一个私有数据集Camel-4M,这是一个从免疫中获得的400万条骆驼科抗体序列的集合,我们将其视为弱正监督的来源。
| 数据集 | N | 产量范围 (mg/L) | 不可表达 | 平均长度 | 长度标准差 | 来源 |
| :--- | :--- | :--- | :--- | :--- | :--- | :--- |
| Garbinski et al. (2023) | 94 | [68.3, 373.3] | × | 122.6 | 2.2 | (Chungyoun等, 2024 (https://arxiv.org/html/2607.16263#bib.bib1)),最初未发表 |
| Jain et al. (2017) | 136 | [6.6, 277.2] | × | 119.5 | 3.2 | (Jain等, 2017 (https://arxiv.org/html/2607.16263#bib.bib2)) |
| Szkodny et al. (2024) | 178 | [1.5, 22.8] | × | 120.0 | 0.0 | (Szkodny and Lee, 2024 (https://arxiv.org/html/2607.16263#bib.bib5)) |
| PROPHET-Ab | 246 | [34.3, 781.9] | × | 149.0 | 0.0 | (Arsiwala等, 2025 (https://arxiv.org/html/2607.16263#bib.bib3)) |
| Exp-1K (Ours) | 1254 | [0.0, 435.5] | ✓ | 123.3 | 12.8 | 内部 |
| Camel-4M (Ours) | 4.2M | - | - | 119.7 | 4.6 | 内部 |
表1:抗体表达基准比较。我们的Exp-1K数据集在规模和覆盖范围上显著超过现有基准,特别包含不可表达序列并表现出更高的序列长度变异性。Camel-4M提供了另一个来源于免疫的大规模弱正监督来源。
核心挑战是设计一个能够自然吸收这些异质监督信号的训练框架。我们通过直接偏好优化(DPO)(Rafailov等, 2023 (https://arxiv.org/html/2607.16263#bib.bib8)) 来应对这一挑战。DPO为抗体表达排序提供了统一的抽象:定量表达产量可以转化为序列之间的相对偏好,而弱正监督则在不需显式标签的情况下,在序列空间上引发隐式偏好。在此公式下,一个单一模型可以联合学习根据相对产量分数对序列进行排序,并区分可表达与不可表达的抗体。我们的框架从一个领域对齐阶段开始,在该阶段,模型在来源于免疫的Camel-4M上使用掩码语言建模进行持续预训练,以适应现有的蛋白质语言模型(pLMs)到特定的蛋白质家族(Alley等, 2019 (https://arxiv.org/html/2607.16263#bib.bib12); Biswas等, 2021 (https://arxiv.org/html/2607.16263#bib.bib13))。这建立了抗体空间的专用表示,为偏好学习提供了稳健的基础。在此初始化基础上,我们向pLMs引入一个修改后的DPO目标。将DPO应用于pLMs并非易事,因为pLMs大多是掩码语言模型,其序列似然度的定义与因果语言模型不同。具体来说,pLMs依赖于伪对数似然度(Salazar等, 2020 (https://arxiv.org/html/2607.16263#bib.bib11); Meier等, 2021 (https://arxiv.org/html/2607.16263#bib.bib9)),这在独立应用于每个序列位置时计算成本高昂。我们通过采用联合掩码对数似然近似(Ferragut等, 2025 (https://arxiv.org/html/2607.16263#bib.bib7))来解决此限制,在该近似中,两条序列之间的不同位置被联合掩码并在一次前向传递中进行评估。为了能够对可变长度序列一致地构建此类偏好对,我们使用ANARCI软件(Dunbar and Deane, 2016 (https://arxiv.org/html/2607.16263#bib.bib39))通过IMGT编号系统(Lefranc等, 2003a (https://arxiv.org/html/2607.16263#bib.bib37), b (https://arxiv.org/html/2607.16263#bib.bib38))对齐抗体序列。这种设计允许在现实的长度变异性下对抗体序列进行高效且可扩展的偏好优化。
在实证方面,我们在Exp-1K数据集上评估我们的框架,证明基于偏好的学习能有效捕捉抗体可表达性。我们的结果表明,在产量排序和二值预测方面,我们的模型持续优于标准的回归和分类基线。具体来说,我们观察到,与仅在标记数据上训练相比,领域对齐的MLM和偏好优化的结合效应带来了显著的性能提升。此外,我们展示了我们的框架随着弱监督数量的增加而有效扩展,证实了它能成功地从大规模、未标记的抗体序列中提取有用的生物物理信号。这些发现表明,基于偏好的优化是数据受限场景下抗体设计的一种实用且稳健的方法。我们总结主要贡献如下:(a) 统一框架:我们开发了一个基于偏好的学习框架,将稀缺的定量产量和大规模弱正监督整合到单个训练目标中。(b) 高效的pLM DPO:我们适配了联合掩码对数似然近似和基于IMGT的对齐,使得能够对可变长度序列进行高效训练。(c) 实证验证:我们证明了我们的方法在使用多个蛋白质语言骨干网络时持续优于基线。(d) 扩展性分析:我们展示了我们的框架随着弱监督数据量的增加而有效扩展,证明了其利用未标记工业数据来缓解标记数据稀缺的能力。
利益冲突披露
作者Josh Qixuan Sun在Kisoji Biotech实习期间进行了此项工作,并获得了Kisoji Biotech的财务支持。本项目还部分得到了Mitacs的支持。作者声明不存在其他可能合理被认为会影响本工作的财务利益冲突。
## 2 相关工作
##### 蛋白质语言模型的偏好学习。
对于通用蛋白质设计,ProteinDPO (Xu等, 2025 (https://arxiv.org/html/2607.16263#bib.bib20)) 整合了来自折叠模拟器(例如AlphaFold)的结构反馈来优化逆向折叠模型,显著提高了CATH基准上的TM分数。ResiDPO (Xue等, 2025 (https://arxiv.org/html/2607.16263#bib.bib21)) 通过引入基于局部置信度分数(pLDDT)的残基级偏好信号进一步改进了这一点,提高了复杂酶设计的成功率。在抗体工程领域,AbDPO (Zhou等, 2024 (https://arxiv.org/html/2607.16263#bib.bib22)) 和 AlignAb (Wen等, 2024 (https://arxiv.org/html/2607.16263#bib.bib23)) 利用基于物理的能量函数将扩散模型对齐到帕累托最优的结合物,平衡结合亲和力与结构稳定性。为了解决KL正则化DPO的保守性问题,SimBinder-IF (Zhao等, 2025 (https://arxiv.org/html/2607.16263#bib.bib24)) 采用了SimPO,一个具有校准边际的无参考目标,在零样本抗体-抗原亲和力预测中达到了最先进的Spearman相关性。在蛋白质之外,该范式已通过RiboPO (Sun等, 2025 (https://arxiv.org/html/2607.16263#bib.bib25)) 扩展到RNA设计,该模型将序列与热力学稳定性和几何保真度对齐。为了解决计算瓶颈,g-DPO (Ferragut等, 2025 (https://arxiv.org/html/2607.16263#bib.bib7)) 实现了一个可扩展的框架,修剪冗余的序列对,在蛋白质适应性和稳定性任务中实现了显著的训练加速。总体而言,这些工作表明基于偏好的微调有效地弥合了进化概率分布与特定生物物理工程目标之间的差距。
##### 蛋白质可开发性预测。
用于可开发性的计算方法已从基于启发式的服务器(如Protein-Sol (Hebditch等, 2017 (https://arxiv.org/html/2607.16263#bib.bib26)))发展到复杂的深度学习架构。几何方法,如GVP-GNN (Kim等, 2023 (https://arxiv.org/html/2607.16263#bib.bib27)) 和 D-GNN (Khade等, 2023 (https://arxiv.org/html/2607.16263#bib.bib28)),利用等变图神经网络来建模残基的3D空间关系和表面斑块,这对于预测热稳定性(TmT\_\{m\})和溶解度至关重要。然而,当前最先进的方法日益由微调pLMs主导。大规模模型如ProtBERT (Brandes等, 2022 (https://arxiv.org/html/2607.16263#bib.bib32)) 利用对数亿条序列进行掩码语言建模,无需显式监督即可捕捉结构和功能约束。近期研究强调了任务特定适配的有效性:ESM-1v (Meier等, 2021 (https://arxiv.org/html/2607.16263#bib.bib9)) 通过对其嵌入进行逻辑回归,展示了在预测抗体非特异性方面的高准确性。NetSolP (Thumuluri等, 2022 (https://arxiv.org/html/2607.16263#bib.bib35)) 使用Transformer架构微调嵌入,以预测蛋白质溶解度和纯化适用性。DeepSTABp (Jung等, 2023 (https://arxiv.org/html/2607.16263#bib.bib33)) 将PLM表示与实验元数据相结合,以回归连续的TmT\_\{m\}值。RP3Net (Tankhilevich等, 2026 (https://arxiv.org/html/2607.16263#bib.bib42)) 从蛋白质语言模型中提取表示,并训练一个线性层来预测给定的抗体序列是否可表达。总体而言,大多数现有的基于pLM的可开发性预测器遵循一种范式,即预训练的pLM被冻结,其最终层嵌入被用作下游回归或分类头的特征。虽然有效,但此策略并未直接修改pLM的序列级似然度。相比之下,如上文所讨论的偏好学习方法,直接使用成对或排序监督来微调生成模型本身,使模型能够将其序列概率与可开发性相关的目标对齐。
## 3 方法
### 3.1 问题设定
我们将抗体表达排序视为一个序列级评分问题。一条抗体序列表示为 y = (s₁, s₂, ..., sₗ),其中每个氨基酸标记 sᵢ 属于标准的20种残基集合。我们重点关注可变长度的VHH抗体序列,不对固定长度做任何假设。给定序列 y,目标是分配一个标量分数来反映其表达行为,使得不可表达序列的排名低于可表达序列,并且在可表达抗体中,具有更高表达产量的序列排名更高。此公式自然地支持基于排名的评估和二值可表达性预测,而无需单独的任务特定模型。
### 3.2 通过伪对数似然度进行序列评分
我们使用伪对数似然度(PLL)(Salazar等, 2020 (https://arxiv.org/html/2607.16263#bib.bib11); Meier等, 2021 (https://arxiv.org/html/2607.16263#bib.bib9)) 从蛋白质语言模型(pLMs)中推导出序列级分数。对于序列 y = (s₁, ..., sₗ),PLL分数定义为:
PLL(y) = (1/L) * Σᵢ log p_θ(sᵢ | y_\{i\})
其中 y_\{i\} 表示在第 i 个位置被掩码后的序列。我们使用平均PLL作为长度归一化的标量分数来对抗体序列进行排序。该评分函数在序列上诱导出一个全序,并且可以直接以零样本方式应用。为了从PLL分数中获得二值可表达性预测,我们采用基于百分位数的阈值方案。具体来说,给定一个训练集,其中可表达序列的比例已知,我们计算所有训练样本的PLL分数,并选择相应的百分位数作为全局决策阈值。然后该阈值一致地应用于验证集和测试集,从而在不引入额外可训练参数的情况下产生一个二值分类器。
### 3.3 基于蛋白质语言模型的偏好优化
虽然伪对数似然度提供了一个有意义的序列级分数,但它并未直接纳入可用的监督。因此,我们采用一个基于偏好的学习框架。相似文章
AbICL:面向抗原特异性抗体亲和力排序的上下文学习
AbICL提出了一种面向抗原特异性抗体亲和力排序的上下文学习框架,将预训练的结构编码器与上下文排序头相结合,利用带标签的演示进行测试时自适应,无需梯度更新。
基于共识的大型语言模型相对偏好评估框架
本文介绍了一种基于共识的评估框架,通过一组模型对匿名输出进行排名,生成相对智能指数(RII),作为跨领域相对质量的代理指标。
分布鲁棒的列表级偏好优化
本文提出一种用于LLM对齐的分布鲁棒列表级偏好优化方法,处理排序标签不确定性,具有可处理的目标函数和强收敛性保证。
通过分类器引导的胚系吸收离散扩散实现抗体序列的条件生成
本文介绍了一种具有新颖“胚系吸收”特性的离散扩散模型,以改善抗体序列的条件生成。该模型解决了蛋白质语言模型中的胚系偏差问题,并在优化抗体结合亲和力和可开发性方面表现出优于现有方法(如 EvoProtGrad)的性能。
通过建模幸存者偏差提升蛋白质功能预测
本文介绍了 Evo-PU,一种正无标签学习框架,通过利用进化突变过程对蛋白质序列数据中的幸存者偏差进行建模。作者证明,在预测流感、RSV 和 SARS-CoV-2 的蛋白质功能方面,Evo-PU 优于标准的正无标签方法和蛋白质语言模型。