AbICL:面向抗原特异性抗体亲和力排序的上下文学习
摘要
AbICL提出了一种面向抗原特异性抗体亲和力排序的上下文学习框架,将预训练的结构编码器与上下文排序头相结合,利用带标签的演示进行测试时自适应,无需梯度更新。
arXiv:2607.05846v1 公告类型:新
摘要:根据结合亲和力对抗体候选物进行准确排序对于治疗性抗体发现至关重要。然而,现有方法将亲和力比较视为独立事件,忽视了其他标记比较中编码的上下文信息,限制了其捕获抗原特异性结合景观的能力。对于许多靶抗原,通常只有少量经过实验表征的亲和力比较可用。一个重要的问题是,模型能否利用这些已有的比较来推断抗原特异的排序模式,从而促进后续的亲和力排序。这种从标记演示中学习的形式与上下文学习(In-Context Learning)范式非常相似,这促使我们从ICL的角度重新审视抗体亲和力排序。为此,我们提出了AbICL,一个面向抗原特异性抗体亲和力排序的ICL框架。AbICL结合了预训练的结构编码器和上下文排序头,并通过情景元训练策略进行训练,使模型能够在不需要梯度更新的情况下利用支持演示进行测试时自适应。在AbRank基准上的实验表明,AbICL在几乎所有数据分割和评估基准上均持续优于现有的排序基线。进一步分析显示,上下文演示的价值取决于它们与目标推理任务的匹配程度,并且在分布偏移和细粒度亲和力判别下变得更加显著。这些发现突显了ICL作为抗原特异性抗体亲和力排序有效范式的潜力,特别是在单一全局排序函数不足的挑战性场景中。
查看缓存全文
缓存时间: 2026/07/08 04:45
# 用于抗原特异性抗体亲和力排名的上下文学习 †通讯作者 来源:https://arxiv.org/html/2607.05846 胡婧†王俊哲黄悦阳杨欣怡王兆阳朱峰 ###### 摘要 根据结合亲和力对抗体候选进行准确排名对于治疗性抗体发现至关重要。然而,现有方法独立处理亲和力比较,忽略了其他已标记比较中编码的上下文信息,限制了其捕捉抗原特异性结合景观的能力。对于许多目标抗原,通常只有少量通过实验表征的亲和力比较可用。一个重要的问题是,模型能否利用这些已有的比较来推断抗原特异性的排名模式,从而促进后续的亲和力排名。这种从标记演示中学习的形式与上下文学习(ICL)的范式非常相似,这促使我们从ICL的角度重新审视抗体亲和力排名。为此,我们提出了AbICL,一个用于抗原特异性抗体亲和力排名的ICL框架。AbICL将预训练的结构编码器与上下文排名头相结合,并通过情节式元训练策略进行训练,使模型能够在无需梯度更新的情况下,利用支撑演示来进行测试时的自适应。在AbRank基准上的实验表明,AbICL在几乎所有数据划分和评估基准上均持续优于现有的排名基线。进一步分析表明,上下文演示的价值取决于它们与目标推理任务的匹配程度,并且在分布偏移和细粒度亲和力判别下变得更加显著。这些发现强调了ICL作为抗原特异性抗体亲和力排名的有效范式的潜力,特别是在单个全局排名函数不足的挑战性场景中。 ## I. 引言 预测抗体-抗原结合亲和力是治疗性抗体发现的核心,但直接进行亲和力预测仍然具有挑战性,因为亲和力测量通常带有噪声、依赖测定方法,并且经常被删截。因此,根据相对结合强度而非绝对亲和力值对候选抗体进行排序的亲和力排名,已成为一种稳健的替代方案。 现有的抗体亲和力预测方法大致可分为三类:亲和力回归方法 (Wang等人, 2026; Ullanat等人, 2026; Li等人, 2025; Wang等人, 2026; Yuan等人, 2023; Bandara等人, 2025; Hummer等人, 2025; Subedy等人, 2026; Chen等人, 2025; Cai等人, 2024),基于排名的方法 (Liu等人, 2025b; Xu等人, 2026a),以及基于预训练基础模型的间接亲和力评分方法 (Lin等人, 2023; Rives等人, 2021; Candido等人, 2026; Abramson等人, 2024; Krishna等人, 2024; Wohlwend等人, 2025; Passaro等人, 2025; team等人, 2024; Team等人, 2025b, a; Xu等人, 2026b; Ruffolo等人, 2023)。亲和力回归方法直接预测实验结合亲和力,但经常受到噪声和异质测量的影响。基于排名的方法则学习相对结合偏好,提供了更稳健的目标,但通常依赖于上下文无关的排名函数,将每个比较视为孤立的预测问题。间接亲和力评分方法使用序列似然度、结构置信度或预训练蛋白质表示来估计结合质量,而不是明确建模抗体-抗原亲和力。尽管存在差异,这些方法都依赖于在训练期间学到的固定评分函数或表示,限制了它们适应未见抗原和分布偏移的能力。 然而,抗体亲和力排名本质上是抗原特异性的,因为抗体候选之间的相对偏好是由目标抗原的结合景观决定的,而不是一个通用的排名函数。这引出一个自然的问题:与其仅依赖于训练期间学到的固定排名函数,能否利用现有的抗原特异性证据来改进预测?此类证据的一个可能来源是先前表征过的亲和力比较,它们可能为推断抗原特异性排名模式提供有用信息,并促进后续的排名决策。这种基于标记示例进行预测的条件化方式非常类似于ICL范式,即模型根据上下文演示调整其预测,而无需更新模型参数。受此联系的启发,我们从ICL的角度重新审视抗体亲和力排名。 为此,我们提出了AbICL,一个用于抗原特异性抗体亲和力排名的ICL框架。AbICL将预训练的结构编码器与一个上下文排名头相结合,该排名头共同对支撑演示和查询对进行推理。该模型通过情节式元训练进行训练,以模拟推理时遇到的支撑-查询场景,从而仅通过上下文演示实现测试时的自适应,无需梯度更新。 在AbRank基准上的大量实验表明,AbICL在所有数据划分和评估基准上均持续优于现有的排名和回归基线。进一步分析表明,上下文演示的好处随着分布偏移和细粒度亲和力判别而变得更加显著,并且在演示与目标推理任务高度匹配时达到最大。 我们的贡献总结如下: - • 我们引入了首个用于抗原特异性抗体亲和力排名的ICL框架,通过标记的亲和力比较实现了测试时的自适应。 - • 我们提出了一个上下文相关的排名框架,该框架将预训练的结构编码器与通过情节式元训练训练的上下文排名头相结合,使模型能够有效利用上下文演示进行抗原特异性的亲和力排名。 - • 我们在AbRank基准上取得了最先进的性能,并进行了全面分析,表明AbICL的性能提升源于有效的上下文自适应,而非模型容量的增加。我们的结果进一步揭示,在分布偏移和细粒度亲和力判别场景下,上下文演示的价值越来越大。 ## II. 相关工作 ### II-A. 抗体亲和力预测 ##### II-A0a. 亲和力回归方法 亲和力回归方法将抗体-抗原亲和力建模视为一个回归问题,旨在直接预测绝对结合亲和力或突变引起的亲和力变化。基于序列的方法从抗体和抗原序列中学习回归模型来预测结合亲和力 (Wang等人, 2026; Ullanat等人, 2026; Li等人, 2025; Wang等人, 2026; Yuan等人, 2023) 或突变引起的亲和力变化 (Jin等人, 2024; Liu等人, 2025a)。作为基于序列方法的补充,基于结构的方法利用实验确定或计算预测的复合物结构来显式建模分子间相互作用以进行亲和力预测 (Bandara等人, 2025; Hummer等人, 2025; Subedy等人, 2026; Chen等人, 2025; Cai等人, 2024)。尽管这些方法已取得有希望的性能,但它们依赖于连续亲和力值或亲和力变化的监督回归,而这些值通常带有噪声、依赖测定方法,并且难以跨实验条件进行比较。 ##### II-A0b. 基于排名的方法 受亲和力回归局限性的启发,基于排名的方法最近作为一种替代范式出现,通过直接优化抗体候选的相对顺序而非绝对亲和力值来进行抗体-抗原亲和力预测。现有方法大致可分为成对排名和列表排名方法。成对方法学习抗体-抗原复合物对之间的相对偏好,并优化成对排名目标以确定哪个候选表现出更强的结合亲和力 (Liu等人, 2025b)。相比之下,列表方法联合优化给定抗原的一组抗体候选的顺序,直接对筛选池中多个候选的排名进行建模 (Xu等人, 2026a)。尽管这些方法具有令人鼓舞的性能,但现有的基于排名的方法将每个排名实例视为独立处理,并依赖于训练中学到的固定排名函数,而没有利用来自先前表征的亲和力比较的上下文信息。 ##### II-A0c. 间接亲和力评分方法 蛋白质基础模型的最新进展激发了无需任务特定亲和力训练的抗体-抗原亲和力估计的替代策略。基于序列的方法利用预训练的蛋白质或抗体语言模型,使用似然度或伪似然度对候选序列进行评分,其中序列自然度作为结合亲和力的代理 (Lin等人, 2023; Rives等人, 2021; Candido等人, 2026)。基于结构的方法则通过由基础模型(如AlphaFold3 (Abramson等人, 2024)、RoseTTAFoldAA (Krishna等人, 2024)、Boltz (Wohlwend等人, 2025; Passaro等人, 2025)、Chai (team等人, 2024; Team等人, 2025b)、Protenix (Team等人, 2025a) 或抗体特异性结构预测模型 (Xu等人, 2026b; Ruffolo等人, 2023))预测的抗体-抗原复合物结构来估计亲和力,通常使用结构置信度或界面质量指标作为结合强度的间接指标。尽管这些方法在蛋白质序列建模和结构预测中表现出较强的泛化能力,但它们并未在抗体-抗原亲和力数据上进行显式训练。基于序列的评分常常忽略抗原特异性的结合相互作用,而基于结构的评分依赖于结构置信度或界面质量,由于抗体-抗原相互作用的复杂性和抗体CDR的灵活性,这些可能无法忠实反映结合亲和力。 ### II-B. 情节式元学习 元学习,即学会学习,旨在利用最少的监督信息实现对新颖任务的快速适应。这通常通过在模拟少样本测试时场景的任务集合上进行训练来实现。现有文献主要分为三类。基于度量的方法,如匹配网络 (Vinyals等人, 2016) 和原型网络 (Snell等人, 2017),专注于学习一个共享的嵌入空间,在其中通过距离度量进行分类。基于优化的方法,以MAML (Finn等人, 2017) 和Reptile (Nichol等人, 2018) 为代表,寻求学习一个任务无关的参数初始化,用于快速的梯度适应。此外,基于模型的方法,如SNAIL (Mishra等人, 2017) 和MANN (Santoro等人, 2016),利用内部记忆或注意力机制来快速整合支撑信息。 为了弥合训练和评估之间的差距,情节式训练范式将训练过程组织为一系列情节 (Vinyals等人, 2016)。每个情节通常包含一个用于任务适应的支撑集和一个用于性能评估的查询集 (Snell等人, 2017)。通过在训练期间模拟少样本约束,该范式迫使模型学习任务级别的表示,而不是记忆类别特定的标签,从而增强了对未见任务的泛化能力 (Finn等人, 2017)。 ### II-C. 用于生物预测的上下文学习 上下文学习(ICL)已成为大型语言模型的一项基本能力 (Brown等人, 2020),使模型能够通过条件化于少量标记演示来适应新任务,而无需更新模型参数。在众多解释这种能力的理论观点中,两种有影响力的看法认为,Transformer要么在前向传播期间隐式执行基于梯度的适应 (Von Oswald等人, 2023),要么充当通过学习获得的元优化器,通过上下文演示执行任务特定的适应 (Dai等人, 2023)。除了自然语言处理,最近的研究已将ICL扩展到分子性质预测 (Fifty等人, 2023; Wang等人, 2024) 和蛋白质适应性预测 (Beck等人, 2025),其中通过引入上下文演示来改进预测性能。据我们所知,ICL尚未被探索应用于抗体-抗原亲和力预测,而抗原特异性结合偏好在此提出了独特的挑战,这是现有方法无法充分应对的。
相似文章
基于偏好的抗体表达排序:利用大规模弱监督进行扩展
本文提出了一种基于偏好的学习框架,用于抗体表达排序,将稀缺的定量数据与来自免疫序列的大规模弱正监督相结合。该方法通过引入联合掩码对数似然近似和基于IMGT的比对,将直接偏好优化(DPO)适配到蛋白质语言模型,从而在多样化的内部数据集上实现了改进的排序性能。
LC-ICL:标签引导的对比上下文学习用于鲁棒信息抽取
本文提出LC-ICL,一种新颖的少样本技术,它同时使用正确和错误的示例以及错误原因标签,以提升大型语言模型在信息抽取任务(如命名实体识别和关系抽取)上的性能。
通过功能感知掩码学习任务特定的抗体表示
本文介绍了功能感知掩码,这是一种用于抗体语言模型的预训练算法,它将掩码放置与功能先验对齐,显著提升了结构和CDR相关任务的表现。
AgForce 实现抗原条件生成式抗体设计
本文识别了现有抗体设计方法中的三种失败模式(抗原盲区、词汇崩溃、收敛到边缘分布),并提出 AgForce,一种使用图神经网络和混合密度网络的新型编码器-解码器架构,在 Chimera-Bench 基准测试上实现了最先进的结合质量和序列恢复。
多样本思维链上下文学习:让上下文学习真正学会
本文研究了推理任务的多样本思维链上下文学习,揭示了标准扩展规则并不适用,并提出了Curvilinear Demonstration Selection (CDS)方法以改进示例排序,最高可获得5.42个百分点的性能提升。