EpiBench:LLMs 能否理解抗体药物发现中的表位?
摘要
EpiBench 是一个新的闭卷、基于序列的基准,用于评估 LLMs 在五项抗体药物发现任务中对表位的理解程度,结果发现当前模型能捕获部分信号,但在抗体特异性推理方面存在困难。
arXiv:2608.06022v1 公告类型:新
摘要:表位决定了抗体与抗原的结合位置,并影响功能阻断、逃逸耐药性等下游治疗特性,因此表位理解对于抗体药物发现至关重要。尽管大语言模型(LLMs)展现出较强的生物医学推理能力,但尚不清楚它们能否直接从抗原和抗体序列中推断出表位信息。现有表位资源通常聚焦于孤立的预测任务或依赖专门的结构设置,而通用蛋白质基准并不评估抗体开发流程中以表位为中心的决策。为弥补这一空白,我们提出了 EpiBench——一个闭卷、基于序列、可自动评分的基准,用于评估 LLMs 的表位推理能力。EpiBench 包含 1,609 个精选样本,这些样本基于结构层面的抗体-抗原接触、经筛选的功能性 B 细胞检测以及深度突变扫描逃逸测量。它涵盖五个相互关联的任务:可靶向区域发现、抗体条件表位识别、表位分箱、功能性表位评估和抗体逃逸评估,并通过受控采样减少基于捷径的评估伪影。我们评估了九个通用 LLMs,并通过任务特定基线、抗原长度分层、显式推理比较和失败模式检查来分析其行为。结果表明,当前 LLMs 能捕获部分表位相关信号,但在抗体特异性序列锚定、长上下文残基定位以及基于生物学的推理方面仍然有限。因此,EpiBench 为衡量和改进具有序列感知能力的生物医学 LLMs 提供了一个诊断性测试平台,以迈向可靠的 LLM 辅助抗体发现。
查看缓存全文
缓存时间: 2026/08/07 07:52
EpiBench:LLM 能否理解抗体药物发现中的表位? Source: https://arxiv.org/abs/2608.06022 View PDF (https://arxiv.org/pdf/2608.06022) > 摘要:表位决定了抗体与抗原的结合位置,并影响功能阻断和逃逸耐药性等下游治疗特性,因此表位理解是抗体药物发现的核心。尽管大型语言模型(LLMs)已展现出较强的生物医学推理能力,但目前尚不清楚它们能否直接从抗原和抗体序列中推断表位信息。现有的表位资源通常侧重于孤立的预测任务或依赖于专门的结构设置,而通用蛋白质基准测试并未评估抗体开发工作流程中围绕表位的决策。为解决这一空白,我们推出了 EpiBench——一个封闭式、基于序列且可自动评分的基准测试,用于评估 LLM 的表位推理能力。EpiBench 包含 1,609 个精选样本,这些样本基于结构抗体-抗原接触、精选的功能性 B 细胞检测以及深度突变扫描逃逸测量。它涵盖五项相互关联的任务:可靶向区域发现、抗体条件表位识别、表位分箱、功能性表位评估和抗体逃逸评估,并通过受控采样减少基于捷径的评估伪影。我们评估了九个通用 LLM,并通过任务特定基线、抗原长度分层、显式推理比较和失败模式检查来分析其行为。结果表明,当前 LLM 能捕获部分表位相关信号,但在抗体特异性序列锚定、长上下文残基定位和生物学基础推理方面仍然有限。因此,EpiBench 提供了一个诊断性测试平台,用于衡量和改进具备序列感知能力的生物医学 LLM,以推动可靠的 LLM 辅助抗体发现。 ## 提交历史 来自:Jiaqi Wang \[view email (https://arxiv.org/show-email/d9b8b306/2608.06022)\] **\[v1\]** Thu, 6 Aug 2026 13:29:53 UTC \(1,307 KB\)
相似文章
TxBench: 抗体发现 (13分钟阅读)
TxBench 是一个用于抗体发现的基准测试,可能评估该生物技术领域中的计算或AI驱动的方法。
EHRBench:用于大语言模型临床决策的自动化可靠电子健康记录基准
EHRBench是一个自动化且可靠的基准测试,利用真实电子健康记录评估大语言模型在临床决策任务上的表现,涵盖诊断、治疗和预后任务,包含近100万个问答条目。
基于智能体的BAIM-LLM评估(ABLE):LLM使用蛋白质设计工具的基准测试
ABLE是一个基准测试,旨在评估LLM智能体在蛋白质设计工作流程中使用生物AI模型(如ProteinMPNN和AlphaFold3)的能力。该测试评估了15个前沿模型,结果显示Claude Sonnet 4和Gemini 3 Pro得分最高,而部分模型拒绝执行所有任务。
测量LLMs在误导性医疗语境下的认知韧性
介绍了MedMisBench,用于测量LLMs在误导性语境下维持正确医疗推理的能力。结果显示,在对抗性条件下,准确率从71.1%骤降至38.0%,临床专家组指出存在潜在危害。
MolDesignBench:评估基于场景的分子设计的LLM智能体
MolDesignBench是一个新的基准测试,用于评估基于场景的分子设计中的LLM智能体,包含2000个具有隐式和显式约束的实例,揭示了当前前沿的LLMs成功率较低,尤其是在推理隐式约束和检测不可行性方面。