HEDGEHOG:通过严格筛选对药物生成器进行分层评估
摘要
介绍了HEDGEHOG,一个用于评估药物发现中分子生成模型的分层基准,揭示只有0.65%的生成分子通过了所有药物化学和对接筛选。
arXiv:2607.13155v1 公告类型:新
摘要:生成式分子模型可以通过从头提出新的候选化合物来支持早期药物发现。在实践中,有用的候选化合物必须在靶点相关活性、合成可及性、物理化学性质以及其他多参数设计约束之间取得平衡。然而,常用于评估分子生成器的指标仅微弱地反映生成化合物在药物化学上是否合理以及是否适合后续计算。这可能导致模型评估中的假阳性、错误假设以及计算资源的低效利用。我们引入了 HEDGEHOG,这是一个统一的六阶段筛选基准,受工业先导化合物识别流程启发:(i)预处理;(ii)物理化学描述符筛选;(iii)结构警报和图完整性检查;(iv)合成可行性;(v)对接和结合亲和力估计;(vi)三维构象和相互作用检查。我们在标准化协议下评估了来自三个模型类别的 23 个分子生成器。在 230,000 个生成分子中,仅有 0.65% 的初始分子通过了所有阶段。我们的结果揭示了当前分子生成器的一个核心局限性:在孤立标准下看似可接受的分子很少能同时满足药物化学、合成、对接和 3D 构象筛选的要求。
查看缓存全文
缓存时间: 2026/07/16 04:21
# HEDGEHOG:通过严格过滤对药物生成器进行分层评估 来源:https://arxiv.org/html/2607.13155 ###### 摘要 生成式分子模型能够通过高效探索和利用化学空间,从头提出新的候选化合物,从而支持早期药物发现。在实践中,有用的候选分子必须在靶点相关活性、合成可行性、理化性质以及其他多参数设计约束之间取得平衡。然而,常用于评估分子生成器的指标,仅微弱地反映所生成化合物在药物化学上是否合理以及是否适合下游计算。这可能导致模型评估中的假阳性、错误假设以及计算资源的低效使用。我们提出 **HEDGEHOG**,一个统一的六阶段过滤基准,灵感来自工业化的命中化合物识别流程:(i) 预处理;(ii) 理化描述符筛选;(iii) 结构警示与图结构完整性检查;(iv) 合成可行性;(v) 对接与结合亲和力估计;(vi) 三维构象与相互作用检查。我们按照标准化协议,评估了来自三个模型类别的 23 个分子生成器。在生成的 230,000 个分子中,仅有 0.65% 的初始分子能通过所有阶段。我们的结果揭示了当前分子生成器的一个核心局限:在孤立标准下看似可接受的分子,很少能同时满足药物化学、合成、对接和三维构象过滤的要求。 ## 1 引言 生成模型在药物发现的分子设计中广泛应用,通过高效探索和利用化学空间生成大量候选化合物 [Tropsha et al., 2024](https://arxiv.org/html/2607.13155#bib.bib74)。然而,仅能生成化学有效分子对实际药物开发而言并不足够 [Ivanenkov et al., 2023](https://arxiv.org/html/2607.13155#bib.bib33); [Du et al., 2024](https://arxiv.org/html/2607.13155#bib.bib15)。为了成为药物化学有意义的起点,生成的分子必须满足多项与类药性、可开发性和生物学相关性相关的标准 [Atz et al., 2024](https://arxiv.org/html/2607.13155#bib.bib2)。分子生成器的标准评估强调内在指标,如有效性、新颖性、独特性和分布相似性 [Brown et al., 2019](https://arxiv.org/html/2607.13155#bib.bib11)。这些指标有助于评估模型是否产生化学上合理且非平凡的输出;然而,它们本身不足以确立在早期药物发现中的实用价值。对于这些应用,化合物是根据多项药物化学和药物发现标准来优先排序的,这些标准涉及除活性之外的多项指标,包括理化性质 [Veber et al., 2002](https://arxiv.org/html/2607.13155#bib.bib77)、结构缺陷 [Bruns and Watson, 2012](https://arxiv.org/html/2607.13155#bib.bib12)、合成可行性 [Du et al., 2024](https://arxiv.org/html/2607.13155#bib.bib15); [Swanson et al., 2024](https://arxiv.org/html/2607.13155#bib.bib71); [Segler et al., 2018](https://arxiv.org/html/2607.13155#bib.bib68) 和基于结构的筛选流程 [Zhou et al., 2024](https://arxiv.org/html/2607.13155#bib.bib86); [Zhao, 2024](https://arxiv.org/html/2607.13155#bib.bib84)。 这种内在生成质量与实际效用之间的差距,在命中化合物识别中尤为关键。早期发现活动并不基于原始字符串或抽象图分布。相反,它们使用在多种特性之间取得平衡的分子 [Duffy et al., 2012](https://arxiv.org/html/2607.13155#bib.bib16)。后续分析阶段更加耗时和资源密集,并且通常受限于有限的下游计算预算。因此,这些阶段选择性地应用于一组预先筛选的分子,而不是穷举地应用于全部生成集 [Dahlin and Walters, 2014](https://arxiv.org/html/2607.13155#bib.bib13); [Bedart et al., 2024](https://arxiv.org/html/2607.13155#bib.bib6)。属性不合理、含有反应性或不稳定基团、合成可行性差或结合构象不兼容的分子,会消耗资源而无助于提高过程质量。因此,仅使用广泛的分布性或结构指标来评估生成器,可能会显著高估其对药物化学的实用性。 一些任务特定的基准已经整合了对接分数、属性目标或合成可行性代理。然而,这些目标通常被单独评估或以简化的组合方式评估,很少复制实际命中化合物识别流程中施加的顺序淘汰过程。因此,一个模型可能通过优化某种属性、药效团或对接代理而显得成功,但其产生的分子仍会失败于基本的药物化学、逆合成或构象合理性检查。 为了解决这些局限性,我们开发了 **HEDGEHOG**,一个多阶段基准,旨在模拟更接近命中化合物识别实践的计算分类流程来评估生成的分子。该基准应用一个固定的过滤序列,包括预处理、描述符筛选、结构警示、合成可行性、对接与亲和力估计,以及对接后的三维 (3D) 检查。HEDGEHOG 不依赖常见的生成指标,而是衡量模型输出在经过以药物化学为导向的筛选标准后是否仍然合理。这项工作提供了一个统一的协议,可应用于无条件、基于配体和基于蛋白质的模型,从而在相同的下游约束下实现阶段比较。 我们将 HEDGEHOG 实例化于靶向 KRAS G12D 开关-II 口袋的分子,这是一个治疗上重要且结构上具有挑战性的靶点 [Mao et al., 2022](https://arxiv.org/html/2607.13155#bib.bib50); [Vasta et al., 2022](https://arxiv.org/html/2607.13155#bib.bib76)。除了累积生存率,我们还在每个阶段报告条件生存率,以识别当筛选程序变得更加严格时,哪类模型失去了可行性。这种框架使得区分传统内在指标上的优异表现与在更苛刻的计算分类环境中的表现成为可能。 这些结果确立了 HEDGEHOG 作为分子生成器的压力测试,揭示了传统内在指标无法捕捉的失败模式。所提出的基准将分子生成评估重新定义为有用化学空间提案的问题,而非无约束的分子生成。通过识别生成分子在现实分类流程中失败的位置,HEDGEHOG 为开发更符合早期药物发现的分子生成模型提供了更具信息性的基础。 ## 2 相关工作 **分布学习基准。** 现有的分子生成基准套件主要评估二维 (2D) 分子质量以及生成集与参考分布的接近程度。GuacaMol [Brown et al., 2019](https://arxiv.org/html/2607.13155#bib.bib11) 提供了分布学习和目标导向优化的标准化任务,报告有效性、新颖性、唯一性、KL 散度和 Fréchet ChemNet Distance [Preuer et al., 2018](https://arxiv.org/html/2607.13155#bib.bib64) 等指标。它使用基于规则的过滤器(源自 SureChEMBL、Glaxo [Hann et al., 1999](https://arxiv.org/html/2607.13155#bib.bib28)、PAINS [Baell and Holloway, 2010](https://arxiv.org/html/2607.13155#bib.bib3) 和内部规则集)并入化合物质量指标。MOSES [Polykovskiy et al., 2020](https://arxiv.org/html/2607.13155#bib.bib63) 标准化了数据集分割和内在分布指标。它报告了通过药物化学过滤器(如 MCF 和 PAINS)的分子比例,并评估了 SA 分数,尽管该分数是合成可行性的启发式代理。这些基准不包括全面的合成可行性估计、对接和结合构象评估,或依赖 3D 结构的测试。 **基于结构的基准。** 最近的基准更接近实际的基于结构评估。DOCKSTRING [García-Ortegón et al., 2022](https://arxiv.org/html/2607.13155#bib.bib21) 将对接打包成一个可重复的基准,包含大型靶点面板以及虚拟筛选和从头对接分数优化等任务。DOCKSTRING 还报告了一小部分分子描述符,包括 HBD、HBA、可旋转键数和 logP。GenBench3D [Baillif et al., 2024](https://arxiv.org/html/2607.13155#bib.bib5) 在结合口袋内评估 3D 分子生成器,引入了几何感知的 Validity3D 标准以判断构象合理性,并报告来自 Vina [Trott and Olson, 2010](https://arxiv.org/html/2607.13155#bib.bib75)、Glide [Friesner et al., 2004](https://arxiv.org/html/2607.13155#bib.bib19) 和 Gold PLP [Verdonk et al., 2003](https://arxiv.org/html/2607.13155#bib.bib78) 的对接分数。它计算了包括分子量、logP 和环比例在内的少数分子描述符,并使用 SA 分数作为合成性的代理。Durian [Nie et al., 2024](https://arxiv.org/html/2607.13155#bib.bib55) 通过引入带有实验亲和力注释的蛋白质-配体复合物,进一步扩展了基于结构的 3D 评估。它使用了更广泛的理化与几何指标面板,并使用 QuickVina2 [Alhossary et al., 2015](https://arxiv.org/html/2607.13155#bib.bib1)、Surflex [Jain, 2003](https://arxiv.org/html/2607.13155#bib.bib35) 和 GNINA [McNutt et al., 2021](https://arxiv.org/html/2607.13155#bib.bib53) 评估对接亲和力。然而,这些基准并未原生整合合成性估计、结构警示过滤或具有代表性的描述符面板。 **合成感知基准。** 合成感知评估也日益受到关注。SDDBench [Liu et al., 2024](https://arxiv.org/html/2607.13155#bib.bib47) 认为标准的合成可行性分数不足,而是使用基于逆合成的标准以及搜索成功率来评估分子。TARTARUS [Nigam et al., 2023](https://arxiv.org/html/2607.13155#bib.bib56) 引入了基于物理模拟和显式计算预算的实际目标。其药物设计任务结合了对接目标与结构约束及药物化学过滤器,同时还整合了 QED、TPSA 和 SA 分数等指标。这些工作使评估更接近下游实用性,但它们并非为了高效地缩减为可操作的化学空间而设计。 **通用评估框架。** 诸如 MolScore [Thomas et al., 2024](https://arxiv.org/html/2607.13155#bib.bib73) 和 TDC [Huang et al., 2021](https://arxiv.org/html/2607.13155#bib.bib31) 之类的框架提供了组合目标、数据集和评估模块的灵活基础设施。它们对于构建和测试分子设计流程很有价值,并且在某些情况下包含实际管道会使用的许多组件。我们的目标是互补的。我们不提出另一个通用评分框架,而是定义一个高度可配置的基准协议,具有固定的阶段结构和阶段报告方式,这受到命中化合物识别分类的启发。HEDGEHOG 评估生成的分子是否能够在一系列日益严格且实际驱动的过滤器下持续存活。表 1 (https://arxiv.org/html/2607.13155#S2.T1) 总结了先前工作与 HEDGEHOG 的关系。 表 1:HEDGEHOG 与先前分子生成基准和评估框架的比较。每一列显示基准是否覆盖 HEDGEHOG 流程的一个阶段。“Yes”表示该阶段被直接评估或开箱即用支持,“Partial”表示仅通过代理指标或更窄的组件覆盖了部分阶段,“No”表示该阶段未被覆盖。“Code”表示是否有官方实现或公共仓库可用。 **HEDGEHOG 基准协议。** HEDGEHOG 通过化合物是否通过一个分阶段过滤级联来评估模型输出,该级联反映了药物化学团队在命中化合物识别前对分子进行分类的方式。它分析不同生成器类别在固定下游约束下如何失败。除了标准的内在指标外,HEDGEHOG 计算 21 个理化描述符,并使用约 2,460 个 SMARTS 模式和 10 个规则集应用结构警示和图结构完整性检查。它使用四个标准评估合成性,以及在 AiZynthFinder [Genheden et al., 2020](https://arxiv.org/html/2607.13155#bib.bib23) 中进行显式合成路线搜索,并使用 smina [Koes et al., 2013](https://arxiv.org/html/2607.13155#bib.bib41)、GNINA [McNutt et al., 2021](https://arxiv.org/html/2607.13155#bib.bib53) 和 Matcha [Frolova et al., 2025](https://arxiv.org/html/2607.13155#bib.bib20) 评估对接,同时使用 Boltz-2 [Passaro et al., 2025](https://arxiv.org/html/2607.13155#bib.bib60) 进行结合亲和力预测。最后,我们的基准应用 3D 分子过滤器,包括构象质量、构象偏差、相似性和基于相互作用的评估。附录表 4 (https://arxiv.org/html/2607.13155#A1.T4) 包含每个工具的软件版本。 ## 3 方法 HEDGEHOG(图 1 (https://arxiv.org/html/2607.13155#S4.F1))包含六个阶段:分子预处理、理化过滤、结构过滤、合成可行性评估、对接与结合亲和力估计,以及 3D 对接后分析。这种阶段式设计不仅受到药物化学实践的启发,也出于计算效率的考虑:逆合成路线查找、对接和结合亲和力估计远比早期的描述符和结构检查昂贵得多。因此,HEDGEHOG 采用由粗到细的过滤级联,在将更小的候选集发送到最慢的下游阶段之前,先移除不合理的分子。总体阈值和规则集是与靶点无关的。在本研究中,该基准被实例化于 KRAS G12D 的开关-II 口袋(PDB ID: pdb_00007ew9 [Shen et al., 2021](https://arxiv.org/html/2607.13155#bib.bib69))。每个阶段的完整配置细节和阈值见附录 A 节 (https://arxiv.org/html/2607.13155#A1)。 ### 3.1 阶段 1:分子预处理 所有生成的分子首先通过使用 RDKit [Landrum, 2013](https://arxiv.org/html/2607.13155#bib.bib44) 和 DataMol [Mary et al., 2024](https://arxiv.org/html/2607.13155#bib.bib51) 实现的通用预处理流程。此阶段将生成的字符串转换为分子对象,去除盐和溶剂,保留最大的相关有机片段,断开金属连接,通过标准化和净化操作使表示形式标准化,并转换回 SMILES 字符串。含有不支持元素集以外的原子类型、自由基、同位素、无效化合价状态或未解析的多片段伪影的分子在此阶段被移除。此预处理有两个目的。首先,它在评估之前对来自异构生成器的输出进行标准化。其次,它降低了由畸形或化学上不一致的输入影响下游计算的风险(附录 A.1 节 (https://arxiv.org/html/2607.13155#A1.SS1))。 ### 3.2 阶段 2:理化描述符 预处理后,HEDGEHOG 计算一个包含 21 个理化描述符的面板
相似文章
ShallowBench:评估面向浅口袋靶标的生成式药物设计模型
介绍了ShallowBench,一个精心整理的包含5,780个浅口袋蛋白质靶标的基准测试,用于评估针对如KRAS和MYC等具有挑战性的低口袋性靶标的生成式药物设计模型。
DrugSAGE:自演化智能体经验实现高效最先进的药物发现
DrugSAGE是一个框架,能够积累并复用跨任务记忆,高效构建最先进的药物发现模型,在保留任务上比基线智能体性能提升10-30%。
DrugGen 2:一种疾病感知的语言模型,用于增强药物发现
DrugGen-2通过监督学习和强化学习(GRPO)微调GPT-2,在疾病本体和靶点蛋白质序列条件下生成小分子,实现了药物发现中更高的多样性和结合亲和力。
从全息口袋到电子密度:基于密度的GPT式药物设计
本文介绍了EDMolGPT,这是一种自回归框架,能够从低分辨率电子密度点云生成3D分子构象,通过利用具有物理意义的密度信号来改进基于结构的药物设计。
通过口袋条件扩散和属性感知优化生成可开发的3D分子
本文介绍了一种新颖的基于扩散的生成模型,用于基于结构的药物设计。该模型解耦了口袋和配体的表示学习,并融入了多尺度相互作用信号和属性感知优化,以生成具有更强结合亲和力和更优ADMET属性的可开发3D分子。