通过目标感知源选择重新思考分子OOD泛化

arXiv cs.LG 论文

摘要

本文介绍了SCOPE-Bench,一个评估分子分布外泛化的基准测试,以及POMA,一个使用强化学习选择源域进行域自适应的框架,在3D分子模型上实现了显著的误差降低。

arXiv:2605.13932v1 Announce Type: new 摘要:在极端分布外(OOD)场景下对分子性质进行鲁棒预测是AI驱动药物发现的关键瓶颈。当前的骨架拆分协议无法阻止微观语义重叠,容易导致模型采用捷径学习并高估其真实的泛化能力;同时,传统的域自适应范式在极端结构偏移下表现不佳,因为盲目对齐异质源库会引入拓扑噪声并引发负迁移。为解决这两个问题,本文提出了基于簇级划分的显式理化描述符空间的分布外性能评估基准(SCOPE-BENCH)以及多源自适应策略优化(POMA)框架。该框架将知识迁移构建为检索-组合-自适应流程:首先识别与未标记目标结构接近的标记源骨架作为代理目标;然后通过强化学习策略从指数级候选池中自适应选择最优源子集;最后在宏观拓扑和微观药效团两个尺度上进行双尺度域自适应。评估表明,最先进的3D分子模型在SCOPE-BENCH上的预测误差最高飙升至8.0倍(平均5.9倍),而POMA在不同骨干架构上将平均绝对误差最多降低11.2%,平均相对改进6.2%。代码已开源:https://anonymous.4open.science/r/Molecular-OOD-Code-73F6。
查看原文
查看缓存全文

缓存时间: 2026/05/15 06:25

# 通过目标感知源选择重新思考分子分布外泛化
来源:https://arxiv.org/html/2605.13932
\\@anonymousfalse

Zhuohao Lin†, Kun Li†, Jiameng Chen, Wenbin Hu∗ 武汉大学计算机学院 中国武汉 \{linzhuohao, likun98, jiameng.chen, hwb\}@whu.edu.cn †These authors contributed equally. ∗Corresponding author. Yizhen Zheng 莫纳什大学数据科学与人工智能系 澳大利亚维多利亚州 [email protected] &Jiajun Yu 浙江大学计算机科学与技术学院 中国杭州 [email protected] &Duanhua Cao 同济大学生命科学与技术学院 上海, 200092, 中国 [email protected]

###### 摘要

在极端分布外场景下稳健预测分子性质是AI驱动药物发现的关键瓶颈。当前的骨架分割协议无法阻止微观语义重叠,导致模型偏好捷径学习,高估其真实外推能力;同时,传统的域适应范式在极端结构偏移下表现不佳,因为盲目对齐异质源库会引入拓扑噪声并触发负迁移。为了解决这两个挑战,我们提出了**SCOPE-Bench**(骨架簇分布外性能评估基准),该基准基于显式物理化学描述符空间的簇级划分构建,并提出了**POMA**(多源适应策略优化),这是一个将知识转移形式化为“检索-组合-适应”管道的框架:首先识别与未标记目标结构接近的标记源骨架作为代理目标;然后强化学习策略从指数级候选池中自适应选择最优源子集;最后在宏观拓扑和微观药效团尺度上执行双尺度域适应。评估表明,最先进的3D分子模型在SCOPE-Bench上的预测误差最高激增8.0×,平均为5.9×,而POMA在多种骨干架构上将平均绝对误差最高降低11.2%,平均相对改进为6.2%。代码可在https://anonymous.4open.science/r/Molecular-OOD-Code-73F6/获取。

## 1 引言

现代药物发现运行在约10^60个潜在类药分子的化学空间中,识别具有特定生物活性的先导化合物[26]仍然是一个基本挑战[12, 47]。分子表示学习已成为这一努力的核心[38, 32, 57, 48],从手工描述符[35]和2D消息传递网络[18, 14]发展到3D几何等变模型,如ViSNet[49]、ETNN[5]、GotenNet[3]和SchNet[40],这些模型在捕获高阶几何张量的同时在旋转和平移下保持物理一致性[41, 37],在独立同分布基准上接近密度泛函理论精度[16]。

![参见标题](图1:本研究核心动机。(a) 传统骨架分割由于潜在的语义重叠显著高估了模型泛化能力。(b) 严格分布外设置下的结构偏移引发预测错误多倍激增。(c) 源域选择和组合是外推性能的主要驱动因素,有时甚至超过骨干架构选择的影响。)

尽管取得了这些进展,基准性能与真实世界部署之间仍然存在关键差距[25, 27]。在实践中,新型分子源于化学空间中结构孤立的区域[20]。主流基准依赖传统的骨架分割[7, 51],仅要求测试骨架在训练集中不存在。然而,这种宏观解耦无法阻止微观语义重叠。具有不同骨架的分子经常共享局部共轭π电子系统或相同的氢键供体网络。这种潜在重叠使模型倾向于捷径学习[13],而不是学习可转移的物理化学不变量[53]。为了解决这种根本性的评估偏差,我们提出了**SCOPE-Bench**(骨架簇分布外性能评估基准)。该基准基于显式物理化学描述符聚类强制执行严格的度量分离,以完全阻止隐藏的结构插值。如图1a和图1b所示,模型在标准分割下表现良好,但在这些更严格的标准下灾难性地崩溃。

极端分布偏移也暴露了现有迁移学习策略[30, 31]的致命缺陷。盲目对齐异质源库与未标记目标会注入拓扑噪声,引发维度坍缩[11]和严重的负迁移[36]。至关重要的是,我们在图1c中的初步分析表明,源域的策略选择和组合是外推成功的主要决定因素,通常比骨干架构本身的选择影响更大。这一观察结果需要一个能够感知目标域并主动决定最优源配置的智能机制。为了解决这一挑战,我们引入了**POMA**(多源适应策略优化),它将知识转移形式化为一个集成的、策略驱动的“检索-组合-适应”管道。

POMA引入了两项核心创新,使其选择策略区别于传统范式。首先,我们通过基于群体相对策略优化(GRPO)[42]学习组合选择策略,革新了检索和组合阶段。与孤立地对候选者进行排序的静态图核不同,我们的策略动态探索指数级大的组合空间,以组成最具协同效应的源子集,而无需脆弱的价值网络。其次,我们通过用双尺度解耦架构[44]替换传统的全局对齐,革新了域适应阶段。标准的适应方法强制进行整体特征匹配,这不可避免地破坏了细粒度的化学语义。POMA通过独立对齐宏观全分子拓扑和微观药效团片段来解决这个问题。这种双尺度正则化确保了选择策略得到稳健适应过程的支持,该过程保留了结构和化学精度。

总体而言,我们的贡献可以总结为:(i) **SCOPE-Bench**,一个基于物理化学聚类的严格分布外基准,消除了评估偏差。最先进的模型性能下降高达8.0×(平均5.9×),暴露了其在分布外场景下的根本脆弱性。(ii) **POMA**,一个策略引导的框架,通过目标感知选择策略和双尺度解耦域适应克服了负迁移。(iii) 在3D等变架构上的广泛实验表明,在所有任务中平均绝对误差最高降低11.2%,平均相对改进6.2%,验证了其跨架构的普适性。

![参见标题](图2:POMA框架概述,作为“检索-组合-适应”管道。首先识别与目标结构接近的标记源骨架作为代理目标,以实现奖励估计。然后,强化学习策略从候选池中选择最优源子集。最后,双尺度适应模块对齐宏观拓扑和微观药效团特征,策略更新由代理任务上的迁移性能驱动。)
## 2 相关工作

分子机器学习[22, 21, 25]已成为药物发现的核心计算引擎[9, 23],其进展很大程度上得益于越来越忠实的分子结构表示,从手工指纹[35]到图神经网络[55, 54],以及最近的几何感知等变模型[52, 49, 3]。尽管在独立同分布基准上接近密度泛函理论精度[16],但Hu等人[17]表明,这种精度严重依赖于子结构重叠:一旦遇到未见过的拓扑结构,泛化能力会严重下降[24]。

随机分割和MoleculeNet的骨架分割[33, 51]逐步提高了评估的真实性,但两者都无法阻止微观语义重叠。模型利用虚假的子结构相关性而非因果物理化学定律[13],导致在数据集偏移下校准严重退化[29, 38]。GOOD基准[15]和MoleOOD[53]表明,如果不强制执行不变风险最小化[1],捷径学习会导致研究者系统性地高估模型鲁棒性。

基于MMD、对抗训练[56]或二阶统计量[44]的域适应方法[8]假设合并所有源域并与目标全局对齐是有益的。在极端分子偏移下,这一假设失败:异质源梯度过度压缩目标表示,导致维度坍缩[11]和负迁移[36, 50],使得源选择成为稳健分子适应的前提。图核方法[45]静态地对源候选进行排序,但无法基于下游反馈进行优化。强化学习[6]提供了动态组合选择,但PPO[39]需要相同规模的Critic网络,容易在稀疏奖励下崩溃。GRPO[42]完全消除了价值网络,通过组内标准化计算优势,这自然适合从大型候选池中选择最佳源子集的问题。

## 3 方法

### 3.1 问题定义

预测任务定义在3D分子图Gi = (Vi, Ei, Ri, Zi)上,标签yi ∈ R;每个分子的拓扑骨架通过Bemis–Murcko函数si = φ(Gi)提取。

与传统经验风险最小化的独立同分布假设不同,极端分布外设置要求源骨架集S和未标记目标集T同时不相交(S ∩ T = ∅)且在度量上分离:它们在物理化学描述符空间中的1-Wasserstein距离必须超过预定义阈值τ_dist,以防止通过子结构插值的捷径学习。

从这个设置中产生两个核心挑战。**挑战1(基准差距)**:即使骨架不相交,现有分割允许supp(P(S)) ∩ supp(P(T)) ≠ ∅,使模型能够利用局部特征重叠而不是实现真正的外推。**挑战2(负迁移)**:将整个源池S与目标T全局对齐会注入异质梯度,过度压缩目标表示。这导致维度坍缩,形式上是对齐后目标特征协方差矩阵C_T相对于未对齐基线的秩显著降低,并导致性能低于单独使用最优可迁移子集S* ⊂ S。

### 3.2 SCOPE-Bench的构建

为了实现问题定义所需的度量分离,我们通过三步流程构建**SCOPE-Bench**。

**步骤1:骨架提取和特征构造**。通过RDKit[19]从QM9[34]中提取Bemis–Murcko骨架,得到1,247个独特骨架(每个≥10个样本)。每个骨架sk由一个四维物理化学特征向量表示:

fk = V_macro ⊕ V_element ⊕ V_conn ⊕ V_flex   (1)

其中⊕表示拼接;V_macro编码全局拓扑(原子/环数);V_element捕获元素极化率;V_conn反映电子离域和刚性;V_flex通过可旋转键比率衡量构象熵。

**步骤2:层次聚类**。为了处理多环骨架的长尾分布,首先进行层次预分类...

相似文章

超越药物发现:纳米技术分子优化(NMO)基准

Hugging Face Daily Papers

纳米技术分子优化(NMO)基准引入了基于物理的分子设计任务,取代了以药物发现为中心的指标,旨在推动纳米技术领域的科学发现。论文显示,先进方法在NMO上的表现不如更简单的方法,并提出了新的基准方法,包括一种新颖的表示方法和领域无关的预训练。

可控分子生成基础模型

arXiv cs.LG

提出CoMole,一种基于基序感知图扩散和强化学习的可控分子生成基础模型,在材料和药物发现基准测试中实现了卓越的可控性。

通过口袋条件扩散和属性感知优化生成可开发的3D分子

arXiv cs.LG

本文介绍了一种新颖的基于扩散的生成模型,用于基于结构的药物设计。该模型解耦了口袋和配体的表示学习,并融入了多尺度相互作用信号和属性感知优化,以生成具有更强结合亲和力和更优ADMET属性的可开发3D分子。