用于分子属性预测的程序化预训练

arXiv cs.LG 论文

摘要

本文介绍了一种三阶段训练流水线,通过程序化预训练提升分子属性预测性能,在数据稀缺情况下通过从抽象生成数据中学习归纳偏置,表现出更优性能。

arXiv:2609.17831v1 Announce Type: new Abstract: 分子属性预测常受限于标注下游数据集的小规模,这推动了在无标签分子语料库上进行预训练。本工作中,我们探讨在模型接触任何分子数据之前,是否能从抽象的、程序化生成的数据中学习有用的归纳偏置。我们提出了一种三阶段训练流水线,包括程序化预训练、基于SMILES的分子预训练和下游微调,并评估了多种跨越序列结构、细胞自动机和图推理的程序化任务。我们发现,即使在后续分子预训练之后,程序化预训练也能提升分子属性预测:在Lipophilicity数据集上,\textsc{Reverse}将测试误差降低了4.8\%。作为参考,这一改进幅度大约是我们250K分子基线与公开发布的MoLFormer检查点之间性能差异的90\%,后者在约1亿分子上进行预训练。我们的分析表明,在下游数据稀缺时收益最强,取决于程序化数据的结构而非仅表面统计,且不随额外程序化训练单调增加。相反,迁移通常在中等程序化预算时达到峰值,并在模型接近程序化任务收敛时恶化。我们进一步发现,对于多个任务,大部分可迁移信息集中在注意力层,而前馈层可能导致过度专门化。这些结果表明,程序化数据能为分子学习提供可迁移的结构,并在有标签分子数据有限时提供一条互补的提升性能路径。
查看原文
查看缓存全文

缓存时间: 2026/09/17 08:55

# 用于分子性质预测的程序化预训练
来源:https://arxiv.org/html/2609.17831
Zachary Shinnick所属机构:牛津大学所属机构:阿德莱德大学Philip Torr所属机构:牛津大学所属机构:Slater LabsBruno Andreis所属机构:牛津大学所属机构:Slater Labs

###### 摘要

分子性质预测通常受限于标注的下游数据集规模较小,这促使研究者在大规模无标注分子语料库上进行预训练。本研究探讨在模型接触任何分子数据之前,能否从抽象的程序化生成数据中学习有用的归纳偏置。我们引入了一个由程序化预训练、基于SMILES的分子预训练以及下游微调组成的三阶段训练流程,并评估了涵盖序列结构、元胞自动机和图推理的多种程序化任务。研究发现,程序化预训练即使在随后的分子预训练之后,仍能提升分子性质预测性能:在Lipophilicity数据集上,**反向序列任务**使测试误差降低了4.8%。作为参考,这一提升幅度约为我们250K分子基线模型与公开发布的、在约1亿分子上预训练的MoLFormer检查点之间性能差异的90%。我们的分析表明,这种收益在下游数据稀缺时最为显著,其依赖于程序化数据的结构而非仅表层统计特性,并且不会随额外的程序化训练而单调增加。相反,迁移效果通常在中间程序化预算处达到峰值,当模型趋近于程序化任务的最优解时会下降。我们进一步发现,对于多个任务,大部分可迁移信息集中于注意力层,而前馈层可能导致过度特化。这些结果表明,程序化数据能为分子学习提供可迁移的结构,并在标注分子数据有限时,为提升性能提供了一条互补途径。

## 1引言

图1:所提三阶段训练流程概览。Transformer首先在程序化生成的掩码标记任务上进行预训练,然后在分子SMILES上进行预训练,最后针对分子性质预测进行微调。相较于仅进行分子预训练和微调,程序化预训练可以降低下游任务误差。现代分子机器学习模型常训练于无标注分子数据丰富、但标注下游数据稀缺的场景中(Irwin and Shoichet, 2004 (https://arxiv.org/html/2609.17831#bib.bib7); Kim et al., 2019 (https://arxiv.org/html/2609.17831#bib.bib8))。分子性质预测数据集通常只包含数百或数千个标注样本(Wu et al., 2018 (https://arxiv.org/html/2609.17831#bib.bib5)),使得高容量模型难以仅从下游监督中学习到有用的表征。一种常见的应对策略是采用为语言模型开发的预训练范式:模型首先在大量无标注的分子表征(如SMILES字符串)集合上训练,然后针对特定目标性质进行微调(Chithrananda et al., 2020 (https://arxiv.org/html/2609.17831#bib.bib9); Ross et al., 2022 (https://arxiv.org/html/2609.17831#bib.bib4))。虽然这种分子预训练能显著提升性能,但获取和处理日益庞大的分子语料库可能成本高昂,且目前尚不清楚有用的归纳偏置本身是否必须从分子数据中学习。

近期研究提出了另一种预训练信号来源:程序化生成的数据。简单的算法过程,如逻辑运算(Wu et al., 2022 (https://arxiv.org/html/2609.17831#bib.bib15); Shinnick et al., 2025 (https://arxiv.org/html/2609.17831#bib.bib16))、形式语言(Papadimitriou and Jurafsky, 2023 (https://arxiv.org/html/2609.17831#bib.bib17); Hu et al., 2025 (https://arxiv.org/html/2609.17831#bib.bib6))和元胞自动机(Zhang et al., 2025 (https://arxiv.org/html/2609.17831#bib.bib18); Lee et al., 2026 (https://arxiv.org/html/2609.17831#bib.bib3)),可以生成具有受控结构特性的、近乎无限的数据。在这些数据上的程序化预训练已被证明能诱导出可迁移至自然语言和视觉任务的表征(Jiang et al., 2026 (https://arxiv.org/html/2609.17831#bib.bib1); Shinnick et al., 2026 (https://arxiv.org/html/2609.17831#bib.bib2))。这为分子学习带来了一个令人惊讶的可能性:模型能否在看到一个分子之前就学会有用的计算结构?该结构随后能否提升分子性质预测?

我们通过引入程序化预训练阶段,位于传统分子预训练和下游微调之前,来研究这个问题。使用MoLFormer(Ross et al., 2022 (https://arxiv.org/html/2609.17831#bib.bib4))作为基础架构,我们在多个程序化任务上进行预训练,这些任务涵盖序列操作(Jiang et al., 2026 (https://arxiv.org/html/2609.17831#bib.bib1))、层次结构(Hu et al., 2025 (https://arxiv.org/html/2609.17831#bib.bib6))、动力系统(Lee et al., 2026 (https://arxiv.org/html/2609.17831#bib.bib3))和图推理,然后将学习到的Transformer权重迁移至分子预测任务。我们的实验考虑了现实的三阶段流程(程序化预训练、分子预训练、下游微调)和简化设置(去除分子预训练),以隔离负责迁移的机制。

我们发现,程序化预训练即使在随后的真实分子数据预训练之后,也能提升分子性质预测。在Lipophilicity数据集(Wu et al., 2018 (https://arxiv.org/html/2609.17831#bib.bib5))上,仅在简单序列反转任务上进行预训练,就能使测试误差相比仅分子预训练的基线降低4.8%,恢复了约90%的我们250K分子基线模型与公开发布的、在约1亿分子上预训练的MoLFormer检查点之间的性能差异。随后,我们通过受控实验,表征了迁移在何种情况下有益、程序化数据的哪些特性驱动了这种迁移,以及可迁移信息在模型中的表示位置。

我们的主要贡献是:
- •我们证明程序化预训练即使在随后的分子预训练之后,也能提升分子性质预测,表明有用的非分子结构可以在真实的领域特定预训练阶段得以保留。
- •我们发现程序化数据与分子数据之间的**结构对齐**在分子预训练初期提供了先发优势,但**不能可靠地预测下游收益**。
- •我们表明这种收益在**下游数据稀缺时最大**,表明程序化预训练充当了一种归纳偏置,在标注分子数据有限时价值最高。
- •我们发现**更多的程序化预训练并不总是更好**。在五个任务中的四个中,下游性能在中间程序化预算处达到峰值,并在模型接近程序化任务最优点时恶化。
- •我们证明迁移取决于**程序化数据的结构而非表层统计特性**:在保留词汇表、序列长度和标记频率的情况下打乱标记顺序会消除这种收益。
- •我们将**大量可迁移信息定位到注意力层**(针对多个程序化任务),同时发现**前馈层可能导致在较大程序化预算时观察到的过度特化**。

## 2相关工作

##### 在程序化数据上预训练。
近期研究表明,可以从程序化生成的数据(而非自然语料库)中学到有用的表征。在语言领域,在人工语言、形式语言、神经元胞自动机和简单算法任务上的预训练可以提升自然语言任务的下游表现(Papadimitriou and Jurafsky, 2020 (https://arxiv.org/html/2609.17831#bib.bib13); Hu et al., 2025 (https://arxiv.org/html/2609.17831#bib.bib6); Lee et al., 2026 (https://arxiv.org/html/2609.17831#bib.bib3); Jiang et al., 2026 (https://arxiv.org/html/2609.17831#bib.bib1))。在视觉领域,使用分形或结构化噪声等合成图像也观察到了类似结果(Kataoka et al., 2021 (https://arxiv.org/html/2609.17831#bib.bib11); Baradad Jurjo et al., 2021 (https://arxiv.org/html/2609.17831#bib.bib10))。尽管这些程序许多都再现了目标领域的结构特性,但近期研究表明,即使跨领域也能实现迁移:基于序列的形式语言可以提升Vision Transformer的性能(Shinnick et al., 2026 (https://arxiv.org/html/2609.17831#bib.bib2)),而音乐预训练可以使语言模型受益(Nomura, 2026 (https://arxiv.org/html/2609.17831#bib.bib12))。这表明程序化预训练可以在不与下游数据高度相似的情况下,提供有用的归纳偏置。

先前的工作也研究了哪些特性使得程序化预训练具有可迁移性。结构性特性,如多样性、长程依赖和层次组织,可以提升迁移效果(Baradad Jurjo et al., 2021 (https://arxiv.org/html/2609.17831#bib.bib10); Chiang and Lee, 2021 (https://arxiv.org/html/2609.17831#bib.bib14); Hu et al., 2025 (https://arxiv.org/html/2609.17831#bib.bib6))。然而,强领域对齐并非总是必要:即使是简单的序列操作也能保留自然语言预训练的部分益处(Wu et al., 2022 (https://arxiv.org/html/2609.17831#bib.bib15)),并且可迁移信息可能位于不同的Transformer组件中,具体取决于下游任务(Jiang et al., 2026 (https://arxiv.org/html/2609.17831#bib.bib1))。这些发现共同指向了两种可能的迁移来源:程序化分布与目标分布之间的对齐,以及对模型归纳偏置更一般的改变。

我们将这一研究脉络扩展到分子建模领域,该领域标注数据相对稀缺,且程序化预训练受到的关注较少。我们研究抽象的程序化任务能否补充分子预训练、与SMILES结构的对齐如何影响迁移,以及程序化任务学习的哪些模型组件和特性是下游性能提升的关键。

## 3方法

##### 训练流程。
我们研究一个三阶段训练流程:(a) 程序化预训练,(b) 分子预训练,(c) 下游微调。程序化阶段仅向模型暴露算法生成的数据,之后模型才会接触任何分子样本。然后,我们可选地在未标记的SMILES字符串上继续预训练,最后在分子性质预测任务上进行微调。在第4.2节(https://arxiv.org/html/2609.17831#S4.SS2)中,对于部分实验,我们省略了分子预训练阶段,在程序化预训练后直接进行微调,以隔离程序化数据的影响。

##### 程序化预训练任务。
我们考虑五个旨在让模型接触不同形式结构的程序化任务。其中三个直接操作合成序列:**Reverse**(模型必须恢复标记序列的反转形式)、**Dyck**(由正确嵌套的括号序列组成)和**Dyck-Shuffle**(允许交叉括号依赖)。**Dyck** 模拟了SMILES中分支括号的结构,而 **Dyck-Shuffle** 模拟了环闭合数字的结构。我们还考虑了神经元胞自动机轨迹,它引入了时空结构,以及一个最短路径任务,在该任务中模型根据随机图的SMILES表示预测节点距离。所有任务都被表述为掩码标记预测问题,以便在整个程序化和分子预训练过程中使用相同的模型架构和训练目标。程序化输入示例如图2所示(https://arxiv.org/html/2609.17831#S3.F2)。

01234234源节点\(a\)图与源节点*CCCCCCC1\(\)101234234拼接*C1CC\(C\)C1CC\.01234234掩码距离*C1CC\(C\)C1CC\.?12??2?4\(b\)输入序列
图2:程序化预训练任务。上:序列级任务在掩码前后的示例序列。下:如何创建SSP任务的输入序列。a)生成一个类分子随机图并随机选择源节点。b)图的SMILES表示(使用*表示源节点,C表示所有其他节点)与从源节点到所有其他节点的最短路径距离拼接。
##### 模型。
我们使用MoLFormer(Ross et al., 2022 (https://arxiv.org/html/2609.17831#bib.bib4)),一个仅有编码器、约44M参数的Transformer,专为从SMILES表示中学习而设计。MoLFormer使用旋转位置嵌入、基于广义随机特征的线性注意力,以及一个基于正则表达式的SMILES分词器,词汇表包含2,362个标记。我们在所有训练阶段使用相同的Transformer架构。

##### 分子预训练。
MoLFormer通常使用掩码标记建模在从PubChem(Kim et al., 2019 (https://arxiv.org/html/2609.17831#bib.bib8))和ZINC(Irwin and Shoichet, 2004 (https://arxiv.org/html/2609.17831#bib.bib7))中提取的大量未标记SMILES字符串集合上进行预训练。公开发布的MoLFormer检查点是在约1亿分子上训练的,这超出了我们可用的计算预算。因此,为了评估程序化预训练在现实分子预训练流程中的作用,我们构建了一个更小规模的设置近似。我们在PubChem的250k分子子集上,使用相同的掩码标记建模目标和0.15的掩码概率,预训练了12个周期。在比较程序化和非程序化初始化时,所有模型接收相同的分子预训练数据和计算预算。

##### 下游评估。
我们在三个具有连续回归目标的分子性质预测基准上进行评估:来自MoleculeNet的Lipophilicity(Wu et al., 2018 (https://arxiv.org/html/2609.17831#bib.bib5)),包含约44k分子;FreeSolv,包含642个分子;以及QM9,我们预测HOMO-LUMO能隙,并使用完整数据集或训练集的受控子集。模型微调500个周期。我们报告在标准化目标上,从验证性能最佳的检查点获得的测试平均绝对误差,遵循Ross et al. \(2022\)(https://arxiv.org/html/2609.17831#bib.bib4)的做法。除非另有说明,比较使用相同的下游数据划分和优化设置。

##### 权重迁移。
我们将模型参数划分为标记嵌入、注意力投影、前馈层、层归一化参数和输出头。程序化和分子领域使用不同的标记语义,因此我们不迁移学习到的程序化标记嵌入。相反,在程序化预训练期间,嵌入矩阵保持在随机初始化状态,确保任何可迁移信息必须编码在Transformer主干网络中,而非特定任务的标记表示中。我们也丢弃程序化输出头,其维度和语义不一定与后续阶段匹配。因此,默认的迁移设置保留了学习到的Transformer主干网络,同时根据需要重新初始化输入和输出接口。为了定位可迁移信息

相似文章

表格上下文学习器能否泛化到生物分子性质预测?

arXiv cs.LG

本文研究了在合成因果表上预训练的表格上下文学习模型能否从有限的标注数据泛化到生物分子性质的预测。作者发现,这些模型在蛋白质适应性回归任务上具有竞争力,但在小分子分类中,表示选择至关重要。

利用基于图的工具改进小型语言模型中的分子性质预测

arXiv cs.AI

本文提出了一种上下文增强提示框架,利用图神经网络专家模型提供预测提示和解释性子图,以改进小型语言模型中的分子性质预测。在MUTAG和Tox21上的实验显示,与仅使用SMILES的基线相比,准确率提升高达74%。

GLACIER: 一种用于分子性质预测的多模态学生-教师基础模型

arXiv cs.LG

本文介绍了GLACIER,一种多模态学生-教师基础模型,它整合了分子图、SMILES字符串和物理化学描述符,以高效预测分子性质。它利用Finsler几何感知融合以及来自更大教师模型(MiniMol、MolFormer)的知识蒸馏,以轻量级架构实现高性能。