表格上下文学习器能否泛化到生物分子性质预测?

arXiv cs.LG 论文

摘要

本文研究了在合成因果表上预训练的表格上下文学习模型能否从有限的标注数据泛化到生物分子性质的预测。作者发现,这些模型在蛋白质适应性回归任务上具有竞争力,但在小分子分类中,表示选择至关重要。

arXiv:2606.31126v1 Announce Type: new 摘要:从有限的标注数据预测生物分子性质是蛋白质工程和小分子设计中的核心瓶颈。随着强大的预训练编码器现在提供丰富的固定长度表示,难点已从表示学习转向构建适用于小样本场景的数据高效预测器。表格基础模型(如TabPFN3和TabICL)看似不太适合这一角色:它们是在从随机因果图中抽取的合成表上预训练的上下文学习器,其生成先验与产生蛋白质序列或分子图的过程没有明显对应关系。这种表格化的因果归纳偏差竟然能迁移到生物分子数据上,这反直觉,但我们发现它确实有效。将每个方法视为一个预测器-表示对,我们在两个领域进行了评估。在固定的ESMC表示上,表格上下文学习在ProteinGym和一个多样的酯酶数据集上的蛋白质适应性回归中始终具有竞争力。对于使用ECFP/RDKit描述符的小分子分类,在TDC ADMET、MoleculeNet、FS-Mol和DrugOOD上没有单一配对占据主导地位;表示选择成为主要决定因素,正如预测器自身的先验对分子结构不敏感时所预期的那样。我们得出结论,表格基础模型在生物分子预测任务上表现出色,但其性能在很大程度上取决于所使用的序列或分子表示。
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:33

# 1 引言

来源:https://arxiv.org/html/2606.31126
\\logo

CSIRO\\reporttitle表格上下文学习模型能否泛化到生物分子性质预测?\\reporttitlefontsize28pt\\reportsubtitle\\reportauthorsDavy Guan, Lu Zhang, Asiri Wijesinghe, Allen Zhu, He Zhao, Helen Power, F\. Hafna Ahmed, Andrew Warden, Cheng Soon Ong, Daniel M\. Steinberg\\reportnumber\\clientname\\clientcontact\\commercialinconfidence\\reportdate2026年6月30日\\businessunit\\businessuniturlhttps://www\.csiro\.au/en/work\-with\-us/industries/technology\\contactnameDaniel M\. Steinberg\\contactphone\\contactemaildan\.steinberg@csiro\.au

\\openingpage

引用

Guan D, Zhang L, Wijesinghe A, Zhu A, Zhao H, Power H, Ahmed FH, Warden A, Ong CS and Steinberg DM \(2026\) 表格上下文学习模型能否泛化到生物分子性质预测?澳大利亚联邦科学与工业研究组织(CSIRO).

版权

© Commonwealth Scientific and Industrial Research Organisation 2026。在法律允许的范围内,保留所有权利,未经CSIRO书面许可,不得以任何形式或任何方式复制或拷贝本出版物受版权保护的任何部分。

重要免责声明

CSIRO提醒,本出版物所含信息仅为基于科学研究的通用陈述。读者需注意,此类信息可能不完整或无法用于任何特定情况。因此,未经事先寻求专业、科学和技术方面的专家意见,不得依赖或基于这些信息采取行动。在法律允许的范围内,CSIRO(包括其员工和顾问)对任何因直接或间接使用本出版物(部分或全部)及其所含任何信息或材料而产生的任何后果(包括但不限于所有损失、损害、成本、费用及任何其他赔偿)不承担任何责任。

国家致谢

CSIRO 承认我们在澳大利亚生活和工作所在的土地、海洋和水域的传统所有者,并向过去和现在的长老致敬。

###### 摘要

从有限的标注数据预测生物分子性质是蛋白质工程和小分子设计中的一个核心瓶颈。随着强大的预训练编码器现在能够提供丰富的固定长度表示,难点已从表示学习转向为少样本场景构建数据高效的预测器。表格基础模型(如TabPFN3和TabICL)似乎不太适合这一角色:它们是在随机因果图生成的合成表格上预训练的上下文学习器,这种生成先验与产生蛋白质序列或分子图的过程没有明显对应关系。这种表格化的因果归纳偏置能够迁移到生物分子数据上看似反直觉,但我们发现它确实可行。我们将每种方法视为一个预测器-表示对,在两个领域进行了评估。在固定的ESMC表示上,表格上下文学习在ProteinGym和一个多样的酯酶数据集上的蛋白质适应度回归任务中持续具有竞争力。对于使用ECFP/RDKit描述符的小分子分类任务,在TDC ADMET、MoleculeNet、FS-Mol和DrugOOD上没有任何单一配对占主导地位;表示选择成为主要决定因素,正如当预测器自身的先验对分子结构不敏感时所预期的那样。我们得出结论:表格基础模型在生物分子预测任务上表现强劲,但其性能高度依赖于所使用的序列或分子表示。

从有限的标注数据预测生物分子数据的功能后果是蛋白质工程、变异效应预测和小分子设计中的一个核心问题。深度突变扫描(DMS)基准如ProteinGym大大提高了评估的规模和严谨性,但每个实验仍然产生一个独特的低数据监督任务,其中对于一个新的蛋白质或条件,只有少量实验测量的变异可用(Notin等人,2023 (https://arxiv.org/html/2606.31126#bib.bib8);Elnaggar等人,2022 (https://arxiv.org/html/2606.31126#bib.bib29))。最近,大型生物基础模型使序列表示显著增强:在进化语料库上训练的蛋白质语言模型提供了丰富的固定长度嵌入,这些嵌入可以重复用于下游任务(Elnaggar等人,2022 (https://arxiv.org/html/2606.31126#bib.bib29);Lin等人,2023 (https://arxiv.org/html/2606.31126#bib.bib22);Hayes等人,2025 (https://arxiv.org/html/2606.31126#bib.bib9))。这使建模瓶颈的一部分从表示学习转向设计一个数据高效的预测器,能够在少样本场景中利用这些嵌入。

表格基础模型为解决这一瓶颈提供了一种引人注目的方法。它们不是为每个数据集从头训练一个新的预测器,而是离线在合成表格任务上摊销贝叶斯式预测,并在测试时通过条件化于标注的支持样本来进行推理,无需特定任务的梯度更新(Hollmann等人,2023 (https://arxiv.org/html/2606.31126#bib.bib1),2025 (https://arxiv.org/html/2606.31126#bib.bib2);Qu等人,2025 (https://arxiv.org/html/2606.31126#bib.bib3),2026 (https://arxiv.org/html/2606.31126#bib.bib4))。近期的工作已将这一范式扩展到更大的上下文、更广泛的任务族以及更真实的数据场景。在代谢组学、分析化学和材料信息学等科学领域的评估表明,一旦特定领域的结构被编码为特征向量,这些模型可以有效地迁移(Wu等人,2026 (https://arxiv.org/html/2606.31126#bib.bib10);Granitto等人,2026 (https://arxiv.org/html/2606.31126#bib.bib11);Li等人,2026 (https://arxiv.org/html/2606.31126#bib.bib12))。

目前尚不清楚这种迁移是否适用于两个具有不同表示挑战和输出类型的领域:蛋白质适应度回归和小分子性质分类。蛋白质适应度预测需要将高维序列嵌入映射到连续的适应度值,涉及数百个结构多样的实验,标注样本少至O\(10\)\mathcal\{O\}\(10\)个。小分子性质分类则面临不同的挑战:表示范围从固定的指纹向量到学习的分子图嵌入,评估必须同时捕捉分布内准确率、低样本采样效率以及跨骨架、实验和分子大小变化的分布外泛化能力。

我们将两种设置作为评估问题进行研究,使用现有的预训练模型和指纹技术。对于蛋白质适应度回归,我们用ESMC(Hayes等人,2025 (https://arxiv.org/html/2606.31126#bib.bib9))编码序列,并在ProteinGym和一组新发布的多样化酯酶家族数据集(Ahmed等人,2026 (https://arxiv.org/html/2606.31126#bib.bib25))上,将TabICL和TabPFN3与监督基线进行比较。对于小分子性质分类,我们评估学习器-表示对,将表格模型与分子描述符视图配对,并与基于图的基线进行比较。我们在TDC ADMET(Huang等人,2021 (https://arxiv.org/html/2606.31126#bib.bib15))、MoleculeNet(Wu等人,2018 (https://arxiv.org/html/2606.31126#bib.bib16))、FS-Mol(Stanley等人,2021 (https://arxiv.org/html/2606.31126#bib.bib14))和DrugOOD(Ji等人,2023 (https://arxiv.org/html/2606.31126#bib.bib17))上进行基准测试,其中DrugOOD提供了显式的OOD泛化测试。

我们的贡献主要是实证和方法层面的。我们提供了一个基准审计,评估表格基础模型在尚未被系统评估的科学预测场景中的表现,并且我们采用的设计协议旨在支持谨慎且符合场景的结论。我们在可能的情况下固定特征流程,将少样本结论与全训练结论分开,并将OOD行为、官方ProteinGym保留集、基准覆盖范围以及支持集敏感性作为评估的一等组成部分。

## 2 背景与相关工作

先验数据拟合网络(PFN)框架在合成表格任务上离线训练transformer,以便在推理时通过条件化于标注的上下文示例进行预测,无需特定任务的梯度更新(Müller等人,2022 (https://arxiv.org/html/2606.31126#bib.bib23))。TabPFN为小型分类问题建立了这一公式,并表明在合成贝叶斯先验上的摊销推理可以匹配或超过精心调优的基线的真实基准表现(Hollmann等人,2023 (https://arxiv.org/html/2606.31126#bib.bib1),2025 (https://arxiv.org/html/2606.31126#bib.bib2))。2026年发布的版本(Grinsztajn等人,2026 (https://arxiv.org/html/2606.31126#bib.bib26)),在本文中称为TabPFN3,通过改进的可扩展性和回归支持扩展了该框架。TabICL通过两阶段架构扩展了该范式:第一阶段应用列后行注意力将每个样本压缩为固定维度的行嵌入,第二阶段对行嵌入应用transformer进行上下文预测(Qu等人,2025 (https://arxiv.org/html/2606.31126#bib.bib3),2026 (https://arxiv.org/html/2606.31126#bib.bib4))。为便于阅读,我们将本研究中使用的TabICL v2实现称为TabICL。

ProteinGym标准化了217个DMS实验的评估,涵盖多样的蛋白质和适应度表型,从而能够跨实验类型和替换深度进行系统比较(Notin等人,2023 (https://arxiv.org/html/2606.31126#bib.bib8))。主要的监督策略是将大型预训练序列编码器与轻量级任务特定预测器配对。蛋白质语言模型包括ProtTrans(Elnaggar等人,2022 (https://arxiv.org/html/2606.31126#bib.bib29))、ESM2(Lin等人,2023 (https://arxiv.org/html/2606.31126#bib.bib22))和ESMC(Hayes等人,2025 (https://arxiv.org/html/2606.31126#bib.bib9)),它们在进化序列语料库上训练,因此其嵌入捕获了从自然变异中学习到的结构性和功能性约束。

小分子性质预测涵盖ADMET分析、活性预测以及跨化学系列的分布外泛化。MoleculeNet(Wu等人,2018 (https://arxiv.org/html/2606.31126#bib.bib16))、TDC ADMET(Huang等人,2021 (https://arxiv.org/html/2606.31126#bib.bib15))、FS-Mol(Stanley等人,2021 (https://arxiv.org/html/2606.31126#bib.bib14))和DrugOOD(Ji等人,2023 (https://arxiv.org/html/2606.31126#bib.bib17))提供了互补的评估场景,涵盖标准监督设置、带有任务级别变化的少样本学习以及跨骨架、实验和分子大小的系统分布偏移。固定描述符如ECFP指纹(Rogers and Hahn,2010 (https://arxiv.org/html/2606.31126#bib.bib18))和RDKit特征提供了表格特征向量,而图模型如ChemProp(Yang等人,2019 (https://arxiv.org/html/2606.31126#bib.bib13))和CheMeleon初始化的ChemProp(Burns等人,2025 (https://arxiv.org/html/2606.31126#bib.bib19))则直接建模分子结构。

## 3 使用表格ICL模型处理生物分子

在两个领域中,我们都遵循一个简单流程。一个冻结的领域编码器将每个生物分子映射为固定长度的特征向量,该向量成为表格上下文学习器输入表中的一行。预测器TabICL和TabPFN3通过条件化于上下文中的标注支持行来预测查询分子的标签。蛋白质适应度被视为回归任务,使用MSE和Spearman秩相关系数报告结果。小分子性质预测被视为二分类任务,使用ROC-AUC报告结果。

#### 蛋白质表示。

蛋白质序列使用ESMC(Hayes等人,2025 (https://arxiv.org/html/2606.31126#bib.bib9))进行编码,这是一个拥有3亿参数的蛋白质语言模型,是ESM2(Lin等人,2023 (https://arxiv.org/html/2606.31126#bib.bib22))的后续版本。我们使用由此产生的固定长度960维的每条序列嵌入作为默认特征向量。相同的嵌入被不加修改地提供给所有蛋白质方法,以便比较在固定表示下分离预测器的效果。对于最大的ProteinGym实验,当全特征推理超出可用内存或时间限制时,我们会额外报告基于PCA压缩的ESMC补救运行;这些行在附录注释中明确标记,仅用于完成原本不可行的实验。

#### 分子特征。

对于小分子,表格学习器接收ECFP/Morgan指纹(Rogers and Hahn,2010 (https://arxiv.org/html/2606.31126#bib.bib18))、RDKit二维物理化学描述符,或两者的拼接。该描述符被视为模型对的一个组成部分,而不是一个可分离的预处理步骤,因为使用ECFP特征的表格学习器与使用RDKit描述符的同一个学习器可能表现不同。作为固定描述符的结构替代方案,图基线直接通过从零训练的ChemProp(Yang等人,2019 (https://arxiv.org/html/2606.31126#bib.bib13))和基于CheMeleon检查点微调ChemProp的基础模型初始化变体(Burns等人,2025 (https://arxiv.org/html/2606.31126#bib.bib19))来消费分子图。

## 4 蛋白质预测实验

我们在两个蛋白质预测场景中评估TabICL和TabPFN3。第一个是ProteinGym的217个DMS任务,第二个是Ahmed等人(2026 (https://arxiv.org/html/2606.31126#bib.bib25))引入的PpEST酯酶家族数据集。我们在全训练任务和少样本设置(使用8到64个训练样本)中测试这些模型,以近似低通量湿实验测量场景。

#### 数据集。

ProteinGym(Notin等人,2023 (https://arxiv.org/html/2606.31126#bib.bib8))是一个大型DMS实验集合,用于基准测试蛋白质适应度的计算模型。每个实验量化氨基酸替换对生物学相关性质的影响。我们使用阶段性评估文件中可用的217个监督替换实验,并报告随机5折结果以及官方的随机、模和连续保留方案。在随机方案中,每个突变被随机分配到五个不同的折中。在模方案中,突变的位置被分配给一个特定的折(模5)。在连续方案中,通过分割序列获得5个连续位置的片段,并根据位置将突变分配给片段。PpEST是一个多样的酯酶数据集,在排除了约600个部分使用ML方法选择的序列后,包含1513个祖先相关的序列。它包括三种酯底物的催化反应速率以及在两个温度下的热稳定性测量(Ahmed等人,2026 (https://arxiv.org/html/2606.31126#bib.bib25))。

#### 基线。

我们将TabICL和TabPFN3与岭回归、RBF采样器、HistGradientBoostingRegressor(HGBR)(Pedregosa等人,2011 (https://arxiv.org/html/2606.31126#bib.bib27))以及带有任务特定MLP回归头的微调ESMC进行比较。所有基线都接收相同的ESMC嵌入作为输入。一个兼容的重新训练的PpEST序列CNN作为附录检查报告,而不是插入到主要比较中。

#### 评估指标。

蛋白质适应度预测通过均方误差(MSE)和Spearman秩相关系数进行评估。Spearman是主要的排名指标。

相似文章

探析表格上下文学习的记忆机制

arXiv cs.LG

本文研究了使用上下文学习的表格基础模型中的参数化记忆现象,提出了一种探测框架(IclMem)来分离基于上下文的预测与记忆。发现在特定条件下存在适度的记忆信号,但在现实训练场景下基本消失。

利用基于图的工具改进小型语言模型中的分子性质预测

arXiv cs.AI

本文提出了一种上下文增强提示框架,利用图神经网络专家模型提供预测提示和解释性子图,以改进小型语言模型中的分子性质预测。在MUTAG和Tox21上的实验显示,与仅使用SMILES的基线相比,准确率提升高达74%。

马尔可夫边界在表格预测中的好、坏与丑

Hugging Face Daily Papers

本文评估了马尔可夫边界在表格预测中的实际效果,发现尽管理论上最优,但由于计算限制和优化目标不匹配,当前的因果发现方法无法持续提升预测性能。