表格基础模型在微生物组数据的真实查询分布偏移下是否鲁棒?
摘要
本文评估了表格基础模型在微生物组数据中受生物学启发的分布偏移下的鲁棒性,发现保护判别特征不足以保证稳定性,且零填充是最有害的扰动。
arXiv:2606.24995v1 公告类型:新
摘要:表格基础模型(TFMs)在微生物组丰度数据上取得了强劲性能,但其在真实分布偏移下的鲁棒性仍知之甚少。我们引入了一个基准测试,该测试评估了TFMs在六个跨四种疾病背景的肠道微生物组数据集中受生物学启发的扰动下的鲁棒性。在这种上下文学习设置中,模型以未受扰动的支持集为上下文,并对受扰动的查询样本进行评估。为了隔离超越“捷径”特征的鲁棒性,我们保留了最具判别力的分类单元,并应用了三种受控的扰动策略:(i) 移除高丰度(无信息)分类单元,(ii) 通过增加零膨胀进行稀疏化,以及 (iii) 通过注入虚假非零值进行零填充。我们的结果表明,保护判别特征不足以保证支持-查询偏移下的稳定性:在所有数据集中,所有扰动均降低了模型性能,其中零填充始终是最有害的,这表明即使保留了关键分类单元,破坏全局特征结构也会破坏泛化能力。与经典的随机森林基线相比,稀疏化对TFMs的影响不成比例,表明对零膨胀型偏移更敏感。代码已公开于:https://github.com/UMMISCO/metagenomics-fm/。
查看缓存全文
缓存时间: 2026/06/25 05:10
# 表格基础模型能否应对微生物组数据中真实查询分布偏移? 来源:https://arxiv.org/html/2606.24995 11institutetext:法国发展研究所,索邦大学,复杂系统数学建模与信息学单元 \(UMMISCO\),巴黎,法国11email:\{giulia\.perciballi, ahmad\.fall, jean\-daniel\.zucker, edi\.prifti\}@ird\.fr22institutetext:法国国家信息与自动化研究所,法国国家科学研究中心,I3S,蔚蓝海岸大学,瓦尔博讷,法国22email:federica\.granese@inria\.fr33institutetext:法国国家健康与医学研究院,营养与肥胖症;系统方法学,营养组学,AP\-HP,皮提耶-萨勒佩特里医院,巴黎,法国###### 摘要 表格基础模型在微生物组丰度数据上取得了优异性能,但其在真实分布偏移下的鲁棒性仍未得到充分认识。我们引入了一个基准测试,通过六组涵盖四种疾病背景的肠道微生物组数据集,评估表格基础模型对生物启发式扰动的鲁棒性。在此上下文学习设置中,模型接收未受扰动的支持集作为上下文,并对受扰动的查询样本进行评估。为了隔离除“捷径”特征之外的鲁棒性,我们保留了最具判别力的分类单元,并应用了三种受控扰动策略:(i) 移除高丰度(无信息)分类单元,(ii) 通过增加零膨胀进行稀疏化,(iii) 通过虚假非零注入进行零填充。我们的结果表明,保护判别特征不足以确保支持-查询偏移下的稳定性:在所有数据集中,所有扰动都降低了模型性能,其中零填充始终是最有害的,这表明即使保留了关键分类单元,破坏全局特征结构也可能破坏泛化能力。稀疏化对表格基础模型的影响相对于传统随机森林基线更为显著,表明其对零膨胀型偏移更为敏感。我们在 https://github.com/UMMISCO/metagenomics-fm/ 公开提供代码。 ## 1引言 人类微生物组,即人体内外微生物的集合,在健康和疾病状态下直接或间接地影响着广泛的生理过程。因此,微生物组数据集已成为生物医学应用中机器学习方法的重要测试平台。微生物组研究通过分析样本间分类单元的相对丰度来刻画微生物群落,生成矩阵,其中行对应样本,列对应分类单元(即特征)。与标准表格数据相比,微生物组数据具有两个独特的结构特性:成分性(特征表示相对丰度,总和为常数)和显著的零膨胀(由于生物性缺失或测序深度限制,许多分类单元在给定样本中未被观测到)\[2 (https://arxiv.org/html/2606.24995#bib.bib2)\]。此外,由于人群差异、测序方案差异及预处理流程差异,不同队列之间存在显著变异。特别是,本工作聚焦于肠道微生物组,它与包括2型糖尿病、肥胖、炎症性肠病和肝硬化在内的多种系统性疾病相关,并且与其他身体部位相比,其多样性尤为突出,且在健康个体之间组成差异很大\[21 (https://arxiv.org/html/2606.24995#bib.bib21)\]。这些变异来源使得此类数据集成为机器学习模型具有挑战性的场景,尤其是当训练或基于一个队列的模型被应用于不同人群或实验条件样本时\[2 (https://arxiv.org/html/2606.24995#bib.bib2)\]。 表格基础模型已成为低数据量场景(如微生物组数据)下经典机器学习方法的强大替代方案。这些模型利用上下文学习:在推理时,提供一个带标签的支持集作为上下文,模型在单次前向传播中生成预测,无需更新参数。由于上下文学习依赖于支持样本与查询样本之间的相似性而非参数更新,其有效性可能对上下文样本与查询样本之间的分布不匹配特别敏感。尽管在标准表格基准上表现出色\[8 (https://arxiv.org/html/2606.24995#bib.bib8)\],但尚不清楚它们是否适合微生物组数据的成分性和稀疏结构。为探究此问题,我们做出以下贡献: 1. 1.我们提出了一种基于查询分布偏移的评估协议,专为表格基础模型设计:支持集保持未扰动,仅对查询样本施加扰动。此设计隔离了支持-查询不匹配下上下文学习的鲁棒性(参见第3.2节 (https://arxiv.org/html/2606.24995#S3.SS2))。 2. 2.我们开发了三种生物启发式扰动算法,用于修改微生物组丰度数据的关键结构特性(即成分性和零膨胀),同时保留信息特征。该设计隔离了模型对分布偏移的鲁棒性,而不移除底层预测信号(参见第3.1节 (https://arxiv.org/html/2606.24995#S3.SS1))。 3. 3.通过在六个肠道微生物组数据集和六个最先进的表格基础模型上进行大量实验,我们分析了不同形式的分布扰动如何影响表格基础模型,并与经典基线进行比较,揭示了不同扰动类型下的不同鲁棒性模式(参见第5节 (https://arxiv.org/html/2606.24995#S5))。 ### 1.1相关工作 传统的机器学习模型,如XGBoost\[3 (https://arxiv.org/html/2606.24995#bib.bib3)\]、随机森林\[1 (https://arxiv.org/html/2606.24995#bib.bib1)\]和多层感知机,长期以来主导着表格数据分类,但它们需要特定任务的训练,并且高度依赖超参数和编码的归纳偏置。为了更好地捕捉表格数据中的复杂模式,近期方法将表格预测重新定义为表格补全问题,即从已观测条目预测缺失条目。基于此视角,TabPFN\[10 (https://arxiv.org/html/2606.24995#bib.bib10)\]被提出作为首个面向表格数据的基础模型,它利用上下文学习直接从提示中分类新样本,无需基于梯度的微调。在TabPFN的基础上,一些模型将此范式扩展到更大数据集和更高维的特征空间。TabICL\[20 (https://arxiv.org/html/2606.24995#bib.bib20)\]使用分解式Transformer,通过列级和行级注意力机制高效地扩展上下文学习。TabDPT\[14 (https://arxiv.org/html/2606.24995#bib.bib14)\]结合检索增强型Transformer与Flash Attention,以处理现实世界的表格数据集,无需针对特定数据集进行调整。ContextTab\[22 (https://arxiv.org/html/2606.24995#bib.bib22)\]引入列名的语义嵌入,以利用大规模表格中的特征含义。这些模型展示了表格补全框架如何使基于Transformer的基础模型能够泛化到多种表格任务,同时避免每任务重新训练。 在此思想基础上形成了若干扩展。TabPFN-Wide\[12 (https://arxiv.org/html/2606.24995#bib.bib12)\]和TabFLEX\[24 (https://arxiv.org/html/2606.24995#bib.bib24)\]将上下文学习应用于更宽、更复杂的表格,而TabICL和TabPFN的更新版本(第4.1.4节 (https://arxiv.org/html/2606.24995#S4.SS1.SSS4))通过分解式Transformer架构和优化提示进一步提升了效率和特征覆盖率。在特定领域应用中,文献\[18 (https://arxiv.org/html/2606.24995#bib.bib18)\]的作者并未修改TabPFN的架构,而是调整了PFN模型的先验,以生成类宏基因组合成数据。 ## 2预备知识 ### 2.1微生物组丰度数据 微生物组丰度数据表示为一个矩阵(分类丰度表)X∈Rn×d,其中行代表样本,列代表分类单元(即从机器学习视角看,是特征),每个条目Xij表示样本i中分类单元j的丰度。该数据类型具有两个区别于通用表格数据的结构特性\[2 (https://arxiv.org/html/2606.24995#bib.bib2)\]: 1. 1.成分性。在分类丰度表中,样本的各个分量之和为常数,因此特征位于单纯形上,这意味着增加一个分类单元的丰度必然会减少其他分类单元的相对贡献。形式上,X是成分数据集当且仅当∀i∈{1,...,n},X的行向量xi位于单纯形 Cd={xi∈Rd:∀j,xij>0;∑j=1dxij=κ},其中κ>0为常数,通常为1。 2. 2.稀疏性。分类丰度表具有高比例的零值,这意味着分布呈右偏态,且在零点处有大量质量聚集(零膨胀)。值得注意的是,应谨慎对待零值,它们可能源于微生物群落的生物异质性(其中许多生物仅在一小部分样本中被检测到),也可能来自技术限制,阻止了对某些低丰度分类单元的检测。 上述两个特性直接启发了第3.1节 (https://arxiv.org/html/2606.24995#S3.SS1)中的算法。成分性意味着局部扰动一个分量(即分类单元)会直接影响样本的所有其他分量,这一性质催生了算法1和算法3。零膨胀结构使得模型对改变样本零/非零模式的扰动敏感,这催生了算法2。 ### 2.2表格基础模型 表格基础模型是一类专为表格数据定制的新型神经网络。其卓越性能源于通过上下文学习进行预测:在推理时,提供一个带标签的支持集作为上下文,模型在单次前向传播中为未见过的查询样本生成预测,无需任何参数更新。表格基础模型基于先验数据拟合网络框架\[16 (https://arxiv.org/html/2606.24995#bib.bib16)\],其中Transformer在从任务先验中采样的合成数据集上进行预训练。该过程元学习了一个贝叶斯后验预测推断的近似方法,使模型能够在测试时泛化到新任务,前提是目标分布与预训练先验一致。 表格基础模型在广泛的应用场景中表现出色。然而,它们在微生物组丰度数据上的鲁棒性仍未得到充分认识。虽然先前的工作\[18 (https://arxiv.org/html/2606.24995#bib.bib18)\]探讨了将TabPFN\[10 (https://arxiv.org/html/2606.24995#bib.bib10)\]的先验分布调整为适用于该数据类型,但未系统分析表格基础模型在此领域的失败模式。此外,该工作先于近期表格基础模型的涌现,如今已有性能更强的模型。这促使我们对表格基础模型在微生物组数据上的鲁棒性进行系统性评估。 ### 2.3表格基础模型预训练 预训练机制从根本上塑造了表格基础模型在推理时的行为。TabPFN和TabICL均通过在从结构化任务先验中采样的合成数据集上进行预训练,因此对真实特征分布没有隐含先验。然而,TabICL引入了一个列级集合Transformer,该Transformer显式地感知支持集的分布。相反,ConTextTab和TabDPT利用在真实世界数据上的大规模预训练,分别使用T4\[6 (https://arxiv.org/html/2606.24995#bib.bib6)\]和OpenML\[23 (https://arxiv.org/html/2606.24995#bib.bib23)\]数据集。因此,它们发展了关于真实数据分布的先验。 参见说明文字图 1:扰动流程 – 从原始分类丰度矩阵X开始,通过ANOVA F检验和随机森林识别信息特征FI并保护其免受扰动。然后,三种扰动算法之一仅应用于无信息特征FU。扰动后的矩阵X'最终通过拼接FU'与原始FI,并进行逐行重新归一化以保持成分性约束来重建。 ## 3方法 本节介绍评估表格基础模型在微生物组丰度数据上鲁棒性的提议框架。我们首先介绍生物启发式扰动策略,然后描述评估协议。实验参数的更多细节在第4.1节 (https://arxiv.org/html/2606.24995#S4.SS1)中提供。 ### 3.1扰动流程 扰动流程(参见图1 (https://arxiv.org/html/2606.24995#S2.F1))的目标是设计一个框架,引入针对微生物组数据两个结构特性(成分性和稀疏性,即零膨胀)的受控分布偏移。在下文中,我们将扰动后的分类丰度矩阵记为X'。值得注意的是,在我们的算法中,我们要求X'保持成分性。我们将扰动算法的伪代码放入附录A.2(补充材料)中。我们在图5(补充材料)中提供了随扰动强度增加、按类别分层的各个特征的平均丰度分布。 #### 3.1.1信息特征 vs. 无信息特征选择。为避免琐碎的失效模式,我们首先区分信息特征和无信息特征。具体而言,如果一个特征对模型在目标任务上的预测性能有显著贡献,则将其定义为信息特征。我们注意到,被机器学习模型判断为重要的特征可能并不与领域专家认为相关的特征一致。然而,由于我们的目标是评估模型对查询分布偏移的鲁棒性,我们采用数据驱动的特征重要性概念。扰动高度判别性的分类单元会琐碎地降低性能,因此对理解分布偏移下的鲁棒性提供的见解有限。因此,我们的扰动仅应用于无信息特征,从而隔离了模型在超越捷径依赖之外的鲁棒性。 令y∈Yn表示目标任务的标签向量。我们首先通过单因素ANOVA F检验对特征按重要性排序,这提供了无需辅助学习器的模型无关排序。为确定数据集中真正信息特征的数量,我们应用以下流程:在交叉验证下,在完整数据集上训练随机森林分类器,得到基线AUROC a0。然后,我们迭代地移除排名最高的特征,并在每次移除步骤j后重新计算AUROC aj。只要aj-1 - aj < δ(即下降低于阈值δ=0.03),则被移除的特征被视为信息特征。该过程在第一步j⋆处停止,此时下降超过δ,我们将FI={1,...,j⋆}定义为信息特征集。相似文章
表格基础模型是否与自身一致?
本文研究了表格基础模型(TFMs)如 TabPFN、TabICL、TabDPT 和 TabFM 是否能够产生与任何联合分布一致的预测。结果表明,所有被评估的 TFM 在分类和回归任务中均违反了边际化一致性和分解一致性,从而对其贝叶斯推断的主张提出了质疑。
超越IID:表格基础模型到底有多通用?
本文介绍了BeyondArena,一个统一的表格数据整体基准,并发现现有的表格基础模型仅在小到中等规模的IID数据上表现优异,而传统的基于树和深度学习模型仍然在非IID、大规模和高维数据集上占据主导地位。
用于离散选择估计的表格基础模型
本文提出一种重新表述方法,将表格基础模型(TFMs)应用于离散选择估计,解决了行独立假设的结构性差距。最佳重新表述在留出对数似然上优于层次贝叶斯估计8%,在命中率上优于3.6%,同时运行速度快16倍。
TabFM:一种用于表格数据的零样本基础模型
Google Research 推出了 TabFM,这是一种用于表格数据的零样本基础模型,利用上下文学习来执行分类和回归任务,无需手动训练模型或调整超参数。
当表格基础模型遇到策略性表格数据:一种先验对齐方法
本文研究了基于预训练先验数据拟合网络的表格基础模型是否能够泛化到个体在部署后修改特征的策略性表格数据。提出了策略性先验数据拟合网络(SPN),这是一个无需重新训练即可将PFN预测与操纵后分布对齐的推理时框架。