自监督预训练何时有助于表格模型?标签稀缺与缺失数据研究

arXiv cs.LG 论文

摘要

本文评估了在标签稀缺和缺失数据条件下表格模型的自监督预训练,发现效果混合但在测试时缺失情况下有可靠改进。

arXiv:2608.24381v1 Announce Type: new Abstract: 自监督学习(SSL)已成为表格数据的一种有前景的方法,但在极端标签稀缺和测试时缺失情况下的有效性仍待探索。本文中,我们评估了一种掩码恢复SSL预训练目标,对比从零训练和经典基线,在14个多样化的分类任务上进行。首先,虽然SSL平均上优于从零训练,并与最先进的树集成模型保持竞争力(在10%标签下达到~0.8954 AUC,而Random Forest为0.9015),但SSL相对于从零训练的增益表现出高任务间方差且缺乏显著性(在5%和10%标签下p = 0.626)。其次,与缺失值插补目标普遍有益于具有原生缺失的数据集的假设相反,SSL在干净数据集上产生最可靠的改进,而经常在具有高固有缺失率的数据集上降低性能。第三,尽管有这种训练方差,SSL预训练模型在测试时缺失完全随机(MCAR)注入和结构化缺失偏移(MNAR)下,平均AUC均高于从零训练的模型(MCAR下+0.0245 AUC,在14个任务中有11个为正;MNAR下+0.0418 AUC,在14个任务中有8个为正),但经过Holm-Bonferroni多重比较校正后,两者差异均不具有统计学显著性(调整后p值分别为0.118和0.518)。第四,将我们的掩码恢复目标与三个既定的表格SSL基线(VIME, SCARF, SubTab)在相同编码器架构下比较,我们发现与任何基线均无显著差异(调整后p值分别为0.459, 1.000, 1.000),这表明我们的发现反映了表格SSL的一般特性,而非特定预训练任务的独特性质。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:36

# 自监督预训练何时对表格模型有帮助?标签稀缺性与缺失数据研究
来源:https://arxiv.org/html/2608.24381
Sahand Mazrouei 单位:哈拉兹米大学数学与计算机科学学院 邮箱:[sahand\.mazrue@khu\.ac\.ir](mailto:)

###### 摘要

自监督学习(SSL)已成为处理表格数据的一种有前景的方法,但其在极端标签稀缺和测试时缺失情况下的有效性仍待探索。本文在14个多样化的分类任务中,评估了一种基于掩码-恢复的SSL预训练目标,并将其与从头训练及经典基线方法进行对比。首先,尽管SSL平均性能优于从头训练,且与最先进的树集成模型(在10%标签下实现约0.8954 AUC,而随机森林为0.9015)保持竞争力,但SSL与从头训练之间的性能差异在不同任务间表现出高度方差且不具统计显著性(在5%和10%标签下p=0.626)。其次,与“缺失值插补目标普遍有益于原生缺失数据集”的假设相反,SSL在干净数据集上带来最可靠的性能提升,而在固有缺失率高的数据集上常导致性能下降。第三,尽管训练阶段存在方差,但经过测试时完全随机缺失(MCAR)注入(+0.0245 AUC,14个任务中11个呈正向)和结构性缺失偏移(MNAR,+0.0418 AUC,14个任务中8个呈正向)后,SSL预训练模型的平均AUC均高于从头训练模型,但经过多重比较的Holm-Bonferroni校正后,两者差异均未达到统计显著性(调整后p值分别为0.118和0.518)。第四,在相同编码器架构下,将我们的掩码-恢复目标与三种现有表格SSL基线(VIME、SCARF、SubTab)对比,发现与任一方法均无显著差异(调整后p值分别为0.459、1.000、1.000),表明我们的发现反映了表格SSL的通用特性,而非某一特定前置任务的独特性。

关键词:表格数据,自监督学习,缺失数据,标签稀缺性,鲁棒性

## 1引言

表格数据至今仍是存储医疗到金融预测等多领域异构信息的主流格式。尽管深度学习在视觉和自然语言处理领域占主导地位,但基于树的集成方法(如随机森林和梯度提升树)在表格任务上常优于深度神经网络。在两个截然不同的挑战下,这种性能差距在真实场景中进一步扩大:*标签稀缺*(标注样本成本高或速度慢)和*特征缺失*(因传感器故障、隐私限制或不规则报告导致数据丢失)。

自监督学习(SSL)为解决这些限制提供了有力框架。通过在大量无标签特征上优化重构或对比目标,深度表格编码器可以在微调少量标签子集前学习底层数据流形。近期的表格SSL架构通常采用“掩码、破坏、恢复”范式。然而,现有文献主要在完全观测的干净数据集上评估这些方法。SSL重构目标与原生包含缺失值的数据集之间的交互作用,以及模型在测试时缺失分布偏移下的鲁棒性,仍是待解决的实证问题。

本研究在现实约束下对表格SSL进行了全面评估。我们在精选的OpenML分类任务套件中,将SSL预训练的表格编码器与从头训练的相同架构以及经典机器学习基线进行对比。我们的实验设计通过强制采用1%、5%、10%和20%的标签稀缺比例,并评估测试时缺失注入下的恢复能力,明确测试了SSL的极限。

我们的分析超越了综合性能榜单,揭示了数据集依赖的表格SSL动态特性。主要贡献如下:

- •标签稀缺性基准测试:我们证明SSL预训练与经典基线高度竞争,在10%标签比例下,尽管归纳偏置远少,其平均AUC-ROC分数与随机森林的差距仅约0.006。然而,我们发现SSL与从头训练之间的差异在不同任务间方差很大,且本身不具统计显著性。
- •缺失与干净数据的悖论:我们揭示了SSL与缺失数据之间的微妙交互。虽然重构目标本身即学习插补,但结果表明SSL在*干净*数据集上带来最一致的下游分类提升。在原生缺失率高的数据集上,SSL性能高度依赖于数据集本身。
- •对测试时退化的鲁棒性:我们证明SSL预训练模型在推理时输入退化下比从头训练模型保持更高准确率。在完全随机缺失(MCAR)注入(+30%缺失率)和非随机缺失(MNAR)结构偏移下,SSL模型比从头训练模型退化更平缓,但经多重比较校正后,此优势在我们的四个主要假设检验中未达显著性。
- •表格SSL组件消融:我们在四个原生缺失数据集上对一致性损失、组掩码和掩码可见性进行了消融。初步的单种子对比显示去除一致性损失有显著且一致的效果;然而,当我们用三个独立预训练种子重新运行每个变体(比本文其他部分更严格的协议)后,该效应降至统计噪声水平(平均ΔAUC=+0.0031,p=0.625)。在我们的四任务样本中,三个被消融组件均未表现出可靠、可泛化的效果,突显了在小样本表格SSL研究中仅凭单种子消融对比得出结论的风险。
- •与现有表格SSL目标的对比:在相同编码器架构下,我们在所有14个任务的10%标签设置下,将我们的掩码-恢复目标与三种已确立的表格SSL前置任务(VIME、SCARF和SubTab)进行对比。三种基线均与我们的方法无显著差异(Wilcoxon p值分别为0.153、0.670、0.502;经Holm-Bonferroni校正后仍不显著),表明在架构匹配的受控对比下,我们的目标在实证上与现有表格SSL公式相当,而非有别于它们。

## 2相关工作

### 2\.1表格数据的深度学习

虽然深度神经网络已革新了非结构化数据领域,但如XGBoost\[1 (https://arxiv.org/html/2608.24381#bib.bib1)\]、LightGBM\[2 (https://arxiv.org/html/2608.24381#bib.bib2)\]和随机森林\[3 (https://arxiv.org/html/2608.24381#bib.bib3)\]等基于树的模型仍是表格数据的主流范式;Grinsztajn等人\[7 (https://arxiv.org/html/2608.24381#bib.bib7)\]将这种持续存在的差距部分归因于深度模型对非信息特征的敏感性,以及其归纳偏置不适合表格数据。近期为使深度学习适应表格数据集的工作引入了专门架构。TabNet\[4 (https://arxiv.org/html/2608.24381#bib.bib4)\]利用顺序注意力进行特征选择,FT-Transformer\[5 (https://arxiv.org/html/2608.24381#bib.bib5)\]将多头自注意力应用于表格输入,而TabTransformer\[9 (https://arxiv.org/html/2608.24381#bib.bib9)\]、SAINT\[6 (https://arxiv.org/html/2608.24381#bib.bib6)\]和Non-Parametric Transformers\[10 (https://arxiv.org/html/2608.24381#bib.bib10)\]将基于注意力的建模扩展到行、列或两者。另外,Gorishniy等人\[8 (https://arxiv.org/html/2608.24381#bib.bib8)\]表明,学习到的数值特征嵌入会独立于编码器架构显著影响下游性能。本研究中,我们有意采用更简单的双分支MLP编码器(第4节 (https://arxiv.org/html/2608.24381#S4)),以便下游结果的差异可归因于预训练目标而非架构容量。

### 2\.2表格数据的自监督学习

为缓解深度表格模型对数据的渴求,自监督学习(SSL)已从自然语言处理和计算机视觉领域借鉴而来\[17 (https://arxiv.org/html/2608.24381#bib.bib17),18 (https://arxiv.org/html/2608.24381#bib.bib18)\]。VIME\[12 (https://arxiv.org/html/2608.24381#bib.bib12)\]使用恢复被破坏特征和估计掩码向量的前置任务。SCARF\[13 (https://arxiv.org/html/2608.24381#bib.bib13)\]通过边缘分布破坏形成正样本对,从而适应对比学习。SubTab\[14 (https://arxiv.org/html/2608.24381#bib.bib14)\]将表格行划分为多个子集,并通过从部分视图重构完整行来学习表示。

### 2\.3机器学习中的缺失数据处理

缺失数据传统上分为三种机制:完全随机缺失(MCAR)、随机缺失(MAR)和非随机缺失(MNAR)\[19 (https://arxiv.org/html/2608.24381#bib.bib19)\]。经典方法依赖于模型训练前的统计插补(例如,均值插补、K近邻\[21 (https://arxiv.org/html/2608.24381#bib.bib21)\]或MICE\[22 (https://arxiv.org/html/2608.24381#bib.bib22)\]),而更新的方法直接从数据学习插补机制,如MissForest的基于随机森林的迭代方案\[24 (https://arxiv.org/html/2608.24381#bib.bib24)\]和GAIN的对抗插补框架\[23 (https://arxiv.org/html/2608.24381#bib.bib23)\]。我们的经典基线(第5节 (https://arxiv.org/html/2608.24381#S5))使用简单统计插补而非这些学习方法;我们将在附录C (https://arxiv.org/html/2608.24381#A3)中重新讨论这一选择。

## 3背景与问题设定

### 3\.1含缺失值的表格预测

我们考虑在具有NN个样本和dd个特征的表格数据集上进行监督分类。每个样本包含数值特征xnx\_\{n\}、分类特征xcx\_\{c\}和一个标签yy(仅子集可用)。

缺失性通过二值掩码表示:实例ii的数值特征掩码mn\(i\)∈\{0,1\}dnm\_\{n\}^\{\(i\)\}\\in\\\{0,1\\\}^\{d\_\{n\}\},分类特征掩码mc\(i\)∈\{0,1\}dcm\_\{c\}^\{\(i\)\}\\in\\\{0,1\\\}^\{d\_\{c\}\},其中1表示缺失条目。为描述数据集的退化程度,我们定义所有NN个训练实例上的数值缺失率为:

missing\_pct=∑i=1N∑mn\(i\)Ndn×100%\.\\text\{missing\\\_pct\}=\\frac\{\\sum\_\{i=1\}^\{N\}\\sum m\_\{n\}^\{\(i\)\}\}\{N\\,d\_\{n\}\}\\times 100\\%\.

### 3\.2标签稀缺协议

我们使用OpenML的官方训练/测试划分(折0);预处理和预训练仅在训练划分上拟合,绝不在测试数据上进行。我们在训练集的\\{1%,5%,10%,20%\\\}\\{1\\%,5\\%,10\\%,20\\%\\\}比例下采样标注子集。对于每个比例,我们运行3个种子(0, 1, 2),控制标注子集采样和微调轨迹,并报告均值(以及相关时的标准差);SSL预训练本身每个任务运行一次,并在这3个种子间共享。这与消融研究和SSL基线对比(第6.4节 (https://arxiv.org/html/2608.24381#S6.SS4)、6.6节 (https://arxiv.org/html/2608.24381#S6.SS6))不同,后者使用3个独立预训练种子。

### 3\.3评估指标:AUC-ROC

我们使用测试集AUC-ROC评估性能。AUC-ROC衡量模型将随机正样本排名高于随机负样本的概率,跨所有决策阈值汇总。AUC-ROC范围从0.5(随机)到1.0(完美)。对于我们14个任务中属于多分类的部分,我们采用一对多公式并跨类别进行宏平均来计算AUC-ROC;二分类任务使用标准的两类AUC-ROC。

## 4方法

### 4\.1模型架构

设表格数据集为D=\{\(xi,yi\)\}i=1N\\mathcal\{D\}=\\\{\(x\_\{i\},y\_\{i\}\)\\\}\_\{i=1\}^\{N\},其中每个实例xix\_\{i\}包含一个数值特征向量xn∈Rdnx\_\{n\}\\in\\mathbb\{R\}^\{d\_\{n\}\}和一个分类特征向量xc∈Zdcx\_\{c\}\\in\\mathbb\{Z\}^\{d\_\{c\}\}。为明确告知模型缺失信息,我们定义二值掩码向量mn∈\{0,1\}dnm\_\{n\}\\in\\\{0,1\\\}^\{d\_\{n\}\}和mc∈\{0,1\}dcm\_\{c\}\\in\\\{0,1\\\}^\{d\_\{c\}\},其中1值表示缺失条目。

我们使用双分支表格编码器处理这些输入。数值分支将特征及其掩码拼接,通过两层多层感知机(MLP):

hn=MLPnum\(\[xn⊕mn\]\)h\_\{n\}=\\text\{MLP\}\_\{\\text\{num\}\}\(\[x\_\{n\}\\oplus m\_\{n\}\]\)其中⊕\\oplus表示拼接,MLP应用层归一化、ReLU激活和Dropout(丢弃率p=0\.1p=0\.1)将输入投影到128维隐藏层。

同时,分类特征通过可学习的嵌入字典Ej∈R\|Vj\|×32E\_\{j\}\\in\\mathbb\{R\}^\{\|V\_\{j\}\|\\times 32\}处理,其中\|Vj\|\|V\_\{j\}\|是第jj个分类特征的词汇表大小。嵌入被拼接并处理:

hc=MLPcat\(⨁j=1dcEj\(xc,j\)\)h\_\{c\}=\\text\{MLP\}\_\{\\text\{cat\}\}\\left\(\\bigoplus\_\{j=1\}^\{d\_\{c\}\}E\_\{j\}\(x\_\{c,j\}\)\\right\)最终表示h∈R128h\\in\\mathbb\{R\}^\{128\}通过融合数值和分类表示获得:

h=MLPfusion\(\[hn⊕hc\]\)h=\\text\{MLP\}\_\{\\text\{fusion\}\}\(\[h\_\{n\}\\oplus h\_\{c\}\\\]\)

### 4\.2自监督预训练目标

我们的SSL预训练采用“掩码、破坏、恢复”范式。在预训练期间,我们从参数为ρ=0\.3ρ=0\.3的伯努利分布中采样一个人工破坏掩码m~\\tilde\{m\}。破坏后的输入x~\\tilde\{x\}将被掩码的数值值替换为0\.00\.0(缩放均值),分类值替换为专用的\[MASK\]标记。

网络产生两个增强视图x~\(1\)\\tilde\{x\}^\{\(1\)\}和x~\(2\)\\tilde\{x\}^\{\(2\)\}。总损失定义为:

LSSL\\displaystyle\\mathcal\{L\}\_\{\\mathrm\{SSL\}\}=Lrecon\(x~\(1\),x\)\+Lrecon\(x~\(2\),x\)\\displaystyle=\\mathcal\{L\}\_\{\\mathrm\{recon\}\}\(\\tilde\{x\}^\{\(1\)\},x\)\+\\mathcal\{L\}\_\{\\mathrm\{recon\}\}\(\\tilde\{x\}^\{\(2\)\},x\)\+λLcons\(h⁡\(x~\(1\)\),h⁡\(x~\(2\)\)\)\\displaystyle\\quad\+\\lambda\\mathcal\{L\}\_\{\\mathrm\{cons\}\}\(h\(\\tilde\{x\}^\{\(1\)\}\),h\(\\tilde\{x\}^\{\(2\)\}\)\)重构损失Lrecon\\mathcal\{L\}\_\{\\mathrm\{recon\}\}按特征类型划分。对于数值特征,我们仅在人工掩码索引上计算均方误差(MSE):

Lnum=∑j=1dnm~n,j\(x^n,j−xn,j\)2∑j=1dnm~n,j+ε\\mathcal\{L\}\_\{\\mathrm\{num\}\}=\\frac\{\\sum\_\{j=1\}^\{d\_\{n\}\}\\tilde\{m\}\_\{n,j\}\(\\hat\{x\}\_\{n,j\}\-x\_\{n,j\})^\{2\}\}\{\\sum\_\{j=1\}^\{d\_\{n\}\}\\tilde\{m\}\_\{n,j\}\+\\epsilon\}对于分类特征,我们独立计算每个被掩码的分类特征jj的平均交叉熵(CE)(在批次中该特征被掩码的样本上平均),然后对批次中至少有一个样本被掩码的所有dcd\_\{c\}个特征平均这些逐特征损失:

Lcat=1\|J\|∑j∈J∑i=1Bm~c,j\(i\)CE\(x^c,j\(i\),xc,j\(i\)\)∑i=1Bm~c,j\(i\)\\mathcal\{L\}\_\{\\mathrm\{cat\}\}=\\frac\{1\}\{\|J\|\}

相似文章

当表格基础模型遇到策略性表格数据:一种先验对齐方法

arXiv cs.AI

本文研究了基于预训练先验数据拟合网络的表格基础模型是否能够泛化到个体在部署后修改特征的策略性表格数据。提出了策略性先验数据拟合网络(SPN),这是一个无需重新训练即可将PFN预测与操纵后分布对齐的推理时框架。

马尔可夫边界在表格预测中的好、坏与丑

Hugging Face Daily Papers

本文评估了马尔可夫边界在表格预测中的实际效果,发现尽管理论上最优,但由于计算限制和优化目标不匹配,当前的因果发现方法无法持续提升预测性能。

表格上下文学习器能否泛化到生物分子性质预测?

arXiv cs.LG

本文研究了在合成因果表上预训练的表格上下文学习模型能否从有限的标注数据泛化到生物分子性质的预测。作者发现,这些模型在蛋白质适应性回归任务上具有竞争力,但在小分子分类中,表示选择至关重要。

大型语言模型为何在表格预测上失败

Hacker News Top

一篇新的arXiv论文系统性地测试了关于大型语言模型为何在表格预测上失败的五个假设,发现维度是决定性因素:随着输入维度增加,LLM的准确率下降,而经典基线模型的准确率则保持平稳或有所提升。