表格基础模型还需要特征工程吗?
摘要
一项控制研究发现,对于更强的表格基础模型,特征工程的收益逐渐减少,而添加来自相关数据集的上下文信息仍能提升性能。
arXiv:2609.13202v1 公告类型:新
摘要:特征工程长期以来一直是表格机器学习的基石。表格基础模型(TFMs)在广泛的表格数据集上进行预训练,并通过上下文学习进行应用。它们的兴起引发了一个自然的问题:随着这些模型变得更强大,手动特征构建是否仍然重要?为了回答这个问题,我们对两个主要TFM家族的多个版本进行了控制研究,在TabArena的基准数据集上测试了多种现有的特征工程技术。我们发现了一个一致的模式:特征工程的收益集中在早期的模型世代,而对于最强的模型则变得可以忽略不计。这些结果表明,更强的TFMs对显式工程化的输入表示依赖较少。然而,在一个补充实验中,添加来自相关数据集的上下文信息仍然能提升性能。我们的发现表明,对于更强的TFMs,性能收益的来源发生了转变:重新表示现有输入变得不那么有效,而提供额外的任务相关上下文仍然有益。
查看缓存全文
缓存时间: 2026/09/15 08:35
# 表格基础模型是否仍需特征工程?
来源:https://arxiv.org/html/2609.13202
###### 摘要
特征工程长期以来一直是表格机器学习的基石。表格基础模型(TFMs)在多种表格数据集上进行预训练,并通过上下文学习进行应用。随着这些模型能力的提升,一个自然的问题浮现:当这些模型变得更强大时,人工特征构建是否仍然重要?为回答此问题,我们针对两个主要TFM系列的多个版本进行了对照研究,在TabArena基准数据集上测试了广泛的现有特征工程技术。我们发现了一致的模式:特征工程的收益集中于早期模型版本,对于最强大的模型则变得微不足道。这些结果表明,更强大的TFM对显式工程化的输入表征的依赖更小。然而,在一项补充实验中,添加来自相关数据集的上下文信息仍然能提升性能。我们的发现表明,更强大TFM的性能增益来源发生了转变:对现有输入的重新表征效果减弱,而提供额外的任务相关上下文仍然有益。
## 引言
特征工程通过将原始变量转换为能更好暴露有用统计结构(24 (https://arxiv.org/html/2609.13202#bib.bib2))的表征,来提升预测性能。这一做法隐含的假设是,此类结构应在学习之前编码到输入表征中,而非由估计器本身推断。
表格基础模型(TFMs)挑战了这一假设。TFMs在多种表格任务上进行预训练,并通过上下文学习进行应用,可能减少对特定任务特征工程的需求。随着这些模型能力增强,以前需要显式转换才能获得的统计结构,可能从原始输入中变得越来越容易获取。这就引出了一个依赖于能力的问题:随着TFMs变得更强大,特征工程的边际价值是否会下降?
近期研究表明,特征工程流程可以通过显式暴露数据中的有用结构来提升TFMs的性能(21 (https://arxiv.org/html/2609.13202#bib.bib12))。然而,目前尚不清楚这些收益是反映了TFMs在从原始输入中恢复结构方面的持续局限,还是集中在特定模型和数据集上,并且随着TFMs能力的增强而减弱。现有证据并未区分这些可能性,因为特征工程的价值尚未在对照的、估计器内部的设置中,跨模型版本进行系统比较。
回答这个问题需要在每个固定的估计器内评估特征工程,然后比较其在连续TFM版本中的效果。因此,我们研究工程化表征是否在模型版本、数据集和任务中提供一致的收益。我们进一步研究,从特征转换中获益甚少的TFM,是否仍然能利用来自相关数据集的额外样本。这些分析共同研究,更强大的TFM是普遍变得对额外干预反应减弱,还是干预的价值从重新表征现有输入转向提供额外的任务相关上下文。
为进行这项研究,我们在TabArena(6 (https://arxiv.org/html/2609.13202#bib.bib11))的数据集上评估了TabPFN和TabICL系列的连续版本。对于每个数据集、划分和估计器,我们使用模型的默认配置和原生预处理,同时保持评估协议固定。这种配对比较隔离了特征工程效果如何随模型版本变化。在另一项独立实验中,我们研究了更强大的TFM是否仍然能从与目标任务兼容的额外源示例中受益。
在所评估的TabArena任务中,通用特征工程不是TFMs可靠改进的来源。大多数转换是中性的或有害的,而正向收益集中在特定数据集和较早的模型版本。对于最强大的模型,跨数据集的收益趋近于零。然而,这些模型仍然对来自相关数据集的额外示例有响应。这种对比表明,通用特征转换价值的下降不应被解释为无法利用额外任务相关信息的普遍能力缺失。
我们的贡献是对TFMs特征工程进行了一次对照性的经验再评估。通过隔离跨连续TabPFN和TabICL版本的估计器内收益,我们表明通用特征工程的益处集中在较早的模型和一小部分数据集上,而对于最强大的模型则变得微不足道。我们补充的上下文增强实验证据表明,这些模型仍然可以利用额外的任务相关信息,这表明改进的机会正在从重新表征现有输入转向丰富可用的任务上下文。
## 相关工作
特征工程转换输入变量,以暴露可能更容易被特定估计器使用的结构。常见方法包括数值转换、类别编码、离散化和交互项构建。先前的工作表明,工程化特征与估计器之间存在交互作用:不同的模型类别对相同的工程化结构可能有不同的响应(10 (https://arxiv.org/html/2609.13202#bib.bib1))。基于树的模型和神经网络表格模型在对信息贫乏特征的鲁棒性、特征方向性和不规则目标函数方面也存在差异(9 (https://arxiv.org/html/2609.13202#bib.bib3))。在神经网络模型内部,缩放和排序等转换可以使不规则目标更平滑,但也可能丢弃信息或损害优化,因此其实用性取决于特征和模型设置(3 (https://arxiv.org/html/2609.13202#bib.bib4))。这些发现促使我们为每个估计器单独评估特征转换。
表格基础模型引入了不同的设置。TabPFN和TabICL在多种表格任务上进行预训练,并通过上下文学习适应新数据集,而连续版本在架构、预训练、上下文容量和可处理的数据集大小上有所不同(11 (https://arxiv.org/html/2609.13202#bib.bib5);12 (https://arxiv.org/html/2609.13202#bib.bib6);7 (https://arxiv.org/html/2609.13202#bib.bib7);8 (https://arxiv.org/html/2609.13202#bib.bib8);18 (https://arxiv.org/html/2609.13202#bib.bib9);19 (https://arxiv.org/html/2609.13202#bib.bib10))。这样的变化可能改变哪些结构可以直接从原始输入中恢复,哪些结构仍然受益于显式转换。因此,从一个模型版本获得的证据无法确立特征工程的效果是否在后续版本中持续存在。
TabPrep与我们的研究密切相关(21 (https://arxiv.org/html/2609.13202#bib.bib12))。它生成针对数值交互、组条件效应和伪类别数值结构的特征变体,并在TabArena的训练、调整和集成流程中进行评估。其结果表明,工程化变体可以在这个更广泛的流程中提升性能,特别是在应用于TabPFN-2.5时。我们的研究提出一个互补的问题:在每个估计器内、在共同的评估协议下测量的特征工程的配对效果,如何随TabPFN和TabICL的连续版本变化?
## 问题设置与估计量
### 符号
令第 d 个表格预测任务为
\mathcal{D}\_d = (X\_d, y\_d),其中 X\_d 表示原始预测变量,y\_d 表示分类或回归目标。令 m 表示固定的表格基础模型估计器,包括其检查点、默认配置、集成过程和原生预处理流程。
遵循将特征工程视为预测前对输入表征进行显式转换的标准观点(24 (https://arxiv.org/html/2609.13202#bib.bib2)),我们将每个外部特征工程条件表示为一个映射
T\_k: \mathcal{X}\_d \rightarrow \mathcal{Z}\_{d,k}。恒等条件 T\_0(X) = X 对应于除了基础模型原生预处理之外没有额外的外部特征工程。每个 k > 0 表示一个预先指定的干预,\mathcal{K}(d) 表示适用于数据集 d 的非恒等干预集合。T\_k 的任何数据依赖组件仅使用相应的训练划分拟合。
令 \mu\_{d,s,m,k} 表示在数据集 d、评估划分 s、估计器 m 和表征条件 k 下获得的测试指标。令 \sigma\_q \in \{-1, +1\} 表示指标 q 的方向,当值越大越好时 \sigma\_q = +1,当值越小时越好时 \sigma\_q = -1。
### 特征工程收益
我们定义相对于恒等表征的方向归一化配对收益为
\delta\_{d,s,m,k} = \sigma\_q \left( \mu\_{d,s,m,k} - \mu\_{d,s,m,0} \right)。因此,\delta\_{d,s,m,k} > 0 一致地表示在相同的划分和估计器配置下,干预 k 优于恒等表征。
我们通过以下方式总结每个数据集内的重复配对评估
\Delta\_{d,m,k} = \mathrm{median}\_s \; \delta\_{d,s,m,k}。评估划分被视为数据集内的重复测量,而数据集是基准级别分析的单位。
为了确定任何评估的干预是否优于恒等,我们定义观测到的最佳特征工程收益为
B\_{d,m} = \max\_{k \in \mathcal{K}(d)} \Delta\_{d,m,k}。因此,B\_{d,m} \leq 0 表示没有适用于数据集 d 的评估干预能够实现正的中位数配对收益,而 B\_{d,m} 是一个预言机式观测,报告了观测到的最佳条件,但并不意味着在没有验证集的情况下可以选择此条件。
### 有序假设检验
对于每个版本系列,令 D 表示基准数据集的数量,G 表示估计器版本的数量,按时间顺序排列并由 g = 1, \ldots, G 索引。我们使用 B\_{d,g} 表示在数据集 d、版本 g 上评估的上述最佳观测收益。候选集 \mathcal{K}(d) 跨版本固定,数据集是推断的独立单位。
对于 G > 2 的 TabPFN 版本系列,我们使用单侧精确 Page 检验来检验最佳观测余量的有序下降(17 (https://arxiv.org/html/2609.13202#bib.bib22))。在零假设下,版本标签在每个数据集内是可交换的。备择假设是较大的 B\_{d,g} 值倾向于出现在较早的版本位置。
对于每个数据集 d,令 r\_{d,g} 表示 B\_{d,g} 在 G 个版本中升序的中间秩。Page 统计量为
L = \sum\_{d=1}^{D} \sum\_{g=1}^{G} (G+1-g) r\_{d,g}。由于较早版本获得更大的权重,较大的 L 值为有序下降提供更强的证据。我们通过枚举数据集内版本标签的所有排列来计算精确的单侧原始 p 值。
TabICL 分类仅包含两个版本,因此有序比较简化为配对检验。对于每个数据集,令
C\_d = B\_{d,\mathrm{v1}} - B\_{d,\mathrm{v2}},其中 C\_d > 0 表示从 v1 到 v2 的最佳观测余量减少。我们使用
T = \frac{1}{D} \sum\_{d=1}^{D} C\_d 作为单侧精确符号翻转检验的统计量。在零假设下,配对差值关于零对称。精确原始 p 值在所有 2^D 种符号分配上计算。
来自三个预定主检验的精确单侧 p 值使用 Benjamini-Hochberg 程序进行联合调整,以 q < 0.05 作为主要多重性调整显著性标准(2 (https://arxiv.org/html/2609.13202#bib.bib23))。我们还报告 Holm 调整后的 p 值,以评估在族-wise 错误控制下的稳健性(13 (https://arxiv.org/html/2609.13202#bib.bib24))。作为描述性效应摘要,我们报告中位数配对首尾差
\widetilde{C} = \mathrm{median}\_d \left( B\_{d,1} - B\_{d,G} \right) 和
N\_{\downarrow} = \sum\_{d=1}^{D} \mathbf{1}\left\{ B\_{d,1} > B\_{d,G} \right\},即具有正首尾差的数据集数量。
## 实验
我们在13个TabArena数据集(表1 (https://arxiv.org/html/2609.13202#Sx4.T1))上评估了TabPFN和TabICL系列的12个估计器版本:8个分类任务和5个回归任务。分类组包括TabPFN v1、v2、v2.5、v2.6、v3、TabICL v1和TabICL v2;所有选定的分类数据集都满足TabPFN v1的样本和特征限制(最多1024个训练样本和100个特征),确保每一代都在相同的数据集上进行评估。这一限制是有意的:小数据任务是TFMs的预期操作环境,并为测试当任务特定证据有限时,特征工程是否仍然提供有用的归纳偏见提供了一个严格的环境。回归实验包括TabPFN v2、v2.5、v2.6、v3和TabICL v2,因为TabPFN v1和TabICL v1都仅用于分类。所有实验均在配备32 GB NVIDIA Tesla V100和AMD Ryzen 9700X处理器的Ubuntu服务器上运行。
数据集 | 样本数 | 特征数 | 类别数 | 类型
--- | --- | --- | --- | ---
血液传输 | 748 | 4 | 2 | 分类
糖尿病 | 768 | 8 | 2 | 分类
退火 | 898 | 38 | 5 | 分类
信用-g | 1,000 | 20 | 2 | 分类
母体健康 | 1,014 | 6 | 3 | 分类
QSAR生物降解 | 1,054 | 41 | 2 | 分类
网站钓鱼 | 1,353 | 9 | 3 | 分类
健身俱乐部 | 1,500 | 6 | 2 | 分类
QSAR鱼毒性 | 907 | 6 | — | 回归
混凝土强度 | 1,030 | 8 | — | 回归
医疗保健保险 | 1,338 | 6 | — | 回归
翼型噪声 | 1,503 | 5 | — | 回归
二手菲亚特500 | 1,538 | 7 | — | 回归
表1:本研究中使用的13个TabArena数据集,在每个任务内按样本数排序。
对于每个数据集和估计器,我们将恒等基线与来自七个家族的26个特征工程条件进行比较:尺度和幂变换、类别编码、离散化、交互特征、选择方法、TabPrep组合流程以及两个从上下文学习改编的提示启发式条件。每个条件是一个单一的原子转换;根据列类型,这些条件中有16到26个适用于给定的数据集。数据依赖组件仅在相应的训练划分上拟合。
每个条件都在30个官方TabArena划分(10次重复 × 3折)上进行评估。对于每个数据集、估计器和特征工程组合,我们计算其相对于相同划分上恒等基线的配对收益,并通过单元内中位数 \Delta\_{d,m,k} 进行总结;最佳观测收益 B\_{d,m} 是这些中位数在适用的非恒等条件上的最大值。遵循TabArena协议(6 (https://arxiv.org/html/2609.13202#bib.bib11)),我们对分类采用宏F1,对回归采用符号反转的RMSE,以便正值始终有利于特征工程。
表2:按家族分组的26个特征工程条件。适用性取决于数据集列类型;未显示恒等基线。提示启发式家族改编了两种形式的上下文增强。相似文章
超越IID:表格基础模型到底有多通用?
本文介绍了BeyondArena,一个统一的表格数据整体基准,并发现现有的表格基础模型仅在小到中等规模的IID数据上表现优异,而传统的基于树和深度学习模型仍然在非IID、大规模和高维数据集上占据主导地位。
训练公平表格基础模型
本文提出FairTFM,一种将公平性约束融入表格基础模型的训练策略,通过上下文学习实现公平预测,无需针对特定任务的重新训练。
当表格基础模型遇到策略性表格数据:一种先验对齐方法
本文研究了基于预训练先验数据拟合网络的表格基础模型是否能够泛化到个体在部署后修改特征的策略性表格数据。提出了策略性先验数据拟合网络(SPN),这是一个无需重新训练即可将PFN预测与操纵后分布对齐的推理时框架。
表格基础模型是否与自身一致?
本文研究了表格基础模型(TFMs)如 TabPFN、TabICL、TabDPT 和 TabFM 是否能够产生与任何联合分布一致的预测。结果表明,所有被评估的 TFM 在分类和回归任务中均违反了边际化一致性和分解一致性,从而对其贝叶斯推断的主张提出了质疑。
表格基础模型在微生物组数据的真实查询分布偏移下是否鲁棒?
本文评估了表格基础模型在微生物组数据中受生物学启发的分布偏移下的鲁棒性,发现保护判别特征不足以保证稳定性,且零填充是最有害的扰动。