表格基础模型是否与自身一致?
摘要
本文研究了表格基础模型(TFMs)如 TabPFN、TabICL、TabDPT 和 TabFM 是否能够产生与任何联合分布一致的预测。结果表明,所有被评估的 TFM 在分类和回归任务中均违反了边际化一致性和分解一致性,从而对其贝叶斯推断的主张提出了质疑。
arXiv:2608.06004v1 公告类型:新
摘要:表格基础模型(TFMs)目前是解决表格预测问题的最佳方法。它们被构建为基于预训练先验近似贝叶斯后验预测分布的变换器。这些单变量预测器可以通过采样一个目标并将其添加到特征中,以自回归方式转换为多变量预测器。
然而,所得到的联合分布的忠实性尚未被研究。此外,TFM 无法与后验本身进行评估,至少在真实世界数据集上无法做到,因为真实分布是未知的。因此,我们提出一个不同的问题:一个模型的预测能否由某个联合分布产生?为了回答这个问题,我们提出了任何此类模型必须满足的两个要求。第一个是边际化一致性,要求边际化的条件分布等于直接预测的边际分布。第二个是分解一致性,要求不同的分解顺序产生相同的联合分布。我们评估的每个 TFM 在分类和回归中,在所有数据集上都违反了这两个要求。
查看缓存全文
缓存时间: 2026/08/07 07:53
# 表格基础模型是否与自身一致? 来源:https://arxiv.org/html/2608.06004
###### 摘要
表格基础模型 \(TFMs\) 目前是表格预测问题的最佳方法。它们被构建为基于预训练先验逼近贝叶斯后验预测分布的 Transformer。这些单变量预测器可以通过采样一个目标并将其加入特征,以自回归方式转换为多变量预测器。然而,由此产生的联合分布的忠实性尚未得到研究。此外,TFM 无法直接与后验本身进行比较,至少在真实数据集上不行,因为真实分布是未知的。因此,我们提出一个不同的问题:一个模型的预测结果能否来自*任意*联合分布?为了回答这个问题,我们提出了任何此类模型都必须满足的两个要求。第一个是边际化一致性,要求边际化的条件分布与直接预测的边际分布相等。第二个是因子分解一致性,要求不同的因子分解顺序产生相等的联合分布。我们评估的每个 TFM 在分类和回归任务上、在所有数据集上都违反了这两个要求。
## 1 引言
表格基础模型 \(TFMs\) 建立在一个关于贝叶斯推断的断言之上。Müller 等人(2022)表明,一个在从先验采样的数据集上训练以预测留出目标的 Transformer,可以逼近该先验下的贝叶斯后验预测分布(PPD)。基于这一断言构建的先验数据拟合网络(PFN)蓝图如今支撑着 TabPFN(Hollmann 等人,2025)、TabICL(Qu 等人,2025)、TabDPT(Ma 等人,2025)以及最近的 TabFM(Kong and Das,2026)等 TFM,它们是表格预测任务的最先进方法。虽然当前 TFM 的预测头仅限于单变量分布,实践者却用它们来建模多变量分布,依赖的正是它们近似贝叶斯推断这一断言。一个目标的值可以简单地作为特征附加进去,以调节对另一个目标的预测。将这些条件分布串联起来,就把单变量预测器变成了多变量联合的自回归构造(Vetter 等人,2025)。
参见图 1 标题:图 1:来自 TabPFNv3 的单个 Wine 测试实例上的边际化一致性违反。这种违反可以通过比较 (a) 和 (b) 面板观察到,它们显示的两个分布本应相等,但实际上并不相等。(a) 表示使用除 Color 之外的所有预测器对 Quality-Rating 的预测分布。图 (b) 中的分布是在假设 Color 为红色 (c) 或白色 (d) 的情况下,对 Quality-Rating 预测进行混合,并按每种颜色的概率 (e) 加权计算得到的。
然而,理论在极限情况下所承诺的,并不能说明训练好的模型在多大程度上实际达到了这一点。TFM 究竟在多大程度上逼近了贝叶斯推断,尚未被分析。考虑到每一行只有一个样本可用,也不清楚该如何度量这一点。因此,预训练先验下的后验预测分布是未知的,也就没有可以作为模型输出评分基准的参考分布。为此,我们采取了一种不同的方法。我们不去问模型的预测与贝叶斯后验之间有多远,而是问它们是否可能来自*任意*联合分布。一个良定义的联合分布会约束其自身的边际分布和条件分布。它们必须服从全概率定律,并且链式法则必须以任何顺序得到相同的因子分解。这些约束可以仅凭模型自身的预测来检查,无需真实标签,也无需知道先验。图 1(https://arxiv.org/html/2608.06004#S1.F1)以 Wine 数据集中的单行为例展示了一个失败案例。我们比较了针对某个酒瓶的 Quality-Rating 的两个预测分布。第一个分布是直接使用所有可用特征但忽略 Color 来预测的。第二个分布是在假设颜色为红色或白色(这是数据集中所有可能的葡萄酒颜色)条件下,对条件分布进行混合得到的。混合按相应颜色的概率加权。数据集中所有列的真实联合分布是未知的,但我们知道两种查询应当产生相同的 Quality-Rating 边际分布。然而,TabPFNv3 计算出了两个非常不同的分布,这表明该模型并不遵循一个良定义的分布。
为了引导关于 TFM 的持续研究朝着最小化甚至消除此类不一致的方向发展,我们提出了任何其预测由良定义联合分布所诱导的模型都必须满足的两个要求。第一是*边际化一致性*,它将模型的条件分布与其直接预测的边际分布联系起来。第二是*因子分解一致性*,它要求两种链式法则顺序构建出相同的联合分布。我们形式化地证明了这两个一致性要求是密切相关的。因子分解一致性蕴含边际化一致性,但反之不成立。因此,每一个观测到的边际化失败都已经证明改变因子分解顺序将导致不同的分布。我们还设计了实验来评估不同的 TFM 分类器和(概率)回归器在多大程度上违反了每个一致性要求。我们评估的每个模型在所有数据集上、对分类和回归都违反了这两个条件。我们的结果表明,最近发布的 TabFM 是*最一致*的分类器。然而,该模型目前不提供概率回归。对于回归器,我们没有发现一个在所有数据集和要求上都是最一致的模型。此外,我们的实验表明,我们为每个要求提出的违反度量彼此之间高度相关。
我们的贡献是:
- • 我们形式化了两个一致性要求,一个 TFM 必须满足它们才能使其隐含的联合分布良定义。
- • 从这些要求出发,我们推导出量化违反程度的指标,这些指标无需知道真实分布即可使用。
- • 应用所推导的指标,我们通过比较 TFM 的一致性,为其评估增添了新的维度。我们的结果表明,所有当前最先进的 TFM 在所有数据集上都违反了这两个要求。
## 2 表格基础模型
(a) 预训练:合成数据集 D(k)∼prior,Transformer p̂(y∣x,D(k)) 用于留出目标,更新 θ 以最小化 NLL
(b) 推理:Transformer 单次前向传播,上下文 D,特征 x,目标 y,返回 p̂(y∣x,D)
图 2:先验数据拟合网络蓝图。(a) 一个 Transformer 在从先验中抽取的合成数据集 D(k) 上预训练,预测留出目标。(b) 权重冻结后,在真实训练集 D 和测试点 x 上进行一次前向传播,即返回一个单变量预测密度,近似该先验下的后验预测。
表格基础模型将上下文学习范式迁移到表格上的监督预测任务。标准蓝图是先验数据拟合网络(PFN;图 2)。一个 Transformer 在数以百万计的合成数据集上预训练,这些数据集从数据生成过程的先验(例如,随机采样的结构因果模型)中抽取,方式是从每个数据集的其余部分预测留出的目标值。预训练后,模型无需任何梯度更新即可解决新任务。它将一个有标签的训练集 D={(xi,yi)}i=1n 作为上下文,连同测试特征向量 x 一起输入,一次前向传播返回一个关于目标的预测分布 p̂(y∣x;D)。预训练目标将该输出塑造为合成先验下贝叶斯后验预测分布的一个近似(Müller 等人,2022)。
#### 一种适用于两种预测任务的符号
TFM 通过两种预测头服务于两种预测任务:一个用于有限类别集合的分类头,以及一个用于连续值概率回归的分布头。根据模型的不同,分布头被实现为逐桶密度(Hollmann 等人,2025)或一组预测分位数(Qu 等人,2026)。我们以统一的方式处理分类和回归。一个目标 yj 在目标空间 Yj 中取值,该空间要么是有限的(分类),要么是 R 的连续子集(回归),并且 p̂ 始终表示关于该空间基测度的预测分布密度:有限情形下是计数测度,其中 p̂ 是概率质量函数,而 ∫Yj⋯dyj 是有限和;连续情形下是勒贝格测度。因此,我们在全文使用*密度*和*积分*的说法,本节和第三节中的每一句话都逐字适用于分类目标、回归目标以及一对混合类型的目标。
#### 隐含联合分布
虽然预测头是单变量的,但上下文接口并不关心哪些列作为特征,哪一列作为目标。这种灵活性使得条件预测唾手可得。为了条件化对一个目标的预测依赖于另一个目标的值,只需将该值作为额外的特征列附加到测试点 x 上,并在上下文集 D 的每一行中使用观测值(Vetter 等人,2025)。将这些条件分布串联起来,单变量预测器就变成了多变量联合的构造器。为此,令 y=(y1,...,yd)∈Y1×⋯×Yd 收集 d 个感兴趣的目标。对于 {1,...,d} 的任意排列 π,链式法则蕴含自回归因子分解 p̂π(y∣x)=∏j=1dp̂(yπ(j) | yπ(1..j-1), x; D)。因此,一个单变量预测头就隐含地定义了许多可能的联合分布。
#### 我们究竟在何处需要联合分布?
在多输出预测之外,联合分布还有多种用途。一个常见的下游任务是获取保留特征的条件分布,例如计算某个目标关于另一个目标的概率或期望值。多变量联合也可用于缺失值插补的似然评估、异常检测中的密度估计、合成表生成、最优传输(Vetter 等人,2025)以及数据蒸馏。然而,在实际应用部署一个 TFM 之前,我们是否必须相信其隐含联合是良定义的?我们认为是的。一个良定义的概率模型应当对其关于可观测变量的预测具有内部自洽性;否则,不同但理论上等价的查询会产生相互矛盾的答案。
此外,存在一个概率论与统计学的经典结果,即给定一族相容的条件分布,就存在一个唯一的联合分布(Besag,1974;Arnold and Press,1989)。因此,良定义性可以仅基于模型自身的预测进行评估,而无需真实标签或已知先验。我们接下来推导出这种良定义性的两个必要条件,并针对当前 TFM 进行检验。
## 3 一致性要求
我们考虑如下场景。两个目标 a∈YA 和 b∈YB 是感兴趣的,其他所有列都被视为特征。我们使用一个由模型自身预测诱导的索引约定。记 D_A 为在上下文集中加入额外目标列 a 后的数据集,记 D_{-A}^B 为同时带有 a 作为特征并在 b 的上下文集中额外包含 b 作为目标列之后得到的数据集。记号表示:D_{-B}^A 是指数据集中有 a 作为目标列,但 b 不作为特征;D^A 是指 a 作为目标列且 b 作为特征;D_{-A}^B 是指 b 作为目标列且 a 不作为特征;D^B 是指 b 作为目标列且 a 作为特征。其他特征在所有情况下都相同。为了记号简洁,我们省略了特征向量的下标。此外,为了让 d>2 的情形也适用,这两个条件同样逐字适用于任意一对目标,其余目标固定为特征。
### 3.1 边际化一致性
最基本的要求是将模型的条件分布与其直接的(单变量)预测联系起来。自回归构造从模型自身的预测分布中采样中间目标;经过这条迂回路径,不应改变模型对剩余目标的*信念*。因此,将因子分解对中间目标进行边际化,必须得到模型直接预测的边际分布。以下定义符合随机过程的柯尔莫哥洛夫扩展定理的精神(Øksendal,2003)。
###### 定义 1(边际化一致性)。
一个模型是*边际化一致*的,当且仅当对每个 x 和所有 a∈YA,都有
p̂(a∣x;D_{-B}^A) = ∫_{YB} p̂(a∣b,x;D^A) p̂(b∣x;D_{-A}^B) db. (C1)
违反该定义意味着模型对 a 的边际估计与其自身关于 b 的条件预测不一致。两个预测的上下文集不同,即左侧丢弃了 b,而右侧存在 b。对于任何良定义的联合分布,该恒等式成立。条件 (C1) 要求模型的预测服从全概率定律;用贝叶斯术语来说,这是一致预测系统鞅性质的一个实例(Berti 等人,2004;Fong 等人,2023)。
### 3.2 因子分解一致性
第二个更强要求关注的是所构造的联合分布本身,而非其单变量投影。链式法则以任一顺序分解联合密度:p(a,b∣x)=p(a∣b,x)p(b∣x)=p(b∣a,x)p(a∣x)。如果模型的预测密度是由一个共同联合分布诱导的,那么两种自回归构造必须一致,即 p̂_{(a,b)}=p̂_{(b,a)}。
###### 定义 2(因子分解一致性)。
一个模型是*因子分解一致*的,当且仅当对每个 x 和所有 a∈YA, b∈YB,都有
p̂(a∣b,x;D^A) p̂(b∣x;D_{-A}^B) = p̂(b∣a,x;D^B) p̂(a∣x;D_{-B}^A) (C2)
如果违反此性质,自回归方法将依赖于目标采样的顺序。方程 (C2) 是一个相容性条件,它刻画了一族条件分布和边际分布何时能够来自同一个联合分布(Besag,1974;Arnold and Press,1989)。
### 3.3 两个性质是严格有序的
虽然定义 1 和定义 2 源于一致性的不同方面(一方面是条件预测与边际预测之间的一致,另一方面是两种因子分解之间的一致),它们并非相互独立。只要预测的条件分布是适当归一化的密度,因子分解一致性就已经蕴含边际化一致性。
###### 命题 1((C2) 蕴含 (C1))。
如果一个模型是因子分解一致的(定义 2),那么它也是边际化一致的(定义 1)。
###### 证明。
令 x 为特征向量,a∈YA。我们证明 (C1) 的右端,也就是自回归构造分配给 a 的边际密度,约化为 p̂(a∣x;D_{-B}^A)。
∫_{YB} p̂(a∣b,x;D^A) p̂(b∣x;D_{-A}^B) db = (C2)相似文章
用于离散选择估计的表格基础模型
本文提出一种重新表述方法,将表格基础模型(TFMs)应用于离散选择估计,解决了行独立假设的结构性差距。最佳重新表述在留出对数似然上优于层次贝叶斯估计8%,在命中率上优于3.6%,同时运行速度快16倍。
当表格基础模型遇到策略性表格数据:一种先验对齐方法
本文研究了基于预训练先验数据拟合网络的表格基础模型是否能够泛化到个体在部署后修改特征的策略性表格数据。提出了策略性先验数据拟合网络(SPN),这是一个无需重新训练即可将PFN预测与操纵后分布对齐的推理时框架。
超越IID:表格基础模型到底有多通用?
本文介绍了BeyondArena,一个统一的表格数据整体基准,并发现现有的表格基础模型仅在小到中等规模的IID数据上表现优异,而传统的基于树和深度学习模型仍然在非IID、大规模和高维数据集上占据主导地位。
内存高效的表格基础模型
本文研究了TabPFN等表格基础模型的内存需求,并表明模型压缩(如INT4量化)可以将内存占用减少高达7.6倍,且精度损失极小,从而提升实际部署效率。
表格基础模型在微生物组数据的真实查询分布偏移下是否鲁棒?
本文评估了表格基础模型在微生物组数据中受生物学启发的分布偏移下的鲁棒性,发现保护判别特征不足以保证稳定性,且零填充是最有害的扰动。