测量依赖差距:诊断表格生成模型中的列间保真度

arXiv cs.LG 论文

摘要

本文引入了一种依赖感知的保真度诊断方法,用于测量合成表格数据中的列间依赖关系,揭示了标准指标对依赖关系视而不见,当前的生成器存在一个残余差距,无法通过增加容量或常见修复来弥补。

arXiv:2607.21636v1 公告类型:新 摘要:合成表格数据的价值不仅在于保留每一列的边际分布,还在于保留列之间的依赖关系——这种结构承载了在不平衡领域(如欺诈和临床风险)中少数类别的许多判别信号。然而,我们表明,最常用于验证合成表格数据的指标在很大程度上对列间依赖关系视而不见:一个独立建模每一列(从而破坏所有依赖关系)的基线,被逻辑回归C2ST判断为与真实数据无法区分,而成对趋势得分仅部分敏感。我们引入了一种依赖感知的保真度诊断方法,将一个强分类器双样本检验(XGB-C2ST)分解为边际、依赖和数值-分类交叉分量,锚定在最坏情况下的全因子分解参考(所有依赖被破坏)和最佳情况下的真实数据oracle之间。将其应用于最先进的流匹配生成器(TabbyFlow/EF-VFM),我们发现了一个标准指标遗漏的真实依赖差距;直接破坏依赖关系会彻底摧毁少数类别的效用,而生成器的残余差距带来了较小但一致的效用损失。然后我们询问这个差距是否反映了平均场生成目标的结构性限制。并非如此:与变分流匹配的最新恢复结果一致,该目标渐近精确。然而,这个差距很顽固——模型容量增加16倍也无法弥合——这表明问题在于缺乏直接的依赖监督,而非容量或结构限制。与此一致,且由于残余差距是高阶的,没有廉价的干预措施能够弥合它:无论是模型内的依赖机制、事后copula修正,还是16倍的容量增加——这对于一个认为此类修复有效的领域是一个警示。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:40

# 测量依赖缺口:诊断表格生成模型中的列间保真度
来源:https://arxiv.org/html/2607.21636

###### 摘要

合成表格数据的价值不仅在于保留每列的边缘分布,更在于保留*列间依赖关系*——这种结构承载着不平衡领域(如欺诈和临床风险)中少数类的大部分判别信号。然而,我们表明,最常用于验证合成表格数据的指标在很大程度上对列间依赖*不敏感*:一个独立建模每列(从而破坏所有依赖关系)的基线模型,通过逻辑回归C2ST判断,与真实数据难以区分,而成对趋势得分仅部分敏感。我们引入一种依赖感知的保真度诊断方法,它将强分类器双样本检验(XGB-C2ST)分解为边缘、依赖和数值-类别*交叉*三个分量,并锚定在最坏情况下的完全因式分解参考(所有依赖被破坏)和最好情况下的真实数据参考之间。将其应用于最先进的流匹配生成器(TabbyFlow/EF-VFM),我们发现标准指标遗漏了一个真实的依赖缺口;直接破坏依赖会导致少数类效用崩溃,而生成器的残余缺口则带来较小但一致的效用损失。随后我们探究这一缺口是否反映了平均场生成目标的结构性局限。答案是否定的:与变分流匹配的最新恢复结果一致,该目标在渐近意义上是精确的。然而缺口是顽固的——模型容量增加16×16倍也未能缩小它——这表明问题出在缺乏直接的依赖监督,而非容量或结构限制。与此一致,且由于残余缺口是高阶的,没有廉价的干预能将其消除:无论是模型内的依赖机制、事后联合分布修正,还是16×16倍的容量增加——这对于认为此类修复有效的领域是一个警示。

## 1 引言

表格数据的生成模型广泛用于隐私保护数据共享(Patki 等,2016 (https://arxiv.org/html/2607.21636#bib.bib24);Jordon 等,2019 (https://arxiv.org/html/2607.21636#bib.bib14))以及增强少数类样本。在不平衡领域——信用卡欺诈、临床风险、用户流失——将少数类与多数类区分开的信息通常不在于单个特征,而在于特征的*联合配置*:账户历史年轻本身并不异常,大额交易本身也不异常,但二者同时出现就是关键信号。一个能重现每列边缘分布却打乱列间联合变化的合成生成器,会产生“平均真实”的行,但其少数类结构已被冲淡。因此,保留*列间依赖*对于合成表格数据的有用性至关重要,特别是对于少数类的价值(He & Garcia,2009 (https://arxiv.org/html/2607.21636#bib.bib11))。

近期最先进的表格生成器基于扩散模型(Ho 等,2020 (https://arxiv.org/html/2607.21636#bib.bib12);Song 等,2021 (https://arxiv.org/html/2607.21636#bib.bib28))和流匹配模型(Lipman 等,2023 (https://arxiv.org/html/2607.21636#bib.bib18);Tong 等,2024 (https://arxiv.org/html/2607.21636#bib.bib29)),并针对混合类型表格数据进行了适配(Guzmán 等,2025 (https://arxiv.org/html/2607.21636#bib.bib10);Shi 等,2025 (https://arxiv.org/html/2607.21636#bib.bib27);Mueller 等,2026 (https://arxiv.org/html/2607.21636#bib.bib22))。一个实际问题随之而来:*我们如何知道生成器保留了依赖?*主导表格合成评估的指标——列向和成对的“趋势/形状”得分以及逻辑回归分类器双样本检验(C2ST)——我们表明,它们并不适合回答这个问题。一个退化基线,独立拟合每列边缘并*独立*采样(破坏*所有*依赖),其逻辑回归C2ST达到0.995-1.000——被认为与真实数据无法区分,与强生成器一样忠实——而趋势得分仅轻微退化(0.69-0.78)。(说明:LR-C2ST和趋势得分采用SDMetrics质量量表,其中1.0表示无法区分/完美;我们下面的XGB-C2ST是原始判别器AUC,其中0.5表示无法区分,1.0表示完全可分。)这些指标验证的是边缘分布,而非依赖关系。

我们使依赖问题变得可测量。我们使用一个基于强交互敏感学习器(梯度提升树,XGB-C2ST)的分类器双样本检验,并将其得分*分解*为边缘分量、依赖分量以及数值-类别交叉分量,每个分量锚定在完全因式分解下界(FF,仅边缘)和真实数据参考上界之间。这种分解将“依赖是否被保留?”转化为实践者可以读取的数字。

利用这一诊断方法,我们报告三个发现。 (i) 标准指标对依赖不敏感,而XGB-C2ST暴露了最先进流匹配生成器(TabbyFlow/EF-VFM,Guzmán 等,2025 (https://arxiv.org/html/2607.21636#bib.bib10))中的真实依赖缺口;该指标对少数类很重要——直接破坏依赖会导致少数类F1得分崩溃,而生成器的残余缺口与参考相比带来较小但一致的不足。(ii) 这一缺口*并非*平均场生成目标的结构性盲点。与变分流匹配的最新精确恢复结果一致(Eijkelboom 等,2026 (https://arxiv.org/html/2607.21636#bib.bib8)),该目标仅监督每维后验均值,但其诱导的确定性流在无限容量极限下恢复联合分布。然而,这一缺口也无法通过大幅(16×16倍)增加容量来消除,这表明存在优化/监督瓶颈,而非容量或结构限制。(iii) 与 (ii) 一致,没有廉价干预能消除这一缺口。残余缺口是高阶的(生成器已经匹配了二阶交叉矩),因此协方差匹配修正无济于事;添加显式的模型内依赖机制没有帮助,事后联合分布修正(Scassola 等,2026 (https://arxiv.org/html/2607.21636#bib.bib26))和暴力规模扩大也同样无效——这是一个坦诚的负面结果,提醒人们无论是依赖特定架构还是暴力规模扩大都不是解决之道。

### 贡献。

1. 1. 一种针对表格生成模型的依赖感知保真度诊断方法:将XGB-C2ST分解为边缘/依赖/数值-类别交叉分量,并带有完全因式分解和参考边界(§3 (https://arxiv.org/html/2607.21636#S3))。
2. 2. 实证分析表明,广泛使用的指标对依赖不敏感,SOTA生成器中存在真实的依赖缺口,且该缺口与少数类效用相关(§4 (https://arxiv.org/html/2607.21636#S4))。
3. 3. 分析表明,该缺口并非平均场目标的结构性限制,并且——令人惊讶——即使16×16倍容量增加也无法消除,将其定位为目标缺乏直接依赖监督(§5 (https://arxiv.org/html/2607.21636#S5))。
4. 4. 坦诚的负面结果:残余缺口是高阶的,模型内依赖修复、事后联合分布和暴力容量缩放均无法消除,警示反对架构化和暴力修复方法(§6 (https://arxiv.org/html/2607.21636#S6))。

## 2 背景与相关工作

### 表格生成模型。

现代表格合成器包括基于GAN的(Xu 等,2019 (https://arxiv.org/html/2607.21636#bib.bib30);Zhao 等,2021 (https://arxiv.org/html/2607.21636#bib.bib32))、基于扩散的(Zhang 等,2024 (https://arxiv.org/html/2607.21636#bib.bib31);Shi 等,2025 (https://arxiv.org/html/2607.21636#bib.bib27);Kotelnikov 等,2023 (https://arxiv.org/html/2607.21636#bib.bib16);Kim 等,2023 (https://arxiv.org/html/2607.21636#bib.bib15);Lee 等,2023 (https://arxiv.org/html/2607.21636#bib.bib17))、基于流匹配的(Guzmán 等,2025 (https://arxiv.org/html/2607.21636#bib.bib10);Mueller 等,2026 (https://arxiv.org/html/2607.21636#bib.bib22))以及基于语言模型的(Borisov 等,2023 (https://arxiv.org/html/2607.21636#bib.bib2);Liu 等,2023 (https://arxiv.org/html/2607.21636#bib.bib19))方法;更广泛的综述见Borisov 等 (2024 (https://arxiv.org/html/2607.21636#bib.bib3))。我们将研究重点放在TabbyFlow上,它是指数族变分流匹配(EF-VFM)的表格实例化(Guzmán 等,2025 (https://arxiv.org/html/2607.21636#bib.bib10)),是一个强大且具有代表性的流匹配基线。EF-VFM采用*平均场*变分后验,该后验按列分解,并使用矩匹配目标;数值列采用协方差为各向同性的多元高斯头部建模,类别列采用逐列类别头部。这种分解结构正是使得依赖保留问题如此突出的原因,并激励了我们的研究重点。

### 评估合成表格数据。

主要的保真度指标是列向和成对“形状/趋势”相似度(例如SDMetrics (Patki 等,2016 (https://arxiv.org/html/2607.21636#bib.bib24)))以及分类器双样本检验(C2ST)(Lopez-Paz & Oquab,2017 (https://arxiv.org/html/2607.21636#bib.bib20)),后者将“两个样本是否来自同一分布”转化为判别器的准确率。近期研究对这些指标提出质疑,表明即使对于较差的生成器,弱判别器和成对统计量也可能饱和(Scassola 等,2026 (https://arxiv.org/html/2607.21636#bib.bib26);Platzer & Reutterer,2021 (https://arxiv.org/html/2607.21636#bib.bib25))。我们在这一批评基础上进行建设性工作:不仅指出指标失败,还提供了一个*分解*,定位它们*漏掉了什么*(依赖)以及*漏掉了多少*,使用对高阶交互敏感的强树基判别器。

### 建模依赖。

Copula将边缘分布与依赖关系分离(Nelsen,2006 (https://arxiv.org/html/2607.21636#bib.bib23);Aas 等,2009 (https://arxiv.org/html/2607.21636#bib.bib1)),近期工作将copula或依赖结构嵌入生成模型内部。然而,这些努力不属于我们的范畴:Carrasco-Pollo 等 (2026 (https://arxiv.org/html/2607.21636#bib.bib4)) 引入了结构化(非平均场)变分流匹配,但用于基于模拟的推断;Huk & Damoulas (2026 (https://arxiv.org/html/2607.21636#bib.bib13)) 在流/扩散模型内建模copula,但仅针对纯连续的科学数据。两者都不针对混合类型、类别不平衡的表格生成。我们的工作是诊断性的,而非提出新生成器:我们测量依赖在何处丢失,并测试此类模型内机制是否有帮助。

### 平均场与恢复。

一个自然的假设是,平均场(按列分解)目标*无法*表示列间依赖。变分流匹配的最新恢复结果表明,在理想化极限下这一假设是错误的:由于插值是端点(one-hot编码)的仿射函数,平均场最优解恢复了真实的每维后验均值,边际速度场是精确的,并且诱导的确定性流将分布传输到真实的*联合*分布——包括连续和类别变量(Eijkelboom 等,2026 (https://arxiv.org/html/2607.21636#bib.bib8))。这一结果是我们在§5 (https://arxiv.org/html/2607.21636#S5) 中分析的基础:任何测量到的依赖缺口都必须归因于有限容量、优化或离散化,而非结构性盲点。

## 3 一种依赖感知的保真度诊断方法

### 设置。

令真实数据x∼Px∼P有dd列,分为数值块和类别块,x=(xnum,xcat)x=(xnum,xcat),并令QQ为生成器的分布。我们在一个保留的真实测试集(从未用于拟合任何参考)上评估保真度,并报告在合成数据上训练、在真实测试数据上评估的下游分类器的少数类F1得分和召回率作为效用轴。

### 强分类器双样本检验。

对于样本SPSP和SQSQ,我们构建一个平衡的双样本集(下采样至相等大小,因此随机准确率为0.50.5),将真实数据标记为11,合成数据标记为0,并训练一个梯度提升树判别器(Chen & Guestrin,2016 (https://arxiv.org/html/2607.21636#bib.bib6)),使用5折分层交叉验证,报告折外AUC并标准化为c2st=max⁡(AUC,1−AUC)c2st=max(AUC,1−AUC)。解释为:0.50.5表示无法区分(好),1.01.0表示平凡可分(差)。我们使用梯度提升树而非线性模型,正是因为依赖由高阶特征交互承载,而线性判别器无法看到这些交互;这一选择使得依赖分量可见(Lopez-Paz & Oquab,2017 (https://arxiv.org/html/2607.21636#bib.bib20);Scassola 等,2026 (https://arxiv.org/html/2607.21636#bib.bib26);Grinsztajn 等,2022 (https://arxiv.org/html/2607.21636#bib.bib9))。

### 分解。

我们通过破坏依赖同时保留边缘分布来分离边缘保真度和依赖保真度。令Π(⋅)Π(⋅)对*每列*的行进行独立置换(对每个数据集应用相同过程,每列独立置换),因此Π(S)Π(S)保留每列的边缘分布但移除所有列间依赖。定义

full=c2st(SP,SQ),marg=c2st(Π(SP),Π(SQ)),dep=full−marg.full=c2st(SP,SQ),marg=c2st(Π(SP),Π(SQ)),dep=full−marg.

margmarg孤立了因边缘分布错误造成的可判别性;depdep是因*联合*结构错误而额外增加的可判别性。为了孤立混合类型交互,我们进一步通过块置换定义一个*交叉*分量:将第ii行的数值块xinumxinum与第π(i)π(i)行的类别块xπ(i)catxπ(i)cat配对,保留块内依赖(数值-数值和类别-类别)但破坏数值-类别耦合,得到depcross=full−c2st(块置换样本)depcross=full−c2st(块置换样本)。

### 参考点。

我们用两个基于真实数据构建的参考来锚定依赖轴。*完全因式分解*参考FF从经验边缘分布中独立重采样每列:它具有正确的边缘分布和*零*依赖,提供了依赖保真度的下界(其依赖缺口本质上是整个缺口)。*参考*是真实训练数据的一个新的子样本——正确的边缘分布*和*正确的依赖——提供了上界(XGB-C2ST≈0.5≈0.5)。生成器的依赖保真度相对于这些锚点读取。

### 协议与规范。

所有评估都是确定性的(固定种子,固定判别器状态)。真实参考始终是保留的测试集,而非用于拟合参考的数据集,避免循环论证。我们报告五次种子运行的均值±±标准差(magicmagic参考锚点除外,为三次),且从不选择单次运行。我们使用XGB-C2ST、依赖分量

相似文章

超越IID:表格基础模型到底有多通用?

Hugging Face Daily Papers

本文介绍了BeyondArena,一个统一的表格数据整体基准,并发现现有的表格基础模型仅在小到中等规模的IID数据上表现优异,而传统的基于树和深度学习模型仍然在非IID、大规模和高维数据集上占据主导地位。

Oracle Gap与信号保真度:一种测试时协作的固定池诊断方法

arXiv cs.CL

本文介绍了OracleGap,一个将测试时协作(如自一致性、验证器)的收益分解为oracle gap、覆盖率、信号保真度和伤害的框架,表明收益受限于oracle gap和信号保真度。它提供了一种部署前的诊断方法,用于判断何时协作有望带来帮助。