超越分布匹配:基于弱语义先验的语义一致性表格扩散

arXiv cs.LG 论文

摘要

SCTab-Diff 是一个语义一致的表格扩散框架,它利用弱语义先验来生成高保真合成表格数据,相比现有方法,提升了分布保真度和语义一致性。

arXiv:2609.16069v1 公告类型:新 摘要:合成表格数据可以匹配真实数据分布,但仍然违反了管理有效表格行的语义约束。这揭示了现有表格生成器的一个关键局限:它们主要优化分布保真度,但没有明确建模表格模式和文本描述中编码的弱语义先验。在本文中,我们提出 SCTab-Diff,一个在弱指定语义先验下用于高保真合成数据生成的语义一致表格扩散框架。SCTab-Diff 首先构建两种类型的先验,即列内语义和列间符号规则,通过 LLM 辅助从元数据中提取,并在真实训练集上进行验证。然后,这些先验被用作生成条件,而不是事后过滤器。具体来说,SCTab-Diff 将异构列值、列标识和语义先验映射到统一的语义空间,并执行列式前向损坏和先验条件逆去噪,以保留边际分布和规则一致的跨列依赖。在六个真实表格基准上的广泛实验表明,SCTab-Diff 在分布保真度、语义一致性和下游任务效用方面,始终优于代表性的 VAE、GAN、LLM 和基于扩散的基线。额外的分析进一步证明了当语义先验部分不可用时,SCTab-Diff 的鲁棒性。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:38

# 超越分布匹配:基于弱语义先验的语义一致表格扩散模型
来源:https://arxiv.org/html/2609.16069  
王艺丽††贡献相等。单位:吉林大学人工智能学院,中国长春。邮箱:[[email protected]](mailto:)  
施如雪¹¹脚注同上。单位:吉林大学人工智能学院,中国长春。邮箱:[[email protected]](mailto:)  
杜孟男 单位:香港中文大学(深圳)人工智能学院,中国深圳  
常毅††通讯作者。单位:吉林大学人工智能学院,中国长春。  
王鑫 ²²脚注同上。单位:吉林大学人工智能学院,中国长春。

#### 摘要
合成表格数据可以匹配真实数据分布,但仍可能违反有效表格行所遵循的语义约束。这揭示了现有表格生成器的一个关键局限:它们主要优化分布保真度,但未显式建模表格模式和文本描述中编码的弱语义先验。本文提出 SCTab-Diff,一个在弱指定语义先验下用于高保真合成数据生成的语义一致表格扩散框架。SCTab-Diff 首先利用 LLM 辅助从元数据中提取两种先验——即列内语义和列间符号规则,并在真实训练集上进行验证。这些先验被用作生成条件,而非事后过滤器。具体而言,SCTab-Diff 将异构的列值、列标识和语义先验映射到一个统一的语义空间,并执行逐列前向破坏和先验条件下的反向去噪,以同时保留边缘分布和规则一致的列间依赖。在六个真实世界表格基准上的大量实验表明,SCTab-Diff 相较于代表性的 VAE、GAN、LLM 和扩散模型基线,持续提升了分布保真度、语义一致性和下游任务效用。额外分析进一步证明了当语义先验部分不可用时,SCTab-Diff 的鲁棒性。代码见 https://anonymous.4open.science/status/SCTab-Diff-B6DF。

## 1 引言
高保真表格生成常被简化为分布匹配问题 (Liu and Liu, 2024) (https://arxiv.org/html/2609.16069#bib.bib33); (Schreyer et al., 2024) (https://arxiv.org/html/2609.16069#bib.bib34),然而对于表格数据,*仅分布真实性是不够的* (Shi et al., 2025) (https://arxiv.org/html/2609.16069#bib.bib18)。如图1 (https://arxiv.org/html/2609.16069#S1.F1)(a)所示,一个合成元组在统计上可能看似合理,但在语义上可能无效,例如为儿童分配不合理的教育水平,或产生违反基本列间依赖规则的值。此类错误在表格领域尤为突出,因为合成数据常被重用于下游流程,包括数据增强 (Zhang et al., 2024) (https://arxiv.org/html/2609.16069#bib.bib12); (Kotelnikov et al., 2023) (https://arxiv.org/html/2609.16069#bib.bib9)、隐私保护数据共享 (Wang et al., 2024) (https://arxiv.org/html/2609.16069#bib.bib36); (Torfi et al., 2022) (https://arxiv.org/html/2609.16069#bib.bib35)以及模型训练或评估 (He et al., 2024) (https://arxiv.org/html/2609.16069#bib.bib1); (Sattarov et al., 2023) (https://arxiv.org/html/2609.16069#bib.bib2); (Zhang et al., 2023) (https://arxiv.org/html/2609.16069#bib.bib26)。因此,现实的表格生成应满足更强的目标:生成的样本应既*分布忠实*又*语义有效*。这一要求与表格数据的结构密切相关。与图像或文本不同,表格由语义类型化的列组成,而非可互换的维度 (Seedat et al., 2023) (https://arxiv.org/html/2609.16069#bib.bib4)。每列展现出自己的边际行为,而有效的元组还必须遵守跨列的复杂依赖关系 (Kim et al., 2024) (https://arxiv.org/html/2609.16069#bib.bib3)。此外,表征有效表格所需的语义知识通常仅被*弱指定*。如图1 (https://arxiv.org/html/2609.16069#S1.F1)(b)所示,列内语义通常隐含在列名、表格模式和文本描述中,而列间有效性则由*符号规则*控制,这些规则在标准表格基准中很少被明确标注。这使得语义有效的表格生成成为比纯粹分布匹配难得多的问题。
这推动了对表格生成更强的表述:现实的表格生成不仅需要分布保真度,还需要在弱指定约束下的语义有效性。参见图注。

图1:从分布保真到语义有效的表格生成。

然而,正是这一更强的目标是现有表格生成器的短板。从基于 VAE (Xu et al., 2019) (https://arxiv.org/html/2609.16069#bib.bib5); (Ma et al., 2020) (https://arxiv.org/html/2609.16069#bib.bib21); (Liu et al., 2023) (https://arxiv.org/html/2609.16069#bib.bib22) 和 GAN (Choi et al., 2017) (https://arxiv.org/html/2609.16069#bib.bib23); (Lee et al., 2021) (https://arxiv.org/html/2609.16069#bib.bib24); (Zhao et al., 2021) (https://arxiv.org/html/2609.16069#bib.bib25) 的方法,到近期的扩散模型 (Dhariwal and Nichol, 2021) (https://arxiv.org/html/2609.16069#bib.bib27); (Ho et al., 2020) (https://arxiv.org/html/2609.16069#bib.bib28); (Song et al., 2020) (https://arxiv.org/html/2609.16069#bib.bib10); (Austin et al., 2021) (https://arxiv.org/html/2609.16069#bib.bib19),大多数现有方法仍遵循表格合成的*以分布为中心*的观点:每一行被视为一个整体向量,生成过程优化以再现整体统计量。这种设计便于分布建模,但它在很大程度上使生成过程对表格数据的语义结构“视而不见”。特别是,现有的扩散公式破坏和恢复表格样本时,并未显式保留列标识,也未在弱语义先验条件下进行去噪。结果,语义一致性被视为分布学习的隐含副产品,而非显式的生成目标。这一局限不仅是评估问题,更反映了表格数据结构与生成方式之间的错配:表格行是一组类型化的语义属性,而大多数生成器将其建模为无类型的数值向量。
为弥合这一差距,本文研究*弱指定约束下的语义有效表格生成*。我们将弱语义先验作为扩散机制本身的一部分,而非将其视为用于过滤生成样本的外部规则。具体而言,这些先验作为逆时间分数估计的条件信号,使得去噪过程既受统计恢复引导,也受语义一致性引导。如图1 (https://arxiv.org/html/2609.16069#S1.F1)(c)所示,我们从弱语义来源构建两种类型的语义先验:*列内语义*,编码属性含义和值合理性;以及*列间符号规则*,捕获跨属性的显式依赖约束。候选符号约束通过 LLM 辅助的语义提取¹从表格模式和文本描述中获得¹,¹该用于语义提取的 LLM 无法访问原始表格记录。此设计降低了记忆或泄露原始表中敏感记录级条目的风险。并进一步使用观测数据进行验证和精炼。基于此表述,我们提出**语义一致表格扩散(SCTab-Diff)**,它将逐列扩散与统一语义空间中的先验条件分数估计相结合。在此空间中,列标识指定噪声潜在变量代表什么,行上下文指定它是否与其他属性兼容,而弱语义先验指定哪些恢复是语义上可接受的。这种设计使 SCTab-Diff 能够生成既分布忠实又语义一致的合成表格。
我们的主要贡献总结如下:
- • 我们超越分布匹配来表述表格生成,要求合成表格在弱指定约束下同时满足*分布保真度*和*语义有效性*。
- • 我们引入了一种弱语义先验构建策略,从表格模式和文本描述中派生出用于属性级合理性的*列内语义*和用于跨属性依赖有效性的*列间符号规则*。
- • 我们提出了 SCTab-Diff,一个语义一致的扩散框架,它将弱语义先验视为生成条件,并将其注入基于分数的去噪过程,以保留列标识并执行规则一致的依赖关系。
- • 大量实验证明了在分布保真度、语义一致性和下游效用方面的改进,以及在不完整语义先验下的鲁棒性。

## 2 预备知识
### 2.1 问题形式化
设 D={X,F} D=\\{X,F\\} 表示一个表格数据集,其中 X={x⁽ᵐ⁾}ₘ₌₁ᴹ X=\\{x^{\{(m)\}}\\}\\_{m=1}^{M\\} 是表格行的集合,F={fᵢ}ᵢ₌₁ⁿ F=\\{f\\_{i\\}\\}\\_{i=1}^{n\\} 是列名的集合。每行 x∈X x\\in X 表示为 x=(x₁,...,xₙ) x=(x\\_{1\\},\\dots,x\\_{n\\}),其中第 i 个属性 xᵢ x\\_{i\\} 对应列 fᵢ f\\_{i\\}。在 n n 列中,Nₙ N\\_{n\\} 是数值型的,Nc N\\_{c\\} 是分类型的,且 Nₙ+Nc=n N\\_{n\\}+N\\_{c\\}=n。除了 D D,本工作还考虑弱语义来源,例如表格模式和附随的文本文档,用于构建语义先验: P={Pⁱⁿᵗʳᵃ, Pⁱⁿᵗᵉʳ} P=\\{P^{\\mathrm{intra\\}}, P^{\\mathrm{inter\\}}\\}。这里,Pⁱⁿᵗʳᵃ P^{\\mathrm{intra\\}} 表示列内语义,Pⁱⁿᵗᵉʳ P^{\\mathrm{inter\\}} 表示列间符号规则。目标是学习一个生成器 gθ(D,P) g\\_{\\theta\\}(D,P),它能产生合成样本 x̂∈D̂ \\hat{x}\\in\\hat{D},这些样本既在分布上忠实于 D D,又在 P P 下语义有效。

### 2.2 基于分数的扩散预备知识
基于分数的扩散模型通过噪声扰动数据,并学习一个分数函数来逆转破坏过程 (Song et al., 2020) (https://arxiv.org/html/2609.16069#bib.bib10); (Song and Ermon, 2020) (https://arxiv.org/html/2609.16069#bib.bib11)。本工作采用方差爆炸(VE)公式 (Song et al., 2020) (https://arxiv.org/html/2609.16069#bib.bib10),其中前向扰动具有闭合形式:
xₜ=x₀+σ(t)ε, ε∼N(0,I)。 x\\_{t\\}=x\\_{0\\}+\\sigma(t)\\epsilon,\\qquad\\epsilon\\sim\\mathcal{N}\\(0,I\\)。(1)
相应的逆时间去噪过程为:
dxₜ = -2σ̇(t)/σ(t) ∇ₓₜ log pₜ(xₜ) dt + √(2σ̇(t)/σ(t)) dw̄ₜ。 \\mathrm{d}x\\_{t\\}=-2\\,\\dot{\\sigma}(t)\\sigma(t)\\nabla\\_{x\\_{t\\}}\\log p\\_{t\\}(x\\_{t\\})\\,\\mathrm{d}t+\\sqrt{2\\,\\dot{\\sigma}(t)\\sigma(t)}\\,\\mathrm{d}\\bar{w}\\_{t\\}。(2)
其中 pₜ p\\_{t\\} 表示时间 t t 时的扰动数据分布,w̄ₜ \\bar{w}\\_{t\\} 是标准的逆时间维纳过程。在本工作中,VE 公式作为 SCTab-Diff 的扩散骨干,在其上构建语义一致的表格去噪。

## 3 提出的方法:SCTab-Diff
SCTab-Diff 的核心思想是将弱指定的语义知识转化为表格扩散的显式生成条件。与主要从噪声样本中恢复数据分布的传统表格生成器不同,SCTab-Diff 的逆去噪过程以描述属性级合理性和跨属性依赖规则的语义先验为条件。如图2 (https://arxiv.org/html/2609.16069#S3.F2)所示,我们首先将这些弱语义先验形式化为生成条件,然后重新公式化基于分数的扩散以将其纳入逆时间去噪,最后在一个统一的语义空间中实例化该公式以实现端到端的表格合成。

参见图注 图2:SCTab-Diff 概览。

### 3.1 弱语义先验作为生成条件
SCTab-Diff 中的逆扩散过程由弱语义先验 P P 引导,这些先验作为超越分布恢复的生成条件。这些先验编码了语义一致性的两个互补方面:属性级合理性和元组级依赖有效性。形式上,我们将 P P 分解为:
P={Pⁱⁿᵗʳᵃ, Pⁱⁿᵗᵉʳ}, Pⁱⁿᵗʳᵃ={pᵢⁱⁿᵗʳᵃ}ᵢ₌₁ⁿ, Pⁱⁿᵗᵉʳ={rₖ}ₖ₌₁ᴷ。 P=\\{P^{\\mathrm{intra\\}}, P^{\\mathrm{inter\\}}\\},\\qquad P^{\\mathrm{intra\\}}=\\{p\\_{i\\}^{\\mathrm{intra\\}}\\}\\_{i=1}^{n\\},\\qquad P^{\\mathrm{inter\\}}=\\{r\\_{k\\}\\}\\_{k=1}^{K\\}。(3)
**列内语义**。每个 pᵢⁱⁿᵗʳᵃ p\\_{i\\}^{\\mathrm{intra\\}} 描述单个列 fᵢ f\\_{i\\} 的语义有效性。它定义了该列的合理值空间,例如数值范围、分类域或特定领域的值约束。这些先验在属性级运作,防止生成器产生数值上可能但语义上不合理的结果。
**列间符号规则**。每个 rₖ∈Pⁱⁿᵗᵉʳ r\\_{k\\}\\in P^{\\mathrm{inter\\}} 捕获多个列之间的符号依赖关系:
rₖ: φₖ(xᵢ₁,...,xᵢₛ)=1, r\\_{k\\}:\\quad\\phi\\_{k\\}(x\\_{i\\_{1\\}\\},\\dots,x\\_{i\\_{s\\}\\})=1, (4)
其中 φₖ(·) \\phi\\_{k\\}(\\cdot) 是列子集上的布尔约束函数。这些先验在元组级运作,约束不同属性是否可以一致地共现,例如教育水平是否与年龄兼容,或收入是否与工作时间兼容。
给定 P P,一个合成行 x̂ \\hat{x} 如果同时满足属性级和元组级先验,则它是语义有效的:
x̂∈V(P) ⟺ x̂ᵢ ⊧ pᵢⁱⁿᵗʳᵃ, ∀i, 且 φₖ(x̂)=1, ∀rₖ∈Pⁱⁿᵗᵉʳ, \\hat{x}\\in\\mathcal{V}\\(P\\)\\Longleftrightarrow\\hat{x}\\_{i\\}\\models p\\_{i\\}^{\\mathrm{intra\\}},\\ \\forall i,\\quad\\text{且}\\quad\\phi\\_{k\\}(\\hat{x})=1,\\ \\forall r\\_{k\\}\\in P^{\\mathrm{inter\\}}, (5)
其中 V(P) \\mathcal{V}\\(P\\) 表示由弱语义先验诱导的语义有效性集合。在实践中,P P 很少在公开表格基准中作为明确标注提供。我们使用基于 LLM 的语义提取从表格模式和文本描述中构建候选先验,并进一步使用观测数据进行验证和精炼。所得的 P P 然后用作语义一致扩散的条件。

### 3.2 从以分布为中心的扩散到语义一致的生成
给定第3.1节 (https://arxiv.org/html/2609.16069#S3.SS1) 中定义的弱语义先验 P P,我们接下来将基于分数的扩散从以分布为中心的恢复重新表述为语义一致的生成。令 z₀,ᵢ z\\_{0,i\\} 表示第 i 个列值 xᵢ x\\_{i\\} 的连续表示。在第3.3节 (https://arxiv.org/html/2609.16069#S3.SS3) 中,z₀,ᵢ z\\_{0,i\\} 将实例化为统一语义表示 h₀,ᵢ h\\_{0,i\\}。我们首先应用逐列前向破坏:
zₜ,ᵢ = z₀,ᵢ + σᵣᵢ(t)ε, ε∼N(0,I), z\\_{t,i\\}=z\\_{0,i\\}+\\sigma\\_{\\rho\\_{i\\}}(t)\\epsilon,\\qquad\\epsilon\\sim\\mathcal{N}\\(0,I\\), (6)
其中 σᵣᵢ(t) σ\\_{\\rho\\_{i\\}}(t) 是列 fᵢ f\\_{i\\} 的可学习噪声调度。与整体行级破坏...

相似文章

Geometry-Aware Tabular Diffusion

arXiv cs.LG

介绍了Geometry-Aware Tabular Diffusion(GATD),该方法通过显式的成对几何特征增强表格扩散去噪器。在十个基准测试上取得了最先进的性能,同时使用的参数显著更少。

金融领域的约束表格扩散

arXiv cs.LG

介绍了金融领域的约束表格扩散(CTDF),该方法将可行性操作集成到扩散采样中,以对金融合成数据生成施加硬约束。