FairDiffuseVQVAE:通过向量量化潜变量的条件细化实现表格扩散中的采样时公平性
摘要
介绍了FairDiffuseVQVAE,一种两阶段表格扩散模型,通过在采样时以受保护属性为条件来实现公平性,在人口统计均等和均等化几率方面优于以往的公平表格生成器。
arXiv:2607.28945v1 公告类型:新
摘要:合成表格数据越来越多地用于隐私保护数据共享、数据增强以及缓解下游分类器偏差。最先进的表格扩散模型(如TabDDPM和TabSyn)实现了出色的分布保真度,但没有提供公平性机制;相反,公平感知的表格生成器(DECAF、FairTGAN、FairTabDDPM)在训练时施加显式公平性惩罚,导致公平性提升有限,却以样本质量或下游效用的显著损失为代价。我们提出了FairDiffuseVQVAE,一种将保真度与公平性解耦的两阶段架构:首先是一个带有行级判别器的向量量化自编码器(阶段1,无公平性项),随后是一个DiffuseVAE风格的连续扩散精炼器,通过无分类器指导同时以阶段1的重建和受保护属性为条件(阶段2)。公平性作为采样分布的一个属性出现——在推理时对受保护属性进行均匀采样,在设计上即强制执行人口统计均等,而不是依赖相互竞争的损失项。在Adult、Bank和COMPAS数据集上,FairDiffuseVQVAE取得了最高的平均人口统计均等比($0.702$,较FairTabDDPM提高$+47\%$)和均等化几率比($0.686$,$+100\%$)。它还取得了所有已发表方法中最低的平均成对相关误差($0.034$),同时明确以$\sim$$15$ AUC点换取这些公平性收益。
查看缓存全文
缓存时间: 2026/08/03 07:34
# 通过向量量化潜变量的条件细化实现表格扩散中的采样时公平性
Source: https://arxiv.org/html/2607.28945
Mahdi Bagheri
University of California, Irvine
Amir M. Rahmani
University of California, Irvine
###### 摘要
合成表格数据越来越多地用于隐私保护的数据共享、数据增强以及缓解下游分类器的偏见。最先进的表格扩散模型(如 TabDDPM 和 TabSyn)在分布保真度上表现出色,但缺乏公平性机制;相反,公平性感知的表格生成器(DECAF、FairTGAN、FairTabDDPM)在训练时显式施加公平性惩罚,却只带来微小的公平性提升,同时以样本质量或下游效用的显著损失为代价。我们提出 FairDiffuseVQVAE,一种两阶段架构,将保真度与公平性解耦:一个带有行级判别器的向量量化自编码器(阶段 1,无公平性项),后接一个 DiffuseVAE 风格的连续扩散细化器,该细化器通过无分类器引导(阶段 2)同时以阶段 1 的重建结果和受保护属性为条件。公平性作为采样分布的一个属性出现——在推理时对受保护属性进行均匀采样,从构造上保证统计均等(demographic parity)——而非来自相互竞争的损失项。在 Yang 等人(2025)的基准测试(Adult、Bank、COMPAS)上,FairDiffuseVQVAE 取得了最高的平均统计均等比(0.702,比 FairTabDDPM 提升 47%)和平均等机会比(0.686,提升 100%)。它还在所有已发表方法中取得了最低的平均列间相关性误差(0.034),同时明确以约 15 个 AUC 点换取了这些公平性增益。
## 1 引言
表格数据是医疗、金融、社会科学和公共政策领域的主要数据形态(Borisov 等人,2022)。发布此类数据受到隐私法规(HIPAA、GDPR)(Jordon 等人,2022)、获取代表性样本以覆盖欠代表性人群的难度,以及最关键的——这些数据集通常编码的偏见的限制。一个历史上对某个特定人口群体过度代表的贷款审批数据集,即使下游模型本身是无偏的,也会训练出一个延续这种偏见的下游模型(Caton 和 Haas,2024;Plečko 和 Bareinboim,2024)。合成表格数据生成旨在同时解决这三个问题:生成符合隐私约束的现实样本,扩展对欠代表性群体的支持,并减少下游分类器偏见。
最近的表格数据扩散模型已经弥合了与真实数据之间的大部分“质量”差距。TabDDPM(Kotelnikov 等人,2023)将去噪扩散适配到混合类型的表格特征上,TabSyn(Zhang 等人,2024)通过在学习的 VAE 的潜在空间中进行扩散进一步推进了这一点,实现了低于 1% 的逐列密度误差。然而,这些方法都没有对生成数据的公平性提供任何保证:合成分布会继承训练数据中包含的任何统计偏差。
另一条互补的研究路线明确针对公平表格合成。DECAF(van Breugel 等人,2021)将因果感知的公平性编辑引入 GAN;FairTGAN 和 FairTabDDPM(Yang 等人,2025)分别向表格 GAN/DDPM 添加公平性惩罚项。这些方法改善了公平性指标,但通常以样本质量(FairTabDDPM 密度误差 0.119 vs TabSyn 的 0.015)或下游效用的损失为代价——我们观察到,当底层生成架构被迫在重建与对抗或辅助损失之间折衷时,这种张力会更加尖锐。
#### 我们的视角。
我们认为公平性机制不应在训练期间与重建相互竞争。相反,如果生成模型以受保护属性为条件,则可以在采样时执行公平性。通过在采样时从均匀分布中抽取受保护属性,合成分布的边际在构造上满足统计均等;无分类器引导(Ho 和 Salimans,2022)提供了一个可调旋钮,控制样本在条件流形上的集中程度。为了使这在表格数据上实用,我们将向量量化自编码器(阶段 1)与一个在输入空间中训练并以(i)阶段 1 重建结果和(ii)受保护属性为条件的连续扩散细化器(阶段 2)耦合。阶段 1 模型在没有任何公平性项的情况下训练;所有公平性正则化都推迟到阶段 2 的条件结构中。
#### 贡献。
- •我们提出了 FairDiffuseVQVAE,一种两阶段架构,结合了 VQGAN 风格的自编码器(Esser 等人,2021;van den Oord 等人,2017)与 DiffuseVAE 风格(Pandey 等人,2022)的输入空间扩散细化器。公平性机制是采样时对受保护属性的无分类器引导;无需显式的公平性损失项。
- •我们证明,该设计在 Yang 等人(2025)的基准测试上大幅超越特定公平性基线:平均统计均等比为 0.702(比 FairTabDDPM 提升 47%),平均等机会比为 0.686(提升 100%)。
- •我们还表明,同一架构在所有已发表方法中取得了最低的平均列间相关性误差(0.034),超越了 TabSyn(0.041);效用-公平性权衡相对于最强基线约损失 15 个 AUC 点。
- •我们提供了一个可复现的流程,集成到 TabSyn 仓库中,支持 Zhang 等人(2024)和 Yang 等人(2025)中使用的全部八个数据集,并一致地报告密度、相关性、AUC、DCR、DPR 和 EOR。
## 2 背景
### 2.1 向量量化与 VQGAN
向量量化变分自编码器(VQ-VAE,van den Oord 等人,2017),建立在变分自编码器的基础之上(Kingma 和 Welling,2014;Rezende 等人,2014),用一个离散码本 \(\mathcal{Z} = \{ e_k \}_{k=1}^K\) 的学习嵌入向量增强标准自编码器。编码器输出 \(z_e\) 被替换为其最近的码本条目 \(z_q\),梯度通过直通估计器(Bengio 等人,2013)传播经过量化步骤。码本加上承诺损失 \(\beta \| z_e - \mathrm{sg}[z_q] \|^2\) 正则化潜在空间。VQGAN(Esser 等人,2021)通过感知损失(Zhang 等人,2018)和补丁级判别器(Goodfellow 等人,2014)扩展了 VQ-VAE,产生高保真图像重建,从而支持下游生成建模(通常通过码本索引上的自回归先验)。
### 2.2 扩散模型与 EDM
去噪扩散概率模型(DDPM,Ho 等人,2020)通过逆转一个逐步添加高斯噪声的马尔可夫链来生成样本。我们采用 Karras 等人(2022)的 EDM 公式,它通过从对数正态分布中抽取的连续噪声水平 \(\sigma\) 表示前向过程,并用加权 MSE 目标 \(\mathbb{E}_{\sigma,\epsilon,x}\big[ w(\sigma) \| D_\theta(x+\sigma\epsilon,\sigma) - x \|^2 \big]\) 训练去噪器 \(D_\theta\),其中 \(w(\sigma) = (\sigma^2 + \sigma_{\mathrm{data}}^2) / (\sigma \sigma_{\mathrm{data}})^2\)。EDM 采样器(Heun)在相当样本质量下比普通 DDPM 需要更少的函数评估。潜在扩散模型(LDM,Rombach 等人,2022)将 VAE 与潜在空间中的 EDM/DDPM 组合;DiffuseVAE(Pandey 等人,2022)以不同方式组合它们——一个以 VAE 重建结果为条件的输入空间 DDPM。
### 2.3 无分类器引导
无分类器引导(CFG,Ho 和 Salimans,2022)联合训练一个去噪器,同时处理条件和无条件样本(通过在训练期间随机丢弃条件信号),然后在采样时对两个预测进行插值:\(\hat{D}^{\mathrm{cfg}} = D^{\varnothing} + w(D^{c} - D^{\varnothing})\)。对于 \(w > 1\),样本被进一步推入条件流形;对于 \(w = 1\),行为与标准条件采样一致。
### 2.4 公平性指标
我们遵循 Yang 等人(2025),他们遵循 Agarwal 等人(2018)和 Hardt 等人(2016),使用统计均等比(DPR)和等机会比(E相似文章
面向奖励引导扩散的分层变分策略
提出了面向奖励引导扩散的分层变分策略框架,在降低推理成本的同时实现高质量采样。在超分辨率等任务上展现了优异的质量-速度权衡。
面向真实世界时间序列的量子生成扩散模型
QDiffusion-TS是首个针对真实世界时间序列合成的量子生成扩散模型,它用量子神经网络替换了去噪Transformer中的前馈组件。该模型将可训练参数减少了近三个数量级,并在金融数据上将Wasserstein距离改进了44%,在下游预测任务中RMSE最高提升71%。
金融领域的约束表格扩散
介绍了金融领域的约束表格扩散(CTDF),该方法将可行性操作集成到扩散采样中,以对金融合成数据生成施加硬约束。
线性约束下的条件扩散:Langevin 混合与信息论保证
本文分析了预训练扩散模型在线性逆问题上的零样本条件采样,提供了信息论保证并提出了一种投影 Langevin 初始化方法。
FAIR-Calib:面向扩散大语言模型训练后量化的前沿感知不稳定性重加权校准
本文提出了FAIR-Calib,一种用于扩散大语言模型的两阶段训练后量化框架,解决了迭代精炼过程中令牌提交的不稳定性问题。在低比特量化下,它在LLaDA和Dream模型上取得了最先进的结果。