跨合成数据生成器家族的可移植因果公平性

arXiv cs.LG 论文

摘要

这篇论文展示了因果公平机制,特别是因果图上的边切割,能够跨各种合成数据生成器家族移植,包括GANs和扩散模型,对数据保真度和实用性影响极小。

arXiv:2609.03180v1 公告类型:新 摘要:当统计机构或监管机构发布合成数据以替代敏感记录时,它选择生成数据表的生成器,并可以调整该生成器以消除不公平的路径。DECAF在一个非私有GAN上具体实现了这一点:三个公平性定义转化为生成器因果图上的三组边切割。该机制是否属于DECAF,或属于因果分解本身,此前未经测试。我们将所有三个定义移植到九个来自三个不相关家族的生成器(基于边际分布的、GAN和扩散模型,每个都有差分私有变体),跨三个正式隐私保证级别,在Adult和COMPAS数据集上进行了2,520次匹配对运行。该机制在所有情况下都能转移,我们新的因果扩散骨干产生了我们测试的所有家族中最公平的发布,保真度接近边际分布层级。应用切割几乎不影响保真度,仅使下游分类器的AUC平均降低约0.07到0.15,并且添加隐私保证不会使数据变得更不公平。
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:22

# 跨合成数据生成器家族的可移植因果公平性
来源:https://arxiv.org/html/2609.03180
Steven Golob††感谢:通讯作者\.Sikha Pentyala附属机构:华盛顿大学塔科马分校Martine De Cock附属机构:华盛顿大学塔科马分校

###### 摘要

当统计机构或监管机构发布合成数据以替代敏感记录时,它选择生成该表的生成器,并可以调整该生成器以消除不公平路径。DECAF在一种非私有生成对抗网络(GAN)上实现了这一点:三种公平性定义转化为生成器因果图上的三组边切割。这种机制是属于DECAF,还是属于因果分解本身,此前未经测试。我们将所有三种定义移植到来自三个不相关家族(基于边际分布、GAN和扩散模型,每个家族都有差分隐私变体)的九种生成器中,在三个形式化隐私保证层级下,使用Adult和COMPAS数据集进行了2,520次配对匹配运行。该机制在所有生成器上均有效,我们新的因果扩散骨干网络在所有测试家族中产生了最公平的发布结果,其保真度接近基于边际分布的层级。应用切割几乎不影响保真度,仅使下游分类器的平均AUC降低约0.07至0.15,并且添加隐私保证不会使数据变得不公平。

## 1 引言

持有敏感记录的机构越来越多地发布合成替代品而非原始记录:医院、贷款监管机构或统计机构拟合一个生成模型,并发布从中抽取的表格。这种做法真实存在且日益普遍:2020年美国人口普查在差分隐私保证下发布[2 (https://arxiv.org/html/2609.03180#bib.bib22)],而由NIST、FDA和美英隐私技术项目举办的公开挑战赛已使私有表格发布成为可行技术而非提案[17 (https://arxiv.org/html/2609.03180#bib.bib23),8 (https://arxiv.org/html/2609.03180#bib.bib24),21 (https://arxiv.org/html/2609.03180#bib.bib25)]。这种替代通常基于隐私理由,但它带来了第二个、较少被利用的后果。生成数据的人选择生成过程,而过程是可以编辑的。因受保护属性(如原籍国)到结果(如贷款是否获批)路径而存在的世界差异,在发布的表格中未必存在。

现有最清晰体现这一杠杆的是DECAF[20 (https://arxiv.org/html/2609.03180#bib.bib1)],它沿着因果图对生成器进行分解,使得在采样时切断一条边,生成器就结构性地无法使用它所命名的路径。但DECAF只是一个非私有的WGAN-GP[9 (https://arxiv.org/html/20609.03180#bib.bib16)],其发布的表格在保真度和效用基准测试(决定机构实际部署的基准)上落后于现代差分隐私边际合成器和现代扩散模型(第4节 (https://arxiv.org/html/2609.03180#S4))。因此,公平性机制是仅限于这一特定架构,还是因果分解本身的属性,是一个实际问题,而不仅仅是学术问题:它决定了部署合成数据的机构是否能够使用这种干预手段。

我们对该机制提出两个问题。边切割是DECAF的特性,还是任何此类生成器使用的因果分解的特性?其次,它能否应用于一个其图不是给定的因果有向无环图(DAG),而是差分隐私合成器从噪声计数中构建的无向边际依赖图的生成器?关键在于实际意义:如果使发布表格公平的机制仅限于机构实际上不会采用的生成器,那它就形同虚设。

## 2 背景与相关工作

图1:三种公平性定义作为三组被切断的边,作用于数据被*生成*时的图,而非事后为下游任务训练的模型。S是受保护属性,Y是结果,A是被认为具有合法影响的可接受属性,Z是中间代理。红色虚线边被切断。DemPar移除每一条有向S↝Y路径;CF仅移除那些不经过A的路径,因此S→A→Y路径得以保留。#### DECAF:作为图手术的公平性。

DECAF[20 (https://arxiv.org/html/2609.03180#bib.bib1)]使用一个生成器沿因果DAG(有向无环图)*分解*的GAN生成公平的合成表格:列上的联合分布被写为条件概率的乘积,P(X) = ∏i P(Xi | pa(Xi)),其中pa(Xi)是图中作为列Xi父节点的列。这与基于边际分布的合成器(如MST[15 (https://arxiv.org/html/20609.03180#bib.bib12)])拟合的分解相同,主要区别在于MST的依赖图是无向的。DECAF为每一列提供一个仅读取pa(Xi)的子网络,因此父节点可以在生成时通过替换一个独立于行中其余部分的替代值来切断。

切断Xj→Xi无需重新拟合:训练好的条件模型改为*评估*一个从Xj自身边际分布重新采样的替代父值,这是一种在采样时应用的*do*式干预。这就是为什么切割代价低廉,以及它为何会损失保真度:子网络被要求处理训练时从未见过的父节点组合。

哪些边需要切断,将一个公平性*定义*转化为一个*算法*,DECAF提供了三种(图1 (https://arxiv.org/html/2609.03180#S2.F1))。FTU(通过不知情实现公平)仅切断直接边S→Y;DemPar111DECAF称此机制为DP;我们在全文中写作DemPar,并保留DP用于差分隐私,在下面每个结果中均与此处一并讨论。(人口统计对等)切断每一条有向S↝Y路径;CF(条件公平)保留经过建模者指定为*可接受*属性的路径,因此通过合法因素传递的差异得以保留。DECAF自己的示例最为清晰:Education→Resume→Job值得保留,因为Resume是可接受的,而Race→Postcode→Loan是红线划定,不可接受。该机制清晰明了,其作者认为它应能移植到其他生成器。

#### 差分隐私。

发布敏感表格的机构越来越多地附加差分隐私(DP)保证[7 (https://arxiv.org/html/20609.03180#bib.bib19)]:2020年美国人口普查即如此发布[2 (https://arxiv.org/html/20609.03180#bib.bib22)],而我们在此研究的合成器是使私有表格发布变得可行的公开挑战赛的优胜者和参赛者[17 (https://arxiv.org/html/20609.03180#bib.bib23),15 (https://arxiv.org/html/20609.03180#bib.bib12),21 (https://arxiv.org/html/20609.03180#bib.bib25)]。DP通过预算ε限制任何单个个体对发布表格的影响:较小的ε意味着更强的隐私和更嘈杂的发布。ε=1是机构可能发布的紧预算;ε=1000是一个接近无隐私的宽松比较点。下文中所有“私有”或“DP-”的提法均指此类合成器。

#### 相关方法与差距。

只有PreFair[18 (https://arxiv.org/html/20609.03180#bib.bib2)]将生成器内的公平性切割应用于私有合成器,仅通过在私有结构搜索运行之前将有问题的边际分布排除在候选之外,将CF应用于MST。所有其他在生成过程中结合隐私与公平的方法都在图之外起作用:在学习的嵌入上强制独立性[10 (https://arxiv.org/html/20609.03180#bib.bib7),19 (https://arxiv.org/html/20609.03180#bib.bib8)],提示大型语言模型(LLM)骨干[16 (https://arxiv.org/html/20609.03180#bib.bib10)],学习没有公平性目标的私有结构[12 (https://arxiv.org/html/20609.03180#bib.bib11)],或缓解下游[3 (https://arxiv.org/html/20609.03180#bib.bib3)]。因果DAG扩散仅针对保真度[23 (https://arxiv.org/html/20609.03180#bib.bib4),11 (https://arxiv.org/html/20609.03180#bib.bib5)],而没有因果图的私有表格扩散无法提供可供切割的每列边[27 (https://arxiv.org/html/20609.03180#bib.bib9)]。我们在§4.3 (https://arxiv.org/html/20609.03180#S4.SS3)中与[Angelozzi and Arcolezi [3]](https://arxiv.org/html/20609.03180#bib.bib3)进行基准比较,这是唯一一个在相同单位(保留真实人群的对等差距)上的先前系统;基于嵌入和LLM的生成器超出我们的范围,我们的范围是生成器内的边切割是否跨家族可移植,而非公平合成数据生成算法的直接比较。

这留下了一个无人提出的问题:DECAF的边切割是完整的*DECAF*架构的特性,还是*因果分解*的特性?DECAF推测是后者,称该方法“简单且可扩展到其他生成方法”,但从未进行测试。其关键在于实际意义:如果该机制仅限于DECAF,那么希望获得公平发布的发布者就必须接受一个非私有的GAN,而根据我们自己的测量(图2 (https://arxiv.org/html/20609.03180#S4.F2)),没有机构会采用它;如果这是分解的特性,发布者在为隐私和质量选择合成器时,可以保留公平性杠杆,涵盖主导私有表格数据的基于边际分布的合成器[15 (https://arxiv.org/html/20609.03180#bib.bib12),24 (https://arxiv.org/html/20609.03180#bib.bib13),26 (https://arxiv.org/html/20609.03180#bib.bib14)]和扩散模型,后者在多个表格质量基准测试中领先[13 (https://arxiv.org/html/20609.03180#bib.bib6)]。

## 3 移植机制

我们针对单一接口实现了FTU、CF和DemPar,222匿名代码,附有重现所有运行和表格的说明:https://anonymous.4open.science/r/CausalFairnessInSDG-55EC/。并将该接口移植到来自三个不相关家族的九种生成器。公平性定义不变。改变的是切割作用的图,以及该图是有向还是无向。每个定义都简化为对发布依赖结构的图分离约束(没有不可接受的S↝Y路径);DECAF的有向边切割和我们成对无向排除是同一约束的两种实现,因此DECAF呈现中的DAG是一种设计选择。

基于边际分布的合成器(MST[15 (https://arxiv.org/html/20609.03180#bib.bib12)]、PrivBayes[24 (https://arxiv.org/html/20609.03180#bib.bib13)]和PrivSyn[26 (https://arxiv.org/html/20609.03180#bib.bib14)])形成一个图形模型,其边是合成器选择在隐私预算下测量的列对的噪声联合计数;发布是从重现这些计数的分布中抽取的。它们的图是无向的,因此我们将切割作用于*路径*而非有序的父节点→子节点边。添加一个候选对是否会创建禁止的S到Y路径取决于模型已包含的内容,因此我们在每个选择步骤上增量检查约束。被切割排除的对永远不会被测量,这使得约束在隐私核算中是免费的,而不仅仅是低成本的(遵循PreFair[18 (https://arxiv.org/html/20609.03180#bib.bib2)]在MST上对CF的应用,此处扩展到PrivBayes、PrivSyn,以及DemPar和FTU)。

因果生成对抗网络(GAN)(DECAF,加上我们在CTGAN表示[22 (https://arxiv.org/html/20609.03180#bib.bib15)]和DP-SGD[1 (https://arxiv.org/html/20609.03180#bib.bib20)]上构建的变体)在DAG上完全采用DECAF的替代替换。对于因果扩散,我们保持相同的分解,并用通过监督噪声预测训练的小型去噪器替换每个子网络。然后切割是相同的代码路径,因为暴露一条边的原因是Xi拥有自己的网络,仅读取pa(Xi),无论该网络是通过对抗方式训练(如GAN家族),还是通过去噪训练,这都成立。

#### 实验设置。

两个数据集,Adult[6 (https://arxiv.org/html/20609.03180#bib.bib26)]和COMPAS[4 (https://arxiv.org/html/20609.03180#bib.bib27)];九种生成器;四种机制(无/FTU/CF/DemPar);每个数据集三种受保护/可接受角色划分(附录A (https://arxiv.org/html/20609.03180#A1));五个随机种子;2,520次完成运行。九种生成器中有六种带有差分隐私保证[7 (https://arxiv.org/html/20609.03180#bib.bib19)],并在全文中标记为†:三种基于边际分布的合成器,其本身是私有的,以及我们附加DP-SGD的三种骨干(DP-GAN、DP-CTGAN、DP-扩散)。这六种在ε∈{1,10,1000}(δ=10⁻⁹)下运行;DECAF、CTGAN和Diffusion没有隐私机制,仅运行一次。对于因果GAN和扩散家族,我们根据领域知识手动指定每个数据集的DAG,这是该文献中的标准做法(遵循[Kusner et al. [14]](https://arxiv.org/html/20609.03180#bib.bib17)和[Zhang et al. [25]](https://arxiv.org/html/20609.03180#bib.bib18)),并固定不变跨生成器,以便任何效果都归因于机制。基于边际分布的生成器在隐私预算下选择自己的无向图,我们在该图上执行切割。

#### 公平性指标。

本文中所有公平性数字都是人口统计对等差距。在发布的合成表上训练分类器,用它预测*真实*人群保留样本的结果,并比较其对每个受保护群体的肯定预测频率:

差距 = |Pr(Ŷ=1 | S=1) - Pr(Ŷ=1 | S=0)|,

报告为所有划分受保护属性上的最坏情况。例如,如果在合成Adult表上训练的分类器在真实保留样本中预测50%的男性和17%的女性收入超过50k,那么差距为0.33;一种将其降至0.05的机制消除了85%的差距。注意差距说明和未说明的内容:它只询问两个群体是否获得肯定预测的频率相等,而不关心任何预测是否正确。在此处它是正确的目标,因为它是DemPar定义要消除的差异,并且它是基于真实人群而非合成表测量的,因此生成器不能通过发明一个比给定人群更公平的人群来获得高分。我们也记录每次运行的条件对等和正负率平衡;以下所有主张在所有四种指标上都成立,我们报告对等差距,因为这是三种机制针对定义的指标。

#### 保真度、效用和匹配对。

对于*保真度*,我们报告合成边际与真实边际之间的全变差距离(TVD)(0=完全一致,1=无质量重叠),在单列(1-way)和列对(2-way)上取平均,再加上跨列对的Cramér's V平均绝对差(询问发布是否保留每对关联的*强度*)。对于*效用*,我们在合成表上训练分类器,并在真实保留的30%上进行评分,报告AUC(最低0.5)和宏F1(最低0.41),并与真实数据上训练的参考进行对比。因为种子噪声与公平性效果相当,我们报告所有随机种子上的平均值。由于种子噪声与公平性效果相当,我们报告所有随机种子上的平均值。

相似文章

通过同质-异质分割的合成图像生成后策展

arXiv cs.LG

本文提出了一种与生成器无关的生成后策展方法,通过将真实类别拆分为规范的同质子集和无冗余的异质子集,并基于保真度-多样性准则对合成图像进行评分,从而选取信息丰富的合成图像子集。该方法持续优于现有的数据选择基线,并且在合成样本数量减少多达40%的情况下,仍能达到与真实数据相当的性能。