LLM-as-a-Discriminator:当合成表格看起来仍然真实
摘要
本文提出了一种基于LLM鉴别的方法,用于审计合成表格数据的隐私,通过让LLM将样本分类为真实或合成,表明LLM鉴别可以作为一种实用的隐私审计信号。
arXiv:2606.09865v1 Announce Type: new
摘要:隐私与数据共享往往处于矛盾之中。许多组织使用合成数据来降低隐私风险,同时仍能共享有用的数据。对于表格数据,隐私审计仍然困难。在许多情况下,即使是人类也很难判断一个表格是真实的还是合成的。本文提出了一种基于LLM鉴别的方法。我们让LLM对每个表格样本进行分类,判断其为真实还是合成。我们测试了两种设置:C1仅包含表格,C2包含表格及分布元数据。我们使用LLaMA作为开源模型,Gemini作为参考模型。在实验中,我们在两个公开数据集(UCI Adult和ACS Census)上运行了三种合成模型:CTGAN、TVAE和Gaussian Copula。我们收集了451次有效试验。结果显示模型间存在明显差异。在Adult数据集上,LLaMA在报告单元中DRS=0%,而Gemini在CTGAN和TVAE上DRS=100%。在Census数据集上,LLaMA对大多数样本预测为合成,而Gemini在C1中保持较高值,但在C2中对CTGAN和TVAE有所下降。我们还与分类器双样本检验(C2ST)和记录链接作为分布基线进行了比较,并进行了由2名标注员和240次试验组成的人工试点。结果表明,当谨慎处理模型选择、按提供者报告以及数据编码时,LLM鉴别是一种实用的隐私审计信号。为便于复现,代码和实验脚本可在 https://github.com/SlokomManel/LLM-as-a-Discriminator 获取。
查看缓存全文
缓存时间: 2026/06/10 06:14
# LLM-as-a-Discriminator:当合成表格仍然看起来很真实
来源:https://arxiv.org/html/2606.09865
11institutetext:Vrije Universiteit, Amsterdam11email:manel\.slokom@live\.fr22institutetext:Equativ, Paris22email:slokom\.malek@livgmaile\.com33institutetext:EDICIA, Nantes33email:thierno\.kante@edicia\.fr###### 摘要
隐私与数据共享常常存在矛盾。许多组织使用合成数据来降低隐私风险,同时仍能共享有用数据。对于表格数据,审计隐私仍然困难。在许多情况下,即使是人类也难以轻易判断一个表格是真实的还是合成的。在本文中,我们提出了一种基于LLM判别的方法。我们让一个LLM将每个表格样本分类为`REAL`或`SYNTHETIC`。我们测试了两种设置:仅表格的C1,以及表格加分布元数据的C2。我们使用LLaMA作为开源模型,Gemini作为参考模型。在实验中,我们在两个公共数据集(UCI Adult和ACS Census)上运行了三种合成模型(CTGAN、TVAE和Gaussian Copula)。我们收集了451次有效试验。结果显示了模型之间的明显差异。在Adult数据集上,LLaMA在报告的单元格中达到DRS=0%,而Gemini对CTGAN和TVAE达到DRS=100%。在Census数据集上,LLaMA将大多数样本预测为`SYNTHETIC`,而Gemini在C1中保持高位,但在C2中对CTGAN和TVAE有所下降。我们还将结果与作为分布基线的分类器双样本检验(C2ST)和记录链接,以及由2名标注者和240次试验组成的人工试点进行了比较。我们的结果表明,当模型选择、按提供商报告和数据编码得到谨慎处理时,LLM判别是一种实用的隐私审计信号。为便于复现,代码和实验脚本可在https://github.com/SlokomManel/LLM-as-a-Discriminator获取。
## 1 引言
组织越来越多地将合成表格数据作为真实微观数据的隐私保护替代方案。关键的实际问题是,一个信息丰富的对手是否仍然能够判断哪些记录是真实的。如果是,那么所提供的保护可能比假设的要弱。
经典的统计披露控制(SDC)工具,例如k-匿名性、微聚集、记录链接[9 (https://arxiv.org/html/2606.09865#bib.bib219),23 (https://arxiv.org/html/2606.09865#bib.bib250),18 (https://arxiv.org/html/2606.09865#bib.bib203)],是为掩码或扰动数据设计的,并未考虑生成模型。深度生成模型的兴起促使成员推断攻击(MIAs)成为隐私风险度量[21 (https://arxiv.org/html/2606.09865#bib.bib279),20 (https://arxiv.org/html/2606.09865#bib.bib156)]。MIA被框架化为一个二元分类问题:给定一个目标记录和一份合成发布数据,该记录是否属于原始训练集?最先进的影子建模方法即使在黑盒设置下也能实现非平凡的真正率,尽管没有一种攻击能够在所有生成器和数据集上占据主导地位[19 (https://arxiv.org/html/2606.09865#bib.bib261)]。属性推断[10 (https://arxiv.org/html/2606.09865#bib.bib235)]和链接攻击进一步证实了合成数据面临与经典匿名化类似的隐私-效用权衡。然而,所有这些方法都有一个共同的局限性:它们无法捕捉一个*人类或AI观察者*是否能够直接区分合成表格与真实表格。
大型语言模型(LLMs)越来越多地被用作自动评估器。在[27 (https://arxiv.org/html/2606.09865#bib.bib304)]中,作者展示了强大的LLM评判者与人类偏好的一致性超过80%。然而,使用LLM作为黑盒*判别器*来审计合成表格发布的隐私尚未得到系统研究。我们通过一个*LLM-as-Discriminator*协议填补了这一空白,该协议在两种威胁条件下运行:仅表格(C1)和表格加分布元数据(C2)。这种框架模拟了一个现实的对手,他能够访问发布数据但不能访问生成器内部,并且产生可解释的输出(判决、置信度),供从业者检查。我们做出四项贡献:(i) 一个用于黑盒隐私审计的*LLM-as-Discriminator*协议,在两种威胁条件下(仅表格C1和表格加元数据C2);(ii) 在451次有效试验中,横跨两个数据集、三种合成方法和两个LLM家族的评估,显示出强烈的模型依赖性和编码依赖性;(iii) 一个平衡的*披露风险评分*(DRS),并与经验基线(C2ST和记录链接)进行比较,报告方向一致性;(iv) 一个受控的人类试点(240次试验),显示LLaMA落后于人类标注者,而Gemini达到或超过人类表现。
我们的实验评估围绕五个研究问题组织,详见第5节。本文其余部分组织如下。第2节回顾了关于披露风险、数据合成和基于LLM评估的相关工作。第3节描述了LLM-as-Discriminator协议和披露风险评分。第4节介绍了实验设置。第5节报告了我们的结果。第6节讨论了我们的发现并将其与经典隐私度量联系起来。第7节总结并指出了未来工作的方向。附录0.A提供了额外的分析。
## 2 背景与相关工作
在本节中,我们分三部分回顾相关工作:(1) 隐私风险度量,(2) 合成方法,以及 (3) LLM作为评估器。
### 2.1 统计数据库的隐私风险度量
隐私风险主要有两种形式[24 (https://arxiv.org/html/2606.09865#bib.bib288)]:身份披露,即对手将外部信息与发布的记录关联起来;以及属性披露,即对手推断出关于个人的敏感信息。
基于SDC的度量。kk-匿名性[22 (https://arxiv.org/html/2606.09865#bib.bib249)]、l\\ell-多样性和tt-接近性[24 (https://arxiv.org/html/2606.09865#bib.bib288)]通过不可区分性约束来度量身份和属性披露风险。CAP[13 (https://arxiv.org/html/2606.09865#bib.bib191),12 (https://arxiv.org/html/2606.09865#bib.bib268)]估计对手正确猜测敏感属性值的概率。这些度量已经很成熟,但当初是为掩码或扰动数据设计的,并非用于生成模型。
基于攻击的度量。MIAs[19 (https://arxiv.org/html/2606.09865#bib.bib261)]推断目标记录是否属于生成器的训练集。属性推断攻击[10 (https://arxiv.org/html/2606.09865#bib.bib235),17 (https://arxiv.org/html/2606.09865#bib.bib21)]针对的是敏感属性值而非成员身份。记录链接[6 (https://arxiv.org/html/2606.09865#bib.bib287),15 (https://arxiv.org/html/2606.09865#bib.bib298)]度量将合成记录与外部数据库匹配的风险。我们使用MIAs和记录链接作为正式基线。
据我们所知,这些方法中没有一个能够捕捉到一个信息丰富的观察者在发布后是否能够直接区分合成表格与真实表格。我们填补了这一空白。
### 2.2 合成表格数据生成
表格数据的合成方法在如何建模和采样底层数据分布方面有所不同。我们简要概述主要方法。
统计方法。在[14 (https://arxiv.org/html/2606.09865#bib.bib233)]中,作者使用高斯连接函数和参数化边际模型来重现成对列相关性。基于CART的合成器通过递归划分从估计的条件分布中抽取记录[16 (https://arxiv.org/html/2606.09865#bib.bib237),5 (https://arxiv.org/html/2606.09865#bib.bib37)]。两种方法都很透明,但它们的输出带有可预测的统计结构,攻击方法可以利用这些结构。
基于GAN的方法。CTGAN[25 (https://arxiv.org/html/2606.09865#bib.bib177)]通过连续列的模态特定归一化和条件向量训练,将条件GAN范式适应于异构表格数据。TVAE应用变分自编码器来学习联合分布的潜在嵌入。两种方法都比统计基线更忠实地捕捉复杂的列间依赖关系。
扩散和语言模型方法。TabDDPM[11 (https://arxiv.org/html/2606.09865#bib.bib297)]将去噪扩散概率模型应用于表格数据,并在标准基准上实现了强保真度。GReaT[1 (https://arxiv.org/html/2606.09865#bib.bib306)]将表格行序列化为自然语言句子,并微调大型语言模型以通过token级补全生成新行。这些方法产生的记录可能在语义上合理,并能抵抗纯粹的分布检测,这提出了统计评估协议当初并未设计回答的问题。
### 2.3 LLMs作为评估器
LLMs在广泛任务中表现出强大性能,并已被扩展到表格数据处理[26 (https://arxiv.org/html/2606.09865#bib.bib305),4 (https://arxiv.org/html/2606.09865#bib.bib301)]。最近,它们被用作自动评估器,替代或补充人工标注[8 (https://arxiv.org/html/2606.09865#bib.bib299)]。Zheng等人[27 (https://arxiv.org/html/2606.09865#bib.bib304)]表明GPT-4的判断与人类偏好的一致性超过80%,确立了LLM-as-a-Judge作为人工标注的可扩展替代方案。Chiang和Lee[3 (https://arxiv.org/html/2606.09865#bib.bib303)]发现LLM与人类在定义良好的二元任务上具有高度一致性,并记录了系统偏差,如位置偏差和冗长偏好。我们遵循这种二元任务框架,并将其应用于一个新的设置:区分真实与合成表格记录。
LLM判断的可解释性。LLM评判者会输出判决以及解释其决策的自然语言理由[7 (https://arxiv.org/html/2606.09865#bib.bib302)]。这一特性在隐私审计中非常有用,因为从业者不仅需要判别信号,还需要解释为何某个记录看起来是合成的。我们的方法在一个提示中同时引出判决、置信度分数和理由。我们利用这些理由来分析模型在不同威胁条件下的推理过程。
## 3 LLM-as-Discriminator框架
我们将隐私审计框架化为一个二元分类任务。给定一个来自真实数据集R\\mathcal{R}或合成数据集S\\mathcal{S}的表格样本TT,判别器D\\mathcal{D}必须输出三项内容:一个判决v∈\{REAL,SYNTHETIC\}v\\in\\{\\texttt{REAL},\\texttt{SYNTHETIC}\\},一个置信度分数c∈\[0,100\]c\\in\[0,100\],以及一个自然语言理由。我们使用大型语言模型来实例化D\\mathcal{D}。LLMs可以大规模运行,产生明确且可复现的推理,并且拥有在预训练期间获得的、关于真实数据分布的广泛隐含知识。
核心隐私见解很简单。如果D\\mathcal{D}的准确率接近50%的随机基线,则合成数据与真实数据*感知上无法区分*。这为在信息丰富的对手面前的隐私鲁棒性提供了经验证据。如果D\\mathcal{D}的准确率显著更高,则合成数据中存在可判别的伪影。这些伪影可以被利用来发动记录链接、成员推断或属性推断攻击。
### 3.1 实验条件
我们定义两种威胁条件(见表1 (https://arxiv.org/html/2606.09865#S3.T1))。在C1(仅表格)下,判别器接收一个Markdown格式的样本,包含N=20N=20行、列名和数据集维度,模拟一个仅能访问数据发布的对手。在C2(表格加元数据)下,相同的样本被附加一个从完整数据集计算的结构化元数据块,包括每列的描述性统计量(均值、标准差、四分位数、偏度、峰度)、Shapiro-Wilk检验结果、top-kk类别频率、香农熵以及皮尔逊相关矩阵。这模拟了统计机构发布中常见的情景,即摘要统计量与合成数据一同发布。
表1:两种实验条件的总结。两种条件共享相同的20行表格样本。它们的区别在于提供给判别器的额外上下文。
### 3.2 提示设计
每次试验包含一个系统提示和一个用户提示。系统提示指示LLM扮演数据科学家的角色,并要求返回结构化的JSON响应,包含五个字段:`verdict`(`REAL`或`SYNTHETIC`)、`confidence`(0–100)、`reasoning`、`red_flags`和`supporting_evidence`。温度设置为零以保证可复现性。用户提示使用20行Markdown表格实例化C1或C2模板,并在C2中附加统计元数据块。结构化输出允许明确提取判决,并使LLM的推理过程可审计。我们不提供任何少样本示例;判别准确率反映的是合成数据的性质,而非任务特定的校准。
### 3.3 披露风险评分
我们引入*披露风险评分*(DRS)将原始判别准确率转化为隐私导向的标量:
DRS=min\(p^REAL,p^SYNTHETIC\),\\mathrm{DRS}=\min\\!\\left\(\\hat{p}\_{\\mathrm{REAL}},\\;\\hat{p}\_{\\mathrm{SYNTHETIC}}\\right\),(1)
其中p^REAL\\hat{p}\_{\\mathrm{REAL}}是真实样本被正确标记为`REAL`的比例,p^SYNTHETIC\\hat{p}\_{\\mathrm{SYNTHETIC}}是合成样本被正确标记为`SYNTHETIC`的比例。我们取两个每类准确率的最小值,以抵消标签偏差伪影。将所有样本都标记为`REAL`的判别器得到p^REAL=1\\hat{p}\_{\\mathrm{REAL}}=1但p^SYNTHETIC=0\\hat{p}\_{\\mathrm{SYNTHETIC}}=0,因此DRS=0\\mathrm{DRS}=0。这正确地反映了零判别能力。DRS接近0表示判别器无法区分真实与合成数据。DRS接近0.5表示随机水平的平衡判别。DRS高于0.5表示高于随机水平的判别,这是令隐私担忧的区间。
### 3.4 人工标注协议
我们使用相同的C1/C2试验结构提供了一个人类判别基线22屏幕录制:https://github.com/SlokomManel/LLM-as-a-Discriminator/blob/main/results/human/streamlit-human_labeling_app-2026-05-31-01-57-42.webm。每次会话向标注者展示一个从真实或合成数据集中采样的20行Markdown表格;在C1下仅显示表格,在C2下则附加第3.1节中的元数据块。标注者记录二元判决(`REAL`或`SYNTHETIC`)、置信度分数(0–100)以及可选的自由文本注释。会话遵循配对C1然后C2的设计:相同的10个样本首先在没有元数据的情况下展示,然后附带元数据展示,从而能够在没有样本混淆的情况下度量信息效应。
## 4 实验设置
### 4.1 数据集
我们使用两个具有相同收入预测任务但不同列编码的人口普查数据集。UCI Adult人口普查收入33ADULT:https://archive.ics.uci.edu/dataset/2/adult包含30,162条记录和14个属性(连续相似文章
评估LLM模拟器作为差分隐私数据生成器
本论文评估基于LLM的模拟器作为差分隐私合成数据生成器的能力,使用PersonaLedger来评估LLM是否能够忠实地复现受DP保护角色的统计分布。虽然在欺诈检测效用方面取得了良好成果(在ε=1时AUC为0.70),但该研究发现了由系统性LLM偏差造成的显著分布漂移,该偏差会覆盖输入统计数据。
LLM作为检测器:一种用于表格异常检测的上下文学习方法
本文提出了LLM-Detector,这是一个利用大语言模型进行上下文学习的框架,用于执行表格异常检测,无需微调,在多个数据集上展示了相对于现有方法的持续改进。
区分AI生成与人类撰写:评估LLM检测LLM生成内容的能力
本文研究了在教育场景中,LLMs在多大程度上能够检测自身生成的内容,发现检测准确率因任务类型而异,且对于简答题不可靠。
评估 LLM 在受控实验中作为人类代理的可靠性
本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。
看似合理但实际无效:对LLM作为合成调查受访者的心理测量学审计
本文对大型语言模型作为合成调查受访者进行了心理测量学审计,发现它们无法匹配人类的联合分布和信度,因此不适合作为人类受访者的替代品。