Leak It:黑盒语言模型训练数据提取的概率方法
摘要
本文提出了一种从黑盒语言模型中提取训练数据的概率方法,表明聚合的成员推断指标掩盖了逐文档泄露,并介绍了“leakit”审计工具。
arXiv:2608.00144v1 公告类型:新
摘要:语言模型上的成员推断(MIA)通常用聚合的ROC-AUC来概括,但此类评估存在混淆:无模型的盲基线仅凭表面文本就能区分成员和非成员。我们通过概率视角研究基于采样的黑盒训练数据泄露,将来自p(.|x)的N个样本视为输出分布的估计,并将泄露信号视为其泛函。我们将盲基线批评扩展到采样场景:在WikiMIA上,盲词袋分类器达到AUC 0.97(5% FPR时TPR 0.90),而采样并未增加任何收益;在IID Pile分割(MIMIR)上,自集中度和黄金延续恢复均未显著超过盲基线(增量AUC的95%置信区间包含零)。聚合指标掩盖了真正的危害。同样的采样能逐字提取训练数据,这些数据属于盲攻击无法触及的一小部分文档。在Pythia-6.9B上,500个Pile文档中有83个带有真实标识符(16.6%;其中带有电子邮件地址的文档为21.3%),这些标识符被精确重现,并且在错配前缀控制下未被重现,因此每次泄露都可归因于该文档,而非全局常见字符串。这种逐文档披露对聚合AUC不可见,且随模型容量增长(从410M到6.9B,比例为5.6%到16.6%)。风险并不均匀:代码中的标识符泄露比散文强约3倍,尽管散文仍明显为正且也随容量增长(4.0%到12.1%),而任意保留延续的恢复仅限于代码(GitHub上成员差距+0.44,散文上最多+0.014)。温度和核采样影响不大,16个token的前缀就足够了,并且我们未检测到语料库去重带来的减少。隐私审计应报告按领域分解的逐文档提取,而不是单一的AUC。我们发布了leakit,一个黑盒提取审计工具。
查看缓存全文
缓存时间: 2026/08/04 07:37
# 从黑盒语言模型中提取训练数据的概率方法 来源:https://arxiv.org/html/2608.00144 ###### 摘要 对语言模型的成员推断(MIA)通常用聚合的 ROC-AUC 来概括,但近期工作表明这些评估存在混杂因素:无模型的*盲*基线仅凭表面文本就能区分成员与非成员(Das 等人,2025)。我们从概率视角研究基于黑盒、采样的训练数据泄露。将来自 pθ(⋅∣x) 的 N 个独立样本视为模型输出分布的经验估计,我们把基于重叠的泄露信号视为该分布的泛函(平均重叠、极值、自集中)。在这个视角下,我们证实并将盲基线批评扩展到采样场景:在 WikiMIA 上,盲袋词分类器达到 AUC 0.97(TPR@5%FPR 0.90),而采样统计量没有增加任何信息;在 IID Pile 分割(MIMIR)上,自集中和黄金延续恢复均未在聚合层面显著超过盲基线(增量 AUC 95% CI 包含零)。然而,聚合指标掩盖了真正的危害。同样的概率采样*逐字提取*了盲攻击无法触及的一部分文档的训练数据。在 Pythia-6.9B 上,500 份带有真实标识符的 Pile 文档中(83 份文档;21.3% 的带电子邮件地址的文档),16.6% 的文档的精确标识符被复现,而在不匹配前缀控制下该标识符未被复现,因此每次泄露都可归因于特定文档,而非全局常见字符串。这是聚合 AUC 无法看到的逐文档披露。风险分布不均匀,我们报告的是分解结果而不仅是平均值:标识符泄露在代码中比在散文中强约 3 倍,尽管散文也明显为正并随模型规模增长(从 410M 到 6.9B,由 4.0% 增至 12.1%),而*任意*保留延续的恢复基本局限于代码(GitHub 上成员差距 +0.44,散文上 ≤ +0.014)。我们刻画了提取机制:温度和核采样影响较小,16 token 前缀已足够,所需样本预算与前缀长度成反比。我们没有发现在去重语料上训练能降低提取。我们的结果表明,语言模型隐私审计应报告逐文档提取,而非聚合成员关系,并推动差分隐私作为缓解措施。我们发布了 leakit,一个黑盒提取审计工具。 ## 1 引言 成员推断(MIA)询问某文档是否在模型训练集中。它是隐私攻击、版权审计和遗忘验证的基础。当模型在狭窄、敏感的人群上训练时,成员关系本身就是敏感属性的披露:证明某人的记录被用于训练特定疾病模型,就揭示了他患有该疾病(Knolle 等人,2026)。对于语言模型,MIA 几乎总是以成员和非成员基准上的聚合 ROC-AUC 来报告。Das 等人(2025)表明这种做法不健全:在八个基础模型基准上,从不查询模型的无模型*盲*分类器(袋词、日期检测)打败了最先进的 MIA,因为成员和非成员来自可区分的分布。因此,只有当聚合 AUC 超过盲基线,并且仅在成员和非成员同分布的基准上,它才能证明成员泄露;为此 Das 等人(2025)推荐使用具有官方训练/测试分割的语料库,如 Pile;MIMIR(Duan 等人,2024)正好提供了这一点。基于似然的攻击(LOSS(Yeom 等人,2018)、Min-K%(Shi 等人,2024)、zlib 比值(Carlini 等人,2021)、邻域比较(Mattern 等人,2023)、ReCaLL(Xie 等人,2024))进一步需要 token 级似然,而封闭 API 日益限制这些能力,MoPe(Li 等人,2023)则要求更多:白盒访问模型参数。 #### 采样泄露的概率视角。 我们询问黑盒语言模型仅通过*采样*泄露了其训练数据的什么信息。给定前缀 x,我们抽取 N 个独立延续 C1,...,CN∼pθ(⋅∣x),并将其视为模型输出分布的经验估计。基于采样的泄露信号随后是该分布的*泛函*:样本与文档保留延续之间的平均重叠(SaMIA;Kaneko 等人,2025)、其极值,以及样本之间的自集中。这一泛函视角(第3节)统一了现有的采样攻击,并构成本研究的分析主线。 #### 聚合采样-MIA 同样存在混杂。 应用 Das 的纪律,我们重现其盲基线,并将其与每个采样泛函进行比较。在 WikiMIA 上,盲袋词分类器达到 AUC 0.97(TPR@5%FPR 0.90),采样没有增加任何信息;在 IID MIMIR 分割(Duan 等人,2024)上,时间盲探针降至随机水平(0.56),确认该分割是干净的,然而自集中和黄金延续恢复都没有显著超过残余盲基线(增量 AUC 95% CI 包含 0)。作为*聚合*成员分类器,采样并未增加表面文本已揭示的信息。 #### 但采样逐字提取了训练数据的尾部。 聚合 AUC 是错误的视角:它平均掉了一小部分高度暴露的记录(Knolle 等人,2026)。提取正是盲攻击无法重现的部分。在 500 份每份都带有真实电子邮件地址或电话号码的 Pile 文档中,对 Pythia-6.9B 的黑盒采样重现了其中 83 份(16.6%)的*精确*标识符,而不匹配前缀控制显示模型并非通常性地生成该标识符,因此泄露可归因于该文档。仅限电子邮件地址时,该数字为 21.3%。这种逐文档披露对聚合 AUC 不可见,对仅文本的盲攻击也不可能,而这正是 MIA 旨在检测的具体隐私危害:如果某人的文档在训练中,采样就能重现其标识符。我们进一步刻画了提取机制:温度和核采样影响较小,16 token 前缀已足够,所需样本预算与前缀长度成反比。 #### 贡献。 - (C1) 黑盒采样泄露的概率泛函估计视角,将平均重叠、极值和自集中统计量统一为从 N 个样本估计的 pθ(⋅∣x) 的泛函(第3节)。 - (C2) 我们将盲基线批评(Das 等人,2025)扩展到采样场景:在 IID 分割上,没有采样泛函作为聚合成员分类器显著超过无模型基线(第4节)。 - (C3) 我们表明同样的采样对聚合指标和盲攻击都遗漏的一部分文档逐字提取了训练数据(包括个人身份信息),并刻画了温度、top-p、前缀长度和样本预算下的提取机制(第5节)。 - (C4) 我们发布了 leakit,一个黑盒提取审计工具,并主张语言模型隐私审计应报告逐文档提取而非聚合成员关系。 ## 2 相关工作 #### 基于采样的 MIA(SaMIA)。 Kaneko 等人(2025)引入了 SaMIA,这是第一种*基于采样*、不依赖似然的成员推断方法,仅使用采样文本对候选进行评分。SaMIA 将候选 d 分成前缀 x 和后缀 y,采样 N 个延续 Ci∼pθ(⋅∣x),并使用 r̄(d)=1N∑iROUGEn(Ci,y) 作为成员统计量(可选 zlib 重新加权)。SaMIA 在 WikiMIA 上对照 logit 基线(包括 LOSS 和 Min-K%)进行评估。我们与 SaMIA 共享无 logit 威胁模型,但更进一步:(i) 我们将问题框架为 pθ(⋅∣x) 上的泛函估计,将 SaMIA 的 r̄ 恢复为特定泛函;(ii) 我们确定了两个互补家族(极值和自集中),分别改进和替代 SaMIA 的均值;(iii) 我们在 MIMIR(Duan 等人,2024)上评估,而 SaMIA 未这样做。 #### 其他无内部信息 MIA 家族。 近期三条工作线减少了攻击者访问权限,但并未完全摆脱延续。*AttenMIA*(Zaree 等人,2026)在模型*注意力图*的跨层一致性和扰动移位特征上训练监督分类器,需要白盒访问内部信息。*PETAL*(He 等人,2025)(USENIX Security 2025)是仅标签的,但基于候选文档的逐 token 语义进行信号处理,仍需要 y。*SPV-MIA*(Fu 等人,2024)(NeurIPS 2024)提示目标模型引导出参考模型的校准集,并在候选上运行基于似然的 MIA。本文占据的是更小的攻击面:无延续、黑盒、仅样本(无内部信息、无 logit、无 y)。 #### 基于 logit 的 MIA。 LOSS 攻击(Yeom 等人,2018)以文档 NLL 为阈值。后续变体对逐 token 贡献进行重新加权或重新校准(Min-K%,Shi 等人,2024;Min-K%++,Zhang 等人,2025),对照外部复杂度基线归一化(zlib;Carlini 等人,2021),与参考模型(Ratio;Carlini 等人,2021)或邻域集成(Mattern 等人,2023)比较,或以非成员前缀为条件(ReCaLL;Xie 等人,2024)。所有这些至少需要 token 级似然访问,有些要求更多:Ratio 需要第二个模型,MoPe(Li 等人,2023)需要白盒参数。MIMIR(Duan 等人,2024)提供了五种广泛使用的基于似然攻击的统一头对头比较。 #### 黑盒提取。 Carlini 等人(2021)证明从 GPT-2 使用互联网抓取前缀进行采样可以恢复逐字训练数据序列,Nasr 等人(2025)将其扩展到对齐的生产模型。Lukas 等人(2023)专门分析了 PII 泄露,表明清洗和差分隐私在测得的 PII 暴露与效用之间进行权衡。这些工作确立了提取是可能的;我们的贡献是将其置于成员推断文献中,表明提取恰恰在聚合成员指标无法通过盲基线控制的尾部持续存在,并测量样本预算、前缀长度和解码机制如何控制它。它们的逐字泄露率是我们极值评分器的阈值版本,而我们将其作为连续统计量在同一探针上对照 logit-MIA 基线进行评估。 #### 记忆化缩放。 Carlini 等人(2022)确定 LLM 记忆化随模型规模、训练示例重复次数和提示上下文长度增长;Tirumala 等人(2022)表明更大的模型记忆更快。我们的规模阶梯结果与规模趋势一致:在固定 N 下,极值采样-MIA AUC 随 Pythia 410M→6.9B 单调增加。 #### 基准。 WikiMIA(Shi 等人,2024)将 Wikipedia 事件与每个模型的训练截止对齐。Duan 等人(2024)提供 MIMIR,涵盖七个 Pile 领域,并在成员和非成员之间进行额外 nn-gram 去重(13-grams,≤80% 重叠)。Maini 等人(2024)表明 WikiMIA 的截止前/后偏移夸大了表观 AUC(Min-K% 在那里达到≈0.7,但在 IID Pile Wikipedia 分割上≈0.5),Shi 等人(2024)记录检测与文本长度相关,MIMIR 通过将样本限制在 100–200 词来控制这一点。Das 等人(2025)将其推广为全面警告:无模型*盲*分类器(袋词、日期检测)在八个基础模型基准上打败了最先进的 MIA(例如在 WikiMIA 上 TPR@5%FPR 94.7%),因此报告的 AUC 仅在超过盲基线时才证明成员泄露,他们建议在真正的训练/测试分割(如 Pile)上评估。我们在整个研究中采用这一纪律:MIMIR 是 Pile 训练对测试分割,我们在每个攻击旁边报告盲前缀分类器。 #### 个体层面和尾部风险。 Knolle 等人(2026)表明,对于医学分类器,聚合 MIA AUC 可能接近随机水平,而少量个体记录高度脆弱,这一脆弱比例随模型容量增长,部分记录访问对某些个体仍然有效;他们指针对*生成*模型的逐记录提取是开放方向。那个黑盒生成设置,以及聚合与尾部的区别,正是我们报告结果的核心。 ## 3 采样-MIA 作为泛函估计 参见图1说明:概率性黑盒泄露。从前缀 x 出发,我们查询黑盒 LLM 获取 N 个延续 C1,...,CN∼pθ(⋅∣x),这是模型输出分布的经验估计。泄露信号是这些样本的泛函:与候选延续的重叠,以及样本之间的相互重叠(如图)。对于记忆化(成员)前缀,样本集中在训练延续上,并可能*逐字*复现它;对于新颖前缀,它们分散。橙色带标记在采样集中反复出现的 nn-gram。 ### 3.1 框架 设 M 为具有 con(续文被打断,但按原文保留)
相似文章
大语言模型中的预训练数据暴露:成员推理、数据污染及安全影响综述
统一综述大语言模型中的预训练数据暴露(PDE),涵盖成员推理、数据污染和安全影响,并回顾了攻击与防御方法。
通过填充提取扩散语言模型中的训练数据
本文介绍了infilling extraction(填充提取)方法,这是一种通过使用任意二进制掩码从扩散语言模型中提取训练数据的新方法,表明此类模型比之前认为的更容易受到记忆化攻击。
大规模语言模型的概率归因
本文提出了一种与模型无关的基于概率的令牌归因度量,利用贝叶斯规则反转下一个令牌的对数概率,捕捉模型对令牌序列的内部表示,并通过熵分析提高可解释性。
MosaicLeaks:你的研究助手能保守秘密吗?
MosaicLeaks 提出了一个新的基准,用于衡量深度研究型AI助手的隐私泄露情况,结果表明这些助手经常通过外部查询泄露私人信息,并提出了一种训练方法(PA-DR),在降低泄露的同时提升任务性能。
有限记忆语言模型中的遗忘审计
本文提出了一种因果审计框架,通过在推理过程中改变数据库状态来评估有限记忆语言模型中的遗忘情况,发现参数泄漏可忽略不计,删除后的正确性主要源于检索伪影而非残留的参数记忆。