JUMP:微调扩散语言模型上的单次成员推理
摘要
本文提出JUMP,一种针对微调离散扩散语言模型的单次成员推理攻击,利用其任意顺序和并行解码特性,以更少的查询次数提高检测准确率。
arXiv:2607.16207v1 公告类型:新论文
摘要:成员推理攻击(MIA)用于测试候选样本是否出现在模型的训练数据中。我们研究了针对微调离散扩散语言模型(dLLM)的MIA,这里的成员关系指样本是否包含在目标模型的微调数据集中。与自回归语言模型不同,dLLM允许攻击者选择任意掩码集,并并行获取所有掩码位置的词元分布。先前的dLLM攻击方法SAMA采用自然的损失模拟策略,通过对多个随机采样掩码的平均重建信号进行攻击,但其仅将任意顺序接口作为随机化手段,且需要大量目标/参考查询。我们提出JUMP(联合不确定性引导掩码探测),一种单次评分攻击方法,同时利用了dLLM的两个独特特性:利用任意顺序解码能力选择低参考置信度的位置,以及利用并行解码能力通过每个模型的一次联合掩码查询对所有选定位置进行评分。JUMP将选定位置联合掩码,并计算裁剪后的目标/参考重建差距统计量。在六个MIMIR领域上对微调后的LLaDA-8B-Base进行实验,JUMP将平均ROC-AUC从0.82提升至0.90(相比SAMA),并显著改善了低假阳性率下的检测性能,同时仅需对目标模型和参考模型各进行一次选择传递和一次评分传递。
查看缓存全文
缓存时间: 2026/07/21 06:37
# JUMP:面向微调扩散语言模型的单次通过成员推断攻击
来源:https://arxiv.org/html/2607.16207
Yeachan Jun
人工智能系
延世大学,首尔,韩国
dpcks8942@yonsei\.ac\.kr
&Albert No
人工智能系
延世大学,首尔,韩国
albert\.no@yonsei\.ac\.kr
###### 摘要
成员推断攻击(MIAs)用于测试一个候选样本是否出现在模型的训练数据中。我们研究针对微调离散扩散语言模型(dLLMs)的MIAs,其中成员指样本包含在目标模型的微调集中。与自回归语言模型不同,dLLMs允许攻击者选择任意掩码集,并并行获取所有掩码位置的标记分布。先前的dLLM攻击SAMA采用一种自然的损失模拟策略,通过对许多随机采样的掩码进行重建信号平均化,但它仅将任意顺序接口用作随机化,并需要大量目标/参考查询。我们提出JUMP(*联合不确定性引导的掩码探测*),一种单次通过评分攻击,同时利用dLLMs的两个独特性质:任意顺序可解码性用于选择低参考置信度的位置,并行可解码性用于通过每个模型的一次联合掩码查询对所有选定位置进行评分。JUMP联合掩码选定位置,并计算一个截断的目标/参考重建差距统计量。在六个MIMIR域上微调的LLaDA-8B-Base上,JUMP将平均ROC-AUC从0.82提升至0.90,超过SAMA,并大幅改善了低FPR检测,同时仅需对每个目标模型和参考模型执行一次选择通过和一次评分通过。
## 1 引言
成员推断攻击(MIAs)是审计机器学习模型隐私泄露的标准工具(Shokri等人,2017 (https://arxiv.org/html/2607.16207#bib.bib1);Yeom等人,2018 (https://arxiv.org/html/2607.16207#bib.bib2))。给定一个训练好的模型和一个候选样本,攻击者判断该样本是否出现在模型的训练数据中。成功的攻击揭示了模型的输出保留了特定训练样本的可测量痕迹。我们研究针对微调语言模型的问题:目标模型在私有语料库上进行适配,成员则指样本包含在该微调集中。
对于自回归(AR)语言模型,MIAs自然遵循从左到右的似然接口。一个序列通过训练中使用的相同前缀条件预测进行评分,更强的攻击通过参考校准、标记过滤、基于扰动的比较或信息论归一化来细化该统计量(Carlini等人,2021 (https://arxiv.org/html/2607.16207#bib.bib7);Duan等人,2024 (https://arxiv.org/html/2607.16207#bib.bib15);Shi等人,2024b (https://arxiv.org/html/2607.16207#bib.bib12);Zhang等人,2025 (https://arxiv.org/html/2607.16207#bib.bib13);Xie等人,2024 (https://arxiv.org/html/2607.16207#bib.bib14);Mattern等人,2023 (https://arxiv.org/html/2607.16207#bib.bib11);Chang等人,2025 (https://arxiv.org/html/2607.16207#bib.bib16);Tao和Shokri,2026 (https://arxiv.org/html/2607.16207#bib.bib17))。然而,条件上下文是固定的:标记 \(x_i\) 总是根据前缀 \(x_{<i}\) 进行评估。扩散语言模型(dLLMs;Lovelace等人,2024;Ye等人,2024;Shi等人,2024a;Ou等人,2024;Wang等人,2024a;Chen等人,2025)改变了这种顺序依赖性。它们在任意位置计算 \(p(x_i \mid x_{\backslash i})\),其中 \(x_{\backslash i}\) 是除第 \(i\) 个位置外的所有标记,通常通过大量随机采样的掩码集进行训练(Austin等人,2021;Gong等人,2022)。
一个标准的MIA框架由一个评分函数 \(g(x; M_{\text{tgt}}, M_{\text{ref}})\) 定义,将候选样本 \(x\) 映射到一个实数,\(g\) 值较高表示推断为成员。然后,通过设定阈值 \(\eta\),当 \(g(x; M_{\text{tgt}}, M_{\text{ref}}) > \eta\) 时,将 \(x\) 分类为成员,并且改变 \(\eta\) 可得出ROC曲线。一个典型的例子是负损失统计量 \(g_{\text{loss}}(x; M_{\text{tgt}}) = -\ell(M_{\text{tgt}}, x)\),它将成员泄露与泛化差距联系起来(Yeom等人,2018 (https://arxiv.org/html/2607.16207#bib.bib2))。基于参考的攻击则将目标与参考进行比较,例如 \(g_{\text{ref}}(x) = -\ell(M_{\text{tgt}}, x) + \ell(M_{\text{ref}}, x)\),以减少样本内在难度带来的混淆效应(Watson等人,2022 (https://arxiv.org/html/2607.16207#bib.bib5);Carlini等人,2022 (https://arxiv.org/html/2607.16207#bib.bib4);Zarifzadeh等人,2024 (https://arxiv.org/html/2607.16207#bib.bib6))。补充工作研究了训练数据提取和隐私审计(Long等人,2018 (https://arxiv.org/html/2607.16207#bib.bib3);Carlini等人,2019 (https://arxiv.org/html/2607.16207#bib.bib34),2021 (https://arxiv.org/html/2607.16207#bib.bib7),2023 (https://arxiv.org/html/2607.16207#bib.bib8);Nasr等人,2025 (https://arxiv.org/html/2607.16207#bib.bib9);Steinke等人,2023 (https://arxiv.org/html/2607.16207#bib.bib35);Jagielski等人,2023 (https://arxiv.org/html/2607.16207#bib.bib36);Lukas等人,2023 (https://arxiv.org/html/2607.16207#bib.bib18);Mireshghallah等人,2022 (https://arxiv.org/html/2607.16207#bib.bib10))。
#### 自回归语言模型的MIA。
对于自回归语言模型,损失是一个自然的MIA统计量,因为模型通过下一个标记的负对数似然进行训练,从而根据前缀条件下的标记概率得出序列分数:\(g_{\text{AR}}(x) = \log p_{\text{AR}}(x) = \sum_{i=1}^{L} \log p(x_i \mid x_{<i})\)。相似文章
离散扩散语言模型上的成员推断攻击
本文研究了针对微调掩码扩散语言模型(MDLMs)的成员推断攻击(MIA)。提出了一种白盒攻击,利用模型在不同掩码比率下的重构损失构建46维特征向量,取得了较高的AUC分数,表明MDLMs的脆弱性超出先前预期。
可学习性引导的扩散语言模型微调
我们提出LIFT,一种可学习性引导的扩散语言模型微调算法,该算法根据 token 难度和时间步对齐训练,在推理基准测试上取得了显著提升。
生存引导的长度控制以实现高效扩散语言模型
该论文提出了一种针对扩散语言模型的生存引导长度预测器,在推理和代码生成基准测试中,将推理速度提升高达7倍,而不牺牲准确性。
DLLM-JEPA:面向掩码扩散语言模型的联合嵌入预测架构
介绍了DLLM-JEPA,这是一种针对掩码扩散语言模型的JEPA公式,通过扩散噪声调度从单个输入构建两个视图,相比LLM-JEPA减少了33%的训练FLOPs,并在GSM8K等任务上提升了微调性能。
预测,而非迭代:扩散语言模型的高效自适应长度填充
本文提出Pill,一种针对扩散语言模型的高效自适应长度填充方法,该方法在提升代码和文本填充任务性能的同时,减少了推理时间。