ADS-C:面向分类的反蒸馏采样方法
摘要
本文提出ADS-C,一种面向分类任务的反蒸馏防御方法。它可在证明保留top-1精度的同时,将学生模型性能降低高达29.7个百分点,且对教师模型实现零效用成本。
arXiv:2607.15467v1 公告类型:新
摘要:知识蒸馏使攻击者能够通过查询专有分类器的预测接口,并在返回的概率向量上训练替代模型来复制该分类器。针对大语言模型提出的反蒸馏采样方法,通过输入依赖的梯度导向扰动来对抗这一威胁,但该方法向分类任务的迁移尚未被研究。通过将该防御方法适配到分类任务,我们证明其行为由教师模型每个输入置信度裕度的分布决定。由于训练良好的分类器存在严重的过度自信现象,直接迁移会表现出一个惯性窗口:在闭式可预测的阈值以下,该防御对攻击者和防御者均无影响;超过该阈值后,防御发生相变,且对教师模型的降级速度超过攻击者的学生模型。温度软化以闭式形式重新缩放该转变,且每种温度配置均位于相同的不利权衡曲线上。我们的方法ADS-C在闭式、每个输入的裕度预算下组合扰动,该预算可证明地保留每个服务的top-1预测,因此经防御的教师模型准确度与未经防御的教师模型完全相同。在此保证下,蒸馏得到的学生模型在CIFAR-100上仍损失17.4个百分点,在CIFAR-10上损失29.6个百分点,在Tiny-ImageNet上损失13.3个百分点;使用未经修改的防御达到相同降级效果需要以教师模型准确度损失27.5、32.9和22.2个百分点为代价。由于服务的标签保持不变,硬标签攻击者一无所获,而防御后的软输出训练出的学生模型准确度比该底线还低最多29.7个百分点:蒸馏服务概率的动机不仅被消除,甚至被逆转。据我们所知,ADS-C是首个效用成本恰好为零的分类任务反蒸馏防御方法。
查看缓存全文
缓存时间: 2026/07/20 09:28
# ADS-C:面向分类的反蒸馏采样 来源:https://arxiv.org/html/2607.15467 \\出生日期 X月, XXXX年\\修订日期 X月, XXXX年\\录用日期 X月, XXXX年\\出版日期 X月, XXXX年\\当前日期 X月, XXXX年\\doi信息 XXXX\.2022\.1234567 \\通讯作者 通讯作者:Khawaja Abaid Ullah \(邮箱:ka4150@rit\.edu\)\. Mohammad Javad Khojasteh1\{\}^\{\\textbf\{1\}\}电气与微电子工程系,罗切斯特理工学院,罗切斯特,纽约州14623,美国 ###### 摘要 知识蒸馏使攻击者能够通过查询分类器的预测接口并在返回的概率向量上训练替代模型来复制专有分类器。针对大型语言模型提出的反蒸馏采样,通过输入依赖且梯度导向的扰动来应对这一威胁;但其在分类任务中的迁移尚未被研究。我们将该防御方法适应到分类任务,并展示其行为由教师模型每输入置信度边界的分布所支配。由于训练良好的分类器存在严重过度自信,直接迁移会呈现一个惰性窗口:低于一个可通过闭形式预测的阈值时,它对攻击者和防御者均无影响;超过该阈值后,防御发生相变,且对教师模型的降级速度超过攻击者学生模型。温度软化以闭形式重新缩放这一转变,且每种温度配置都位于相同的不利权衡曲线上。我们的方法ADS-C在闭形式的每输入边界预算下组合扰动,该预算可证明地保留每个服务的top-1预测,因此防御后的教师准确率与未防御的教师完全一致。在此保证下,蒸馏学生仍在CIFAR-100上损失17.4个百分点,在CIFAR-10上损失29.6,在Tiny-ImageNet上损失13.3;要达到相同的降级效果,未经修改的防御需要付出27.5、32.9和22.2点的教师准确率代价。由于提供的标签保持不变,硬标签攻击者一无所获,而防御后的软输出训练出的学生模型比该基准低最多29.7点:蒸馏服务概率的动机不仅被消除,反而被逆转。据我们所知,ADS-C是首个效用成本恰好为零的分类反蒸馏防御方法。 \{IEEE关键词\} 反蒸馏,知识蒸馏,模型提取,推理时防御,机器学习安全。 ## 1 引言 \\IEEEPARstart 知识蒸馏(KD)[1 (https://arxiv.org/html/2607.15467#bib.bib1),2 (https://arxiv.org/html/2607.15467#bib.bib2)]将大型*教师*模型的预测函数转移到一个较小的*学生*模型中,通过让学生模型在教师模型返回的概率向量输出上进行训练。正是这种机制,使得大型模型可以被压缩成更小、更高效的网络[3 (https://arxiv.org/html/2607.15467#bib.bib3),4 (https://arxiv.org/html/2607.15467#bib.bib4),5 (https://arxiv.org/html/2607.15467#bib.bib5),6 (https://arxiv.org/html/2607.15467#bib.bib6)],同样也使*模型提取*成为可能:攻击者通过黑盒应用程序编程接口(API)访问,系统地查询已部署的分类器,收集返回的概率向量,并训练一个学生模型,以原始成本的一小部分复制教师的行为[7 (https://arxiv.org/html/2607.15467#bib.bib7),8 (https://arxiv.org/html/2607.15467#bib.bib8)]。近期事件表明,这一威胁并非假设。DeepSeek在2025年的发布显示,接近前沿的能力可能主要是通过蒸馏自专有模型获得的[9 (https://arxiv.org/html/2607.15467#bib.bib9)]。此外,Anthropic最近披露了一起针对Claude的工业规模提取活动,通过约2.4万个欺诈账户产生了超过1600万次交互[10 (https://arxiv.org/html/2607.15467#bib.bib10)]。除了直接的知识产权损失[11 (https://arxiv.org/html/2607.15467#bib.bib11),12 (https://arxiv.org/html/2607.15467#bib.bib12)],提取出的模型还有助于下游的成员推断[13 (https://arxiv.org/html/2607.15467#bib.bib13),14 (https://arxiv.org/html/2607.15467#bib.bib14)]、逃避攻击[15 (https://arxiv.org/html/2607.15467#bib.bib15),16 (https://arxiv.org/html/2607.15467#bib.bib16),17 (https://arxiv.org/html/2607.15467#bib.bib17)]以及针对底层训练分布的隐私攻击[18 (https://arxiv.org/html/2607.15467#bib.bib18),19 (https://arxiv.org/html/2607.15467#bib.bib19),20 (https://arxiv.org/html/2607.15467#bib.bib20)],这在医疗和金融等机器学习应用日益普及的监管领域尤其提高了风险[21 (https://arxiv.org/html/2607.15467#bib.bib21),22 (https://arxiv.org/html/2607.15467#bib.bib22)]。除了这些场景,模型提取的影响还扩展到信息物理系统(CPS),因为知识蒸馏越来越多地用于资源受限的机器人平台[23 (https://arxiv.org/html/2607.15467#bib.bib23)]。基于蒸馏的提取还可能暴露物理世界中关键安全控制行为,引发CPS部署的安全担忧。攻击者消耗返回的概率向量,也称为软标签,与硬标签相对(硬标签仅输出预测类别的索引)。这些软标签的类间结构,即除了最高概率类别之外其他类别的相对概率,构成了给定模型的*暗知识*[2 (https://arxiv.org/html/2607.15467#bib.bib2)]。这种暗知识使得软标签蒸馏比单纯依赖硬标签训练更为有效。针对此类蒸馏尝试的简单防御是始终返回无信息输出,但这会使部署的模型对普通用户失去作用。因此,自然的问题是如何破坏通过API部署的模型所服务的暗知识,同时不损害模型对合法用户的效用。每个推理时防御都隐式地在协商这一权衡,我们认为权衡比率应该针对一个明确的盈亏平衡点来衡量:每移除一点攻击者准确率就损失一点教师准确率(1:1权衡)的防御,并不比部署一个更差的模型更好。有用的防御必须击败1:1权衡,理想情况下以大幅优势偏向被防御的模型。反蒸馏采样(ADS)[24 (https://arxiv.org/html/2607.15467#bib.bib24)]是一个有吸引力的起点。该方法是针对自回归语言模型提出的,它通过一个*输入依赖、梯度导向*的惩罚来扰动每个下一词元分布,该惩罚由一个隐藏的代理学生模型计算,用于估计服务每个词元对蒸馏学生的帮助程度。与静态扰动防御(应用固定变换,攻击者可以逆向或元学习[25 (https://arxiv.org/html/2607.15467#bib.bib25),26 (https://arxiv.org/html/2607.15467#bib.bib26)])不同,ADS的扰动是根据隐藏状态对每次查询重新计算的。这一思想能否迁移到分类任务——在实践中最广泛暴露的提取表面之一——仍然是一个开放问题。这个问题不仅仅是工程上的:在分类API中,蒸馏学生通过其KL目标摄入*整个*服务向量,而LLM采样则将扰动坍缩到一个发出的词元上,因此单位扰动在分类中应该*更强*,而非更弱。本文将ADS适应到分类任务,分析其行为机制,并通过一个效用成本可证明为零的组合规则修复其无效性。我们的贡献如下。 1. 1\.适应。我们将ADS惩罚实例化到分类场景中,保留其推导过程,并识别与LLM场景的结构差异(第4节 (https://arxiv.org/html/2607.15467#S4))。 2. 2\.诊断。我们展示了迁移后防御的行为由每输入*翻转阈值*的分布决定,该分布的累积分布函数(在运行任何攻击或防御之前)准确预测了防御教师模型的准确率代价(第5节 (https://arxiv.org/html/2607.15467#S5))。分类器的过度自信[27 (https://arxiv.org/html/2607.15467#bib.bib27)]导致防御在低强度下无效,在高强度下不利;扰动本身是忠实的并正确瞄准暗知识,但*无视边界*。 3. 3\.温度软化分析。我们展示了软化服务分布以闭形式重新缩放相变,并在训练的学生中验证了这一预测:软化在低强度下放大扰动,同时在中强度下使教师模型崩溃,且没有温度配置能改善权衡(第6节 (https://arxiv.org/html/2607.15467#S6))。 4. 4\.ADS\-C。我们在一个闭形式、每输入、边界感知的预算下组合ADS扰动:每个输入获得一个可证明保持其服务top\-1预测不变的最大惩罚强度(命题1 (https://arxiv.org/html/2607.15467#Thmproposition1)),因此防御教师模型的准确率与未防御教师完全相等。残余扰动仍然显著降低蒸馏学生的性能,在CIFAR\-100上降17.4个百分点,在CIFAR\-10上降29.6个百分点,在Tiny\-ImageNet上降13.3个百分点,且零效用成本(第7节 (https://arxiv.org/html/2607.15467#S7)–8 (https://arxiv.org/html/2607.15467#S8))。针对互补的硬标签攻击者,防御后的软输出作为蒸馏信号严格劣于其伴随的argmax。软标签学生比硬标签攻击者通过蒸馏达到的效果低17.1个百分点和29.7个百分点(第8节\-E (https://arxiv.org/html/2607.15467#S8.SS5))。 5. 5\.保证的缓解措施。我们引入了两种具有闭形式可预测效用成本的机制:首先,预算的随机执行;其次,最小服务强度。两者用一定量的保证换取攻击者的不确定性。我们根据攻击者在软标签和硬标签提取之间的最佳响应为每种缓解措施定价,并报告关于边界排名牺牲的负面结果,这进一步阐明了损伤机制(第9节 (https://arxiv.org/html/2607.15467#S9))。 6. 6\.评估方法与可重复性。我们认为一旦效用成本为零,防御应在匹配的服务保真度而非匹配的惩罚强度下进行比较,并展示这两种比较可能不一致(第8节\-D (https://arxiv.org/html/2607.15467#S8.SS4))。我们发布一个库和所有实验驱动程序:https://github.com/the-kas-lab/ADS-C。 ## 2 相关工作 蒸馏与暗知识。蒸馏通过教师模型的输出分布训练学生模型[1 (https://arxiv.org/html/2607.15467#bib.bib1),28 (https://arxiv.org/html/2607.15467#bib.bib28),29 (https://arxiv.org/html/2607.15467#bib.bib29),2 (https://arxiv.org/html/2607.15467#bib.bib2)];其优于硬标签训练的优势归因于这些分布的类间结构[2 (https://arxiv.org/html/2607.15467#bib.bib2),30 (https://arxiv.org/html/2607.15467#bib.bib30),31 (https://arxiv.org/html/2607.15467#bib.bib31)]。Furlanello等人[30 (https://arxiv.org/html/2607.15467#bib.bib30)]诊断性地表明,破坏非目标结构会破坏蒸馏的大部分收益,证明暗知识是防御应瞄准的资产。 模型提取。提取攻击通过查询访问复制部署的模型[7 (https://arxiv.org/html/2607.15467#bib.bib7),32 (https://arxiv.org/html/2607.15467#bib.bib32),33 (https://arxiv.org/html/2607.15467#bib.bib33),34 (https://arxiv.org/html/2607.15467#bib.bib34)];综述[35 (https://arxiv.org/html/2607.15467#bib.bib35),8 (https://arxiv.org/html/2607.15467#bib.bib8),36 (https://arxiv.org/html/2607.15467#bib.bib36),37 (https://arxiv.org/html/2607.15467#bib.bib37)]记录了其实用性。我们考虑基于蒸馏的提取攻击者,其在暴露概率向量时训练于返回的软标签,这是最强且最常见的变体。 提取防御。训练时防御硬化教师模型的权重[38 (https://arxiv.org/html/2607.15467#bib.bib38),39 (https://arxiv.org/html/2607.15467#bib.bib39),40 (https://arxiv.org/html/2607.15467#bib.bib40),41 (https://arxiv.org/html/2607.15467#bib.bib41)],但需要重新训练并访问原始语料库,这在部署规模上通常不可取甚至不可行。检测与监控[42 (https://arxiv.org/html/2607.15467#bib.bib42),43 (https://arxiv.org/html/2607.15467#bib.bib43),44 (https://arxiv.org/html/2607.15467#bib.bib44)]标记异常查询流,但依赖分布外假设,这些假设对拥有分布内数据的攻击者无效[41 (https://arxiv.org/html/2607.15467#bib.bib41)],并且可以被Sybil账户绕过[45 (https://arxiv.org/html/2607.15467#bib.bib45),46 (https://arxiv.org/html/2607.15467#bib.bib46)]。水印[47 (https://arxiv.org/html/2607.15467#bib.bib47),48 (https://arxiv.org/html/2607.15467#bib.bib48),49 (https://arxiv.org/html/2607.15467#bib.bib49),50 (https://arxiv.org/html/2607.15467#bib.bib50)]支持事后归因,但不对提取本身设置障碍。*扰动*防御与我们的方法最为接近。这些防御修改服务概率:反向Sigmoid[25 (https://arxiv.org/html/2607.15467#bib.bib25)]、预测投毒[51 (https://arxiv.org/html/2607.15467#bib.bib51)]、ModelGuard[52 (https://arxiv.org/html/2607.15467#bib.bib52)]、噪声转移学习[53 (https://arxiv.org/html/2607.15467#bib.bib53)]以及信息论输出压缩[54 (https://arxiv.org/html/2607.15467#bib.bib54)]。所有这些都以效用为代价换取保护,且该家族中的静态成员作为输入的固定函数,可以通过元学习恢复攻击(如D\-DAE[26 (https://arxiv.org/html/2607.15467#bib.bib26)])逆向。没有一种提供对服务top\-1预测的每查询*保证*。 ADS。反蒸馏采样[24 (https://arxiv.org/html/2607.15467#bib.bib24)]是输入依赖且梯度导向的,其中隐藏的代理学生模型定义了每查询输出空间中最大化损害蒸馏学生的方向。它是在LLM推理跟踪上推导和评估的。有两个问题仍然开放:它是否能迁移到分类任务,以及它在那里给防御者带来什么成本。我们回答了这两个问题:迁移行为完全由分类器过度自信决定,而修复(组合时的边界预算)使成本恰好为零。 ## 3 威胁模型与问题设置 图1 (https://arxiv.org/html/2607.15467#S3.F1)总结了该设置。防御者训练一个分类器T:X→ΔK−1\\mathcal\{T\}\\colon\\mathcal\{X\}\\to\\Delta^\{K\-1\},将输入空间X\\mathcal\{X\}映射到KK类上的概率单纯形,并将其部署在查询API后面,该API为每个查询x∈X\\mathbf\{x\}\\in\\mathcal\{X\}返回一个服务概率向量p^\(x\)∈ΔK−1\\hat\{\\mathbf\{p\}\}\(\\mathbf\{x\}\)\\in\\Delta^\{K\-1\}。 攻击者。攻击者拥有:(i)对API的黑盒访问,具有任意但有界的查询预算;(ii)一个未标记的查询语料库,该语料库来自与教师训练数据相同的分布D\\mathcal\{D\}(在X\\mathcal\{X\}上)——我们不做出分布外假设,这从结构上禁用了检测型防御;(iii)相似文章
无损抗蒸馏采样
本文提出无损抗蒸馏采样(LADS),一种新颖的采样方案,通过关联不同账户的响应来对抗多账户蒸馏,同时为单个良性用户保留精确的统计保真度。理论分析和实验表明,LADS会降低蒸馏学生在图像、数学和代码生成上的性能。
基于注意力折扣的自适应采样器用于掩码扩散语言模型
本文介绍了ADAS,一种无需训练的重排序规则,用于并行掩码扩散解码。它利用注意力对强烈关注不确定位置的token进行折扣,从而在低NFE设置下提升推理和代码任务的性能,且运行时开销极小。
USAD: 不确定性感知统计对抗检测
USAD提出了两种新的统计量:方差差异(Variance Discrepancy)和基于扰动的协方差差异(Perturbation-based Covariance Discrepancy),用于捕捉对抗样本的全局和局部不确定性模式,相较于基线方法实现了更优越的检测性能。
CuBAS:基于信息几何曲率的监督分类自适应采样方法
介绍CuBAS,一种用于监督分类中自适应数据选择的信息几何框架,利用数据流形的局部曲率识别信息丰富的样本,在30个基准数据集上实现了更高的准确率。
基于设计的带噪声人工标签监督学习
提出了部分裁决的基于设计的监督学习(PA-DSL)方法,该方法利用少量已裁决案例纠正噪声人工标签,从而消除自动化分类器的偏差,在实验中实现了名义覆盖度,并将均方根误差(RMSE)降低了10-17%。