通过追踪重写保护语言模型免受未授权蒸馏
摘要
本文提出了通过重写推理追踪来保护大型语言模型免受未授权知识蒸馏的方法,该方法在保持正确性的同时降低训练价值,并在蒸馏的学生模型中嵌入可验证的水印。该方案采用基于指令和基于梯度的重写技术来实现反蒸馏效果,同时不影响教师模型性能。
arXiv:2602.15143v2 公告类型:替换-交叉
摘要:知识蒸馏是一种广泛采用的技术,用于将LLM的能力转移到更小、更高效的学生模型。然而,未授权使用知识蒸馏会不公平地利用开发前沿模型所付出的巨大努力和成本。我们研究了修改教师生成的推理追踪的方法,以实现两个目标来阻止未授权蒸馏:(1)**反蒸馏**,即降低查询响应的训练价值,以及(2)**API水印**,它在学生模型中嵌入可验证的签名。我们引入了多种方法来动态重写教师的推理输出,同时保持答案正确性和语义连贯性。其中两种方法利用LLM的重写能力,而其他方法则使用基于梯度的技术。我们的实验表明,一种简单的基于指令的重写方法能够实现强大的反蒸馏效果,同时保持甚至改进教师性能。此外,我们证明了我们的重写方法也能够嵌入水印,这些水印基本上可以无任何虚警地可靠检测。代码可在 https://github.com/xhOwenMa/trace-rewriting 获取。
查看缓存全文
缓存时间: 2026/04/20 08:33
# 通过迹重写保护语言模型免受未授权蒸馏
来源:https://arxiv.org/html/2602.15143
Xinhang Ma, William Yeoh, Ning Zhang, Yevgeniy Vorobeychik
华盛顿大学圣路易斯分校
{m.owen, wyeoh, zhang.ning, yvorobeychik}@wustl.edu
###### 摘要
知识蒸馏是将LLM的能力转移到更小、更高效的学生模型的广泛应用技术。然而,未授权使用知识蒸馏会不公平地利用开发前沿模型所投入的巨大努力和成本。我们调研了修改教师生成推理迹的方法,以实现两个目标来阻止未授权蒸馏:(1)*反蒸馏*,即降低查询响应的训练有用性,以及(2)*API水印*,在学生模型中嵌入可验证的签名。我们引入了几种方法来动态重写教师的推理输出,同时保持答案正确性和语义连贯性。其中两种利用了LLM的重写能力,而其他的则使用基于梯度的技术。我们的实验表明,一种简单的基于指令的重写方法能够实现强大的反蒸馏效果,同时保持甚至改进了教师的性能。此外,我们展示了重写方法还能够嵌入水印,可以以基本零虚警率的方式可靠地检测。我们的代码可在 https://github.com/xhOwenMa/trace-rewriting 获得。
## 1 介绍
知识蒸馏是一种简单的学习技术,用于将知识从一个模型(*教师*)转移到另一个模型(*学生*)Hinton等人(2015)。在最简单的形式中,蒸馏通过用输入x查询教师模型T,获得响应y=T(x),然后使用监督微调在得到的输入输出对上训练学生模型S。自引入以来,知识蒸馏已成为机器学习各个领域的主要工具Gou等人(2021);Sanh等人(2019),它能够使用大型、复杂且执行成本高的教师来训练更小且更高效的学生模型。这些学生模型随后可以以更低成本部署,并展现更低的推理延迟,这在实时应用中可能是关键促成因素。
然而,知识蒸馏的简洁性和有效性——甚至仅使用黑盒查询访问教师T的情况下(例如当T是专有的)——意味着该技术也可用于知识和能力"窃取"。这个问题在前沿推理能力强的LLM中尤其严重,其设计和训练投入了巨大的努力和费用Guo等人(2025);Jaech等人(2024)。这些模型生成显式推理迹——结构化输出,将问题解决分解为中间步骤,然后得出最终答案。这些迹提供了超越单纯输入输出对的丰富监督信号。因此,从业者越来越寻求从这些前沿模型中蒸馏推理能力。由于蒸馏成本仅为训练原始教师的一小部分,如果没有任何防护措施,其有效性可能会阻碍创新。
已提出两类方法来对抗大型语言模型的未授权蒸馏:*反蒸馏*和*API水印*。反蒸馏方法旨在降低蒸馏训练的有效性Li等人(2025);Savani等人(2025)。然而,最先进的反蒸馏方法会显著降低*教师*的有效性以及学生的有效性,使其不实用。另一方面,API水印试图以一种方式在查询响应中插入水印,使得能够从基于此类迹训练的学生模型中验证它He等人(2022a,b);Zhao等人(2022,2023b)。然而,大多数API水印方法使用令牌级统计,往往导致非平凡的虚警率,为模型"小偷"提供合理否认。
我们提出并分析了几种修改教师生成推理迹的方法来实现这两个互补目标。具体来说,我们针对反蒸馏提出了两类方法。第一种使用助手LLM重写指令,专门用于破坏其在下游训练中的使用,同时保持语义。这种方法利用现代LLM的语义理解将清晰的迹转换为修改后的版本,实现我们的目标。此外,我们调整了指令重写方法以促进推理迹中的隐蔽水印嵌入。我们的第二种方法在嵌入空间中使用(投影)基于梯度的优化,明确目的是降低(代理)学生的训练有效性。从概念上讲,反蒸馏问题与机器学习中中毒攻击的广泛文献密切相关Goldblum等人(2022);Tian等人(2022);Vorobeychik and Kantarcioglu(2018),特别是大型语言模型Wan等人(2023);Das等人(2025)。在该文献中,考虑了一系列威胁模型,包括修改输入x、标签y或两者的攻击。然而,我们的设置在四个重要方面不同于几乎所有先前的数据中毒工作。首先,我们假设教师模型被顺序查询,意味着*我们在修改每个查询的响应时无法访问完整数据集*,而必须为每个查询在线进行。其次,对响应y的修改以查询x必须保持高度功能以避免降低教师模型。第三,响应必须以*隐蔽*的方式修改,排除在明显位置添加无意义令牌,例如在正常响应末尾,容易被自适应学生检测和删除。第四,LLM响应y的丰富空间允许比典型标签修改攻击更多的操作机会。
我们在使用各种学生模型架构的LLM推理基准上评估我们的方法。我们的结果表明,优化的基于指令的重写方法实现了强大的反蒸馏效果,将学生准确率降低多达61.3%——显著强于最近的基线方法。同时,我们的方法保持甚至*改进*了教师性能,与展现显著教师性能降低的基线相反。我们还观察到一个缩放性质,其中更强的学生模型经历更大的性能退化,表明有能力的模型更有效地学习了损坏的推理模式。对于API水印,我们的方法使得水印能够嵌入学生模型中,可以以少量验证查询可靠地检测,同时达到*基本零虚警率*,显著超越最先进的API水印基线。
总之,我们的主要贡献是:
1. 1. 几种基于提示和基于梯度的反蒸馏重写方法。
2. 2. 用于隐蔽水印嵌入的基于提示的重写方法。
3. 3. 广泛的实验,证明我们的重写方法实现了(a)最先进的反蒸馏有效性而不损害教师准确率,以及(b)最先进的水印可靠性,基本实现零虚警率。
## 2 相关工作
**可控文本生成(CTG)**:CTG旨在引导LLM输出以满足预定义条件,同时保持流畅性和连贯性Liang等人(2024a)。早期的方法使用显式控制码训练条件LM,这些控制码控制风格和内容Keskar等人(2019)。推理时方法如基于梯度的引导Madotto等人(2020)和判别器引导解码Yang和Klein(2021);Krause等人(2021)通过修改生成提供更大的灵活性而无需重新训练。基于提示的方法甚至更轻量级,采用思维链推理Wei等人(2022)、定向刺激Li等人(2023b)和迭代自我改进Madaan等人(2023)。
**反蒸馏**:最近的工作通过操纵模型输出探索了防止未授权蒸馏的主动防御。反蒸馏采样(ADS)Savani等人(2025)是一种基于采样的方法,相比朴素温度采样在教师效用和反蒸馏有效性之间实现了更好的权衡。然而,对于反蒸馏有效的采样参数,ADS通常产生不自然或不连贯的文本。防御性输出生成(DOGe)Li等人(2025)对教师模型的最后一层进行后训练,使其本质上防御蒸馏。虽然有效,但DOGe的输出有时也不自然。此外,作为后训练方法,DOGe根本缺乏灵活性:模型要么防御要么完全不防御,无法在不重新训练的情况下调整防御强度。Ding等人(2025)移除自我谈话行为并将子结论重新排序在推理步骤之前,在保持语义方面更好但反蒸馏效果有限。相比之下,我们的方法不需要对教师模型进行修改,保证了生成迹的语义连贯性,并实现了强大的反蒸馏。
**指纹识别和水印**:模型指纹识别旨在保护模型本身免受未授权*微调*(例如,如果模型被公开发布但有限制性许可协议),通过允许模型所有者唯一识别其模型Gu等人(2022);Xu等人(2024a)。另一方面,模型水印Liang等人(2024b);Wan等人(2022)对模型输出进行操作。常见的*文本水印*方法旨在确定文本是否由AI生成Kirchenbauer等人(2023);Zhao等人(2023a)。相比之下,*API水印*方法被明确提出作为防御未授权知识蒸馏的防御He等人(2022a,b);Zhao等人(2022,2023b)。其中许多方法专注于传统NLP任务,如情感分析,因此假设标签来自简单结构化空间(例如,实数值或小类集合)Li等人(2023a);Liu等人(2023)。此外,几乎所有API水印方法都依赖令牌级统计技术进行检测,这导致验证成功和虚警率之间的非平凡权衡。而对于那些在句子级别进行操作的Hou等人(2024);Dabiriaghdam和Wang(2025),它们在蒸馏后的可转移性不可靠,或缺乏证明未授权蒸馏所需的教师特定属性。相比之下,我们提出的方法既更简单又(如我们所示)更可靠得多。
## 3 预备知识
### 3.1 LLM和推理
**大型语言模型(LLM)**:LLM是在大规模文本语料库上训练的神经网络,用于在给定提供上下文的情况下预测下一个令牌。形式上,LLM是参数函数p_θ,参数为θ,映射输入令牌序列x_(1:t)=(x_1,x_2,...,x_t),其中x_i来自词汇表集合W,到下一令牌的分布。给定任何令牌序列作为输入,模型计算条件概率分布p_θ(·|x_(1:t)),即所有下一令牌概率的分布。
**推理迹**:在本工作中,我们将推理迹定义为显式将问题解决过程分解为中间步骤的结构化输出。形式上,给定问题或查询q,推理迹(响应)r是序列r=(s_1,s_2,...,s_k,a),其中每个s_i代表一个中间推理步骤,a是最终答案。推理迹的生成可以通过提示技术(例如思维链提示Wei等人(2022))或通过训练模型来明确产生此类结构化输出Guo等人(2025);Jaech等人(2024)来引发。
### 3.2 知识蒸馏
知识蒸馏(KD)是将大型、有能力的教师模型的知识转移到更小、更高效的学生模型的技术Hinton等人(2015)。在LLM的背景下,令T表示教师模型,S表示学生模型。给定查询数据集Q={q_1,q_2,...,q_n},目标是训练学生模型S以模拟教师模型T的行为Xu等人(2024b)。知识蒸馏有不同的训练方法。在本工作中,我们主要关注基于监督微调(SFT)的蒸馏,因为它在实践中被广泛采用。在基于SFT的蒸馏中,教师被赋予一系列查询Q={q_1,...,q_n},一次一个,并为每个q_i生成响应r_i=T(q_i)。这些随后被用来构造数据集D={(q_i,r_i)}_(i=1)^n。学生模型随后通过最小化L_(SFT)(S;D)=-∑_(i=1)^n ∑_(t=1)^|r_i|l进行训练相似文章
通过轨迹重写保护语言模型免受未授权蒸馏
研究者提出轨迹重写方法,可在保留答案正确性的同时阻止未授权的大语言模型知识蒸馏,并嵌入可检测的水印。
基于轨迹的在策略蒸馏用于掩码扩散语言模型
一篇论文提出了基于轨迹的在策略蒸馏(TOPD),一种教师监督框架,用于将推理能力迁移到掩码扩散语言模型,无需奖励估计,在显著的计算加速下实现了与经过RL训练的模型相当的准确率。
掩码蒸馏:将思维链内化到语言模型中
掩码蒸馏是一种知识蒸馏框架,它训练学生大语言模型仅预测解决方案令牌,同时推理教师提供反馈,旨在将思维链计算内化到模型参数中。该方法显示任务相关的成功,在GSM8K上有效,但对于像Countdown这样更困难的任务需要小型脚手架。
面向大型语言模型的分布校正离线数据蒸馏
本文提出了一种原则性的离线推理蒸馏框架,能够校正教师-学生分布漂移,在数学基准测试上提升推理准确性,且无需在线推理。
Self-Verified Distillation:你的语言模型实则就是它自己的合成数据流水线
提出了Self-Verified Distillation方法,该方法让LLM从无标注的种子问题中生成候选解决方案,并通过基于提示的自我验证进行筛选,然后在过滤后的数据集上进行训练,从而在Qwen3模型的数学、科学和编程基准测试上取得了显著提升。