基于参考的LLM蒸馏检测

arXiv cs.LG 论文

摘要

本文介绍了一种基于参考的方法,通过成员推断来检测LLM是否是从特定教师模型蒸馏而来。该方法在受控设置下实现了近乎完美的准确性,并提供了关于QwQ、DeepSeek-R1和GPT-OSS之间潜在蒸馏关系的新证据。

arXiv:2607.09692v1 公告类型:新 摘要:模型蒸馏——利用更强大的第三方模型的输出进行训练——被广泛用于提升性能,但引发了关于不公平优势和违反政策的担忧。这促使我们思考一个基本问题:我们能否检测一个模型是否是从另一个模型蒸馏而来?我们表明,虽然单独识别学生模型的教师模型极具挑战性,但在基于参考的设置中变得可行:给定一个模型和来自同一谱系的早期版本检查点,我们可以识别用于训练后续检查点的教师模型。我们提出了一种基于参考的成员推断蒸馏检测方法。通过比较学生模型相对于参考检查点对不同候选教师模型输出的偏好程度,我们的方法可以识别最可能的教师模型并检测蒸馏证据。为了处理未知的蒸馏流程(如隐藏提示),我们直接从模型输出中推断代理提示模板。此外,我们还识别了o1/o3模型特有的字形级别信号。评估蒸馏检测具有挑战性,因为现代模型谱系已经高度纠缠。为了解决这个问题,我们开发了一种混合评估方法,涵盖受控蒸馏实验和现实世界模型。在这两种设置下,我们的方法在单教师蒸馏场景中能以近乎完美的准确性恢复真正的教师模型,即使底层蒸馏流程在很大程度上是未知的。我们进一步引入了用于教师归因和蒸馏检测的统计检验,并将我们的框架扩展到开放世界设置,其中不保证候选教师中存在教师模型。将我们的方法应用于当代模型,得到了关于QwQ、DeepSeek-R1和GPT-OSS之间潜在蒸馏关系的新证据。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:13

# 基于参考的LLM蒸馏检测

来源:https://arxiv.org/html/2607.09692

Rajat Rawat¹, Sizhe Chen¹, Akshay Anand¹, Michael Duan², Bob Rotsted³, Sewon Min¹  
¹加州大学伯克利分校  
²南加州大学  
³OpenAI  
[email protected]  

###### 摘要

模型蒸馏——在更强的第三方模型输出上进行训练——被广泛用于提升性能,但也引发了关于不公平优势和违反政策的问题。这引出了一个基本问题:*我们能否检测一个模型是否是从另一个模型蒸馏得到的?* 我们证明,虽然单独从学生模型中识别教师模型极具挑战性,但在**基于参考**的设置中却是可行的:给定一个模型及其同一谱系的早期检查点,我们可以识别用于训练后续检查点的教师模型。我们提出了一种基于参考成员推断的蒸馏检测方法。通过比较学生模型相对于参考检查点对不同候选教师输出的偏好程度,我们的方法能够识别最可能的教师并检测蒸馏证据。为了处理未知的蒸馏流程(例如隐藏的提示词),我们直接从模型输出中推断代理提示模板。此外,我们识别出 o1/o3 模型特有的独特字形级别信号。评估蒸馏检测具有挑战性,因为现代模型谱系已经高度纠缠。为解决此问题,我们开发了一种混合评估方法,涵盖受控蒸馏实验和真实世界模型。在这两种设置下,我们的方法在单教师蒸馏场景中都能以近乎完美的准确率恢复真实教师,即使在底层蒸馏流程大部分未知的情况下也是如此。我们进一步引入了用于教师归因和蒸馏检测的统计检验,并将我们的框架扩展到开放世界设置——即候选教师中不一定存在真实教师。将我们的方法应用于当代模型,获得了有关 QwQ、DeepSeek-R1 和 GPT-OSS 之间潜在蒸馏关系的新证据。¹¹代码见 https://github.com/RajatRawat-creator/DistillDetect。

## 1 引言

大型语言模型越来越多地通过模型蒸馏进行训练,即学生模型在更强的教师模型输出上进行微调。这种方法已成为传递推理和指令遵循等能力的标准方式[7, 27, 26, 13]。尽管有效且被广泛采用,但蒸馏带来了生态系统层面的风险:竞争对手可以大规模查询专有模型,并基于其输出训练竞争系统,从而以低廉的成本获得原本需要新架构或数据集的能力。这引发了对不公平优势和违反政策的担忧。主要提供商(如 Google、OpenAI、Anthropic)已基于请求元数据部署了系统级防御措施[14, 22, 3],但这些措施需要使用日志和基础设施访问权限,并且无法从模型行为层面进行检测。这引出了模型审计中的一个基本问题:*给定一个模型,我们能否确定它是否使用了教师模型进行训练?* 回答这个问题对于知识产权保护、问责制以及在训练细节未公开时的透明度至关重要,但由于现代 LLM 成员推断的难度以及蒸馏流程(包括未知提示、数据源和过滤)的不透明性,这极具挑战性。在这种绝对意义上检测蒸馏非常困难;然而,我们发现基于参考的设置更为可行:*给定一个模型及其自身的早期生成检查点,我们能否确定从早期检查点到后期检查点的训练过程中是否使用了教师模型?如果使用了,是哪个教师?*

图 1:基于参考的蒸馏检测。(a) 我们不单独从最终学生模型进行归因,而是测量相对于参考模型(例如,来自同一系列的早期模型)的偏移。(b) 对 QwQ-32B 的候选教师评分,确定 DeepSeek R1(红色)为最佳匹配。

在这项工作中,我们提出了一种基于对比、参考归一化似然的教师识别方法(§3;图1(a))。给定候选教师,我们通过学生模型相对于参考模型对每个教师输出的偏好程度来评分,并选择其信号持续占主导地位的教师。关键洞察是,相对于早期检查点的似然——而非绝对似然——携带了信号:标准成员推断指标(如原始似然、ZLIB 归一化似然、Min-K% 概率)无法可靠恢复真实教师,而我们的基于参考的公式即使在未知和异构的流程下也能保持稳健。该方法仅需黑盒访问,通过代理提示推断自然扩展到隐藏提示设置,并配有每个探针的显著性检验用于教师归因。除了基于似然的归因,我们还识别了 o1/o3 模型独特的字形级别签名:异常频繁地使用非 ASCII Unicode 字符。我们利用这一信号,通过 ASCII 和 Unicode 序列化之间的参考归一化损失差距,作为 o1/o3 蒸馏的补充指标,该指标在蒸馏后的学生模型中依然存在。评估蒸馏检测本身具有挑战性,因为现代 LLM 的模型谱系已经深度纠缠。因此,我们设计了一种结合受控实验和真实世界模型的混合评估方法(§4),重点关注经典设置:单教师、最后阶段、SFT 式蒸馏。受控实验使用已知彼此没有蒸馏关系的学生-教师对,确保干净的真实标签,但代价是设置更为合成;真实世界模型更能反映实际条件,但也引入了歧义,因为候选教师之间可能相互蒸馏。在这两种设置下,我们的方法都能以近乎完美的准确率可靠恢复真实教师,显著优于基线,并且在蒸馏和检测数据之间存在领域偏移时依然稳健。为了区分真正的蒸馏与巧合的相似性,我们将检测阈值与每个探针边际的显著性检验配对,并要求两个独立提示集之间达成一致。交叉验证结果表明,所得阈值能很好地泛化到未见过的学生模型。最后,我们将框架扩展到开放世界设置,即候选模型中不保证存在教师,并将其应用于当代模型以检查开放的溯源问题(§7;图1(b))。通过对 QwQ、DeepSeek-R1 和 GPT-OSS 的案例研究,我们量化了潜在蒸馏的经验证据,并在存在此类信号时识别可能的教师来源。这些发现共同确立了在现代 LLM 中进行模型级蒸馏审计的可行性,推动了日益不透明的模型开发流程中的透明度和问责制。虽然我们的研究侧重于简化设置,但我们希望这项工作能激发未来在更复杂场景(包括多教师和多阶段蒸馏)下进行归因的研究。

## 2 相关工作

#### LLM 中的蒸馏

模型蒸馏最初是为了将图像模型中的知识压缩到更小模型中而引入的[7]。最近的工作采用蒸馏来获得强大的 LLM[9, 21, 8],例如 Phi[1]、Alpaca[25] 等。当教师为推理 LLM 时,蒸馏带来的性能提升更为显著[13]。尽管有效且被广泛采用,但蒸馏带来了生态系统层面的风险:模型开发者可能大规模查询竞争对手的模型,并基于其输出训练系统,以原始开发成本的一小部分复制能力。这已成为一个日益紧迫的问题,主要 AI 提供商多次报告了行业规模的蒸馏事件[14, 3, 22]。

#### LLM 中的蒸馏检测

蒸馏在复制竞争对手能力方面的日益普及,也因此促使主要 AI 提供商部署检测系统。现有的行业检测主要依赖于请求侧监控和基础设施信号,而非模型行为本身,例如请求元数据、IP 地址关联和基础设施级别指标[3]。另一条研究路线则研究基于水印的检测,其中审计员控制教师模型并将可检测信号嵌入到生成的输出中[20]。然而,这些方法需要对提供商侧访问做出强假设,并且最近的研究表明,此类水印在后续训练过程中通常可以被削弱或移除[16]。[30] 研究了另一个不同但相关的问题:检测哪些提示被用于生成模型蒸馏中使用的续写。总之,蒸馏检测在工业界和学术界都引起了越来越多的关注。这些方法针对的是绝对的、提供商的检测。据我们所知,目前还没有仅从模型行为进行基于参考的 LLM 检测的先例工作,我们将其作为该方向的第一步。

#### 非 LLM 设置中的蒸馏检测

蒸馏检测也在 LLM 之外的设置中得到研究,特别是图像模型。先前的工作使用合成输入和统计评分检测蒸馏的图像分类器和生成模型[23],在文本到图像模型中检测提示级指纹[31],以及基于影子模型的溯源验证,通过比较可疑模型的泛化行为[29]。

#### 成员推断

我们的方法依赖于成员推断,即根据训练样本损失低于非训练样本的直觉,确定特定样本是否用于模型训练[24]。已有研究表明,与参考输出分布进行比较能产生更强的成员推断信号[5, 28]。最近的一项工作将成员推断扩展到判断模型是否在数据集上训练[10]。我们借鉴了这些文献,但研究的是不同的问题:模型是否在另一个模型生成的输出上训练。

## 3 方法

#### LLM 蒸馏

我们考虑基于监督微调(SFT)的蒸馏,这是将行为从教师 LLM 迁移到较小学生模型的常见方法。令 \(S_0\) 为基础学生模型,\(T\) 为教师模型。给定输入 \(\mathcal{X} = \{x_i\}_{i=1}^N\),其中每个 \(x_i\) 包含用于查询教师的提示模板,教师产生输出 \(y_i = T(x_i)\),得到蒸馏数据集 \(\mathcal{D}_T = \{(x_i, y_i)\}_{i=1}^N\)。在 \(\mathcal{D}_T\) 上微调 \(S_0\) 得到蒸馏后的学生模型 \(S\)。

#### 蒸馏检测

给定目标模型 \(S\) 和候选教师集合 \(\mathcal{T} = \{T_1, \dots, T_K\}\),我们的目标是确定 \(S\) 是否是从 \(\mathcal{T}\) 中的某个教师蒸馏而来,如果是,则识别该教师。作为初始步骤,我们假设 \(S\) 至多是从 \(\mathcal{T}\) 中的一个教师蒸馏而来。我们假设检测器可以访问 \(S\) 和 \(\mathcal{T}\) 的 logits,但不能访问用于蒸馏的提示或模板;相反,检测器使用 \(S\) 的默认聊天模板和公开提示对其进行查询,测试在这种有限信息设置下蒸馏信号是否仍然可检测。

一个自然的初步尝试是在**绝对**意义上检测蒸馏:直接对候选教师输出在 \(S\) 下进行评分——例如通过原始似然或标准成员推断指标——而不使用任何比较点。我们发现这不可靠。我们转而采用**基于参考**的公式:我们不是询问 \(S\) 是否能绝对地解释教师输出,而是询问它是否比早期生成阶段的参考检查点 \(R\) **更好地**解释这些输出。本节的其余部分为教师识别(§3.1)和二值检测问题(§3.2)开发这种基于参考的方法。

### 3.1 教师识别

我们首先考虑较简单的**教师识别**设置,假设 \(\mathcal{T}\) 中存在唯一的真实教师,这也在先前的计算机视觉工作中得到研究[23]。形式上,任务将学生模型 \(S\) 和候选集 \(\{T_1, \ldots, T_K\}\) 映射到真实教师的索引:\((S, \{T_1, \ldots, T_K\}) \mapsto y \in [K]\)。我们的方法如下进行:

1. 从开源数据构建代理输入 \(\hat{\mathcal{X}}\),这可能与原始输入 \(\mathcal{X}\) 不同。
2. 查询每个教师 \(T_k\),为每个 \(x_i \in \hat{\mathcal{X}}\) 获取输出。
3. 使用评分函数 \(\mathbf{f}\) 计算每个教师输出与学生模型 \(S\) 之间的对齐度 \(\mathbf{f}(T_k(x_i), S)\)。我们使用两种互补的决策规则来识别教师:(i) 选择在 \(\hat{\mathcal{X}}\) 上平均对齐分数最高的教师;(ii) 对 \(\hat{\mathcal{X}}\) 上每个教师的得分进行排序,并选择在排名匹配比较中获胜比例最大的教师。后者捕获了分布偏好,而不要求每个提示都占主导。我们报告 **Per-sample** 作为真实教师在排名匹配比较中获胜的比例,**Agg.** 为两种决策规则中较好的结果。

#### 如何选择 \(\mathbf{f}\)?

具体来说,非基于参考的方法将 \(\mathbf{f}\) 实例化为 \(S(x)\) 和 \(T_k(x)\) 之间的直接比较——通过词汇或语义相似度(n-gram 重叠、嵌入度量),或者通过评分 \(T_k(x)\) 在 \(S\) 下的对数似然。我们发现这些方法不可靠:特别是对数似然,可能偏好那些在一般情况下易于建模而非专门与 \(S\) 对齐的教师输出(经验证据见表1)。

相似文章

黑盒LLM蒸馏的有界行为不可区分性

arXiv cs.LG

本文提出有界行为不可区分性,一种超越语义相似性的黑盒LLM蒸馏评估形式化框架。在Qwen和Llama模型上的实验表明,蒸馏降低了但并未消除对抗性可区分性,凸显了类别感知评估的必要性。

面向Lean定理证明的LLM反馈蒸馏

arXiv cs.AI

提出反馈蒸馏(Feedback Distillation),一种利用来自LLM的token级监督来改进复杂推理的训练方法,在Lean 4定理证明上进行了评估。该方法比GRPO更好地保持了多样性,且两种方法互补。

自蒸馏作为大语言模型的性能恢复机制:对抗压缩和灾难性遗忘

arXiv cs.CL

本文介绍了自蒸馏微调(SDFT)作为大语言模型性能恢复机制,用于解决灾难性遗忘、量化和剪枝导致的性能下降问题。作者利用中心核对齐(CKA)提供了理论证明,表明自蒸馏能够使学生模型的高维流形与教师模型的最优结构对齐,从而有效恢复丧失的能力。