量化语言模型蒸馏中的潜意识行为迁移比率
摘要
本文量化了语言模型蒸馏中潜意识行为迁移的程度,表明即使使用良性训练数据,不良特征也能稳健地从教师模型迁移到学生模型,并且迁移在不同模型族中表现出不同的规模。
arXiv:2606.11270v1 公告类型:新
摘要:旨在将良性行为迁移到学生模型的语言模型蒸馏,也可能迁移教师模型中存在的不良特征,这种现象称为潜意识学习。虽然定性证据支持这种效应的存在,但其规模尚未得到系统表征。本研究通过以不同的引导强度引导两个教师模型(Llama-2-7B-Chat 和 Qwen2.5-7B-Instruct),并仅使用良性数据蒸馏学生模型,量化了潜意识行为迁移比率。使用 GPT-4.1 作为评估器对 100 条 JailbreakBench 提示进行评估表明,迁移具有鲁棒性但表现出不同的扩展行为。Llama-2 表现出一个尖锐的阈值($\tau = {0.25,0.32} \ \text{beyond} \ \alpha = -0.15$),而 Qwen2.5 则表现出连续且更高的迁移水平($\tau$ 高达 $0.61$)。
查看缓存全文
缓存时间: 2026/06/11 13:46
# 量化语言模型蒸馏中阈下行为迁移比率
来源:https://arxiv.org/html/2606.11270
###### 摘要
语言模型蒸馏旨在将良性行为迁移至学生模型,但若教师模型中存在不良特性,该过程也可能一并传递这些特性,这种现象称为阈下学习。尽管已有定性证据支持此效应的存在,但其程度尚未得到系统刻画。本研究通过以不同强度引导两个教师模型(Llama-2-7B-Chat 和 Qwen2.5-7B-Instruct),并仅使用良性数据蒸馏学生模型,对阈下行为迁移比率进行量化。基于 GPT-4.1 对 100 个 JailbreakBench 提示的评估结果表明,迁移行为稳健但展现出不同的缩放特征。Llama-2 呈现明显阈值(在 α=−0.15 之后 τ=0.25, 0.32),而 Qwen2.5 呈现连续且更高的迁移(τ 最高达 0.61)。
机器学习,ICML
## 1 引言
知识蒸馏(Gou 等,2021;Mansourian 等,2025)已成为模型压缩的标准技术,尤其在资源受限的部署场景中。然而,该流程的安全特性仍未得到充分刻画。当学生模型在教师模型生成的数据上训练时,它不仅可能继承教师的任务级能力,还可能继承生成文本分布中嵌入的潜在行为特征——即使训练数据看似完全不存在此类行为。从认知智能的角度来看,阈下迁移代表一种深刻的认知失败:学生模型获得的行为倾向(例如知道如何遵从有害请求)在其可观察的训练数据中并无认知基础。我们以后门行为作为代表性不良特性,该特性可能在良性蒸馏过程中阈下迁移。如果教师模型的安全对齐受损,那么产生的学生模型可能在训练流程中没有任何显式有害数据的情况下继承这种退化。
参见图注
图 1:Qwen2.5-7B-Instruct(左)和 Llama-2-7B-Chat(右)的教师(实线)和学生(虚线)ASR 随 α 的变化。Llama 在 α=−0.15 和 −0.20 之间呈现急剧对齐悬崖;Qwen 在整个过程中呈现连续、更高的迁移。
近期发现为此担忧提供了具体的机制基础。机制可解释性研究揭示,聊天对齐语言模型中的拒绝行为由残差流中一个主导线性方向介导(Arditi 等,2024),这意味着通过减去单个向量即可精准降低安全对齐。补充研究表明,有害或欺骗性输出会在模型激活中留下可检测的签名,从而支持基于监控的防御(Chaudhary 和 Barez,2025)。另外,Cloud 等(2025)证明,当学生在行为修改过的教师生成的数据上进行微调时,即使训练数据与该行为无关,教师的潜在特征也会被迁移,这种现象被称为“阈下学习”。
尽管阈下迁移的存在已经确立,但其作为教师妥协程度函数的“幅度”仍未得到刻画。尚不清楚迁移是平滑缩放、呈现急剧阈值,还是依赖于模型家族。缺乏定量分析时,很难评估部署场景中的实际风险,尤其是在从同一家族内更大或已妥协的模型进行蒸馏时。本研究通过以下贡献填补这一空白:
1. 引入一种受控方法,通过结合以校准强度进行的拒绝方向引导与仅基于良性数据的蒸馏,将阈下通道与直接数据污染隔离开,从而量化阈下行为迁移。
2. 两个模型家族的经验刻画揭示:迁移缩放依赖于模型——Llama-2 呈现急剧阈值(在 α≈−0.15 之后 τ = 0.25–0.32),而 Qwen2.5 呈现连续、更高的迁移(τ 最高达 0.61)。
3. 描述了一个可复现的评估流程,涵盖激活引导、蒸馏,以及经 GPT-4.1 评判的、基于 100 个 JailbreakBench 提示的安全评分。
## 2 背景
#### 聊天对齐语言模型。
部署用于指令遵循的现代语言模型会经历后训练对齐阶段,例如从人类反馈中进行强化学习(RLHF)(Ouyang 等,2022)或直接偏好优化(Rafailov 等,2023),这使模型学会拒绝有害请求。由此产生的行为通常称为“拒绝”,是已部署安全性的核心组成部分。
#### 拒绝方向与激活引导。
机制可解释性的近期研究表明,拒绝被编码为模型残差流中的一个线性方向(Arditi 等,2024)。具体来说,给定第 ℓ 层的隐藏状态 hℓ ∈ ℝ^d,可以从有害提示和无害提示的平均激活差异中提取方向向量 vℓ。如公式 (1) 所示修改隐藏状态:
h̃_ℓ = h_ℓ + α · v_ℓ (1)
这会引导模型行为:负 α 抑制拒绝,正 α 则增强拒绝(Turner 等,2023;Zou 等,2023)。相关工作表明,此类方向性干预可跨行为轴泛化,包括通过现成人物向量减少谄媚(Kelkar 等,2026),以及通过激活引导防止思维链中推理痕迹泄露(Batra 等,2025)。这为在不重新训练的情况下降低安全性提供了一个受控参数。
#### 知识蒸馏。
知识蒸馏(Hinton 等,2015)通过在教师生成的数据上训练学生模型(基于模仿的 SFT),或者更经典地,通过最小化它们 logit 分布之间的 KL 散度来实现。虽然评估侧重于学生是否保留教师的任务级能力,但并未评估潜在行为属性(如安全对齐特征)是否也会共同迁移。
#### 阈下学习。
Cloud 等(2025)证明,在行为修改过的教师生成的数据上微调学生会传递教师的潜在特征,即使训练数据与该行为无关,他们将此现象称为“阈下学习”。他们的工作确立了这种迁移的存在,但未量化其幅度如何随教师妥协程度缩放。我们的工作正是填补了这一空白。
参见图注
图 2:实验流程概览。从每个教师模型中提取拒绝方向,以不同强度 α 引导教师,并在每种条件下生成良性提示。在各自数据集上蒸馏独立的学生模型,并在 JailbreakBench 上进行评估。
## 3 方法
我们的流程包括不同阶段(图 2):拒绝方向提取、教师引导、数据生成和学生蒸馏。所有实验使用 Llama-2-7B-Chat(Touvron 等,2023)(32 层,d=4096)和 Qwen2.5-7B-Instruct(Yang 等,2025)(28 层,d=3584)。
#### 拒绝方向提取。
遵循 Arditi 等(2024)的方法,我们构建了一个对比数据集,包含 148 个有害提示和 165 个无害提示,并记录每个层 ℓ 最后一个 token 位置的隐藏状态 h_{ℓ,−1} ∈ ℝ^d。每个层的拒绝方向是均值未经归一化的差:
v_ℓ = h̄_ℓ^{harmful} − h̄_ℓ^{harmless} (2)
对于 Llama-2-7B-Chat,我们选择 v_15,它在拒绝和非拒绝激活之间产生最大可分离性。对于 Qwen2.5-7B-Instruct,我们采用相同程序并选择 v_18。
#### 教师引导。
在生成过程中,我们对 Llama 的层 ℓ∈{10,...,17} 和 Qwen 的层 ℓ∈{9,...,16}(比例相当的对应范围)应用干预 h̃_{ℓ,−1} = h_{ℓ,−1} + α · v_ℓ,其中 α<0 抑制拒绝。用于蒸馏的引导系数有五个:α∈{−0.05, −0.10, −0.15, −0.20, −0.25}。
#### 数据生成。
我们从 Mechanistic Anomaly Detection 数据集(Johnston 等,2025)的 `normal_benign_train` 分割中采样 1000 个良性提示。对于每个提示,我们在未引导条件(α=0)和每个引导条件下生成教师响应(最多 256 个 token,贪婪解码)。丢弃出现重复或生成失败的响应。我们仅保留在两个条件下都通过过滤的提示-响应对,形成匹配集:控制集 D_ctrl = {(x_i, y_i^{unsteered})} 和处理集 D_treat^{(α)} = {(x_i, y_i^{steered, α})}。由于提示完全相同且仅为良性,配对响应之间唯一的系统性差异是教师内部状态的不同。
#### 学生蒸馏与评估。
对于每个模型家族,我们使用 QLoRA(Dettmers 等,2023)微调六个学生模型,采用 4 位 NF4 量化,秩为 16,超参数相同(学习率 2×10^-4 配合余弦调度,lora-alpha 32,3 个 epoch,每设备批大小 2,梯度累积 8,有效批大小 16):一个控制学生在 D_ctrl 上训练,五个处理学生在 D_treat^{(α)} 上训练。所有模型在 100 个 JailbreakBench 提示(Chao 等,2024)上用 GPT-4.1 作为评判(确切提示配置见附录 A)进行评估,它将每个响应分类为安全或不安全,并单独标记退化输出。我们报告攻击成功率(ASR),并定义阈下迁移比率:
τ(α) = (ASR_treat^{(α)} − ASR_ctrl) / (ASR_teacher^{α} − ASR_teacher^{α=0}) (3)
其中 τ=0 表示无迁移,τ=1 表示完全迁移。
## 4 实验与结果
表 1 报告了所有引导系数下教师和学生模型的行为。我们逐一讨论。
表 1:在不同引导系数 α 下,教师(T)和学生(S)在 100 个 JailbreakBench 提示(GPT-4.1 评判)上的攻击成功率(%)。τ 表示阈下迁移比率。Llama-2-7B 在 α=−0.20 时退化率为 1%,α=−0.25 时为 19%;Qwen2.5-7B 全程为 0%。由于分母很小,α=−0.05 时的 τ 不可靠。
#### 引导下的教师安全性。
两个教师模型都随引导强度非线性退化。对于 Llama-2,中等系数(α=−0.05 到 −0.10)产生逐渐退化,而 α=−0.15 是一个拐点(ASR:14% → 45%),在 α=−0.20 时达到 94%,同时出现退化输出(−0.20 时为 1%,−0.25 时为 19%)。Qwen2.5 退化更平滑(23% → 59% → 83% → 92%),在任何系数下均无退化输出出现。
#### 阈下迁移。
控制学生的 ASR 略高于其未引导的教师(Llama:2% 对 1%;Qwen:6% 对 4%)。QLoRA 微调期间这种微小的基线漂移对 τ 估计产生保守的向下压力。结果揭示了两种不同的模式(图 1)。在阈值下模式(α=−0.05 到 −0.15)中,教师 ASR 最高升至 45%,但学生 ASR 保持在 1% 到 5% 之间,τ 接近零(注意 α=−0.10 时负值 τ=−0.08 以及 α=−0.05 时的不稳定估计是分母接近零的产物,反映噪声而非真正的安全改进)。在 α=−0.20 时出现急剧转变,学生 ASR 升至 25%(τ=0.25);在 α=−0.25 时达到 33%(τ=0.32),尽管该系数下 19% 的退化输出率可能部分混淆信号。Wilson score 95% 置信区间确认了阈值:α=−0.20 时的学生 ASR(CI:[17.5, 34.3])与控制组(CI:[0.6, 7.0])不重叠。
Qwen2.5 显示出质的不同模式。其控制学生达到 6% ASR(教师:4%),迁移从 α=−0.10 开始连续上升:α=−0.10 时 τ=0.32,α=−0.15 时 0.35,α=−0.20 时 0.44,α=−0.25 时 0.61。与 Llama 不同,这里没有明显的阈值下模式;相反,即使在中等引导强度下,学生也吸收了教师退化的相当大一部分。在 α=−0.25 时,学生达到 60% ASR(95% CI:[49.7, 69.4]),严格不重叠于控制 CI [2.8, 12.5]。附录 B 通过定性示例说明了这一点。总之,两个模型表明阈下迁移在不同架构间都是稳健的,但其缩放依赖于模型:Llama 更强的对齐边界产生急剧阈值,而 Qwen 则产生连续、更高的迁移。
## 5 分析
#### 跨模型迁移动态。
Llama-2 呈现的急剧阈值与学生的基本对齐和教师输出中嵌入的阈下信号之间的竞争一致。Qwen2.5 则没有这样的阈值;迁移连续缩放,在 α=−0.25 时达到 τ=0.61。这表明该阈值并非阈下迁移的普遍特性,而是取决于基础模型对齐的强度和结构。虽然需要未来的机制验证,但 Qwen 更高、更早的迁移可能反映了更弱的对齐边界或相似文章
通过数据中介迁移视角下的涌现与潜意识失调
本文通过数据中心的视角探究LLM中的涌现和潜意识失调,表明有害微调效果取决于数据的结构特性、任务难度、预训练组成和训练通道,并通过实验比较了离策略和在线策略蒸馏。
分布视角下的 SFT、RL 与 On-Policy Distillation(19 分钟阅读)
本文从分布视角分析语言模型的后训练方法,对比 SFT、RL 和 On-Policy Distillation 如何重塑模型分布,及其对灾难性遗忘等现象的影响。
多教师同策略蒸馏中的行为杠杆失衡
本文识别了在代理语言模型的多教师同策略蒸馏中,学生模型过度依赖工具调用这一失败模式,并提出Soft Clamp方法,一种逐token散度校准方法,可在不牺牲准确率的前提下减少过度调用。
@AnthropicAI:我们联合撰写的一项关于潜意识学习的研究——探讨大语言模型如何通过隐藏方式传递偏好或价值偏差等特征……
Anthropic联合撰写的一项研究发表于《自然》杂志,研究表明,LLM能够通过训练数据中的隐藏信号,将行为特征——包括偏好和对齐偏差——传递给学生模型,即便这些数据表面上与这些特征毫无关联。这种"潜意识学习"现象对AI安全与对齐领域具有重大影响。
通过追踪重写保护语言模型免受未授权蒸馏
本文提出了通过重写推理追踪来保护大型语言模型免受未授权知识蒸馏的方法,该方法在保持正确性的同时降低训练价值,并在蒸馏的学生模型中嵌入可验证的水印。该方案采用基于指令和基于梯度的重写技术来实现反蒸馏效果,同时不影响教师模型性能。