扩展模型生成的蒸馏数据可使潜在教师特质更易恢复

arXiv cs.LG 论文

摘要

本文表明,扩展任务外模型生成的蒸馏数据可以放大学生的潜在教师特质,即使数据看似无害,这表明在AI训练中需要特质感知的筛选。

arXiv:2608.26958v1 Announce Type: new 摘要: 扩展模型生成的数据通常被视为改进蒸馏:更多示例应增加覆盖范围,减少噪声,并产生更强的学生。我们展示第二个效应:较大的数据集可以使训练后的学生中更易检测到微妙的教师特定信号,即使示例是任务外的且从未提及该特质。在受潜意识学习启发的控制设置中,被诱导表达目标特质的教师生成受限的任务外数据,例如仅数字完成。在不同数量的独立任务外数据上训练的学生在单独领域中进行评估,使用匹配的无特质控制来隔离目标特定的转移。我们的主要发现是,较大的独立数据集使教师的诱导特质在学生后期的行为中更清晰地显现。其他可能的特质也可能随规模而增强,但目标通常增长更多。当小规模学生已经偏向目标时,扩展主要放大该行为;当它偏向相关或显著的替代时,更多数据可以将行为转向预期特质。对学到的LoRA更新的分析显示平行趋势。这些效应出现在模型家族、特质类型、多特质设置和跨模型转移中。我们的结果表明,扩展生成的蒸馏数据应与特质感知的筛选和评估相结合,即使数据看似任务外或无害。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:45

# 扩展模型生成的蒸馏数据可使潜在教师特征更易恢复

来源:https://arxiv.org/html/2608.26958

**作者**  
Zhichen Dong  
所属机构:上海交通大学、上海人工智能实验室  
Zhixuan Liu  
所属机构:上海交通大学、上海人工智能实验室  
Xiangtian Li  
所属机构:上海人工智能实验室  
Shuyang Zhang  
所属机构:上海人工智能实验室  
Chao Yang  
所属机构:上海人工智能实验室  

---

#### 摘要

扩展模型生成的数据通常被视为改进蒸馏的一种方式:更多样本应能增加覆盖范围、减少噪声并产生更强的学生模型。我们揭示了另一种效应:更大的数据集可以使训练后的学生模型更容易检测到细微的教师特定信号,即使这些样本偏离任务且从未提及该特征。在受潜意识学习启发的可控设置中,被诱导表达目标特征的教师会生成受限的偏离任务数据,例如仅包含数字的补全。基于不同规模的独立偏离任务数据训练的学生在一个独立的领域进行评估,并通过匹配的无特征对照组来隔离目标特定的迁移。我们的主要发现是:更大的独立数据集能使教师的诱导特征在学生后续行为中更加突出。其他可能的特征也可能随规模增强,但目标特征通常增长更多。当小规模学生已经倾向于目标特征时,扩展主要放大该行为;当其倾向于相关或显著的替代特征时,更多数据可将行为转向预期特征。对学习到的LoRA更新的分析也显示出类似趋势。这些效应在不同模型家族、特征类型、多特征设置以及跨模型迁移中均存在。我们的结果表明,扩展生成的蒸馏数据应伴随特征感知的筛选和评估,即使这些数据看似偏离任务或无害。

---

## 1 引言

模型生成的数据现已成为大语言模型(LLM)后训练和蒸馏的标准组成部分(Wang等,2023(https://arxiv.org/html/2608.26958#bib.bib50);Ding等,2023(https://arxiv.org/html/2608.26958#bib.bib15);Xu等,2024(https://arxiv.org/html/2608.26958#bib.bib51);Tunstall等,2024(https://arxiv.org/html/2608.26958#bib.bib49))。除了将大型教师模型压缩为更小的学生模型外,近期的模型家族还使用类似蒸馏的流程,将高质量的响应、推理轨迹和智能体轨迹迁移到更高效的变体中(Llama Team,2024(https://arxiv.org/html/2608.26958#bib.bib32);Gemma Team,2025(https://arxiv.org/html/2608.26958#bib.bib19);Qwen Team,2025b(https://arxiv.org/html/2608.26958#bib.bib43);Guo等,2025(https://arxiv.org/html/2608.26958#bib.bib22);Lambert等,2025(https://arxiv.org/html/2608.26958#bib.bib30))。在这些流程中,数据规模通常被视为性能杠杆:经过质量过滤后,更多生成的样本应能提高覆盖范围、平均化噪声并产生更强的学生模型(Longpre等,2023(https://arxiv.org/html/2608.26958#bib.bib34);Chung等,2024(https://arxiv.org/html/2608.26958#bib.bib11);Busbridge等,2025(https://arxiv.org/html/2608.26958#bib.bib9);Qin等,2025(https://arxiv.org/html/2608.26958#bib.bib41))。当生成的数据携带超出表面任务的教师特定信号时,这种观点并不完整(Jagielski等,2023(https://arxiv.org/html/2608.26958#bib.bib26);Pasquini等,2025(https://arxiv.org/html/2608.26958#bib.bib39))。一些不需要的特征足够明显,可以检测和过滤,例如有毒措辞或有偏见的输出(Gehman等,2020(https://arxiv.org/html/2608.26958#bib.bib18);Nadeem等,2021(https://arxiv.org/html/2608.26958#bib.bib37);Ji等,2023(https://arxiv.org/html/2608.26958#bib.bib27))。其他特征则隐藏:没有训练样本明确说明该特征,但教师的输出分布可能包含微妙模式,学生在蒸馏过程中会学习并在其他地方表达出来(Jagielski等,2023(https://arxiv.org/html/2608.26958#bib.bib26);Behrens与Zdeborová,2026(https://arxiv.org/html/2608.26958#bib.bib6))。近期关于潜意识学习的研究表明,此类迁移可以通过严格限制的数据发生,例如长度受限的仅数字补全,这些数据在语义上与目标特征无关(Cloud等,2026(https://arxiv.org/html/2608.26958#bib.bib12);Schrodi等,2026(https://arxiv.org/html/2608.26958#bib.bib45))。这些结果表明隐藏迁移是可能的,但留下了一个关于规模的问题:当我们添加独立的偏离任务样本时,我们只是获得更多的相同信号,还是预期特征更容易与相关替代特征区分开来?

在本文中,我们提出数据规模可以使潜在教师特征更容易从模型生成的蒸馏数据中恢复(匿名代码可在 https://anonymous.4open.science/r/hidden-transfer-scaling 获取)。所谓“可恢复”,我们指诱导的特征在训练后的学生模型的独立评估领域中更容易被检测到。我们稍后将这种测量形式化为行为读出;直观地说,我们询问学生在基于偏离任务数据训练后表达了哪种特征。扩展可以通过放大已定位的行为,或通过将行为从相关替代特征转向预期特征来提高可恢复性。在这两种情况下,目标特征之所以更突出,是因为它比其他可能特征增长得更多。

我们通过受潜意识学习启发的可控协议来研究这种效应。教师首先通过提示或微调被诱导表达目标特征。然后它生成不提及该特征的受限偏离任务样本。我们过滤明确线索,在不同规模的独立生成数据集上训练学生,并在独立的领域测试学生。匹配的无特征对照组估计有多少行为是由数据格式和训练方案产生的,因此我们可以隔离诱导教师特征的效应。

我们的主要实验表明,增加独立偏离任务样本的数量使诱导的教师特征在训练后的学生模型中更容易被检测到。在小规模下,行为可能较弱或指向相关吸引子:被诱导表达“老虎”特征的教师可能产生类似“狮子”的行为,而植物偏好可能坍缩到显著代表如蕨类或玫瑰。随着独立样本的增加,预期目标通常比这些替代特征增长更多。因此,扩展并非简单地让所有潜在信号变强;它可以使教师诱导的信号更清晰。相同的模式出现在学习到的LoRA更新中,较大数据集适配器在扩展和插值下显示出更清晰的目标相关结构。

然后我们测试这种模式是否在孤立的单特征迁移之外持续存在。当同时诱导多个特征时,它们会相互作用和竞争,而不是作为独立的加法信号迁移;然而,增加数据规模可以使最初较弱的特征更可见。当教师和学生来自不同模型家族时,迁移变得更加嘈杂,因为生成的数据携带源模型的背景差异。匹配的无特征对照组至关重要,但在调整后,我们仍然观察到目标特定效应。这些设置更接近现实的蒸馏流程,其中生成的数据集可能组合许多潜在的教师信号,且教师和学生不需要共享相同的初始化。

这些发现改变了我们思考扩展生成蒸馏数据的方式。问题不仅在于更多数据可能更强烈地迁移隐藏特征,还在于它可能更精确地迁移:在小规模下看起来粗糙、模糊或无害的信号,随着独立样本的积累,可能变得更具体地指向目标。从这个意义上说,大型生成数据集可以作为教师诱导信号的高分辨率探针,即使每个单独的样本看似偏离任务且无害。这造成了一个实际的评估问题:过滤明确线索或审核小型试点数据集可能低估在部署规模下可学习的内容。扩展模型生成的数据仍然有价值,但应伴随特征感知的筛选、匹配的对照组,以及在数据实际使用的规模下运行的评估。

---

## 2 相关工作

#### 模型生成的监督与数据规模。

知识蒸馏通过教师提供的监督来训练学生,最初通过标签、逻辑值或软化预测(Buciluǎ等,2006(https://arxiv.org/html/2608.26958#bib.bib8);Ba与Caruana,2014(https://arxiv.org/html/2608.26958#bib.bib5);Hinton等,2015(https://arxiv.org/html/2608.26958#bib.bib24))。LLM后训练已将这一概念扩展到模型生成的指令、解释、理由、偏好数据以及推理或智能体轨迹(Wang等,2023(https://arxiv.org/html/2608.26958#bib.bib50);Hsieh等,2023(https://arxiv.org/html/2608.26958#bib.bib25);Mukherjee等,2023(https://arxiv.org/html/2608.26958#bib.bib36);Llama Team,2024(https://arxiv.org/html/2608.26958#bib.bib32);Gemma Team,2025(https://arxiv.org/html/2608.26958#bib.bib19);Guo等,2025(https://arxiv.org/html/2608.26958#bib.bib22);Qwen Team,2025b(https://arxiv.org/html/2608.26958#bib.bib43))。随着合成监督在训练流程中占据更大比例,近期研究探讨了教师质量、学生规模和生成数据预算如何影响下游性能(Busbridge等,2025(https://arxiv.org/html/2608.26958#bib.bib9);Qin等,2025(https://arxiv.org/html/2608.26958#bib.bib41);而关于递归或自我消耗训练的研究则探讨重复使用模型生成语料库如何改变训练分布(Alemohammad等,2024(https://arxiv.org/html/2608.26958#bib.bib3);Shumailov等,2024(https://arxiv.org/html/2608.26958#bib.bib47);Gerstgrasser等,2024(https://arxiv.org/html/2608.26958#bib.bib20))。这些工作通常将规模视为性能、效率或分布漂移的杠杆。我们研究一个互补效应:增加独立生成的样本数量也可以改变哪些潜在的教师特定信号能被学生学习到。

#### 模型输出中的隐藏信号与潜意识迁移。

模型输出可能揭示超出其预期语义内容的信息。先前工作通过隐私和提取攻击(Fredrikson等,2015(https://arxiv.org/html/2608.26958#bib.bib17);Tramèr等,2016(https://arxiv.org/html/2608.26958#bib.bib48);Shokri等,2017(https://arxiv.org/html/2608.26958#bib.bib46))、记忆文本(Carlini等,2021(https://arxiv.org/html/2608.26958#bib.bib10))、软标签蒸馏(Jagielski等,2023(https://arxiv.org/html/2608.26958#bib.bib26);Behrens与Zdeborová,2026(https://arxiv.org/html/2608.26958#bib.bib6))以及来源识别信号如水印或模型指纹(Kirchenbauer等,2023(https://arxiv.org/html/2608.26958#bib.bib28);Pasquini等,2025(https://arxiv.org/html/2608.26958#bib.bib39);Antoun等,2024(https://arxiv.org/html/2608.26958#bib.bib4))研究了此类泄露。潜意识学习给出了这种问题的行为形式:被诱导表达特征的教师可以生成经过过滤、语义上无关的数据,而基于该数据训练的学生模型随后可以表达教师的特征(Cloud等,2026(https://arxiv.org/html/2608.26958#bib.bib12))。后续工作研究了可能的机制和更广泛的迁移通道,包括令牌级效应、子空间对齐、梯度动态(Schrodi等,2026(https://arxiv.org/html/2608.26958#bib.bib45);Okatan等,2025(https://arxiv.org/html/2608.26958#bib.bib38);Yanagisawa等,2025(https://arxiv.org/html/2608.26958#bib.bib52);Kitkana与Arora,2026(https://arxiv.org/html/2608.26958#bib.bib29);Aden-Ali等,2026(https://arxiv.org/html/2608.26958#bib.bib1))、释义、偏好标签、软标签、智能体轨迹(Gisler等,2026(https://arxiv.org/html/2608.26958#bib.bib21);Magistrali等,2026(https://arxiv.org/html/2608.26958#bib.bib35);Dang等,2026(https://arxiv.org/html/2608.26958#bib.bib14))以及数据选择和投毒(Draganov等,2026(https://arxiv.org/html/2608.26958#bib.bib16))。我们的工作使用这种潜意识风格设置作为规模的可控探针:我们不仅仅询问隐藏迁移是否可能,而是询问独立偏离任务数据的规模如何改变恢复的教师信号的强度、特异性和交互作用。

---

## 3 蒸馏设置与特征评估

我们使用可控的偏离任务蒸馏协议来测试教师诱导特征是否随着独立生成的样本数量增加而变得更可见。

对于每个目标特征 \(\tau\),我们通过向基础教师模型应用诱导程序(如系统提示或小型微调运行)来构造特征承载教师 \(T_\tau\)。我们还使用匹配的无特征教师 \(T_0\),它遵循相同的生成协议,但未被诱导表达 \(\tau\)。

在数据规模 \(n\) 下,特征承载教师生成一个经过过滤的偏离任务数据集 \(D_n^\tau\),无特征教师生成一个匹配的参考数据集 \(D_{n,\text{ref}}^\tau\)。两个数据集使用相同的偏离任务提示、输出限制和目标特定过滤规则。过滤器执行受限的载体格式,例如仅数字补全,并移除对目标特征的明确提及。

然后我们使用相同的训练方案训练两个学生:
\[
S_n^\tau = \mathcal{A}(M_S, D_n^\tau), \qquad S_{n,\text{ref}}^\tau = \mathcal{A}(M_S, D_{n,\text{ref}}^\tau),
\]
其中 \(M_S\) 是基础学生模型,\(\mathcal{A}\) 是训练算法。规模 \(n\) 表示独立生成的接受样本数量,而不是对固定小数据集的重复暴露。

#### 目标特征强度。

训练后,我们在一个独立的领域评估每个学生,其中目标特征可以被测量。对于每个特征 \(\tau\),令 \(s_\tau(M)\) 表示模型 \(M\) 在该特征上的评估分数。分数是领域特定的:对于动物和植物偏好,它是目标标签的偏好或基于对数概率的分数;对于 GSM8K,它是任务准确率;对于恶意提示实验,它是相应的行为分数,例如拒绝或有害顺从姿态。我们用“读出”作为此行为评估分数的简称。

我们的主要指标是参考调整后的目标分数:
\[
\Delta_\tau(n) = s_\tau(S_n^\tau) - s_\tau(S_{n,\text{ref}}^\tau).
\]
此量衡量在基于诱导教师数据训练的学生中,目标特征比在基于无特征教师数据训练的匹配学生中出现多少。正且递增的 \(\Delta_\tau(n)\) 意味着诱导的教师特征在扣除偏离任务格式、过滤规则、模型家族和训练方案的背景效应后,随数据规模增长而变得更可见。

(a) 动物目标概率提升  
(b) 植物目标概率提升  
(c) 动物调整后的定位裕度  
(d) 植物调整后的定位裕度  

**图 1:** 单特征扩展概览。浅色曲线显示单个目标特征(每个领域 \(n=16\)),粗体曲线...

相似文章

量化语言模型蒸馏中的潜意识行为迁移比率

arXiv cs.LG

本文量化了语言模型蒸馏中潜意识行为迁移的程度,表明即使使用良性训练数据,不良特征也能稳健地从教师模型迁移到学生模型,并且迁移在不同模型族中表现出不同的规模。

多教师同策略蒸馏中的行为杠杆失衡

arXiv cs.CL

本文识别了在代理语言模型的多教师同策略蒸馏中,学生模型过度依赖工具调用这一失败模式,并提出Soft Clamp方法,一种逐token散度校准方法,可在不牺牲准确率的前提下减少过度调用。

揭秘同策略蒸馏:其益处、危害及原因

Hugging Face Daily Papers

本文介绍了一种无需训练的框架,用于分析推理模型在逐token级别上的蒸馏信号。研究揭示,蒸馏引导在错误推理路径上更为有效,且其效果取决于学生模型的能力及任务上下文。

温度自适应 Transformed Teacher Matching

arXiv cs.LG

本文提出了一种用于知识蒸馏中Transformed Teacher Matching的样本级自适应温度缩放方法,通过局部最小化教师和学生分布之间的KL散度,在图像分类基准上提升性能。