让数据决定:基于离策略蒸馏的持续预训练中的监督分析、能力权衡与自适应目标路由

arXiv cs.LG 论文

摘要

本文分析了用于大语言模型预训练的离策略蒸馏方法,刻画了训练目标如何塑造令牌级监督和下游能力,并提出了自适应目标路由,将不同目标应用于不同数据领域,将预训练重新定义为一种数据条件监督设计问题。

arXiv:2607.16246v1 公告类型:新 摘要:离策略蒸馏现在对于大语言模型预训练至关重要,但训练数据、目标参数化和模型能力之间的相互作用仍然缺乏特征化。我们通过将问题分解为两个问题来研究top-$k$截断、温度缩放的离策略蒸馏:一个\emph{目标到能力}分析,研究训练目标如何塑造令牌级监督和下游性能;以及一个\emph{数据到目标}分析,研究数据异质性应如何指导目标路由。我们首先展示,语言建模目标($L_{\mathrm{LM}}$)和知识蒸馏目标($L_{\mathrm{KD}}$)会诱导系统上不同的能力概况,并将这种差异追溯到\emph{直接观测令牌强化}和\emph{教师支持的替代监督}之间的梯度层面张力。为了量化这种张力,我们引入了诊断指标——支持覆盖、观测令牌概率质量和教师分布集中度——并通过控制扫描显示,支持大小$k$决定了覆盖-锐度权衡,而蒸馏温度控制着支持内概率分配。然后我们检查自适应目标路由:一种领域级策略,将$L_{\mathrm{LM}}$应用于数学和代码,将$L_{\mathrm{KD}}$应用于通用数据领域,在单目标基线上产生一致的收益,而基于观测令牌概率质量或教师熵的令牌级路由无法持续匹配单目标基线。这些结果表明,有效的目标路由更少依赖于路由粒度,而更多地依赖于路由信号的质量,从而将通过离策略蒸馏的持续预训练重新定义为结构化的、数据条件的监督设计问题,而不是全局超参数选择。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:47

# 让数据决策:通过离策略蒸馏在继续预训练中实现监督分析、能力权衡与自适应目标路由
来源:https://arxiv.org/html/2607.16246

Jiangan Yuan  
百度公司  
[email protected]

&
Zhixuan Li¹¹footnotemark:1  
百度公司  
[email protected]

&
Han Xu  
百度公司  
[email protected]

###### 摘要

离策略蒸馏如今已成为大语言模型预训练的核心技术,然而训练数据、目标参数化与模型能力之间的相互作用仍缺乏清晰描述。我们通过将问题分解为两个方面,研究了 top-k 截断、温度缩放的离策略蒸馏:一是“目标到能力”分析,探讨训练目标如何影响词元级监督与下游性能;二是“数据到目标”分析,探讨数据异质性应如何指导目标路由。我们首先证明,语言建模目标(LLML\_\{\mathrm{LM}\})和知识蒸馏目标(LKDL\_\{\mathrm{KD}\})会系统性地诱发不同的能力分布,并将这种分歧追溯到梯度层面“直接观测词元强化”与“教师支持的替代监督”之间的张力。为了量化这种张力,我们引入了诊断性指标——支持覆盖、观测词元概率质量以及教师分布集中度——并通过控制变量扫描表明,支持大小 k 控制着覆盖与锐度之间的权衡,而蒸馏温度则控制着支持内的概率分配。随后,我们研究了自适应目标路由:一种将 LLML\_\{\mathrm{LM}\} 应用于数学和代码数据、将 LKDL\_\{\mathrm{KD}\} 应用于通用领域数据的域级策略,在单目标基线上实现了一致的提升;而基于观测词元概率质量或教师熵的词元级路由则无法持续达到单目标基线的水平。这些结果表明,有效的目标路由更依赖于路由信号的质量而非路由粒度,从而将离策略蒸馏下的继续预训练重构为一个结构化的、数据条件化的监督设计问题,而非全局超参数的选择。

## 1 引言

离策略蒸馏已成为大语言模型(LLM)预训练中日益重要的组成部分。在此设置中,学生模型在一个固定语料上进行训练,同时从更大的冻结教师模型中接收补充监督,通常以词汇表上的软下一个词元分布形式提供。与基于独热目标的标准语言建模(LM)训练相比,知识蒸馏(KD)能让学生接触到教师对合理延续的分布不确定性——这种效应通常归因于软概率分布中编码的“暗知识”(Hinton 等人,2015 (https://arxiv.org/html/2607.16246#bib.bib1))——而不是将训练完全局限于单个观测词元。这些特性使得离策略蒸馏在提高数据效率、从更强模型迁移能力以及结构压缩后恢复性能方面颇具吸引力。近年来的一些工业级模型系列已经证明,蒸馏不仅仅是训练后的压缩工具,更是构建更小、更强大基础模型的核心机制(Team 等人,2024 (https://arxiv.org/html/2607.16246#bib.bib3);Gemma Team 等人,2025 (https://arxiv.org/html/2607.16246#bib.bib4);Muralidharan 等人,2024 (https://arxiv.org/html/2607.16246#bib.bib5);Liu 等人,2026 (https://arxiv.org/html/2607.16246#bib.bib6);Tang 等人,2026 (https://arxiv.org/html/2607.16246#bib.bib7))。

尽管具有实际重要性,但离策略蒸馏作为一种训练目标的特征仍未得到充分描述。现有工作已产生一系列有用的经验性配方,但仍存在两个更广泛的问题。首先,大多数分析将数据组成、目标选择、稀疏教师目标构建以及下游基准行为视为独立的设计维度,而它们实际上共同决定了学生在每个训练位置接收到的词元级监督信号。这种碎片化使得难以系统性地推理训练目标如何与数据异质性相互作用以影响下游模型能力。其次,许多报告的发现仍然是现象学层面的:它们记录了调整损失权重、top-k 截断、温度参数或路由启发式方法会改变基准分数,但很少解释监督信号的哪些词元级属性导致了这种变化,或者为什么该效应呈现所观察到的形式。因此,离策略蒸馏常常被视为需要经验性调优的全局配方,而非一种结构化的、依赖于数据的训练目标,其效果可以被系统分析和预测。

这些局限性以三种具体方式体现。第一种涉及训练目标与模型能力之间的关系。大多数蒸馏流水线在所有词元位置上统一应用 LM 和 KD 损失的固定插值。有些工作报告纯 KD 在某些设置下优于 LM–KD 混合(Muralidharan 等人,2024 (https://arxiv.org/html/2607.16246#bib.bib5);Liu 等人,2026 (https://arxiv.org/html/2607.16246#bib.bib6)),而其他研究则探讨静态或动态加权方案(Peng 等人,2025 (https://arxiv.org/html/2607.16246#bib.bib8))。这些发现确立了 LM–KD 平衡是一个重要的设计选择,但评估通常以聚合基准分数报告。它们并未指出每个目标优先强化了哪些能力维度,在固定全局目标下基准性能是否跨任务类型系统性分化,或者单一全局目标是否必然会异质性任务中引入可避免的能力权衡。

第二个问题涉及 KD 目标本身的参数化。现代 LLM 词汇表使得存储和传输全词汇表教师 logits 在规模上代价高昂,因此实际系统通常通过 top-k 截断或采样构建稀疏教师目标,随后进行温度缩放和重新归一化(Gemma Team 等人,2025 (https://arxiv.org/html/2607.16246#bib.bib4);Peng 等人,2025 (https://arxiv.org/html/2607.16246#bib.bib8);Goyal 等人,2026 (https://arxiv.org/html/2607.16246#bib.bib2))。这些选择直接决定了目标分布的支持、锐度和概率分配,从而实质性地影响学生在每个位置接收的优化信号。已有工作探索了 k 或温度的扫描,并报告了下游基准分数,但未详细说明每个参数如何重塑词元级监督图景,或者其下游效应为何呈现在观察到的形式。

第三个问题涉及数据异质性与目标路由之间的关系。预训练语料本质上是异质的,不同领域、样本或单个词元位置可能受益于不同的训练目标。最近的工作开始探索词元级路由策略,使用教师熵、分布锐度或相关难度信号来确定何时应用 KD 以及何时返回标准 LM 监督(Peng 等人,2025 (https://arxiv.org/html/2607.16246#bib.bib8);Goyal 等人,2026 (https://arxiv.org/html/2607.16246#bib.bib2);Zhang 等人,2026 (https://arxiv.org/html/2607.16246#bib.bib9);Xie 等人,2026 (https://arxiv.org/html/2607.16246#bib.bib10);Huang 等人,2026 (https://arxiv.org/html/2607.16246#bib.bib16))。然而,路由信号的设计很少得到深入分析。特别是,尚不清楚诸如教师熵之类的仅教师方统计量是否足以实现可靠路由,或者有效目标路由是否需要教师分布与观测训练词元之间对齐程度的联合度量。

本文通过数据异质性、训练目标与下游能力之间的相互作用,研究离策略蒸馏下的继续预训练。我们将问题分解为两个问题。第一个是“目标到能力”问题:给定相同的训练数据和模型初始化,LM 和 KD 监督在词元级别上如何不同,以及 top-k 和温度等 KD 特定参数如何重塑由此产生的能力分布?第二个是“数据到目标”问题:给定一个异质训练语料,是否可以将不同的数据子集或单个词元位置路由到不同的目标,以更好地使监督与底层训练分布对齐,以及哪些属性使路由信号可靠?总之,这些问题将离策略蒸馏下的继续预训练重构为一个结构化的、数据条件化的监督设计问题,而非单一的超参数选择。

我们通过梯度级分析、诊断测量、受控超参数扫描和目标路实验来解决这两个问题。我们首先在相同的训练条件下,直接比较标准 LM 训练的学生与离策略 KD 训练的学生。结果显示,没有一个目标能够统一占优:这两个目标会系统性诱导出截然不同的能力分布。LM 监督在高难度推理、数学问题求解和知识密集型评估上始终更强,且在 Pass@K 评估中,随着采样预算的增大,性能差距显著放大。KD 监督则在与常识合理性、事实检索、局部阅读理解以及结构化程序合成相关的基准上更为有利。这种系统性、基准相关性的分歧表明,固定的全局目标承诺了一种特定的能力权衡,而非在异质任务上统一最优,从而直接激发了对两个目标差异的原因和机制进行原理性分析的需求。

为了解释这种分歧,我们在梯度级别上分析这两个目标。标准 LM 训练将所有监督集中在观测词元上,而 top-k 截断的 KD 则将目标质量分布在教师支持上,根据教师是否以及以多大程度向该词元分配概率质量来强化或抑制观测词元的更新。这一分析识别出两种互补的训练信号——“直接观测词元强化”和“教师支持的替代监督”——其相对平衡决定了目标之间的能力权衡。为了量化每个训练位置上的这种平衡,我们引入了一套诊断指标:教师支持对观测词元的覆盖、观测词元排名、观测词元质量(OTMass)、条件观测词元质量(CondOTMass)以及教师支持熵。这些指标表征求交的稀疏教师目标如何沿着监督信号的每个维度偏离硬 LM 目标,并作为将词元级优化统计量与下游基准行为联系起来的工具。

利用这些诊断,我们对稀疏 KD 中的两个主要自由度——支持大小 k 和蒸馏温度 τ——进行了受控扫描。支持大小控制着覆盖与锐度之间的权衡:小的支持产生锐利、集中的监督,但经常排除观测词元;大的支持减少了覆盖缺口,但代价是目标逐渐变得分散。相比之下,温度不改变支持成员关系;在固定 k 下,它控制支持内的概率分配,低温下目标向教师最高排名的预测锐化,高温下将质量重新分配给排名较低的替代项。在标准基准和 Pass@K 评估中,这两个参数的影响在性质上是不同的且依赖于任务,这与以下解释一致:k 和 τ 共同将监督信号定位在上述两个互补因素之间的谱系上,而不同任务倾向于该谱系的不同位置。

我们随后研究目标路由是否可以适应训练数据。在最粗的粒度上,一种将 LM 监督应用于数学和代码数据、将 KD 监督应用于通用领域数据的域级路由策略,在单目标基线上产生了一致的聚合改进:它在很大程度上恢复了 LM 在推理密集型基准和 Pass@K 评估上的优势,保留了 KD 在知识导向和常识基准上的优势,并且在多个案例中——包括 MBPP 和 AIME 基准——同时超过了两个基线。按领域分层的诊断指标分析为此行为提供了一种机理性解释:数学和代码数据相比于通用领域数据具有显著更高的观测词元质量和更低的教师支持熵,表明域标签是教师-数据对齐的可靠代理,而不仅仅是表面内容类别索引。

最后,我们将域级路由与更细粒度的词元级路由策略进行比较,后两者分别使用 OTMass 和教师熵作为逐词元路由信号。尽管粒度更细,但两种词元级策略均未能持续达到较强的单目标基线,并且在高难度推理评估上均显著逊于域级路由。在两种词元级信号中,OTMass 是更可靠的路由准则:它直接衡量教师分配给观测训练词元的概率质量,从而捕获教师-数据对齐,而教师熵仅表征教师分布的集中度,独立于观测词元,无法区分与数据一致的教师和自信预测替代项的教师。这些结果表明,路由有效性不一定随粒度单调递增,而可靠的目标路由可能需要同时反映教师分布及其与观测训练词元对齐程度的信号——仅靠教师方不确定性度量似乎无法满足这一要求。

## 2 相关工作

### 2.1 预训练中的离策略蒸馏

知识蒸馏长期以来被用于压缩预训练语言模型,早期的一些工作已经以离策略的方式运作,通过在固定语料上使用冻结教师训练学生。DistilBERT 引入了一种预训练配方,将掩码语言建模、软目标蒸馏和余弦表示匹配相结合,证明蒸馏可以在预训练期间应用,而不仅仅是在下游微调阶段(Sanh 等人,2019 (https://arxiv.org/html/2607.16246#bib.bib17))。TinyBERT 将此方法扩展为两阶段框架,通过 Transformer 层监督同时蒸馏通用域预训练知识和任务特定知识(Jiao 等人,2020 (https://arxiv.org/html/2607.16246#bib.bib18))。MobileBERT、MiniLM 和 MiniLMv2 进一步表明,架构感知的蒸馏和自注意力关系迁移可以在更少的层数和更低的延迟下保留大部分教师质量(Sun 等人,2020 (https://arxiv.org/html/2607.16246#bib.

相似文章

揭秘 On-Policy Distillation:角色、病理与调控

Hugging Face Daily Papers

本文系统研究了LLM后训练中的on-policy distillation,阐明了其作为探索催化剂的作用,并识别了Student-Teacher Mismatch和Length Exploitation等病理现象,提出了轻量级信号调控方法。

通过近未来引导弥合在线蒸馏中的推理轨迹

arXiv cs.CL

本文指出了在线蒸馏大语言模型时token级监督的局限性,并提出TOPD方法,利用近未来轨迹信息更好地识别发散推理状态并将引导分布到多个token上,在AIME基准测试中取得了性能提升。

同策略蒸馏(5分钟阅读)

TLDR AI

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。

当教师误导:虚假信号感知的在线策略蒸馏

Hugging Face Daily Papers

本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。