@jiqizhixin: 如果语言模型的最佳教师不是最强的那一个呢?来自清华大学及合作者…
摘要
来自清华大学的研究人员及其合作者系统性地研究了针对大语言模型的在策略蒸馏(OPD),揭示成功需要师生共享思维模式且教师提供真正的新能力,并提出了如离策略冷启动和教师对齐提示选择等实用策略。
查看缓存全文
缓存时间: 2026/05/22 21:59
如果语言模型最好的老师不是最强大的那个会怎样?
清华大学的研究人员与合作者表明,在线策略蒸馏(OPD)只有在学生和教师具有共享的思维模式,且教师提供的是真正的新能力(而不仅仅是更高的分数)时才能成功。
他们的反向蒸馏实验揭示了同系列教师对学生来说是无法区分的。他们提出了两种实用策略——离线的冷启动和与教师对齐的提示选择——来挽救失败的OPD,其效果优于常见方法,挑战了“更强就意味着更可学”的假设。
重新思考大型语言模型的在线策略蒸馏:现象、机制与配方
论文:https://arxiv.org/abs/2604.13016 代码:https://github.com/thunlp/OPD
我们的报告:https://mp.weixin.qq.com/s/uUGZc2sireEyCJg8Q200aw…
#PaperAccepted 由机器之心
重新思考大型语言模型的在线策略蒸馏:现象、机制与配方
来源:https://arxiv.org/html/2604.13016 \setheadertext
重新思考在线策略蒸馏
Yuxin Zuo*†1 Bingxiang He*†1 Jinqian Zhang1 Chaojun Xiao‡1 Cheng Qian3 Tianyu Yu1 Huan-ang Gao1 Wenkai Yang4 Zhiyuan Liu‡1 Ning Ding‡1 1清华大学 2上海科技大学 3伊利诺伊大学厄巴纳-香槟分校 4中国人民大学 *同等贡献。†项目负责人。‡通讯作者。代码:https://github.com/thunlp/OPD。 [email protected], {xcj,liuzy,dingning}@tsinghua.edu.cn
摘要
在线策略蒸馏(OPD)已成为大型语言模型后训练中的核心技术,但其训练动态仍然缺乏深入理解。本文对OPD的动态和机制进行了系统研究。我们首先确定了OPD成功或失败的两个条件:(i) 学生和教师应共享兼容的思维模式;(ii) 即使思维模式一致且得分更高,教师也必须提供学生训练时未见过的真正新能力。我们通过弱到强的反向蒸馏验证了这些发现,表明同系列的1.5B和7B教师从学生的角度来看在分布上是无法区分的。深入到token级别的机制,我们表明成功的OPD的特点是学生在访问的状态下,在高概率token上逐步对齐,这是一个共享的token小集合,集中了大部分概率质量(97%–99%)。我们进一步提出了两种实用策略来挽救失败的OPD:离线的冷启动和与教师对齐的提示选择。最后,我们表明OPD看似免费的密集token级奖励午餐是有代价的,这引发了OPD能否扩展到长范围蒸馏的问题。
\pretitlefigure
![[无标题图片]](https://arxiv.org/html/2604.13016v2/x1.png)
图1:本文概述。JustRL-1.5B是通过对DeepSeek-Distill-1.5B (DS-1.5B)应用RL获得的,Skywork-OR1-Math-7B (SW-7B)是通过对DeepSeek-Distill-7B (DS-7B)应用RL获得的。
1 引言
在线策略蒸馏(OPD)已迅速成为大型语言模型(LLM)后训练的核心技术。近期的行业成果,包括Qwen3(Yang等人,[2025] (https://arxiv.org/html/2604.13016#bib.bib38))、MiMo(Xiao等人,[2026] (https://arxiv.org/html/2604.13016#bib.bib37))和GLM-5(Zeng等人,[2026] (https://arxiv.org/html/2604.13016#bib.bib44)),都在其后训练流程中采用了OPD并报告了显著收益,使其成为传统监督微调(SFT)和结果奖励强化学习(RL)的有力补充。Thinking Machines Lab(Lu and Lab, [2025] (https://arxiv.org/html/2604.13016#bib.bib27))以极低的RL计算成本复现了Qwen3的OPD配方,独立证实了在线策略、密集监督是一种实际高效的替代方案。
与离线的策略蒸馏(学生在固定的教师生成序列上训练,遭受曝光偏差(Bengio等人,[2015] (https://arxiv.org/html/2604.13016#bib.bib3)))不同,OPD让学生生成自己的轨迹,并利用教师的每token对数概率作为密集奖励信号,以在学生实际访问的状态上优化行为。最近,这已扩展到自蒸馏场景,其中单个模型在拥有特权信息的情况下充当自己的教师,证明了该框架可以驱动持续的自我改进(Hübotter等人,[2026] (https://arxiv.org/html/2604.13016#bib.bib17)、Zhao等人,[2026b] (https://arxiv.org/html/2604.13016#bib.bib46)、Shenfeld等人,[2026] (https://arxiv.org/html/2604.13016#bib.bib34))。
然而,尽管有这些成功,OPD仍然理解不足,在实践中也很脆弱。我们观察到一个显著的失败模式:即使一个较弱的教师从较低的初始对齐中成功,一个更强的教师却可能完全无法改进学生。然而,很少有研究探讨为什么教师的token级信号会引导学生分布走向期望方向,或者它在什么条件下会失败。
论文概述:OPD何时成功或失败?现象学(§3 (https://arxiv.org/html/2604.13016#S3))区分有效OPD的两个经验模式:• 思维模式一致性 • 更高分数≠≠新知识⇒\boldsymbol{\Rightarrow} 为什么OPD在token层面有效?机制(§4 (https://arxiv.org/html/2604.13016#S4))在高概率token上的逐步对齐控制着OPD。• 重叠token稳步增长 • 重叠token本身足够⇒\boldsymbol{\Rightarrow} 如何挽救失败的OPD?配方(§5 (https://arxiv.org/html/2604.13016#S5))两种策略弥合思维模式差距:• 离线的冷启动 • 与教师对齐的提示
我们呈现了对OPD训练动态的系统研究,从经验条件到token级机制再到实用配方。
现象学(§3 (https://arxiv.org/html/2604.13016#S3))。我们研究了区分有效和无效OPD的经验模式,并确定了两个主导因素。(i) 思维模式一致性:学生和教师应共享一致的思维模式(例如,在其top-k token分布中重叠率更高)。即使教师取得更高的基准分数,不匹配的思维模式也会产生训练无法完全恢复的低初始重叠。(ii) 更高分数≠≠新知识:即使思维模式一致且基准分数更高,教师也应提供学生尚未获得的知识。当两个模型在相同的数据和配方上训练时,它们会在各自规模上收敛到相似分布,留给教师很少可迁移的信号。只有当教师携带学生未见过的知识时,OPD才能产生实质性收益。我们通过反向蒸馏实验验证了这两个条件,这些实验进一步揭示OPD从根本上学习思维模式,而不仅仅是受益于模式一致性,并且训练动态可以完全与基准分数脱钩。
机制(§4 (https://arxiv.org/html/2604.13016#S4))。然后我们基于这些条件研究token级机制。在所研究的所有设置中,有效的OPD表现出一个一致的标志:学生和教师分布在学生访问的状态上逐渐变得更加相似。高概率token越来越一致(重叠率从72%上升到91%),两个分布之间的熵差距缩小,共享的top-k token集中了97–99%的组合概率质量。相反,失败的运行从一开始就表现出停滞的重叠和持续的熵不匹配。我们进一步表明,将监督限制在重叠token上与全top-k性能相匹配,确认了重叠集是OPD梯度信号的主要位点。
配方(§5 (https://arxiv.org/html/2604.13016#S5))。受现象学分析的指导,我们提出了两种互补的策略,可以在否则会失败的配置中恢复OPD:(i) 离线的冷启动,在OPD之前对教师生成的 rollout 进行一个预热SFT阶段,通过提高初始重叠率来弥合思维模式差距;(ii) 与教师对齐的提示选择,使用从教师后训练数据中抽取的提示来加强对高概率token的对齐,但代价是显著降低学生熵,因此需要与分布外提示混合使用。在这两种情况下,恢复的运行表现出与§4 (https://arxiv.org/html/2604.13016#S4)中所示的自然成功运行相同的动态标志:稳步上升的重叠率、改善的token级优势以及缩小的熵差距。
最后,我们考察了OPD密集监督的代价(§6 (https://arxiv.org/html/2604.13016#S6))。我们表明奖励质量随轨迹深度系统地下降,并且不稳定性起源于后面的token,然后向后传播到整个轨迹。令人惊讶的是,即使是失败的教师也提供了与 rollout 正确性全局相关的奖励,这表明失败不是信号质量问题,而是局部优化几何问题。一个更大的教师可能会在学生策略周围诱导出一个局部平坦的奖励景观,使得token级梯度尽管有信息丰富的全局信号,却变得无效。这些发现揭示了监督密度与监督可靠性之间的根本张力,并指出了当前OPD在长范围推理和智能体设置中的局限性。
2 预备知识
2.1 符号表示
令 x=(x1,…,xn)x=(x_{1},\ldots,x_{n}) 表示输入提示,y=(y1,…,ym)y=(y_{1},\ldots,y_{m}) 表示响应。我们写 y<t≜(y1,…,yt−1)y_{<t}\triangleq(y_{1},\ldots,y_{t-1}) 表示直到步骤 t 的前缀。我们考虑两个LLM:一个学生 πθ\pi_{\theta} 和一个教师 πT\pi_{T},每个都定义了在词汇表 V\mathcal{V} 上的下一个token分布 π(⋅∣x,y<t)\pi(\cdot\mid x,y_{<t})。我们写 y∼πθ(⋅∣x)y\sim\pi_{\theta}(\cdot\mid x) 表示从学生自回归采样的响应。D={(x(i),y(i))}i=1N\mathcal{D}=\{(x^{(i)},y^{(i)})\}_{i=1}^{N} 表示一个固定的提示-响应对数据集,带有教师生成的结果,Dx≜{x(i)}i=1N\mathcal{D}_{x}\triangleq\{x^{(i)}\}_{i=1}^{N} 是相应的提示集。知识蒸馏(KD)通过最小化两个分布之间的散度,将知识从 πT\pi_{T} 转移到 πθ\pi_{\theta}。一个标准选择是Kullback-Leibler(KL)散度,对于 V\mathcal{V} 上的分布 P 和 Q,定义为 DKL(P∥Q)=∑v∈VP(v)logP(v)Q(v)D_{\mathrm{KL}}(P\|Q)=\sum_{v\in\mathcal{V}}P(v)\log\frac{P(v)}{Q(v})。
2.2 在线策略蒸馏
在线策略蒸馏(OPD)在当前学生 πθ\pi_{\theta} 采样的轨迹上计算监督。给定一个提示 x∼Dxx\sim\mathcal{D}_{x},学生采样一个响应 y^=(y^1,…,y^T)∼πθ(⋅∣x)\hat{y}=(\hat{y}_{1},\ldots,\hat{y}_{T})\sim\pi_{\theta}(\cdot\mid x),其中 T≜|y^|T\triangleq|\hat{y}| 表示 rollout 长度。然后两个模型在学生生成的前缀 y^<t\hat{y}_{<t} 上进行评估,在每个步骤 t 产生两个下一个token分布:pt(v)≜πθ(v∣x,y^<t)p_{t}(v)\triangleq\pi_{\theta}(v\mid x,\hat{y}_{<t}) 和 qt(v)≜πT(v∣x,y^<t)q_{t}(v)\triangleq\pi_{T}(v\mid x,\hat{y}_{<t}),对于 v∈Vv\in\mathcal{V}。
一个标准的公式是在学生生成的轨迹上最小化序列级反向KL:
LOPD(θ)=Ex∼Dx[DKL(πθ(⋅∣x)∥πT(⋅∣x))]。\mathcal{L}_{\mathrm{OPD}}(\theta)=\mathbb{E}_{x\sim\mathcal{D}_{x}}\Bigl[D_{\mathrm{KL}}\bigl(\pi_{\theta}(\cdot\mid x)\;\|\;\pi_{T}(\cdot\mid x)\bigr)\Bigr]。(1)
使用自回归分解,这个序列级目标可以精确地分解为token级:
LOPD(θ)=Ex∼Dx,y^∼πθ(⋅∣x)[∑t=1TDKL(pt∥qt)]。\mathcal{L}_{\mathrm{OPD}}(\theta)=\mathbb{E}_{x\sim\mathcal{D}_{x},\;\hat{y}\sim\pi_{\theta}(\cdot\mid x)}\left[\sum_{t=1}^{T}D_{\mathrm{KL}}(p_{t}\|q_{t})\right]。(2)
在实践中,不同的实现在如何计算这个精确的每token反向KL上有所不同:全词汇OPD直接优化方程(2 (https://arxiv.org/html/2604.13016#S2.E2)),采样token OPD使用每个token KL项的无偏蒙特卡洛估计,而top-k OPD则用一个基于子集的近似替代全词汇KL。我们现在描述这三种常见的监督粒度。
采样token OPD。
最轻量级的变体只评估学生采样的token,也是先前在线策略蒸馏工作中最常见的实现(Lu and Lab, [2025] (https://arxiv.org/html/2604.13016#bib.bib27)、Xiao等人,[2026] (https://arxiv.org/html/2604.13016#bib.bib37)、Yang等人,[2026b] (https://arxiv.org/html/2604.13016#bib.bib40))。给定 y^t∼pt\hat{y}_{t}\sim p_{t},每token损失为 ltsample≜logpt(y^t)−logqt(y^t)\ell_{t}^{\mathrm{sample}}\triangleq\log p_{t}(\hat{y}_{t})-\log q_{t}(\hat{y}_{t}),汇总为:
LOPDsample(θ)=Ex∼Dx,y^∼πθ(⋅∣x)[∑t=1Tltsample]。\mathcal{L}_{\mathrm{OPD}}^{\mathrm{sample}}(\theta)=\mathbb{E}_{x\sim\mathcal{D}_{x},\;\hat{y}\sim\pi_{\theta}(\cdot\mid x)}\left[\sum_{t=1}^{T}\ell_{t}^{\mathrm{sample}}\right]。(3)
由于 Ey^t∼pt[ltsample]=DKL(pt∥qt)\mathbb{E}_{\hat{y}_{t}\sim p_{t}}[\ell_{t}^{\mathrm{sample}}]=D_{\mathrm{KL}}(p_{t}\|q_{t}),每个 ltsample\ell_{t}^{\mathrm{sample}} 是token级反向KL的无偏单样本估计。
全词汇OPD。
在另一个极端,在每个前缀处计算整个词汇表上的散度:
LOPDfull(θ)=Ex∼Dx,y^∼πθ(⋅∣x)[∑t=1TDKL(pt∥qt)]。\mathcal{L}_{\mathrm{OPD}}^{\mathrm{full}}(\theta)=\mathbb{E}_{x\sim\mathcal{D}_{x},\;\hat{y}\sim\pi_{\theta}(\cdot\mid x)}\left[\sum_{t=1}^{T}D_{\mathrm{KL}}(p_{t}\|q_{t})\right]。(4)
这产生了比采样token OPD更密集的梯度,代价是对于批量大小 B、序列长度 T 和词汇表大小 M=|V|M=|\mathcal{V}| 的 O(BTM)O(BTM) 内存。
Top-k OPD。
Top-k OPD通过将散度计算限制在子集 St⊆VS_{t}\subseteq\mathcal{V} 上,提供了采样token和全词汇OPD之间的中间设计。这里我们关注学生top-k变体,它选择学生赋予最高概率的 k 个 token,即 St=TopK(pt,k)S_{t}=\operatorname{TopK}(p_{t},k)。定义在 StS_{t} 上重新归一化的学生和教师分布为:
p ̄t(St)(v)=pt(v)1[v∈St]∑u∈Stpt(u),q ̄t(St)(v)=qt(v)1[v∈St]∑u∈Stqt(u)。\bar{p}_{t}^{(S_{t})}(v)=\frac{p_{t}(v)\,\mathbf{1}[v\in S_{t}]}{\sum_{u\in S_{t}}p_{t}(u)},\qquad\bar{q}_{t}^{(S_{t})}(v)=\frac{q_{t}(v)\,\mathbf{1}[v\in S_{t}]}{\sum_{u\in S_{t}}q_{t}(u)}。然后通过最小化子集KL散度 DKL(p ̄t(St)∥q ̄t(St))D_{\mathrm{KL}}\!\bigl(\bar
相似文章
MOPD:面向大语言模型后训练中能力整合的多教师在线策略蒸馏
MOPD提出了一种用于大语言模型后训练的多教师在线策略蒸馏范式,通过将特定领域的RL教师模型蒸馏到学生模型(使用其自身的采样数据),实现了多领域能力的高效整合。该方案优于Mix-RL和Cascade RL等现有方法,并已在工业级模型中部署。
@VukRosic99: 当小模型从大模型学习时,一半的教训被浪费了 设置:一个小的“学生”模型写出答案…
该论文识别了语言模型在策略蒸馏中的位置偏差,即学生模型生成的答案中后面的token接收到的监督质量下降。所提出的重要性加权在策略蒸馏(IW-OPD)根据累积漂移对修正进行加权,提高了学习速度和最终性能。
多教师同策略蒸馏中的行为杠杆失衡
本文识别了在代理语言模型的多教师同策略蒸馏中,学生模型过度依赖工具调用这一失败模式,并提出Soft Clamp方法,一种逐token散度校准方法,可在不牺牲准确率的前提下减少过度调用。
硬币的两面:论大语言模型在策略内蒸馏中泛化的双重性
本文研究了大语言模型在策略内蒸馏中的泛化行为,表明它转移了推理行为,并且教师-学生来源对齐至关重要,多教师组合会导致能力权衡。
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。