在蒸馏前验证:用于在线策略蒸馏的提示级教师门控
摘要
本文介绍了教师门控在线策略蒸馏(TGOPD),一种在提示级别验证教师可靠性的方法,以改善在线策略蒸馏,从而在异步设置中实现更好的性能和更高的GPU利用率。
arXiv:2609.02998v1 公告类型:新
摘要:在线策略蒸馏(OPD)通过提供冻结教师在学生自身rollouts上的密集token级监督来加速后训练。原始的OPD在所有提示上均匀应用这种监督,而不检查教师对每个提示的可靠性。由于反向KL是模态寻求的,一个自信错误的教师可以诱导出强大但误导性的更新。分布代理,如熵或教师-学生似然一致性,测量不确定性或一致性,但不直接验证结果正确性。我们引入教师门控在线策略蒸馏(TGOPD),基于一个原则:在密集监督被允许之前,应在提示级别验证教师可靠性。TGOPD从一组由验证器评分的教师探测中估计可靠性,并在可靠性检查通过时将每个提示专用于密集OPD,否则使用基于验证器的GRPO。在数学、代码和指令跟随的4B和35B学生模型中,TGOPD在所有六个单领域设置中优于原始OPD,并在多领域训练下在两个规模上都实现了更高的七项基准平均分数。通过利用原本空闲的教师容量进行可靠性估计,TGOPD还减少了异步OPD中教师端的计算浪费,在测量的4B单领域运行中将教师节点GPU利用率从9.8%提高到78.9%。
查看缓存全文
缓存时间: 2026/09/04 06:19
# 面向指令级教师门控的在策略蒸馏
来源:https://arxiv.org/html/2609.02998
## 蒸馏前请验证:面向在策略蒸馏的指令级教师门控
\\setcitestyle numbers,square,comma,sortcompress
\\fancyhead
\\outfit蒸馏前请验证:面向在策略蒸馏的指令级教师门控
AllSpark团队
在策略蒸馏(OPD)通过冻结的教师模型对学生自身的生成轨迹提供密集的令牌级监督,从而加速后训练。朴素的OPD在所有指令上统一应用这种监督,未检查教师模型对每个指令是否可靠。由于反向KL散度具有模式寻求特性,置信度高的错误教师可能诱导强烈但误导性的更新。分布代理度量(如熵或教师-学生似然一致性)虽然能衡量不确定性或一致性,但无法直接验证结果正确性。我们提出教师门控在策略蒸馏(TGOPD),其核心原则是:在引入密集监督前,应在指令级别验证教师可靠性。TGOPD基于少量验证器评分的教师探测样本估计可靠性,并仅在可靠性检查通过时将每个指令路由至密集OPD,否则路由至基于验证器的GRPO。在数学、代码和指令跟随任务中,针对4B和35B学生模型,TGOPD在所有六个单领域设置中均优于朴素OPD,并在多领域训练中在两个规模上实现更高的七项基准平均性能。通过利用原本闲置的教师容量进行可靠性估计,TGOPD还减少了异步OPD中教师端的计算浪费,使教师节点GPU利用率在测量的4B单领域运行中从9.8%提升至78.9%。
\\outfit日期:2026年8月28日
状态:公开技术报告
## 1 引言
图1:异步OPD中教师端GPU利用率不足问题。(a)在朴素OPD下,教师节点利用率在测量时段内有59%时间低于5%;TGOPD利用这些闲置容量进行可靠性探测。(b)平均教师节点利用率从9.8%提升至78.9%。
在策略蒸馏(OPD)是一种计算高效的后训练语言模型方法\\citepagarwal2024gkd,gu2024minillm,thinkingmachines2025opd。基于可验证奖励的强化学习(RLVR)为整个轨迹分配单一标量奖励。相比之下,OPD从学生模型采样轨迹,并利用更强的教师模型在每个令牌处提供反向KL学习信号,将稀疏的结果监督转化为密集的逐令牌指导。这种密集反馈可以使学生模型达到教师级别准确性的速度比RLVR快约一个数量级\\citepthinkingmachines2025opd。尽管训练效率高,异步OPD仍使教师的大量计算处于闲置状态。在典型的异步部署中,学生模型在专用推理节点上生成轨迹,而更强的、领域专用的冻结教师模型在独立节点上对完成的轨迹进行评分。评分过程仅需对已生成的令牌进行一次前向评估,因此比自回归解码便宜得多,并且必须等待一批学生轨迹准备就绪才能开始,这导致教师的加速器在批次评分间处于闲置状态。图1(https://arxiv.org/html/2609.02998#S1.F1)量化了这一低效问题:在一次4B运行中,教师节点平均GPU利用率为9.8%,且在测量时段内有59%时间利用率低于5%,而轨迹生成和训练节点则保持繁忙。这一观察促使我们利用原本闲置的教师容量来改进训练信号本身。
图2:教师置信度并不总能反映指令级可靠性。该诊断使用每个领域2,400个指令的十个离线教师响应;$q_T^{(10)}$是其验证器通过率,与训练中使用的$K_T=3$在线估计器不同。(a,b)教师自置信度在较高($q_T^{(10)}\geq 0.7$)和较低($q_T^{(10)}< 0.7$)可靠性下的表现。置信度在代码任务上以AUROC 0.51、在数学任务上以0.73区分两组。(c)在低可靠性区间($q_T^{(10)}<0.5$),教师最高置信度的采样响应在代码任务上84%错误、在数学任务上61%错误。
闲置容量可用于解决朴素OPD的一个更根本缺陷:教师监督在未进行指令级可靠性检查的情况下就被引入。反向KL散度具有模式寻求特性,将学生模型集中在教师的高概率行为上\\citepgu2024minillm,thinkingmachines2025opd。这一特性使OPD在教师可靠时高效,但也能放大置信错误。可靠性因指令而异:全局信息量大的教师信号可能无法局部利用\\citeprethinkingopd2026,更强的教师可能对较小学生模型产生负迁移\\citepsmallmodels2025。仅靠领域路由无法解决此问题,因为现有多教师框架在未验证所选教师对特定指令的可靠性时就使用其密集奖励\\citepmimo2026v2flash。可靠性感知OPD已沿两个互补方向发展。第一种使用分布证据。EOPD在高熵教师令牌处引入前向KL\\citepeopd2026。TrOPD基于教师-学生解码一致性定义令牌级信任域\\citeptropd2026。REOPOLD使用似然比和学生熵裁剪并采样令牌奖励\\citepreopold2026。这些信号捕捉了不确定性、兼容性或优化风险,但不直接测试教师答案是否正确。结果证据也用于调控更局部的决策。RG-OPD在验证器反馈与教师-学生似然差一致时保留轨迹级蒸馏\\citeprgopd2026。RLSD使用环境正确性确定更新方向,同时自蒸馏调节其幅度\\citeprlsd2026。在令牌级,SPOT通过验证器评分的学生延续评估教师提议的分支\\citepspot2026。这些方法共同展示了结果反馈如何控制单个轨迹或令牌分支。TGOPD则使用重复的教师结果,在引入密集监督前做出指令级准入决策。
图2(https://arxiv.org/html/2609.02998#S1.F2)说明了此指令级决策的动机。诊断中,我们对每个指令绘制十个离线教师响应,并定义$q_T^{(10)}(x)$为其验证器通过率。更大的样本量比训练中使用的三个新鲜在线探测提供更细粒度的分析;两者衡量相同的验证器定义教师可靠性。在代码任务上,自置信度对高、低可靠性指令的区分能力很弱(AUROC 0.51),而数学任务为0.73。在低可靠性区间内,教师最高置信度的采样响应在代码任务上仍有84%错误、数学任务61%错误。由于反向KL强调高概率教师行为,这正是朴素OPD可能传播的错误类型。教师门控在策略蒸馏(TGOPD)利用教师闲置容量在选择监督信号前估计指令级可靠性。如图3(https://arxiv.org/html/2609.02998#S2.F3)所示,教师为同一指令生成$K_T$个探测轨迹;验证器对其评分;其通过率$q_T(x)=K_T^{-1}\sum_k r_k$提供在线可靠性估计。若$q_T(x)\geq \tau$,TGOPD仅使用密集OPD;否则,它拒绝教师信号并仅使用基于验证器的GRPO(前提是学生轨迹组包含奖励差异)。两个分支是路由而非混合。由于探测主要在教师本应闲置时运行,教师节点GPU利用率从9.8%升至78.9%,集群利用率从51.5%升至69.5%,且测量到的端到端开销适中。在数学、代码和指令跟随任务中,针对4B和35B学生模型,TGOPD在所有六个领域-规模设置中均优于朴素OPD。最大增益出现在代码任务上,此处置信度对教师可靠性的信息量最低。这些结果支持了设计选择:在指令级验证教师,当可靠性检查通过时保留其密集信号,检查失败时撤回该信号。
## 2 预备知识
#### 设置与记号。
令$\pi_{\theta}$表示学生策略,$\pi_T$为冻结教师;在多教师设置中,$\pi_T=\pi_{T,\operatorname{dom}(x)}$是路由到指令$x$领域的教师。对每个指令$x\sim\mathcal{D}$,学生采样一组$G$个在策略轨迹$\{y^{i}\}_{i=1}^{G}\sim\pi_{\theta}(\cdot\mid x)$,二元验证器$r(x,y)\in\{0,1\}$根据真实结果对每个轨迹评分:代码使用单元测试,数学和指令跟随使用基于规则的评判。我们用$y^i_t$表示轨迹$i$的第$t$个令牌,$\operatorname{sg}[\cdot]$表示停止梯度算子。
#### 在策略蒸馏(OPD)。
OPD通过最小化模式寻求的反向KL $\mathbb{KL}(\pi_{\theta}\,\|\,\pi_{T})$监督学生自身轨迹的每个令牌。该目标基于每个位置的单个采样令牌估计,采用策略梯度更新形式,其每令牌优势为教师-学生对数似然比\\citepgu2024minillm,thinkingmachines2025opd,mimo2026v2flash:
\[
\hat{A}^{\mathrm{OPD}}_{i,t}=\beta\,\operatorname{sg}\left[\log\pi_T(y^i_t\mid x,y^i_{<t}) - \log\pi_{\theta}(y^i_t\mid x,y^i_{<t})\right],\tag{1}
\]
其中$\beta>0$设定教师信号尺度。因此,每个令牌都获得自己密集、单独加权的学习信号,这有助于OPD相对于从单个轨迹级奖励学习的样本效率。作为模式寻求目标,它将学生集中在教师的最高概率行为上,而非将概率质量分散到替代选项上。注意方程[1](https://arxiv.org/html/2609.02998#S2.E1)仅依赖于$\pi_T$和$\pi_{\theta}$,而不依赖于验证器$r$:它衡量学生与教师的偏离程度,但不直接评估教师输出是否正确。因此,当$\pi_T$在$x$上不可靠时,由此产生的密集梯度可能具有误导性。
#### 带可验证奖励的GRPO。
当教师监督不可用或被保留时,学生可转而仅从验证器学习。GRPO\\citepdeepseekmath2024将组内奖励中心化;我们省略标准差归一化\\citepliu2025drgrpo:
\[
\hat{A}^{\mathrm{GRPO}}_{i}=r\!\left(x,y^{i}\right)-\frac{1}{G}\sum_{j=1}^{G}r\!\left(x,y^{j}\right),\qquad \hat{A}^{\mathrm{GRPO}}_{i,t}=\hat{A}^{\mathrm{GRPO}}_{i}\quad\forall\,t.\tag{2}
\]
与方程1中令牌特定的OPD优势不同,此信号为轨迹中每个令牌分配相同的标量优势。因此,它是轨迹级而非令牌特定的,但仍是基于验证器的:其符号由验证器结果相对于组均值决定。
#### 缺口。
朴素OPD在未直接验证教师可靠性的情况下提供密集令牌级监督,而GRPO提供基于验证器但粗糙的轨迹级监督。朴素OPD和纯GRPO训练在所有指令上应用固定监督规则,即使教师可靠性——从而可取的学习信号——可能因指令而异。下文描述的TGOPD通过将相同验证器应用于教师探测以及学生轨迹,为每个指令做出此选择。它将每个指令路由至恰好一个信号;OPD和GRPO在同一指令上从不混合。
图3:TGOPD概览。(A)朴素OPD:学生生成$G$个在策略轨迹,冻结教师评分每个令牌。由此产生的教师-学生对数概率差提供密集令牌级监督(方程1)用于每个指令。(B)TGOPD:学生解码时,教师利用其原本闲置的容量生成少量探测轨迹。验证器对这些探测评分,其通过率$q_T(x)$(方程4)估计指令级教师可靠性。教师评分和常规的学生轨迹验证器评估使两种候选优势可用;后者为视觉清晰在图中省略。当$q_T(x)\geq\tau$时,门控选择密集OPD;否则选择基于验证器的GRPO(方程2)。两个监督分支互斥。TGOPD将教师可靠性表示为每指令量,并用其选择两种监督模式之一。验证器审计教师对当前指令的表现。审计成功选择密集OPD;否则,教师监督被保留,更新使用基于验证器的GRPO。两个信号从不相加或插值。图3(https://arxiv.org/html/2609.02998#S2.F3)将此过程与朴素OPD对比。图A中,教师对数概率进入每次更新。图B中,它们仅在审计通过后进入;审计失败时使用基于验证器的信号。§3.1定义可靠性估计及其驱动的门控,§3.2给出门控诱导的目标,§3.3展示审计如何与异步训练循环中原本闲置的教师窗口重叠。
### 3.1 教师可靠性探测与门控
门控需要对每个指令的教师可靠性估计,而朴素OPD循环不提供此估计。我们在下文定义此量,并用少量教师样本进行估计。
#### 可靠性及其估计器。
我们定义教师在指令上的可靠性为其期望验证器奖励:
\[
R_T(x)\;=\;\mathbb{E}_{y\sim\pi_T(\cdot\mid x)}\!\big[r(x,y)\big]\;\in\;[0,1],\tag{3}
\]
即教师样本解决$x$的概率。由于$R_T$无封闭形式,我们使用少量教师探测进行估计:教师在同一指令上独立生成$K_T$个轨迹$\{\hat{y}^{k}\}_{k=1}^{K_T}\sim\pi_T(\cdot\mid x)$。用于学生轨迹的验证器对每个教师轨迹评分,其经验通过率为(图3B)
\[
q_T(x)\;=\;\frac{1}{K_T}\sum_{k=1}^{K_T}r\!\left(x,\hat{y}^{k}\right).\tag{4}
\]
因为探测是来自$\pi_T(\cdot\mid x)$的i.i.d.抽取且$r$是二元的,$K_T q_T(x)\sim\mathrm{Binomial}\!\left(K_T,R_T(x)\right)$。因此,该估计器是无偏的,$\mathbb{E}\!\left[q_T(x)\right]=R_T(x)$,对任意探测预算成立,方差为$R_T(x)\big(1-R_T(x)\big)/K_T$。相似文章
SG-OPD:通过符号一致性门控和分阶段教师采样的符号门控在线策略蒸馏
符号门控在线策略蒸馏(SG-OPD)通过使用二元验证器作为教师监督的信任信号,增强了标准在线策略蒸馏,在竞赛级数学推理基准上提升了性能。
当教师误导:虚假信号感知的在线策略蒸馏
本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。
信任区域策略蒸馏
信任区域策略蒸馏(TOP-D)通过动态构建近端教师来稳定在线策略蒸馏,提供理论收敛保证,并在数学推理任务中实现零额外开销的实证收益。
你的老师在这里帮不了你:对抗在线策略蒸馏中的监督保真度衰减
识别了在线策略蒸馏中的监督保真度衰减(SFD),即随着学生序列变长,教师监督质量下降,并提出了前瞻组奖励(LGR)以缓解SFD,从而提升数学和代码基准测试的性能。
策略内蒸馏真的在蒸馏吗?从嘈杂教师到自我改进
本文分析了策略内蒸馏,揭示其主要通过抑制低概率token而非依赖教师指导来实现改进,并提出了无需监督的OPSA方法,显著提升了推理性能。