教师令牌何时可靠?基于位置加权的在线策略自蒸馏方法在推理中的应用
摘要
本文发现,推理蒸馏中教师令牌的可靠性具有轨迹结构特性,并提出了基于位置加权的在线策略自蒸馏方法(PW-OPSD),该方法通过应用递增的位置权重,在不增加教师计算量的情况下提升了性能。
arXiv:2605.21606v1 公告类型:新
摘要:在线策略自蒸馏(OPSD)通过使用特权教师,在学生自身生成的数据上进行训练,但其标准目标对所有生成的令牌赋予相同的权重,隐含地将特权教师目标视为在学生访问到的每个前缀上同样可靠。现有的基于熵的OPD方法通过用教师熵调整令牌级监督来缓解这种均匀性,但推理中的高教师熵具有模糊的可靠性含义:它既可以反映不可行的不确定性,也可以反映良性的解多样性。为了识别这一现象,我们引入了一个分支可行性诊断方法。具体来说,我们记录来自特权答案教师提示的下一个令牌替代项,在学生提示加上其在线策略主干前缀之后强制每个替代项,并测试由此产生的学生模板延续是否恢复正确答案。在Qwen3-4B上,我们发现定向的序列内位置得分是教师令牌可靠性的最强预测指标,ROC曲线下面积(AUROC)达到0.83;局部不确定性得分最多为0.57。受这种轨迹级结构的启发,我们提出了基于位置加权的在线策略自蒸馏(PW-OPSD),该方法应用递增的位置权重,同时保持与OPSD相同的学生生成数据、特权教师传递和裁剪的前向KL目标。在我们使用不同随机种子进行的综合评估中,基于诊断的PW-OPSD在AIME 2024和AIME 2025的Avg@12上分别提升了+1.0和+1.1个百分点,并且在来自不同家族的两个更大规模模型——DeepSeek-R1-Distill-Llama-8B和Olmo-3-7B-Think上的泛化评估也显示出一致的Avg@12整体提升。这些结果表明,推理蒸馏中教师令牌的可靠性具有轨迹结构特性,可以在不增加教师计算量的情况下加以利用。
查看缓存全文
缓存时间: 2026/05/22 08:50
# 教师 Token 何时可靠?面向推理的位置加权在线策略自蒸馏 来源:https://arxiv.org/html/2605.21606 Xiaogeng Liu¹ Xinyan Wang² Yingzi Ma² Yechao Zhang³ Chaowei Xiao¹ ¹约翰霍普金斯大学 ²威斯康星大学麦迪逊分校 ³南洋理工大学 ###### 摘要 在线策略自蒸馏(OPSD)利用特权教师模型对学生自身生成序列进行训练,但其标准目标函数对所有生成的 token 赋予相同权重,隐含地将特权教师目标视为在每个学生访问过的前缀上都同样可靠。现有的基于熵的 OPD 方法通过根据教师熵调节 token 级别监督来缓解这种均匀性,但推理场景下教师的高熵具有模糊的可靠性含义:它既可以反映不可行的不确定性,也可以反映良性的解多样性。为了识别这一现象,我们引入了一个分支可行性诊断方法。具体来说,我们记录来自特权答案教师提示的下一个 token 备选项,在学生提示及其在线策略主干前缀之后强制使用每个备选项,并测试由此产生的学生模板续写是否恢复了正确答案。在 Qwen3-4B 上,我们发现一个有方向的序列内位置分数是教师 token 可靠性的最强预测因子,ROC 曲线下面积(AUROC)达到 0.83,95% 聚类 Bootstrap 区间为 [0.66, 0.95];局部不确定性得分最高仅为 0.57。受这种轨迹层面结构的启发,我们提出了位置加权在线策略自蒸馏(PW-OPSD),它在保持与 OPSD 相同的学生 rollout、特权教师传递和截断的前向 KL 目标的同时,应用了一个递增的位置权重。在我们使用不同随机种子进行的综合评估中,基于诊断的 PW-OPSD 将 AIME 2024 和 AIME 2025 的 Avg@12 分别提升了 +1.0 和 +1.1 个点。在两个来自不同家族的更大规模模型(DeepSeek-R1-Distill-Llama-8B 和 Olmo-3-7B-Think)上的泛化评估也显示出了一致的 Avg@12 整体改进。这些结果表明,推理蒸馏中教师 token 的可靠性具有轨迹结构化的特征,并且可以在不增加教师计算量的情况下加以利用。代码已开源:https://github.com/SaFo-Lab/PW-OPSD ## 1 引言 在线策略自蒸馏(OPSD)(Zhao 等人,2026 (https://arxiv.org/html/2605.21606#bib.bib1))是一种实用的数学推理蒸馏方法,因为它监督的是学生实际访问的前缀。学生从普通问题提示中采样一个 rollout,而模型的一个特权副本(以参考答案信息为条件)沿着同一条 rollout 提供 token 级别的目标。这种构造避免了教师生成演示中的轨迹不匹配问题,同时仍在训练时注入了特权信息。然而,标准的 OPSD 目标函数隐含了一个可靠性假设:每个生成的 token 都接受相同的前向 KL 监督(Zhao 等人,2026 (https://arxiv.org/html/2605.21606#bib.bib1))。这种均匀的目标函数将特权教师目标视为在每个学生访问过的前缀上都同样有用。 近期的自适应、松弛或门控蒸馏目标函数从互补的角度挑战了这一均匀性假设:EOPD 在高教师熵的 token 上增强了反向 KL OPD 的前向 KL 项(Jin 等人,2026 (https://arxiv.org/html/2605.21606#bib.bib3));ToDi 使用教师-学生概率对数比值在每个 token 上混合前向和反向 KL(Jung 等人,2025 (https://arxiv.org/html/2605.21606#bib.bib4));REOPOLD 将教师-学生对数似然比视为 token 奖励,并采用奖励裁剪和基于熵的采样(Ko 等人,2026 (https://arxiv.org/html/2605.21606#bib.bib9));GATES 则通过导师共识来门控特权自蒸馏(Stein 等人,2026 (https://arxiv.org/html/2605.21606#bib.bib5))。这些工作共同推动了通过局部熵、教师-学生不匹配、裁剪 token 奖励或共识信号来实现非均匀的 token 级别监督。  图 1:分支可行性揭示了 Qwen3-4B 推理轨迹中的位置可靠性结构。备选项由同一模型在特权答案教师提示下选出,并在普通学生提示下 rollout;对于高歧义性的候选位置,这些强制性的学生上下文续写在早期位置更容易失败,而在轨迹后期很少失败。(A) 按归一化位置对候选进行排序,因此可以将教师不可靠的分支点与可行的多样性区分开,而局部不确定性(熵)得分则产生近乎平坦的失败曲线。(B) 由此产生的经验可靠性曲线为 PW-OPSD 的权重调度提供了动机:早期的权重较低(高歧义性),后期则保持全强度监督。诊断实验的细节见第 3.2 节 (https://arxiv.org/html/2605.21606#S3.SS2)。 然而,所有这些自适应标准都有一个共同的局限性:它们通过熵、教师-学生不匹配或导师共识来度量教师局部分布的歧义性,但 token 局部的歧义性**并不等同于**教师可靠性低,将两者混为一谈会导致 token 重新加权的理由出错。我们的出发点在于这些局部信号本身的可靠性含义。基于熵的标准是检测不确定性的自然方式,但高教师熵并不等同于低教师可靠性。一个高熵的教师分布可能反映的是**不可行的不确定性**:几个局部合理的下一个 token 备选项获得了概率质量,但在学生上下文的持续生成下,其中一些备选项无法恢复到正确答案。然而,它也可能反映**良性的多样性**:教师将质量分配给多个可行的解题路径或表层实现,而这些路径仍能保持正确性。因此,一个 token 局部的不确定性得分可以识别歧义性,但它无法区分不可行的不确定性与可行的解多样性。实践中的代价是:任何仅基于局部歧义性的重新加权,要么会放大教师在那些导致脱轨的分支点上的监督,要么会削弱教师在那些仍能保持正确性的良性分支点上的监督。 因此,用于自适应 token 加权的正确目标不应是教师熵,而是教师的**可靠性**:一个依上下文而定的概率,表示在该上下文中教师局部目标对学生而言是有用的监督。我们将这种可靠性形式化为一个潜在指示变量 \(I_t\),表示在蒸馏上下文 \(c_t\) 下匹配教师目标是否有助于保持或恢复正确的解。可靠性加权替代项随后通过 \(\rho^*(c_t) = \Pr(I_t=1 \mid c_t)\) 对前向 KL 项进行加权。为了将这个潜在量与可观察行为联系起来,我们引入了一个**分支可行性诊断**。在整个过程中,“教师”和“学生”指的是应用于同一模型的两个提示模板:教师模板包含特权真实答案;学生模板是普通的问题提示。从一条能得出正确答案的学生模板 rollout 开始,我们使用教师模板提出高歧义性的下一个 token 备选项,在学生模板提示加上主干前缀之后强制使用每个备选项,然后继续按学生模板(无特权信息)生成。我们使用学生模板续写,是因为教师模板续写可以重新利用特权答案,几乎能从任何强制分支中恢复,从而导致标签坍缩。如果强制使用的备选项通常无法恢复正确答案,则该候选位置被标记为**真实不确定**:在这个前缀上,教师的局部备选项对学生分布来说是不可靠的监督。如果备选项仍然可行,则该歧义性被视为良性多样性,而非低教师可靠性的证据。 在 Qwen3-4B (Yang 等人,2025 (https://arxiv.org/html/2605.21606#bib.bib19)) 上,这个诊断展示了一个明确的位置模式,如图 1 (https://arxiv.org/html/2605.21606#S1.F1) 所示。在正确主干子集中,真实不确定的候选集中在归一化轨迹的早期,而多样性候选在后期更常见。在问题内残差化后,一个有方向的位置分数将真实不确定候选与多样性候选分开,AUROC 达到 0.83,95% 聚类 Bootstrap 区间为 [0.66, 0.95];所测试的局部不确定性诊断的残差 AUROC 最高仅为 0.57。因此,该诊断提供了可靠性先验的方向:早期的高歧义性分支点正是特权教师的局部备选项最常变得不可靠的地方,而后期位置在强制续写下更为可靠。 受此发现启发,我们提出了位置加权在线策略自蒸馏(PW-OPSD),它将这一可靠性趋势实现为对 \(\rho^*(c_t)\) 的一种即插即用近似。它保持与 OPSD 相同的学生 rollout、特权教师传递和逐词表的截断前向 KL 替代项,但使用一个对归一化序列内位置递增的 sigmoid 函数来聚合 token 损失。底部阈值使早期 token 仍能得到部分监督,而递增的调度将更强的权重分配给诊断表明教师可靠性更高的后期位置。因此,该方法仅改变了外部可靠性加权聚合,不增加额外的教师传递或辅助验证器。 我们在 Qwen3-4B 数学推理基准上评估了 PW-OPSD,使用与 OPSD 参考评估 (Zhao 等人,2026 (https://arxiv.org/html/2605.21606#bib.bib1)) 相同的最大生成长度 38,912 tokens。诊断导出的调度在 MATH-500 Avg@12 上与 OPSD 持平(95.34 vs. 95.33),在 AIME 2024 上 Avg@12 提升了 +1.0 个点,在 AIME 2025 上提升了 +1.1 个点,且教师成本相同。位置调度扫描进一步展示了可靠性曲线强度如何影响更难的场景:攻击性调度在 HMMT 2025 上将 Avg@12 较 OPSD 提升了 +1.48 个点,将 Maj@12 提升了 +1.11 个点。这些结果支持位置作为结构性的可靠性先验,并表明推理蒸馏受益于沿着轨迹建模教师可靠性。 ## 2 相关工作 #### 在线策略蒸馏。 知识蒸馏训练学生模型匹配软教师概率,而非仅仅硬标签(Hinton 等人,2015 (https://arxiv.org/html/2605.21606#bib.bib42))。序列级蒸馏将这一思想从 token 标签扩展到生成的完整序列(Kim and Rush,2016 (https://arxiv.org/html/2605.21606#bib.bib13))。现代 LLM 后训练普及了基于指令和反馈的微调(Ouyang 等人,2022 (https://arxiv.org/html/2605.21606#bib.bib26));在蒸馏领域,最近的 LLM 方法通常将监督移至策略上,即学生是在其实际访问的前缀上训练(Agarwal 等人,2023 (https://arxiv.org/html/2605.21606#bib.bib6); Gu 等人,2023 (https://arxiv.org/html/2605.21606#bib.bib7); Ko 等人,2024 (https://arxiv.org/html/2605.21606#bib.bib8); Zhao 等人,2026 (https://arxiv.org/html/2605.21606#bib.bib1))。这遵循交互式模仿学习的直觉:在学习者访问的状态上查询专家反馈(Ross 等人,2010 (https://arxiv.org/html/2605.21606#bib.bib27));LLM 模仿学习的实证工作也报告了多步生成场景下离线策略模仿的退化现象(Gudibande 等人,2023 (https://arxiv.org/html/2605.21606#bib.bib15))。GKD 形式化了广义的在线策略知识蒸馏(Agarwal 等人,2023 (https://arxiv.org/html/2605.21606#bib.bib6)),MiniLLM 通过策略梯度公式优化学生/教师混合在线策略样本的序列级反向 KL 蒸馏(Gu 等人,2023 (https://arxiv.org/html/2605.21606#bib.bib7)),DistiLLM 则研究学生生成输出上的偏斜 KL 目标用于白盒 OPD(Ko 等人,2024 (https://arxiv.org/html/2605.21606#bib.bib8))。有关 OPD 的更广泛综述可参见 Song and Zheng (2026 (https://arxiv.org/html/2605.21606#bib.bib2))。OPSD 是本文的主要基线:它使用包含参考信息的特权教师提示,在 student rollout 上提供 token 级别的目标(Zhao 等人,2026 (https://arxiv.org/html/2605.21606#bib.bib1))。PW-OPSD 保留了 OPSD 的特权在线策略构造,并将外部可靠性权重改为轨迹结构化的而非均匀的。 #### 散度选择与自适应 Token 加权。 一些蒸馏方法改变了师生之间的散度或 token 级别控制器。MiniLLM 用序列级反向 KL 替换标准的正向 KL KD,并通过策略梯度回报优化由此产生的在线策略目标(Gu 等人,2023 (https://arxiv.org/html/2605.21606#bib.bib7));DistiLLM 使用偏斜 KL 目标来稳定学生生成输出上的白盒 OPD(Ko 等人,2024 (https://arxiv.org/html/2605.21606#bib.bib8))。更广泛的 \(f\)-散度工作研究了散度选择如何改变序列级 KD 行为(Wen 等人,2023 (https://arxiv.org/html/2605.21606#bib.bib25))。AKL 重新审视了 LLM 蒸馏中通常的模态寻找/模态覆盖框架,认为前向和反向 KL 共享相同的渐近目标,但 FKL 强调头部概率而 RKL 在早期 epoch 强调尾部概率,随后提出一种自适应 KL 混合(Wu 等人,2024 (https://arxiv.org/html/2605.21606#bib.bib10))。最近的自适应或特权蒸馏方法也离开了均匀的 token 级别监督,但原因不同且控制信号不同。EOPD 在高教师熵 token 上应用前向 KL,同时在 OPD 的其他部分保留反向 KL(Jin 等人,2026 (https://arxiv.org/html/2605.21606#bib.bib3));REOPOLD (Ko 等人,2026 (https://arxiv.org/html/2605.21606#bib.bib9)) 将 OPD 解释为以教师-学生对数似然比为 token 奖励的策略优化,并通过奖励裁剪、基于熵的动态采样以及探索到精炼的训练来放松严格模仿。在此学生 rollout OPD 散度切换路线之外,ToDi 使用教师-学生概率对数比自适应地按 token 组合前向和反向 KL(Jung 等人,2025 (https://arxiv.org/html/2605.21606#bib.bib4));GATES 则通过导师迹之间的共识来门控特权自蒸馏(Stein 等人,2026 (https://arxiv.org/html/2605.21606#bib.bib5))。这些方法表明,蒸馏监督可以通过熵、教师-学生比值、裁剪奖励或共识信号进行每 token 调制。然而,这些局部控制信号并不能直接区分不可行的不确定性与良性的解多样性。为了探索这一挑战,我们提出了一项分支可行性实验:同一模型在特权答案教师提示下选择强制备选项,然后在普通学生提示下 rollout,以测试能否恢复正确答案。我们将分支可行性与标准不确定性诊断进行比较,包括预测熵、MC-Dropout 互信息以及狄利克雷或证据不确定性 (Kendall and Gal, 2017 (https://arxiv.org/html/2605.21606#bib.bib22); Gal and Ghahramani, 2015 (https://arxiv.org/html/2605.21606#bib.bib11); Malinin and Gales, 2018 (https://arxiv.org/html/2605.21606#bib.bib23); Sensoy 等人,2018 (https://arxiv.org/html/2605.21606#bib.bib24))。这些基线
相似文章
通过混合策略蒸馏进行推理压缩
本文提出了混合策略蒸馏(MPD),这是一个将大教师模型的简洁推理行为转移到更小规模的学生模型的框架,在提升性能的同时,将令牌(token)使用量最多降低了27.1%。
OPRD:在策略表示蒸馏
OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。
在策略自蒸馏中尊重自不确定性以实现高效LLM推理
本文提出了EGRSD和CL-EGRSD,这是在策略自蒸馏方法,通过教师熵对令牌级监督进行加权,以改善大语言模型推理准确性-长度的权衡,并在Qwen3-4B和Qwen3-8B上进行了评估。
通过近未来引导弥合在线蒸馏中的推理轨迹
本文指出了在线蒸馏大语言模型时token级监督的局限性,并提出TOPD方法,利用近未来轨迹信息更好地识别发散推理状态并将引导分布到多个token上,在AIME基准测试中取得了性能提升。
信任区域策略蒸馏
信任区域策略蒸馏(TOP-D)通过动态构建近端教师来稳定在线策略蒸馏,提供理论收敛保证,并在数学推理任务中实现零额外开销的实证收益。