你的老师在这里帮不了你:对抗在线策略蒸馏中的监督保真度衰减
摘要
识别了在线策略蒸馏中的监督保真度衰减(SFD),即随着学生序列变长,教师监督质量下降,并提出了前瞻组奖励(LGR)以缓解SFD,从而提升数学和代码基准测试的性能。
arXiv:2605.30833v1 公告类型:新
摘要:在线策略蒸馏通过使用教师提供的逐token反馈,在学生模型自身生成的轨迹上训练学生模型,从而迁移推理能力。然而,我们发现了一个关键瓶颈——\textbf{监督保真度衰减(SFD)}:随着学生生成的前缀变长,教师的下一token分布变得不那么自信且判别能力下降。因此,反向KL蒸馏中依赖教师的修正信号减弱,导致学生在长推理链上的漂移累积。为了缓解SFD,我们引入了\textbf{前瞻组奖励(\ours{})}。基于以下洞察:下一步教师的置信度反映了未来反向KL监督的判别能力,\ours{} 通过学生在后续步骤所引发的教师置信度来评估其前K个候选token,并分配一个组归一化奖励。为了保持计算效率,我们进一步设计了一种熵触发树注意力机制。在六个数学和代码基准测试中,对于7B学生模型,\ours{} 在mean@8上比OPD提高了\textbf{2.57}个点,在更长的生成中增益增加,在AIME-26上达到39k tokens时提升了+\textbf{4.92}个点。
查看缓存全文
缓存时间: 2026/06/01 09:29
# 你的老师帮不了你:对抗在线策略蒸馏中的监督保真度衰减 来源:https://arxiv.org/html/2605.30833 Yanjiang Liu¹ ², Jie Lou³, Xinyan Guan¹ ², Yuqiu Ji³, Hongyu Lin², Ben He¹ ², Xianpei Han², Le Sun², Xing Yu³, Yaojie Lu² ¹中国科学院大学 ²中国科学院软件研究所中文信息处理实验室 ³小红书 ###### 摘要 在线策略蒸馏通过学生模型自行生成轨迹,并利用教师的词元级反馈进行训练,从而迁移推理能力。然而,我们发现了一个关键瓶颈:**监督保真度衰减**(SFD)。随着学生生成的前缀长度增加,教师的下一词元分布变得愈发不自信且缺乏区分性。因此,反向KL蒸馏中依赖教师提供的纠正信号被削弱,导致学生在长推理链上的漂移不断累积。为缓解SFD,我们提出**前瞻组奖励**(LGR)。基于“下一步教师置信度反映了未来反向KL监督的区分强度”这一见解,LGR通过学生在后续步骤上引发的教师置信度来评估其Top-K候选词元,并分配组归一化奖励。为保持计算效率,我们进一步设计了熵触发的树注意力机制。在六个数学与代码基准上,对于7B学生模型,LGR在mean@8指标上比OPD提升了2.57个百分点,在更长生成任务中增益更大,在AIME-26上(39k词元)提升达4.92个百分点。 ††通讯邮箱:[email protected], {luyaojie,hongyu,xianpei,sunle}@iscas.ac.cn ††代码地址:https://github.com/zui-jiang/LGR ## 1 引言 具备推理能力的大型语言模型(LLMs)在复杂的数学和编程任务上取得了显著性能。近期先进模型[27](https://arxiv.org/html/2605.30833#bib.bib2), [11](https://arxiv.org/html/2605.30833#bib.bib1), [7](https://arxiv.org/html/2605.30833#bib.bib3) 表明,扩展推理链能够解锁先前被认为需要更大模型才能具备的能力。在线策略蒸馏(OPD)——学生模型自行生成推理轨迹,并从教师的词元级反馈中学习——已成为将这些能力迁移至高效可部署模型的主要范式[1](https://arxiv.org/html/2605.30833#bib.bib4), [26](https://arxiv.org/html/2605.30833#bib.bib10), [10](https://arxiv.org/html/2605.30833#bib.bib5), [patiño2025_unlocking_on_policy_distillation_for_any_model_family](https://arxiv.org/html/2605.30833#bib.bib11), [32](https://arxiv.org/html/2605.30833#bib.bib6), [30](https://arxiv.org/html/2605.30833#bib.bib7), [34](https://arxiv.org/html/2605.30833#bib.bib9)。然而,当前的OPD方法[1](https://arxiv.org/html/2605.30833#bib.bib4), [26](https://arxiv.org/html/2605.30833#bib.bib10), [10](https://arxiv.org/html/2605.30833#bib.bib5), [patiño2025_unlocking_on_policy_distillation_for_any_model_family](https://arxiv.org/html/2605.30833#bib.bib11), [20](https://arxiv.org/html/2605.30833#bib.bib14) 隐含地将教师视为一个**静态预言机**,其监督质量不受学生生成内容的影响。我们挑战了这一假设,并揭示了一个关键失效模式:随着学生生成序列越来越长,其输出逐渐偏离教师的训练分布,导致教师的监督质量**单调下降**,我们称之为**监督保真度衰减**(SFD)。在长的推理链中,教师的监督质量是否始终可靠?如果不可靠,我们如何主动维持它? 初步观察发现,使用不同最大生成长度训练OPD(图2)显示,性能从3k词元提升到9k词元,在16k词元左右达到平台,随后在39k词元处显著下降。这一趋势表明在极长生成过程中可能存在失效模式。为隔离原因,我们设计了一个受控前缀补全实验(图2):随着学生前缀变长,教师的下游任务准确率以及下一词元峰值概率均单调下降,而教师自身前缀上的置信度则显著更高,这表明SFD源于学生的漂移。子图进一步显示,当教师接管生成时,其置信度立即跃升,证实不同的词元选择会导致下一步教师置信度的差异。 > **图1:OPD中不同生成长度的性能。** 两个模型对上AIME24随训练词元数的变化。性能从3k提升到9k,在16k左右达到平台,在39k处下降。 > **图2:监督保真度衰减。** 主图:教师补全准确率随学生前缀长度增加而衰减。子图:在~2k(左)和~14k(右)前缀长度处,学生到教师交接点的教师置信度(最大概率/采样概率)。虚线处的置信度跃升证实了词元选择会影响下一步教师置信度。 通过理论分析,我们发现下降的max-prob直接导致了反向KL梯度的坍缩。随着教师置信度下降,其对数概率在不同词元选择间的变化减小,有效将学习信号简化为仅基于学生自身的信号,从而强化现有模式而缺乏纠正。然而,子图中的观察暗示了解决方案:即使在相同的分布外上下文中,教师在后继位置上的置信度因词元选择而异。根据相同的梯度分析,更高的后一位置信度意味着更具备区分性的未来信号:选择能最大化后一位置信度的词元,直接保留了未来的监督质量。我们将此操作化为**前瞻组奖励**(LGR),一种对学生Top-K候选词元施加组归一化的奖励。该组归一化除去了高方差的绝对置信度水平,仅保留候选间的相对排序。为保持计算效率,我们进一步设计了由熵触发的树注意力机制。我们的主要贡献如下: - **我们识别出SFD是OPD的一个根本失效模式。** 我们展示了教师准确率和峰值置信度随学生前缀长度增加而衰减,并证明了这一过程将反向KL梯度坍缩为仅基于学生输出的自我强化信号。 - **我们提出了一种原则性的补救方案——向前看一步。** 由于更高位置上的教师置信度提供了更具区分性的未来监督,LGR通过组归一化奖励与高效的熵触发树注意力机制来选择词元。 - **我们展示了LGR的增益随推理长度增长。** LGR显著优于OPD及其他替代蒸馏方法,在长推理任务上增益尤为突出。 ## 2 监督保真度沿学生轨迹衰减 ### 2.1 在线策略反向KL作为策略梯度 设 \(\pi_T\) 表示教师模型,\(\pi_\theta\) 表示参数为 \(\theta\) 的学生模型。给定提示 \(\mathbf{c}\),学生自回归生成序列 \(\mathbf{x} = (x_1, x_2, \ldots, x_L)\)。在线策略反向KL蒸馏最小化[1](https://arxiv.org/html/2605.30833#bib.bib4), [31](https://arxiv.org/html/2605.30833#bib.bib13): \[ \mathcal{L}_{\text{R-KL}}(\theta) = \mathbb{E}_{\mathbf{x} \sim \pi_\theta(\cdot|\mathbf{c})} \left[ \sum_{t=1}^L \log \pi_\theta(x_t | \mathbf{x}_{< t}) - \log \pi_T(x_t | \mathbf{x}_{< t}) \right]. \] 将这个损失函数关于 \(\log \pi_\theta(x_t | \mathbf{x}_{< t})\) 求导,我们得到在每个位置 \(t\) 的梯度: \[ \nabla_{\log \pi_\theta} \mathcal{L}_{\text{R-KL}}^{(t)} = 1 - \frac{\pi_T(x_t | \mathbf{x}_{< t})}{\pi_\theta(x_t | \mathbf{x}_{< t})} \approx 1 - \frac{\max_v \pi_T(v | \mathbf{x}_{< t})}{\pi_\theta(x_t | \mathbf{x}_{< t})} \] 其中我们使用教师最大概率作为其置信度的代理。当教师置信度较高时,梯度会强烈惩罚学生采样低概率词元的行为(因为较大的比值导致了负梯度),从而纠正学生向教师的高置信区域偏移。 **命题1(教师置信度控制梯度信号)**:设 \(\Delta_T(t) := \max_v \pi_T(v | \mathbf{x}_{< t})\),并令 \(l_t\) 为 \(t\) 位置的有效反向KL监督信号。那么: 1. 梯度范数 \(\| \nabla_{\theta} \mathcal{L}^{(t)} \| \propto |1 - \Delta_T(t) / \pi_\theta(x_t | \mathbf{x}_{< t})|\),当 \(\Delta_T(t) \to 0\) 时趋近于 \(|1 - 0| = 1\),但方向仅由学生自身概率决定(无纠正)。 2. 当 \(\Delta_T(t) > \delta_{\text{crit}}\)(某个阈值)时,梯度同时包含学生和教师信息,推动学生向教师的高置信区域靠拢。 3. 当 \(\Delta_T(t) \leq \delta_{\text{crit}}\) 时,梯度约等于 \(\nabla_{\log \pi_\theta} \approx 1 - \pi_\theta(x_t | \mathbf{x}_{< t})^{-1}\),完全由学生决定。 *证明*:根据定义,\(\Delta_T(t) \in [0,1]\)。当 \(\Delta_T(t) \to 0\) 时,比值 \(\frac{\Delta_T(t)}{\pi_\theta(x_t | \mathbf{x}_{< t})} \to 0\),梯度变为 \(1 - 0 = 1\),独立于教师。当 \(\Delta_T(t)\) 足够高时(\(\delta_{\text{crit}} \approx \pi_\theta(x_t | \mathbf{x}_{< t})\)),梯度符号取决于 \(\Delta_T(t)\) 与 \(\pi_\theta(x_t | \mathbf{x}_{< t})\) 的关系,提供有意义的纠正。阈值 \(\delta_{\text{crit}}\) 可经验设定为 \(0.15\),对应 \(\pi_\theta\) 在采样词元上的典型概率水平。 后续章节将表明,随着学生前缀增长,\(\Delta_T(t)\) 持续下降,最终低于 \(\delta_{\text{crit}}\),导致教师监督失效。 ### 2.2 经验性观察:教师监督质量随学生前缀退化 为量化SFD,我们在AIME24上进行了补全实验:让学生生成固定长度的前缀(1k、2k、…、14k),然后让教师完成剩余部分(约4k词元)。对于每个前缀长度,我们测量教师完成的准确率(图2主图)以及在前缀结尾处教师下一词元概率的统计量(图2子图)。**教师准确率从约45%(1k前缀)单调下降到约30%(14k前缀)**。同时,教师在其自身分布上生成的相同长度前缀,准确率始终高于42%。 子图显示了在较短(~2k)和较长(~14k)前缀处学生-教师交接点的token级别细节。实线表示教师最大概率(max prob),虚线表示学生-教师切换点。**在切换点,教师置信度立即跃升**:在~14k处由约0.10跃升至约0.38。这一跃升表明,不同的词元选择会导致不同的后继教师置信度。我们利用了这一点。 ### 2.3 理论分析:自强化漂移循环 令 \(d_t = d(\mathbf{x}_{\leq t}, \mathcal{X}_T)\) 为前缀 \(\mathbf{x}_{\leq t}\) 与教师训练分布 \(\mathcal{X}_T\) 之间的距离测度(例如总变差距离)。SFD可建模为正反馈循环: **命题2(SFD的自强化循环)**:假设教师置信度 \(\Delta_T(t)\) 随 \(d_t\) 单调递减。设学生从训练开始(\(k=0\))到第 \(k\) 步处于状态 \(\pi_{\theta_k}\),且初始学生分布与教师几乎一致(\(d_0 \approx 0\))。那么: 1. **梯度坍缩**:存在一个临界距离 \(d_{\text{crit}}\),使得当 \(d_t > d_{\text{crit}}\) 时,来自教师的纠正信号消失,梯度仅增强学生现有的高概率词元。 2. **漂移累积**:一旦某个位置 \(t\) 的梯度坍缩,该位置的错误会在后续步骤中累积,因为 \(\pi_\theta\) 会持续强化与教师的分歧,从而增加 \(d_{t+1}\)。 3. **自我永续**:增长的 \(d_t\) 进一步降低了 \(\Delta_T(t)\),维持了梯度坍缩。因此,一旦SFD开始,它便自行维持。 *证明思路*: **部分(1)**。从命题1,当 \(\Delta_T(t) \leq \delta_{\text{crit}}\) 时梯度坍缩。由于 \(\Delta_T(t)\) 随 \(d_t\) 递减,当 \(d_t > d_{\text{crit}}\) 时便满足条件,其中 \(d_{\text{crit}} = \Delta_T^{-1}(\delta_{\text{crit}})\)。当梯度坍缩时,我们有 \(\nabla_{\log \pi_\theta} \mathcal{L}^{(t)} = 1 - 1 / \pi_\theta(x_t | \mathbf{x}_{< t})\)。令 \(p = \pi_\theta(x_t | \mathbf{x}_{< t})\)。当 \(p > e^{-(1 + \log |\mathcal{V}|)} = (e \cdot |\mathcal{V}|)^{-1}\) 时成立。对于任何概率超过该阈值的词元(在学生分布非均匀时,学生的top词元通常满足),梯度会增强学生的高概率词元。具体来说,高概率词元的 \(A_t \gg 0\),接收强梯度,而低概率词元 \(A_t < 0\),被进一步抑制——使得学生分布向其已有模式尖锐化,完全不受教师指导。 **部分(2)**。由假设,\(\Delta_T(t) \leq f(d_t)\) 且 \(f\) 递减。当 \(\Delta_T(t) < \delta_{\text{crit}}\) 时,教师贡献可忽略的纠正信号(命题1第3部分)。因此,步骤 \(t\) 选中的词元 \(x_t\) 来自于学生的尖锐化分布 \(\pi_\theta(\cdot | \mathbf{x}_{< t})\)。由于学生分布已有偏,该词元更可能使 \(d_{t+1} > d_t\)(偏离教师分布),且增量 \(\delta > 0\) 取决于词元分歧大小。这建立了正反馈循环:每当 \(\Delta_T(t)\) 低于临界阈值时 \(d_t\) 增加,而增加的 \(d_t\) 进一步降低 \(\Delta_T(t)\),维持循环。 **部分(3)**。在前向KL(离线策略)下,训练序列由教师生成:\(\mathbf{x} \sim \pi_T(\cdot | \mathbf{c})\)。因此 \(\mathbf{x}_{< t}\) 始终在 \(\mathcal{X}_T\) 内,无漂移发生。 **SFD的行为影响。** 定义有效监督长度 \(t_{\text{eff}}(k) = \sup\{ t : \mathcal{C}^{(t)}[\pi_{\theta_k}] > C_{\min} \}\) 为训练步 \(k\) 上教师监督超过最小有用阈值的最远位置。根据命题2建立的自强化漂移,训练诱导了一个**恶性循环**:超出 \(t_{\text{eff}}\) 的位置接收不到有用监督(\(l \approx 0\))而不改进;这些位置上学生未纠正的行为继续推动教师进一步偏离分布,这又可能导致 \(t_{\text{eff}}\) 在下一步训练中**收缩**。这创造了一个随训练扩展的“学习荒漠”,确立了在标准在线策略蒸馏下学生永远无法改进的**推理长度上限 \(t^*\)**。 \(\mathcal{C}^{(t)}\) 曲线遵循sigmoid衰减:早期保持高监督质量,后期崩溃,过渡区域随训练逐渐锐化。我们通过经验验证:对图2中两条曲线拟合逻辑sigmoid得到 \(R^2 > 0.997\),拟合参数表明OPD训练收缩了监督边界(\(t^*\):7.43→7.04k)并加剧了过渡斜率(\(\varepsilon\):0.21→0.26)。值得注意的是,所有四个参数偏移均与恶性循环预测的方向一致(完整拟合结果见附录C)。 这种复合效应是在线策略反向KL的根本问题,无法通过简单调整学习率或添加正则化来解决,因为这些措施只能减缓漂移率 \(\varepsilon\) 而无法改变结构性问题。相反,这促使我们直接优化监督泛函 \(\mathcal{C}[\pi_\theta]\) 本身,它提供了一种结构上不同的信号,将学生引向教师能提供高质量监督的状态。 ## 3 前瞻置信度作为一种监督信号 ### 3.1 从梯度失效到单步前瞻 前面的分析表明SFD使梯度坍缩:当 \(\pi_T(\cdot | \mathbf{x}_{< t})\) 接近均匀时,所有词元获得的奖励相似,学习信号降级为“自我强化”。然而,图2中的跃升现象揭示了一个关键机会:即使在退化的上下文中,不同的词元选择会导致不同的下一位教师最大概率 \(\max_v \pi_T(v | \mathbf{x}_{< t}, x_t^{(k)})\)。我们利用这一点。 定义**前瞻置信度**为给定当前前缀与候选词元 \(x_t^{(k)}\) 时教师在下一位上的最大概率: \[ r_{\text{conf}}^{(k)} = \max_v \pi_T\!\left(v \mid \mathbf{x}_{< t}, x_t^{(k)}\right). \tag{1} \] 直觉上,高 \(r_{\text{conf}}^{(k)}\) 意味着选择 \(x_t^{(k)}\) 后,教师对下一位分布仍保持高置信度与区分性,从而保留未来的反向KL监督信号(参考命题1中的 \(\Delta_T(t+1)\))。为将此转化为可微分的训练信号,我们将原始梯度(方程10)替换为: \[ \mathcal{L}_t^{\text{LGR}} = \underbrace{\log \pi_\theta(x_t \mid \mathbf{x}_{< t})}_{\text{标准反向KL}} + \;\gamma \cdot \underbrace{r_{\text{conf}}(x_t)}_{\text{前瞻奖励}}, \tag{2} \] 其中 \(\gamma\) 为平衡权重。 ### 3.2 前瞻组奖励 直接使用原始前瞻置信度 \(r_{\text{conf}}\) 作为奖励存在两个问题:(i)绝对置信度水平在不同前缀间差异巨大(从0.05到0.95),导致奖励方差过高;(ii)选择绝对值大于 \(r_{\text{conf}}\) 会强化模型,但难以区分不同候选之间的相对优劣。我们提出**组归一化**来缓解: 对于学生采样到的每个位置 \(t\),考虑其top-K候选词元 \(\{x_t^{(1)}, \ldots, x_t^{(K)}\}\)。我们计算这些候选的原始奖励 \(r_{\text{raw}}^{(k)} = \max_v \pi_T(v | \mathbf{x}_{< t}, x_t^{(k)})\),然后应用组归一化: \[ r_{\text{conf}}^{(k)} = \frac{r_{\text{raw}}^{(k)} - \mu_K}{\sigma_K + \epsilon}, \quad \mu_K = \frac{1}{K} \sum_{k=1}^K r_{\text{raw}}^{(k)}, \quad \sigma_K^2 = \frac{1}{K} \sum_{k=1}^K (r_{\text{raw}}^{(k)} - \mu_K)^2, \tag{3} \] 其中 \(\epsilon\) 是防止除零的小常数。该归一化:(i)去除位置相关的偏移(使得奖励在不同前缀间可比);(ii)仅保留候选之间的相对排序。 **命题3(组归一化的性质)**: 1. **排序保留**:组归一化保持 \(r_{\text{raw}}^{(k)}\) 的单调排序;若 \(r_{\text{raw}}^{(i)} \geq r_{\text{raw}}^{(j)}\),则 \(r_{\text{conf}}^{(i)} \geq r_{\text{conf}}^{(j)}\)。 2. **自动退火**:当所有候选的 \(r_{\text{raw}}^{(k)}\) 接近相等时(典型情况:教师极度不确定),\(\sigma_K \to 0\),于是 \(r_{\text{conf}} \to 0\)。这是期望的优雅退化:在教师无法区分候选的位置(所有候选均导致同等不确定的教师状态),置信度奖励自动归零,无需外部门控。 3. **仿射不变性**:对原始奖励的尺度变换(\(r_{\text{raw}} \to \alpha r_{\text{raw}} + \beta\),\(\alpha > 0\))不影响归一化后的相对排序与奖励分布,因为组归一化会自动移除线性变换。 *证明*: **部分(1)**。排序保留是z-score归一化的标准性质:单调变换保持相对顺序。 **部分(2)**。当所有 \(r_{\text{raw}}^{(k)} \to c\)(常数)时,\(\mu_K \to c\),\(\sigma_K \to 0\)。因此 \(r_{\text{conf}}^{(k)} = (c - c) / (\sigma_K + \epsilon) \to 0\),假设 \(\epsilon > 0\)。 **部分(3)**。令 \(\tilde{r}_{\text{raw}}^{(k)} = \alpha r_{\text{raw}}^{(k)} + \beta\),\(\alpha > 0, \beta \in \mathbb{R}\)。则 \(\tilde{\mu}_K = \alpha \mu_K + \beta\),\(\tilde{\sigma}_K = |\alpha| \sigma_K = \alpha \sigma_K\)(因为 \(\alpha > 0\))。因此 \(\tilde{r}_{\text{conf}}^{(k)} = (\alpha r_{\text{raw}}^{(k)} + \beta - (\alpha \mu_K + \beta)) / (\alpha \sigma_K) = (r_{\text{raw}}^{(k)} - \mu_K) / \sigma_K = r_{\text{conf}}^{(k)}\)。 最终LGR损失为: \[ \mathcal{L}_t^{\text{LGR}} = \begin{cases} \log \pi_\theta(x_t \mid \mathbf{x}_{< t}) + \gamma \cdot r_{\text{conf}}(x_t), & \text{若 } t \in \mathcal{S} \\ \log \pi_\theta(x_t \mid \mathbf{x}_{< t}), & \text{否则} \end{cases} \tag{4} \] 其中 \(\mathcal{S} = \{ t : \mathcal{H}(\pi_\theta(\cdot | \mathbf{x}_{< t})) > \tau \}\) 为高熵位置集合(触发LGR的条件)。需要强调的是,当 \(t \in \mathcal{S}\) 时,我们仅对学生实际采样的词元施加LGR损失;top-K候选仅在教师前向传播中使用,不影响学生损失。 ### 3.3 高效选择与树注意力 **熵触发的选择性应用**。由于SFD仅在教师置信度低的区域发生,我们仅在学生熵高于阈值 \(\tau\) 的位置应用LGR。对于其余位置,仅使用标准反向KL损失。这通常选择 \(\|\mathcal{S}\| \approx 0.15L\)–\(0.25L\) 个位置(训练早期),随着学生分布尖锐化稳定在约 \(0.10L\),计算开销降低4–7倍。触发使用的是**学生**熵而非教师熵,避免循环:教师熵在位置 \(t\) 正是SFD所退化的,若以其触发则会在最需要奖励的地方禁用奖励。该选择近乎无损(附录D)。 **树注意力**。在每个 \(t \in \mathcal{S}\) 处朴素地评估K个候选需要为学生前缀执行 \(K \cdot \|\mathcal{S}\|\) 次教师前向预填充。我们改为构造一个扩展序列(主序列 \(\mathbf{x}\) 后接所有候选作为分支),使用树结构掩码 \(\mathbf{M}\)[5](https://arxiv.org/html/2605.30833#bib.bib16), [24](https://arxiv.org/html/2605.30833#bib.bib17), [23](https://arxiv.org/html/2605.30833#bib.bib18):主分支词元因果注意力;每个候选 \(x_t^{(k)}\) 关注 \(\mathbf{x}_{\leq t-1}\) 但不关注其他候选(示例见图12)。实际中,GPU内存限制总序列长度,因此候选以N段方式处理而非一次性处理。附录E给出了完整的开销分析。 --- **算法1:LGR:前瞻组奖励** 0:学生 \(\pi_\theta\),教师 \(\pi_T\),熵阈值 \(\tau\),top-K \(K\),奖励权重 \(\gamma\) 1:**对于每个训练步**执行 2: 从数据集采样提示 \(\mathbf{c}\) 3: 生成 \(\mathbf{x} = (x_1, \ldots, x_L) \sim \pi_\theta(\cdot|\mathbf{c})\) // 学生 rollout 4: 计算所有位置的学生logits与熵 \(\mathcal{H}_t\) 5: 识别高熵集合 \(\mathcal{S} = \{ t : \mathcal{H}_t > \tau \}\) 6: 提取每个 \(t \in \mathcal{S}\) 处的top-K候选词元 7: 构造树注意力输入:主序列 + 所有候选 8: 构造多分支树掩码 \(\mathbf{M}\) 9: 使用树掩码 \(\mathbf{M}\) 执行教师前向传播 // 单次传递覆盖所有位置 10: 提取所有候选的 \(r_{\text{raw}}^{(k)}\);通过公式(10)计算 \(r_{\text{conf}}\) 11: **对于每个位置** \(t = 1, \ldots, L\) **执行** 12: **如果** \(t \in \mathcal{S}\) **则** 13: \(\mathcal{L}_t \leftarrow \mathcal{L}_t^{\text{LGR}}\) 通过公式(12) // 本地 + 前瞻 14: **否则** 15: \(\mathcal{L}_t \leftarrow \log \pi_\theta(x_t | \mathbf{x}_{< t})\) // 仅标准反向KL 16: **结束如果** 17: **结束对于** 18: 通过 \(\nabla_\theta \sum_t \mathcal{L}_t\) 更新学生参数 \(\theta\) 19:**结束对于** --- *待续*(原文后半部分涉及实验设置、结果、消融、相关工作、结论等,但用户提供的文本截断于此。如需继续翻译后续部分,请提供完整内容。)
相似文章
当教师误导:虚假信号感知的在线策略蒸馏
本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。
同策略蒸馏(5分钟阅读)
本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。
揭秘 On-Policy Distillation:角色、病理与调控
本文系统研究了LLM后训练中的on-policy distillation,阐明了其作为探索催化剂的作用,并识别了Student-Teacher Mismatch和Length Exploitation等病理现象,提出了轻量级信号调控方法。
SG-OPD:通过符号一致性门控和分阶段教师采样的符号门控在线策略蒸馏
符号门控在线策略蒸馏(SG-OPD)通过使用二元验证器作为教师监督的信任信号,增强了标准在线策略蒸馏,在竞赛级数学推理基准上提升了性能。