重新审视在线策略自蒸馏中的特权信息
摘要
本文研究了在线策略自蒸馏中的性能增益是否源于学习特权参考信息或恢复已有推理行为,发现正确参考在不同条件下并未一致地带来性能提升。
arXiv:2608.18271v1 Announce Type: new
Abstract: 在线策略自蒸馏(OPSD)通过使用同一模型在特权参考信息条件下提供的词元级监督,对学生模型在其自身回复上进行训练。我们研究了OPSD的性能增益是否表明学生学习了参考中的信息,还是反映了基础模型中已有推理行为的恢复。我们使用从1.7B到8B的Qwen3模型,在科学和数学数据集上进行了OPSD实验。我们的分析框架将由参考引发的监督与教师在没有参考时提供的监督分开,并衡量每种监督与学生预测变化的一致性。正确参考在不同教师生成模式、模型规模和训练数据集上并未提供一致的性能收益。学生可以在没有正确参考的情况下改进,并且来自其他问题的解决方案可以在多个数学推理基准上优于正确解决方案。学生的预测与基础模型的思维行为一致性更强,而不是与参考引发的监督一致性,但由其他问题构建的对照实验重现了这两种一致性的大部分。此外,归因于正确参考的更强一致性并不总是伴随着参考带来的更大性能收益。因此,仅凭性能增益和分布对齐无法确定特权参考信息如何在OPSD中贡献于学生学习。
查看缓存全文
缓存时间: 2026/08/20 10:24
# 重新思考在策略自蒸馏中的特权信息
来源:https://arxiv.org/html/2608.18271
###### 摘要
在策略自蒸馏(OPSD)利用同一模型在特权参考信息条件下生成的 token 级监督,对基于自身响应的学生进行训练。我们研究了 OPSD 带来的性能提升是否表明学生学习了参考中的信息,或者仅仅反映了基础模型中已存在的推理行为的恢复。我们使用 1.7B 到 8B 的 Qwen3 模型在科学和数学数据集上进行了 OPSD 实验。我们的分析框架将参考引发的监督与不使用参考的教师提供的监督分开,并衡量每种监督与学生预测变化的匹配程度。正确的参考在不同的教师生成模式、模型规模和训练数据集中并未带来一致的性能收益。学生在没有正确参考的情况下也能获得提升,并且在若干数学推理基准测试中,来自另一个问题的解决方案可能优于正确的解决方案。学生的预测与基础模型的思考行为更强烈地对齐,而不是与参考引发的监督对齐,但用其他问题构建的对照组重现了很大一部分对齐性。此外,归因于正确参考的更强对齐并不一定与参考带来的更大性能收益同时出现。因此,仅凭性能提升和分布对齐无法确定特权参考信息在 OPSD 中如何促进学生学习。
## 1 引言
在策略蒸馏(OPD)已成为大型语言模型(LLM)后训练中广泛使用的方法,包括最近发布的模型如 DeepSeek-V4(3)、GLM-5(5)、Kimi K3(17)、Nemotron-Cascade 2(32)和 Qwen3(31)。与容易因在固定目标序列上训练而产生暴露偏差(2)的监督微调(SFT)不同,OPD 在从学生当前策略中采样的轨迹上训练学生。教师对学生访问的状态提供密集的 token 级监督(1;6;21)。在策略自蒸馏(OPSD)在不同上下文中使用同一模型作为教师和学生(34)。学生仅根据问题生成响应,而教师则在访问特权信息(通常是学生无法获得的参考解决方案)时评估相同的响应。OPSD 的核心前提是特权参考信息改善了教师的监督并将有用信息转移给学生(34)。然而,增加教师对参考的接触并不总是一致有益的,并且可能改变不确定性表达或推理行为(7;15;13)。参考条件监督也可能包含在推理时没有参考时学生无法使用的信息(36;25)。因此,仅凭性能无法确定学生是否从参考中学习了信息。当教师在思考模式下运行时,这个问题变得更加困难,因为教师在上下文和生成模式上都与学生不同。因此,我们提出三个问题。第一,正确的参考对于 OPSD 提升性能是否必要?第二,参考是否必须与正在解决的问题相对应?第三,这些收益是反映了从参考中的学习,还是基础模型中已存在的推理行为的恢复?我们使用在 NuminaMath 和 MegaScience 上训练的 Qwen3-8B、Qwen3-4B 和 Qwen3-1.7B 学生来研究这些问题。对于 OPSD,在测试的模式组合中,将非思考学生与思考教师配对会产生最大的性能提升(34)。在我们的实验中,学生在训练和评估期间保持非思考模式,而我们改变教师的生成模式和参考上下文。固定学生的生成模式可以分离这些教师端效应。它还允许我们测试来自思考教师的监督是否使学生向与基础模型思考模式相关的行为转变。我们引入了一个分析框架,将参考引发的监督与剩余的教师监督分开,并衡量每种监督与学生预测在训练期间变化的匹配程度。我们使用来自其他问题的教师上下文重复这些测量。图 1 总结了 OPSD 设置和我们实验中使用的教师与参考条件。
核心问题:学生是否学习了参考中包含的信息?
图 1:OPSD 设置和实验条件。学生保持在非思考模式,而我们改变教师的生成模式和参考上下文。
我们的贡献如下:
- • 我们表明正确参考的益处取决于教师的生成模式、模型规模和训练数据集。学生在没有正确参考的情况下也能获得提升,并且在若干数学推理基准测试中,来自另一个问题的解决方案可能优于正确的解决方案。
- • 我们引入了一个分析框架,将参考引发的监督与剩余的教师监督分开,并衡量每种监督与学生预测变化的匹配程度。学生预测的变化与基础模型的思考行为更强烈地对齐,而不是与参考引发的监督对齐。
- • 我们使用从其他问题构建的对照组来比较这些对齐。对照组重现了很大一部分明显的对齐性,而归因于正确参考的更强对齐并不一定与参考带来的更大性能收益同时出现。
这些结果共同表明,仅凭性能提升和分布对齐无法确定特权参考信息在 OPSD 中如何促进学生学习。
## 2 相关工作
#### 在策略蒸馏。知识蒸馏训练学生以匹配教师模型的输出分布(9)。序列级蒸馏通过在教师生成的完整响应上训练学生,将此方法应用于自回归模型(16)。由于这些响应并非由学生当前策略生成,训练期间看到的前缀可能与推理期间遇到的不同,从而产生暴露偏差并允许错误在生成的响应中累积(2;1)。基于模仿的蒸馏通过在学生生成的轨迹上训练来解决这种不匹配,由教师在学生访问的状态上提供监督(20)。OPD 将此原则应用于 LLM,通过在从学生当前策略中采样的轨迹上评估教师(6;21)。训练最小化教师和学生下一 token 分布之间的 token 级 KL 散度,在生成的响应中的每个位置提供密集监督(1)。
#### 在策略自蒸馏。在策略自蒸馏(OPSD)通过在同一模型的不同上下文中实例化教师和学生,消除了对单独教师的需求(34)。学生仅以问题为条件,而教师还接收特权信息,如参考解决方案。学生生成训练轨迹,教师通过使用额外上下文评估相同前缀来提供 token 级监督。密切相关的工作使用专家示范和文本反馈来应用此原则(26;11)。其他方法将教师的上下文扩展到参考解决方案之外,包括从历史解决方案痕迹和优化系统提示中提取的经验知识(33)、仅动作特权信息(23)、源文档(27)以及从已完成的轨迹中提取的自然语言技能(28)。这些方法共同利用训练期间可用的上下文信息来创建更知情的教师策略。
#### OPSD 中的特权上下文。更知情的教师不一定提供更有用的监督。特定于单个问题的特权信息可能无法可靠地转移到推理时缺乏该信息的学生(36)。提供更多的参考可能会增加教师和学生之间的不匹配(7),而丰富的教师上下文可能会抑制不确定性并损害分布外泛化(15)。特权上下文蒸馏也可能通过抑制验证和自我纠正来降级思考模型(13)。提出的补救措施包括调整向教师展示的参考量(7)、减少高熵 token 位置的影响(14)、将蒸馏限制在已识别的推理错误(35)或从教师信号中移除特定于参考的捷径(25)。同时期的工作发现,来自另一个问题的解决方案可以保持或提高 OPSD 性能(12),并表明特权上下文引发的可能性变化不一定提供有用的 token 信用(22)。我们的研究通过分离依赖参考和不依赖参考的教师监督,并使用从其他问题构建的对照组来比较每种监督如何与学生预测的变化相关,从而补充了这项工作。
## 3 分析框架
### 3.1 训练目标
在 OPSD 中,学生模型 π_S 从其当前策略生成轨迹,而来自同一基础模型的冻结教师 π_T 在访问参考解决方案时提供 token 级监督(1;34)。令 D 表示训练数据集。对于具有参考解决方案 r 的问题 x ∼ D,学生采样一个轨迹 y ∼ π_S(· | x)。训练目标是 L(π_S) = E_{x∼D, y∼π_S(·|x)} ∑_{t=1}^{|y|} D_{JSD}(π_T(·|x,r,y_{<t}) || π_S(·|x,y_{<t}))。
我们用问题替代占位符,用原始数据集解决方案替代解决方案,将提示呈现为单个用户消息,并禁用思考模式。
#### 不匹配的参考。对于 NuminaMath,我们应用无自配对的 seed-42 变换到解决方案列。对于 MegaScience,我们在每个主题内应用相同的构造。问题和其他所有字段保持不变。
#### OPSD 训练提示。学生用户消息是:> 问题:{problem} 请逐步推理,并将最终答案放在 \boxed{} 中。
当使用参考时,教师用户消息是:> 问题:{problem} 这里是此问题的参考解决方案: === 参考解决方案开始 === {reference} === 参考解决方案结束 === 阅读上述参考解决方案后,请确保您真正理解每一步背后的推理——不要复制或意译。现在,使用您自己的话和独立推理,推导出上述问题的相同最终答案。逐步思考,探索不同的方法,如果某些方法不起作用,不要害怕回溯或重新考虑:请逐步推理,并将最终答案放在 \boxed{} 中。
在无参考条件下,教师接收学生用户消息。我们使用 Qwen3 聊天模板渲染两条消息,并独立设置学生和教师的思考模式。
### A.3 训练配置
教师是冻结的 Qwen3-8B 基础模型。在教师评分期间,学生的 LoRA 适配器被禁用。我们最小化全词汇前向 KL 散度 KL(π_T ∥ π_S)。两种分布都在温度 1.1 下计算。在求和、掩码和归约之前,对每个词汇坐标的贡献进行逐点裁剪。我们在表 6 中列出了共同超参数,在表 7 中列出了数据集和模式特定设置。
表 6:共享 OPSD 训练配置。标准微批包含每个 GPU 两个示例,跨八个 GPU 进行两个梯度累积步骤。全轨迹条件使用每个 GPU 一个示例和四个累积步骤。我们使用 FlashAttention 2、梯度检查点和张量并行大小为 1 的协同定位 vLLM 生成。vLLM 展开引擎使用其数据并行过程索引作为种子。20,000-token 设置限制了学生展开上下文。学生提示被截断以留出最大完成空间。教师提示在采样的学生完成被追加之前单独截断为 20,000 token。因此,它不是组合教师序列的普遍限制。对于全轨迹条件,15,900-token 提示过滤器和 4,096-token 完成限制使组合序列保持在 20,000 token 以下。
表 7:按数据集和教师模式变化的设置。
### A.4 评估相似文章
策略内蒸馏真的在蒸馏吗?从嘈杂教师到自我改进
本文分析了策略内蒸馏,揭示其主要通过抑制低概率token而非依赖教师指导来实现改进,并提出了无需监督的OPSA方法,显著提升了推理性能。
PHF:策略自适应自蒸馏中的特权隐式流
PHF提出了一种方法,在策略自适应自蒸馏过程中,将特权教师模型的隐藏状态轨迹蒸馏给学生模型,从而提升语言模型的推理性能。
虽有特权,却有偏见:PI条件教师如何破坏自我蒸馏
本文研究将带特权信息(PI)的自我蒸馏(SD)作为LLM唯一的后期训练目标,在简单任务上复现了已报告的性能提升,但表明它在困难推理任务上会失败:逐token损失下降,而验证准确率停滞或下降。作者将失败归因于PI偏置,它把教师目标拉向参考轨迹,训练出的学生更平坦、更不果断,却没有提升推理能力。
揭秘同策略蒸馏:其益处、危害及原因
本文介绍了一种无需训练的框架,用于分析推理模型在逐token级别上的蒸馏信号。研究揭示,蒸馏引导在错误推理路径上更为有效,且其效果取决于学生模型的能力及任务上下文。
EDGE-OPD:利用证据引导的在线策略蒸馏内化特权上下文
本文提出了EDGE-OPD,一种针对大语言模型的在线策略自蒸馏改进方法,通过引导式采样和证据掩码来内化特权上下文,同时不损害通用能力,在稀有标记身份设定中取得了成功。