OPRD:在策略表示蒸馏
摘要
OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。
在策略蒸馏(OPD)仅通过匹配下一个词元的概率在输出空间监督学生模型。这种仅输出范式有两个局限:(1)来自大词汇表(例如Qwen的约15万个词元)上蒙特卡洛KL估计的采样方差在整个训练过程中持续存在,(2)它将教师模型视为黑箱,丢弃LM头之后的所有中间隐藏状态。我们提出了在策略表示蒸馏(OPRD),该方法通过在相同的部署中选择的层上对齐学生和教师的表示,将蒸馏提升到隐藏状态空间,完全绕过LM头。理论上,OPRD消除了采样方差并提供了更丰富的逐层结构信息。实验上,OPRD缩小了学生在AIME 2024/2025和AIMO上与教师的差距,而输出空间OPD基线在低于教师的水平上趋于平稳。OPRD训练速度也比top-k OPD快1.44倍,内存使用减少54%。代码:https://github.com/ShenzhiYang2000/OPRD。
相似文章
同策略Delta蒸馏(OPD^2)
本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。
OmniOPD: 通过推测验证实现无Logit的同策略蒸馏
OmniOPD 提出了一种无Logit的同策略蒸馏方法,利用块级语义相似性和推测验证,在黑盒教师指导下训练学生模型,在数学基准上相比标准OPD实现了高达+28.64%的提升。
通过直接在线策略蒸馏实现弱到强泛化
Direct-OPD 通过从小模型的预强化学习和后强化学习检查点中蒸馏策略变化,利用在线策略蒸馏改进较大的学生模型,无需在学生模型上执行昂贵的强化学习即可实现显著提升。
SG-OPD:通过符号一致性门控和分阶段教师采样的符号门控在线策略蒸馏
符号门控在线策略蒸馏(SG-OPD)通过使用二元验证器作为教师监督的信任信号,增强了标准在线策略蒸馏,在竞赛级数学推理基准上提升了性能。
学会预见:揭示 On-Policy 蒸馏效率的解锁机制
本文研究了大型语言模型中 On-Policy 蒸馏(OPD)效率背后的参数级机制,将其归因于模块分配和更新方向上的早期“预见性”。本文提出了 EffOPD,一种即插即用方法,可在不损害最终性能的情况下将 OPD 训练速度提高 3 倍。