更好的监督就在近处:邻域在线自蒸馏
摘要
本文提出邻域在线自蒸馏(N-OPSD),通过对特权教师的局部参数扰动来汇聚互补的、与参考解对齐的修正信号,并将其路由到学生实际访问过的状态,从而在 Qwen3 1.7B/4B/8B 模型上提升了数学推理基准(AIME 2024/2025、HMMT Feb 2025)的表现。
查看缓存全文
缓存时间: 2026/10/02 08:27
论文页面 - 更好的监督就在身边:邻域同策略自蒸馏
Source: https://huggingface.co/papers/2609.39687 Published on Sep 30
·
Submitted byhttps://huggingface.co/dingyii
dingyi (https://huggingface.co/dingyii)on Oct 2
摘要
同策略自蒸馏(on-policy self-distillation,OPSD)利用一个拥有“特权“的教师模型来训练数学推理模型:该教师能看到参考解,并对采样得到的学生前缀进行监督。标准 OPSD 在每个状态都使用同一组固定的参数设置,但邻近的参数设置可能提供额外的监督信号。我们发现,在相同的参考上下文下,对参数进行局部扰动可以揭示出互补的、与参考解对齐的修正。不同的专家在参考轨迹的不同位置提供这些修正,其并集所覆盖的位置范围超过了未扰动的特权教师。我们提出了邻域 OPSD(Neighborhood OPSD,N-OPSD),将这些修正转化为学生实际访问状态上的监督。在离线阶段,贪心选择会奖励在池中每个位置上超出当前最优记录的过滤后参考 token 增益,从而构建一个精简的冻结专家池。峰值最高的专家未必提供最好的训练目标。因此,在线路由将锚定方向与其支持程度分离开来:MaxPeak 选取锚定 token,而分位数选择则在那些 top token 与之匹配的专家中进行挑选。学生通过继承自 OPSD 的截断前向 KL 目标,从被选中专家的完整下一 token 分布中学习。我们在 AIME2024、AIME2025 和 HMMT February2025 上进行了评估。每种方法独立运行三次,结果显示 Neighborhood OPSD 在 Qwen3-1.7B、4B 和 8B 上的三项基准 Average@12 分别比 OPSD 提高了 2.75、1.67 和 1.94 分。学生前缀续写实验表明,该专家池可用于选择时未使用的参考轨迹之外的状态。配对消融实验支持将过滤后参考 token 增益作为选择准则。考虑池内专家的重叠度并按状态进行路由,可进一步提升学生准确率。推理阶段仅需使用蒸馏后的学生模型。
View arXiv page (https://arxiv.org/abs/2609.39687)View PDF (https://arxiv.org/pdf/2609.39687)Project page (https://arxiv.org/abs/2609.39687)Add to collection (https://huggingface.co/login?next=%2Fpapers%2F2609.39687)
引用该论文的模型0
No model linking this paper
Cite arxiv.org/abs/2609.39687 in a model README.md to link it from this page.
引用该论文的数据集0
No dataset linking this paper
Cite arxiv.org/abs/2609.39687 in a dataset README.md to link it from this page.
引用该论文的 Spaces0
No Space linking this paper
Cite arxiv.org/abs/2609.39687 in a Space README.md to link it from this page.
包含该论文的合集0
No Collection including this paper
Add this paper to acollection (https://huggingface.co/new-collection)to link it from this page.
相似文章
无需任何监督的同策略自蒸馏
介绍了U-OPSD,一种无监督的同策略自蒸馏方法,利用内部一致性和多数投票伪解决方案来改进大语言模型,无需外部监督,在数学基准上达到或超过有监督方法。
策略内蒸馏真的在蒸馏吗?从嘈杂教师到自我改进
本文分析了策略内蒸馏,揭示其主要通过抑制低概率token而非依赖教师指导来实现改进,并提出了无需监督的OPSA方法,显著提升了推理性能。
突破 LLM 推理中同策略自蒸馏的规模扩展瓶颈
本文分析了用于 LLM 推理的同策略自蒸馏(OPSD),指出未经验证的学生生成骨架会带来模仿鸿沟,且该鸿沟随模型规模增大而加剧,因此提出了 OASIS 方法:利用模型生成的尝试作为教师上下文,主要对经过答案标签验证的同策略轨迹进行监督,使 Qwen3 1.7B/4B/8B 模型在 AIME/HMMT 基准上提升 3.2-3.8 个点。
SG-OPD:通过符号一致性门控和分阶段教师采样的符号门控在线策略蒸馏
符号门控在线策略蒸馏(SG-OPD)通过使用二元验证器作为教师监督的信任信号,增强了标准在线策略蒸馏,在竞赛级数学推理基准上提升了性能。
潜在同策略自蒸馏 (LOPD)
本文介绍了潜在同策略自蒸馏(LOPD),该方法使教师的特权上下文能够从经验中端到端学习,提供密集的token级别监督,以提升智能体在智能工具使用和代码生成中的性能和效率。