突破 LLM 推理中同策略自蒸馏的规模扩展瓶颈
摘要
本文分析了用于 LLM 推理的同策略自蒸馏(OPSD),指出未经验证的学生生成骨架会带来模仿鸿沟,且该鸿沟随模型规模增大而加剧,因此提出了 OASIS 方法:利用模型生成的尝试作为教师上下文,主要对经过答案标签验证的同策略轨迹进行监督,使 Qwen3 1.7B/4B/8B 模型在 AIME/HMMT 基准上提升 3.2-3.8 个点。
查看缓存全文
缓存时间: 2026/10/01 12:24
论文页面 - 突破大模型推理中在线自蒸馏的规模化瓶颈
来源:https://huggingface.co/papers/2609.37915
摘要
在线自蒸馏(On-policy self-distillation,OPSD)训练学生模型沿着自身采样出的轨迹来匹配一个拥有“特权信息“的教师分布。标准的 OPSD 将这种监督施加在未经验证的学生回滚轨迹上,同时让教师以特权上下文(通常是参考解答)作为条件。我们在一项析因分析中将这两个角色分离,发现脚手架(scaffold)的正确性对下游准确率的影响强于上下文的正确性。未经验证的脚手架会产生“模仿差距“,因为教师能够利用学生无法获得的信息。这一差距会随模型规模增大而缩小,但 OPSD 仍然主要监督未经验证的轨迹。相比之下,即使教师以学生自身失败的回滚轨迹为条件,经过验证的脚手架依然有效。基于这一发现,我们提出 OASIS:它保留了 OPSD 的目标函数,但主要对按标签验证过的在线轨迹进行监督,并用未经验证的模型自动生成的尝试替换书面解答作为教师上下文。因此,OASIS 只需要最终答案标签。在 Qwen3-1.7B、4B 和 8B 模型上,针对 AIME 2024、AIME 2025 和 HMMT 2025,OASIS 相比基础模型平均提升了 3.2–3.8 个百分点,而 OPSD 的增益则从 1.7B 时的 3.05 分下降到 8B 时的 0.14 分。在 8B 规模下,OASIS 比 OPSD 提升 3.05 分,这表明经过验证的在线脚手架能够在模型规模扩大时保持自蒸馏的有效性。
查看 arXiv 页面 (https://arxiv.org/abs/2609.37915) | 查看 PDF (https://arxiv.org/pdf/2609.37915) | 加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.37915)
在你的 agent 中获取此论文:
hf papers read 2609.37915
还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
暂无模型关联此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.37915 即可从本页链接它。
引用此论文的数据集 0
暂无数据集关联此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.37915 即可从本页链接它。
引用此论文的 Spaces 0
暂无 Space 关联此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.37915 即可从本页链接它。
包含此论文的合集 1
相似文章
在策略自蒸馏中尊重自不确定性以实现高效LLM推理
本文提出了EGRSD和CL-EGRSD,这是在策略自蒸馏方法,通过教师熵对令牌级监督进行加权,以改善大语言模型推理准确性-长度的权衡,并在Qwen3-4B和Qwen3-8B上进行了评估。
无需任何监督的同策略自蒸馏
介绍了U-OPSD,一种无监督的同策略自蒸馏方法,利用内部一致性和多数投票伪解决方案来改进大语言模型,无需外部监督,在数学基准上达到或超过有监督方法。
使用基于策略的自蒸馏方法降低LLM安全对齐中的安全税
本文介绍了OPSA,一种用于LLM安全对齐的基于策略的自蒸馏方法,该方法通过在模型自身的轨迹上进行训练,并使用教师翻转率激活潜在的安全推理,从而降低了安全税,在多个模型规模上实现了更强的安全-推理权衡。
向自我未来学习:面向扩散大语言模型的自策略知识蒸馏
介绍了 d-OPSD,这是首个面向扩散大语言模型的自策略知识蒸馏框架,采用后缀条件和步骤级别监督,在推理基准上优于 RLVR 和 SFT 基线。
更好的监督就在近处:邻域在线自蒸馏
本文提出邻域在线自蒸馏(N-OPSD),通过对特权教师的局部参数扰动来汇聚互补的、与参考解对齐的修正信号,并将其路由到学生实际访问过的状态,从而在 Qwen3 1.7B/4B/8B 模型上提升了数学推理基准(AIME 2024/2025、HMMT Feb 2025)的表现。