突破 LLM 推理中同策略自蒸馏的规模扩展瓶颈

Hugging Face Daily Papers 论文

摘要

本文分析了用于 LLM 推理的同策略自蒸馏(OPSD),指出未经验证的学生生成骨架会带来模仿鸿沟,且该鸿沟随模型规模增大而加剧,因此提出了 OASIS 方法:利用模型生成的尝试作为教师上下文,主要对经过答案标签验证的同策略轨迹进行监督,使 Qwen3 1.7B/4B/8B 模型在 AIME/HMMT 基准上提升 3.2-3.8 个点。

同策略自蒸馏(OPSD)通过让学生沿着自身采样的轨迹去匹配一个拥有特权信息的教师分布来进行训练。标准 OPSD 将这种监督施加在未经验证的学生生成轨迹上,同时向教师提供特权上下文,通常即参考解答。本文通过因子实验分析将这两种角色分离开来,发现骨架(scaffold)的正确性对下游准确率的影响强于上下文正确性的影响。未经验证的骨架会带来模仿鸿沟,因为教师可以利用学生无法获得的信息。这一鸿沟会随模型规模增大而缩小,然而 OPSD 仍然持续对大量未经验证的轨迹施加监督。与之相对,经过验证的骨架即使在教师以上学生自身的失败生成轨迹为上下文时依然有效。基于这一发现,我们提出 OASIS:它保留了 OPSD 的训练目标,但主要监督经过答案标签验证的同策略轨迹,并将参考解答替换为未经验证的模型生成尝试作为教师上下文。因此,OASIS 仅需要最终答案标签。在 Qwen3-1.7B、4B 和 8B 上,针对 AIME 2024、AIME 2025 和 HMMT 2025 基准,OASIS 相比基座模型平均提升 3.2-3.8 个点;而 OPSD 的收益则从 1.7B 时的 3.05 个点降至 8B 时的 0.14 个点。在 8B 规模上,OASIS 相比 OPSD 提升 3.05 个点,表明经过验证的同策略骨架能够在模型规模扩展时维持自蒸馏的有效性。
查看原文
查看缓存全文

缓存时间: 2026/10/01 12:24

论文页面 - 突破大模型推理中在线自蒸馏的规模化瓶颈

来源:https://huggingface.co/papers/2609.37915

摘要

在线自蒸馏(On-policy self-distillation,OPSD)训练学生模型沿着自身采样出的轨迹来匹配一个拥有“特权信息“的教师分布。标准的 OPSD 将这种监督施加在未经验证的学生回滚轨迹上,同时让教师以特权上下文(通常是参考解答)作为条件。我们在一项析因分析中将这两个角色分离,发现脚手架(scaffold)的正确性对下游准确率的影响强于上下文的正确性。未经验证的脚手架会产生“模仿差距“,因为教师能够利用学生无法获得的信息。这一差距会随模型规模增大而缩小,但 OPSD 仍然主要监督未经验证的轨迹。相比之下,即使教师以学生自身失败的回滚轨迹为条件,经过验证的脚手架依然有效。基于这一发现,我们提出 OASIS:它保留了 OPSD 的目标函数,但主要对按标签验证过的在线轨迹进行监督,并用未经验证的模型自动生成的尝试替换书面解答作为教师上下文。因此,OASIS 只需要最终答案标签。在 Qwen3-1.7B、4B 和 8B 模型上,针对 AIME 2024、AIME 2025 和 HMMT 2025,OASIS 相比基础模型平均提升了 3.2–3.8 个百分点,而 OPSD 的增益则从 1.7B 时的 3.05 分下降到 8B 时的 0.14 分。在 8B 规模下,OASIS 比 OPSD 提升 3.05 分,这表明经过验证的在线脚手架能够在模型规模扩大时保持自蒸馏的有效性。

查看 arXiv 页面 (https://arxiv.org/abs/2609.37915) | 查看 PDF (https://arxiv.org/pdf/2609.37915) | 加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.37915)

在你的 agent 中获取此论文:

hf papers read 2609.37915

还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

暂无模型关联此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.37915 即可从本页链接它。

引用此论文的数据集 0

暂无数据集关联此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.37915 即可从本页链接它。

引用此论文的 Spaces 0

暂无 Space 关联此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.37915 即可从本页链接它。

包含此论文的合集 1

相似文章

无需任何监督的同策略自蒸馏

Hugging Face Daily Papers

介绍了U-OPSD,一种无监督的同策略自蒸馏方法,利用内部一致性和多数投票伪解决方案来改进大语言模型,无需外部监督,在数学基准上达到或超过有监督方法。

使用基于策略的自蒸馏方法降低LLM安全对齐中的安全税

arXiv cs.LG

本文介绍了OPSA,一种用于LLM安全对齐的基于策略的自蒸馏方法,该方法通过在模型自身的轨迹上进行训练,并使用教师翻转率激活潜在的安全推理,从而降低了安全税,在多个模型规模上实现了更强的安全-推理权衡。

更好的监督就在近处:邻域在线自蒸馏

Hugging Face Daily Papers

本文提出邻域在线自蒸馏(N-OPSD),通过对特权教师的局部参数扰动来汇聚互补的、与参考解对齐的修正信号,并将其路由到学生实际访问过的状态,从而在 Qwen3 1.7B/4B/8B 模型上提升了数学推理基准(AIME 2024/2025、HMMT Feb 2025)的表现。