特权信息在在策略自蒸馏中的作用是什么?
摘要
本文研究了特权信息在语言模型在策略自蒸馏中的贡献,发现无参考蒸馏贡献了大部分性能提升,而特权参考带来的额外收益有限。
查看缓存全文
缓存时间: 2026/09/18 02:59
论文页面 - 在线策略自蒸馏中,特权信息能带来什么?
来源:https://huggingface.co/papers/2609.20612
摘要
在线策略自蒸馏使语言模型能从一个能看到答案或完整解题过程的冻结自身副本中学习。给教师模型这种额外信息似乎能让学生模型学到更多,但除了蒸馏本身,它具体增加了多少价值?为隔离这一贡献,我们构建了AMPLE-Math,这是一个包含5,319道数学问题的可复用套件,每道题配有六种共享相同答案的推理视角,并将每种视角与匹配的无参考蒸馏进行比较。在具有思考能力的教师监督直接回答滚动的情况下,无参考蒸馏解释了Qwen3-1.7B在启用思考能力评估下的大部分改进,无论是在领域内还是外部基准测试中。在Qwen中,支持额外参考收益的证据是适度的,在经过提炼的解决方案中最强;而在SmolLM3-3B中,完整推理轨迹在第50步增加了两个百分点的收益。这些收益取决于学生模型是否在训练中。在同一检查点,将简短的直接回答滚动替换为长的启用思考能力的滚动,会导致两个模型家族的收益都变为损失,而问题、参考和评估保持不变。在Qwen中,教师档案和匹配的损失干预进一步表明,改变令牌级别的监督可能很大程度上不会改变学生行为。综合来看,这些发现表明,在线策略自蒸馏可以通过直接回答和启用思考能力的推理共享的参数,提高对现有推理能力的访问。特权参考的价值在于它对这种跨模式转移的贡献,而不在于它揭示了解决方案的多少。
查看 arXiv 页面 (https://arxiv.org/abs/2609.20612) 查看 PDF (https://arxiv.org/pdf/2609.20612) GitHub (https://github.com/xiuyuz/opsd-reference-study) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.20612)
在您的智能体中获取此论文:
hf papers read 2609\.20612
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有链接此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2609.20612 以从此页面链接到该模型。
引用此论文的数据集 1
xiuyuz/ample-math 查看器• 43 分钟前更新 • 5.32k • 4 • 1 (https://huggingface.co/datasets/xiuyuz/ample-math)
引用此论文的 Space 0
没有链接此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2609.20612 以从此页面链接到该 Space。
包含此论文的收藏夹 0
没有包含此论文的收藏夹
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接到该收藏夹。
相似文章
重新审视在线策略自蒸馏中的特权信息
本文研究了在线策略自蒸馏中的性能增益是否源于学习特权参考信息或恢复已有推理行为,发现正确参考在不同条件下并未一致地带来性能提升。
Self-Teacher 应看到什么?在线自蒸馏的特权上下文设计
本文研究在线自蒸馏中的特权上下文设计,表明中间抽象层次可以比完整解决方案更好地提升模型性能,同时使用更少的提示标记。
PHF:策略自适应自蒸馏中的特权隐式流
PHF提出了一种方法,在策略自适应自蒸馏过程中,将特权教师模型的隐藏状态轨迹蒸馏给学生模型,从而提升语言模型的推理性能。
DAPD:双锚定策略蒸馏
本文介绍了双锚定策略蒸馏(DAPD),这是一个用于解决语言模型在策略自蒸馏中特权幻觉问题的框架。DAPD 在多种任务上平均将 Qwen3-4B 提升 +2.00 分,且增益在更大规模上持续存在。
策略内蒸馏真的在蒸馏吗?从嘈杂教师到自我改进
本文分析了策略内蒸馏,揭示其主要通过抑制低概率token而非依赖教师指导来实现改进,并提出了无需监督的OPSA方法,显著提升了推理性能。