特权信息在在策略自蒸馏中的作用是什么?

Hugging Face Daily Papers 论文

摘要

本文研究了特权信息在语言模型在策略自蒸馏中的贡献,发现无参考蒸馏贡献了大部分性能提升,而特权参考带来的额外收益有限。

在策略自蒸馏(OPSD)使语言模型能够从其自身的冻结副本中学习,该副本能看到答案或完整解题过程。为教师模型提供这种额外信息似乎能让学生模型学到更多,但除了蒸馏本身,这究竟带来了多少增益?为隔离这一贡献,我们构建了AMPLE-Math——一个包含5,319个数学问题、共享相同答案但具有六种不同推理视角的可复用测试集,并将每个视角与匹配的无参考蒸馏进行比较。在具有思维能力的教师模型监督直接响应生成的情况下,无参考蒸馏解释了Qwen3-1.7B在具备思维能力的评估中在领域内和外部基准上的大部分性能提升。特权参考带来的额外收益在Qwen中仅有适度体现,对精炼解决方案最为明显,而完整推理轨迹在SmolLM3-3B的第50步训练中仅增加了两个百分点。这些收益取决于学生模型是否处于训练状态。在相同检查点,保持问题、参考和评估不变,将短的直接响应生成替换为长的思维能力生成,会导致两个模型族的收益变为损失。Qwen中的教师模型特征与匹配损失干预实验进一步表明,改变token级别的监督可能对学生行为影响甚微。综合来看,这些发现表明,OPSD可以通过直接响应和思维能力推理共享的参数,提升对现有推理能力的调用效率。特权参考的价值在于它对这种跨模式迁移的增益,而非它揭示了多少解题过程。
查看原文
查看缓存全文

缓存时间: 2026/09/18 02:59

论文页面 - 在线策略自蒸馏中,特权信息能带来什么?

来源:https://huggingface.co/papers/2609.20612

摘要

在线策略自蒸馏使语言模型能从一个能看到答案或完整解题过程的冻结自身副本中学习。给教师模型这种额外信息似乎能让学生模型学到更多,但除了蒸馏本身,它具体增加了多少价值?为隔离这一贡献,我们构建了AMPLE-Math,这是一个包含5,319道数学问题的可复用套件,每道题配有六种共享相同答案的推理视角,并将每种视角与匹配的无参考蒸馏进行比较。在具有思考能力的教师监督直接回答滚动的情况下,无参考蒸馏解释了Qwen3-1.7B在启用思考能力评估下的大部分改进,无论是在领域内还是外部基准测试中。在Qwen中,支持额外参考收益的证据是适度的,在经过提炼的解决方案中最强;而在SmolLM3-3B中,完整推理轨迹在第50步增加了两个百分点的收益。这些收益取决于学生模型是否在训练中。在同一检查点,将简短的直接回答滚动替换为长的启用思考能力的滚动,会导致两个模型家族的收益都变为损失,而问题、参考和评估保持不变。在Qwen中,教师档案和匹配的损失干预进一步表明,改变令牌级别的监督可能很大程度上不会改变学生行为。综合来看,这些发现表明,在线策略自蒸馏可以通过直接回答和启用思考能力的推理共享的参数,提高对现有推理能力的访问。特权参考的价值在于它对这种跨模式转移的贡献,而不在于它揭示了解决方案的多少。

查看 arXiv 页面 (https://arxiv.org/abs/2609.20612) 查看 PDF (https://arxiv.org/pdf/2609.20612) GitHub (https://github.com/xiuyuz/opsd-reference-study) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.20612)

在您的智能体中获取此论文:

hf papers read 2609\.20612

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有链接此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2609.20612 以从此页面链接到该模型。

引用此论文的数据集 1

xiuyuz/ample-math 查看器• 43 分钟前更新 • 5.32k • 4 • 1 (https://huggingface.co/datasets/xiuyuz/ample-math)

引用此论文的 Space 0

没有链接此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2609.20612 以从此页面链接到该 Space。

包含此论文的收藏夹 0

没有包含此论文的收藏夹

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接到该收藏夹。

相似文章

重新审视在线策略自蒸馏中的特权信息

arXiv cs.LG

本文研究了在线策略自蒸馏中的性能增益是否源于学习特权参考信息或恢复已有推理行为,发现正确参考在不同条件下并未一致地带来性能提升。

DAPD:双锚定策略蒸馏

Hugging Face Daily Papers

本文介绍了双锚定策略蒸馏(DAPD),这是一个用于解决语言模型在策略自蒸馏中特权幻觉问题的框架。DAPD 在多种任务上平均将 Qwen3-4B 提升 +2.00 分,且增益在更大规模上持续存在。