策略内蒸馏真的在蒸馏吗?从嘈杂教师到自我改进

Hugging Face Daily Papers 论文

摘要

本文分析了策略内蒸馏,揭示其主要通过抑制低概率token而非依赖教师指导来实现改进,并提出了无需监督的OPSA方法,显著提升了推理性能。

策略内蒸馏作为一种替代可验证奖励强化学习(RLVR)稀疏结果级优势的密集token级监督方法被提出。然而,教师对学生生成的轨迹进行评分时,这些轨迹对其本身具有策略外特性,因此其监督的可靠性——亦即学生改进的来源——仍不明确。我们定量分析了策略内蒸馏训练过程中的教师监督,发现其中存在显著噪声,且噪声比例随教师模型规模增加而上升。令人惊讶的是,学生策略对此类噪声并不敏感:无论保留或移除嘈杂监督,最终收敛性能均相当。那么策略内蒸馏是否真的实现了蒸馏?通过分析其收益来源,我们发现学习过程集中于低对数概率token,而使用单一固定负向优势即可匹配教师提供监督的效果。这表明策略内蒸馏主要通过抑制低对数概率token发挥作用,且无需教师参与。这些发现催生了策略内自适应法——一种无需监督、采用熵自适应负向优势的方法。该方法为高熵位置分配更强的学习信号以抑制尾部token,同时在头部token间均匀重分配概率质量。相比基础模型Qwen3-1.7B,OPSA在AIME24上使Avg@32提升35.41分(相对增长263%),并在所有三个基准测试中使Pass@32提升超过一倍。其Avg@32在AIME24上亦优于OPD 16.77分。跨模型族与任务的广泛实验进一步验证了其有效性与泛化能力。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:55

论文页面 - 在策略蒸馏真的能蒸馏吗?从噪声教师到自我改进

来源:https://huggingface.co/papers/2608.31046

摘要

在策略蒸馏主要依赖抑制低概率词元而非教师引导,这一发现启发了我们提出一种无监督的熵自适应方法,该方法显著提升了推理性能。

在策略蒸馏(OPD)作为一种替代方案,提供了密集的词元级监督,以替代带有可验证奖励的强化学习(RLVR)中稀疏的结果级优势。然而,教师为学生生成的轨迹打分,而这些轨迹对其而言本质上是异策略的,因此教师监督的可靠性,以及学生改进的来源,仍然不明确。我们定量分析了OPD训练期间的教师监督,发现了大量噪声,且噪声的普遍性随教师规模的增加而上升。令人惊讶的是,学生策略对这种噪声并不敏感,无论是否保留噪声监督,最终都能收敛到相近的性能。那么,OPD真的在“蒸馏“吗?通过分析其性能提升的驱动因素,我们发现学习主要集中在低对数概率词元上,并且使用一个固定的负优势就能匹配教师提供优势所达到的效果。这表明,OPD主要是通过抑制低对数概率词元来发挥作用的,而这并不需要教师。这些发现启发我们提出了在策略自适应(OPSA),这是一种无监督的方法,采用熵自适应的负优势。它为高熵位置分配更强的学习信号,抑制尾部词元,并在头部词元间均匀重新分配概率质量。与基础模型Qwen3-1.7B相比,OPSA在AIME24基准上的Avg@32提升了35.41分,对应263%的相对收益,并且在所有三个基准测试中Pass@32均提升了一倍以上。在AIME24上,其Avg@32也比OPD高出16.77分。跨模型系列和任务的大量实验与分析进一步证明了其有效性和泛化能力。

查看arXiv页面 (https://arxiv.org/abs/2608.31046) 查看PDF (https://arxiv.org/pdf/2608.31046) 项目页面 (https://dripnowhy.github.io/On-Policy-Self-Adaptation/) GitHub仓库 (https://github.com/DripNowhy/On-Policy-Self-Adaptation) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.31046)

在你的智能体中获取此论文:

hf papers read 2608.31046

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 3个

Tuwhy/Qwen3-1.7B-OPSA 文本生成 • 2B • 大约9小时前更新 • 357 (https://huggingface.co/Tuwhy/Qwen3-1.7B-OPSA)

Tuwhy/Qwen3-4B-OPSA 文本生成 • 4B • 大约9小时前更新 • 356 (https://huggingface.co/Tuwhy/Qwen3-4B-OPSA)

Tuwhy/Qwen3.5-9B-OPSA 图像-文本到文本 • 10B • 大约9小时前更新 • 12 (https://huggingface.co/Tuwhy/Qwen3.5-9B-OPSA)

引用此论文的数据集 0个

暂无链接此论文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2608.31046 以将其链接到此页面。

引用此论文的Space 0个

暂无链接此论文的Space

在Space的 README.md 中引用 arxiv.org/abs/2608.31046 以将其链接到此页面。

包含此论文的收藏 2个

相似文章

当教师误导:虚假信号感知的在线策略蒸馏

Hugging Face Daily Papers

本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。

超越模仿:基于推理进展过滤策略蒸馏

arXiv cs.AI

论文提出了Reasoning-Progress-Aware Reward Filtering for On-Policy Distillation (R2-OPD) 来解决教师派生奖励与真实推理进展之间的不匹配问题,提高语言模型训练中的推理性能。

OPRD:在策略表示蒸馏

Hugging Face Daily Papers

OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。

揭秘 On-Policy Distillation:角色、病理与调控

Hugging Face Daily Papers

本文系统研究了LLM后训练中的on-policy distillation,阐明了其作为探索催化剂的作用,并识别了Student-Teacher Mismatch和Length Exploitation等病理现象,提出了轻量级信号调控方法。

揭秘同策略蒸馏:其益处、危害及原因

Hugging Face Daily Papers

本文介绍了一种无需训练的框架,用于分析推理模型在逐token级别上的蒸馏信号。研究揭示,蒸馏引导在错误推理路径上更为有效,且其效果取决于学生模型的能力及任务上下文。