基于评分细则的在策略蒸馏
摘要
本文提出了 ROPD,一种基于评分细则的在策略蒸馏框架,相比传统的基于 logits 的方法,该框架在样本效率上表现更优。它通过使用结构化的语义评分细则而非教师 logits,实现了黑盒场景下的模型对齐。
查看缓存全文
缓存时间: 2026/05/11 22:51
论文页面 - 基于评分标准的在线策略蒸馏
来源:https://huggingface.co/papers/2605.07396
摘要
基于评分标准的在线策略蒸馏相比传统基于 logits 的方法,展现了更优的样本效率,同时保持了对黑盒场景的兼容性。
在线策略蒸馏(https://huggingface.co/papers?q=On-policy%20distillation)(OPD)是一种强大的模型对齐范式,然而其对教师 logits(https://huggingface.co/papers?q=teacher%20logits)的依赖限制了其在白盒场景中的应用。我们认为,结构化的语义评分标准(https://huggingface.co/papers?q=structured%20semantic%20rubrics)可以作为教师 logits(https://huggingface.co/papers?q=teacher%20logits)的可扩展替代方案,从而仅利用教师生成的响应即可实现在线策略蒸馏。为证明这一点,我们提出了 ROPD,一个简单但基础性的基于评分标准的在线策略蒸馏框架。具体而言,ROPD 从师生对比(https://huggingface.co/papers?q=teacher-student%20contrasts)中推导出特定于提示的评分标准(https://huggingface.co/papers?q=prompt-specific%20rubrics),然后利用这些评分标准对学生 rollout 进行评分,以进行在线策略优化。实证结果表明,在大多数场景下,ROPD 均优于先进的基于 logits 的在线策略蒸馏方法,并在样本效率(https://huggingface.co/papers?q=sample%20efficiency)上实现了高达 10 倍的提升。这些结果将基于评分标准的在线策略蒸馏确立为一种灵活且兼容黑盒的替代方案,可替代主流的基于 logits 的在线策略蒸馏,为在专有和开源 LLM 之间进行可扩展蒸馏(https://huggingface.co/papers?q=scalable%20distillation)提供了一个简单但强大的基线。代码已开源在 https://github.com/Peregrine123/ROPD_official。
查看 arXiv 页面(https://arxiv.org/abs/2605.07396)查看 PDF(https://arxiv.org/pdf/2605.07396)GitHub(https://github.com/Peregrine123/ROPD_official)加入收藏集(https://huggingface.co/login?next=%2Fpapers%2F2605.07396)
在你的 agent 中获取这篇论文:
hf papers read 2605.07396
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
暂无模型引用此论文
在模型 README.md 中引用 arxiv.org/abs/2605.07396 以从此页面链接。
引用本文的数据集 0
暂无数据集引用此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.07396 以从此页面链接。
引用本文的 Space 0
暂无 Space 引用此论文
在 Space README.md 中引用 arxiv.org/abs/2605.07396 以从此页面链接。
包含本文的收藏集 0
暂无收藏集包含此论文
将此论文添加到一个收藏集(https://huggingface.co/new-collection)以从此页面链接。
相似文章
OPRD:在策略表示蒸馏
OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。
On-policy distillation: 在PapersWithCode上最热门术语之一 [R]
Hugging Face的Niels介绍了On-policy Distillation (OPD),这是一种关键的后训练技术,用于Qwen 3.6/3.7、GLM-5.1和DeepSeek-V4等模型。该技术现已收录于PapersWithCode,并附有Sasha Rush和Dwarkesh Patel的白板讲解链接。
通过直接在线策略蒸馏实现弱到强泛化
Direct-OPD 通过从小模型的预强化学习和后强化学习检查点中蒸馏策略变化,利用在线策略蒸馏改进较大的学生模型,无需在学生模型上执行昂贵的强化学习即可实现显著提升。
同策略Delta蒸馏(OPD^2)
本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。