基于评分细则的在策略蒸馏

Hugging Face Daily Papers 论文

摘要

本文提出了 ROPD,一种基于评分细则的在策略蒸馏框架,相比传统的基于 logits 的方法,该框架在样本效率上表现更优。它通过使用结构化的语义评分细则而非教师 logits,实现了黑盒场景下的模型对齐。

在策略蒸馏(OPD)是模型对齐的一种强大范式,然而其对教师 logits 的依赖限制其仅适用于白盒场景。我们认为,结构化的语义评分细则可以作为教师 logits 的可扩展替代方案,使得仅用教师生成的响应即可进行 OPD。为证明这一点,我们提出了 ROPD,一个简单但基础性的基于评分细则的在策略蒸馏框架。具体而言,ROPD 从教师与学生的对比中诱导出针对特定提示的评分细则,然后利用这些细则对学生生成的 rollout 进行评分,以进行在策略优化。实验表明,ROPD 在大多数场景下优于先进的基于 logits 的 OPD 方法,并且在样本效率上实现了最高 10 倍的提升。这些结果使得基于评分细则的 OPD 成为主流基于 logits 的 OPD 的一种灵活、兼容黑盒的替代方案,为跨专有和开源 LLMs 的可扩展蒸馏提供了一个简单而强大的基线。代码见 https://github.com/Peregrine123/ROPD_official。
查看原文
查看缓存全文

缓存时间: 2026/05/11 22:51

论文页面 - 基于评分标准的在线策略蒸馏

来源:https://huggingface.co/papers/2605.07396

摘要

基于评分标准的在线策略蒸馏相比传统基于 logits 的方法,展现了更优的样本效率,同时保持了对黑盒场景的兼容性。

在线策略蒸馏(https://huggingface.co/papers?q=On-policy%20distillation)(OPD)是一种强大的模型对齐范式,然而其对教师 logits(https://huggingface.co/papers?q=teacher%20logits)的依赖限制了其在白盒场景中的应用。我们认为,结构化的语义评分标准(https://huggingface.co/papers?q=structured%20semantic%20rubrics)可以作为教师 logits(https://huggingface.co/papers?q=teacher%20logits)的可扩展替代方案,从而仅利用教师生成的响应即可实现在线策略蒸馏。为证明这一点,我们提出了 ROPD,一个简单但基础性的基于评分标准的在线策略蒸馏框架。具体而言,ROPD 从师生对比(https://huggingface.co/papers?q=teacher-student%20contrasts)中推导出特定于提示的评分标准(https://huggingface.co/papers?q=prompt-specific%20rubrics),然后利用这些评分标准对学生 rollout 进行评分,以进行在线策略优化。实证结果表明,在大多数场景下,ROPD 均优于先进的基于 logits 的在线策略蒸馏方法,并在样本效率(https://huggingface.co/papers?q=sample%20efficiency)上实现了高达 10 倍的提升。这些结果将基于评分标准的在线策略蒸馏确立为一种灵活且兼容黑盒的替代方案,可替代主流的基于 logits 的在线策略蒸馏,为在专有和开源 LLM 之间进行可扩展蒸馏(https://huggingface.co/papers?q=scalable%20distillation)提供了一个简单但强大的基线。代码已开源在 https://github.com/Peregrine123/ROPD_official。

查看 arXiv 页面(https://arxiv.org/abs/2605.07396)查看 PDF(https://arxiv.org/pdf/2605.07396)GitHub(https://github.com/Peregrine123/ROPD_official)加入收藏集(https://huggingface.co/login?next=%2Fpapers%2F2605.07396)

在你的 agent 中获取这篇论文:

hf papers read 2605.07396

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

暂无模型引用此论文

在模型 README.md 中引用 arxiv.org/abs/2605.07396 以从此页面链接。

引用本文的数据集 0

暂无数据集引用此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.07396 以从此页面链接。

引用本文的 Space 0

暂无 Space 引用此论文

在 Space README.md 中引用 arxiv.org/abs/2605.07396 以从此页面链接。

包含本文的收藏集 0

暂无收藏集包含此论文

将此论文添加到一个收藏集(https://huggingface.co/new-collection)以从此页面链接。

相似文章

OPRD:在策略表示蒸馏

Hugging Face Daily Papers

OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。

On-policy distillation: 在PapersWithCode上最热门术语之一 [R]

Reddit r/MachineLearning

Hugging Face的Niels介绍了On-policy Distillation (OPD),这是一种关键的后训练技术,用于Qwen 3.6/3.7、GLM-5.1和DeepSeek-V4等模型。该技术现已收录于PapersWithCode,并附有Sasha Rush和Dwarkesh Patel的白板讲解链接。

通过直接在线策略蒸馏实现弱到强泛化

Hugging Face Daily Papers

Direct-OPD 通过从小模型的预强化学习和后强化学习检查点中蒸馏策略变化,利用在线策略蒸馏改进较大的学生模型,无需在学生模型上执行昂贵的强化学习即可实现显著提升。

同策略Delta蒸馏(OPD^2)

Hugging Face Daily Papers

本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。