同策略Delta蒸馏(OPD^2)

Hugging Face Daily Papers 论文

摘要

本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。

同策略蒸馏是强化学习中的一种替代后训练方法,通过从教师模型提供令牌级监督来缓解奖励模型带来的约束。尽管同策略蒸馏已在多种场景中得到研究和应用,但其基本设计仍未得到充分探索。在本文中,我们引入一种新的蒸馏奖励——差异信号,而非直接模仿教师模型的输出分布。差异信号定义为教师模型与在推理能力指令调优之前的基础模型之间的差异。因此,它捕捉了推理调优引起的变化,并为迁移推理能力提供了更直接的信号。通过大量实证证据,我们证明差异信号显著改进了同策略蒸馏,并将这种新蒸馏方法称为同策略Delta蒸馏(OPD^2)。在数学、科学和代码推理基准上的实验表明,OPD^2始终优于传统的同策略蒸馏,使推理大语言模型在仅需短时间后训练的情况下就能实现强性能。代码将发布在 https://github.com/naver-ai/opd2
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:40

论文页面 - On-Policy Delta Distillation

来源:https://huggingface.co/papers/2607.15161

摘要

On-policy distillation 是一种替代性的强化学习后训练方法,通过从教师模型提供 token 级别的监督信号,缓解了奖励模型带来的约束。尽管 on-policy distillation 已在多种场景下得到研究和应用,但其基础设计仍未被充分探索。本文引入一种新的蒸馏奖励信号,称为 delta 信号,而非直接模仿教师模型的输出分布。Delta 信号定义为教师模型与其基础模型(在针对推理能力进行指令微调之前)之间的差异。因此,它捕捉了由推理微调引起的变化,并为迁移推理能力提供了更直接的信号。通过大量实证证据,我们证明 delta 信号显著提升了 on-policy distillation 的效果,并将这种新蒸馏方法称为 On-Policy Delta Distillation(OPD²)。在数学、科学和代码推理基准上的实验表明,OPD² 持续优于传统的 on-policy distillation,使得推理大语言模型(reasoning LLM)只需较短的后训练周期即可获得强性能。代码将在 https://github.com/naver-ai/opd2 提供

查看 arXiv 页面 (https://arxiv.org/abs/2607.15161) 查看 PDF (https://arxiv.org/pdf/2607.15161) GitHub1 (https://github.com/naver-ai/opd2) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.15161)

在您的 agent 中获取这篇论文:

hf papers read 2607.15161

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型

没有模型链接到本论文

请在模型 README.md 中引用 arxiv.org/abs/2607.15161 以从本页面链接。

引用本论文的数据集

没有数据集链接到本论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.15161 以从本页面链接。

引用本论文的 Spaces

没有 Space 链接到本论文

请在 Space README.md 中引用 arxiv.org/abs/2607.15161 以从本页面链接。

包含本论文的收藏

没有收藏包含本论文

请将本论文添加到一个收藏 (https://huggingface.co/new-collection) 中以从本页面链接。

相似文章

OPRD:在策略表示蒸馏

Hugging Face Daily Papers

OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。

DOPD: 双在线策略蒸馏

Hugging Face Daily Papers

DOPD提出了一种双在线策略蒸馏范式,该范式基于优势差距和概率,在特权教师和学生策略之间动态路由令牌级监督,解决了特权幻觉问题,并提升了LLM和VLM中的能力迁移。

OmniOPD: 通过推测验证实现无Logit的同策略蒸馏

Hugging Face Daily Papers

OmniOPD 提出了一种无Logit的同策略蒸馏方法,利用块级语义相似性和推测验证,在黑盒教师指导下训练学生模型,在数学基准上相比标准OPD实现了高达+28.64%的提升。

On-policy distillation: 在PapersWithCode上最热门术语之一 [R]

Reddit r/MachineLearning

Hugging Face的Niels介绍了On-policy Distillation (OPD),这是一种关键的后训练技术,用于Qwen 3.6/3.7、GLM-5.1和DeepSeek-V4等模型。该技术现已收录于PapersWithCode,并附有Sasha Rush和Dwarkesh Patel的白板讲解链接。