同策略Delta蒸馏(OPD^2)

Hugging Face Daily Papers 论文

摘要

本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。

同策略蒸馏是强化学习中的一种替代后训练方法,通过从教师模型提供令牌级监督来缓解奖励模型带来的约束。尽管同策略蒸馏已在多种场景中得到研究和应用,但其基本设计仍未得到充分探索。在本文中,我们引入一种新的蒸馏奖励——差异信号,而非直接模仿教师模型的输出分布。差异信号定义为教师模型与在推理能力指令调优之前的基础模型之间的差异。因此,它捕捉了推理调优引起的变化,并为迁移推理能力提供了更直接的信号。通过大量实证证据,我们证明差异信号显著改进了同策略蒸馏,并将这种新蒸馏方法称为同策略Delta蒸馏(OPD^2)。在数学、科学和代码推理基准上的实验表明,OPD^2始终优于传统的同策略蒸馏,使推理大语言模型在仅需短时间后训练的情况下就能实现强性能。代码将发布在 https://github.com/naver-ai/opd2
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:40

论文页面 - On-Policy Delta Distillation

来源:https://huggingface.co/papers/2607.15161

摘要

On-policy distillation 是一种替代性的强化学习后训练方法,通过从教师模型提供 token 级别的监督信号,缓解了奖励模型带来的约束。尽管 on-policy distillation 已在多种场景下得到研究和应用,但其基础设计仍未被充分探索。本文引入一种新的蒸馏奖励信号,称为 delta 信号,而非直接模仿教师模型的输出分布。Delta 信号定义为教师模型与其基础模型(在针对推理能力进行指令微调之前)之间的差异。因此,它捕捉了由推理微调引起的变化,并为迁移推理能力提供了更直接的信号。通过大量实证证据,我们证明 delta 信号显著提升了 on-policy distillation 的效果,并将这种新蒸馏方法称为 On-Policy Delta Distillation(OPD²)。在数学、科学和代码推理基准上的实验表明,OPD² 持续优于传统的 on-policy distillation,使得推理大语言模型(reasoning LLM)只需较短的后训练周期即可获得强性能。代码将在 https://github.com/naver-ai/opd2 提供

查看 arXiv 页面 (https://arxiv.org/abs/2607.15161) 查看 PDF (https://arxiv.org/pdf/2607.15161) GitHub1 (https://github.com/naver-ai/opd2) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.15161)

在您的 agent 中获取这篇论文:

hf papers read 2607.15161

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型

没有模型链接到本论文

请在模型 README.md 中引用 arxiv.org/abs/2607.15161 以从本页面链接。

引用本论文的数据集

没有数据集链接到本论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.15161 以从本页面链接。

引用本论文的 Spaces

没有 Space 链接到本论文

请在 Space README.md 中引用 arxiv.org/abs/2607.15161 以从本页面链接。

包含本论文的收藏

没有收藏包含本论文

请将本论文添加到一个收藏 (https://huggingface.co/new-collection) 中以从本页面链接。

相似文章

超越模仿:基于推理进展过滤策略蒸馏

arXiv cs.AI

论文提出了Reasoning-Progress-Aware Reward Filtering for On-Policy Distillation (R2-OPD) 来解决教师派生奖励与真实推理进展之间的不匹配问题,提高语言模型训练中的推理性能。

面向多语言数学推理的同策略Delta蒸馏

Hugging Face Daily Papers

本文研究了同策略Delta蒸馏(OPD^2)在英语、韩语和日语中的多语言数学推理,显示其相对于标准OPD的一致改进,并缩小了语言差距。

OPRD:在策略表示蒸馏

Hugging Face Daily Papers

OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。