OmniOPD: 通过推测验证实现无Logit的同策略蒸馏

Hugging Face Daily Papers 论文

摘要

OmniOPD 提出了一种无Logit的同策略蒸馏方法,利用块级语义相似性和推测验证,在黑盒教师指导下训练学生模型,在数学基准上相比标准OPD实现了高达+28.64%的提升。

同策略蒸馏(OPD)在强大教师模型的密集token级反馈下,利用学生模型自身的生成轨迹进行训练,从而缓解了监督微调(SFT)的离策略分布偏移和强化学习(RL)的稀疏信用分配问题。然而,标准OPD面临两个相互关联的限制。首先,它需要直接访问教师模型的token级logits,从而排除了大量功能强大的专有模型作为教师。其次,token级logit信号本身较为脆弱,依赖于教师和学生之间合理下一token的狭窄重叠,并且容易放大重复循环等退化模式。本文中,我们提出了OmniOPD,这是一个新型框架,通过无logit的块级监督信号解决了这两个限制。OmniOPD用蒙特卡洛rollout替代了确定性的logit匹配,通过多token块上的连续语义相似性度量来近似教师模型的局部偏好,并通过峰值熵调度器集中这种监督,该调度器仅在学生模型高不确定性的推理分支处进行审计。狄利克雷-多项贝叶斯先验和基础模型的KL锚进一步限制了离散采样的方差,并防止了未经审计token上的策略崩溃。在竞争性基准测试中,OmniOPD在数学上比标准OPD方法高出高达+28.64%,证实了块级语义验证比token级logit匹配提取了更可靠的学习信号,后者的高信息密度被显著的噪声和脆弱性所抵消。此外,当与更强大的黑盒教师(如Claude-4.5-Haiku和Gemini-2.5-Flash)配对时,OmniOPD在数学上相比其开放权重教师对应模型额外获得了+9.54%的相对提升,使学生模型超越自探索RL的性能。
查看原文
查看缓存全文

缓存时间: 2026/06/03 19:39

论文页面 - OmniOPD:基于推测性验证的无对数概率在线蒸馏

来源:https://huggingface.co/papers/2606.01476

摘要

OmniOPD 通过使用分块级语义相似度替代词元级对数概率,解决了标准在线蒸馏的局限性,在与黑盒教师模型配合时提升了学习可靠性和性能。

在线蒸馏(On-Policy Distillation,OPD)(https://huggingface.co/papers?q=On-Policy%20Distillation)通过让学生模型在其自身生成轨迹下接受更强教师模型的密集词元级反馈(https://huggingface.co/papers?q=token-level%20feedback)进行训练,既缓解了监督微调(Supervised Fine-Tuning,SFT)(https://huggingface.co/papers?q=Supervised%20Fine-Tuning)中的离策略分布偏移问题,也克服了强化学习(Reinforcement Learning,RL)(https://huggingface.co/papers?q=Reinforcement%20Learning)中稀疏的信用分配问题。然而,标准 OPD 面临两个相互关联的局限性。首先,它要求直接访问教师模型的词元级对数概率,从而将一大批功能强大的专有模型排除在教师角色之外。其次,词元级对数概率信号本身是脆弱的,它依赖于教师和学生之间合理下一个词元的狭窄重叠区域,并且容易放大重复循环等退化模式。在本文中,我们提出 OmniOPD,一个新颖的框架,通过一种无对数概率的分块级监督信号来解决这两个局限性。OmniOPD 将确定性的对数概率匹配(logit matching)(https://huggingface.co/papers?q=logit%20matching)替换为蒙特卡洛展开(Monte Carlo rollouts)(https://huggingface.co/papers?q=Monte%20Carlo%20rollouts),该方法通过一个跨多词元分块的连续语义相似度(semantic similarity)(https://huggingface.co/papers?q=semantic%20similarity)指标来近似教师模型的局部偏好,并通过一个峰值熵调度器(peak-entropy scheduler)(https://huggingface.co/papers?q=peak-entropy%20scheduler)集中这种监督,该调度器仅在学生的高不确定性推理分叉点进行审计。一个 Dirichlet-Multinomial 贝叶斯先验(Dirichlet-Multinomial Bayesian prior)(https://huggingface.co/papers?q=Dirichlet-Multinomial%20Bayesian%20prior)和一个基础模型 KL 锚点进一步限制了离散采样的方差,并防止了未审计词元上的策略崩溃(policy collapse)(https://huggingface.co/papers?q=policy%20collapse)。在多个竞争性基准测试中,OmniOPD 在数学任务上比标准 OPD 方法最多提升了 +28.64%,证实了分块级语义验证提取到的学习信号比词元级对数概率匹配(logit matching)(https://huggingface.co/papers?q=logit%20matching)更可靠,后者虽然信息密度高,但被显著的噪声和脆弱性所抵消。此外,当与更强的黑盒教师模型(black-box teachers)(https://huggingface.co/papers?q=black-box%20teachers)(如 Claude-4.5-Haiku 和 Gemini-2.5-Flash)搭配使用时,OmniOPD 在数学任务上相比其开放权重教师版本额外实现了 +9.54% 的相对提升,使学生模型超越了自我探索强化学习的性能。

查看 arXiv 页面(https://arxiv.org/abs/2606.01476)查看 PDF(https://arxiv.org/pdf/2606.01476)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.01476)

引用该论文的模型 0

暂无模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.01476,以使其与此页面关联。

引用该论文的数据集 0

暂无数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2606.01476,以使其与此页面关联。

引用该论文的 Spaces 0

暂无 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2606.01476,以使其与此页面关联。

包含该论文的收藏集 0

暂无收藏集包含此论文

请将此论文添加到一个收藏集(https://huggingface.co/new-collection)中,以使其与此页面关联。

相似文章

OPRD:在策略表示蒸馏

Hugging Face Daily Papers

OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。

同策略Delta蒸馏(OPD^2)

Hugging Face Daily Papers

本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。