OmniOPD: 通过推测验证实现无Logit的同策略蒸馏
摘要
OmniOPD 提出了一种无Logit的同策略蒸馏方法,利用块级语义相似性和推测验证,在黑盒教师指导下训练学生模型,在数学基准上相比标准OPD实现了高达+28.64%的提升。
查看缓存全文
缓存时间: 2026/06/03 19:39
论文页面 - OmniOPD:基于推测性验证的无对数概率在线蒸馏
来源:https://huggingface.co/papers/2606.01476
摘要
OmniOPD 通过使用分块级语义相似度替代词元级对数概率,解决了标准在线蒸馏的局限性,在与黑盒教师模型配合时提升了学习可靠性和性能。
在线蒸馏(On-Policy Distillation,OPD)(https://huggingface.co/papers?q=On-Policy%20Distillation)通过让学生模型在其自身生成轨迹下接受更强教师模型的密集词元级反馈(https://huggingface.co/papers?q=token-level%20feedback)进行训练,既缓解了监督微调(Supervised Fine-Tuning,SFT)(https://huggingface.co/papers?q=Supervised%20Fine-Tuning)中的离策略分布偏移问题,也克服了强化学习(Reinforcement Learning,RL)(https://huggingface.co/papers?q=Reinforcement%20Learning)中稀疏的信用分配问题。然而,标准 OPD 面临两个相互关联的局限性。首先,它要求直接访问教师模型的词元级对数概率,从而将一大批功能强大的专有模型排除在教师角色之外。其次,词元级对数概率信号本身是脆弱的,它依赖于教师和学生之间合理下一个词元的狭窄重叠区域,并且容易放大重复循环等退化模式。在本文中,我们提出 OmniOPD,一个新颖的框架,通过一种无对数概率的分块级监督信号来解决这两个局限性。OmniOPD 将确定性的对数概率匹配(logit matching)(https://huggingface.co/papers?q=logit%20matching)替换为蒙特卡洛展开(Monte Carlo rollouts)(https://huggingface.co/papers?q=Monte%20Carlo%20rollouts),该方法通过一个跨多词元分块的连续语义相似度(semantic similarity)(https://huggingface.co/papers?q=semantic%20similarity)指标来近似教师模型的局部偏好,并通过一个峰值熵调度器(peak-entropy scheduler)(https://huggingface.co/papers?q=peak-entropy%20scheduler)集中这种监督,该调度器仅在学生的高不确定性推理分叉点进行审计。一个 Dirichlet-Multinomial 贝叶斯先验(Dirichlet-Multinomial Bayesian prior)(https://huggingface.co/papers?q=Dirichlet-Multinomial%20Bayesian%20prior)和一个基础模型 KL 锚点进一步限制了离散采样的方差,并防止了未审计词元上的策略崩溃(policy collapse)(https://huggingface.co/papers?q=policy%20collapse)。在多个竞争性基准测试中,OmniOPD 在数学任务上比标准 OPD 方法最多提升了 +28.64%,证实了分块级语义验证提取到的学习信号比词元级对数概率匹配(logit matching)(https://huggingface.co/papers?q=logit%20matching)更可靠,后者虽然信息密度高,但被显著的噪声和脆弱性所抵消。此外,当与更强的黑盒教师模型(black-box teachers)(https://huggingface.co/papers?q=black-box%20teachers)(如 Claude-4.5-Haiku 和 Gemini-2.5-Flash)搭配使用时,OmniOPD 在数学任务上相比其开放权重教师版本额外实现了 +9.54% 的相对提升,使学生模型超越了自我探索强化学习的性能。
查看 arXiv 页面(https://arxiv.org/abs/2606.01476)查看 PDF(https://arxiv.org/pdf/2606.01476)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.01476)
引用该论文的模型 0
暂无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.01476,以使其与此页面关联。
引用该论文的数据集 0
暂无数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.01476,以使其与此页面关联。
引用该论文的 Spaces 0
暂无 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.01476,以使其与此页面关联。
包含该论文的收藏集 0
暂无收藏集包含此论文
请将此论文添加到一个收藏集(https://huggingface.co/new-collection)中,以使其与此页面关联。
相似文章
SG-OPD:通过符号一致性门控和分阶段教师采样的符号门控在线策略蒸馏
符号门控在线策略蒸馏(SG-OPD)通过使用二元验证器作为教师监督的信任信号,增强了标准在线策略蒸馏,在竞赛级数学推理基准上提升了性能。
OPRD:在策略表示蒸馏
OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。
同策略Delta蒸馏(OPD^2)
本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。
@louieworth: 新博客文章:On-Policy Distillation — 前景、陷阱与展望
这篇博客文章讨论了On-Policy Distillation (OPD),这是一种结合在线策略 rollout 与密集教师监督的技术,并重点介绍了其前景、三种失败模式以及作者关于该主题的新论文。
DiffusionOPD:扩散模型中在线策略蒸馏的统一视角
DiffusionOPD提出了一种扩散模型的多任务训练范式,利用在线策略蒸馏将任务特定的教师模型高效地整合到统一的学生模型中,在所有评估基准上取得了最先进的结果。