无需任何监督的同策略自蒸馏

Hugging Face Daily Papers 论文

摘要

介绍了U-OPSD,一种无监督的同策略自蒸馏方法,利用内部一致性和多数投票伪解决方案来改进大语言模型,无需外部监督,在数学基准上达到或超过有监督方法。

同策略(自)蒸馏(OPD / OPSD)在大型语言模型(LLM)的后训练中展现出巨大潜力。然而,现有方法仍然严重依赖外部监督,包括真实标签信号、环境反馈或更大模型的指导,因此算不上真正的“自”蒸馏。在本研究中,我们证明仅通过模型自身生成并结合内部一致性即可实现同策略自蒸馏。我们提出了无监督同策略自蒸馏(U-OPSD)。U-OPSD 首先采样多条轨迹,并在自一致性阈值下通过多数投票构建伪解决方案。然后,它以伪解决方案为条件对模型分布进行约束,并在不一致的补全上对自身进行蒸馏,从而使模型能够在自信出错的地方精确地进行自我修正。在不同的基准、基础模型和训练设置下,U-OPSD 始终优于基础模型,并达到或超过使用真实标签(GT)的监督方法(如 OPSD 和 GRPO)。在五个数学推理基准(即 AIME24、AIME25、HMMT25、MATH500 和 AMC23)上,在 Qwen3 非思考模式下,U-OPSD 在 4B 和 8B 规模上分别比基础模型提升 8.5% 和 10.7%,平均分别比 OPSD 高出 3.2% 和 2.3%。在思考模式下,U-OPSD 与 OPSD 持平,在 4B 上领先 0.9%,在 8B 上持平,并分别超过 GRPO 0.7% 和 1.1%。代码可在 [https://github.com/williamium3000/u-opsd](https://github.com/williamium3000/u-opsd) 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:22

论文页面 - 无任何监督的同策略自蒸馏

来源:https://huggingface.co/papers/2608.06296

摘要

无监督同策略自蒸馏通过利用内部一致性和多数投票伪解决方案,在无需外部监督的情况下纠正高置信度错误,从而改进大语言模型。

同策略(自)蒸馏(OPD / OPSD)在大语言模型(LLM)的后训练中展现出巨大潜力。然而,现有方法仍严重依赖外部监督,包括真值信号、环境反馈或更大模型的指导,因此尚不能实现真正的“自”蒸馏。在本研究中,我们证明仅通过模型自身的生成结果并利用内部一致性即可实现同策略自蒸馏(https://huggingface.co/papers?q=on-policy%20self-distillation)。我们提出了无监督同策略自蒸馏(https://huggingface.co/papers?q=unsupervised%20on-policy%20self-distillation)(U-OPSD(https://huggingface.co/papers?q=U-OPSD))。U-OPSD(https://huggingface.co/papers?q=U-OPSD)首先采样多个 rollout,并在自一致性(https://huggingface.co/papers?q=self-consistency)阈值下通过多数投票(https://hug

相似文章

β-OPSD:以策略优化推导,以自蒸馏训练

Hugging Face Daily Papers

本文介绍了β-OPSD,它是同策略自蒸馏(OPSD)的一种泛化形式,将其构建为一个具有可控KL惩罚的策略优化家族。该方法利用蒸馏来近似昂贵的策略优化,在数学基准上提升了稳定性和推理性能。

使用基于策略的自蒸馏方法降低LLM安全对齐中的安全税

arXiv cs.LG

本文介绍了OPSA,一种用于LLM安全对齐的基于策略的自蒸馏方法,该方法通过在模型自身的轨迹上进行训练,并使用教师翻转率激活潜在的安全推理,从而降低了安全税,在多个模型规模上实现了更强的安全-推理权衡。