无需任何监督的同策略自蒸馏
摘要
介绍了U-OPSD,一种无监督的同策略自蒸馏方法,利用内部一致性和多数投票伪解决方案来改进大语言模型,无需外部监督,在数学基准上达到或超过有监督方法。
查看缓存全文
缓存时间: 2026/08/12 08:22
论文页面 - 无任何监督的同策略自蒸馏
来源:https://huggingface.co/papers/2608.06296
摘要
无监督同策略自蒸馏通过利用内部一致性和多数投票伪解决方案,在无需外部监督的情况下纠正高置信度错误,从而改进大语言模型。
同策略(自)蒸馏(OPD / OPSD)在大语言模型(LLM)的后训练中展现出巨大潜力。然而,现有方法仍严重依赖外部监督,包括真值信号、环境反馈或更大模型的指导,因此尚不能实现真正的“自”蒸馏。在本研究中,我们证明仅通过模型自身的生成结果并利用内部一致性即可实现同策略自蒸馏(https://huggingface.co/papers?q=on-policy%20self-distillation)。我们提出了无监督同策略自蒸馏(https://huggingface.co/papers?q=unsupervised%20on-policy%20self-distillation)(U-OPSD(https://huggingface.co/papers?q=U-OPSD))。U-OPSD(https://huggingface.co/papers?q=U-OPSD)首先采样多个 rollout,并在自一致性(https://huggingface.co/papers?q=self-consistency)阈值下通过多数投票(https://hug
相似文章
向自我未来学习:面向扩散大语言模型的自策略知识蒸馏
介绍了 d-OPSD,这是首个面向扩散大语言模型的自策略知识蒸馏框架,采用后缀条件和步骤级别监督,在推理基准上优于 RLVR 和 SFT 基线。
β-OPSD:以策略优化推导,以自蒸馏训练
本文介绍了β-OPSD,它是同策略自蒸馏(OPSD)的一种泛化形式,将其构建为一个具有可控KL惩罚的策略优化家族。该方法利用蒸馏来近似昂贵的策略优化,在数学基准上提升了稳定性和推理性能。
使用基于策略的自蒸馏方法降低LLM安全对齐中的安全税
本文介绍了OPSA,一种用于LLM安全对齐的基于策略的自蒸馏方法,该方法通过在模型自身的轨迹上进行训练,并使用教师翻转率激活潜在的安全推理,从而降低了安全税,在多个模型规模上实现了更强的安全-推理权衡。
dOPSD:扩散语言模型中的在线策略自蒸馏方法
本文介绍了 dOPSD,一种面向扩散语言模型的在线策略自蒸馏方法,该方法利用内部去噪轨迹来提升数学推理和代码生成能力。
在策略自蒸馏中尊重自不确定性以实现高效LLM推理
本文提出了EGRSD和CL-EGRSD,这是在策略自蒸馏方法,通过教师熵对令牌级监督进行加权,以改善大语言模型推理准确性-长度的权衡,并在Qwen3-4B和Qwen3-8B上进行了评估。