利用在线策略逆蒸馏实现弱到强泛化
摘要
论文提出了在线策略逆蒸馏(OPRD)方法,该方法通过沿教师策略偏移方向放大验证器支持的策略梯度,使更强的AI模型能够超越较弱的监督者,在蒸馏场景中以更少的更新次数获得更高性能。
查看缓存全文
缓存时间: 2026/09/09 04:28
论文页面 - 通过在线策略反向蒸馏激发弱到强泛化
来源:https://huggingface.co/papers/2609.08798
摘要
在线策略反向蒸馏使更强的模型能够超越弱监督者,方法是通过放大验证器支持的策略梯度,沿教师模型的偏移方向加速优化,而不施加容量限制。 弱到强泛化(https://huggingface.co/papers?q=Weak-to-strong%20generalization)研究更强的模型是否能从弱监督者那里学习并超越他们。这个问题对于模型的世代演进和多领域整合尤其重要,因为在这些场景中,从头开始重复前沿规模的后训练可能极其昂贵。然而,传统的蒸馏方法将弱教师模型视为优化目标,这可能会将其能力上限强加给学生模型。我们提出了在线策略反向蒸馏(OPRD)(https://huggingface.co/papers?q=On-Policy%20Reverse%20Distillation),该方法在学生模型的轨迹上评估教师模型相对于其参考策略的策略偏移,并放大由学生模型验证器驱动的策略梯度(https://huggingface.co/papers?q=policy%20gradient)在该方向上的分量。通过仅重新缩放验证器支持的更新,OPRD 在保持策略优化驻点的同时,加速了超越教师模型的学习过程。在连续的模型迁移和多教师蒸馏(https://huggingface.co/papers?q=multi-teacher%20distillation)中,OPRD 相比现有的强化学习和蒸馏方法,以更少的学生更新次数实现了更高的性能。响应风格分析表明,OPRD 训练出的学生模型与仅使用基于验证器的强化学习训练的模型更为接近,而与其弱教师模型的距离较远,这表明教师的指导加速而非重定向了学生自身的优化过程。在传统的强到弱蒸馏设置中的结果进一步证明,无论容量顺序如何,OPRD 都能有效地结合基于验证器的策略优化(https://huggingface.co/papers?q=verifier-driven%20policy%20optimization)与教师指导。
查看 arXiv 页面 (https://arxiv.org/abs/2609.08798) 查看 PDF (https://arxiv.org/pdf/2609.08798) GitHub3 (https://github.com/raymin0223/on_policy_reverse_distillation) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.08798)
在您的代理中获取本文:
hf papers read 2609\.08798
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
没有模型链接到本文
在模型的 README.md 中引用 arxiv.org/abs/2609.08798 以从此页面链接它。
引用本文的数据集 0
没有数据集链接到本文
在数据集的 README.md 中引用 arxiv.org/abs/2609.08798 以从此页面链接它。
引用本文的 Space 0
没有 Space 链接到本文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.08798 以从此页面链接它。
包含本文的合集 0
没有合集包含本文
将本文添加到合集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
通过直接在线策略蒸馏实现弱到强泛化
Direct-OPD 通过从小模型的预强化学习和后强化学习检查点中蒸馏策略变化,利用在线策略蒸馏改进较大的学生模型,无需在学生模型上执行昂贵的强化学习即可实现显著提升。
策略内蒸馏真的在蒸馏吗?从嘈杂教师到自我改进
本文分析了策略内蒸馏,揭示其主要通过抑制低概率token而非依赖教师指导来实现改进,并提出了无需监督的OPSA方法,显著提升了推理性能。
Weak-to-Strong On-Policy Distillation
介绍了 Weak-to-Strong On-Policy Distillation(W2S-OPD)框架,该框架通过使用对比对在 logit 空间中对多个较弱模型进行蒸馏,从而改进强语言模型,在数学和代码基准测试上始终优于标准同策略蒸馏。
基于策略的蒸馏与离策略GRPO结合:训练紧凑指令遵循重排序器
本文提出了一种基于强化学习的蒸馏框架,用于训练紧凑的指令遵循重排序器。该框架使用离策略GRPO增强教师模型,并通过基于策略的蒸馏训练学生模型,在分布偏移下展现出优越性能。
同策略Delta蒸馏(OPD^2)
本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。