利用在线策略逆蒸馏实现弱到强泛化

Hugging Face Daily Papers 论文

摘要

论文提出了在线策略逆蒸馏(OPRD)方法,该方法通过沿教师策略偏移方向放大验证器支持的策略梯度,使更强的AI模型能够超越较弱的监督者,在蒸馏场景中以更少的更新次数获得更高性能。

弱到强泛化探讨更强的模型是否能从较弱的监督者那里学习并超越它们。这个问题在连续模型迭代和多领域整合中尤为重要,因为从头重复前沿规模的后训练可能成本过高。然而,传统的蒸馏方法将弱教师视为优化目标,可能会将其能力上限强加给学生。我们提出了On-Policy Reverse Distillation (OPRD)方法,该方法在学生轨迹上评估教师相对于其参考策略的策略偏移,并沿该方向放大学生验证器驱动的策略梯度分量。通过仅重新调整验证器支持的更新,OPRD在加速超越教师的学习同时,保留了策略优化的不动点。在连续模型迁移和多教师蒸馏中,OPRD都比现有的强化学习和蒸馏方法以更少的学生更新次数实现了更高的性能。响应风格分析显示,OPRD学生更接近仅用验证器强化学习训练的模型,而不是他们的弱教师,这表明教师指导加速而非重定向学生自身的优化。在传统强到弱蒸馏中的结果进一步表明,无论能力排序如何,OPRD都能有效结合验证器驱动的策略优化和教师指导。
查看原文
查看缓存全文

缓存时间: 2026/09/09 04:28

论文页面 - 通过在线策略反向蒸馏激发弱到强泛化

来源:https://huggingface.co/papers/2609.08798

摘要

在线策略反向蒸馏使更强的模型能够超越弱监督者,方法是通过放大验证器支持的策略梯度,沿教师模型的偏移方向加速优化,而不施加容量限制。 弱到强泛化(https://huggingface.co/papers?q=Weak-to-strong%20generalization)研究更强的模型是否能从弱监督者那里学习并超越他们。这个问题对于模型的世代演进和多领域整合尤其重要,因为在这些场景中,从头开始重复前沿规模的后训练可能极其昂贵。然而,传统的蒸馏方法将弱教师模型视为优化目标,这可能会将其能力上限强加给学生模型。我们提出了在线策略反向蒸馏(OPRD)(https://huggingface.co/papers?q=On-Policy%20Reverse%20Distillation),该方法在学生模型的轨迹上评估教师模型相对于其参考策略的策略偏移,并放大由学生模型验证器驱动的策略梯度(https://huggingface.co/papers?q=policy%20gradient)在该方向上的分量。通过仅重新缩放验证器支持的更新,OPRD 在保持策略优化驻点的同时,加速了超越教师模型的学习过程。在连续的模型迁移和多教师蒸馏(https://huggingface.co/papers?q=multi-teacher%20distillation)中,OPRD 相比现有的强化学习和蒸馏方法,以更少的学生更新次数实现了更高的性能。响应风格分析表明,OPRD 训练出的学生模型与仅使用基于验证器的强化学习训练的模型更为接近,而与其弱教师模型的距离较远,这表明教师的指导加速而非重定向了学生自身的优化过程。在传统的强到弱蒸馏设置中的结果进一步证明,无论容量顺序如何,OPRD 都能有效地结合基于验证器的策略优化(https://huggingface.co/papers?q=verifier-driven%20policy%20optimization)与教师指导。

查看 arXiv 页面 (https://arxiv.org/abs/2609.08798) 查看 PDF (https://arxiv.org/pdf/2609.08798) GitHub3 (https://github.com/raymin0223/on_policy_reverse_distillation) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.08798)

在您的代理中获取本文:

hf papers read 2609\.08798

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

没有模型链接到本文

在模型的 README.md 中引用 arxiv.org/abs/2609.08798 以从此页面链接它。

引用本文的数据集 0

没有数据集链接到本文

在数据集的 README.md 中引用 arxiv.org/abs/2609.08798 以从此页面链接它。

引用本文的 Space 0

没有 Space 链接到本文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.08798 以从此页面链接它。

包含本文的合集 0

没有合集包含本文

将本文添加到合集 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

通过直接在线策略蒸馏实现弱到强泛化

Hugging Face Daily Papers

Direct-OPD 通过从小模型的预强化学习和后强化学习检查点中蒸馏策略变化,利用在线策略蒸馏改进较大的学生模型,无需在学生模型上执行昂贵的强化学习即可实现显著提升。

Weak-to-Strong On-Policy Distillation

arXiv cs.LG

介绍了 Weak-to-Strong On-Policy Distillation(W2S-OPD)框架,该框架通过使用对比对在 logit 空间中对多个较弱模型进行蒸馏,从而改进强语言模型,在数学和代码基准测试上始终优于标准同策略蒸馏。

同策略Delta蒸馏(OPD^2)

Hugging Face Daily Papers

本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。