KL散度在大型语言模型在策略蒸馏中是否必要?
摘要
本文研究KL散度在大型语言模型在策略蒸馏中的必要性,表明仅保留更新方向即可,并提出共识多教师在策略蒸馏(C-MOPD)以增强多教师学习。
查看缓存全文
缓存时间: 2026/09/30 00:13
论文页面 - 我们真的需要KL散度来对大型语言模型进行在线策略蒸馏吗?
来源:https://huggingface.co/papers/2609.33791 作者: , , , , , , , , , , , , ,
摘要
自知识蒸馏出现以来,KL散度一直是蒸馏的标准损失函数。最近,在线策略蒸馏作为一种高效的LLM后训练范式而兴起。作为一种蒸馏方法,OPD自然继承了KL散度作为其标准损失。然而,在这项工作中,我们发现KL散度对于OPD可能并非必需。我们表明,仅保留更新方向就足以实现有效的OPD。只要更新方向是朝着教师模型的,OPD就能发挥作用。更准确地说,关键不在于每个token的方向,而在于教师模型和学生模型强烈不一致的那一小部分token的方向。我们首先表明,仅仅为教师模型概率高于学生模型概率的token分配+1奖励,为低于的token分配-1奖励(这仅鼓励向教师模型更新),几乎能重现与使用反向KL的OPD相同的训练模式。我们进一步证明,只有那一小部分师生分歧较大的token的方向至关重要,只要它们的更新方向朝向教师模型,训练就能有效进行,即使其他token被拉离教师模型。作为这些发现的一个应用,我们引入了共识多教师在线策略蒸馏来改进多教师在线策略蒸馏。与将每个样本路由到单个教师并可能导致跨领域能力冲突的MOPD不同,C-MOPD让每个样本都接受所有教师的监督。实验表明,在数学和代码基准测试中,C-MOPD一致优于MOPD。我们的代码已发布在 https://github.com/LeapLabTHU/KL-Free-OPD。
查看 arXiv 页面 (https://arxiv.org/abs/2609.33791)查看 PDF (https://arxiv.org/pdf/2609.33791)GitHub0 (https://github.com/LeapLabTHU/KL-Free-OPD)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.33791)
通过您的代理获取此论文:
hf papers read 2609.33791
没有最新的 CLI?curl \-LsSf https://hf.co/cli/install.sh \| bash
引用此论文的模型 0
无模型链接此论文 在模型 README.md 中引用 arxiv.org/abs/2609.33791 以从此页面链接。
引用此论文的数据集 0
无数据集链接此论文 在数据集 README.md 中引用 arxiv.org/abs/2609.33791 以从此页面链接。
引用此论文的 Space 0
无 Space 链接此论文 在 Space README.md 中引用 arxiv.org/abs/2609.33791 以从此页面链接。
包含此论文的集合 0
无集合包含此论文 将此论文添加到一个集合 (https://huggingface.co/new-collection)以从此页面链接。
相似文章
反思大语言模型在策略蒸馏 II:单个训练样本
本文研究了大语言模型的在策略蒸馏,表明单个训练查询就能实现显著的状态覆盖和对齐,表明该方法更受算法限制而非数据限制。
硬币的两面:论大语言模型在策略内蒸馏中泛化的双重性
本文研究了大语言模型在策略内蒸馏中的泛化行为,表明它转移了推理行为,并且教师-学生来源对齐至关重要,多教师组合会导致能力权衡。
同策略蒸馏(5分钟阅读)
本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。
重新思考温度在大语言模型蒸馏中的作用
本文重新审视了温度在大语言模型蒸馏中的作用,揭示出温度不对称地更有利于正向KL散度而非反向KL,使得简单的KL方法在较高温度下能够匹敌当前最先进的蒸馏方法。