KL散度在大型语言模型在策略蒸馏中是否必要?

Hugging Face Daily Papers 论文

摘要

本文研究KL散度在大型语言模型在策略蒸馏中的必要性,表明仅保留更新方向即可,并提出共识多教师在策略蒸馏(C-MOPD)以增强多教师学习。

自知识蒸馏诞生以来,KL散度一直是蒸馏中的标准损失函数。近年来,在策略蒸馏(OPD)已成为大型语言模型(LLM)的高效后训练范式。作为一种蒸馏方法,OPD自然继承了KL散度作为其标准损失。然而,在本工作中,我们发现KL散度可能对OPD并非必要。我们证明,仅保留更新方向对于有效的OPD就足够了。只要更新方向是朝向教师的,OPD就能工作。更准确地说,并非每个token的方向,而是教师和学生强烈分歧的小部分token的方向。我们首先证明,仅对教师概率高于学生概率的token分配奖励(+1),对较低的分配(-1),这仅鼓励朝向教师的更新,就能复现与反向KL的OPD几乎相同的训练模式。我们进一步证明,只有具有大教师-学生分歧的小部分token的方向是关键的,只要它们的更新方向朝向教师,训练就能工作,即使其他token被拉离教师。作为这些发现的应用,我们引入共识多教师在策略蒸馏(C-MOPD)以改进多教师在策略蒸馏(MOPD)。与MOPD将每个样本路由到单一教师并可能导致跨领域能力冲突不同,C-MOPD让每个样本由所有教师监督。实验表明,C-MOPD在数学和代码基准测试上均持续优于MOPD。我们的代码可在https://github.com/LeapLabTHU/KL-Free-OPD获取。
查看原文
查看缓存全文

缓存时间: 2026/09/30 00:13

论文页面 - 我们真的需要KL散度来对大型语言模型进行在线策略蒸馏吗?

来源:https://huggingface.co/papers/2609.33791 作者: , , , , , , , , , , , , ,

摘要

自知识蒸馏出现以来,KL散度一直是蒸馏的标准损失函数。最近,在线策略蒸馏作为一种高效的LLM后训练范式而兴起。作为一种蒸馏方法,OPD自然继承了KL散度作为其标准损失。然而,在这项工作中,我们发现KL散度对于OPD可能并非必需。我们表明,仅保留更新方向就足以实现有效的OPD。只要更新方向是朝着教师模型的,OPD就能发挥作用。更准确地说,关键不在于每个token的方向,而在于教师模型和学生模型强烈不一致的那一小部分token的方向。我们首先表明,仅仅为教师模型概率高于学生模型概率的token分配+1奖励,为低于的token分配-1奖励(这仅鼓励向教师模型更新),几乎能重现与使用反向KL的OPD相同的训练模式。我们进一步证明,只有那一小部分师生分歧较大的token的方向至关重要,只要它们的更新方向朝向教师模型,训练就能有效进行,即使其他token被拉离教师模型。作为这些发现的一个应用,我们引入了共识多教师在线策略蒸馏来改进多教师在线策略蒸馏。与将每个样本路由到单个教师并可能导致跨领域能力冲突的MOPD不同,C-MOPD让每个样本都接受所有教师的监督。实验表明,在数学和代码基准测试中,C-MOPD一致优于MOPD。我们的代码已发布在 https://github.com/LeapLabTHU/KL-Free-OPD。 查看 arXiv 页面 (https://arxiv.org/abs/2609.33791)查看 PDF (https://arxiv.org/pdf/2609.33791)GitHub0 (https://github.com/LeapLabTHU/KL-Free-OPD)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.33791) 通过您的代理获取此论文: hf papers read 2609.33791 没有最新的 CLI?curl \-LsSf https://hf.co/cli/install.sh \| bash

引用此论文的模型 0

无模型链接此论文 在模型 README.md 中引用 arxiv.org/abs/2609.33791 以从此页面链接。

引用此论文的数据集 0

无数据集链接此论文 在数据集 README.md 中引用 arxiv.org/abs/2609.33791 以从此页面链接。

引用此论文的 Space 0

无 Space 链接此论文 在 Space README.md 中引用 arxiv.org/abs/2609.33791 以从此页面链接。

包含此论文的集合 0

无集合包含此论文 将此论文添加到一个集合 (https://huggingface.co/new-collection)以从此页面链接。

相似文章

同策略蒸馏(5分钟阅读)

TLDR AI

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。

重新思考温度在大语言模型蒸馏中的作用

arXiv cs.LG

本文重新审视了温度在大语言模型蒸馏中的作用,揭示出温度不对称地更有利于正向KL散度而非反向KL,使得简单的KL方法在较高温度下能够匹敌当前最先进的蒸馏方法。