面向LLM的高效知识蒸馏:离线Top-K Logits与融合分块KL损失
摘要
本文对如何让LLM的知识蒸馏训练更高效进行了实践研究,引入了离线Top-K logits缓存和一种融合的分块KL损失,从而减少内存尖峰,并允许在单张GPU上训练更长的上下文。
查看缓存全文
缓存时间: 2026/08/10 14:15
论文页面 - 高效的大语言模型知识蒸馏:离线 Top-K Logits 与融合的分块 KL 损失
来源:https://huggingface.co/papers/2608.03796
摘要
小语言模型通常是在严格的延迟、成本和本地部署约束下唯一可行的部署选择,但它们很少从零开始训练:压缩模型通常通过知识蒸馏(KD)恢复。这一恢复步骤在很大程度上决定了最终质量,但其成本高昂。我们提供了一份面向实践者的研究,围绕两个系统层面的贡献来探讨如何让蒸馏训练更高效。首先,我们证明离线 KD(一次性缓存教师模型的 top-K logits,并让学生模型针对缓存进行训练)能够以几乎相同的训练损失匹配在线蒸馏,同时将教师模型从内存中移除,每次迭代速度提升约 29%,在单个 H200 GPU 上吞吐量最高可提升 41%。其次,我们引入一种融合的分块 KL 损失,它从不显式构造完整的词表大小的 logit 张量,使峰值内存随序列长度线性增长。这消除了原本会限制上下文长度的内存尖峰,使我们能够在单个 GPU 上以四倍的上下文长度(32,768 个 token)进行训练。一个独立的仅输出头玩具基准将损失内核隔离开来,验证了其在 4K 到 256K token 范围内的内存与迭代速率扩展性。综合起来,这些方法使大规模修复和数百次消融实验变得可行。我们还报告了关于损失设计和序列打包的辅助消融实验。我们开源了分块损失实现:https://github.com/CompactifAI/Full-Chunked-KL-Loss。
查看 arXiv 页面 (https://arxiv.org/abs/2608.03796)
查看 PDF (https://arxiv.org/pdf/2608.03796)
项目页面 (https://multiversecomputing.com/)
GitHub3 (https://github.com/CompactifAI/Full-Chunked-KL-Loss)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03796)
在您的 agent 中获取此论文:
hf papers read 2608\.03796
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型2
MultiverseComputingCAI/Hypernova-60B-2605 文本生成 • 59B • 更新于3天前 • 1.45k • 15 (https://huggingface.co/MultiverseComputingCAI/Hypernova-60B-2605)
MultiverseComputingCAI/LittleLamb 文本生成 • 0.3B • 更新于3天前 • 1.6k • 9 (https://huggingface.co/MultiverseComputingCAI/LittleLamb)
引用此论文的数据集0
没有数据集链接到此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.03796 即可从此页面链接到该数据集。
引用此论文的 Space0
没有 Space 链接到此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.03796 即可从此页面链接到该 Space。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到它。
相似文章
让知识蒸馏的成本低到足以大规模运行
Multiverse Computing 发布了一篇论文,介绍如何通过离线 top-K logits 和融合的分块 KL 损失来降低 LLM 知识蒸馏的成本,从而减少大规模蒸馏时的显存占用。
FLoKD:用于无线网络上联邦低秩LLM的自适应知识蒸馏
本文提出FLoKD,一种用于无线网络上联邦LoRA微调LLM的自适应知识蒸馏框架,可将通信开销降低50-65%,同时保持竞争性能。
通过知识蒸馏将大语言模型转化为高效的交叉编码器以用于RAG重排序
本文提出了一种方法,将LLaMA 3 8B微调为高效的检索增强生成重排序器,利用知识蒸馏和4位量化,在检索指标上比交叉编码器基线提升14-21%,同时降低了推理成本。
分层课程学习用于高效大语言模型压缩
本文提出了一种分层课程学习方法,用于高效压缩大语言模型,该方法以显著降低GPU内存占用和训练时间,实现了最先进性能。
通过交互作用统一解释大型语言模型知识蒸馏的方法
本文提出了一种基于博弈论交互的统一方法,用于解释大型语言模型中的知识蒸馏,发现蒸馏会稀疏化交互,并引入了一种损失函数CIP来提升性能。