面向LLM的高效知识蒸馏:离线Top-K Logits与融合分块KL损失

Hugging Face Daily Papers 论文

摘要

本文对如何让LLM的知识蒸馏训练更高效进行了实践研究,引入了离线Top-K logits缓存和一种融合的分块KL损失,从而减少内存尖峰,并允许在单张GPU上训练更长的上下文。

小语言模型通常是在延迟、成本和本地部署条件受限时唯一的选择,但它们很少从头训练:压缩模型通常通过知识蒸馏(KD)恢复得到。这一恢复步骤在很大程度上决定了最终质量,但其成本高昂。我们呈现了一份关于如何让蒸馏训练高效的实践者研究,围绕两项系统贡献展开。首先,我们证明离线KD(一次性缓存教师模型的top-K logits,并让学生模型针对该缓存进行训练)在训练损失几乎相同的情况下能与在线蒸馏匹敌,同时将教师模型移出内存,每次迭代速度提升约29%,在单张H200 GPU上吞吐量最高提升41%。其次,我们引入一种融合的分块KL损失,它从不物化完整的词表大小的logits张量,使得峰值内存与序列长度呈线性关系。这消除了原本会限制上下文长度的内存尖峰,使我们能在单张GPU上以四倍上下文(32,768个token)进行训练。一个单独的输出头玩具基准对该损失内核进行了隔离测试,并确认了其从4K到256K token的内存和迭代速率扩展。这些共同使大规模修复和数百次消融实验变得可负担。我们还报告了关于损失设计和序列打包的辅助消融实验。我们发布了分块损失实现:https://github.com/CompactifAI/Full-Chunked-KL-Loss。
查看原文
查看缓存全文

缓存时间: 2026/08/10 14:15

论文页面 - 高效的大语言模型知识蒸馏:离线 Top-K Logits 与融合的分块 KL 损失

来源:https://huggingface.co/papers/2608.03796

摘要

小语言模型通常是在严格的延迟、成本和本地部署约束下唯一可行的部署选择,但它们很少从零开始训练:压缩模型通常通过知识蒸馏(KD)恢复。这一恢复步骤在很大程度上决定了最终质量,但其成本高昂。我们提供了一份面向实践者的研究,围绕两个系统层面的贡献来探讨如何让蒸馏训练更高效。首先,我们证明离线 KD(一次性缓存教师模型的 top-K logits,并让学生模型针对缓存进行训练)能够以几乎相同的训练损失匹配在线蒸馏,同时将教师模型从内存中移除,每次迭代速度提升约 29%,在单个 H200 GPU 上吞吐量最高可提升 41%。其次,我们引入一种融合的分块 KL 损失,它从不显式构造完整的词表大小的 logit 张量,使峰值内存随序列长度线性增长。这消除了原本会限制上下文长度的内存尖峰,使我们能够在单个 GPU 上以四倍的上下文长度(32,768 个 token)进行训练。一个独立的仅输出头玩具基准将损失内核隔离开来,验证了其在 4K 到 256K token 范围内的内存与迭代速率扩展性。综合起来,这些方法使大规模修复和数百次消融实验变得可行。我们还报告了关于损失设计和序列打包的辅助消融实验。我们开源了分块损失实现:https://github.com/CompactifAI/Full-Chunked-KL-Loss。

查看 arXiv 页面 (https://arxiv.org/abs/2608.03796)
查看 PDF (https://arxiv.org/pdf/2608.03796)
项目页面 (https://multiversecomputing.com/)
GitHub3 (https://github.com/CompactifAI/Full-Chunked-KL-Loss)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03796)

在您的 agent 中获取此论文:

hf papers read 2608\.03796

还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型2

MultiverseComputingCAI/Hypernova-60B-2605 文本生成 • 59B • 更新于3天前 • 1.45k • 15 (https://huggingface.co/MultiverseComputingCAI/Hypernova-60B-2605)

MultiverseComputingCAI/LittleLamb 文本生成 • 0.3B • 更新于3天前 • 1.6k • 9 (https://huggingface.co/MultiverseComputingCAI/LittleLamb)

引用此论文的数据集0

没有数据集链接到此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.03796 即可从此页面链接到该数据集。

引用此论文的 Space0

没有 Space 链接到此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.03796 即可从此页面链接到该 Space。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到它。

相似文章

让知识蒸馏的成本低到足以大规模运行

Hugging Face Blog

Multiverse Computing 发布了一篇论文,介绍如何通过离线 top-K logits 和融合的分块 KL 损失来降低 LLM 知识蒸馏的成本,从而减少大规模蒸馏时的显存占用。