打破令牌天花板:蒸馏更小、更强的字节模型

arXiv cs.CL 论文

摘要

本文进行了一项大规模研究,比较蒸馏的字节模型和令牌模型,发现字节模型在更多计算资源下能达到更高的性能上限,并且比令牌模型更高效利用数据。

arXiv:2609.12303v1 公告类型:新 摘要:小模型通过从共享其分词方案的更大模型中蒸馏而变得更强大。然而,随着计算和数据的增加,蒸馏的字节模型和令牌模型在扩展趋势上是否表现相似?为了进行此比较,我们引入了两种变体来高效地将令牌逻辑转换为字节逻辑:1)近似:边缘化法,2)精确:令牌结束。然后,我们首次进行了大规模研究,同时改变两个维度:分词方案(令牌、字节、带eot的字节)和训练目标(蒸馏与交叉熵),对大约10亿参数、多达1万亿字节数据的层参数匹配模型进行过训练。在跨越三个类别的八个基准测试中:多项选择问答、语言生成和机器翻译,我们发现令牌-1B模型在低FLOP条件下优于字节模型(End-Of-Token-1B和Bytes-1B),但最终趋于平稳;字节模型起初较差,但在更多计算资源下超越了令牌-1B模型,达到了更高的下游任务性能上限。外推平均top-1错误与验证BPB的缩放定律预测,渐进地,蒸馏的End-Of-Token-1B比蒸馏的令牌-1B高出高达4%。它们也远更数据高效,仅使用六分之一的训练数据就能匹配蒸馏令牌-1B的性能。此外,通过在256字节的小词汇表上操作,而不是约100K的令牌,它们避免了在逻辑转储期间进行top-k截断的需要,同时将逻辑存储成本降低到大约五分之一。最后,我们的下游性能缩放定律预测,我们的蒸馏End-Of-Token-1B模型在平均下游任务上渐进地超越Llama 3.2-1B、Gemma-3-1B-pt和Gemma 2B模型,分别高达6.5%、8.1%和2.1%。
查看原文
查看缓存全文

缓存时间: 2026/09/14 08:31

# 蒸馏更小更强的字节模型
来源:https://arxiv.org/html/2609.12303

## 突破词元天花板:蒸馏更小更强的字节模型

Kalyani Marathe†\*, Artidoro Pagnoni†\*, Tomasz Limisiewicz, Margaret Li, Mike Lewis\#, Luke Zettlemoyer\#, Srinivasan Iyer†\#
Meta FAIR
†共同第一作者
\#共同最后作者

###### 摘要
通过从共享其分词方案的更大模型进行蒸馏,可以提升小模型的能力。然而,随着计算量和数据量的增加,蒸馏后的字节模型和词元模型在扩展规律上表现是否相似?为便于这种比较,我们引入了两种变体来高效地将词元对数几率转换为字节对数几率:1)近似方法:边缘化-它(Marginalize-It),以及2)精确方法:词元结束(End-Of-Token)。随后,我们首次大规模研究了解码器-only密集Transformer模型的过训练,同时改变两个维度:分词方案(词元、字节、带词元结束的字节)和训练目标(蒸馏 vs. 交叉熵),对层参数匹配的模型(参数量≈10亿)在高达1万亿字节的数据上进行扫描。在涵盖三个类别的八项基准测试(多项选择问答、语言生成和机器翻译)中,我们发现Token-1B模型在低FLOP区间表现优于字节模型(End-Of-Token-1B和Bytes-1B),但最终趋于平稳;字节模型起步表现较差,但随着计算量增加最终超越了Token-1B模型,达到了更高的下游任务性能天花板。根据平均Top-1错误率与验证BPB的扩展规律推断,在渐近条件下,蒸馏后的End-Of-Token-1B在平均下游任务性能上比蒸馏后的Token-1B高出最多4%。它们的数据效率也远高得多,仅使用六分之一的训练数据即可匹配蒸馏Token-1B的性能。此外,通过在约256个字节的小词汇表(而非约10万词元)上操作,它们避免了在对数几率转储时进行Top-k截断的需要,同时将对数几率存储成本降低至约五分之一。最后,我们的下游性能扩展规律预测,蒸馏后的End-Of-Token-1B模型在平均下游任务上渐近地超越Llama 3.2-1B模型(Meta AI,(2024))、Gemma-3-1B-pt(Kamath et al.,(2025))和Gemma 2B(Team et al.,(2024))模型,幅度分别高达6.5%、8.1%和2.1%。

††脚注文本:*通讯作者:[email protected], \{artidoro, sviyer\}@meta.com

## 1 引言
扩展已成为提升语言模型性能的主流方法(Kaplan et al.,(2020);Hoffmann et al.,(2022);Henighan et al.,(2020))。然而,在现实世界中部署模型需要的不仅仅是规模:服务成本可能会超过规模带来的收益(Pope et al.,(2023);Dettmers & Zettlemoyer,(2023))。模型通常:1)被蒸馏成更小但能力强的模型,通过针对教师的下一个词元分布(而非真实词元)进行训练,在下游任务上表现更优(Hinton et al.,(2015);Beyer et al.,(2022)),以及2)进行过训练,以摊销模型生命周期内的推理成本(Sardana et al.,(2023);Gadre et al.,(2024))。然而,随着计算预算的增长,学生模型分词方式的选择如何与这些技术相互作用仍不清楚。

在这项工作中,我们比较了随着计算预算增长,字节和词元如何影响蒸馏扩展规律。字节是一个引人注目的替代方案,原因有二:首先,通过将词汇表压缩到仅约256个值,基于字节操作的Transformer可以精确保留大型词元语言模型的分布(Hayase et al.,(2025);Phan et al.,(2024)),并且可能绕过离线蒸馏中对Top-k对数几率截断的需求。其次,它们也具备有趣的特性:它们学习字节间关系所需的样本比词元模型学习词元关系所需的少(Hestness et al.,(2017)),这使得它们成为高效的数据学习者(Xue et al.,(2022);Zheng et al.,(2025))。

然而,蒸馏到这类模型依赖于悬而未决的问题:1)如何高效地将词元对数几率转换为字节对数几率;2)分词和训练目标如何影响BPB与FLOPs的幂律关系;3)蒸馏是否在下游任务上优于监督式字节(和词元)级别训练;4)在什么计算预算下字节级蒸馏超越词元级蒸馏;5)训练的模型和渐近预测与可比较模型规模的开放权重模型相比如何,以及数据和存储效率的影响。本工作解决了所有五个问题。我们在下文1.1节中总结我们的主要贡献。

**图1:** 下游任务性能扩展规律(lr=4e-3,六项基准平均):多项选择问答(ARC-Easy, ARC-Challenge, HellaSwag, PIQA)和语言生成(MBPP, Natural Questions)任务。End-Of-Token蒸馏模型,通过精确保留教师分布并在固定数据上投入最多计算量,提升了渐近性能天花板。End-Of-Token蒸馏在渐近条件下优于Token蒸馏模型最多4%,优于Marginalize-It蒸馏模型1.9%,并优于三个开放权重模型:Llama 3.2-1B模型(Meta AI,(2024))、Gemma-3-1B-pt(Kamath et al.,(2025))和Gemma 2B(Team et al.,(2024)),在平均下游任务上幅度分别高达6.5%、8.1%和2.1%。

### 1.1 贡献总结
**在单次前向传播中将词元对数几率转换为字节对数几率。** 从大型词元模型蒸馏一个较小的字节模型,首先需要将教师的词元对数几率转换为字节对数几率。一个词元由多个字节组成,因此概率分布必须分配到各个字节位置。先前将词元分布转换为字节分布的方法(Hayase et al.,(2025);Phan et al.,(2024))需要多次前向传播,当教师推理计算成本高昂时,这变得不可行。我们引入了两种单次传播变体,通过对字节位置进行边缘化来将词元对数几率转换为**字节对数几率**:1)近似方法:**边缘化-它(Marginalize-It)** 在前缀匹配的词元上重新归一化,而2)精确方法:**词元结束(End-Of-Token)** 在词汇表中添加一个`<eot>`词元,因此不会丢失任何概率。

**跨分词方案和训练目标的每字节比特数与训练FLOPs幂律。** 有了对数几率转换方法,我们探讨生成的字节模型与词元模型及其监督对应物相比如何扩展。我们进行了一项大规模研究,沿两个轴过训练层参数匹配的解码器-only密集Transformer:训练目标(蒸馏损失 vs. 监督/交叉熵损失)和分词方案(词元、字节、带词元结束的字节):扫描具有固定12.8亿层参数的解码器-only Transformer模型,数据量高达1万亿字节。我们训练了多个Token-1B(1.81B)、Bytes-1B(1.28B)和End-Of-Token-1B(1.28B)模型,以拟合验证BPB与训练FLOPs幂律,从而表明蒸馏后的End-Of-Token-1B模型与蒸馏后的Token-1B和Bytes-1B相比,展现出更好的渐近行为。

**平均下游任务准确率与训练FLOPs扩展趋势。** 为理解Marginalize-It(近似)和End-Of-Token(精确)的验证损失扩展趋势如何转化为下游任务性能,我们现在转向基准评估。在三个类别和八项基准测试中:多项选择问答(ARC-Easy, ARC-Challenge, HellaSwag, PIQA),语言生成(MBPP, Natural Questions)和机器翻译(Flores),我们发现Token-1B Transformer(监督和蒸馏)在低计算区间表现强劲,但迅速趋于平稳。Bytes-1B(1.28B)和End-Of-Token-1B(1.28B)尽管总参数较少,但由于其约256个字节的词汇表尺寸小,最初落后于Token-1B(1.81B)模型,但随着额外计算量的增加,以更陡峭的速率持续改进。

**跨计算预算的蒸馏扩展轨迹比较。** 下游任务性能与训练FLOPs的扩展趋势提出了一个实际问题:在给定的计算预算下选择哪种方法。我们拟合了下游错误率与验证BPB的扩展规律(图1),并引入**羽毛图**(图11),将下游错误率-验证BPB曲线上的等FLOP点连接起来。这些图表让我们能够比较每种分词方案跨计算预算的下游性能轨迹。通过外推下游错误率与验证BPB的扩展规律,我们的实验预测蒸馏后的End-Of-Token-1B Transformer提高了平均下游任务性能的渐近天花板。然后我们预测,通过精确保留教师分布以及在固定数据上比Marginalize-It(近似)方法多花费约30.94%的计算量,蒸馏后的End-Of-Token-1B(精确)在渐近条件下优于蒸馏后的Token-1B最多4%,优于蒸馏后的Bytes-1B最多1.9%。

**End-Of-Token-1B:数据与存储效率,对开放权重模型的渐近胜出。** End-Of-Token方法的渐近精度增益也带来了效率提升。蒸馏后的End-Of-Token-1B模型在训练充分的情况下,仅使用**六分之一**的训练数据就能超越蒸馏后的Token-1B模型,尽管总参数较少。通过在约256个字节的小词汇表上操作,而不是约10万个词元,它们避免了在对数几率转储时进行Top-k截断的需要,将对数几率存储成本降低至约**五分之一**。最后,与开放权重模型的比较以及渐近预测显示,我们的蒸馏End-Of-Token-1B模型在平均下游任务上超越Meta AI ((2024))、Kamath et al. ((2025))和Team et al. ((2024))模型,幅度分别高达6.5%、8.1%和2.1%。

**论文结构:** 我们介绍了两种对数几率转换方法:边缘化-它和词元结束,用于将词元对数几率转换为字节对数几率(第2节)。然后我们描述实验设置、用于我们扩展研究的六种情景以及用于评估的基准(第3节)。接着我们研究验证BPB与FLOPs的扩展规律(第4节),下游任务性能与训练FLOPs的扩展趋势(第5节)以及下游性能与验证BPB的扩展规律(第6节)。然后我们利用这些扩展规律找出字节蒸馏何时优于词元蒸馏基线(第7节)。借助下游错误率扩展规律和羽毛图,我们展示了Token蒸馏、Marginalize-It蒸馏和End-Of-Token蒸馏模型之间的相对性能排序如何随着训练计算预算而演变。接着,我们将我们训练的检查点及渐近预测与开放权重模型进行基准比较(第8节)。之后,我们将我们的工作置于现有文献的背景下(第9节)。最后,我们反思研究发现、局限性以及未来工作的机遇(第10节)。

## 2 对数几率转换方法
在本节中,我们描述了我们在扩展研究中使用的两种方法:**边缘化-它(Marginalize-It)** 和 **词元结束(End-Of-Token)**,用于高效地将词元对数几率转换为**字节对数几率**。

图2展示了通过示例说明的字节对数几率形成过程。我们提供了两种方法的伪代码在附录F.1中,并在附录F.2中讨论了特殊情况。

### 2.1 边缘化-它对数几率
对于教师推理中使用的每个词元,我们有一个大小为|V|的对数几率张量,表示下一个词元的分布,其中V是BPE分词器的词汇表。我们还有V中每个BPE词元解码后的字节序列。为了计算每个BPE词元的*第一个*字节分布,我们基于第一个字节对整个词汇表V进行边缘化。对于每个*后续*字节,我们将词汇表限制为前缀与真实字节匹配的词元子集,并基于此子集计算字节分布。我们称之为**边缘化-It**方法。虽然这种方法总是为第一个字节生成精确分布,但后续字节的分布仅是*近似*的。

图2(第1列)逐步展示了边缘化-It对数几率转换过程。为了预测分布B3,词元`is`(其概率为0.125)的延续被静默丢弃,只有词元`isu`和`isk`被继续保留。虽然获取词元`is`的下一个词元分布可以解决此问题,但它需要对序列[`<bos>`, T, iram, is]运行额外的教师推理。对于长序列,获得精确转换所需的额外推理次数可能变得难以处理。为避免此问题,在**边缘化-It**方法中,剩余概率在词元`isu`和`isk`之间重新分配:
\( P(\texttt{isu}) = \frac{0.5}{0.5 + 0.125} = 0.8, \)
\( P(\texttt{isk}) = \frac{0.125}{0.5 + 0.125} = 0.2, \)
训练时使用的字节序列是:[`<bos>`, T, i, r, a, m, i, s, u, `<eot>`]。我们在附录F.2中提供了更多细节。**边缘化-It**在整个研究中作为主要基线。

### 2.2 词元结束对数几率
**词元结束(End-Of-Token)** 方法本质上是**边缘化-It**方法,但有两个关键改变。首先,在教师推理后形成字节对数几率时,我们在每个BPE词元末尾追加一个`<eot>`词元以标记结束,如图2(第2列)所示。其次,我们将字节词汇表扩展一个以存储`<eot>`概率,然后对字节位置进行边缘化以形成字节对数几率。在训练时,我们在预训练数据集中每个BPE词元后追加`<eot>`:[`<bos>`, T, `<eot>`, i, r, a, m, `<eot>`, i, s, u, `<eot>`, `<eot>`]。这解决了边缘化-It的概率缺失问题。为了计算B3分布,与边缘化-It不同,词元结束...

相似文章

字节级模型

Reddit r/LocalLLaMA

讨论了字节级分词器是否在精确任务(如区分相似名称、计数字符和大小写敏感)上优于子词分词器,并询问当前推荐。

跨分词器LLM蒸馏:基于字节级接口的方法

Hugging Face Daily Papers

本文提出字节级蒸馏(BLD),一种简单的跨分词器知识迁移方法,通过在共享的字节级接口上操作,在1B-8B参数模型上实现了与更复杂现有方法相当或更优的性能。

Compute Optimal Tokenization (2分钟阅读)

TLDR AI

本文通过训练近1300个模型,系统推导了压缩感知的神经缩放定律,证明了广泛使用的每参数20个词元的启发式方法是由特定分词器造成的。作者提出了基于字节的分词器无关缩放定律,为跨多样语言和模态的计算高效训练提供了新框架。