通过字节前缀边缘化的跨分词器同策略蒸馏

arXiv cs.CL 论文

摘要

介绍字节前缀边缘化(BPM)用于跨分词器同策略蒸馏,在共享字节空间上重新表达教师分词在学生词汇表上的分布,在数学和编程基准测试中优于基线方法。

arXiv:2607.22334v1 Announce Type: cross 摘要:不同系列的开权重语言模型展现出互补能力,促使通过同策略蒸馏(OPD)将它们整合到一个紧凑的学生模型中。然而,全词汇OPD通常假设共享分词器,而现有的跨分词器方法可能会丢弃教师概率质量,或将其分配给内容不相关的学生分词。我们引入字节前缀边缘化(BPM),在共享字节空间上重新表达教师对下个分词在学生词汇表上的分布。具体来说,BPM将每个教师分词的概率分配给其字节表示是教师分词字节前缀的最长学生分词,将映射到同一学生分词的质量聚合起来,并将其他不匹配的质量放入一个显式的残差类别中。这为密集OPD产生了一个词汇完整、字节对齐且质量保持的目标。当相关前缀不跨越多个教师分词时(在超过99%的训练位置上满足此条件),该目标精确恢复教师诱导的字节前缀边缘;否则使用质量保持的链式分解下界。在以Qwen3-32B、GLM-Z1-9B-0414和MiniMax-M2.7作为教师的实验中,BPM在六个数学和编程基准测试中持续优于当前的跨分词器方法,在avg@8上比最强基线高出3.7-6.6个百分点。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:42

# 跨分词器策略蒸馏:通过字节前缀边缘化实现

来源:https://arxiv.org/html/2607.22334  
\[1\]中国科学院大学 \[2\]快手KAT团队 \[3\]浙江大学

###### 摘要

来自不同系列的开源语言模型展现出互补能力,这促使我们通过策略蒸馏(OPD)将其整合进一个紧凑的学生模型。然而,全词汇策略蒸馏通常假设共享一个分词器,而现有的跨分词器方法可能会丢弃教师概率质量,或将其分配给内容不相关的学生词元。我们引入了**字节前缀边缘化**(BPM),该方法在一个共享的字节空间中重新表达教师关于学生词汇的下一个词元分布。具体来说,BPM将每个教师词元的概率分配给字节表示是教师词元字节前缀的最长学生词元,将映射到同一学生词元的概率质量聚合起来,并将未匹配的质量放入一个显式的残差类别中。这为密集策略蒸馏生成了一个词汇完整、字节对齐且质量守恒的目标。当相关前缀不跨越多个教师词元时(在超过99%的训练位置上满足此条件),该目标精确恢复了教师诱导的字节前缀边缘分布;否则,使用一个质量守恒的链式分解下界。以Qwen3-32B、GLM-Z1-9B-0414和MiniMax-M2.7作为教师,在六个数学和编程基准测试上,BPM始终优于当前的跨分词器方法,在最强基线的基础上将六个基准测试的avg@8提升了3.7至6.6个百分点。

![[无标题图片]](https://arxiv.org/html/2607.22334v1/x1.png)

图1:三个教师-学生对的平均性能(表1 (https://arxiv.org/html/2607.22334#S4.T1))。(a) 所有六个基准测试的avg@8,每个轴独立缩放;(b) 平均数学avg@8;(c) 平均代码avg@8;(d) 每个教师-学生对的avg@8差距中,由BPM及其最强基线所弥补的比例。BPM在所有预算匹配的策略基线和单独训练的SeqKD参考方法中均领先。

## 1 引言

开源语言模型\[1 (https://arxiv.org/html/2607.22334#bib.bib1),2 (https://arxiv.org/html/2607.22334#bib.bib2),3 (https://arxiv.org/html/2607.22334#bib.bib3),4 (https://arxiv.org/html/2607.22334#bib.bib4),5 (https://arxiv.org/html/2607.22334#bib.bib5)\]发展迅速,不同模型系列在数学推理、复杂问题解决、智能体编码和工具使用方面展现出互补优势。在实际部署中,通常希望将这些不同的能力整合到一个单一的紧凑模型中。除了能力整合之外,这种整合可以通过减少计算和内存开销来提高推理效率,并避免部署多个专用模型或在其间路由请求的需要。这激发将知识从异构教师模型迁移到一个高效的学生模型\[6 (https://arxiv.org/html/2607.22334#bib.bib6)\]。

知识蒸馏通过训练学生模仿教师的预测行为,为此迁移提供了一种自然机制\[7 (https://arxiv.org/html/2607.22334#bib.bib7),8 (https://arxiv.org/html/2607.22334#bib.bib8),9 (https://arxiv.org/html/2607.22334#bib.bib9),10 (https://arxiv.org/html/2607.22334#bib.bib10)\]。**策略蒸馏**(OPD)沿着学生生成的轨迹进行迁移,在学生实际访问的状态下查询教师\[11 (https://arxiv.org/html/2607.22334#bib.bib11),12 (https://arxiv.org/html/2607.22334#bib.bib12),13 (https://arxiv.org/html/2607.22334#bib.bib13),14 (https://arxiv.org/html/2607.22334#bib.bib14)\]。其监督范围从采样词元和top-k近似\[15 (https://arxiv.org/html/2607.22334#bib.bib15),12 (https://arxiv.org/html/2607.22334#bib.bib12),16 (https://arxiv.org/html/2607.22334#bib.bib16),17 (https://arxiv.org/html/2607.22334#bib.bib17)\]到全词汇匹配教师的完整下一个词元分布\[11 (https://arxiv.org/html/2607.22334#bib.bib11),2 (https://arxiv.org/html/2607.22334#bib.bib2)\]。然而,密集的词元级监督通常假设教师和学生使用相同的分词器\[18 (https://arxiv.org/html/2607.22334#bib.bib18)\]。这个假设将教师的选择限制在与学生分词方案兼容的模型,可能排除针对目标任务更强的教师\[19 (https://arxiv.org/html/2607.22334#bib.bib19)\]。

因此,将全词汇策略蒸馏扩展到异构分词器需要转换后的目标满足三个属性:
- **(D1) 词汇完整性**:目标对学生词汇中的每个词元都有明确定义。
- **(D2) 字节级对齐**:教师的概率质量根据其字节表示之间的对应关系映射到学生词元。
- **(D3) 质量守恒**:转换保留了教师的总概率质量,确保产生的目标分布(包括任何显式表示的残差质量)之和为1。

现有的跨分词器蒸馏方法\[20 (https://arxiv.org/html/2607.22334#bib.bib20),21 (https://arxiv.org/html/2607.22334#bib.bib21),22 (https://arxiv.org/html/2607.22334#bib.bib22),23 (https://arxiv.org/html/2607.22334#bib.bib23),24 (https://arxiv.org/html/2607.22334#bib.bib24),25 (https://arxiv.org/html/2607.22334#bib.bib25),26 (https://arxiv.org/html/2607.22334#bib.bib26)\]通过放宽至少一个这些要求(第2节 (https://arxiv.org/html/2607.22334#S2))使教师和学生分布具有可比性。候选集方法如SimCT\[26 (https://arxiv.org/html/2607.22334#bib.bib26)\]会丢弃未匹配的教师质量,违反了(D1)词汇完整性;ULD\[21 (https://arxiv.org/html/2607.22334#bib.bib21)\]和GOLD\[25 (https://arxiv.org/html/2607.22334#bib.bib25)\]中的秩匹配可能将教师质量分配给字节内容不相关的学生词元,违反了(D2)字节级对齐。SeqKD\[8 (https://arxiv.org/html/2607.22334#bib.bib8)\]则避免了分布匹配,不提供全词汇的下一个词元目标。这些基线方法要么近似词元级迁移,要么完全避免词元级分布匹配。

然而,在字节级别,转换有一个精确的解。因此,我们在一个共享的字节空间中制定教师监督\[27 (https://arxiv.org/html/2607.22334#bib.bib27),28 (https://arxiv.org/html/2607.22334#bib.bib28),29 (https://arxiv.org/html/2607.22334#bib.bib29),30 (https://arxiv.org/html/2607.22334#bib.bib30)\]:尽管教师和学生可能对同一个响应进行不同的分词,但他们对底层的字节序列是一致的(图2 (https://arxiv.org/html/2607.22334#S3.F2))。**字节前缀边缘化**(BPM)将教师的下一个词元分布转换为一个关于学生词元的分布。具体来说,每个教师词元的概率质量被分配给字节表示是该教师词元字节表示前缀的最长学生词元。分配给同一学生词元的概率质量随后跨教师词元聚合,而任何不存在此类学生词元前缀的质量被分配到一个显式的残差类别中。这个残差对于质量守恒至关重要:没有它,未匹配的教师质量将被丢弃,转换后的目标之和可能小于1。因此,产生的目标通过构造满足D1/D2/D3。在超过99%的训练位置上,这个目标精确地恢复了教师的字节前缀边缘分布。然后,通过最小化关于转换后目标的广义Jensen-Shannon散度,学生在其自身生成的轨迹上进行训练。

我们的实验进一步发现了字节精确蒸馏的一个失败模式。在代码生成数据中目标仅由空白字符组成的位置上,字节级对齐可能转移分词器特有的分割模式,而不是教师的预测行为。对于一个教师-学生对,这种虚假监督将代码通过率从49%降低到了9%(第4.3节 (https://arxiv.org/html/2607.22334#S4.SS3))。我们通过一个预计算的掩码来解决这个问题,该掩码从蒸馏目标中排除所有空白位置,从而防止观察到的崩溃。

总之,我们的贡献有两个方面:

- **跨分词器的精确全词汇监督**。我们引入了BPM,它在满足D1-D3的同时,重新表达了教师关于学生词汇的下一个词元分布。我们证明,当字节前缀不跨越多个教师词元时,产生的目标是精确的,在我们的实验中,这一条件在超过99%的训练位置上成立(命题C.3 (https://arxiv.org/html/2607.22334#A3.Thmtheorem3))。在剩余的跨越位置上,BPM使用一个质量守恒的链式分解下界。

- **跨异构分词器的系统评估**。我们独立地将三个教师模型(包括Qwen3-32B、GLM-Z1-9B-0414和MiniMax-M2.7)蒸馏到同一个推理模式的学生架构中,覆盖了分词器距离各异的教师-学生对。所有策略方法共享一个训练预算;SeqKD遵循其标准的离线方案,无更小预算。对于每个教师-学生对,最佳的BPM变体优于最强基线,分别弥补了相应教师-学生性能差距的33.5%、43.9%和34.4%。

## 2 相关工作

### 2.1 语言模型蒸馏

语言模型蒸馏始于逐位置匹配教师的输出分布\[7 (https://arxiv.org/html/2607.22334#bib.bib7)\]。SeqKD将此方案推广到序列模型\[8 (https://arxiv.org/html/2607.22334#bib.bib8)\]。其他方向包括迁移中间特征\[31 (https://arxiv.org/html/2607.22334#bib.bib31)\]、推理原理\[32 (https://arxiv.org/html/2607.22334#bib.bib32),33 (https://arxiv.org/html/2607.22334#bib.bib33)\]或教师精炼的训练语料库\[34 (https://arxiv.org/html/2607.22334#bib.bib34),35 (https://arxiv.org/html/2607.22334#bib.bib35),36 (https://arxiv.org/html/2607.22334#bib.bib36)\]。BPM建立在逐位置方案的两个改进之上。MiniLLM将前向KL替换为反向KL\[12 (https://arxiv.org/html/2607.22334#bib.bib12)\]。然后学生专注于它能够表示的教师模式。广义策略蒸馏在学生自身的生成上进行训练\[11 (https://arxiv.org/html/2607.22334#bib.bib11),37 (https://arxiv.org/html/2607.22334#bib.bib37),38 (https://arxiv.org/html/2607.22334#bib.bib38)\]。其散度在两个KL之间插值,之后的目标涵盖了f-散度以及偏斜或对比变体\[39 (https://arxiv.org/html/2607.22334#bib.bib39),40 (https://arxiv.org/html/2607.22334#bib.bib40),41 (https://arxiv.org/html/2607.22334#bib.bib41)\]。策略蒸馏已达到生产级水平。KAT-Coder-V2将五个专门的编码专家整合到一个可部署模型中\[42 (https://arxiv.org/html/2607.22334#bib.bib42)\]。其后续版本将相同pipeline扩展到仓库规模的智能体任务\[43 (https://arxiv.org/html/2607.22334#bib.bib43)\]。这一系列的词元级目标仍然在共享词汇内比较教师和学生的预测。

### 2.2 跨分词器蒸馏

跨分词器方法通过对齐、传输、投影或跨度级目标来恢复可比性。FuseLLM通过最小编辑距离对两个词元序列进行硬对齐\[20 (https://arxiv.org/html/2607.22334#bib.bib20)\]。逐位置比较变成了一个近似的词元到词元映射。通用对数蒸馏损失按概率对每个分布进行排序,并作为最优传输的替代方案按秩匹配。匹配丢弃了每个排序概率属于哪个词元\[21 (https://arxiv.org/html/2607.22334#bib.bib21)\]。多级最优传输将此基于秩的传输扩展到词元和序列级别\[23 (https://arxiv.org/html/2607.22334#bib.bib23)\]。GOLD实现向排序损失中增加了一个广义Jensen-Shannon项\[25 (https://arxiv.org/html/2607.22334#bib.bib25)\]。该术语仅覆盖两个模型共享的词汇。双空间蒸馏学习一个到共同隐藏空间的投影。输出侧的对应关系与学习到的投影同样可靠\[22 (https://arxiv.org/html/2607.22334#bib.bib22)\]。SimCT在两个模型都能表达的短续写上比较它们,并仅监督一个受限的位置集。学生词汇的其余部分未收到信号\[26 (https://arxiv.org/html/2607.22334#bib.bib26)\]。近似似然匹配是最接近的先前目标,也在对齐的跨度上跨分词器进行监督\[24 (https://arxiv.org/html/2607.22334#bib.bib24)\]。其对每个跨度的目标是一个标量似然值,而标量无法将质量分配到特定的学生词元上。零次分词器迁移则是为一个模型配备新的词汇\[44 (https://arxiv.org/html/2607.22334#bib.bib44)\]。

#### 推理时词汇投影
GaC、EVA和UNITE将集成分布投影到共享词汇上\[45 (https://arxiv.org/html/2607.22334#bib.bib45),46 (https://arxiv.org/html/2607.22334#bib.bib46),47 (https://arxiv.org/html/2607.22334#bib.bib47)\]。这些投影仅在推理时操作,而BPM构建了覆盖整个学生词汇的显式训练分布。

## 3 方法

参见图注

图2:BPM概览。
(a) 两个模型将相同的字节切分成不同的词元(我们最不相似对的真实分割);两个模型共享的边界是“同步点”(黑色线条)。
(b) 映射φ将每个教师词元w路由到字节表示是`bytes(w)`前缀的最长学生词元。路由到同一学生词元的概率被求和为t(这里对于“bell”是.17 + .09);未匹配的质量进入∅,并且p在D_β下向t训练。

### 3.1 跨分词器设置

策略蒸馏沿着学生生成的响应查询教师。令 V^t 和 V^s 分别表示教师和学生的词汇。在教师位置 j,教师预测 q_j ∈ Δ(V^t);在学生位置 i,学生预测 p_i ∈ Δ(V^s)。当两个模型共享一个分词器时,它们的位置和词汇坐标一致,给出了标准的逐位置目标:

L_OPD = Σ_i D(q_i ∥ p_i)。 (1)

两个条件使得这种比较有意义:q_i 和 p_i 位于同一词汇上,并且索引 i 表示两个模型相同的文本前缀。不同的分词器破坏了这两个条件。它们的分布占据不同的词汇(*词汇不匹配*),而相同的位置索引可能指代不同的文本前缀,因为词元边界出现在不同的字节偏移上(*分割不匹配*)。因此,我们将每个响应视为一个字节字符串 x,具有教师分割 w^t_1, ..., w^t_M 和学生分割 w^s_1, ..., w^s_N。两者都解码为 x,但它们的边界和词元计数不同。

相似文章

跨分词器LLM蒸馏:基于字节级接口的方法

Hugging Face Daily Papers

本文提出字节级蒸馏(BLD),一种简单的跨分词器知识迁移方法,通过在共享的字节级接口上操作,在1B-8B参数模型上实现了与更复杂现有方法相当或更优的性能。

X-Token: 投影引导的跨分词器知识蒸馏

arXiv cs.LG

X-Token 引入了两种损失函数(P-KL 和 H-KL),以解决基于 logit 的跨分词器知识蒸馏中的失败模式,使学生模型能够从具有不兼容词汇的教师模型中学习,并在 Llama-3.2-1B 上取得了最先进的结果。

多教师同策略蒸馏中的行为杠杆失衡

arXiv cs.CL

本文识别了在代理语言模型的多教师同策略蒸馏中,学生模型过度依赖工具调用这一失败模式,并提出Soft Clamp方法,一种逐token散度校准方法,可在不牺牲准确率的前提下减少过度调用。

同策略蒸馏(5分钟阅读)

TLDR AI

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。

通过混合策略蒸馏进行推理压缩

arXiv cs.AI

本文提出了混合策略蒸馏(MPD),这是一个将大教师模型的简洁推理行为转移到更小规模的学生模型的框架,在提升性能的同时,将令牌(token)使用量最多降低了27.1%。