当分词与语言建模联合优化时,会学习到哪些词元?

arXiv cs.CL 论文

摘要

本文研究了当分词与语言建模联合优化时所学习到的词元,比较了跨多种语言的无分词器方法,发现它们为自然语言处理生成了独特而高效的词汇表。

arXiv:2608.17325v1 Announce Type: new 摘要:分词是语言建模流程的基础组件。尽管其重要性,但它通常是固定的,即使它对跨语言的模型性能有显著影响。在这项工作中,我们分析了当分词与语言建模联合优化时所学习到的词元。我们比较了无分词器方法,如 SSLMs 和 H-Nets,与固定分词器,在 18 种类型学和书写系统多样的语言中。我们的结果显示,联合优化从根本上改变了词元结构。SSLMS 恢复了形态对齐且上下文高效的词元,而 H-Nets 优先考虑字节级效率,生成更长的词元,与标准子词词汇表的重叠度很低。我们进一步表明,分词行为因语言类型学而异。黏着语在学习时表现出更动态的分割模式。通过下游评估,使用预训练后微调的 BERT 模型,我们发现基于 SSLM 的预分词一致地降低了语言建模困惑度,并在词汇表不同的情况下实现了有竞争力的下游性能。总的来说,无分词器方法优化上下文和计算效率而非严格的形态结构,从而为下游自然语言处理生成了根本不同但有效的词汇表。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:54

# 当分词优化与语言建模联合进行时,会学习到哪些词元?
来源:https://arxiv.org/html/2608.17325
###### 摘要

分词是语言建模流程中的基础组件。尽管其重要性不言而喻,但它往往是固定的,尽管它对跨语言的模型性能有显著影响。在这项工作中,我们分析了当分词与语言建模联合优化时会学习到哪些词元。我们比较了在跨18种类型和书写系统多样性的语言中,无分词器方法(如SSLMs和H-Nets)与固定分词器的表现。我们的结果表明,联合优化从根本上改变了词元结构。SSLMs恢复了形态对齐且上下文高效的词元,而H-Nets则优先考虑字节级效率,生成更长的词元,并且与标准的子词词汇表重叠极低。我们进一步表明,分词行为因语言类型而异。黏着语在学习过程中表现出更动态的分块模式。通过下游评估,使用预训练后微调的BERT模型,我们发现基于SSLM的预分词一致性地降低了语言建模困惑度,并尽管词汇表不同,但取得了有竞争力的下游性能。总体而言,无分词器方法优化的是上下文和计算效率,而非严格的形态结构,从而产生了根本不同但有效的下游NLP词汇表。

## 1引言

分词是语言模型中的基础预处理步骤。在基于Transformer的语言模型中,它通常通过子词算法学习分词器来完成,例如字节对编码(BPE,14 (https://arxiv.org/html/2608.17325#bib.bib11);36 (https://arxiv.org/html/2608.17325#bib.bib1))、无监督语言模型(ULM,20 (https://arxiv.org/html/2608.17325#bib.bib2))或WordPiece(WPC,35 (https://arxiv.org/html/2608.17325#bib.bib12))。这些算法建立在简单的统计先验之上,例如假设经常共同出现的字符应属于同一个词元。尽管它们被广泛采用,但尚不清楚这种方法是否能提供最佳性能,特别是在处理跨形态复杂性、类型和书写系统多样性的语言时。这种担忧在标准的分词-语言模型-去分词流程中进一步加剧,其中分词器的训练独立于语言模型训练,并且保持静态。我们将这些称为固定分词器方法。评估此类语言模型的最佳分词器既困难又昂贵,因为分词器在训练前就已固定,之后无法修改。

图1:无分词器(H-Nets,SSLMs)与固定分词器方法的形态对齐评估。SSLMs显示出一致较高的对齐度,而H-Nets以形态对齐为代价换取更长、计算效率更高的词元。已经提出了各种改进和新颖的算法来学习分词器。这包括预分词、鲁棒性、形态对齐、词汇表剪枝或修改,以及跨词元方法的进展。然而,不能得出单一方法是“最佳”的结论,因为结论取决于多种因素,例如:1) 所选语言及其形态属性,2) 实验设置如模型架构、数据集大小和其他超参数。

最近,提出了一些新的架构,以克服上述分词-语言模型-去分词流程。这些通常被称为无分词器语言模型。诸如动态词元池化Transformer和H-Nets等架构,将数据依赖的边界预测(即分词)和字节级语言建模整合到一个单一的端到端流程中。特别是H-Nets,提供了一个稳定的架构。另一方面,诸如子词片段语言模型(SSLM)的模型,使用长短期记忆网络(LSTMs)或Transformer来边缘化并优化所有可能的分块。尽管计算开销大且在大规模上不可行,但SSLMs为我们提供了一个联合架构,可以用于分析。这些无分词器方法避免了任何统计或启发式先验,因此提供了与语言模型联合学习的分词。

在这项工作中,我们研究“当分词优化与语言建模联合进行时会学习到哪些词元。”我们的贡献如下:
1. 我们通过评估其在跨多样语言集上的内在和语言学属性,分析了通过无分词器方法(即SSLM和H-Net)学习词元的方式和内容。
2. 我们将这些方法与固定分词器方法(如BPE和ULM)进行比较,以评估它们学习到的词汇表有多相似。
3. 我们评估了这些分词方法对下游任务性能的影响,以评估联合学习的分词器是否带来改进。

## 2相关工作

先前分析无分词器语言模型学习词元的工作仍然有限。最近,25 (https://arxiv.org/html/2608.17325#bib.bib5) 研究了SSLMs学习的词元的学习动态。他们从语言学角度追踪了子词学习动态,评估了形态对齐、生产力、独特性和丰富度,并确定了子词学习的不同阶段。然而,由于他们的研究侧重于学习动态,分析仅限于三种语言。此外,在跨语言得出结论时,没有考虑诸如数据集大小和语言差异等关键混淆因素。

另一方面,许多研究分析了固定分词器及其修改。这些研究主要关注子词算法对下游语言模型性能的影响。例如,8 (https://arxiv.org/html/2608.17325#bib.bib28) 和 42 (https://arxiv.org/html/2608.17325#bib.bib29) 比较了不同的算法,表明ULM在下游任务中表现更好,并且恢复了形态对齐更好的子词。而诸如40 (https://arxiv.org/html/2608.17325#bib.bib40) 的工作则认为,推理策略可能与分词器构建算法同等重要或更重要。

## 3方法论

### 3.1语言和数据集

表1:本研究中包含的类型和书写系统多样化的语言列表。该表的详细版本可在附录的表11中找到。语言在形态、类型和书写系统上差异很大,这可能影响最佳分词方法。因此,我们研究了跨这些多样性的一组广泛且具有代表性的18种语言,列于表1中。

跨语言的理想比较需要平行训练和测试数据,但在这种规模上很难获得。因此,我们使用非平行的单语语料库,同时仔细控制数据源和大小。为了平衡数据大小,我们提取250,000个英语句子,并测量其以字节为单位的大小。然后,对于其他语言,我们根据字节溢价缩放数据大小,并提取所需数量的句子。我们使用WMT新闻爬取语料库,将大多数语言的领域固定为新闻,在不可用时回退到NLLB语料库。所得预训练数据连同可用的形态注释数据统计信息列于附录的表12中。

### 3.2分词方法

我们包含了来自近期文献的两种不同的无分词器方法:
- 基于Transformer版本的子词片段语言模型(SSLM),它在所有可能的分块上进行边缘化,同时联合优化语言建模。
- 端到端的H-Nets,联合执行数据依赖的边界预测和字节级语言建模。

为了将这些与固定分词器方法进行比较,我们包含了标准算法和改进算法。标准算法包括BPE、ULM和WPC。我们还研究了SaGe,它倾向于在比其频率更少的不同上下文中出现的子词单元,以及无监督形态分词器如Morfessor。我们还包括了修改推理的方法(如BPE-dropout和PathPiece)、预分词(如MorphBPE)、编码(如MYTE)和词汇表构建(如PickyBPE)。我们还包含了跨词元方法,如SuperBPE和BoundlessBPE,它们已被证明更高效。附录中的表13描述了这些方法,B.3节列出了它们的超参数。

### 3.3评估

我们评估上述分词方法的内在属性和外在性能。我们考虑内在指标,如上下文呈现度和有效词汇表大小,以及语言学指标,如形态对齐。附录中的表14提供了我们评估指标的综合描述。这种广泛的内在评估为我们提供了对每种分词方法产生的词元的有意义的评估。

为了衡量每种分词方法对下游性能的影响,我们在12M参数规模上预训练BERT模型,并在任务上微调它们:情感分析、词性标注、命名实体识别(NER)和依存句法分析。我们将下游评估限制在三种类型不同的语言上:英语、印地语和泰卢固语;以控制计算成本。

### 3.4实验设置

我们采用与理想实验设置相反的方法,如31 (https://arxiv.org/html/2608.17325#bib.bib10) 所指出的,这使我们能够更好地隔离分词器的影响。我们在数据集的训练子集上训练SSLMs、H-Nets和固定分词器算法。训练在验证子集上进行监控,所有分词方法在测试子集上进行评估。H-Net模型的总参数数保持在约3M,SSLMs为2M。这确保了跨语言的词元与参数数之比至少为2。虽然H-Nets不需要任何词汇表进行初始化,但SSLMs需要预先提供固定的词典。我们遵循25 (https://arxiv.org/html/2608.17325#bib.bib5) 的做法,为此考虑了10,000个最常用的单词,并将最大词元长度设置为5。对于下游评估,我们从相同的数据源抓取了一个更大的数据集,包含1000万个句子:NewsCrawl。这确保了对我们要分析的2M-30M参数BERT模型有合理的数据规模。每个模型的详细超参数列于附录B中。

(表2:几种候选词形的分块演化,由无分词器方法SSLM产生,并带有形态对齐F1分数。英语、希伯来语和印地语是屈折语或分析语,而泰米尔语、匈牙利语和印尼语是黏着语。更多示例见附录表10。)

## 4实验与结果

### 4.1问题1:词元是如何学习的?

我们分析了SSLMs的学习动态,类似于25 (https://arxiv.org/html/2608.17325#bib.bib5),但具有更广泛的语言覆盖范围、书写系统变化,更重要的是,根据字节溢价调整了数据集大小。我们根据MorphScore数据评估并跟踪形态对齐,以及内在属性,如有效词汇表大小和不同相邻词元的数量,即上下文呈现度。我们的结果证实了25 (https://arxiv.org/html/2608.17325#bib.bib5) 的发现,并纳入了更多样化的语言。

#### 形态对齐

图2绘制了SSLM产生的词元的形态对齐变化,随着其训练的进展。

相似文章

寻找最优分词器

Hacker News Top

这篇博客文章提出一个使用整数线性规划的算法来计算语言模型的最优分词器,并将其与解决旅行商问题相类比。文中指出,虽然结果在理论上很有趣,但实际的分词器已经接近最优,并且该方法可能不具备良好的泛化能力。

Compute Optimal Tokenization (2分钟阅读)

TLDR AI

本文通过训练近1300个模型,系统推导了压缩感知的神经缩放定律,证明了广泛使用的每参数20个词元的启发式方法是由特定分词器造成的。作者提出了基于字节的分词器无关缩放定律,为跨多样语言和模态的计算高效训练提供了新框架。

语言模型对不同语言中的非规范分词并非同样鲁棒

arXiv cs.CL

本文研究了语言模型在27种语言中是否对替代(非规范)分词保持鲁棒性,发现英语中观察到的不变性并不具有普适性,且分词碎片化程度更高的语言表现出更高的敏感性。作者证明,使用多分词数据的LoRA微调可以有效缓解这种敏感性。

Token 最大化

Reddit r/singularity

讨论在大型语言模型中最大化 Token 使用以提高效率和输出质量的策略与技术。

随机分词法提高模型鲁棒性

arXiv cs.CL

本论文证明了使用随机分词而非确定性标准分词来训练大型语言模型,可以显著提升模型对对抗攻击和随机扰动的鲁棒性。这种改进在预训练、微调和上下文学习阶段都有表现,且不会增加推理成本。