TokEval:分词器评估套件
摘要
本文介绍了TokEval,一个用于评估语言模型分词器的框架,该框架利用与下游任务性能相关的内在指标。
arXiv:2608.18062v1 公告类型:新
摘要:语言模型分词器通常在选择时只进行极少评估,尽管其设计选择直接影响模型能力。这在一定程度上归因于对分词器哪些属性影响下游性能哪些方面理解有限。我们引入TokEval,一个分词器评估指标框架,超越标准度量如生育率和压缩率,以捕获语言和结构上有意义的属性,例如UTF-8字符边界完整性和数学数字位值边界对齐。为验证这些指标是否预测下游模型性能,我们进行受控语言模型预训练实验,仅变化分词器的训练数据混合、预分词策略和训练算法。我们评估所得模型的字节比特率(一种与分词器无关的困惑度版本)和多个基准,涵盖语言理解、数学推理和代码生成。我们的实验表明,不同的内在属性对模型能力有不同的影响:信息论指标预测语言建模能力(Spearman rho高达0.80),而结构敏感指标,如测量数字和换行处理的指标,与任务准确性相关。我们希望TokEval能实现更原则性的分词器评估,在内在测量与预训练扫频一致时,用前者替代后者。
查看缓存全文
缓存时间: 2026/08/19 10:13
# TokEval:分词器评估套件 来源:https://arxiv.org/html/2608.18062
###### 摘要
尽管语言模型分词器的设计选择直接影响模型能力,但其评估过程往往被草草带过。这在一定程度上源于对分词器哪些属性影响下游性能哪些方面的理解有限。我们引入TokEval,一套超越常规评估指标(如分词密度和压缩率)的分词器评估框架,能够捕捉语言学和结构上的有意义属性,例如UTF-8字符边界完整性以及数学场景中的数位值边界对齐性。为验证这些指标对下游模型性能的预测能力,我们开展了受控的语言模型预训练实验,仅改变分词器的训练数据混合比例、预分词策略和训练算法。我们在比特/字节(一种与分词器无关的困惑度指标)及涵盖语言理解、数学推理和代码生成等多项基准任务上评估了生成的模型。实验表明:不同内在属性对模型能力的影响各异——信息论指标能预测语言建模能力(Spearman|ρ|高达0.80),而结构敏感指标(如数字处理和换行处理能力)则与任务准确率相关。我们期望TokEval能推动更科学的分词器评估方法,当内在测量与下游性能一致时,可替代大规模预训练实验。
cimeister/tokenizer-intrinsic-evals (https://github.com/cimeister/tokenizer-intrinsic-evals)
huggingface.co/cmeister/tokenizer-lm-ablations (https://huggingface.co/cmeister/tokenizer-lm-ablations)
## 1 引言
子词分词是现代语言模型流程中不可或缺的组成部分。几乎所有当代大语言模型都依赖某种子词分割变体(例如字节对编码 (38 (https://arxiv.org/html/2608.18062#bib.bib1), BPE) 或UnigramLM算法 (19 (https://arxiv.org/html/2608.18062#bib.bib2))),将原始文本映射为离散的词元序列——这是模型能够高效训练和评估的格式。
尽管扮演着核心角色,分词器设计却常常未受到足够重视。相较于在模型架构、训练数据和学习算法优化上投入的大量精力,分词器的选择往往仅基于少量启发式规则(如词表大小、压缩率或对分割质量的非正式检查),且在模型开发过程中极少重新评估。
这种忽视持续存在,尽管越来越多的证据表明分词化选择会塑造模型在多个领域的下游行为,包括算术准确性、多语言性能和通用任务质量 (2 (https://arxiv.org/html/2608.18062#bib.bib37); 39 (https://arxiv.org/html/2608.18062#bib.bib4); 25 (https://arxiv.org/html/2608.18062#bib.bib13); 35 (https://arxiv.org/html/2608.18062#bib.bib5); 22 (https://arxiv.org/html/2608.18062#bib.bib44))。这些结果共同表明,分词器设计是一个具有实质性影响的建模选择,对下游模型能力有可衡量的后果。
这种忽视的一个核心原因可能是测试不同分词器的成本高昂:从文本处理到输出格式化的整个流程都需要为每种设计选择重新配置。此外,当前的内在评估协议存在两个明显问题:¹
> ¹ 内在评估指仅使用分词器和语料库评估分词器,无需训练下游模型。
首先,当前内在评估指标范围非常狭窄。例如,压缩率仅告诉我们分词器*压缩了多少*,但无法反映它在*多大程度上*保留了对特定下游任务重要的结构性质。其次,内在指标与下游性能之间的关系仍存在争议。具体而言,46 (https://arxiv.org/html/2608.18062#bib.bib7)发现Rényi效率与机器翻译质量强相关,而压缩率长期被视作分词器质量的默认代理指标 (35 (https://arxiv.org/html/2608.18062#bib.bib5))。然而后续研究直接挑战了这两项发现 (37 (https://arxiv.org/html/2608.18062#bib.bib8); 10 (https://arxiv.org/html/2608.18062#bib.bib14))。
我们认为这些混合结果并非表明内在评估毫无希望,而是说明我们需要更丰富的内在指标来捕捉特定领域的结构化分词器属性,同时需要通过受控实验隔离分词器特性的具体影响。本文同时应对这两个需求。
我们的贡献如下:
- • 我们引入了开源库TokEval,实现了一套涵盖文本、数学、代码和多语言公平性的内在分词器评估指标,并包含分词器可视化与完整性检查(第3节 (https://arxiv.org/html/2608.18062#S3))。
- • 我们提出了针对数学内容和代码的新型内在指标,这些指标专门用于衡量特定下游能力(第3.5节 (https://arxiv.org/html/2608.18062#S3.SS5)–第3.6节 (https://arxiv.org/html/2608.18062#S3.SS6))。
- • 我们在网格化的分词器配置中开展了受控预训练实验,在保持所有其他变量不变的情况下,系统性地改变分词算法、预分词策略和训练数据混合比例(第5节 (https://arxiv.org/html/2608.18062#S5))。
- • 我们使用混合效应回归模型隔离各指标的贡献,同时控制设计轴之间的协变量关系,结果表明特定内在指标能预测特定下游能力(第5节 (https://arxiv.org/html/2608.18062#S5))。
## 2 背景与相关工作
##### 分词算法
为使机器学习模型能处理文本,文本首先需要表示为实值向量序列。分词是此预处理流程的关键步骤。形式上,分词将输入符号序列(通常是以字节或字符级别表示的原始文本)映射为来自有限词表的输出词元序列。每个词元可通过嵌入查找表关联到一个实值向量。值得注意的是,字节或字符本身可作为词表符号使用,此时映射是平凡的。然而字节级和字符级分词会导致输入序列过长,在训练和推理中带来显著计算开销 (44 (https://arxiv.org/html/2608.18062#bib.bib35); 42 (https://arxiv.org/html/2608.18062#bib.bib34))。
子词分词(词表单元粒度介于字符和完整单词之间)是主流方法,它在词表覆盖率和序列长度之间实现了有利权衡:既提供了有用的学习归纳偏置,又提升了训练和推理效率。
字节对编码 (38 (https://arxiv.org/html/2608.18062#bib.bib1), BPE) 是最广泛使用的子词分词算法。虽然已有其他算法提出并采取不同路径 (19 (https://arxiv.org/html/2608.18062#bib.bib2), 如UnigramLM),但许多研究基于BPE进行改进,针对经验发现的问题提出多种变体(例如SuperBPE、BoundlessBPE和PickyBPE)(25 (https://arxiv.org/html/2608.18062#bib.bib13); 36 (https://arxiv.org/html/2608.18062#bib.bib46); 8 (https://arxiv.org/html/2608.18062#bib.bib33))。
##### 分词化的影响
多项研究调查了分词化选择与模型能力的关系。2 (https://arxiv.org/html/2608.18062#bib.bib37)训练语言模型时仅改变分词器设置,发现分词器选择显著影响大语言模型的下游性能和训练成本。值得注意的是,他们发现分词密度等标准内在指标无法可靠预测下游性能。
35 (https://arxiv.org/html/2608.18062#bib.bib5)同样对大语言模型训练进行分词器消融研究,观察到将多语言分词器替换为专用单语言分词器可提升几乎所有任务和语言的下游性能,其效应量与预训练语料中语言数据占比的影响相当。
39 (https://arxiv.org/html/2608.18062#bib.bib4)证明数字分词直接影响模型的算术能力,仅改变分词策略就会导致数学任务准确率出现约20%的差异。
更深层次上,22 (https://arxiv.org/html/2608.18062#bib.bib44)*因果*证明了:将某个子词加入词表可使相应字符串获得的概率提升高达17倍,相较于该字符串由两个词元表示的情况。
30 (https://arxiv.org/html/2608.18062#bib.bib43)同样表明将自然单词分割为多个词元会对模型性能产生负面影响。
分词器也与模型成本及可及性差异相关。33 (https://arxiv.org/html/2608.18062#bib.bib6)与1 (https://arxiv.org/html/2608.18062#bib.bib42)均记录了分词阶段引入的系统性跨语言不公平性,有时被称为对低资源语言的“分词税” (28 (https://arxiv.org/html/2608.18062#bib.bib16)),因其带来的经济影响。最新研究已将此探索扩展至方言和表征差异领域 (16 (https://arxiv.org/html/2608.18062#bib.bib38))。
##### 内在分词器评估
本研究特别关注内在分词器指标的发展,以及此类指标与下游模型性能关系的研究。*内在*指标在隔离条件下评估分词器,无需训练或查询下游模型;它仅是分词器和文本语料库的函数。相比之下,*外在*指标衡量分词器对使用该分词器训练的模型性能的影响(例如比特/字节、任务准确率)。
内在指标因其成本低廉而具有吸引力:评估分词器通常仅需数秒,而训练语言模型以测量外在影响可能需要数天或数周。最常用的内在指标是基于压缩度的度量,如语料词元数和分词密度,用于量化分词器对文本的碎片化程度。然而先前研究表明,仅基于压缩度的指标并非分词器设计的可靠目标。例如37 (https://arxiv.org/html/2608.18062#bib.bib8)显示最小化语料词元数并不能可靠提升下游性能,而10 (https://arxiv.org/html/2608.18062#bib.bib14)构建的分词器可任意提高Rényi效率却*降低*模型性能。
因此最新研究主张通过多个互补的内在信号评估分词器,而非仅依赖压缩度 (26 (https://arxiv.org/html/2608.18062#bib.bib15))。另一系列研究关注分词器与形态单位的对齐性。3 (https://arxiv.org/html/2608.18062#bib.bib9)引入形态分数(MorphScore),衡量词元边界与语素边界的对齐程度,并表明分词质量有助于解释语言模型性能的部分跨语言差异,尽管形态边界对齐本身并非始终具有预测性。
相关地,40 (https://arxiv.org/html/2608.18062#bib.bib41)显示保持形态的分割倾向于比根词分割产生更好的上下文表征,而16 (https://arxiv.org/html/2608.2608.18062#bib.bib38)表明分词公平性对依赖句法和形态线索的方言自然语言处理任务的下游性能具有特殊预测性。
## 3 TokEval框架
TokEval在用户指定的文本语料库上为分词器计算一套内在指标。该库支持按语言处理文本输入,以实现细粒度的跨语言分析。
具体而言,设𝒯为分词器,𝒞={(x_i,ℓ_i)}_{i=1}^N为包含文本x_i及其语言标签ℓ_i的语料库。我们用‖x‖_u表示文本x在单位u下的长度,其中u∈{字节, 字符, 单词, 行},字节为默认单位。²
> ² 单位选择取决于分析需求。字节无需语言特定的单词或字符边界定义,但会惩罚UTF-8编码较大的文字系统(拉丁语1字节,中日韩语3-4字节,表情符号4字节)。行数适用于平行语料库(每行对应一条翻译),使计数跨语言保持恒定,将分词器与语言惯例及编码伪影隔离。
每条文本被编码为词元序列t_i = 𝒯(x_i),其中每个词元t来自分词器的词表𝒱。所有指标按语言报告并进行全局聚合。表1 (https://arxiv.org/html/2608.18062#S3.T1)总结了指标;更多细节和设计选择依据在以下小节中提供。
TokEval以Python实现,原生支持五类分词器:HuggingFace类(通过单一类加载tokenizers(Rust加速)和transformers格式)、SentencePiece类 (18 (https://arxiv.org/html/2608.18062#bib.bib3))、预分词语料类(用于已分割为词元的输入),以及ScriptBPE/MinGram类(均使用SCRIPT编码类 (20 (https://arxiv.org/html/2608.18062#bib.bib39)))。register_tokenizer_class钩子允许用户注册其他分词器类。统一包装器确保不同后端下指标计算的一致性。
TokEval还包含“健全性检查”模块,对每个分词器运行十六项确定性检查(例如字节覆盖度、组合标记处理、数字处理、往返保真度和词表可达性),并汇总为每个分词器的通过/警告/失败严重等级。可视化模块生成分词文本可视化及标准化图表(包括按指标、按语言、按分面细分的柱状图),用于比较不同分词器。
表1:TokEval内在指标总结。符号:p(t)是词表项t在输入语料库中的相对频率;n_t是语料库中所有以t开头的双元组计数;n_{t,t'}是所有以(t,t')开头的三元组计数;𝒜(c)是观察到作为上下文c后继的不同词表项集合;x̂ = 𝒯⁻¹(𝒯(x))是往返重建;B_obs/B_ideal是观察/理想数字边界集合(见第3.5节 (https://arxiv.org/html/2608.18062#S3.SS5));𝒮是特殊词元集合。相似文章
当分词与语言建模联合优化时,会学习到哪些词元?
本文研究了当分词与语言建模联合优化时所学习到的词元,比较了跨多种语言的无分词器方法,发现它们为自然语言处理生成了独特而高效的词汇表。
@omarsar0: TokTier makes tokenization stateful for agentic serving. Across 153,951 real agent calls with a 94.1% prompt-cache hit …
TokTier is a stateful tokenization service that cuts tokenization overhead in agentic LLM serving by reusing stable token boundaries and running exact CPU/GPU tokenization, reducing time-to-first-token by 16–34% under vLLM.
TokenScope: 面向大型语言模型中代码任务的词元级可解释性与可理解性
TokenScope是一个面向仅解码器大型语言模型的交互式可解释性工具,在代码生成过程中提供词元级指标、注意力模式及反事实分支,支持系统性地研究模型行为。
时间序列即语言:面向通用时间序列基础模型的通用分词器
本文提出UniTok,一种将连续时间序列转化为离散标记的通用分词器,以及UniTok-FM,一个基于下一标记预测预训练的基础模型。该模型支持零样本和提示增强预测,以及通过无需训练的上下文推理实现少样本生成和分类——这是以往工作未能实现的能力。
字节级模型
讨论了字节级分词器是否在精确任务(如区分相似名称、计数字符和大小写敏感)上优于子词分词器,并询问当前推荐。