语言编码的速率-效用前沿:在受控语言内容下比较令牌、字节和像素
摘要
本文比较了在13种语言的受控语言内容下,作为语言模型文本编码的子词令牌、原始字节和渲染像素。它追踪了速率-效用前沿,发现没有一种编码在所有任务中占主导地位:像素最佳地保留了表面形式,字节最佳地保留了跨语言对齐,令牌最佳地支持了主题预测。
arXiv:2607.16117v1 公告类型:新
摘要:语言模型将文本编码为子词令牌、原始字节或渲染像素,但这些编码通常是在建模约束下进行比较的,这些约束会使不同语言的模型暴露于不同数量的语言内容。我们转而探究,在内容和下游容量都受控的情况下,每种编码保留了哪些信息。使用经过验证的十三种语言和五种文字的平行句子,我们通过一个共享瓶颈比较令牌、字节和像素,该瓶颈的宽度被扫描以追踪速率-效用前沿。这分离了常常被混淆的三个量:编码产生的输入位置数量、编码后可用的潜在容量,以及压缩后幸存下来的任务相关信息。我们评估了三种效用:表面形式保留、跨语言句子对齐和主题分类。没有一种编码在所有任务或容量机制中占主导地位。像素最佳地保留了表面形式,字节最佳地保留了跨语言对齐,尤其是在同文字的多语言设置中,而令牌最佳地支持了主题预测。这些表现并不能仅由序列长度解释。短输入可能丢弃有用的含义,而长输入可以保留压缩效果好的信息。因此,选择编码并不是对令牌、字节或像素的固定偏好,而是一个取决于任务、语言组合、容量机制和计算预算的速率-效用权衡。
查看缓存全文
缓存时间: 2026/07/20 09:37
# 在受控语言内容下比较词元、字节和像素 来源:https://arxiv.org/html/2607.16117 ## 语言编码的率-效用前沿:在受控语言内容下比较词元、字节和像素 Ingo Ziegler Martin Krebs Desmond Elliott 哥本哈根大学计算机科学系 inzi@di\.ku\.dk, lsw275@alumni\.ku\.dk, de@di\.ku\.dk ###### 摘要 语言模型将文本编码为子词词元、原始字节或渲染像素,但这些编码通常是在模型对不同语言暴露不同数量语言内容的建模约束下进行比较的。我们转而探究,当内容和下游能力都被控制时,每种编码保留了什么。利用经过验证的涵盖十三种语言和五种文字的平行句子,我们通过一个共享瓶颈来比较词元、字节和像素,该瓶颈的宽度被遍历以描绘率-效用前沿。这区分了三个经常被混为一谈的量:编码创建的输入位置数量、编码后可用的潜在容量,以及在压缩中幸存下来的任务相关信息。我们评估了三种效用:表层形式保存、跨语言句子对齐和主题分类。没有任何一种编码在所有任务或容量区间中占优。像素在保存表层形式方面最佳,字节在保存跨语言对齐方面最佳(尤其是在同文字的多语言环境中),而词元在支持主题预测方面最佳。这些表现不能仅用序列长度来解释。短输入可能丢弃有用的含义,而长输入则可能保存压缩效果良好的信息。因此,选择编码并非对词元、字节或像素的固定偏好,而是一个取决于任务、语言组合、容量区间和计算预算的率-效用权衡。 ## 1 引言 在语言模型处理文本之前,文本必须被编码为单元序列。大多数模型使用子词词元(Radford et al., 2019; Grattafiori et al., 2024; Yang et al., 2025; GLM-5-Team et al., 2026),有些读取原始字节(Xue et al., 2022; Yu et al., 2023; Pagnoni et al., 2025),少数则将文本渲染为图像并处理像素(Salesky et al., 2021; Rust et al., 2023; Kesen et al., 2025)。尽管这些编码保留了语言内容,但它们改变了模型所看到的表征。词元由来自已学习但固定词表的、承载意义的单元组成短序列(Sennrich et al., 2016)。字节由来自小型通用字母表的单元组成较长的序列(Xue et al., 2022)。像素形成二维图像,具有空间布局和视觉细节,但没有离散符号(Rust et al., 2023)。这些差异在不同语言和文字间会扩大,这使得编码难以比较。 先前的研究表明,预训练的分词器在不同语言中暴露了不相等数量的语言内容(Petrov et al., 2023; Ahia et al., 2023)。图1显示,这个问题不仅限于分词。固定的序列长度、批次大小或计算预算,可能根据编码和语言的不同而包含不同数量的内容(Petrov et al., 2023)。因此,在两个编码之间测量到的差异,可能反映的是模型被展示了多少内容,或者模型被给予了多大容量,而非编码本身保留了什么。可控的比较需要两个量保持恒定。首先,内容必须相同,这样只有编码发生变化。其次,下游容量必须可控,这样判断编码的标准是其如何利用给定的预算,而非其需要多大的预算。这将核心问题从"哪种编码更短"转变为"哪种编码在压缩下能更好地保留有用的任务相关信息"。 我们直接满足这两个条件。我们使用SIB-200(Adelani et al., 2024),这是一个由人工翻译的并行数据集,其中相同的含义在每种语言中出现;并且我们让每种编码通过一个固定宽度的共享瓶颈。与Ahia et al. (2023)和Petrov et al. (2023)的方法互补,我们针对每个语言情境在匹配内容上重新训练分词器,因此词元基线适应与字节和像素编码相同的语言。这使我们能够区分三个经常混合在一起的概念:编码创建了多少个输入位置、编码后我们允许有多少潜在容量、以及哪些任务相关信息在压缩中幸存。我们称第一个为**源率**,通过改变瓶颈宽度来遍历第二个,并通过三种效用(探针互补地使用文本表征:保存形式、对齐翻译和支持下游语义预测)来测量第三个。我们在各种语言情境中评估这些量,这些情境从单一语言,到同一种文字的五种语言,再到同时使用五种文字。 我们发现效用前沿并不遵循源率。相反,编码的比较强烈依赖于内容和容量如何被控制。短编码可能错误分配容量,而长编码可能保存结构使其压缩效果好。优选的编码随任务和容量区间而变化:像素最好地保存表层形式,字节最可靠地保存跨语言对齐,词元最好地支持主题预测。同一种文字在不同效用下也可能扮演不同角色。中文在跨文字对齐上很困难,尤其对于像素,但其语标形式在主题预测上缩小了编码间的差距。 ![参见标题图1]() 图1:相同的语言内容在不同编码和语言下产生不同的**源率**。每列显示同一SIB-200句子的翻译,并标注了词元、字节和像素块长度。固定的输入长度不会向模型暴露跨表征的相等内容。例如,中文在词元上比英文长,即使分词器是在匹配内容和情境特定语言上重新训练的,但在字节和块上更短。我们的实验考察了源率差异如何与瓶颈容量交互,以完成需要不同类型信息的任务。 我们的结果表明,更便宜的编码未必更好,什么算作有用取决于想要建模什么。我们的贡献如下: - • 我们引入了文本编码的受控率-效用比较。该比较通过并行句子固定语言内容,通过共享瓶颈固定下游容量,并跟踪容量变化时的效用,以及每条前沿所需的训练计算量。 - • 我们展示了编码偏好取决于效用。像素保存表层形式,字节保存跨语言对齐,词元支持主题预测,文字组合和瓶颈容量会改变其边际效益。 - • 我们在十三种语言和五种文字上,针对相同的语言内容测量了词元、字节和像素的源率,证实并扩展了先前关于长度差异的发现,将其应用于渲染文本和匹配内容分词器情境。 ## 2 相关工作 #### 分词和多语言不平衡。 先前的研究表明,多语言分词器在生育率(Nayeem et al., 2025)、词表覆盖率(Limisiewicz et al., 2023)以及跨语言的下游质量(Rust et al., 2021)上存在差异,尤其对于低资源(Raj S et al., 2025)和形态丰富的语言(Asgari et al., 2025),以及分词器训练数据中代表性不足的文字(Limisiewicz et al., 2023)。最接近我们源率分析的是 Petrov et al. (2023) 和 Ahia et al. (2023),他们在 FLORES-200 (NLLB Team et al., 2022) 的并行文本上测量了长度差异。他们表明,相同的内容在一种语言中可能比在另一种语言中花费更多的词元,Petrov et al. (2023) 还报告了在字节和字符级别上存在类似的差距。这些研究聚焦于预训练的分词器,并将长度差异视为公平性、可及性和商业成本的问题。我们针对每个语言情境,在匹配的并行文本上重新训练一个分词器,这也将源率从分词器自身的训练数据中隔离出来,并且我们加入了渲染像素作为第三种编码。核心之处在于,我们超越了长度本身,转而探究当每种编码都通过相同的容量瓶颈时,每种编码保留了多少任务相关信息。 #### 无词表编码器。 这些编码器用更小的原子单元(如 UTF-8 字节或 Unicode 字符)替换已学习的子词词表。ByT5 (Xue et al., 2022) 使用未压缩的字节,而 CANINE (Clark et al., 2022) 在其更深层之前对字符进行降采样。像素模型 (Salesky et al., 2021; Rust et al., 2023) 完全舍弃符号,通过将文本渲染为图像并处理像素块,Pix2Struct (Lee et al., 2023) 直接从渲染的屏幕截图中读取语言。两者都付出了结构性代价:字节在序列长度上,像素在二维图像上。这些工作探讨的是,在改变架构、目标或规模后,此类模型能否与词元模型匹敌。我们则探讨当架构、内容和容量都固定时,每种编码保存了什么。 ## 3 实验设置 ### 3.1 受控内容和语言情境 我们的比较控制了内容,因此我们测量到的任何差异都来自编码,而非来自展示给模型的内容。因此,所有实验都使用 SIB-200 (Adelani et al., 2024),这是一个带有主题标签、由人工翻译的并行数据集。每个句子在每种语言中都具有相同的主题标签,因此内容和标签在跨语言时天然对齐。我们使用标准划分:每种语言 701 个训练句子、99 个验证句子和 204 个测试句子。 我们研究了五个语言情境,每次隔离一个因素。两个是单语言的:英语(使用字母拉丁文字)和中文(使用语标汉字)。两个是在单一文字内的多语言:Latin-5(英语、西班牙语、土耳其语、印度尼西亚语和斯瓦希里语)和 Cyrillic-5(俄语、保加利亚语、乌克兰语、塞尔维亚语和哈萨克语)。第五个 Multiscript-5 将五种语言与五种文字配对:英语(拉丁文)、俄语(西里尔文)、阿拉伯语(阿拉伯文)、印地语(天城文)和中文(汉文)。每个多语言情境包含与单语言情境相同的句子,每种语言重复一次,因此它增加了语言但没有增加新的内容。单语言情境去除了多语言性,同文字情境在保持文字固定的同时增加语言,而多文字情境则增加了文字。分别考虑每个情境可以将语言数量的影响与文字多样性的影响分离开来。 我们使用三种探针,每种对应文本表征的不同用途,以测量每种编码在压缩下保留了哪些信息。形式保存探询问书写的句子本身是否可以被恢复。跨语言检索探询问相同句子的翻译在表征空间中是否保持接近。主题分类探询问压缩后的表征是否保留了足够的信息以支持下游预测头。每个任务在其使用的第4节中都有完整定义。这些探针对于不同的应用都很重要。当表层本身是任务的一部分时,形式很重要,例如 OCR (Kim et al., 2022; Li et al., 2023)、场景文本 (Jang et al., 2026)、文档理解 (Lee et al., 2023; Kim et al., 2022)、拼写敏感处理 (Salesky et al., 2021; Vesalainen et al., 2026) 和视觉文本生成 (Liu et al., 2023; 2024)。当表征需要跨文字和语言的语义等价性时,跨语言含义很重要,例如双文本挖掘 (Heffernan et al., 2022; Artetxe & Schwenk, 2019)、多语言句子嵌入 (Reimers & Gurevych, 2020; Enevoldsen et al., 2025) 或跨语言检索 (Zhang et al., 2023)。主题分类捕捉了最接近编码器风格推理的场景 (Wang et al., 2018; Devlin et al., 2019),其中固定表征必须支持一个分类头。 ### 3.2 编码 我们比较相同内容的三种编码。**词元**暴露了学习到的分段:频繁的子词成为单个单元,这压缩了常见文本但固定了词表。**字节**暴露了固定的通用字母表:每个字符串都是一个 UTF-8 字节序列,代价是更多的位置。**像素**暴露了视觉形式:文本被渲染为图像,移除了符号单元但增加了表层细节,如间距和字形形状。 **词元。** 我们使用 SentencePiece (Kudo & Richardson, 2018) 和 Unigram 模型 (Kudo, 2018),词表大小为 32,000。我们针对每个语言情境,在该情境语言的圣经翻译(Christodouloupoulos & Steedman, 2015; Wordproject, 2026; HTML Bible, 2026)的并集上训练一个分词器,然后将其应用于 SIB-200。由于圣经翻译是并行的,因此分词器训练在每个情境内的语言之间是匹配的。从圣经文本到 SIB-200 的转变会由于数据集较小而留下一些未使用的词表槽位。 **字节。** 我们将文本编码为原始 UTF-8 字节,这是一个包含 256 个值的固定字母表。 **像素。**
相似文章
字节级模型
讨论了字节级分词器是否在精确任务(如区分相似名称、计数字符和大小写敏感)上优于子词分词器,并询问当前推荐。
兼顾公平与效率:多语言大语言模型分词器的实证研究
本文系统比较了涵盖11种东南亚语言的公平性分词器在多语言大语言模型中的表现,发现Parity-aware BPE在效率与公平之间取得了最佳平衡,并且跨语言公平性与分词效率并非根本冲突。
Compute Optimal Tokenization (2分钟阅读)
本文通过训练近1300个模型,系统推导了压缩感知的神经缩放定律,证明了广泛使用的每参数20个词元的启发式方法是由特定分词器造成的。作者提出了基于字节的分词器无关缩放定律,为跨多样语言和模态的计算高效训练提供了新框架。
跨25种欧洲语言的Tokenizer税:领域不变性、跨语言少样本效应与乌克兰语惩罚
本文在平行文本上测量了25种欧洲语言的分词器标记率,发现从英语到希腊语/马耳他语的差距达到2.5倍,其中乌克兰语承受15-18%的惩罚。研究证明了标记率排名的领域不变性,分析了子词碎片化,并评估了跨语言少样本效应。
非洲语言税:量化前沿大语言模型中分词非洲语言的成本、延迟和上下文惩罚
本文系统量化了20种非洲语言在11个前沿和开源分词器上的分词惩罚,发现推理成本和延迟最高可达8.9倍,有效上下文窗口仅为英语的11%,突显了子词词汇表中编码的结构性数字鸿沟。