Tokenization:现代 NLP 综述 [R]
摘要
一篇关于现代 NLP 中分词(tokenization)的全面综述,由 32 位 tokenizer 研究者共同编写,涵盖算法、评估、多语言、编码、理论,以及潜在(latent)或视觉(visual)分词等替代方案,还包括受约束生成和 tokenizer 安全等相邻主题。
尽管分词(tokenization)的影响遍及整个 NLP 领域,但它却是一个研究严重不足的方向。在过去约 8 个月里,32 位(!)tokenizer 研究者共同整理出了该领域迄今最全面的一篇综述。我们涵盖了分词的方方面面:算法、评估、多语言、编码、理论等。我们甚至讨论了你可能想要用来替代 tokenizer 的方案(例如 latent 分词或视觉分词)。此外,我们还涉及了一些与分词紧密相邻的主题,如受约束生成(constrained generation)、token healing 以及 tokenizer 的安全问题。快来一探究竟!https://www.alphaxiv.org/abs/2609.tokenization-survey-modern-nlp
相似文章
Compute Optimal Tokenization (2分钟阅读)
本文通过训练近1300个模型,系统推导了压缩感知的神经缩放定律,证明了广泛使用的每参数20个词元的启发式方法是由特定分词器造成的。作者提出了基于字节的分词器无关缩放定律,为跨多样语言和模态的计算高效训练提供了新框架。
TokEval:分词器评估套件
本文介绍了TokEval,一个用于评估语言模型分词器的框架,该框架利用与下游任务性能相关的内在指标。
超越标记:大型语言模型与视觉语言模型的解码方法综述
本综述论文系统回顾了大型语言模型与视觉语言模型的解码方法,聚焦于推理时方法以提升效率和控制生成过程。文中识别了新兴范式,指出了当前挑战,并探讨了未来研究方向。
字节级模型
讨论了字节级分词器是否在精确任务(如区分相似名称、计数字符和大小写敏感)上优于子词分词器,并询问当前推荐。
ReconSpan:重构引导的自适应潜在分词
ReconSpan 引入了一种自适应潜在分词方法,利用后向解码器将文本划分为可重构的块,从而实现可变长度的潜在标记以及训练后对粒度的控制。