标签
Liquid AI进行了一项实验,其中编码智能体自主构建了一个名为toktoktok的生产级BPE分词器训练器,分享了关于设计有效的智能体循环和验证基础设施以解决实际问题的经验教训。
This paper investigates whether released LLM tokenizer vocabularies can support fine-grained token-level estimation of hidden pretraining corpora, proposing a Quantile-Guided Density Estimation (QGDE) method that achieves low error rates in controlled and realistic settings.
本文提出JOLT,一种整数规划方法,用于优化基于从左到右贪心最长匹配解码(WordPiece)的子词分词。JOLT实现了近乎最优的压缩,缩小了BPE与理论下界之间的大部分差距,使token数量相比BPE最多减少0.78%。
本文介绍了BHARATI,一组基于SentencePiece BPE的分词器,在针对古典印度语言的平衡多语语料库上训练而成。子词丰富度分析显示,分词效率显著提升,与基线分词器相比,序列长度最多缩短90%,从而提高了下游语言模型的有效上下文长度。
本文系统比较了化学SMILES字符串的BPE和Unigram-LM分词方法,发现它们产生了几乎不相交的词汇表,并且在分割粒度上存在显著差异。结果表明,子词算法的选择是一个关键的建模决策,而不是一个免费的默认选项。
quicktok 是一个快速且精确的 BPE 分词器,用 C++ 编写,与 tiktoken 字节一致,比现有替代方案快 2–11 倍。支持 cl100k、o200k、GPT-OSS、Llama-3 和 Qwen2.5/3 编码器。