@percyliang: ! 分词是你在CS336(从头构建语言模型)中做的第一件事。如果Marcel能对LM流水线的其余部分施展魔法……
摘要
Marcel Rød 宣布了 Gigatoken,一个分词器实现,比 HuggingFace 快 500-1000 倍,比 OpenAI 的 tiktoken 快 100 倍,使用 Rust 构建。
查看缓存全文
缓存时间: 2026/07/22 06:19
⚡!分词是你在CS336(从零构建语言模型)中首先要做的事情。如果Marcel能在LM管道的其余部分施展他的魔法,世界将会变得更美好。
Marcel Rød (@marcelroed): 介绍全球最快的分词器实现——Gigatoken!
在大多数机器上,对于大多数分词器定义,Gigatoken比HuggingFace快约500-1000倍,比OpenAI的tiktoken快约100倍。
而这些基线已经是多线程的Rust实现!🧵
相似文章
Gigatoken: 一个新的开源分词器,比Tiktoken快约100倍,比Huggingface快500-1000倍
Gigatoken 是一个开源分词器,通过SIMD和缓存优化,相对于HuggingFace分词器实现了高达1000倍的加速,相对于Tiktoken实现了100倍加速。它支持作为现有分词器API的直接替代。
Gigatoken (GitHub Repo)
Gigatoken 是一个即插即用的替代 tokenizer,声称相比 HuggingFace 的 tokenizer 速度提升高达 1000 倍,支持许多常见的 tokenizer 和 CPU。
GigaToken:语言模型分词速度提升约1000倍
GigaToken 是一个超快速的分词器库,声称比 HuggingFace 分词器快达 1000 倍,支持大多数常见的大语言模型分词器,并提供即插即用的兼容性。
quicktok: 一个更快的分词器(与tiktoken精确且字节一致)[P]
quicktok 是一个快速且精确的 BPE 分词器,用 C++ 编写,与 tiktoken 字节一致,比现有替代方案快 2–11 倍。支持 cl100k、o200k、GPT-OSS、Llama-3 和 Qwen2.5/3 编码器。
利用自引导标记化平衡图像压缩与生成
介绍了SelfBootTok,一种自引导标记化方法,它将全局和局部信息分离,使生成器计算量减少约40%,仅用64个标记即实现了1.56的gFID新最先进水平。