字节级模型
摘要
讨论了字节级分词器是否在精确任务(如区分相似名称、计数字符和大小写敏感)上优于子词分词器,并询问当前推荐。
如今,在精确任务中,字节分词器和解码器相比子词分词器有多大帮助?它们在区分相似名称和单词的细微差别而不混淆(例如 Jansen vs Jensen)、计数字符、区分大写和小写字母,或在摘要中“跳过”数据方面,是否真的有更好的结果?如果它们确实有助于细粒度任务,那么当前的偏好是哪一种?
相似文章
通过字节级模拟解耦子词分词对语言模型训练的益处
本文通过进行受控的字节级预训练实验,研究了子词分词对LLM训练效率和性能的影响。它揭示了关键因素,如训练吞吐量以及将子词边界作为语言先验的整合。
面向字节级BPE的书写系统级分词器适配
本文介绍了BPE引导插入,用于对字节级BPE模型进行事后分词器适配,在保持词汇表大小固定的同时保留大多数token-ID分配。该方法将乌克兰语的token数量减少约33-36%,同时将对英语和其他欧洲语言的影响降至最低。
语言编码的速率-效用前沿:在受控语言内容下比较令牌、字节和像素
本文比较了在13种语言的受控语言内容下,作为语言模型文本编码的子词令牌、原始字节和渲染像素。它追踪了速率-效用前沿,发现没有一种编码在所有任务中占主导地位:像素最佳地保留了表面形式,字节最佳地保留了跨语言对齐,令牌最佳地支持了主题预测。
跨分词器LLM蒸馏:基于字节级接口的方法
本文提出字节级蒸馏(BLD),一种简单的跨分词器知识迁移方法,通过在共享的字节级接口上操作,在1B-8B参数模型上实现了与更复杂现有方法相当或更优的性能。
Compute Optimal Tokenization (2分钟阅读)
本文通过训练近1300个模型,系统推导了压缩感知的神经缩放定律,证明了广泛使用的每参数20个词元的启发式方法是由特定分词器造成的。作者提出了基于字节的分词器无关缩放定律,为跨多样语言和模态的计算高效训练提供了新框架。