字节级模型

Reddit r/LocalLLaMA 新闻

摘要

讨论了字节级分词器是否在精确任务(如区分相似名称、计数字符和大小写敏感)上优于子词分词器,并询问当前推荐。

如今,在精确任务中,字节分词器和解码器相比子词分词器有多大帮助?它们在区分相似名称和单词的细微差别而不混淆(例如 Jansen vs Jensen)、计数字符、区分大写和小写字母,或在摘要中“跳过”数据方面,是否真的有更好的结果?如果它们确实有助于细粒度任务,那么当前的偏好是哪一种?
查看原文

相似文章

面向字节级BPE的书写系统级分词器适配

arXiv cs.CL

本文介绍了BPE引导插入,用于对字节级BPE模型进行事后分词器适配,在保持词汇表大小固定的同时保留大多数token-ID分配。该方法将乌克兰语的token数量减少约33-36%,同时将对英语和其他欧洲语言的影响降至最低。

颠覆字节级语言建模中的层级结构

arXiv cs.CL

本文研究了分层字节级语言模型,并揭示了其设计限制了字符级理解,纯字节级模型在字符操作任务上优于它们,从而确立了计算效率与细粒度性能之间的权衡。