标签
一篇关于现代 NLP 中分词(tokenization)的全面综述,由 32 位 tokenizer 研究者共同编写,涵盖算法、评估、多语言、编码、理论,以及潜在(latent)或视觉(visual)分词等替代方案,还包括受约束生成和 tokenizer 安全等相邻主题。
本文研究了词汇规范化中的多语言诅咒,发现同时在多种语言上训练单个模型会导致各语言准确率下降,而当语言以小组形式训练时性能最佳。
本文介绍了'文化漏斗'概念,展示了LLM训练数据中的文化信号在后训练阶段急剧下降。作者发布了一个包含5.6M样本的标记数据集,以帮助在模型对齐中保留文化基础。