@maximelabonne: 如何为模型添加新语言?高效的分词在此中扮演关键角色。在这篇新博文中,我们讨论…

X AI KOLs Following 模型

摘要

Liquid AI 分享了原地升级预训练模型分词器的秘诀,将 LFM2.5 的分词器从 65K 扩展到 128K,以提高对泰语、越南语和印地语等语言的效率,结果使得令牌数量减少多达4倍,生成速度提升2.2-3.7倍。

如何为模型添加新语言? 高效的分词在此中扮演关键角色。在这篇新博文中,我们讨论了如何扩展 LFM2 的分词器来添加新语言。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:27

如何为模型添加新语言?

高效的 tokenization 在此起到关键作用。在这篇新博客文章中,我们将讨论如何扩展 LFM2 的 tokenizer 以添加新语言。

Liquid AI (@liquidai): 我们将 LFM2.5-8B-A1B 的 tokenizer 从 65K 扩展到 128K,以修复那些切分过细的语言。今天我们分享一种在预训练模型中原位升级 tokenizer 的方法。

> 泰语现在使用的 token 数量减少 4.0 倍,越南语减少 2.6 倍,印地语减少 2.4 倍 > 预计速度提升 2.2 至 3.7 倍

相似文章

Token 最大化

Reddit r/singularity

讨论在大型语言模型中最大化 Token 使用以提高效率和输出质量的策略与技术。

超越原子标记:音节分解在语言模型预训练中的应用

arXiv cs.CL

本文介绍了一种基于语言学的音素分词器,用于越南语和中文,该分词器将音节分解为声母、韵母和声调成分,从而减小词汇表大小并提高效率。所提出的PhonemicBERT模型在语言理解任务中与现有的分词器和预训练模型相比,展示了具有竞争力或更优的性能。