@maximelabonne: 如何为模型添加新语言?高效的分词在此中扮演关键角色。在这篇新博文中,我们讨论…
摘要
Liquid AI 分享了原地升级预训练模型分词器的秘诀,将 LFM2.5 的分词器从 65K 扩展到 128K,以提高对泰语、越南语和印地语等语言的效率,结果使得令牌数量减少多达4倍,生成速度提升2.2-3.7倍。
查看缓存全文
缓存时间: 2026/07/22 08:27
如何为模型添加新语言?
高效的 tokenization 在此起到关键作用。在这篇新博客文章中,我们将讨论如何扩展 LFM2 的 tokenizer 以添加新语言。
Liquid AI (@liquidai): 我们将 LFM2.5-8B-A1B 的 tokenizer 从 65K 扩展到 128K,以修复那些切分过细的语言。今天我们分享一种在预训练模型中原位升级 tokenizer 的方法。
> 泰语现在使用的 token 数量减少 4.0 倍,越南语减少 2.6 倍,印地语减少 2.4 倍 > 预计速度提升 2.2 至 3.7 倍
相似文章
Token 最大化
讨论在大型语言模型中最大化 Token 使用以提高效率和输出质量的策略与技术。
@maximelabonne: 我们刚刚发布了两个新的编码器模型(MLM)在2026年。它们非常快,易于训练,并且多语言能力强。试试…
Liquid AI发布了两个新的编码器模型,LFM2.5-Encoder-230M和LFM2.5-Encoder-350M。这些模型快速、易于训练且多语言能力强。速度基准测试显示,与ModernBERT-base相比,CPU性能提升了3.7倍以上。
超越原子标记:音节分解在语言模型预训练中的应用
本文介绍了一种基于语言学的音素分词器,用于越南语和中文,该分词器将音节分解为声母、韵母和声调成分,从而减小词汇表大小并提高效率。所提出的PhonemicBERT模型在语言理解任务中与现有的分词器和预训练模型相比,展示了具有竞争力或更优的性能。
@liquidai: 介绍 LFM2.5-Embedding-350M 和 LFM2.5-ColBERT-350M:两款为超快且精准的多语言检索模型
Liquid AI 推出 LFM2.5-Embedding-350M 和 LFM2.5-ColBERT-350M,这两款多语言检索模型经过优化,可在11种语言中实现快速准确的搜索,延迟低至1.5毫秒。
@NVIDIAAI: 大多数语言模型一次只生成一个token。我们刚刚发布了Nemotron-Labs-Diffusion,一个扩散语言模型系列…
NVIDIA发布了Nemotron-Labs-Diffusion,这是一个扩散语言模型系列,可以并行生成多个token,从而实现更快的推理和更好的GPU利用率,模型规模从3B到14B,包括视觉语言变体。