MameLoshnLM:意第绪语语言模型与评估基准

arXiv cs.CL 论文

摘要

本文介绍了 MameLoshnLM,这是首个开源的 8B 参数意第绪语语言模型,同时还包括 Oytser 预训练语料库和 Kashes 评估基准。研究表明,在高质量意第绪语数据上进行持续预训练的表现优于通用多语言模型,凸显了专门进行低资源语言建模的价值。

arXiv:2608.05850v1 公告类型:新 摘要:我们提出了 MameLoshnLM,这是首个专为意第绪语构建的开源 8B 参数语言模型。尽管意第绪语拥有丰富的文本传统,但其有限的数字存在和可靠评估资源的稀缺制约了意第绪语语言建模的发展。现有的多语言语料库和基准通常无法很好地代表该语言,其中包含大量有噪声的、机器翻译的和错误分类的文本。为了解决这些不足,我们引入了 Oytser,一个高质量的意第绪语预训练语料库,它结合了当代网络来源与文学材料;以及 Kashes,一个涵盖翻译、语言分析、信息抽取和语言理解的多任务基准。利用这些资源,我们对 Llama 3.1 8B 进行持续预训练,得到了 MameLoshnLM。在基准中的各项任务上,MameLoshnLM 的性能优于相似规模的开源基线。我们的分析表明,这些提升不仅是数量上的:相对于通用多语言模型,MameLoshnLM 能更好地捕捉定义语言的词汇和形态模式,这揭示了大规模多语言网络数据对低资源语言的一个更普遍的失败模式。我们的研究结果为意第绪语自然语言处理奠定了基础,也为那些历史丰富但在数字领域中代表性不足的语言开发语言模型提供了实用模板。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:52

# 意第绪语语言模型与评估基准

来源:https://arxiv.org/html/2608.05850

Uri Katz1 Omer Goldman2 Tomasz Limisiewicz3 Reut Tsarfaty1,אָ^{1,\text{אָ}} Noah A. Smith3,4,אָ^{3,4,\text{אָ}}

1巴伊兰大学  
2剑桥大学  
3华盛顿大学  
4艾伦人工智能研究所  

###### 摘要

我们提出了 **MameLoshnLM**<sup>1</sup>,这是首个专为意第绪语构建的开源 8B 参数语言模型。尽管意第绪语拥有丰富的文本传统,但其有限的数字存在和可靠评估资源的稀缺制约了意第绪语语言建模的进展。现有的多语种语料库和基准往往是该语言的不良替代品,其中包含大量有噪声、机器翻译和错误分类的文本。我们通过引入 **Oytser**(一个高质量的意第绪语预训练语料库,结合了当代网络原生来源与文学材料)和 **Kashes**(一个涵盖翻译、语言分析、信息抽取和语言理解的多任务基准)来弥补这些空白。利用这些资源,我们继续预训练 Llama 3.1 8B 以获得 **MameLoshnLM**。在基准的各类任务中,**MameLoshnLM** 优于相似规模的开源基线。我们的分析表明,这些提升不仅仅是数量上的:相对于通用多语种模型,**MameLoshnLM** 能更好地捕捉定义语言的词汇和形态模式,这指向了有噪声的网络规模多语种数据对低资源语言的更广泛失败模式。我们的结果既为意第绪语 NLP 奠定了基础,也为在历史上丰富但数字表现不足的语言中开发语言模型提供了实用模板。

<sup>1</sup>该模型及相关资源可在 https://github.com/katzurik/MameLoshnLM 获取。

---

## 1 引言

尽管多语种语言建模进展迅速,大语言模型(LLMs)的收益在不同语言之间仍然高度不均衡(Wu et al., 2025)。性能通常对数字存在广泛、高质量文本量大且评估资源成熟的语言最强,而低资源语言则远远得不到充分服务。意第绪语是一个特别有趣的案例。它是一种历史悠久的日耳曼语言,主要用希伯来字母书写,同时也包含大量的希伯来语和阿拉米语词汇层,并反映了与斯拉夫语言的长期接触。尽管它有着悠久而丰富的文学历史,其当代在线存在却非常有限,而且在常见的网络规模数据集中,大量意第绪语文本往往是稀疏的、有噪声的,或者与该语言今天的使用方式极不匹配。结果是,模型既不能服务该语言约一百万的使用者,也不能服务研究意第绪语世界历史与文化的学术界。

这些局限性反映了整个 LM 开发流程中的空白。在数据方面,可公开获取的意第绪语预训练文本数量有限(Xue et al., 2021),而且其质量尚未得到很好的刻画(Kreutzer et al., 2022)。在本文中,我们通过对 mC4 的详细分析表明,其所谓意第绪语内容中有相当一部分要么是机器翻译的垃圾内容,要么根本不是意第绪语。我们发现,其中只有不到一半的数据是真正的意第绪语文本。在评估方面,针对意第绪语的基准非常稀缺,而现有的基准往往基于自动翻译,而不是为该语言本身设计的任务(Singh et al., 2024)。因此,要有效应对意第绪语,不仅需要添加更多文本,还需要在语料库构建、评估、模型适配和分析方面进行协调工作。

我们引入了 **MameLoshnLM**,一个开源 8B 参数意第绪语 LM,以及两个配套资源:**Oytser**(一个新的意第绪语预训练语料库)和 **Kashes**(一个评估意第绪语 LM 的基准)。**Oytser** 旨在通过将当代网络原生意第绪语与来自意第绪语文学传统的材料相结合,成为常见开放多语种资源的高质量替代品。这对意第绪语尤其重要,因为其历史文本记录远比当前网络足迹丰富。我们还引入了 **Kashes**,一个由现有和新开发任务组成的基准,旨在为评估意第绪语语言模型提供更广泛、更可靠的基础。利用这些资源,我们继续预训练 Llama 3.1 8B 以获得 **MameLoshnLM**。在基准测试中,**MameLoshnLM** 优于相似规模的开源模型,在翻译、语言分析和命名实体识别等以意第绪语为中心的任务上取得了显著提升。

除了基准性能之外,我们的分析表明,**MameLoshnLM** 输出的意第绪语在形态和词汇上更加自然,避免了通用多语种 LM 经常产生的过度德语化和类似翻译腔的特征(第 8 节)。我们进一步发现,虽然英语

相似文章

大语言模型在低资源语言人文学科研究中的机遇与挑战

arXiv cs.CL

本文系统评估了大语言模型在低资源语言研究中的应用,分析了在语言变异、历史文献、文化表达和文学分析等方面的机遇与挑战。研究强调了跨学科合作和定制化模型开发,以保护语言和文化遗产,同时解决数据可获取性、模型适应性和文化敏感性问题。