NE-BERT: 针对九种东北印度语言的多语言模型

arXiv cs.CL 论文

摘要

NE-BERT 是一个多语言编码器模型,在830万句数据上训练,覆盖九种东北印度语言和两种锚定语言,通过自定义分词技术,在超低资源语言上显著优于现有模型如 IndicBERT-V2 和 MuRIL。

arXiv:2608.18094v1 公告类型:新 摘要:大型预训练语言模型在多种语言上展现了卓越能力,但严重缺乏资源的语言仍然被边缘化。我们推出 NE-BERT,这是一个特定领域的多语言编码器模型,在约830万句数据上训练,覆盖9种东北印度语言和2种锚定语言(印地语、英语),该地区语言多样,但在现有模型中代表性不足。通过采用加权数据采样和自定义 SentencePiece Unigram 分词器,NE-BERT 在所有9种东北印度语言上优于 IndicBERT-V2 和 MuRIL,平均困惑度分别降低15.97倍和7.64倍,分词效率比 mBERT 高1.50倍。我们通过激进的过采样策略解决了极低资源语言如 Pnar(1,002句)和 Kokborok(2,463句)的关键词汇碎片化问题。在三种东北印度语言上的词性标注下游评估验证了其实用性。我们以 CC-BY-4.0 协议发布 NE-BERT、测试集和训练语料库,以支持自然语言处理研究和东北印度社区的数字化包容。
查看原文
查看缓存全文

缓存时间: 2026/08/20 09:55

# 面向九种东北印度语言的多语言模型  
来源:https://arxiv.org/html/2608.18094  

###### 摘要  
大型预训练语言模型在多语言任务中展现出卓越能力,但资源极度稀缺的语言仍面临边缘化问题。我们提出 **NE-BERT**,一个专注于特定领域的多语言编码器模型,基于约830万句子训练,覆盖9种东北印度语言及2种锚定语言(印地语、英语)。该地区语言多样性极高,但在现有主流多语言模型中代表性不足。通过采用加权数据采样和定制的SentencePiece Unigram分词器,NE-BERT在所有9种东北印度语言上均优于IndicBERT-V2和MuRIL,平均困惑度分别降低 **15.97倍** 和 **7.64倍**,分词效率比mBERT提升 **1.50倍**。针对普纳尔语(1,002句)和科克博罗克语(2,463句)等极低资源语言的词汇碎片化问题,我们通过激进的过采样策略加以解决。在词性标注下游任务中,模型在三种东北印度语言上验证了实用价值。我们以CC-BY-4.0协议开源NE-BERT、测试集及训练语料,以支持自然语言处理研究与东北印度社区的数字化包容。  

**NE-BERT:面向九种东北印度语言的多语言模型**  
Badal Nyalang | Wire Labs  
西隆,梅加拉亚邦,印度 | [email protected]  

---

## 1 引言  
现代自然语言处理系统中高资源与低资源语言之间的性能差距,反映并加剧了现有的数字不平等(Joshi等,2020)。尽管mBERT(Devlin等,2019)等多语言模型提供了广泛的语言覆盖,但在网络资源有限、形态结构复杂的语言上表现不佳(Lauscher等,2020)。这一差距在东北印度原住民语言中尤为明显——该地区拥有超过200种独特语言(Moseley,2010),却在主流自然语言处理研究中几乎缺席。东北印度语言面临独特挑战:资源极端稀缺(部分语言数字化句子不足1,000句)、黏着语形态、文字多样性(拉丁文、孟加拉-阿萨姆文)以及标准化不足。现有区域性工作如IndicBERT(Kakwani等,2020)主要关注拥有大规模语料库的印度官方语言,导致卡西族、加罗族、普纳尔、米佐族和科克博罗克语等语言严重缺乏支持。  

我们提出 **NE-BERT**,一个基于ModernBERT(Warner等,2025)的编码器模型,专为东北印度语言设计。本文贡献包括:  
- • 构建覆盖9种东北印度原住民语言(阿萨姆语、加罗语、卡西语、梅泰语、米佐语、那加语、尼西语、普纳尔语、科克博罗克语)及2种锚定语言(印地语、英语)的多语言语料库,共830万句子,并采用策略性加权采样(Xue等,2021)。  
- • 开发定制的50,368词符SentencePiece Unigram分词器,针对形态丰富和黏着语优化(Kudo和Richardson,2018),分词效率比mBERT提升 **1.50倍**。  
- • 在所有9种东北印度语言上进行全面评估,结果表明NE-BERT优于IndicBERT-V2和MuRIL,在普纳尔、科克博罗克等超低资源语言上提升尤为显著(**77–15倍**)。  

---

## 2 相关工作  
### 2.1 多语言语言模型  
早期多语言模型如mBERT(Devlin等,2019)展示了跨语言迁移能力,但存在“多语言诅咒”(Conneau等,2020)——性能随语言数量增加而下降。XLM-RoBERTa(Conneau等,2020)通过扩大训练语料(2.5TB)缓解了这一问题,但仍出现低资源语言的词汇碎片化。近期针对语言特异性适配(Rust等,2021)和定向持续预训练(Chau和Lin,2020)的研究为弥合这一差距提供了前景。  

### 2.2 区域语言模型  
为满足地方语言需求,多项区域性计划已启动。IndicBERT(Kakwani等,2020)覆盖12种印度官方语言(9B词符),在印度-雅利安语和达罗毗荼语中表现优异,但对东北印度语言覆盖有限。针对非洲语言的类似研究(Ogueji等,2021;Alabi等,2022)证明了区域特异性模型的可行性。然而,这些方法通常聚焦于拥有大规模现有语料库(>>100万句)的语言,未能解决超低资源语言的问题。  

### 2.3 低资源语言的分词  
分词器设计对低资源语言性能至关重要(Ács,2021)。字节对编码(BPE)(Sennrich等,2016)虽流行,但可能将形态丰富的单词分解为次优单元。SentencePiece Unigram(Kudo和Richardson,2018)能更好保留黏着语的语言结构。分词器训练中的加权采样(Lample和Conneau,2019)有助于平衡不同规模语料库的词汇分配,对高度不平衡的数据集尤为关键。  

---

## 3 数据集构建  
### 3.1 语言选择与来源  
我们整理了9种东北印度语言及2种锚定语言的数据(表1)。这些语言分属三大语系:汉藏语系(梅泰语、米佐语、加罗语、科克博罗克语、尼西语、那加语)、南亚语系(卡西语、普纳尔语)和印度-雅利安语系(阿萨姆语)。纳入印地语和英语作为锚定语言以促进跨语言迁移(Artetxe等,2020),尤其适用于需要语码转换支持的任务。  

| 语言 | ISO | 句子数 | 词符数 | 虚拟计数 | 加权倍数 | 语系 | 来源 |  
|------|-----|--------|--------|----------|----------|------|------|  
| **锚定语言** | | | | | | | |  
| 印地语 | hin | 3,404,007 | — | 170,200 | 0.05× | 印度-雅利安 | HF数据集 |  
| 英语 | eng | 500,000 | — | 100,000 | 0.2× | 日耳曼语族 | HF数据集 |  
| **东北印度语言** | | | | | | | |  
| 梅泰语 | mni | 1,354,323 | 42,504,181 | 1,354,323 | 1.0× | 汉藏语系 | 整理数据 |  
| 阿萨姆语 | asm | 1,000,000 | 38,652,391 | 1,000,000 | 1.0× | 印度-雅利安 | 整理数据 |  
| 卡西语 | kha | 1,000,000 | 17,472,606 | 1,000,000 | 1.0× | 南亚语系 | 整理数据 |  
| 米佐语 | lus | 1,000,000 | 26,774,164 | 1,000,000 | 1.0× | 汉藏语系 | 整理数据 |  
| 尼西语 | njz | 55,870 | 560,374 | 1,117,400 | 20.0× | 汉藏语系 | WMT 2025 |  
| 那加语 | nag | 13,918 | 508,980 | 278,360 | 20.0× | 汉藏语系 | 整理数据 |  
| 加罗语 | grt | 10,817 | 243,251 | 216,340 | 20.0× | 汉藏语系 | 整理数据 |  
| 科克博罗克语 | trp | 2,463 | 89,851 | 246,300 | 100.0× | 汉藏语系 | WMT 2025 |  
| 普纳尔语 | pbv | 1,002 | 52,144 | 100,200 | 100.0× | 南亚语系 | 整理数据 |  
| **东北总计** | | 4,438,393 | 126,857,942 | | | | |  
| **总计** | | 8,342,400 | — | 6,583,123 | | | |  

*表1:语料库统计(含句子数、东北语言词符数、分词器训练加权后的虚拟计数、语系及来源)*  

数据来源包括:  
- • **整理语料库**:梅泰语、阿萨姆语、米佐语、卡西语、加罗语、普纳尔语和那加语数据集来自政府文件、新闻档案、教育材料和文化文本。  
- • **WMT 2025共享任务**:尼西语和科克博罗克语平行语料来自机器翻译研讨会低资源语言赛道。  
- • **公开数据集**:印地语来自Hugging Face验证数据集;英语来自标准语料库。  

### 3.2 数据预处理  
我们应用严格的清洗流程确保数据质量:  
1. 1. **长度过滤**:删除字符长度<20的句子以排除噪声、不完整片段和非语言内容。  
2. 2. **Unicode规范化**:应用NFKC规范化(The Unicode Consortium,2021)处理文字变体、变音符号,确保跨数据源一致性。  
3. 3. **空白压缩**:合并多空格并标准化换行符。  

数据按99.5%训练集和0.5%验证集划分(随机种子42)。单独保留测试集用于最终评估(第7节)。  

**数据可用性**:我们公开发布训练语料(Badnyal/ne-multilingual-corpus)和评估测试集(MWirelabs/northeast-languages-test-set)至Hugging Face,采用CC-BY-4.0协议以支持可重复性研究与东北印度语言的未来探索。  

### 3.3 加权采样策略  
参照Xue等(2021),我们实施激进加权采样以解决资源极端不平衡问题。表1显示权重方案:超低资源语言(普纳尔1,002句、科克博罗克2,463句)在分词器训练时获得 **100倍** 上采样,确保词汇充分表征。这防止了词汇饥饿现象——即稀有语言被分解为字符级词符(Rust等,2021),严重损害推理效率与模型性能。表1中的虚拟计数仅用于分词器训练;实际掩码语言建模训练使用原始句子数以避免过拟合。锚定语言被降权(印地语0.05×、英语0.2×),在保持跨语言迁移能力的同时优先保障东北印度语言的词汇表征。  

---

## 4 分词  
### 4.1 算法选择  
我们选用SentencePiece Unigram(Kudo和Richardson,2018)而非更常见的字节对编码(BPE),主要基于两点:  
1. 1. **语言结构保留**:Unigram的概率方法相比BPE的贪心合并策略,能减少形态丰富和黏着语(科克博罗克语、加罗语、梅泰语)中有害的子词碎片化。这对能编码复杂语法信息的单词至关重要。  
2. 2. **词汇效率**:Unigram无需显式词汇分区即可自然平衡跨语言的高频子词分配,使我们的加权采样策略能直接影响词符边界。  

### 4.2 分词器配置  
分词器配置如下:  
- • 词汇表大小:50,368词符(128的最近倍数,确保现代GPU上Tensor Core高效执行)  
- • 字符覆盖度:1.0(完整Unicode范围以处理所有文字)  
- • 最大词符长度:16字符  
- • 收缩因子:0.75  
- • 子迭代次数:2  
- • 特殊词符:<s>、</s>、<pad>、<unk>、<mask>  

基于加权虚拟计数(表1)的训练确保普纳尔语和科克博罗克语中的常见单词形成单一词符,而非分解为多词符序列,大幅降低推理成本并提升超低资源语言的语义连贯性。  

---

## 5 模型架构  
我们选用ModernBERT-base(Warner等,2025)作为基础模型,因其相比经典BERT具有架构改进:  

### 5.1 架构细节  
- • 编码器层数:22层Transformer  
- • 隐藏维度:768  
- • 注意力头数:12  
- • 总参数量:1.49亿  
  - – 嵌入层:3,870万参数  
  - – 编码器层:1.103亿参数  
- • 位置编码:旋转位置编码(RoPE)(θ_global=160,000,θ_local=10,000)(Su等,2024)  
- • 注意力机制:Flash Attention 2(Dao,2023)以提升内存效率  
- • 优化:启用非填充(Unpadding)实现训练吞吐量提升约30%  

ModernBERT的设计在保持与BERT-base(1.1亿)相当参数量的同时,支持更长上下文的高效训练,优于IndicBERT(6,600万)等模型。RoPE位置编码比学习式位置编码具有更好的长度外推能力,有利于处理词长多变的语言。  

**模型规模依据**:我们采用1.49亿参数配置,在能力与计算效率间取得最优平衡。该规模与mBERT(1.1亿)相当,但远小于IndicBERT-V2(2.37亿)和MuRIL(2.36亿),支持成本效益高的训练(单张A40 GPU仅需$7.31)及高效部署。结果表明,对于超低资源语言性能,适当的分词与针对性训练数据比原始参数量更为关键。  

---

## 6 训练  
### 6.1 训练配置  
我们采用掩码语言建模(MLM)训练NE-BERT,掩码概率15%(Devlin等,2019)。使用动态掩码策略,每个训练周期掩码位置不同,相比静态掩码(Liu等,2019)提升泛化能力。  

超参数设置:  
- • 批量大小:每设备32,梯度累积步数32(有效批量大小1,024)  
- • 学习率:5×10⁻⁴,余弦衰减调度  
- • 预热步数:1,500  
- • 权重衰减:0.01  
- • 训练周期:10  
- • 精度:混合FP16,启用TF32  
- • 优化器:AdamW(β₁=0.9,β₂=0.999,ε=10⁻⁸)  

### 6.2 计算基础设施  
训练在单张NVIDIA A40 GPU(48GB显存)上进行约17小时,总计算成本$7.31。这证明了该方法在资源受限研究环境中的经济性。使用PyTorch 2.4+、Hugging Face Transformers 4.48+及Flash Attention 2.x。  

### 6.3 训练动态  
训练损失从初始约10.0平稳下降至收敛时的1.62(训练)和1.64(验证),历时10个周期。训练与验证损失紧密跟随表明,尽管部分语言语料规模较小,模型并未过拟合。这表明加权采样策略和动态掩码数据增强有效防止了记忆化。  

---

## 7 评估  
### 7.1 评估协议  
我们使用每种语言500句保留测试集的困惑度(PPL)进行评估。困惑度计算公式为:  

**PPL = exp( (1/N) × Σᵢ₌₁ᴺ ℒ_MLM(xᵢ) )**  

其中 ℒ_MLM 是掩码语言建模损失,N 为测试样本数。较低困惑度表示更好的预测性能。我们还测量分词生育率(每个单词的平均子词词符数),以评估词汇效率(Rust等,2021)。

相似文章

m3BERT:一种现代、多语言、套娃式双向编码器

arXiv cs.CL

本文介绍了m3BERT,一种多语言双向编码器,采用新颖的预训练策略,联合优化跨Transformer层和多个嵌入维度的表示,使得单个模型能够适应不同的资源约束。在Bing-Click工业检索数据集上,它显著优于现有最优模型。