评估针对达罗毗荼语的专用单语模型与联合多语言因果模型
摘要
本文从头训练了五个GPT-2风格模型,比较了针对泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语的专用单语模型与一个联合多语言模型,发现单语模型在情感分类和命名实体识别上优于mGPT,且分词器更高效。
arXiv:2608.07727v1 公告类型:新
摘要:达罗毗荼语系语言,主要是泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语,仅占用于训练多语言语言模型数据的一小部分,因此尚不清楚这些模型实际上保留了多少每种语言的能力。我从头训练了五个GPT-2架构模型,以比较四个单语模型(泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语各一个,每个模型都有自己的32K词表子词分词器)与一个在所有四种语言间共享64K词表子词分词器的多语言模型。所有5个模型均使用清洗后的CC-100、维基百科和Samanantar数据进行训练。我在困惑度、每字节比特数、分词器效率以及微调结果上对模型进行了测试,并与mGPT进行了比较。单语模型在情感分类和命名实体识别上优于mGPT,并且其分词器在测试的所有语言上被证明比共享的多语言模型更高效。
查看缓存全文
缓存时间: 2026/08/11 08:05
# 评估针对达罗毗荼语的专用单语与联合多语言因果模型 ###### 摘要 达罗毗荼语系语言,主要是泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语,仅占多语言语言模型训练数据的一小部分,因此这些模型实际保留了多少每种语言的能力尚不清楚。我从零开始训练了五个 GPT-2 架构模型,用以比较四个单语模型(泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语各一个,每个模型配有各自 32K 词表的子词分词器)与一个在所有四种语言间共享 64K 词表子词分词器的多语言模型。所有 5 个模型均在清洗后的 CC-100、Wikipedia 和 Samanantar 数据上训练。我在困惑度、每字节比特数、分词器效率和微调结果上对模型进行了测试,并与 mGPT 进行了比较。在情感分类和命名实体识别任务上,单语模型优于 mGPT,且其分词器在所有测试语言上都比共享的多语言模型更高效。 # 评估针对达罗毗荼语的专用单语与联合多语言因果模型 Venkata Naga Sai Vishnu Rohit Pulipaka 独立研究员 [email protected] ## 1 引言 泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语是主要的达罗毗荼语系语言,它们具有粘着性、形态复杂,并使用各自的天城体相关文字(Brahmic scripts)书写,与 NLP 中研究的大多数语言截然不同。尽管拥有悠久的文学历史和大量在线内容,它们获得的 NLP 研究关注远少于拉丁字母、高资源语言。大规模多语言模型确实包含达罗毗荼语文本,但每种语言的容量在数百种语言中被分散,且共享分词器通常围绕罗马化文本构建。像 mBERTDevlin et al. (2019 (https://arxiv.org/html/2608.07727#bib.bib4))、XLM-RConneau et al. (2020 (https://arxiv.org/html/2608.07727#bib.bib3))、mT5Xue et al. (2021 (https://arxiv.org/html/2608.07727#bib.bib15)) 和 mGPTShliazhko et al. (2024 (https://arxiv.org/html/2608.07727#bib.bib12)) 这样的大型多语言模型确实包含达罗毗荼语,但它们只是同时涵盖数十或数百种语言的混合体中的一小部分。那么,经过这种稀释后,每种语言实际还剩下多少能力?考虑到这些语言的形态密集程度,它们是否因共享的通用分词器而付出更大代价?专门为印度语言构建的工具包,如 IndicBERTKakwani et al. (2020 (https://arxiv.org/html/2608.07727#bib.bib6)) 和 IndicTrans2Gala et al. (2023 (https://arxiv.org/html/2608.07727#bib.bib5)),已经大大推动了进展,但它们大多偏向编码器或围绕翻译目标构建。二者都不是为了单独评估从头训练、语言专用的因果模型和分词器能为此语系带来什么。我直接解决这一空白,而非通过多语言代理,并从零开始训练了 5 个 GPT-2 架构的因果语言模型:4 个单语模型,每种语言一个,每个模型配备仅在那种语言数据上训练的专用 32K 词表 SentencePiece 分词器,以及一个在全部四种语言间共享 64K 词表联合分词器的多语言模型。训练数据来自精选的 CC-100、Wikipedia 和 AI4Bharat Samanantar 语料库。 ## 2 相关工作 像 mBERTDevlin et al. (2019 (https://arxiv.org/html/2608.07727#bib.bib4))、XLM-RConneau et al. (2020 (https://arxiv.org/html/2608.07727#bib.bib3))、mT5Xue et al. (2021 (https://arxiv.org/html/2608.07727#bib.bib15))、mGPTShliazhko et al. (2024 (https://arxiv.org/html/2608.07727#bib.bib12)) 和 BLOOMWorkshop (2024 (https://arxiv.org/html/2608.07727#bib.bib14)) 这样的模型在数十到数百种训练语言中包含了达罗毗荼语。这些模型是通用基线,也是缺乏专用预训练的低资源语言的默认选择,但它们的分词器和参数预算是在完整语言混合体上联合分配的。先前工作已表明这种分配是不均匀的,高资源语言获得不均匀的高效分词和更大的有效训练信号Petrov et al. (2023 (https://arxiv.org/html/2608.07727#bib.bib9)); Rust et al. (2021 (https://arxiv.org/html/2608.07727#bib.bib11))。我使用 mGPT 作为下游比较的多语言基线。AI4Bharat 的 IndicNLPSuiteKakwani et al. (2020 (https://arxiv.org/html/2608.07727#bib.bib6)) 和 IndicCorp 提供了涵盖印度语言的分词、归一化和语料库资源,而 IndicBERTKakwani et al. (2020 (https://arxiv.org/html/2608.07727#bib.bib6)) 和 IndicGLUE 基准建立了基于编码器的评估套件,后来通过 IndicXNLI 扩展Aggarwal et al. (2022 (https://arxiv.org/html/2608.07727#bib.bib1))。谷歌的 MuRILKhanuja et al. (2021 (https://arxiv.org/html/2608.07727#bib.bib7)) 以 BERT 风格编码器针对 17 种印度语言。IndicTrans2Gala et al. (2023 (https://arxiv.org/html/2608.07727#bib.bib5)) 处理 22 种预定语言的翻译。这些工作显著改善了印度语 NLP 工具,但主要侧重于编码器而非因果解码器专用模型,并集体处理印度语言,而非专门隔离达罗毗荼语系。同样,像 Sarvam 这样的现代生成套件展示了区域预训练和自定义印度语分词的价值,尽管它们同时在数十种语言族系上以数十亿参数规模扩展,而非在匹配的轻量级约束下隔离达罗毗荼语系。先前工作已证明,使用专用分词器从头训练的单语模型通常在特定目标语言上优于多语言对应模型,例如用于法语的 CamemBERTMartin et al. (2020 (https://arxiv.org/html/2608.07727#bib.bib8))、用于芬兰语的 FinBERTVirtanen et al. (2019 (https://arxiv.org/html/2608.07727#bib.bib13)) 和用于阿拉伯语的 AraBERTAntoun et al. (2020 (https://arxiv.org/html/2608.07727#bib.bib2))。这种效应主要归因于分词器增殖度(fertility):通用多语言词表相对于专用分词器,会过度切分形态丰富、非拉丁文字的语言,导致序列长度膨胀并稀释上下文窗口。达罗毗荼语具有粘着性并使用独特的婆罗米系文字,是在受控、匹配架构下评估这种效应的理想候选。 ## 3 方法论 ### 3.1 训练数据 对于 4 种目标语言中的每一种,我从 3 个主要来源收集文本:CC-100Conneau et al. (2020 (https://arxiv.org/html/2608.07727#bib.bib3))、Wikipedia(2023-11-01 转储)和 AI4Bharat SamanantarRamesh et al. (2022 (https://arxiv.org/html/2608.07727#bib.bib10)) 的目标语言端。卡纳达语和马拉雅拉姆语额外包含一个过滤后的简单叙事语料库。表1 (https://arxiv.org/html/2608.07727#S3.T1) 报告了每种语言按划分的语料库大小。 表 1:按划分的语料库大小,以词为单位(按空白分隔)。 原始文本经过 Unicode-NFC 归一化、去除 HTML 标签和 URL、折叠空白;除源级行过滤外不进行去重。每种语言的清洗后语料按 96/2/2 划分为训练/验证/测试,按连续行索引划分以保持结构连贯性。 ### 3.2 分词 我为每种语言训练了一个词汇量为 32,000 的 SentencePiece BPE 分词器,并为多语言模型训练了一个跨全部 4 种语言的词汇量为 64,000 的共享分词器。我使用了 `nmt_nfkc` 归一化、完整字符覆盖率(1.0-1.0)和字节级回退以保证封闭词表覆盖。特殊词元 ID(`<s>=0`, `<pad>=1`, `</s>=2`, `<unk>=3`)在训练时固定。 ### 3.3 模型架构与预训练 所有模型都遵循 GPT-2 小规模解码器专用架构:12 层、768 隐藏大小、12 个注意力头、3072 维前馈层、GELU 激活,以及 1024 词元上下文窗口。该配置为每个单语模型产生 110M 参数,为多语言模型产生 135M 参数。所有模型仅训练一次。每个语料行被独立分词并截断为 1024 词元。训练使用 Hugging Face Trainer,有效批量大小为 256 个序列(每设备批大小 4 × 梯度累积 16 × 4 GPU),训练 3 个 epoch。我使用了 AdamW,学习率 1e-4,余弦学习率衰减,4,000 步预热,权重衰减 0.01,梯度裁剪范数 0.5,采用 bf16/tf32 混合精度和梯度检查点。训练在 SLURM 集群上通过 Hugging Face Accelerate 在 4 个 GPU 上进行。 ### 3.4 评估 我沿着三个互补的轴评估了全部 5 个模型: 1. **内在质量**:在完整保留测试集上(不进行子采样)计算交叉熵损失、困惑度(PPL)和每字节比特数(BPB),测试行独立截断为 1024 词元。 2. **分词器效率**:在 2,000 句测试样本上计算子词增殖度(每空白分隔词的词元数)、压缩率(每词元字节数)和 UNK 率,并与多语言分词器(XLM-R、mBERT、mGPT)进行比较。 3. **下游迁移**:在 IndicSentiment(二分类情感分类,准确率)和 WikiANN NER(词元分类,跨度级 F1)上进行完整微调,5 个 epoch,学习率 2e-5,批量大小 16,使用 AdamW,并与同样微调的 mGPT 基线进行比较。 ## 4 结果 ### 4.1 困惑度与每字节比特数 表2 (https://arxiv.org/html/2608.07727#S4.T2) 显示了全部 5 个模型的完整测试集困惑度(PPL)和每字节比特数(BPB)。多语言模型在泰卢固语和泰米尔语上比其单语对应模型获得更低的困惑度,但在卡纳达语和马拉雅拉姆语上困惑度更高,这种分化并不随语料库大小单调变化。按 BPB(它对分词器差异进行了归一化),排名是明确的:单语模型在每种语言上都更好。联合 64K 分词器产生更短、更“便宜”的每字节词元序列,这在原始困惑度比较中偏向多语言模型,而并不反映真正的质量优势。 表 2:单语和多语言模型的完整测试集困惑度和每字节比特数(BPB)。 ### 4.2 分词器效率 表3 (https://arxiv.org/html/2608.07727#S4.T3) 报告了专用分词器与 3 个多语言基线相比的增殖度。32K 分词器在每种语言上都比 XLM-R、mBERT 和 mGPT 获得更低的增殖度和更高的压缩率,尽管词汇量小 3–8 倍,且整个过程中 UNK 率接近零(mBERT 是唯一存在 UNK 的基线,为 0.2–0.3%)。mGPT 的卡纳达语分词是一个显著异常值:16.39 词元/词,是其自身在其他三种达罗毗荼语上增殖度的两倍多,表明 mGPT 的词表中卡纳达语文字的有效覆盖率极低。 表 3:四种达罗毗荼语的分词器增殖度(词元/词)。 ### 4.3 下游迁移 表4 (https://arxiv.org/html/2608.07727#S4.T4) 报告了单语模型与同样微调的 mGPT 基线相比的 IndicSentiment 准确率和 WikiANN NER F1。在本轮运行中,单语模型在每项任务和每种语言上都优于 mGPT。我提醒不要过度解读这些差距的大小:IndicSentiment 的测试集很小(24 个样本,从 IndicSentiment 验证划分中自行划分,因为官方测试划分没有公开标签),而 WikiANN 的卡纳达语划分比其他三种语言的划分小得多(100 个训练样本 vs. 1,000–15,000)。发现相同名义随机种子下的另一次微调运行对泰米尔语和卡纳达语产生了实质不同的排名,这将在6 (https://arxiv.org/html/2608.07727#S6) 中进一步讨论。 表 4:下游微调结果:IndicSentiment 准确率和 WikiANN NER F1,单语和多语言模型对比 mGPT。单次运行结果。 ### 4.4 训练稳定性 多语言模型的预训练运行在训练中途发散:第 ∼766,400 步出现梯度爆炸(裁剪前梯度范数在 200 步内从约 500 上升到 18,979,尽管配置的裁剪阈值为 0.5),导致训练损失从 4.71 跳到 9.21 且从未恢复,在剩余训练中停滞在损失约 8.6–8.7。由于训练配置在训练结束时按验证损失重新加载最佳检查点,发布的多语言模型对应其 epoch-1 检查点,而非完整 3-epoch 训练的模型——这大约是其名义训练预算的三分之一,而全部 4 个单语模型则完成了完整的 3-epoch 训练。这是本文中多语言与单语比较中的一个真实不对称,而非评估的伪影。 ## 5 结论 针对达罗毗荼语系训练了 5 个 GPT-2 风格因果语言模型:4 个单语(泰米尔语、泰卢固语、卡纳达语、马拉雅拉姆语)和 1 个多语言,均从头训练,使用专用与共享子词分词,并沿 3 个轴进行评估:内在质量、分词器效率和下游迁移。结果显示,专用、每语言词表具有一致的分词优势:32K 分词器在所有 4 种语言上在增殖度和压缩率上优于 XLM-R、mBERT 和 mGPT,甚至优于专门针对该语系训练的 64K 联合分词器。按不受分词器影响的每字节比特数指标,单语预训练在每种语言上都比多语言预训练更高效,尽管多语言模型在其中两种语言上获得更低的原始困惑度。在下游微调中,单语模型在几乎所有被评估语言的情感分类和命名实体识别上都优于 mGPT,多语言模型落后于单语但仍普遍领先于 mGPT。研究结果表明,对于像达罗毗荼语这样形态独特、文字多样的语系,专用分词和单语预训练能够恢复大规模多语言模型遗留的真实质量,即使在适度规模下也是如此。 ## 6 局限性 实验范围存在若干局限。模型在 GPT-2 Small 规模(110M–135M 参数)下训练;更大规模下的扩展行为未经测试。下游评估仅涵盖分类和序列标注(情感、NER),且结果(表4 (https://arxiv.org/html/2608.07727#S4.T4))是单次运行而非种子平均;相同名义种子下的另一次运行对泰米尔语和卡纳达语产生了实质不同的排名,因此这些数字应视为指示性而非确定性。多语言模型的预训练运行在中途发散(见4.4 (https://arxiv.org/html/2608.07727#S4.SS4)),发布的检查点反映的是更早的最佳验证损失保存,而非完整调度,这使得多语言与单语的比较处于预算不均等的环境中。最后,困惑度使用固定的 1024 词元截断而非滑动窗口,且语言覆盖范围仅限于该语系中的四种语言。 ## 7 伦理考量 所有训练和评估数据(CC-100、Wikipedia、Samanantar、IndicSentiment、WikiANN)均公开可用且许可用于研究用途;除基本归一化外未应用额外的毒性过滤,因此底层网络抓取语料库中的偏见可能反映在模型输出中。与任何发布的生成式语言模型一样,这些模型具有标准的双重用途风险,尽管其小规模(110M–135M 参数)在一定程度上限制了这种风险。
相似文章
低资源语言数学教育中的大语言模型:僧伽罗语和泰米尔语研究
本文评估了大语言模型在僧伽罗语和泰米尔语(两种资源匮乏的南亚语言)中的数学推理能力,采用独立编写问题的平行数据集进行评估。研究表明,虽然基础算术在跨语言间转移良好,但复杂推理任务在非英语语言中表现出显著性能下降,这对在多语言教育环境中部署AI辅导工具具有重要启示。
语言模型中跨语言泛化的体外研究
本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。
从单语到多语:评估Mamba在南非语言中的ASR性能
本文评估了Mamba状态空间模型在七种南非语言上的ASR性能,发现其在资源更少的情况下达到了与Conformer相当的准确率,并探讨了多语训练策略和低资源场景。
Inspect India Evals:面向印度语言文化语境的大语言模型开放评估框架
介绍Inspect India Evals,一个用于在印度语言文化语境中评估大语言模型的开源框架,包含六项基准测试,涵盖多语言能力、偏见、安全性和文化知识。对五个模型的测试显示,Sarvam-M 24B和Gemma 2 27B表现领先。
基于LLM的跨语言手写OCR自动机器学习:利用GPT-5、GPT-4o和Claude Sonnet 4的闭环神经架构搜索
本文提出了一种基于LLM的流水线,利用GPT-5、GPT-4o和Claude Sonnet 4自动设计跨语言手写OCR的神经网络架构,在阿拉伯语、英语和波斯语文本上实现了超过93%的准确率,无需人工干预。