从零到英雄:为亚美尼亚打造开放的LLM生态系统

arXiv cs.LG 论文

摘要

本文整理并发布了针对亚美尼亚语的开放数据集和模型,展示了通过新闻和STEM数据进行持续预训练可以提高性能,并解决低资源NLP中的数据稀缺问题。

arXiv:2609.03350v1 公告类型:新 摘要:亚美尼亚语是一种形态丰富且资源稀缺的语言,其预训练数据稀缺,且尚未发布可复现的开放亚美尼亚语LLM及其数据和配方。为解决这一空白,我们整理并发布了两个数据集。ArmWeb是一个广泛验证的语料库,包含437万篇亚美尼亚语新闻文档。ArmSTEM是一个包含37.3万道数学和科学问题的平行英亚语数据集,附有逐步解答,翻译成亚美尼亚语并通过保留答案的LLM判断和人工评估进行验证。在这些数据集上对Gemma-4-E4B进行持续预训练,得到了arm-gemma-e4b,其性能优于所有现有的开放亚美尼亚语模型及其未适应的基础模型,并且是第一个拥有完整训练数据和配方的开放亚美尼亚语LLM。我们的消融实验表明,仅使用新闻进行持续预训练可以提高流畅度但会侵蚀知识,这一模式在现有亚美尼亚语模型中也存在,而少量经过验证的翻译STEM数据可以逆转这种损失。我们进一步发现,最大的公开亚美尼亚语语料库与基于网络的评估面板高度重叠,包括FineWeb-2内部的训练/测试自重叠。我们公开发布了所有数据、模型和代码。
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:25

# 从零到英雄:亚美尼亚语的开放大语言模型生态系统
来源:https://arxiv.org/html/2609.03350
Khatun Avetisyan  
所属机构:COPA  
邮箱:[[email protected]](mailto:[email protected])  
Meri Davtyan  
所属机构:COPA  
Heghine Grigoryan  
所属机构:COPA  
Nane Khachatryan  
Hayk Shahsuvaryan  
Henrik Sergoyan  
Vahan Martirosyan  
所属机构:COPA  

###### 摘要  
亚美尼亚语是一种形态丰富且资源稀缺的语言,其预训练数据十分匮乏,并且尚未有开源的亚美尼亚语大语言模型及其可复现的数据与方案一同发布。为填补这一空白,我们整理并发布了两个数据集。ArmWeb是一个经过广泛验证的语料库,包含437万篇亚美尼亚语新闻文档。ArmSTEM是一个包含37.3万个数学与科学问题的英亚平行语料库,其中32.4万个问题附有逐步解答,这些内容被翻译成亚美尼亚语,并通过保留答案的LLM判断和人工评估进行了验证。使用这些数据集对Gemma-4-E4B进行持续预训练,产生了arm-gemma-e4b模型。该模型超越了所有现有的开源亚美尼亚语模型及其未适配的基础模型,并且是首个拥有完整训练数据和方案的开源亚美尼亚语大语言模型。我们的消融研究表明,仅在新闻数据上进行持续预训练能提高流畅度但会侵蚀知识——我们在现有的亚美尼亚语模型中也观察到了这一模式,而一小部分经过验证的翻译STEM数据就能逆转这一损失。我们进一步发现,最大的公开亚美尼亚语语料库与基于网络的评估面板高度重叠,包括FineWeb-2内部训练集/测试集的自重叠。我们公开发布了所有数据、模型和代码。  

## 1 引言  
语言建模的进展仍然集中在英语和少数几个数据丰富的语言(Le Scao et al., 2022 (https://arxiv.org/html/2609.03350#bib.bib49);Üstün et al., 2024 (https://arxiv.org/html/2609.03350#bib.bib88))上。尽管大规模多语言模型在包含数百种语言的语料库上进行训练,但其效益并不均衡,因为预训练将大部分容量分配给了语言分布中高资源的那一端(Le Scao et al., 2022 (https://arxiv.org/html/2609.03350#bib.bib49))。小型*单语*模型在低资源语言的基本生成任务上,仍能超越规模大几个数量级的模型(Chang et al., 2026 (https://arxiv.org/html/2609.03350#bib.bib8))。为克服这种不平衡,一系列日益增长的工作发布了特定语言的生态系统,共同发布精心策划的语料库、适配后的开源模型、评估基准以及训练方案,例如针对巴斯克语(Etxaniz et al., 2024 (https://arxiv.org/html/2609.03350#bib.bib20))、哈萨克语(Koto et al., 2025 (https://arxiv.org/html/2609.03350#bib.bib45))、波兰语(Kocoń et al., 2025 (https://arxiv.org/html/2609.03350#bib.bib44))和东南亚语言(Nguyen et al., 2024b (https://arxiv.org/html/2609.03350#bib.bib60))的工作。

亚美尼亚语是一种形态丰富的语言,被广泛认为是低资源语言(Ghazaryan et al., 2025 (https://arxiv.org/html/2609.03350#bib.bib26);Khurshudyan et al., 2022 (https://arxiv.org/html/2609.03350#bib.bib40)),并且缺乏这样的生态系统。其开放文本仅限于多语言网络爬取数据的亚美尼亚语部分(Abadji et al., 2022 (https://arxiv.org/html/2609.03350#bib.bib1);Penedo et al., 2025 (https://arxiv.org/html/2609.03350#bib.bib70);Burchell et al., 2025 (https://arxiv.org/html/2609.03350#bib.bib7)),没有针对亚美尼亚语的专门策划。我们将在下文展示,这些部分与亚美尼亚语评估集的重叠率高达17.4%(§2.1 (https://arxiv.org/html/2609.03350#S2.SS1)),这与对英语语料库的审计结果相似(Dodge et al., 2021 (https://arxiv.org/html/2609.03350#bib.bib19);Sainz et al., 2023 (https://arxiv.org/html/2609.03350#bib.bib79))。其开源模型仅发布权重,不包含训练数据或方案(Gen2B and NCCAIT, 2025 (https://arxiv.org/html/2609.03350#bib.bib25);Remy et al., 2024 (https://arxiv.org/html/2609.03350#bib.bib75)),因此无法进行审计或复现。与此同时,评估工作近期有所改进(Metric AI Lab, 2025 (https://arxiv.org/html/2609.03350#bib.bib56);Ghazaryan et al., 2025 (https://arxiv.org/html/2609.03350#bib.bib26)),但缺乏用于这些基准所测量知识的开放训练数据。目前没有以训练规模存在的、包含详细解答的亚美尼亚语数学或科学文本。本文将缺失的部分作为一个有文档记录、可审计的流水线发布出来。¹¹¹数据与模型:https://huggingface.co/COPA-AI。代码:https://github.com/COPATeam/armenian_llm_ecosystem。我们遵循Gebru等人(2021)(https://arxiv.org/html/2609.03350#bib.bib24)的数据卡片实践和Soldaini等人(2024)(https://arxiv.org/html/2609.03350#bib.bib85)的分阶段报告方法,并报告了一个关于语言适配的发现,我们认为该发现具有普遍性。我们做出五项贡献。

- • 我们发布 **ArmWeb**,这是一个包含437万篇文档(33亿Gemma token)的亚美尼亚语新闻语料库,由作者运营的为期15年的爬取构建而成,其流水线完全文档化,涵盖提取、语言识别、感知联合发布的去重、针对十个亚美尼亚语基准的经过验证的泄露检查和13-gram去污染,并包含每篇文档的溯源元数据。质量通过一个4.1亿的消融网格、重复性研究和拟合误差在0.47%以内的缩放阶梯(可预测一个13亿保留模型的损失)进行验证。

- • 我们发布 **ArmSTEM**,包含来自GSM8K(Cobbe et al., 2021 (https://arxiv.org/html/2609.03350#bib.bib12))、AceReason-Math(Chen et al., 2025 (https://arxiv.org/html/2609.03350#bib.bib10))、OpenScience(NVIDIA, 2025a (https://arxiv.org/html/2609.03350#bib.bib62))和OpenScienceReasoning-2(NVIDIA, 2025b (https://arxiv.org/html/2609.03350#bib.bib63))的37.3万个数学与科学问题,这些内容被机器翻译成东亚美尼亚语,并通过占位符掩蔽翻译、语言识别和带有精确匹配答案检查的盲人重新解答进行了*验证*,同时针对英语基准来源和亚美尼亚语基准目标进行了双端去污染。在一项人工评估中,两名母语使用者独立评估了300个抽样问题中的299个,认为它们有效,并且标注者之间完全一致。该语料库以英亚平行数据的形式发布,包含每项溯源信息和每个子集的许可信息。据我们所知,这是首个包含逐步解答且达到训练规模的亚美尼亚语STEM语料库。

- • 我们发布 **arm-gemma-e4b**,这是一个通过在ArmWeb(69%)、ArmSTEM(6%,两种语言)、英语网络重放(20%)和代码(5%)的混合物上进行持续预训练而适配到亚美尼亚语的Gemma-4-E4B模型。它超越了所有我们知晓的开源亚美尼亚语模型,以及其自身未适配的基础模型(图1 (https://arxiv.org/html/2609.03350#S1.F1))。据我们所知,这是首个随完整训练语料库和方案一同发布的开源亚美尼亚语大语言模型。

- • 我们对适配方案进行了严格研究。在新闻文本上天真地进行持续预训练表现出经典的灾难性遗忘(McCloskey and Cohen, 1989 (https://arxiv.org/html/2609.03350#bib.bib55);French, 1999 (https://arxiv.org/html/2609.03350#bib.bib21)),在Belebele基准上以高达-21.2个百分点的代价将知识换取了流畅度(Bandarkar et al., 2024 (https://arxiv.org/html/2609.03350#bib.bib5)),而现有的亚美尼亚语模型在相当的预算下也表现出流畅度提高和知识退化的相同模式。使用更温和的学习率(Ibrahim et al., 2024 (https://arxiv.org/html/2609.03350#bib.bib34))可以恢复大约三分之二的损失,而经过上限控制的经验证翻译STEM数据则完全逆转了这一损失,最终平均比基础模型高出+2.2个百分点,同时保持了流畅度的提升(§5 (https://arxiv.org/html/2609.03350#S5))。

- • 我们报告基准洁净度结果。对最大的三个公开亚美尼亚语爬取部分进行扫描,发现7.9%–17.4%的文档与我们的评估集重叠,主要来自基于网络的困惑度面板,包括FineWeb-2自身亚美尼亚语测试集泄漏到其训练集的情况。如果不进行去污染,困惑度式的评估会系统性地高估在爬取数据上训练的亚美尼亚语模型的性能。

图1 (https://arxiv.org/html/2609.03350#S1.F1)总结了核心结果。  
图 1:所有开源亚美尼亚语模型及其未适配基础模型在六任务亚美尼亚语似然套件(§4 (https://arxiv.org/html/2609.03350#S4))上的平均准确率。

## 2 方法论

#### Token 单位。  
本文在两种分词器中计算 token。*Gemma token* 使用标准的 Gemma-4 词汇表(每个亚美尼亚语词约 4.15 token,表13 (https://arxiv.org/html/2609.03350#A6.T13)),这是发布模型的训练单位,因此所有语料库大小、混合比例和跨语料库比较都使用它们,其他公开语料库由我们重新分词。*SP token* 使用在 ArmWeb 上训练的 32K SentencePiece 分词器,这是我们构建的最高效的分词器(每个词 1.48 token)。§2.1 (https://arxiv.org/html/2609.03350#S2.SS1) 的小规模 Megatron 消融实验使用它,以便小型模型将其预算用于内容而非分割单词,因此它们的预算以 SP token 为单位。在 ArmWeb 文本上,1 个 SP token 约等于 2.8 个 Gemma token。

我们构建了一个精心策划的本族语语料库(§2.1 (https://arxiv.org/html/2609.03350#S2.SS1))和一个经过验证的翻译知识语料库(§2.2 (https://arxiv.org/html/2609.03350#S2.SS2)),§3 (https://arxiv.org/html/2609.03350#S3) 将它们组合成一个适配方案。

### 2.1 ArmWeb 新闻语料库

#### 来源。  
ArmWeb 源自对2011-2026年间公共亚美尼亚语新闻网站的单一运营商爬取,数据存储为结构化数据库而非原始HTML,这几乎消除了主导网络爬取清理的样板代码。每条记录包含标题、正文、URL、新闻来源、主题、发布日期和爬取日期。我们发布除作者姓名外的所有元数据。

#### 流水线。  
表1 (https://arxiv.org/html/2609.03350#S2.T1) 给出了完整的处理漏斗。清理工作被有意最小化,因为主导网络爬取清理的启发式方法,如样板规则、阻止列表和质量分类器(Raffel et al., 2020 (https://arxiv.org/html/2609.03350#bib.bib74);Rae et al., 2021 (https://arxiv.org/html/2609.03350#bib.bib73);Penedo et al., 2023 (https://arxiv.org/html/2609.03350#bib.bib71)),针对的是我们数据源中不存在的爬取伪影,并且已知会附带丢弃无害文本(Dodge et al., 2021 (https://arxiv.org/html/2609.03350#bib.bib19))。遵循OSCAR(Abadji et al., 2022 (https://arxiv.org/html/2609.03350#bib.bib1))的轻触先例,我们仅应用标题-正文拼接、最少100个字符的长度限制和空白标准化。发布的文本经过NFC标准化并逐字保留,而所有相似度计算使用单独构建的激进“签名视图”,该视图使用NFKC标准化、亚美尼亚语连字符折叠、标点剥离和数字归零。GlotLID(Kargaran et al., 2023 (https://arxiv.org/html/2609.03350#bib.bib39))将98.3%的文档保留为hye/hyw。去重能显著改善由此产生的模型(Lee et al., 2022 (https://arxiv.org/html/2609.03350#bib.bib50);Penedo et al., 2023 (https://arxiv.org/html/2609.03350#bib.bib71);Li et al., 2024 (https://arxiv.org/html/2609.03350#bib.bib52))并减少记忆化(Kandpal et al., 2022 (https://arxiv.org/html/2609.03350#bib.bib37)),并且必须在划分数据集*之前*全局运行,因为跨越训练/测试边界重复的文档会无声地夸大评估结果(Lee et al., 2022 (https://arxiv.org/html/2609.03350#bib.bib50);Soboleva et al., 2023 (https://arxiv.org/html/2609.03350#bib.bib84))。我们首先使用xxh128哈希和保留最长规则去除精确重复,然后运行MinHash LSH,使用词5-gram分片、112个排列和14个8行带,目标Jaccard阈值接近0.72。这个低阈值是我们调整后的选择,因为新闻联合发布产生的真实转载,其Jaccard相似度远低于网络重复(Silcock et al., 2023 (https://arxiv.org/html/2609.03350#bib.bib81)),而标准的0.8阈值方案(Penedo et al., 2023 (https://arxiv.org/html/2609.03350#bib.bib71))会漏掉其中大部分,这是FineWeb2论证的按来源调整必要性的一个实例(Penedo et al., 2025 (https://arxiv.org/html/2609.03350#bib.bib70))。附录E (https://arxiv.org/html/2609.03350#A5) 验证了引擎对两个独立实现的正确性。Dolma式的重复段落移除(Soldaini et al., 2024 (https://arxiv.org/html/2609.03350#bib.bib85))修改了0.1%的文档,并且只丢弃了13个之后低于长度下限的文档。

#### 数据划分与泄露检查。  
我们保留了三个评估划分,每个包含20K文档。验证集和同分布测试集通过按新闻来源和月份分层抽样获得,因此每个都反映了训练分布,而时间测试集则取自爬取的最后两个月的文档,以衡量对未见文本的泛化能力。由于去重在划分之前运行,因此保留的文档中不应在训练集中存在重复。三项检查验证了这一点。第一项要求任意两个划分之间精确重复的文档数为零。第二项使用相同的MinHash过程,将近重复文档限制在保留文档的0.1%以内。两项都作为硬断言运行,如果违反则终止发布构建,并且都通过了,验证集、同分布测试集和时间测试集的精确重复数为零,近重复率分别为0.045%、0.010%和0.005%。第三项检查统计保留划分与训练集共享的、至少包含13个token的段落数量,并报告这些数量而非断言一个界限,发现三个划分分别有30、63和10个共享段落(附录F (https://arxiv.org/html/2609.03350#A6))。最后,训练文本通过针对十个亚美尼亚语评估集的13-gram重叠进行去污染,移除了147,101个文档(3.3%),遵循由开源语料库工具实现的n-gram去污染实践(Soldaini et al., 2024 (https://arxiv.org/html/2609.03350#bib.bib85);Li et al., 2024 (https://arxiv.org/html/2609.03350#bib.bib52))。

| 阶段 | 文档数 | Δ\\Delta |
| :--- | :--- | :--- |
| 提取 | 5,918,811 | — |
| 语言识别 | 5,817,343 | −1.7% \-1\.7\\% |
| 精确去重 | 5,436,984 | −6.5% \-6\.5\\% |
| MinHash去重 | 4,515,497 | −16.9% \-16\.9\\% |
| 样板代码 | 4,515,484 | −0.0% \-0\.0\\% |
| 划分保留 | 4,455,484 | −60\-60K |
| 去污染 | 4,308,383 | −3.3% \-3\.3\\% |
| **最终:11.0 GB, 33亿 Gemma / 11.5亿 SP tokens** | | |

表 1:ArmWeb 流水线漏斗。每个 Δ\\Delta 是相对于前一行的。“划分保留”:验证/测试各20K,加上20K的时间尾部,在训练端去污染前移除。

#### 现有语料库的污染。  
基准污染在英语语料库中有记录(Dodge et al., 2021 (https://arxiv.org/html/2609.03350#bib.bib19)),当未报告时会使评估结论无效(Sainz et al., 2023 (https://arxiv.org/html/2609.03350#bib.bib79)),并且可以在事后检测(Oren et al., 2024 (https://arxiv.org/html/2609.03350#bib.bib66)),因此它最终会被审计。将我们的扫描应用于三个最大的近期公开语料库的亚美尼亚语部分,量化了一个社区尚未纳入考量的问题。每个语料库与我们的十个评估集在文档层面的重叠率在7.9%–17.4%之间(表2 (https://arxiv.org/html/2609.03350#S2.T2)),主要来自基于网络的困惑度面板,尤其是FineWeb-2自身的亚美尼亚语测试集和维基百科,而对手工构建的MCQA基准的命中率,对于包括我们在内的每个语料库都接近零。仅限于手工构建的基准时,每个语料库的文档重叠率均在或低于0.06%,尽管只有20–53%的Belebele(Bandarkar et al., 2024 (https://arxiv.org/html/2609.03350#bib.bib5))、INCLUDE(Romanou et al., 2025 (https://arxiv.org/html/2609.03350#bib.bib77))和SynDARin(Ghazaryan et al., 2025 (https://arxiv.org/html/2609.03350#bib.bib26))条目足够长,可以在n=13n\{=\}时被检测到。

相似文章

MameLoshnLM:意第绪语语言模型与评估基准

arXiv cs.CL

本文介绍了 MameLoshnLM,这是首个开源的 8B 参数意第绪语语言模型,同时还包括 Oytser 预训练语料库和 Kashes 评估基准。研究表明,在高质量意第绪语数据上进行持续预训练的表现优于通用多语言模型,凸显了专门进行低资源语言建模的价值。