Mizan:用于评估大型语言模型在伊拉克阿拉伯语及伊拉克公民语境下的国家级基准

arXiv cs.CL 论文

摘要

Mizan 引入了一个国家级基准,用于评估大型语言模型在伊拉克阿拉伯语和公民语境下的表现,突出了以 MSA 为重点的评估中存在的差距,并揭示了安全加固模型中的过度拒绝问题。

arXiv:2609.13980v1 Announce Type: new 摘要:阿拉伯语大型语言模型(LLM)评估已围绕现代标准阿拉伯语(MSA)成熟:综合排行榜如 Open Arabic LLM Leaderboard (OALL)、HELM Arabic 和 BALSAM 在数十个 MSA 任务上对模型进行排名,前沿系统日益饱和这些任务。方言阿拉伯语,即伊拉克人实际使用的语言,在此基础设施中几乎不可见。我们引入 Mizan(“平衡”),伊拉克的国家级基准,用于评估 LLM 在伊拉克阿拉伯语和伊拉克公民语境下的表现:一个 MSA 基线轨道与一个伊拉克轨道相结合,涵盖六个轴(方言理解、方言生成、双向 MSA-Iraqi 翻译、伊拉克特定知识、官方文档字段提取和安全性),基于 340 个原创、双重审查的项目构建,每个发布分数都具有统计审核的答案位置和 Wilson 区间。对 27 个系统的试点评估,涵盖发布三天内的封闭前沿模型、跨尺寸层级的开放权重,以及一个阿拉伯语三元组(商业、开放专有和主权系统),产生四个发现。MSA 轨道饱和,而伊拉克轨道具有区分度,每个模型一致存在 14-18 分的差距,且统计上并列的领先者。官方文档提取将每个系统限制在 32-56 分。阿拉伯语焦点专业化表现为 MSA 专业化:两个专用阿拉伯模型在伊拉克轨道上得分低于尺寸匹配的通才。而最新模型家族的安全加固层确定性地拒绝无害的方言理解项目作为策略违规,这是一种在 MSA 基准中不可见的过度拒绝模式。平台执行完整性协议,包括不可变快照、验证证书、人工发布门和公开撤回,所有这些都在本研究中得以实践。代码和公共开发集随论文提供。
查看原文
查看缓存全文

缓存时间: 2026/09/15 08:48

# Mizan:评估伊拉克阿拉伯语与伊拉克公民语境下大语言模型的国家基准
来源:https://arxiv.org/html/2609.13980
穆斯塔法·S·阿尔朱迈利 | 附属机构:米桑石油公司,阿马拉,伊拉克;伊拉克大型语言模型国家团队成员,总理办公室,巴格达,伊拉克

###### 摘要

阿拉伯语大语言模型(LLM)的评估已围绕现代标准阿拉伯语(MSA)趋于成熟:综合排行榜如开放阿拉伯语LLM排行榜(OALL)、HELM阿拉伯语和BALSAM在数十项MSA任务中对模型进行排名,而前沿系统正日益使其饱和。方言阿拉伯语——伊拉克人实际使用的语言——在此基础设施中几乎不可见。我们引入Mizan(意为“天平”),这是伊拉克评估LLM在伊拉克阿拉伯语及伊拉克公民语境下表现的国家基准:一条MSA基线轨道与一条伊拉克轨道并行,涵盖六个维度——方言理解、方言生成、MSA-伊拉克语双向翻译、伊拉克特有知识、官方文件字段提取和安全性——基于340个原创、双重审核的项目构建,每个发布分数均附有统计审核的答案位置和威尔逊区间。对27个系统的试点评估——包括发布三天后的闭源前沿模型、跨规模层级的开放权重模型,以及涵盖商业、开源专业和主权系统的阿拉伯语三元组——得出四个发现:MSA轨道饱和而伊拉克轨道具有区分度,模型间存在持续14-18分的差距,且领先者统计并列。官方文件提取将每个系统限制在32-56分之间。阿拉伯语专项化表现为MSA专项化:两个专用阿拉伯语模型在伊拉克轨道上的得分低于规模匹配的通用模型。而最新模型系列的安全硬化层级将无害的方言理解项目确定性地拒绝为政策违规——这种过度拒绝模式在MSA基准测试中不可见。平台执行完整性协议,包括不可变快照、验证证书、人工发布门控和公开撤回,所有这些均在本研究中得以实践。代码与公开开发集随文附上。

关键词:LLM评估,方言阿拉伯语,低资源自然语言处理,过度拒绝,文档提取,基准完整性。

## 1引言

评估基础设施决定了“进步”的含义。对阿拉伯语而言,该基础设施已围绕现代标准阿拉伯语整合:ArabicMMLU和AlGhafa建立了严谨的MSA测试集;开放阿拉伯语LLM排行榜对其进行大规模聚合;HELM阿拉伯语将透明的多基准方法论扩展至阿拉伯语;而BALSAM(Al‑Matham等人,2025)(https://arxiv.org/html/2609.13980#bib.bib6)在区域性联盟下汇集了数万个测试问题,涵盖数十个任务类别。这种整合是成功的——甚至达到了自我淘汰的程度。在我们的MSA轨道上,当代系统聚集在满分或接近满分处,最新的前沿模型在公开发布后72小时内即能匹敌,且两个最强系统完全无法区分:它们并列,并在独立评估轮次间交换排名。一个不再区分系统的基准也不再衡量它们。饱和所掩盖的是人们所使用的语言。伊拉克阿拉伯语服务于数千万使用者,其语音、形态、词汇和语用与MSA存在差异——差异之深足以产生系统性的假朋友词(伊拉克方言的hwaya意为“许多”,而MSA的hiwaya意为“爱好”),并导致双向字面翻译失败。然而,目前尚不存在针对它的全面LLM评估框架。该领域拥有的方言资源——多阿拉伯语方言应用与资源(MADAR)、细微阿拉伯语方言识别(NADI)——属于早期范式:为监督式自然语言处理构建的识别和分类语料库。近期的方言感知评估,尤其是阿拉伯语方言与文化评估(AraDiCE),已开始拉近与阿拉伯语方言的距离——通过机器翻译并经人工后编辑的现有基准衍生版本,涵盖黎凡特和埃及变体以及海湾、埃及和黎凡特的文化语境。伊拉克阿拉伯语及其内部区域差异和独特的公民语体,未出现在其中任何一项。利害关系并非学术性的。国家正在公共管理中采用语言模型,伊拉克已根据总理令组建国家团队,以构建主权阿拉伯语和伊拉克语能力。拟用于伊拉克国家使用的模型必须能阅读官方信函——发证机关、参考编号、日期、收件人、主题、所需行动——并必须能在伊拉克社会敏感问题上自如应对,既不助长伤害,也不拒绝合法的公民质询。目前没有任何基准在任何方言、任何地方衡量这些内容。因此,国家评估工具并非便利之选,而是知情采购的前提条件:任何提供给伊拉克国家的模型都应首先在国家尺度上进行衡量。Mizan(意为“天平”或“秤”)就是该工具,其设计通过结构回应了上述每一项失败。两个地位平等的轨道——国际文献可读的MSA基线,以及作为其他基准无法提供的鉴别器的伊拉克轨道。六个维度涵盖理解、生成、MSA-伊拉克语双向翻译、伊拉克特有知识、伊拉克语境下的官方文件字段提取和安全性。所有项目均由母语使用者原创并经双重审核——无任何内容译自外国基准,因为译文衡量的是翻译腔而非方言能力。答案位置均衡且经过审核。生成性维度由人工评委根据编号量规评分。配套平台执行完整性协议——统一条件并记录重试阶梯、每项审核记录、带日期的不可变快照、SHA‑256证书、人工发布门控和公开撤回——该协议在本研究中得到实践:诊断图表暴露了两次技术性受损运行,均被公开撤回,两个模型均被干净地重新评估,随后对完整榜单进行了端到端重新验证。我们报告了一项试点研究,在相同条件下对340个项目库评估了27个系统:闭源前沿模型(包括GPT‑6 Astra,在发布后三天内评估)、跨规模层级的开放权重模型,以及涵盖商业API系统、开源专业模型和主权国家模型的阿拉伯语三元组。四项规律性组织结果。饱和‑区分分裂:MSA在天花板处压缩,而伊拉克得分分布跨越二十余分,每个模型都带有持续的14‑18分内部差距。文档壁垒:官方文件字段提取将每个系统——包括最新前沿模型——限制在32至56分之间。专项化定律:被营销为阿拉伯语专项化的模型表现为MSA专项化——两个专用阿拉伯语模型(一个开源,一个主权)在伊拉克轨道上得分低于规模匹配的通用模型,而第三个虽超过其自身的通用模型同类,但仍远低于前沿。以及在每项MSA基准测试中不可见的过度拒绝模式:最新模型系列的安全硬化层级确定性地拒绝无害的伊拉克语理解项目——询问日常词汇含义的问题——将其分类为违反政策的内容,同时毫不犹豫地回答整个MSA轨道。本文有五项贡献:Mizan,据我们所知,首个专门针对伊拉克阿拉伯语和伊拉克公民语境、原创、全面的评估框架,具有双轨设计和六个评估维度;一个任何现有基准均未衡量的官方文件字段提取维度,直接关联主权用途;一个开源评估平台,执行经实践检验的完整性协议:快照、证书、人工门控、公开撤回及带运行间一致性报告的全榜单重新验证;一项27个模型的实证研究,全程经统计验证,确立了MSA饱和、每模型方言差距、普遍文档壁垒和阿拉伯语专项化悖论;以及首个记录在案的前沿系统中由方言触发的安全过度拒绝案例,附有官方API证据——同时发布公开开发集、指南和代码,以播种超越伊拉克的方言感知评估。第2节将Mizan置于阿拉伯语评估工作背景中;第3‑4节介绍基准和平台;第5‑6节报告试点研究;第7‑10节分析错误、讨论启示并说明局限性与v1.0路线图。

## 2相关工作

阿拉伯语LLM评估沿三条线路整合:MSA基准及其聚合排行榜、分类时代的方言资源,以及初现端倪的方言感知LLM评估转向。Mizan汲取了所有三者,同时与每者有所不同。

### 2.1MSA基准与聚合排行榜

ArabicMMLU(Koto等人,2024)(https://arxiv.org/html/2609.13980#bib.bib2)和AlGhafa(Almazrouei等人,2023)(https://arxiv.org/html/2609.13980#bib.bib3)为阿拉伯语建立了严谨的多选测试集,尤其是ArabicMMLU为原生构建而非翻译——我们采纳并扩展了这一设计立场。开放阿拉伯语LLM排行榜(Elfilali等人,2024)(https://arxiv.org/html/2609.13980#bib.bib4)在社区规模上聚合此类基准以用于开源模型。语言模型整体评估(HELM)阿拉伯语(Stanford CRFM与Arabic.AI,2025)(https://arxiv.org/html/2609.13980#bib.bib5)将HELM框架的透明、可复现的多基准方法论扩展至阿拉伯语,涵盖七个既定测试集,并有一个处理金融和法律任务的企业变体。BALSAM(Al‑Matham等人,2025)(https://arxiv.org/html/2609.13980#bib.bib6)在一个中东北非地区联盟下汇集了约五万个测试问题,涵盖六十七个任务类别,具有盲测集和标准提交接口。此基础设施成熟、严谨且限于MSA:无一观察方言、本地知识或公民文件语体。我们的结果提供了经验性佐证:其天花板已至。在Mizan的MSA轨道上,多个当代系统得分接近或达到100.0,且两个最强系统统计上不可区分(第6节)。

### 2.2分类时代的方言资源

MADAR(Bouamor等人,2018)(https://arxiv.org/html/2609.13980#bib.bib7)和NADI共享任务(Abdul‑Mageed等人,2020)(https://arxiv.org/html/2609.13980#bib.bib1)构建了该领域的基础方言语料库和方言识别任务,涵盖城市和国家级变体。这些是用于监督式自然语言处理的资源:它们衡量系统是否能识别或标注方言,而非生成模型是否能理解、生成、翻译或安全运行于某种方言中。Mizan继承了它们对区域粒度的坚持——每个伊拉克项目都带有方言区域标签——同时提出了超越它们时代的生成式问题。

### 2.3方言感知LLM评估

最接近我们工作的是AraDiCE(Mousi等人,2025)(https://arxiv.org/html/2609.13980#bib.bib8),它贡献了约45,000个通过机器翻译并经人工后编辑从现有基准创建的样本,评估了黎凡特和埃及阿拉伯语的方言理解和生成,并引入了一个覆盖海湾、埃及和黎凡特的细粒度文化基准。AraDiCE证明以阿拉伯语为中心的模型在方言任务上优于多语言模型,且方言生成仍然困难。同期工作延续了同样的基于翻译的路线:DialectalArabicMMLU(Altakrori等人,2025)(https://arxiv.org/html/2609.13980#bib.bib12)手动将三千个MMLU‑Redux问答对翻译并改编为五种方言(叙利亚语、埃及语、阿联酋语、沙特语和摩洛哥语),证实了十九个开源模型中持续存在的方言差距。这些努力共同精确界定了Mizan的偏离点。来源:AraDiCE通过翻译现有基准衍生项目;Mizan的每个项目均为原创,因为翻译项目继承源基准的文化内容并带有翻译腔痕迹——项目问的是译者写的内容,而非说话者会说的话。覆盖范围:伊拉克阿拉伯语未出现在AraDiCE的方言任务和文化区域中,也未出现在DialectalArabicMMLU的五种方言中——继埃及之后人口最多的阿拉伯国家在这两项工作中均未出现。范围:现有基准,无论方言与否,均未衡量官方文件字段提取、带标注者间一致性的人工量规生成质量,或在特定国家语境下的安全行为——包括我们在第7节记录的方言触发过度拒绝模式,该模式在设计上对基于翻译MSA的测试集不可见。治理:Mizan将其数据集与一个执行完整性协议的实时平台绑定——不可变快照、验证证书、人工发布门控和公开撤回——该协议在本研究中得以实践。

### 2.4定位

Mizan是对该格局的补充,而非竞争。共享阿拉伯语能力已通过OALL、HELM阿拉伯语和BALSAM在大规模上得到良好衡量;区域方言广度则通过AraDiCE和DialectalArabicMMLU衡量。Mizan深度贡献于一个国家的语言和公民现实,这些项目均为原创、双重审核、统计审计、主权锚定,并且经验上,是饱和的MSA轴不再提供的鉴别信号。据我们所知,Mizan是首个专门针对伊拉克阿拉伯语和伊拉克公民语境的全面、原创评估框架。

## 3Mizan基准

### 3.1设计原则

五项原则指导该基准,每项均为对已记录失败模式的回应。原创性:每个项目均由创作团队以其目标变体原生撰写,并由作者中的伊拉克母语使用者单独审核、修正和批准;无任何内容译自现有基准,因为翻译项目衡量的是译者的输出而非说话者的语言,并继承源基准的文化框架(Koto等人,2024;Mousi等人,2025)。双重审核与累积裁决:每个项目经过第二轮语言审核,由此产生的裁决——词汇真实性约束、语体边界、正字法惯例——累积为适用于所有后续项目的约束性创作指南。污染分层:项目携带分层字段,将公开开发集与保留的私有测试层分开;整个试点库故意为public_dev,私有层在下一开发阶段前保持为空,这是我们说明而非掩饰的一项局限性(第9节)。统计平衡:多选项目中的正确答案位置经设计平衡,并通过卡方拟合优度检验对均匀分布进行审计,对于每个(轨道,维度)组均未能拒绝均匀性(所有卡方≤1.20,df=3,p>0.05;报告实际审核计数,而非计划数)。人工评判以防自动化误导:生成性维度由人工评委根据编号量规评分,并通过Krip

相似文章

MameLoshnLM:意第绪语语言模型与评估基准

arXiv cs.CL

本文介绍了 MameLoshnLM,这是首个开源的 8B 参数意第绪语语言模型,同时还包括 Oytser 预训练语料库和 Kashes 评估基准。研究表明,在高质量意第绪语数据上进行持续预训练的表现优于通用多语言模型,凸显了专门进行低资源语言建模的价值。