KyrgyzLLM-Bench: 吉尔吉斯语言理解基准测试
摘要
本文介绍了KyrgyzLLM-Bench,这是一个用于评估吉尔吉斯语大语言模型的基准测试套件,包含原生创作和翻译数据集,并对26个模型进行了系统评估。
arXiv:2607.17173v1 公告类型:新提交
摘要:评估大语言模型(LLM)在不同语言上的表现仍然具有挑战性,因为大多数多语言基准测试依赖于翻译后的英文数据集,往往掩盖了目标语言的语言和文化特性。这个问题在资源较少的语言(如吉尔吉斯语)中尤为突出,因为缺乏可靠的、由母语者创作的评估数据。基于先前引入的吉尔吉斯语评估数据集,本研究报告了首次使用KyrgyzLLM-Bench基准测试套件对吉尔吉斯语LLM进行系统性大规模评估。KyrgyzLLM-Bench包含两个原生创作的数据集$-$KyrgyzMMLU和KyrgyzRC$-$以及经过精心翻译和人工后期编辑的WinoGrande、HellaSwag、BoolQ和TruthfulQA版本。我们在零样本和少样本设置下评估了26个开源和闭源LLM,分析了模型性能、跨语言迁移以及翻译伪影对评估可靠性的影响。在不同模型族和任务中,模型排名在WinoGrande和BoolQ上从英文到吉尔吉斯语广泛迁移,在MMLU上迁移程度较低,而HellaSwag则表现出显著的英-吉性能差距,这与翻译引起的合理性转变一致。少样本提示在阅读理解上提升了几款开源模型,但在翻译任务上对专有模型表现不一致。我们公开发布所有数据集、评估代码和每个模型的结果,并将吉尔吉斯语任务集成到一个广泛使用的多语言评估框架中,以支持未来对吉尔吉斯语自然语言处理的研究。
查看缓存全文
缓存时间: 2026/07/21 06:44
# KyrgyzLLM-Bench:吉尔吉斯语理解基准测试 来源:https://arxiv.org/html/2607.17173 Aida Turdubaeva信息技术研究所,伊·拉扎科夫吉尔吉斯国立技术大学Rustem Izmailov计算机科学学院,温莎大学Anton M. Alekseev信息技术研究所,伊·拉扎科夫吉尔吉斯国立技术大学俄罗斯科学院斯捷克洛夫数学研究所圣彼得堡分所圣彼得堡国立大学Sergey I. Nikolenko俄罗斯科学院斯捷克洛夫数学研究所圣彼得堡分所圣彼得堡国立大学 ###### 摘要 跨语言评估大语言模型(LLM)仍面临挑战,因为大多数多语言基准依赖翻译后的英文数据集,往往掩盖了目标语言的语言和文化特异性。这一问题在资源匮乏的语言(如吉尔吉斯语)中尤为突出,因为这类语言缺乏可靠的本土创作评估数据。本研究基于先前引入的吉尔吉斯语评估数据集,首次使用KyrgyzLLM-Bench基准套件对吉尔吉斯语LLM进行系统化大规模评估。KyrgyzLLM-Bench包含两个本土创作的数据集——KyrgyzMMLU和KyrgyzRC——以及经过精心翻译和人工后编辑的WinoGrande、HellaSwag、BoolQ和TruthfulQA版本。我们在零样本和少样本设置下评估了26个开源和闭源LLM,分析了模型性能、跨语言迁移以及翻译伪影对评估可靠性的影响。在不同模型家族和任务中,模型排名从英语到吉尔吉斯语在WinoGrande和BoolQ上广泛迁移,在MMLU上迁移程度稍弱,而HellaSwag则表现出显著的英-吉性能差距,这与翻译引起的合理性偏移一致。少样本提示在阅读理解任务上提升了部分开源模型,但在翻译任务上对闭源模型表现不稳定。我们公开发布所有数据集、评估代码和每个模型的结果,并将吉尔吉斯语任务集成到一个广泛使用的多语言评估框架中,以支持吉尔吉斯语NLP的未来研究。¹¹¹预印本。此版本尚未经过同行评审。 关键词:吉尔吉斯语、资源匮乏语言、LLM评估、基准、多语言NLP、阅读理解 ## 1 引言 大语言模型(LLM)的快速发展增加了对稳健多样化评估基准的需求。MMLU[11(https://arxiv.org/html/2607.17173#bib.bib7)]等套件已成为评估推理和知识能力的事实标准。然而,当前的评估仍严重偏向英语[30(https://arxiv.org/html/2607.17173#bib.bib27)],导致模型在不同语言和文化背景下的性能理解存在巨大空白。 为了扩大多语言评估,人们开发了许多基准,最常见的是通过机器翻译英语数据集[16(https://arxiv.org/html/2607.17173#bib.bib3)]。虽然这种方法实用,但引入了众所周知的问题,包括细微的翻译错误、不自然的措辞和“翻译腔”[26(https://arxiv.org/html/2607.17173#bib.bib4)]。更关键的是,翻译后的基准往往保留了源材料特定的文化假设,而不是反映目标语言社区的文化和语境基础,这在文化敏感领域(如社会科学、历史和文学)对评估可靠性产生了可测量的影响[22(https://arxiv.org/html/2607.17173#bib.bib34)]。对于吉尔吉斯语等资源匮乏的语言,缺乏高质量、本土策划的评估数据持续阻碍系统研究和可靠语言技术的开发。 在本研究中,我们使用*KyrgyzLLM-Bench*对吉尔吉斯语LLM进行了系统化大规模评估。KyrgyzLLM-Bench是一个基于先前引入的吉尔吉斯语评估数据集的多方面基准套件。与仅依赖翻译数据的评估不同,KyrgyzLLM-Bench的核心组件是本土创作的,确保了语言自然性和文化相关性。 KyrgyzLLM-Bench包括:(1)KyrgyzMMLU,一个大规模多任务多项选择问答基准,包含7,977道由课程专家编写、与吉尔吉斯国家教育注册表对齐的题目,涵盖数学、物理、文学和历史等学科;(2)KyrgyzRC,一个本地创作的阅读理解数据集,包含400道基于真实吉尔吉斯语文本的问题,需要语境理解和多句推理;(3)翻译基准:经过人工后编辑的吉尔吉斯语版WinoGrande、HellaSwag、BoolQ和TruthfulQA,确保语言保真度和文化适当性。 本文在很大程度上扩展了之前在TurkLang-2025会议上发表的早期会议论文[24(https://arxiv.org/html/2607.17173#bib.bib26)],该论文向吉尔吉斯语NLP社区介绍了KyrgyzLLM-Bench资源。相对于那项工作,本期刊版本提供了更详细的数据集构建、标注和质量控制协议描述;扩展了评估范围,覆盖26个开源和闭源LLM,在零样本和少样本机制下——据我们所知,这是首次在此规模上对复杂、文化扎根的吉尔吉斯语任务进行LLM性能系统分析——并辅以平行英语基线,支持第6节(https://arxiv.org/html/2607.17173#S6)和第7节(https://arxiv.org/html/2607.17173#S7)中的跨语言分析;将吉尔吉斯语任务集成到*Lighteval*评估框架中;以及关于评估相关语言特性(第3节(https://arxiv.org/html/2607.17173#S3))、翻译引起的合理性偏移和少样本稳定性的新分析。我们公开发布所有数据集、评估代码和每个模型的结果,以支持吉尔吉斯语NLP的未来研究。 基于先前关于翻译基准和跨语言评估的工作,我们提出以下假设:(1)核心推理和问答能力部分从英语迁移到吉尔吉斯语,在结构相似的任务(如BoolQ和WinoGrande)上保持相对模型排名;(2)依赖合理性判断的事件延续基准(如HellaSwag)特别容易受到翻译伪影的影响,导致*合理性偏移*——感知自然性和连贯性的不可预测变化,损害跨语言测量的可靠性。 在本文余下部分,我们首先回顾相关先前研究并描述KyrgyzLLM-Bench的构建,然后呈现对开源和专有LLM的广泛评估,最后讨论跨语言迁移、鲁棒性及对低资源评估的启示。 ## 2 相关工作 大语言模型(LLM)在广泛自然语言理解和推理基准上取得了强劲性能,包括GLUE[29(https://arxiv.org/html/2607.17173#bib.bib5)]、SuperGLUE[28(https://arxiv.org/html/2607.17173#bib.bib6)]和MMLU[11(https://arxiv.org/html/2607.17173#bib.bib7)],以及常识推理数据集如WinoGrande[20(https://arxiv.org/html/2607.17173#bib.bib13)]、HellaSwag[31(https://arxiv.org/html/2607.17173#bib.bib12)]和GSM8K[4(https://arxiv.org/html/2607.17173#bib.bib15)]。然而,这些基准主要提供英语和其他高资源语言版本,对吉尔吉斯语等低资源语言的覆盖有限。为填补这一空白,多语言基准如XTREME[12(https://arxiv.org/html/2607.17173#bib.bib8)]和FLORES[8(https://arxiv.org/html/2607.17173#bib.bib9)]被开发用于评估跨不同类型语言的跨语言迁移。然而,许多低资源语言,特别是中亚和突厥语言(如吉尔吉斯语),仍然被排除在外。为低资源语言创建基准的一种实用方法是翻译现有英语数据集。例如,MMLU和COPA已被翻译成拉脱维亚语[23(https://arxiv.org/html/2607.17173#bib.bib10)],尽管这些翻译往往缺乏人工后编辑,可能引入额外噪声。OKAPI框架[16(https://arxiv.org/html/2607.17173#bib.bib3)]使用ChatGPT将ARC、HellaSwag和MMLU翻译成26种语言,但其语言覆盖不包括吉尔吉斯语或任何其他突厥语言,且翻译未经母语者验证。在本研究中,四个广泛使用的基准——WinoGrande、HellaSwag、BoolQ和TruthfulQA——被翻译成吉尔吉斯语并经过人工审核,以确保文化和语言适当性。此外,该基准包括原始的吉尔吉斯语任务,包括基于吉尔吉斯官方学校考试的本地化MMLU和阅读理解测试,其构建和标注程序在本文中详细描述。这种方法与[5(https://arxiv.org/html/2607.17173#bib.bib11)]一致,后者使用中央拉脱维亚高中考试评估LLM性能。 通过结合翻译数据集和文化扎根的原始基准,本研究为多语言泛化和开源LLM对吉尔吉斯语(一种吉尔吉斯共和国约四百万人使用的突厥语言,约占人口的80%[21(https://arxiv.org/html/2607.17173#bib.bib28)])的能力提供了新见解。 据我们所知,在本研究之前,不存在手动验证的MMLU风格基准和吉尔吉斯语母语阅读理解基准,并且[5(https://arxiv.org/html/2607.17173#bib.bib11)]的中央化考试评估逻辑首次应用于突厥低资源语言。我们将KyrgyzLLM-Bench定位为对先前基于翻译的努力的补充而非替代:它添加了之前缺失的本土创作、专家验证的组件。 ## 3 与评估相关的吉尔吉斯语特性 本节简要概述与LLM评估最相关的吉尔吉斯语特性,而非提供全面语言描述;后者请参见[1(https://arxiv.org/html/2607.17173#bib.bib17)]。吉尔吉斯语的三个特性与基准测试和基于翻译的评估特别相关。 **粘着性突厥形态学**。吉尔吉斯语是一种粘着性突厥语言,其中语法关系和派生区别主要通过生产性后缀连接来表达[1(https://arxiv.org/html/2607.17173#bib.bib17)]。因此,表面词形通常比相应英语形式更长,并且不太可能作为单个词元出现在主要基于印欧语数据训练的子词词汇表中。这以两种实际方式影响评估:分词器碎片化增加了相同语义内容的有效上下文长度,当形态学相关形式被分割为罕见或不相关的子词序列时,词汇泛化能力减弱。 **带有扩展字形的西里尔字母**。吉尔吉斯语使用基于西里尔字母的字母表,包括标准俄语中不存在的字母(特别是ң、ү、ө)。没有专用吉尔吉斯语覆盖的分词器可能将这些字形映射到字节级回退或将其视为低频词元,这影响输入编码和生成答案字符串的解析。 **预训练中表示有限且资源稀缺**。吉尔吉斯语在主流畅行预训练语料库和公开可用NLP资源中仍然严重代表性不足[1(https://arxiv.org/html/2607.17173#bib.bib17)、18(https://arxiv.org/html/2607.17173#bib.bib20)、27(https://arxiv.org/html/2607.17173#bib.bib21)]。尽管最近有商业和非商业努力[15(https://arxiv.org/html/2607.17173#bib.bib18)、25(https://arxiv.org/html/2607.17173#bib.bib19)],但核心语言处理任务的手工标注数据集仍然稀缺。 这些特性与我们在第6节(https://arxiv.org/html/2607.17173#S6)中观察到的模式相关。HellaSwag上显著的英-吉差距与翻译引起的粘着性事件完成措辞破坏一致,其中惯用延续依赖于在字面翻译中无法存活的形态连贯性。KyrgyzMMLU中具有强语言特定内容的科目(吉尔吉斯语、吉尔吉斯文学;见表9(https://arxiv.org/html/2607.17173#S6.T9)和表7(https://arxiv.org/html/2607.17173#S5.T7))相对于跨语言可迁移科目(如数学或物理)的准确率较低且不稳定,这与预训练中有限的吉尔吉斯语特定知识一致。我们不主张归因于任何单一因素;我们指出这些特征是最可能的解释候选,有现有吉尔吉斯语NLP文献支持。 ## 4 KyrgyzLLM-Bench构建 #### 与类似资源的比较。 KyrgyzLLM-Bench在两个方面区别于先前的多语言评估工作。*创作与验证*:KyrgyzMMLU和KyrgyzRC源自官方吉尔吉斯教育材料和真实吉尔吉斯文本,每个题目由领域专家和吉尔吉斯语教育工作者审核。这缓解了自动策划的吉尔吉斯语资源质量分析中记录的翻译噪声问题;例如,对公共OPUS样本中NLLB v1英-吉平行语料库的独立定性分析报告称,只有大约三分之一的样本句对是高质量、可用的翻译,其余表现出语言识别错误、对齐错误或流利性问题[14(https://arxiv.org/html/2607.17173#bib.bib29)]。*范围*:KyrgyzMMLU提供7,977道题目,涵盖八个学校科目外加医学专业,KyrgyzRC添加了400道母语阅读理解组件,涵盖百科全书、新闻、文学和数学类型;据我们所知,没有任何先前的公共基准提供如此广泛的吉尔吉斯语覆盖。 ### 4.1 原始基准:KyrgyzMMLU KyrgyzMMLU基于自2002年起在吉尔吉斯斯坦进行的通用共和测试(GRT)材料。GRT由教育评估与教学方法中心(CEATM)与吉尔吉斯共和国教育部合作管理。测试集官方来源于教育和科学部下属的教育质量发展司,包含从6年级到11年级的8个学校科目以及医学等专业类别。科目分布总结于表1(https://arxiv.org/html/2607.17173#S4.T1)。GRT旨在通过公平独立的测试确保高等教育平等机会。测试评估申请者成功在高等教育机构继续学习的能力,以吉尔吉斯语和俄语进行。评估针对推理技能和学校知识的应用。 | 学校科目 | 题目数量 | | --- | --- | | 数学 | 1,169 | | 生物学(Bio) | 1,550 | | 物理学(Phys) | 1,228 | | 化学(Chem) | 1,205 | | 吉尔吉斯文学(Lit) | 1,169 | | 地理(Geog) | 640 | | 吉尔吉斯历史(Hist) | 440 | | 吉尔吉斯语(Lang) | 360 | | 医学(Med) | 216 | 表1:KyrgyzMMLU中的学校科目。 | 科目 | 题目数量 | 来源 | | --- | --- | --- | | 百科全书文本 | 100 | 国家文献 | | 新闻文章 | 100 | 报纸 | | 文学作品 | 100 | 标准书籍 | | 数学问题 | 100 | 考试 | 表2:KyrgyzRC中的科目。 | 问题: | 如果邮局对汇款收取总金额的10%,那么Askar寄600索姆需要多付多少索姆? | | --- | --- | | A) 6 | B) 60 | C) 600 | D) 6000 | | 正确答案: | (В) 60 | 表3:示例测试任务:“如果邮局对汇款收取总金额的10%,那么Askar寄600索姆需要多付多少索姆?”正确答案是(В)60。
相似文章
UA-Legal-Bench:评估大语言模型在乌克兰法律推理能力的基准
介绍了UA-Legal-Bench,这是一个基于统一国家法院判决登记册构建的、用于评估大语言模型在乌克兰法律推理能力的五项任务基准。评估了11个LLM,揭示了任务相关的少样本效应以及在不平衡法律任务中准确率的误导性。
LLM基准测试
一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。
JOR-Bench:面向大型语言模型的日语运筹学基准测试
JOR-Bench 是一个包含五个日语基准测试的集合,用于评估大型语言模型在运筹学问题建模方面的能力,这些基准测试从现有的英语基准翻译而来。评估结果显示整体性能与语言无关,仅有轻微的跨语言差异。
前沿LLM在阿拉伯文化和社会语言学知识上的基准测试:一个带有人类专家真值的交叉评估框架
本文介绍了一个交叉评估框架,用于在阿拉伯文化和社会语言学知识上对LLM进行基准测试,使用人类专家真值和自动评审。作者贡献了一个针对埃及和伊拉克阿拉伯语的提示-评分标准对数据集,评估了前沿LLM,并发现文化推理仍然是自动评分的主要失败模式。
GaoYao基准:全面评估大模型多语言与多文化能力的新框架
GaoYao发布18.2万样本、覆盖26种语言与51个地区的基准,系统评测大模型多语言与多文化能力,首次揭示显著地域性能差异。