Riazi-8B:一个用于数学推理的乌尔都语大语言模型

arXiv cs.CL 论文

摘要

Riazi-8B是一个针对数学推理微调的乌尔都语大语言模型,通过在乌尔都语思维链数据上持续预训练和监督微调,在MGSM-Urdu上实现了性能提升。

arXiv:2606.25568v1 公告类型:新 摘要:近期的大语言模型展示了强大的数学推理能力,但现有成果高度依赖以英语为核心的训练资源和基准。因此,在乌尔都语等低资源语言中,推理性能大幅下降,因为这类语言中缺乏面向推理的数据集和适配的模型。乌尔都语既缺乏面向推理的资源,也缺乏适用于多步数学问题求解的模型,这限制了最新进展对乌尔都语使用者的适用性。我们通过Riazi-8B填补了这一空白,这是一个乌尔都语数学推理模型,通过两步适应过程开发,包括在乌尔都语维基百科上进行持续预训练,以及在源自GSM8K的乌尔都语思维链数据上进行监督微调。我们在MGSM-Urdu上对Riazi-8B与现有的乌尔都语指令微调模型进行了评估。我们的结果显示,在答案正确性、推理质量、响应完整性和乌尔都语生成方面均有持续改进。我们的发现表明,将乌尔都语语言适应与面向推理的微调相结合,是将数学推理能力扩展到低资源语言的有效策略。
查看原文
查看缓存全文

缓存时间: 2026/06/25 05:12

# Riazi-8B:一个用于数学推理的乌尔都语大语言模型
来源:https://arxiv.org/html/2606.25568
###### 摘要

近期的大语言模型展示了强大的数学推理能力,但现有进展严重依赖以英语为中心的训练资源和基准。因此,在资源匮乏的语言(如乌尔都语)中,推理性能显著下降,而这类语言中推理导向的数据集和适配模型仍然稀缺。乌尔都语既缺乏推理导向的资源,也缺少针对多步数学问题求解的适配模型,限制了最新进展对乌尔都语用户的可应用性。我们通过Riazi-8B填补了这一空白,该模型是一个乌尔都语数学推理模型,采用了两步适配过程:在乌尔都语维基百科上进行持续预训练,并在源自GSM8K的乌尔都语思维链数据上进行监督微调。我们在MGSM-乌尔都语上对Riazi-8B与现有的乌尔都语指令微调模型进行了评估。结果显示,在答案正确性、推理质量、响应完整性和乌尔都语生成方面均有持续改进。我们的发现表明,将乌尔都语语言适配与推理导向的微调相结合,是将数学推理能力扩展到低资源语言的有效策略。

## I. 引言

数学推理需要多步推理、逻辑一致性,以及从中间计算中得出可验证结论的能力\[6 (https://arxiv.org/html/2606.25568#bib.bib1),10 (https://arxiv.org/html/2606.25568#bib.bib2)\]。大语言模型的最新进展通过思维链提示\[22 (https://arxiv.org/html/2606.25568#bib.bib3)\]和面向推理的后训练技术\[20 (https://arxiv.org/html/2606.25568#bib.bib4),7 (https://arxiv.org/html/2606.25568#bib.bib5)\]显著提升了数学推理能力。然而,所有这些努力都集中在高资源语言上,而对乌尔都语等低资源语言的关注较少。

乌尔都语在数学推理方面面临独特挑战,因为它使用从右向左的波斯-阿拉伯文字、复杂的词形,并且缺乏面向推理的数据集\[13 (https://arxiv.org/html/2606.25568#bib.bib18)\]。现有的乌尔都语数据集主要支持机器翻译、情感分析和问答等任务,并非为数学推理设计\[12 (https://arxiv.org/html/2606.25568#bib.bib27),3 (https://arxiv.org/html/2606.25568#bib.bib25),4 (https://arxiv.org/html/2606.25568#bib.bib24),1 (https://arxiv.org/html/2606.25568#bib.bib26)\]。虽然多语言大语言模型可以生成流畅的乌尔都语文本,但它们在处理乌尔都语的结构化多步推理\[18 (https://arxiv.org/html/2606.25568#bib.bib28)\]任务时常常遇到困难\[2 (https://arxiv.org/html/2606.25568#bib.bib19),5 (https://arxiv.org/html/2606.25568#bib.bib20)\]。近期面向乌尔都语的模型,如Alif-8B\[19 (https://arxiv.org/html/2606.25568#bib.bib22)\]和Qalb-8B\[9 (https://arxiv.org/html/2606.25568#bib.bib23)\],通常能生成流畅的响应,但无法保持一致的推理轨迹。图1 (https://arxiv.org/html/2606.25568#S1.F1)展示了一个典型的失败案例。模型得出正确答案,但其中间计算却是不正确的。这种不一致性降低了所生成解决方案的可靠性,并限制了大语言模型在教育和辅导应用中的实用性,在这些应用中,推理步骤通常与最终答案同样重要。

参见图1
图1: 比较错误和正确推理轨迹的乌尔都语数学推理示例

据我们所知,尚无先前工作研究乌尔都语中的数学推理。我们通过研究乌尔都语数学推理来填补这一空白。为此,我们提出了Riazi-8B,一个基于Qwen3-8B\[24 (https://arxiv.org/html/2606.25568#bib.bib16)\]的两步乌尔都语数学推理框架,通过在乌尔都语数学推理和维基百科\[23 (https://arxiv.org/html/2606.25568#bib.bib30)\]数据集上进行持续预训练和监督微调,实现乌尔都语中的逐步数学推理。

我们的贡献如下:(1) 我们提出了Riazi-8B,一个面向数学推理的乌尔都语大语言模型;(2) 我们研究了一种将乌尔都语语言适配与推理导向监督相结合的两步适配策略;(3) 我们给出了乌尔都语数学推理的实证分析,并提供了一个综合评估框架,该框架将答案级指标与基于大语言模型的推理质量和乌尔都语流畅度评估相结合。

参见图2
图2: Riazi-8B通过持续预训练进行乌尔都语语言适配,并通过推理导向监督微调进行优化。

## II. 相关工作

我们将本节分为三部分,涵盖数学推理、乌尔都语大语言模型和低资源训练策略。

### II-A 大语言模型中的数学推理

像GSM8K\[6 (https://arxiv.org/html/2606.25568#bib.bib1)\]和MATH\[10 (https://arxiv.org/html/2606.25568#bib.bib2)\]这样的数据集揭示了大型模型在零样本条件下的系统性失败,并促使研究重心转向中间推理步骤。思维链提示\[22 (https://arxiv.org/html/2606.25568#bib.bib3)\]表明,监督完整的推理轨迹能显著提升性能。过程奖励模型\[15 (https://arxiv.org/html/2606.25568#bib.bib6)\]进一步证明,步骤级监督优于仅结果监督。GRPO\[20 (https://arxiv.org/html/2606.25568#bib.bib4)\]作为PPO\[17 (https://arxiv.org/html/2606.25568#bib.bib10)\]的无评判器变体,实现了强大的数学推理对齐;DeepSeek-R1\[7 (https://arxiv.org/html/2606.25568#bib.bib5)\]展示了GRPO如何仅使用最终答案正确性作为奖励来激励复杂的多步推理。

### II-B 乌尔都语大语言模型

现有的乌尔都语自然语言处理研究主要集中于翻译\[12 (https://arxiv.org/html/2606.25568#bib.bib27)\]、情感分析\[3 (https://arxiv.org/html/2606.25568#bib.bib25)\]和语言处理\[4 (https://arxiv.org/html/2606.25568#bib.bib24)\]\[1 (https://arxiv.org/html/2606.25568#bib.bib26)\]等任务。近期包括Alif-8B\[19 (https://arxiv.org/html/2606.25568#bib.bib22)\]和Qalb-8B\[9 (https://arxiv.org/html/2606.25568#bib.bib23)\]在内的乌尔都语模型,通过持续预训练和指令微调来提高通用乌尔都语能力。然而,这些模型并非专门为数学推理设计,且主要依赖合成生成的指令数据,而我们的方法则利用翻译后的人工编撰数学推理数据。据我们所知,Riazi-8B是首个明确为逐步数学推理训练的面向乌尔都语的大语言模型。

### II-C 低资源训练策略

Joshi等人\[13 (https://arxiv.org/html/2606.25568#bib.bib18)\]根据数字资源量对语言进行分类,显示大多数语言属于自然语言处理代表性最低的类别。MEGA\[2 (https://arxiv.org/html/2606.25568#bib.bib19)\]和Bang等人\[5 (https://arxiv.org/html/2606.25568#bib.bib20)\]确认推理性能在低资源环境中显著下降,这直接激励了特定语言的训练。领域自适应预训练\[8 (https://arxiv.org/html/2606.25568#bib.bib21)\]为持续预训练提供了实证基础:在领域特定文本上持续训练能带来持续收益,特别是当目标领域与预训练分布差异较大时——这正是乌尔都语的情况。

## III. 提出的解决方案:Riazi-8B

我们提出Riazi-8B,一个基于Qwen3-8B\[24 (https://arxiv.org/html/2606.25568#bib.bib16)\]的乌尔都语数学推理流水线。该流水线将乌尔都语维基百科上的持续预训练与乌尔都语思维链数学推理数据上的监督微调相结合。我们选择Qwen3-8B作为基础模型,因为它具有多语言能力。两个适配步骤都使用LoRA\[11 (https://arxiv.org/html/2606.25568#bib.bib15)\]进行参数高效训练。图2 (https://arxiv.org/html/2606.25568#S1.F2)总结了整个流水线¹¹代码和训练资源将在接受后发布。

### III-A 持续预训练

我们的第一步是在乌尔都语维基百科上对Qwen3-8B进行持续预训练。我们的目标是在引入数学推理监督之前,先适配乌尔都语的流畅生成。我们使用LoRA\[11 (https://arxiv.org/html/2606.25568#bib.bib15)\]进行参数高效适配,仅更新一小部分可训练参数。

### III-B 监督微调

在持续预训练之后,我们的第二步是在GSM8K-乌尔都语上对适配后的模型进行微调。每个训练实例包含一个乌尔都语数学问题以及对应的包含最终答案的推理轨迹。通过这一步,我们将乌尔都语数学推理引入训练后的模型。在推理时,我们使用温度为0.6,top-p为0.95,top-k为20,以及最大序列长度为2048个标记。表1 (https://arxiv.org/html/2606.25568#S3.T1)总结了两个阶段的实验设置。我们在持续预训练和监督微调中都使用LoRA\[11 (https://arxiv.org/html/2606.25568#bib.bib15)\],以实现参数高效适配,而无需更新完整的模型参数。

表 I: 持续预训练和监督微调阶段的模型与配置细节,包括评估时使用的解码设置。

## IV. 实验

### IV-A 数据集

我们使用乌尔都语维基百科\[23 (https://arxiv.org/html/2606.25568#bib.bib30)\]进行持续预训练,使用GSM8K-乌尔都语\[18 (https://arxiv.org/html/2606.25568#bib.bib28)\]进行监督微调,以及使用MGSM-乌尔都语\[18 (https://arxiv.org/html/2606.25568#bib.bib28)\]进行评估。乌尔都语维基百科包含约20万篇文章,作为语言适配语料库。GSM8K-乌尔都语是GSM8K\[6 (https://arxiv.org/html/2606.25568#bib.bib1)\]的乌尔都语翻译版,包含约8500个算术应用题,每道题附有逐步解决方案和最终答案。MGSM-乌尔都语包含250个保留的小学数学问题,用于评估超出训练数据的泛化能力。我们使用fastText\[14 (https://arxiv.org/html/2606.25568#bib.bib32)\]进行语言验证,并应用Unicode标准化、文档级去重、质量过滤以及使用Qwen3-8B分词器\[24 (https://arxiv.org/html/2606.25568#bib.bib16)\]进行分词器兼容性检查。

### IV-B 模型

我们将Riazi-8B与三个基线模型进行比较:(1) Qalb-8B\[9 (https://arxiv.org/html/2606.25568#bib.bib23)\]、(2) Alif-8B\[19 (https://arxiv.org/html/2606.25568#bib.bib22)\]和(3) Llama-8B\[21 (https://arxiv.org/html/2606.25568#bib.bib34)\]。Qalb-8B和Alif-8B代表现有的乌尔都语适配大语言模型,而Llama-3.1-8B-Instruct在相似规模上提供了一个强大的多语言基线。我们使用相同的解码参数评估所有模型(温度=0.6,top-p=0.95,top-k=20,最大序列长度=2048个标记)。

参见图3
图3: 评估流水线,其中模型响应通过大语言模型评判器与真实答案进行比较。

### IV-C 评估

我们报告三个指标:精确匹配准确率(EM)衡量提取出的数值答案与参考答案完全匹配的问题比例;这是我们主要的指标。乌尔都语输出纯度(UOP)衡量生成标记中属于乌尔都语脚本的比例(通过fastText\[14 (https://arxiv.org/html/2606.25568#bib.bib32)\]识别),用于捕捉语言崩溃的失败模式。步骤完整性评分(SCS)衡量模型是否在最终答案之前生成至少两个不同的中间推理步骤,用于区分结构化的思维链生成和直接检索。这三个指标分别刻画了答案正确性、语言保真度和推理结构,独立地暴露每种失败模式。

### IV-D 大语言模型作为评判器

为了评估生成响应的质量,我们应用了基于大语言模型作为评判器范例\[25 (https://arxiv.org/html/2606.25568#bib.bib7),16 (https://arxiv.org/html/2606.25568#bib.bib9)\]的评分准则评估框架。如图3 (https://arxiv.org/html/2606.25568#S4.F3)所示,我们使用gpt-oss-20作为自动评估器。评判器接收乌尔都语问题、模型的完整响应和参考答案,并基于5点李克特量表对响应的五个维度进行评分:(i) 正确性:最终答案和中间结论的准确性;(ii) 推理:推理过程的连贯性和有效性;(iii) 乌尔都语流畅度:生成乌尔都语文本的语法正确性和自然度;(iv) 清晰度:推理和结论的无歧义性;(v) 完整性:涵盖所有必要推理步骤的程度。我们报告每个维度在评估集上的均值和标准差。这些指标通过捕捉推理和响应质量的定性方面,补充了精确匹配准确率。

表 II: 乌尔都语MGSM上的评估结果:EM、UOP和SCS。
表 III: 大语言模型作为评判器在乌尔都语推理基准上的评估结果。分数报告为均值±标准差。

## V. 结果

表 II (https://arxiv.org/html/2606.25568#S4.T2)报告了MGSM-乌尔都语上的评估结果。Riazi-8B在所有三个指标上均取得了最高性能,优于乌尔都语特定和多语言基线。最强的基线Llama已经展现了具有竞争力的数学推理性能,达到了59.6%的精确匹配准确率和77.2%的步骤完整性。然而,Riazi-8B进一步改进了这些结果,达到了最高的答案准确率、乌尔都语输出纯度和推理完整性。

在乌尔都语生成质量方面差距最为显著。虽然Llama取得了相对较强的推理性能,但其乌尔都语输出纯度低于Riazi-8B。相比之下,Riazi-8B将具有竞争力的推理与更一致的乌尔都语生成相结合,这表明语言适配不仅有助于提升答案正确性。步骤完整性评分的提高进一步表明,模型在得出最终答案之前生成了更完整的推理轨迹。这些结果共同表明,将乌尔都语语言适配与推理导向监督相结合,既改善了推理质量,也提升了语言保真度。

### V-A 响应质量分析

表 III (https://arxiv.org/html/2606.25568#S4.T3)报告了在五个质量维度上的大语言模型作为评判器评估结果。Riazi-8B在正确性、推理、乌尔都语流畅度、清晰度和完整性上均取得了最高分数,表明其改进超越了答案级准确性。最强的基线Llama-8B在所有维度上都表现出了竞争力,但Riazi-8B保持了持续的优势。最大的提升出现在完整性和乌尔都语流畅度方面,表明该模型生成了更完整的推理轨迹,同时保持了更高质量的乌尔都语生成。

这些结果表明,仅靠语言适配不足以应对数学推理。尽管Llama-8B展现了强大的通用推理能力,但推理导向的监督进一步提高了乌尔都语中的正确性、清晰度和完整性。相比之下,Alif-8B和Qalb-8B在与推理相关和语言相关的维度上均显著落后,突显了在没有任务特定适配的情况下将数学推理迁移到乌尔都语的困难。

## VI. 局限性

持续预训练数据主要来自乌尔都语维基百科,其中数学和科学内容较少。这限制了模型获取领域特定推理技能的能力。第二,指令微调数据来自GSM8K,主要侧重于小学数学。这使得

相似文章

低资源语言数学教育中的大语言模型:僧伽罗语和泰米尔语研究

arXiv cs.CL

本文评估了大语言模型在僧伽罗语和泰米尔语(两种资源匮乏的南亚语言)中的数学推理能力,采用独立编写问题的平行数据集进行评估。研究表明,虽然基础算术在跨语言间转移良好,但复杂推理任务在非英语语言中表现出显著性能下降,这对在多语言教育环境中部署AI辅导工具具有重要启示。

UrduMMLU:乌尔都语理解的大规模多任务基准测试

arXiv cs.CL

UrduMMLU是一个新基准测试,包含来自本土教育材料的26,431道多项选择题,涵盖26个学科,用于评估大语言模型在乌尔都语理解上的表现。对30个大语言模型的评估显示,Gemini-3.5-Flash表现最佳,而开源模型和区域特定学科仍构成重大挑战。

哪些模型在继承推理中表现更好?

arXiv cs.CL

本文介绍了PSL团队在2026年阿拉伯伊斯兰继承推理共享任务(QIAS 2026 Shared Task)中的参与情况,对比了商业和开源大语言模型。结果显示,商业模型(如Gemini 2.5 Flash)在处理具有多步依赖的结构化法律推理方面显著优于开源模型。