面向低资源语言的大语言模型:塔吉克语电子详解词典的概念框架

arXiv cs.CL 论文

摘要

本文提出了一个使用大语言模型构建塔吉克语电子详解词典的概念框架,该框架整合了词法分析、词形还原、语义聚类和词典条目生成,并采用PEFT策略。

arXiv:2608.04186v1 公告类型:新 摘要:本文提出了一个使用大语言模型(LLMs)开发塔吉克语电子详解词典的概念框架。这项工作的相关性源于以下事实:塔吉克语缺乏一个功能上与高资源语言词典相当的综合数字词典资源,同时现代自然语言处理技术对低资源语言系统的适配也有限。基于对现有语言学、统计学和语料库资源的系统性调查,我们提出了一种词典架构,该架构整合了使用LLMs进行词法分析、词形还原、语义聚类和词典条目生成的模块。选择子词分词的理由是塔吉克语词法的黏着性及其高度的词法变异性,同时采用适用于有限标注数据的参数高效微调(PEFT)策略。这项工作的新颖之处在于,它提出了第一个整体性的塔吉克语详解词典概念架构,将经典词典编纂方法、语言统计和LLMs的生成能力统一到一个系统中。该研究的实践意义在于为开发功能全面的电子词典奠定方法论基础,该词典既可以作为词典编纂工具,也可以作为机器翻译、自动摘要、情感分析和其他应用型NLP任务的核心资源。本文面向计算语言学、词典编纂领域的专家,以及从事低资源语言自然语言处理系统开发的从业者。
查看原文
查看缓存全文

缓存时间: 2026/08/06 07:45

# 面向低资源语言的大语言模型:塔吉克语电子详解词典的概念框架  
来源:https://arxiv.org/html/2608.04186

M\. K\. Arabov 电子邮件:MKArabov@kpfu\.ru  
喀山联邦大学,计算数学与信息技术学院,喀山,俄罗斯

S\. S\. Pirov 电子邮件:3samr@list\.ru  
塔吉克国立大学,信息与通信技术系,力学数学学院,杜尚别,塔吉克斯坦

B\. Sultonov 电子邮件:sultonov\.b@mail\.ru  
塔吉克国立大学,信息与通信技术系,力学数学学院,杜尚别,塔吉克斯坦

###### 摘要

本文提出了一个使用大语言模型(LLM)开发塔吉克语电子详解词典的概念框架。本工作的意义在于:塔吉克语目前缺乏一个在功能上与高资源语言词典相当的综合数字词典资源,同时现代自然语言处理技术对低资源语言系统的适配也有限。基于对现有语言学、统计学和语料库资源的系统调查,我们提出了一种词典架构,该架构整合了形态分析、词形还原、语义聚类以及利用LLM生成词条的模块。选择子词分词的理由是塔吉克语形态的黏着特性及其高形态变异性,同时采用了适用于有限标注数据的参数高效微调(PEFT)策略。本工作的新颖之处在于首次提出了一个塔吉克语详解词典的整体概念架构,将经典词典编纂方法、语言统计和LLM的生成能力统一到一个系统中。本研究的实际意义在于为开发一个功能完备的电子词典奠定方法论基础,该词典既可以作为词典编纂工具,也可以作为机器翻译、自动摘要、情感分析和其他应用型自然语言处理任务的核心资源。本文面向计算语言学、词典编纂学专业研究人员,以及从事低资源语言自然语言处理系统开发的实践者。

关键词:大语言模型、电子详解词典、塔吉克语、低资源语言、参数高效微调、子词分词、词典编纂学、形态分析、语义聚类、语料库语言学、自然语言处理。

## 1 引言

近年来,自然语言处理(NLP)技术的快速发展带来了数字语言资源创建方式的质变。基于大语言模型(LLM)已经取得了特别显著的成果,这些模型在数字支持水平较高的语言的文本生成、理解和分析任务中表现出了很高的有效性。然而,这种进展极不均衡:缺乏足够标注语料、计算基础设施和研究社区的语言几乎被排除在现代LLM生态系统之外 (Arabov,2025 (https://arxiv.org/html/2608.04186#bib.bib1))。塔吉克语就属于这类低资源语言。塔吉克语作为塔吉克斯坦共和国的国语,拥有悠久的文学传统,却仍然缺乏一部功能上与世界上主要语言的词典资源相当的综合性电子详解词典。现有的塔吉克语详解词典以纸质形式 (Shukurov et al.,2008 (https://arxiv.org/html/2608.04186#bib.bib2))或受限的电子版本存在,不符合现代数字词典资源的要求:它们不支持动态更新,未与自动文本处理系统集成,也未采用机器学习方法来生成和更新词条。与此同时,在过去二十年里,以Z\.D\. Usmanov及其学生为核心的计算语言学科学学派在塔吉克斯坦建立起来,为塔吉克语自动文本处理奠定了根本性基础。他们创建了形态分析的概念模型 (Usmanov and Dovudov,2014 (https://arxiv.org/html/2608.04186#bib.bib4)),编制了庞大的语素数据库,包括81个前缀、76539个词根和128760个后缀 (Dovudov,2018 (https://arxiv.org/html/2608.04186#bib.bib5)),开发了频率语素词典 (Usmanov and Dovudov,2010 (https://arxiv.org/html/2608.04186#bib.bib6))和塔吉克语文本的统计画像 (Usmanov and Kosimov,2015a (https://arxiv.org/html/2608.04186#bib.bib8),2016 (https://arxiv.org/html/2608.04186#bib.bib7); Kosimov,2021 (https://arxiv.org/html/2608.04186#bib.bib9))。在这些研究的基础上,构建了自动文本处理系统TajLINGVO (Khudoyberdiev,2023 (https://arxiv.org/html/2608.04186#bib.bib10))、语音语料库 (Khudoyberdiev,2025 (https://arxiv.org/html/2608.04186#bib.bib11))和开源工具包TajikNLP (Arabov et al.,2026 (https://arxiv.org/html/2608.04186#bib.bib12)),以及规模最大的塔吉克语语料库——超过11亿字符的塔吉克语网络语料库 (Arabov,2026f (https://arxiv.org/html/2608.04186#bib.bib13))和包含5840万词次出现的塔吉克语国家语料库(NKTJ) (Tajik National Corpus, (https://arxiv.org/html/2608.04186#bib.bib14))。在将神经网络架构适配到塔吉克语方面也取得了重要成果。基于多语言Transformer进行了词性标注基准测试 (Arabov,2026c (https://arxiv.org/html/2608.04186#bib.bib15)),对子词分词器效率进行了系统分析 (Arabov and Khaibullina,2026 (https://arxiv.org/html/2608.04186#bib.bib16)),针对塔吉克语文本生成进行了参数高效微调(PEFT)方法的比较研究 (Arabov,2026b (https://arxiv.org/html/2608.04186#bib.bib17)),并且基于继续预训练创建了Soro系列的塔吉克语专用模型 (Liashkov et al.,2026 (https://arxiv.org/html/2608.04186#bib.bib18))。然而,尽管有上述资源和方法,使用大语言模型创建塔吉克语电子详解词典的任务仍未解决。现有工作没有定义词典的架构模型、考虑黏着现象的子词分词策略、数据稀缺条件下的微调方法以及生成词条的评估体系。本文是对这一问题进行系统性解决的第一阶段。本工作的目标是开发一个基于大语言模型的塔吉克语电子详解词典的概念框架。为实现这一目标,需要完成以下任务:

1. 对与创建词典资源相关的塔吉克语现有语言学、统计和基础设施开发成果进行系统化;
2. 分析当前将LLM适配到低资源语言的方法,并重点考察其在塔吉克语上的适用性;
3. 论证电子详解词典的架构解决方案和方法;
4. 开发一个整合形态分析、词形还原、语义聚类和词条生成模块的概念词典架构。

本工作的科学新颖之处在于首次提出一个塔吉克语详解词典的整体概念架构,将经典词典学描述方法、塔吉克语文本统计分析结果和大语言模型的生成能力统一起来。所提出的架构是创建并随后实验评估一个功能完备的塔吉克语详解词典的第一阶段。本研究的实际意义在于为开发塔吉克语电子详解词典奠定方法论基础,该词典既可以作为词典学工具,也可以作为广泛的应用型自然语言处理任务的基础资源:机器翻译、自动摘要、情感分析、问答系统等。本文面向计算语言学、词典学专业研究人员、自然语言处理系统开发者,以及从事低资源语言数字化发展问题研究的学者。

## 2 相关工作

### 2.1 塔吉克语的形态学基础

塔吉克语形态学的基础研究是在以Z\.D\. Usmanov的工作为核心形成的科学学派中开展的。专著《塔吉克语词形的形态分析》 (Usmanov and Dovudov,2015 (https://arxiv.org/html/2608.04186#bib.bib3))描述了词类的屈折范畴和语法特征,提供了词缀类型和词形的分类,考察了词缀附着时的词类转化,并提出了自动形态分析的算法。形态分析器的概念模型以流程图的形式呈现,反映了各个子系统以及整个系统的运行机制 (Usmanov and Dovudov,2014 (https://arxiv.org/html/2608.04186#bib.bib4))。最完整的塔吉克语语素数据库在G\.M\. Dovudov的学位论文研究中编制完成 (Dovudov,2018 (https://arxiv.org/html/2608.04186#bib.bib5)),包含81个前缀、76539个词根和128760个后缀。该工作提出了词缀类型分类——屈折词缀、派生词缀和搭配词缀——以及相应的词形分类。

相似文章

大语言模型在低资源语言人文学科研究中的机遇与挑战

arXiv cs.CL

本文系统评估了大语言模型在低资源语言研究中的应用,分析了在语言变异、历史文献、文化表达和文学分析等方面的机遇与挑战。研究强调了跨学科合作和定制化模型开发,以保护语言和文化遗产,同时解决数据可获取性、模型适应性和文化敏感性问题。

低资源语言数学教育中的大语言模型:僧伽罗语和泰米尔语研究

arXiv cs.CL

本文评估了大语言模型在僧伽罗语和泰米尔语(两种资源匮乏的南亚语言)中的数学推理能力,采用独立编写问题的平行数据集进行评估。研究表明,虽然基础算术在跨语言间转移良好,但复杂推理任务在非英语语言中表现出显著性能下降,这对在多语言教育环境中部署AI辅导工具具有重要启示。

语言模型碎片整合:基于可解释性的词汇扩展方法

arXiv cs.CL

# 基于可解释性的词汇扩展方法 来源:[https://arxiv.org/html/2604.16656](https://arxiv.org/html/2604.16656) ## 语言模型碎片整合:基于可解释性的词汇扩展方法 Maitrey Mehta¹, Nishant Subramani², Zhichao Xu¹, Ashim Gupta¹, Vivek Srikumar¹ 1 Kahlert School of Computing, University of Utah 2 Language Technologies Institute, Carnegie Mellon University {maitrey,svivek}@cs.utah.edu ###### 摘要 所有语言生而平等;但在词元化方面,某些语言更为平等。词元是当代大语言模型访问成本和延迟的隐藏货币。然而,许多使用非拉丁文字书写的语言却面临着糟糕的“汇率”:大语言模型需要用数倍的词元来编码与英语相同的信息。我们的分析表明,这个被称为“词元过度碎片化”的问题在现代开源大语言模型中依然存在。标准解决方案是词汇扩展,即添加模型词汇库中缺失的目标语言词汇。在这项工作中,我们全面研究并推进基于可解释性的词汇扩展这一新研究方向。我们聚焦于词汇扩展过程中的两个核心决策:应该添加哪些词汇?以及如何初始化它们对应的输入和输出嵌入? 首先,我们质疑使用基于频率的方法来选择待添加候选词汇的传统做法(这一决策长期以来被视为理所当然),并证明基于可解释性的方法能够提供更优的性能-词元效率权衡。其次,我们通过展示对于多种非拉丁文字语言相较于基线初始化方法取得的大幅提升(约20分),加强了基于可解释性的嵌入初始化的可行性。我们发现了“子词去词元化”现象,即模型在多层网络中逐步将碎片化的子词词元合并为更大的子词。基于对这一现象的分析,我们提出了FragMend,以进一步突破基于可解释性的扩展的效率上限。我们通过与强基线方法的比较验证了FragMend的有效性,并对其设计选择进行了广泛分析。