TajPersLexon:用于跨脚本低资源NLP的塔吉克-波斯语词汇资源与混合模型

arXiv cs.CL 论文

摘要

本文介绍了 TajPersLexon,这是一个用于塔吉克-波斯语跨脚本自然语言处理的词汇资源,并通过将混合模型与神经基线模型进行基准测试,展示了其在低资源环境下的有效处理能力。

arXiv:2605.06886v1 公告类型:新发布 摘要:本文介绍了 TajPersLexon,这是一个经过精心整理的塔吉克-波斯语平行词汇资源,包含40,112对单词和短语,旨在支持低资源环境下的跨脚本词汇检索、转写和对齐。我们进行了全面的仅CPU基准测试,比较了三类方法:(i) 轻量级混合流水线,(ii) 神经序列到序列模型,以及 (iii) 检索方法。评估结果表明该任务基本可解,神经基线和检索基线达到了98-99%的Top-1准确率。关键在于,我们发现虽然大型多语言句子Transformer在此类精确词汇匹配任务上表现不佳,但我们的可解释性混合模型在实用应用中提供了良好的准确率与效率平衡,在OCR后纠错任务中达到了96.4%的准确率。所有实验均使用固定的随机种子以确保完全可复现。数据集、代码和模型将公开发布。
查看原文
查看缓存全文

缓存时间: 2026/05/11 06:39

# TajPersLexon:一种针对跨脚本低资源NLP的塔吉克语-波斯语词汇资源与混合模型
来源:https://arxiv.org/html/2605.06886
[![[无标题图片]](https://arxiv.org/html/2605.06886v1/x1.png)M\. K\. Arabov](https://orcid.org/0000-0003-2525-1183) 计算数学与信息技术研究所 喀山联邦大学 俄罗斯喀山 MKArabov@kpfu\.ru

###### 摘要

本工作引入了 TajPersLexon,这是一个精心整理的包含 40,112 个单词和短词组对的塔吉克语-波斯语平行词汇资源,用于低资源环境下的跨脚本词汇检索、转写和对齐。我们进行了一项全面的仅使用 CPU 的基准测试,比较了三种方法家族:(i)轻量级混合流水线,(ii)神经序列到序列模型,以及(iii)检索方法。我们的评估表明该任务基本上是可解的,神经和检索基线达到了 98–99% 的 Top-1 准确率。关键在于,我们证明虽然大型多语言句子变换器(Sentence Transformers)在此精确词汇匹配上失败,但我们可解释的混合模型为实际应用提供了有利的准确率-效率权衡,在 OCR 后校正任务中达到了 96.4% 的准确率。所有实验均使用固定的随机种子以确保完全可复现性。数据集、代码和模型将公开发布。

*关键词*塔吉克语⋅\\cdot波斯语⋅\\cdot词汇资源⋅\\cdot低资源 NLP⋅\\cdot跨脚本⋅\\cdot转写⋅\\cdot混合模型⋅\\cdot基准测试

## 1 引言

伊朗语族的自然语言处理在资源可用性和工具支持方面存在显著不平衡。虽然波斯语(包括伊朗标准语和达里语)一直是许多计算努力的重点,但相关变体如塔吉克语相比之下资源较为匮乏。塔吉克语主要使用西里尔字母书写,而波斯语变体通常使用波斯-阿拉伯字母;这种双脚本格局造成了跨脚本挑战,使词汇对齐、转写、检索以及机器翻译和光学字符识别(OCR)等下游应用变得复杂(Megerdoomian and Parvaz, 2008; Merchant and Tang, 2024)。此外,现有的塔吉克语文本和词典材料格式往往 heterogeneous(异构),且未直接与波斯语资源对齐,限制了其在跨脚本计算方法中的即时效用(Shukurov et al., 1969; Ghiyosiddin, 1987; Nazarzoda et al., 2008; TNC)。

先前的研究已探索使用统计机器翻译技术进行塔吉克语和波斯语之间的转写和映射(Davis, 2012),以及基于规则的系统和方法,包括变压器模型在内的神经方法(Sadraei Javaheri et al., 2024; Merchant et al., 2025)。同时,成熟的工具生态系统(如 fairseq)和既定的评估指标(如 chrF 系列)支持了实验的严谨性(Ott et al., 2019; Popović, 2017)。然而,许多现代神经方法依赖于大量的预训练和 GPU 资源,这降低了在计算受限环境中的可访问性和可复现性;这激发了优先考虑轻量级、可解释和可复现流水线的研究(Arabov et al., 2025; Arabov and Sedykh, 2025)。

为了弥补这些差距,我们引入了 TajPersLexon,这是一个精心整理的塔吉克语-波斯语平行词汇资源,包含约 40,112 个带有词性信息和示例的单词和短词组对。基于此资源,我们对多种方法家族进行了全面评估:(i)一个紧凑的仅 CPU 混合流水线,结合了联合子词分词(SentencePiece)、子词感知的分布式嵌入(FastText 和 Word2Vec),以及融合嵌入相似度、编辑距离检索和基于规则的转写的排序模型;(ii)现代序列到序列模型(LSTM 和 Transformer 架构);以及(iii)基于检索的方法(BM25)。我们的设计目标优先考虑可复现性、可解释性和可访问性:在建立强大的神经基线的同时,我们特别关注无需 GPU 基础设施即可使用的轻量级方法,为低资源场景提供实用解决方案。据我们所知,这是目前最大的公开可用机器可读塔吉克语-波斯语词典,也是针对此跨脚本任务的首个全面基准测试。

我们的贡献:(1)TajPersLexon 数据集(40,112 条带有 POS 标签的条目);(2)对混合、神经和检索方法的全面基准测试(98-99% Acc@1);(3)实用的 OCR 后校正效用(96.4% 准确率);(4)完全可复现的仅 CPU 设置。所有资源将公开发布。

## 2 相关工作

我们回顾了五个相关领域:词典资源、转写方法、分词技术、评估工具和低资源方法,将 TajPersLexon 定位于此领域。

**词典和语料库资源。**权威的印刷词典仍然是塔吉克语词典学的重要参考。Shukurov 等人的历史性和大规模词典(Shukurov et al., 1969)、Ghiyosiddin 的综合词典(Ghiyosiddin, 1987)以及 Nazarzoda 等人的解释性词典(Nazarzoda et al., 2008)提供了丰富的描述,但很少以适合计算实验的机器可读平行形式分发。数字语料库和国家集合(如塔吉克国家语料库 TNC)提供原始文本,但通常缺乏对齐的双语词汇对(TNC)。最近为塔吉克语汇编多格式语料库的努力试图缩小这一差距(Arabov et al., 2025);TajPersLexon 旨在通过提供显式平行、带有使用示例的 POS 注释词典来补充这些资源。

**转写和跨脚本映射。**塔吉克语和波斯语之间的转写已通过多种方法解决。早期方法使用 SMT 风格模型将转写视为序列映射问题(Davis, 2012)。最近,神经 seq2seq 和基于 Transformer 的模型已应用于转写和方言桥接,在拥有足够平行数据和计算资源时取得了强劲结果(Sadraei Javaheri et al., 2024; Merchant et al., 2025)。诸如 ParsText 之类的语料库通过提供双脚本数据支持这些努力(Merchant and Tang, 2024)。神经方法功能强大,但经常依赖大型预训练模型和 GPU 资源;这激发了在受限环境中可访问的互补轻量级和混合方法的研究。

**分词、嵌入和混合方法。**子词分词和子词感知的嵌入对于形态丰富、低资源的语言特别有用。SentencePiece 广泛用于语言无关的子词分割,而 Word2Vec 和 FastText 等分布模型仍然是稳健的基线——FastText 的字符 n-gram 缓解了屈折语言中的未登录词(OOV)问题。将分布相似度与基于字符串的度量(如编辑距离)和基于规则的转写相结合,利用了互补优势:嵌入捕捉分布语义,字符串方法捕捉正字法对应关系。先前的比较研究表明,此类混合策略提高了低资源、跨脚本任务中的鲁棒性(Arabov and Sedykh, 2025; Mohtaj et al., 2018);我们的混合排序遵循这一原理,并在保留数据上调整组件权重。

**工具和评估。**成熟的工具生态系统(如 fairseq)促进了可复现的序列建模实验(Ott et al., 2019)。对于转写和相关任务,字符级指标(chrF, CER)与检索指标(Accuracy@k, MRR)一起提供了对性能互补视角(Popović, 2017)。我们采用这种指标组合并报告 bootstrap 置信区间以表征不确定性。

**低资源方法和可访问性。**有一条活跃的研究线索关注低资源语言的自举方法和实用工作流,涵盖语料库准备、预处理和轻量级建模策略(Megerdoomian and Parvaz, 2008; Arabov et al., 2025; Arabov and Sedykh, 2025)。特定语言的预处理工具(如用于波斯语的 Parsivar)说明了定制流水线带来的收益(Mohtaj et al., 2018)。我们的工作与这些努力保持一致,强调可复现性、可解释性和旨在广泛采用的基于 CPU 的基线。

**总结与差异。**简而言之,先前的资源和方法为跨脚本研究奠定了坚实基础,但机器可读、平行的塔吉克语-波斯语词典以及轻量级、可复现的基线仍然稀缺。TajPersLexon 通过结合词典编纂与紧凑的混合建模框架(子词分词、分布嵌入和基于字符串的度量)并释放数据和支持后续研究的代码来解决这一差距。

## 3 数据集

**来源。**TajPersLexon 数据集是从权威的词典资源和数字语料库混合编译而成。主要来源包括印刷版塔吉克语词典和塔吉克国家语料库(TNC)(Shukurov et al., 1969; Ghiyosiddin, 1987; TNC)。选择这些来源是为了最大化词汇覆盖率,并在可能的情况下提供规范词目形式以及示例语料库例句。在可能的情况下,我们保留了源元数据(词目原形、POS 注释和使用说明)以支持下游整理和验证。

### 3.1 整理流水线和规范化

数据集构建遵循半自动化的可复现流水线:

1. **提取:**从数字化的词典版本和对齐的语料库片段中提取候选的塔吉克语-波斯语对应关系。
2. **规范化:**应用 Unicode NFC 规范化。对于塔吉克语西里尔字母,我们标准化了正字法变体(例如,在适当情况下 ё→е)并规范了二合元音中 й 的使用。对于波斯语波斯-阿拉伯字母,我们统一了语义中性的常见 Aleph(א)和 Hamza 变体,遵循标准波斯语文本处理惯例。
3. **去重:**移除完全重复项,随后使用模糊匹配(Levenshtein 距离 < 2)处理近乎相同的形式。
4. **丰富:**将条目与词性标签和示例(如有)对齐。
5. **质量控制:**由母语为塔吉克语的人员手动审查 5% 的分层随机样本(2,006 对),纠正系统性的 OCR、分词和脚本转换错误。样本中的校正前错误率为 3.2%,经人工审核后降至 0.4%。

多词表达式(MWEs)如复合名词(рӯзи умъа – ruz-e jom’e)和轻动词结构(кор кардан – kār kardan)作为原子单元包含在内,不进行组合分解,反映了词典查询的使用习惯。

形态变体(屈折形式)作为独立条目保留,而不进行词形还原,保持了检索任务重要的表面形式多样性。

**词性注释。**POS 标签源自多种来源的结合:在可能的情况下,我们保留来自原始词典来源的 POS 元数据;对于缺乏显式标签的条目,我们应用轻量级的基于规则和词典的分配启发式方法,利用词典词目信息和简单的形态线索。在整理期间,随机抽取的自动分配标签子集经过手动检查并在必要时进行纠正。最终的 POS 库存报告于表 2。

**记录格式。**每个数据集记录存储为换行符分隔文件(JSONL)中的单个 JSON 对象,包含规范字段 `tajik`(西里尔字母)、`persian`(波斯-阿拉伯字母)、`part_of_speech`(塔吉克语 POS 标签)和 `examples`(如有,示例句子数组)。典型记录如下:

> \{"tajik":"маъво", "persian":"ma’vā", "part\_of\_speech":"исм", "examples":\["Даргои ӯ панои оламиён ва остони ӯ маъвои али аон омад\. \-\- Равзатуcсафо"\]\}

**高层统计信息。**清洗后的数据集包含 40,112 条记录。表 1 总结了关键的语料库级统计信息和整理质量指标。表 2 报告了词性分布。与典型的词典衍生词典一样,开放类类别占主导地位。

**观察结果。**有几点值得注意:(1)**令牌覆盖率的不对称性:** 独特的波斯语形式(37,546)少于塔吉克语(40,112),反映了规范化选择以及真实的塔吉克语到波斯语的一对多对应关系。(2)**低示例密度:** 每条记录 0.52 个示例表明未来工作中应优先考虑上下文增强。(3)**POS 偏斜:** 名词和形容词占主导地位;动词和封闭类词代表不足,这可能会影响需要稳健形态覆盖率的下游系统。(4)**规范查询形式:** `_queried_word` 字段包含 1,630 个不同的规范化查找形式, enabling 表面形式评估和词素级分析。

**划分和分区。**对于实验,我们使用按 POS 分层确定的训练/开发/测试划分(80/10/10),生成时使用固定种子 `seed=42`。从测试分区中移除五个格式错误的记录后,最终评估集包含 4,011 对塔吉克语-波斯语对(用于第 6 节)。

**可复现性和发布。**所有预处理、规范化和整理脚本均版本化。发布将包括清洗后的 JSONL 文件、预处理/划分脚本以及包含精确复现命令的 README。数据集根据非商业研究的合理使用原则聚合材料,并credited所有原始来源。

以下部分描述了在 TajPersLexon 上评估的方法家族:轻量级混合模型、神经序列到序列基线、基于检索的方法以及多语言句子编码器。

## 4 方法学

我们设计并评估了多种方法家族...

相似文章

低资源Tangkhul-英语神经机器翻译

arXiv cs.CL

介绍了一个针对严重资源匮乏的Tangkhul-英语语言对的神经机器翻译系统,通过微调ByT5-large和mT5-small模型,在BLEU、chrF++、BERTScore和COMET评分上取得了优异成绩。