字符象似性与任意性:阿拉伯语NLP视角

arXiv cs.CL 论文

摘要

本文从自然语言处理(NLP)的视角研究阿拉伯语字符形式与功能之间的关系是否具有任意性,结果表明,将字符随机重新映射到缩减的rasm集合上,可以在各种NLP任务中取得具有竞争力的表现。

arXiv:2608.02935v1 公告类型:新增 摘要:阿拉伯文字使用28个字母,其中许多字母共享相同的基形(rasm),仅通过点的位置加以区分。由于早期阿拉伯语手稿在书写时没有点,但仍然可以解读,因此去除点提供了一种自然的测试方式,以检验这些视觉区分是否在功能上是必要的。已有研究表明,无点阿拉伯语在自然语言处理(NLP)中仍可保持可读性和有效性,但尚不清楚这种成功是否依赖于保留原始的rasm分组,还是任意的但一致的到同一缩减rasm集合的重映射也能取得相当的性能。我们通过将标准带点阿拉伯语和无点阿拉伯语与限制在相同19个无点rasm上的任意字符重映射进行比较来回答这个问题。我们在词级和字符级分词下生成了2,000个随机重映射,并选择了熵值最高和最低的四个代表性映射。这些表示在语言建模、文本分类、序列标注、机器翻译以及恢复原始脚本等任务上进行了评估。结果表明,无论是保留原始字符区分还是保持基于rasm的传统分组,都不是获得强大NLP性能所必需的。随机重映射在取得具有竞争力的性能的同时,降低了词汇量大小、未登录词(OOV)率、模型规模和训练成本。这些发现表明,从NLP的角度来看,阿拉伯语字符的形式-功能关系在很大程度上是任意的:模型更多地依赖稳定的分布结构,而非字母形式的视觉象似性。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:41

# 字符象似性与任意性:阿拉伯语自然语言处理视角
来源:https://arxiv.org/abs/2608.02935
查看 PDF (https://arxiv.org/pdf/2608.02935)

> 摘要:阿拉伯文字使用 28 个字母,其中许多字母共享一个共同的基底形状(rasm),仅凭点的位置加以区分。由于早期阿拉伯语手稿书写时没有点,但仍然可以解读,因此去除点提供了一种自然的测试,用以判断这些视觉区分在功能上是否必要。此前的工作表明,无点阿拉伯语在自然语言处理(NLP)中仍可保持可读性和有效性,但尚不清楚这种成功是否依赖于保留原有的 rasm 分组,还是说,任意但一致地重映射到相同的缩减后 rasm 集合也能获得相当的性能。我们通过将标准的带点阿拉伯语和无点阿拉伯语与受限于相同 19 个无点 rasm 的任意字符重映射进行比较,来回答这个问题。我们在词级和字符级分词下生成了 2,000 种随机重映射,并选取了熵值最高和最低的四种代表性映射。这些表示在语言建模、文本分类、序列标注、机器翻译以及恢复为原始文字等任务上进行了评估。结果表明,无论是保留原始字符区分,还是维持基于 rasm 的传统分组,都不是获得强大 NLP 性能所必需的。随机重映射在降低词汇量、未登录词(OOV)率、模型大小和训练成本的同时,实现了具有竞争力的性能。这些发现表明,从 NLP 的角度来看,阿拉伯语字符的形式-功能关系在很大程度上是任意的:模型更多地依赖于稳定的分布结构,而不是字母形态的视觉象似性。

## 提交历史

来自:Dorieh Alomari [查看电子邮件](https://arxiv.org/show-email/e82e3d12/2608.02935) **\[v1\]** 2026年8月3日,周一 22:47:50 UTC(3,008 KB)

相似文章

评估阿拉伯语言模型对抗鲁棒性

arXiv cs.CL

本文评估了五种阿拉伯语言模型在字符级、单词级和句子级攻击下的对抗鲁棒性,结果表明插入变音符号可使准确率降低92%,对抗训练能提升鲁棒性但存在局限性。

CAMMAR:文化感知的Matryoshka隐喻阿拉伯语表示

arXiv cs.CL

CAMMAR引入了一个表示学习框架,通过分阶段的语义课程将阿拉伯语隐喻意义组织成嵌套的词汇、文化和隐喻子空间,在一个新的跨度标注数据集上实现了强大的隐喻检测(AUC高达0.84)。