字符象似性与任意性:阿拉伯语NLP视角
摘要
本文从自然语言处理(NLP)的视角研究阿拉伯语字符形式与功能之间的关系是否具有任意性,结果表明,将字符随机重新映射到缩减的rasm集合上,可以在各种NLP任务中取得具有竞争力的表现。
arXiv:2608.02935v1 公告类型:新增
摘要:阿拉伯文字使用28个字母,其中许多字母共享相同的基形(rasm),仅通过点的位置加以区分。由于早期阿拉伯语手稿在书写时没有点,但仍然可以解读,因此去除点提供了一种自然的测试方式,以检验这些视觉区分是否在功能上是必要的。已有研究表明,无点阿拉伯语在自然语言处理(NLP)中仍可保持可读性和有效性,但尚不清楚这种成功是否依赖于保留原始的rasm分组,还是任意的但一致的到同一缩减rasm集合的重映射也能取得相当的性能。我们通过将标准带点阿拉伯语和无点阿拉伯语与限制在相同19个无点rasm上的任意字符重映射进行比较来回答这个问题。我们在词级和字符级分词下生成了2,000个随机重映射,并选择了熵值最高和最低的四个代表性映射。这些表示在语言建模、文本分类、序列标注、机器翻译以及恢复原始脚本等任务上进行了评估。结果表明,无论是保留原始字符区分还是保持基于rasm的传统分组,都不是获得强大NLP性能所必需的。随机重映射在取得具有竞争力的性能的同时,降低了词汇量大小、未登录词(OOV)率、模型规模和训练成本。这些发现表明,从NLP的角度来看,阿拉伯语字符的形式-功能关系在很大程度上是任意的:模型更多地依赖稳定的分布结构,而非字母形式的视觉象似性。
查看缓存全文
缓存时间: 2026/08/05 07:41
# 字符象似性与任意性:阿拉伯语自然语言处理视角 来源:https://arxiv.org/abs/2608.02935 查看 PDF (https://arxiv.org/pdf/2608.02935) > 摘要:阿拉伯文字使用 28 个字母,其中许多字母共享一个共同的基底形状(rasm),仅凭点的位置加以区分。由于早期阿拉伯语手稿书写时没有点,但仍然可以解读,因此去除点提供了一种自然的测试,用以判断这些视觉区分在功能上是否必要。此前的工作表明,无点阿拉伯语在自然语言处理(NLP)中仍可保持可读性和有效性,但尚不清楚这种成功是否依赖于保留原有的 rasm 分组,还是说,任意但一致地重映射到相同的缩减后 rasm 集合也能获得相当的性能。我们通过将标准的带点阿拉伯语和无点阿拉伯语与受限于相同 19 个无点 rasm 的任意字符重映射进行比较,来回答这个问题。我们在词级和字符级分词下生成了 2,000 种随机重映射,并选取了熵值最高和最低的四种代表性映射。这些表示在语言建模、文本分类、序列标注、机器翻译以及恢复为原始文字等任务上进行了评估。结果表明,无论是保留原始字符区分,还是维持基于 rasm 的传统分组,都不是获得强大 NLP 性能所必需的。随机重映射在降低词汇量、未登录词(OOV)率、模型大小和训练成本的同时,实现了具有竞争力的性能。这些发现表明,从 NLP 的角度来看,阿拉伯语字符的形式-功能关系在很大程度上是任意的:模型更多地依赖于稳定的分布结构,而不是字母形态的视觉象似性。 ## 提交历史 来自:Dorieh Alomari [查看电子邮件](https://arxiv.org/show-email/e82e3d12/2608.02935) **\[v1\]** 2026年8月3日,周一 22:47:50 UTC(3,008 KB)
相似文章
无意义之虚妄:古典阿拉伯语中任意符号的结构不可能性
本文对古典阿拉伯语形态学进行数学建模,以反驳索绪尔的任意符号论和后现代语义不确定性,证明阿拉伯语词汇意义通过词根-词式配对在结构上被决定,并显示其与印欧语言相比存在系统复杂度不对称性。
评估阿拉伯语言模型对抗鲁棒性
本文评估了五种阿拉伯语言模型在字符级、单词级和句子级攻击下的对抗鲁棒性,结果表明插入变音符号可使准确率降低92%,对抗训练能提升鲁棒性但存在局限性。
方言能否像语言一样被引导?阿拉伯语大语言模型中的稀疏神经元与分布式方向
本文研究了通过识别稀疏神经元群体和提取方言激活方向来引导阿拉伯语大语言模型生成特定方言的方法,从而在不进行微调的情况下实现推理时的方言控制。
CAMMAR:文化感知的Matryoshka隐喻阿拉伯语表示
CAMMAR引入了一个表示学习框架,通过分阶段的语义课程将阿拉伯语隐喻意义组织成嵌套的词汇、文化和隐喻子空间,在一个新的跨度标注数据集上实现了强大的隐喻检测(AUC高达0.84)。
从零构建阿拉伯语NLP:二十年的经验、失败与未解难题
全面回顾二十年阿拉伯语NLP研究,探讨该领域的经验、失败与未解难题。