使用ISO语言标记框架和TEI Lex-0分析并编码Al-Mawrid阿拉伯语-英语词典

arXiv cs.CL 论文

摘要

本文介绍了一种使用ISO LMF和TEI Lex-0标准对Al-Mawrid阿拉伯语-英语词典进行数字化的方法,实现了高解析准确率和精确度,填补了阿拉伯语词汇基础设施的空白。

arXiv:2606.18205v1 Announce Type: new Abstract: 本文提出了一种鲁棒的方法论,用于系统性地数字化和编码Al-Mawrid阿拉伯语-英语词典,将其从传统的印刷资源转化为标准化的计算词汇库。针对阿拉伯语词汇基础设施的重大空白,研究采用双标准框架,将ISO词汇标记框架(LMF)与文本编码倡议TEI Lex-0指南相结合。通过对词典宏观和微观结构进行编辑视角的审视,研究解决了20世纪双语词典典型的结构歧义和标点不一致问题。该方法论基于对词典词汇知识密度的实证分析。利用代表性样本(字母'Ayn',占总卷数的4.6%),研究为编码过程提供了科学依据,展示了91%的结构解析准确率。信息抽取规则的定量评估显示出高性能:同义词的精确率为85%,召回率为98%,其他形态语义特征的精确率为88%。除了技术描述,本文还与现有阿拉伯语词汇资源进行了批判性比较,并讨论了TEI Lex-0在建模特定阿拉伯语现象(如隐式“开放集”语义关系和分散的形态线索)时的局限性。此外,研究通过建立可扩展的基于前缀的引用系统,探索了语言关联开放数据(LLOD)集成的潜力,该引用系统有助于资源纳入语义网。最终成果是一个可互操作、机器可处理的资源,为阿拉伯语自然语言处理和数字人文社区内复杂遗留双语词典的逆向数字化提供了可复现的工作流程。
查看原文
查看缓存全文

缓存时间: 2026/06/17 05:42

# 使用 ISO 语言标记框架与 TEI Lex-0 分析并编码《Al-Mawrid 阿拉伯语-英语词典》
来源:https://arxiv.org/abs/2606.18205
查看 PDF (https://arxiv.org/pdf/2606.18205)

> 摘要:本文提出了一种稳健的方法论,用于系统化地将《Al-Mawrid 阿拉伯语-英语词典》从传统印刷资源数字化并编码为标准化计算词典。为解决阿拉伯语词汇基础设施中的重大空白,本研究采用双标准框架,将 ISO 词汇标记框架(LMF)与文本编码倡议的 TEI Lex-0 指南相结合。通过从编辑视角审视该词典的宏观与微观结构,研究解决了 20 世纪双语词典中常见的结构歧义与标点符号不一致问题。该方法论基于对词典词汇知识密度的实证分析。以代表性样本(字母 Ayn,占总篇幅的 4.6%)为基础,本研究为编码过程提供了科学依据,展示了 91% 的结构解析准确率。信息提取规则的定量评估显示出高性能:同义词提取的精确率为 85%,召回率为 98%;其他形态语义特征的精确率为 88%。除技术描述外,本文还与现有阿拉伯语词汇资源进行了关键比较,并讨论了 TEI Lex-0 在建模特定阿拉伯语现象(如隐式“开放集”语义关系和分散的形态线索)时的局限性。此外,研究探索了与语言关联开放数据(LLOD)集成的潜力,通过建立可扩展的基于前缀的引用系统,促进该资源纳入语义网。最终成果是一个可互操作、机器可处理的资源,为阿拉伯语自然语言处理和数字人文社区中复杂传统双语词典的逆向数字化提供了可复现的工作流程。

## 提交历史

来自:Diaa Fayed \[查看电子邮件 (https://arxiv.org/show-email/e2f61111/2606.18205)\] **\[v1\]** 2026 年 6 月 16 日(星期二)17:35:11 UTC(1,089 KB)

相似文章