利用信息抽取从阿拉伯语-英语机器可读词典中提取知识
摘要
本文提出了一种方法,利用n元语法分析、关键词上下文分析和基于规则的信息抽取,从阿拉伯语-英语的Al-Mawrid词典中自动提取词汇知识。
arXiv:2606.28457v1 Announce Type: new
摘要:自然语言处理(NLP)应用需要大量且丰富的语言知识。此外,电子语言资源如词典、百科全书和语料库已经可用。因此,出现了自动方法从这些资源中提取词汇信息,以克服知识获取瓶颈。我们提出了一种方法,从阿拉伯语-英语Al-Mawrid词典的机器可读版本中自动提取词汇信息。我们使用了n元语法分析和关键词上下文(KWIC)分析来发现体现形态、句法或语义信息的词汇模式。然后,我们使用手工制作的基于规则的信息抽取来提取这些信息。此外,我们利用标点符号和一些启发式方法提取子词条中的一组同义词。本研究在所有类型的信息上均获得了高精度,同义词的召回率高,而其他信息的召回率低。研究还表明,Al-Mawrid包含大量的派生词(形态信息)、同义词、领域标签以及上下位关系(语义信息)。
查看缓存全文
缓存时间: 2026/06/30 05:26
# 利用信息抽取技术从阿拉伯语-英语机器可读词典中提取知识 来源:https://arxiv.org/abs/2606.28457 查看PDF(https://arxiv.org/pdf/2606.28457) > 摘要:自然语言处理(NLP)应用需要大量丰富的语言知识。此外,电子语言资源(如词典、百科全书和语料库)已变得可用。因此,涌现出自动方法从这些资源中提取词汇信息,以克服知识获取瓶颈。我们提出了一种从阿拉伯语-英语Al-Mawrid词典的机器可读版本中自动提取词汇信息的方法。我们使用n-gram分析和关键词上下文(KWIC)分析来发现体现形态、句法或语义信息的词汇模式。然后,利用手工制定的基于规则的信息抽取技术提取这些信息。此外,我们利用标点符号和一些启发式规则来提取子词条中的同义词集。本研究在所有类型的信息上取得了高精确率,同义词的召回率高,其他信息的召回率较低。研究还表明,Al-Mawrid词典包含大量的派生词(形态信息)、同义词、领域标签以及下义词/上义词关系(语义信息)。 ## 提交历史 来自:Diaa M. Fayed [查看邮件](https://arxiv.org/show-email/a7445f88/2606.28457) **\[v1\]** 2026年6月26日星期五 11:52:27 UTC(735 KB)
相似文章
使用解析表达文法构建阿拉伯语-英语机器可读词典
本文提出了一种方法,利用解析表达文法对阿拉伯语-英语Al-Mawrid词典进行结构化处理,将词条转换为适用于自然语言处理应用的层次结构。
使用ISO语言标记框架和TEI Lex-0分析并编码Al-Mawrid阿拉伯语-英语词典
本文介绍了一种使用ISO LMF和TEI Lex-0标准对Al-Mawrid阿拉伯语-英语词典进行数字化的方法,实现了高解析准确率和精确度,填补了阿拉伯语词汇基础设施的空白。
通过WordNet自动对阿英词典词义进行词性标注
本文提出了一种资源轻量级算法,通过消歧后从英语WordNet转移词性标签,自动为Al-Mawrid阿英双语词典中的词义分配词性标签,以极低成本实现了高准确率。
让数据说话:利用AI从众包集合中提取关键词
本文评估了三种NLP方法(命名实体识别、关键词提取、主题建模)在自动化提取众包集合关键词中的应用,以Their Finest Hour Online Archive(牛津大学托管的二战众包数字馆藏)为案例研究。研究发现,像开放权重模型这样的提取式模型更适合负责任地部署,而生成式AI则带来问责风险。
从零构建阿拉伯语NLP:二十年的经验、失败与未解难题
全面回顾二十年阿拉伯语NLP研究,探讨该领域的经验、失败与未解难题。