利用信息抽取从阿拉伯语-英语机器可读词典中提取知识

arXiv cs.CL 论文

摘要

本文提出了一种方法,利用n元语法分析、关键词上下文分析和基于规则的信息抽取,从阿拉伯语-英语的Al-Mawrid词典中自动提取词汇知识。

arXiv:2606.28457v1 Announce Type: new 摘要:自然语言处理(NLP)应用需要大量且丰富的语言知识。此外,电子语言资源如词典、百科全书和语料库已经可用。因此,出现了自动方法从这些资源中提取词汇信息,以克服知识获取瓶颈。我们提出了一种方法,从阿拉伯语-英语Al-Mawrid词典的机器可读版本中自动提取词汇信息。我们使用了n元语法分析和关键词上下文(KWIC)分析来发现体现形态、句法或语义信息的词汇模式。然后,我们使用手工制作的基于规则的信息抽取来提取这些信息。此外,我们利用标点符号和一些启发式方法提取子词条中的一组同义词。本研究在所有类型的信息上均获得了高精度,同义词的召回率高,而其他信息的召回率低。研究还表明,Al-Mawrid包含大量的派生词(形态信息)、同义词、领域标签以及上下位关系(语义信息)。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:26

# 利用信息抽取技术从阿拉伯语-英语机器可读词典中提取知识
来源:https://arxiv.org/abs/2606.28457
查看PDF(https://arxiv.org/pdf/2606.28457)

> 摘要:自然语言处理(NLP)应用需要大量丰富的语言知识。此外,电子语言资源(如词典、百科全书和语料库)已变得可用。因此,涌现出自动方法从这些资源中提取词汇信息,以克服知识获取瓶颈。我们提出了一种从阿拉伯语-英语Al-Mawrid词典的机器可读版本中自动提取词汇信息的方法。我们使用n-gram分析和关键词上下文(KWIC)分析来发现体现形态、句法或语义信息的词汇模式。然后,利用手工制定的基于规则的信息抽取技术提取这些信息。此外,我们利用标点符号和一些启发式规则来提取子词条中的同义词集。本研究在所有类型的信息上取得了高精确率,同义词的召回率高,其他信息的召回率较低。研究还表明,Al-Mawrid词典包含大量的派生词(形态信息)、同义词、领域标签以及下义词/上义词关系(语义信息)。

## 提交历史

来自:Diaa M. Fayed [查看邮件](https://arxiv.org/show-email/a7445f88/2606.28457) **\[v1\]** 2026年6月26日星期五 11:52:27 UTC(735 KB)

相似文章

让数据说话:利用AI从众包集合中提取关键词

arXiv cs.CL

本文评估了三种NLP方法(命名实体识别、关键词提取、主题建模)在自动化提取众包集合关键词中的应用,以Their Finest Hour Online Archive(牛津大学托管的二战众包数字馆藏)为案例研究。研究发现,像开放权重模型这样的提取式模型更适合负责任地部署,而生成式AI则带来问责风险。