通过WordNet自动对阿英词典词义进行词性标注
摘要
本文提出了一种资源轻量级算法,通过消歧后从英语WordNet转移词性标签,自动为Al-Mawrid阿英双语词典中的词义分配词性标签,以极低成本实现了高准确率。
arXiv:2606.24359v1 Announce Type: new
Abstract: 本文提出了一种对双语词典词义进行词性(POS)标注的算法。该算法应用于Al-Mawrid阿英词典。标注任务通过消歧过程后,将英语翻译等价词(TEs)的词性标签转移至词典词义来完成。词义的英语词性标签来自Princeton WordNet。对双语词典词义进行词性标注是将双语词典链接到WordNet和/或将该词典标准化为WordNet-LMF格式的前提条件,该格式以同义词集(synset)而非单词为基本单元。虽然成本很低,但所记录的准确率很高。构建NLP/HLT工具需要语言学专家、大量投资和长时间。对于统计方法,我们需要大规模标注语料库;对于基于规则的方法,我们需要包含丰富语言和世界知识的大型词典。这促使了所谓的资源轻量级方法的出现,用于开发资源匮乏语言的自然语言处理(NLP)工具。
查看缓存全文
缓存时间: 2026/06/24 07:46
# 通过WordNet自动标注阿拉伯语-英语词典词义词性 来源:https://arxiv.org/abs/2606.24359 查看PDF (https://arxiv.org/pdf/2606.24359) > 摘要:本文提出了一种对双语词典词义进行词性(POS)标注的算法。该算法应用于Al-Mawrid阿拉伯语-英语词典。标注任务通过在消歧后将英语翻译等价词(TE)的词性标签转移至词典词义来完成。词义的英语词性标签来自Princeton WordNet。对双语词典词义进行词性标注是将双语词典链接到WordNet和/或将其标准化为WordNet-LMF格式(其中同义词集而非单词为基本单元)的前提条件。尽管成本低廉,但准确率较高。构建NLP/HLT工具需要语言学专家、大量投资和长时间。对于统计方法,我们需要大规模标注语料库;对于基于规则的方法,我们需要包含丰富语言知识和世界知识的大型词典。这促使了所谓“资源轻量”方法的出现,以开发适用于资源匮乏语言的自然语言处理(NLP)工具。 ## 提交历史 来自:Diaa Fayed [查看邮件 (https://arxiv.org/show-email/94f85ae8/2606.24359)] **\[v1\]** 周二,2026年6月23日 09:49:26 UTC (629 KB)
相似文章
利用信息抽取从阿拉伯语-英语机器可读词典中提取知识
本文提出了一种方法,利用n元语法分析、关键词上下文分析和基于规则的信息抽取,从阿拉伯语-英语的Al-Mawrid词典中自动提取词汇知识。
使用解析表达文法构建阿拉伯语-英语机器可读词典
本文提出了一种方法,利用解析表达文法对阿拉伯语-英语Al-Mawrid词典进行结构化处理,将词条转换为适用于自然语言处理应用的层次结构。
TTLab 在 AlexandriaX-2026:一个用于阿拉伯语机器翻译错误片段检测与分类的微调表层标签器
TTLab 展示了一个用于阿拉伯语机器翻译错误片段检测与分类的微调表层标签器,使用 MARBERTv2 在 AlexandriaX-2026 共享任务中获得了第三名。
使用ISO语言标记框架和TEI Lex-0分析并编码Al-Mawrid阿拉伯语-英语词典
本文介绍了一种使用ISO LMF和TEI Lex-0标准对Al-Mawrid阿拉伯语-英语词典进行数字化的方法,实现了高解析准确率和精确度,填补了阿拉伯语词汇基础设施的空白。
STAGEET:用于语法纠错的分阶段类型化编辑标注框架——以阿拉伯语为案例研究
本文提出STAGEET,一个面向语法纠错的分阶段类型化编辑标注框架,通过增强可解释性并在阿拉伯语基准测试中取得最先进性能。