HomoEnsNER:语言对齐在古吉拉特语命名实体识别中是否优于架构复杂性?

arXiv cs.CL 论文

摘要

本文提出了HomoEnsNER,一个由五个GujaratiBERT模型组成的同质集成,用于古吉拉特语命名实体识别,并表明它优于依赖架构多样性的异构替代方案,在Naamapadam测试集上取得了最先进的F1分数。

arXiv:2608.03105v1 公告类型:新 摘要:古吉拉特语的命名实体识别(NER)仍未被充分探索,主要受限于缺少大小写线索、丰富的形态学、词汇歧义和自由词序等问题。先前的集成工作强调架构多样性,通过组合异构分类器、多语言编码器或经典序列模型,而非利用语言对齐的单语预训练。本研究提出一个问题:对于像古吉拉特语这样低资源、形态丰富的语言,单一单语编码器的同质集成是否优于此类架构多样性?我们提出了HomoEnsNER,一个由五个独立微调的GujaratiBERT模型通过多数投票组合而成的同质集成,并与单个GujaratiBERT基线以及六种异构替代方案进行对比评估,包括与MuRIL-base、MuRIL-large、IndicBERT、mBERT、BiLSTM、CRF以及堆叠式BiLSTM-CRF-GujaratiBERT架构的组合。所有八个模型在一致的预算下训练,并在Naamapadam古吉拉特语测试集上使用实体级F1进行评估。HomoEnsNER取得了最高F1(0.8442),超过了基线(0.8347)以及所有异构替代方案(最低:0.7855),表明对于低资源印度语言NER,语言对齐是一种比架构复杂性更有效且更具预算意识的集成策略。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:44

# HomoEnsNER:在古吉拉特语命名实体识别中,语言对齐是否优于架构复杂性?
来源:https://arxiv.org/abs/2608.03105
查看 PDF (https://arxiv.org/pdf/2608.03105)

> 摘要:古吉拉特语的命名实体识别(NER)仍未被充分探索,其原因在于缺乏大小写线索、形态丰富、词汇歧义以及自由语序。以往的集成工作强调架构多样性,通过组合异构分类器、多语言编码器或经典序列模型来实现,而非利用语言对齐的单语预训练。本研究探讨:对于像古吉拉特语这样低资源、形态丰富的语言,单一单语编码器的同质集成是否优于此类架构多样性。我们提出 HomoEnsNER,一种由五个独立微调的 GujaratiBERT 模型通过多数投票组成的同质集成,并与单一 GujaratiBERT 基线以及六种异构替代方案进行对比评估,这些替代方案包括与 MuRIL-base、MuRIL-large、IndicBERT、mBERT、BiLSTM、CRF 以及堆叠的 BiLSTM-CRF-GujaratiBERT 架构的组合。所有八个模型均在一致的预算下训练,并使用 Naamapadam 古吉拉特语测试集上的实体级 F1 进行评估。HomoEnsNER 取得了最高 F1(0.8442),超过了基线(0.8347)和所有异构替代方案(最低:0.7855),表明对于低资源印度语言 NER,语言对齐是一种比架构复杂性更有效且更具预算意识的集成策略。

## 提交历史

来自:Chandrakant Bhogayata \[查看电子邮件 (https://arxiv.org/show-email/174cfdb6/2608.03105)\] **\[v1\]** 周二,2026年8月4日 04:21:35 UTC(351 KB)

相似文章

利用共现比较组装局部语法

arXiv cs.CL

本文提出了一种比较局部语法共现结果的方法,旨在优化葡萄牙语人名命名实体识别,并在 HAREM 数据集上取得了更高的 F-measure 分数。