HomoEnsNER:语言对齐在古吉拉特语命名实体识别中是否优于架构复杂性?
摘要
本文提出了HomoEnsNER,一个由五个GujaratiBERT模型组成的同质集成,用于古吉拉特语命名实体识别,并表明它优于依赖架构多样性的异构替代方案,在Naamapadam测试集上取得了最先进的F1分数。
arXiv:2608.03105v1 公告类型:新
摘要:古吉拉特语的命名实体识别(NER)仍未被充分探索,主要受限于缺少大小写线索、丰富的形态学、词汇歧义和自由词序等问题。先前的集成工作强调架构多样性,通过组合异构分类器、多语言编码器或经典序列模型,而非利用语言对齐的单语预训练。本研究提出一个问题:对于像古吉拉特语这样低资源、形态丰富的语言,单一单语编码器的同质集成是否优于此类架构多样性?我们提出了HomoEnsNER,一个由五个独立微调的GujaratiBERT模型通过多数投票组合而成的同质集成,并与单个GujaratiBERT基线以及六种异构替代方案进行对比评估,包括与MuRIL-base、MuRIL-large、IndicBERT、mBERT、BiLSTM、CRF以及堆叠式BiLSTM-CRF-GujaratiBERT架构的组合。所有八个模型在一致的预算下训练,并在Naamapadam古吉拉特语测试集上使用实体级F1进行评估。HomoEnsNER取得了最高F1(0.8442),超过了基线(0.8347)以及所有异构替代方案(最低:0.7855),表明对于低资源印度语言NER,语言对齐是一种比架构复杂性更有效且更具预算意识的集成策略。
查看缓存全文
缓存时间: 2026/08/05 07:44
# HomoEnsNER:在古吉拉特语命名实体识别中,语言对齐是否优于架构复杂性? 来源:https://arxiv.org/abs/2608.03105 查看 PDF (https://arxiv.org/pdf/2608.03105) > 摘要:古吉拉特语的命名实体识别(NER)仍未被充分探索,其原因在于缺乏大小写线索、形态丰富、词汇歧义以及自由语序。以往的集成工作强调架构多样性,通过组合异构分类器、多语言编码器或经典序列模型来实现,而非利用语言对齐的单语预训练。本研究探讨:对于像古吉拉特语这样低资源、形态丰富的语言,单一单语编码器的同质集成是否优于此类架构多样性。我们提出 HomoEnsNER,一种由五个独立微调的 GujaratiBERT 模型通过多数投票组成的同质集成,并与单一 GujaratiBERT 基线以及六种异构替代方案进行对比评估,这些替代方案包括与 MuRIL-base、MuRIL-large、IndicBERT、mBERT、BiLSTM、CRF 以及堆叠的 BiLSTM-CRF-GujaratiBERT 架构的组合。所有八个模型均在一致的预算下训练,并使用 Naamapadam 古吉拉特语测试集上的实体级 F1 进行评估。HomoEnsNER 取得了最高 F1(0.8442),超过了基线(0.8347)和所有异构替代方案(最低:0.7855),表明对于低资源印度语言 NER,语言对齐是一种比架构复杂性更有效且更具预算意识的集成策略。 ## 提交历史 来自:Chandrakant Bhogayata \[查看电子邮件 (https://arxiv.org/show-email/174cfdb6/2608.03105)\] **\[v1\]** 周二,2026年8月4日 04:21:35 UTC(351 KB)
相似文章
基于BERT的模型与大型语言模型在低资源命名实体识别中的比较:以马拉地语为例
本文比较了微调后的MahaBERT模型与大型语言模型(Gemini、LLaMA-3.3-70B、Gemma)在马拉地语命名实体识别上的表现,发现专门的BERT模型显著优于这些大型语言模型,其F1分数为0.88–0.91,而后者仅为0.57–0.69。
结构引导实体解析:微调大语言模型实现复杂语言环境下的鲁棒姓名匹配
本文提出结构引导实体解析(SGER)框架,通过课程学习微调大语言模型,在语言多样化环境中实现鲁棒的人名匹配,在印度身份数据上达到99.02%准确率,并已在Dream11部署。
利用共现比较组装局部语法
本文提出了一种比较局部语法共现结果的方法,旨在优化葡萄牙语人名命名实体识别,并在 HAREM 数据集上取得了更高的 F-measure 分数。
@mayhewsw 新论文:我知道现在流行把算力规模扩大10倍,让模型一步步思考并使用工具,但……
作者发布了 Universal NER v2,这是一篇将在 LREC 2026 发表的命名实体识别论文,刻意回避了当代的“规模扩张+工具调用”潮流。
当名字不是名字:低资源大语言模型中文化纠缠的孟加拉语同形词的基准数据集与蒸馏推理
本文介绍了一个包含1,516条经专家验证的孟加拉语句子的基准数据集,用于消解文化纠缠的同形词(既是名字又是普通名词的词语)。研究表明,大语言模型存在主导意义偏见,并提出了对比思维链提示和蒸馏方法来减少这种偏见。