标签
本文介绍了uOttawa团队在EvaLatin 2026古典拉丁语命名实体识别共享任务中使用的系统,通过商业LLM(Gemini 2.5 Pro和Claude Sonnet 4-5)的提示工程,在粗粒度和细粒度NER子任务中均获得第一名。
本文提出了HomoEnsNER,一个由五个GujaratiBERT模型组成的同质集成,用于古吉拉特语命名实体识别,并表明它优于依赖架构多样性的异构替代方案,在Naamapadam测试集上取得了最先进的F1分数。
DiffImaginE是一篇研究论文,提出了一种基于扩散的多模态命名实体识别验证器,用条件潜扩散推理取代确定性想象,以实现更稳健的实体类型验证。
介绍DE-NER,一种用于零样本命名实体识别的对话引导框架,通过提问者和角色扮演LLM之间的自我对弈来明确实体边界,相比基线平均提高了3.75%的F1值。
LA-RL 提出了一种标签感知的自我反思框架,用于信息抽取中的强化学习,在命名实体识别、关系抽取和事件抽取任务上取得了持续改进,在分布外基准上 F1 提升高达 20。
本文比较了微调后的MahaBERT模型与大型语言模型(Gemini、LLaMA-3.3-70B、Gemma)在马拉地语命名实体识别上的表现,发现专门的BERT模型显著优于这些大型语言模型,其F1分数为0.88–0.91,而后者仅为0.57–0.69。
提出FSE,一种基于快慢专家(Fast-Slow Experts)的跨度NER模型用于持续学习,在CLNER基准上达到最先进性能。
本文介绍了ARI,一个利用检索增强型大语言模型修复历史文档中难以辨认部分的框架,通过将隐式的大语言模型知识与显式检索的外部历史背景相结合,显著提升了命名实体的修复效果。
本文评估了三种NLP方法(命名实体识别、关键词提取、主题建模)在自动化提取众包集合关键词中的应用,以Their Finest Hour Online Archive(牛津大学托管的二战众包数字馆藏)为案例研究。研究发现,像开放权重模型这样的提取式模型更适合负责任地部署,而生成式AI则带来问责风险。
本文提出LC-ICL,一种新颖的少样本技术,它同时使用正确和错误的示例以及错误原因标签,以提升大型语言模型在信息抽取任务(如命名实体识别和关系抽取)上的性能。
本文系统研究了如何将时间元数据结构性地嵌入到面向历史文本的命名实体识别(NER)模型中。通过采用早期或晚期融合机制注入绝对和相对时间表示的实验表明,晚期融合策略在法语和德语历史数据集上展现出更稳健的性能。
本文介绍了HIPE-2026的结果,这是HIPE评测系列的第三版,专注于从法语、德语和英语的多语言历史文档中提取基于时间的人物-地点关系。对17个参赛团队在预测准确性、计算效率和跨领域泛化能力方面进行了评估。
AAbAAC是一个手动标注的语料库,包含115篇PubMed摘要,用于自身免疫信息提取,重点关注自身免疫疾病和自身抗体等实体。研究表明,在该语料库上进行微调后,命名实体识别(NER)性能有所提升。
本文研究了使用 LoRA 和 NEFTune 对 DeepSeek-R1-8B 进行指令微调用于金融命名实体识别,取得了 0.912 的微平均 F1 值,并优于多个基线模型。
SMADE-IE 是一个面向零样本信息抽取的稀疏多智能体框架,通过自适应模式选择器与基于 Toulmin 论证风格和贝叶斯更新的证据驱动辩论机制,在 NER、RE 和 JERE 任务的 9 个基准测试上超越现有基线,同时提升了 token 使用效率。
本文介绍了ChristBERT,一个基于RoBERTa的面向德国临床NLP的领域特定语言模型家族,并在医学命名实体识别和文本分类任务上评估了三种领域适应策略(继续预训练、从头预训练和词汇适应),取得了最先进的结果。
本文介绍了BioConCal,一种监督评分器,它利用推理时的面板和候选特征对LLM面板浮现的生物医学实体候选进行排序,在策展人筛选方面显著优于原始一致性。
本文提出了一种针对免疫介导和感染性疾病的专科医学语言模型,用于从临床叙述中提取信息。该模型采用BiLSTM-CNN-Char架构,在371份病例报告的精标语料库上训练,F1得分达到0.89。
LELA是一个基于LLM的实体链接框架,将零样本命名实体识别和实体消解整合为端到端的Python库,并在多种场景下验证了其有效性。
介绍了ReDose数据集,该数据集包含6,435条Reddit帖子,标注了药物、剂量和效果实体,并评估了包括BiomedBERT、Llama-3 70B和GPT-4在内的多种模型的提取性能。