MiNER:针对临床文本中疟疾疾病实体识别的微调生物医学自然语言处理

arXiv cs.AI 论文

摘要

本文提出了MiNER,一个微调的BioBERT模型,用于从疟疾相关临床文本中提取生物医学实体,并发布了一个人工标注的数据集以供未来研究。

arXiv:2609.00073v1 公告类型:新 摘要:疟疾仍是全球重大健康负担,需要持续的研究努力来理解其复杂的分子机制、流行病学和潜在治疗干预措施。从海量且不断增长的疟疾文献中提取关键生物医学信息是一项具有挑战性的任务,需要创新方法。近年来,预训练语言模型彻底改变了自然语言处理任务,在各个领域展现出卓越能力。本文提出了一种微调的预训练生物医学语言模型,用于从疟疾疾病科学文献中提取生物医学信息。所提方法选择和预处理了大量疟疾相关科学文章,并对其进行具有临床意义实体的标注。然后利用BioBERT,一种先进的预训练语言模型,将文本数据编码为上下文感知表示。我们使用领域特定标注和监督学习对模型进行微调,以增强其提取相关生物医学命名实体的能力。大量实验和与不同编码及机器学习算法的比较表明,所提方法在精确度、召回率和准确度上显著优于它们。我们还发布了用于实体和关系提取的人工标注数据集,以使其他健康信息学研究人员能够训练先进的疟疾信息提取模型。
查看原文
查看缓存全文

缓存时间: 2026/09/02 05:56

# MiNER:用于临床文本疟疾病实体识别的微调生物医学自然语言处理模型  
来源:https://arxiv.org/html/2609.00073  

V\. S\. Anoop (https://orcid.org/0000-0001-6673-6932)  
隶属机构:计算机科学与工程系,Amrita计算学院  
隶属机构:Amrita Vishwa Vidyapeetham  
隶属机构:印度科拉姆  
电子邮件:[anoopvs@am\.amrita\.edu](mailto:)  

Devika N\. (https://orcid.org/0000-0000-0000-0000)  
隶属机构:数字科学学院  
隶属机构:喀拉拉数字科学、创新与技术大学  
隶属机构:印度特里凡得琅  
电子邮件:[devika\.ds21@duk\.ac\.in](mailto:)  

###### 摘要  

疟疾仍是全球重大健康负担,需要持续研究以理解其复杂的分子机制、流行病学及潜在治疗干预手段。从浩瀚且不断增长的疟疾文献中提取关键的生物医学信息是一项具有挑战性的任务,需要创新方法。近年来,预训练语言模型彻底改变了自然语言处理任务,在多个领域展现出卓越能力。本文提出一种微调后的预训练生物医学语言模型,用于从疟疾相关科学文献中提取生物医学信息。该方法首先筛选并预处理大量疟疾科学文献,然后对其中具有临床意义的实体进行标注。随后利用前沿预训练语言模型BioBERT,将文本数据编码为上下文相关的语义表示。我们通过领域特定标注和监督学习对模型进行微调,以增强其提取相关生物医学命名实体的能力。大量实验及与不同编码和机器学习算法的对比表明,所提方法在精确率、召回率和准确率上均显著优于现有方法。我们同时发布了人工标注的实体与关系抽取数据集,以支持其他健康信息学研究人员训练先进的疟疾信息抽取模型。  

*关键词* 自然语言处理⋅\cdot生物医学⋅\cdot语言模型⋅\cdot生物医学信息抽取⋅\cdot生物医学命名实体抽取⋅\cdot疟疾病  

## 1 引言  

自然语言处理(NLP)作为人工智能(AI)的子领域,使计算机系统能够像人类一样理解自然语言(包括文本和语音),并以计算方式表示和分析人类语言\[15 (https://arxiv.org/html/2609.00073#bib.bib1)\]。NLP帮助计算机理解并处理通常动态且复杂的自然语言,广泛应用于情感分析\[2 (https://arxiv.org/html/2609.00073#bib.bib11)\]\[11 (https://arxiv.org/html/2609.00073#bib.bib34)\]、机器翻译\[18 (https://arxiv.org/html/2609.00073#bib.bib13)\]、信息抽取\[19 (https://arxiv.org/html/2609.00073#bib.bib12)\]、文本分类\[4 (https://arxiv.org/html/2609.00073#bib.bib10)\]、命名实体识别\[12 (https://arxiv.org/html/2609.00073#bib.bib14)\]、问答系统、聊天机器人与虚拟助手\[16 (https://arxiv.org/html/2609.00073#bib.bib15)\]、文本摘要\[29 (https://arxiv.org/html/2609.00073#bib.bib16)\]以及文本生成\[22 (https://arxiv.org/html/2609.00073#bib.bib17)\]等任务。信息抽取旨在从网络及各类平台海量的非结构化文本中提取有意义的信息。随着对高效信息抽取需求的日益增长,该NLP子领域受到研究者广泛关注。早期的信息抽取方法依赖规则系统与统计模型,但预训练语言模型的兴起(如cite son2024ftmmr,\[31 (https://arxiv.org/html/2609.00073#bib.bib18)\]和\[1 (https://arxiv.org/html/2609.00073#bib.bib25)\])使该领域近年发生重大变革。这些具备上下文理解能力的文本理解模型,彻底改变了机器理解人类语言的方式\[32 (https://arxiv.org/html/2609.00073#bib.bib26)\]\[8 (https://arxiv.org/html/2609.00073#bib.bib27)\]\[14 (https://arxiv.org/html/2609.00073#bib.bib2)\]。  

疟疾是由疟原虫引起、通过感染蚊虫叮咬传播的致命疾病之一,持续对全球健康构成严峻威胁\[24 (https://arxiv.org/html/2609.00073#bib.bib19)\]\[30 (https://arxiv.org/html/2609.00073#bib.bib20)\]\[23 (https://arxiv.org/html/2609.00073#bib.bib21)\]。近年来,医学界通过全球范围内的多种干预措施在抗击疟疾方面取得了显著进展。然而,该疾病的复杂性要求投入大量精力整合知识,以帮助研究人员理解并制定有效的预防、诊断和治疗策略。海量疟疾文献中蕴含的科学知识具有巨大潜力,可为医疗研究者提供支持。但大量研究论文、临床试验、病例研究和流行病学报告带来了提取有价值信息的重大挑战\[21 (https://arxiv.org/html/2609.00073#bib.bib28)\]\[10 (https://arxiv.org/html/2609.00073#bib.bib29)\]。手动收集、整理和分析此类非结构化数据过程繁琐、耗时且易出错。自然语言处理领域的最新进展,尤其是预训练语言模型的开发,通过利用大规模数据集中的丰富知识,在各项任务中展现出卓越性能。BERT\[6 (https://arxiv.org/html/2609.00073#bib.bib3)\]、GPT\[7 (https://arxiv.org/html/2609.00073#bib.bib4)\]和RoBERTa\[20 (https://arxiv.org/html/2609.00073#bib.bib22)\]等模型彻底改变了自然语言处理,并已应用于生物医学研究\[5 (https://arxiv.org/html/2609.00073#bib.bib23)\]\[3 (https://arxiv.org/html/2609.00073#bib.bib24)\]等多个领域。  

本文探索利用领域特定预训练语言模型,从海量疟疾科学文献中提取生物医学信息的潜力。我们旨在加速疟疾研究进程并促进基于证据的决策,从而为全球抗击该疾病的事业做出贡献。所提方法从PubMed等生物医学文献库收集大量疟疾相关非结构化数据,并通过人工标注实体。随后使用领域特定生物医学预训练模型BioBERT获取上下文嵌入向量,以训练不同的机器学习算法。此外,本文将呈现实验与评估结果,揭示预训练语言模型在从海量非结构化文本中识别与抽取关键实体方面的有效性。本文还将探讨潜在未来方向与机遇,以提升我们所提信息抽取方法的性能与适用性,并发布标注数据集供其他健康信息学研究人员使用。本文的主要贡献可概括如下:  

- • 提出使用领域特定生物医学语言模型提取疟疾病临床实体的方法。  
- • 通过系统实验验证所提方法,并与最先进的机器学习方法进行结果比较。  
- • 发布标注数据集与代码,供其他自然语言处理研究人员与实践者训练先进的NER模型。  

后续章节结构安排如下:第2节讨论相关工作,第3节详述材料与方法,第4节详细说明所提出的生物医学命名实体识别方法,第5节呈现结果与讨论,最后在第6节讨论结论与未来方向。  

## 2 相关研究  

本节讨论自然语言处理文献中一些突出且近期的研究方法,这些方法利用预训练语言模型从文本数据中提取生物医学信息。自然语言处理的最新进展(如深度学习与大型语言模型)推动了更优上下文理解模型的发展。由于数据有限、标注困难以及生物医学概念覆盖范围广泛等因素,生物医学领域的命名实体识别被认为是最具挑战性的任务之一。近年来已有若干突出研究成果尝试应对这些挑战,其准确度各有差异\[34 (https://arxiv.org/html/2609.00073#bib.bib33)\]。  

生物医学命名实体识别方法严重依赖机器学习方法,这是一种传统方法,其特征工程过程可能相当耗时\[9 (https://arxiv.org/html/2609.00073#bib.bib30)\]。该任务的目标是准确为输入序列中的词语分配标签,作为监督序列分类问题,需要充足的标注数据。为解决多词实体识别挑战,需使用能够以BIO、IOE或IOBE等标注标准表示序列的模型。例如,单个疾病词实体标记为"S-Disease",而多词实体则标记为"B-Disease"、"I-Disease"和"E-Disease",分别表示实体的开始、内部和结束部分\[33 (https://arxiv.org/html/2609.00073#bib.bib31)\]。  

生物医学命名实体抽取的最新进展见证了深度学习技术的采用,如卷积神经网络、长短期记忆网络以及基于Transformer的前沿语言模型\[27 (https://arxiv.org/html/2609.00073#bib.bib32)\]\[21 (https://arxiv.org/html/2609.00073#bib.bib28)\]。亦有多种方法将传统深度神经网络与注意力机制相结合\[25 (https://arxiv.org/html/2609.00073#bib.bib8)\]。其中深度神经网络捕获特定词语特征并在输入句子中构建上下文理解\[25 (https://arxiv.org/html/2609.00073#bib.bib8)\]。部分架构通过迁移学习将预训练模型与长短期记忆网络相结合,其性能优于基线模型\[28 (https://arxiv.org/html/2609.00073#bib.bib9)\]。该模型整合了Bi-LSTM框架与条件随机场(CRF)层,有效建模整个输入序列内的状态依赖关系。值得注意的是,其取得了91% F1分数与98%准确率的优异性能指标\[28 (https://arxiv.org/html/2609.00073#bib.bib9)\]。  

传统命名实体识别模型严重依赖耗时的人工特征工程。而预训练嵌入则在字符和词语层面使用语义上下文感知的特征嵌入,提升了识别准确率\[26 (https://arxiv.org/html/2609.00073#bib.bib6)\]。随着深度学习技术与统计嵌入(如LSTM-CRF)的采用,该领域进一步发展,显著提升了生物医学实体识别能力\[17 (https://arxiv.org/html/2609.00073#bib.bib7)\]。尽管多任务策略在疾病实体识别中已显成效,但最新研究表明,结合BERT等模型的迁移学习与CRF可获得更优性能\[13 (https://arxiv.org/html/2609.00073#bib.bib5)\]。此外,BERT和领域特定BioBERT等Transformer模型已整合至嵌入层,在准确性和有效性上超越了以往的BiLSTM+CRF架构。这些进展凸显了利用深度学习与上下文嵌入推动生物医学命名实体识别领域发展,并在生物医学文本分析中设立新基准的演变趋势。  

近期有多项研究聚焦于针对生物医学数据优化命名实体识别模型。部分研究突显了BERT迁移学习结合条件随机场(CRF)的潜力,其性能优于传统深度学习和多任务学习方法\[13 (https://arxiv.org/html/2609.00073#bib.bib5)\]。另一些研究证实,循环神经网络(RNN)和长短期记忆网络(LSTM)等深度学习技术比基线机器学习模型取得更好结果\[26 (https://arxiv.org/html/2609.00073#bib.bib6)\]。然而,这些方法最初因长程依赖问题难以捕获长文本序列中的相关信息。为克服这些挑战,利用预训练模型至关重要。这些在特定领域训练的模型擅长捕获与其训练领域相关的上下文信息\[14 (https://arxiv.org/html/2609.00073#bib.bib2)\]。尽管存在通用领域模型,但专门针对生物医学文本的预训练模型仍有限。BioBERT作为在海量生物医学语料上预训练的领域特定语言模型,在生物医学NER、问答和关系抽取等多类文本挖掘任务中均展现出显著改进\[17 (https://arxiv.org/html/2609.00073#bib.bib7)\]。所提方法利用了BioBERT这一生物医学预训练模型的能力,并对其微调以识别疟疾相关命名实体。  

参见标题图1:所提命名实体识别模型示意图  

## 3 材料与方法  

生物医学领域的命名实体识别是一项关键任务,面临诸多挑战。早期NER方法使用各种基线浅层机器学习模型对命名实体进行分类,但这些模型有时难以处理复杂和多词实体。深度学习方法所需特征工程较少,潜力巨大。该任务在通用领域有许多可用数据集,但领域特定数据集较少。因此,领域特定任务的标注数据非常有限。尽管PubMed等数据库包含大量信息,但提取并手动标注这些数据十分困难,因其涵盖广泛概念,且标注需要生物医学概念的专业知识。本节列举并讨论用于实现所提方法的部分材料与方法。  

### 3.1 Label Studio  

Label Studio(可访问https://labelstud.io/)是一款免费数据标注工具,支持文本、图像、音频和视频等多类数据的标注。它提供直观界面以创建和组织标注任务,允许用户建立标注结构、邀请贡献者并监控标注进度。数据标注是机器学习中关键且具挑战性的步骤。

相似文章

针对免疫介导疾病的专科医学语言模型

arXiv cs.CL

本文提出了一种针对免疫介导和感染性疾病的专科医学语言模型,用于从临床叙述中提取信息。该模型采用BiLSTM-CNN-Char架构,在371份病例报告的精标语料库上训练,F1得分达到0.89。