AAbAAC:自身免疫信息提取的标注语料库
摘要
AAbAAC是一个手动标注的语料库,包含115篇PubMed摘要,用于自身免疫信息提取,重点关注自身免疫疾病和自身抗体等实体。研究表明,在该语料库上进行微调后,命名实体识别(NER)性能有所提升。
arXiv:2606.13051v1 公告类型:新
摘要:尽管深度学习和大型语言模型推动了信息提取的进步,但在高度专业化的生物医学领域,性能差距依然存在,这些领域的领域复杂性对通用模型构成了挑战。本研究聚焦于自身免疫领域,其中主要关注的实体包括自身免疫疾病、自身抗体(即可能标志或引起这些疾病的分子)、它们的分子靶标、在体内的位置以及相关的临床体征。在此,我们介绍AAbAAC(AutoAntibodies and Autoimmunity Annotated Corpus),一个从PubMed选取的115篇摘要的语料库,我们对其中实体的关系进行了手动标注。首先,AAbAAC用于评估命名实体识别(NER)任务的几种方法,其次,用于微调NER模型。我们的研究展示了AAbAAC在自身免疫领域信息提取中的实用性,显示微调后NER性能的预期提升。这说明了针对专业领域的小规模标注工作的价值,并为自身免疫的计算研究做出了贡献。AAbAAC语料库可在 https://github.com/f-maury/AAbAAC 获取。
查看缓存全文
缓存时间: 2026/06/12 08:55
# AAbAAC:用于自身免疫信息抽取的标注语料库 来源:https://arxiv.org/html/2606.13051 Fabien Maury¹,², Solène Grosdidier³, Maud de Dieuleveult¹,\*, Adrien Coulet²,\* 1Inserm, Université Paris Cité, U1163 Institut Imagine, Paris, France 2Inria, Inserm, Université Paris Cité, U1346 HeKA, Paris, France 3Freelance researcher, The Hague, Netherlands \*这些作者贡献相同,通讯作者:fabien\.maury@inserm\.fr ###### 摘要 尽管深度学习和大语言模型推动了信息抽取的发展,但在高度专业化的生物医学领域,通用模型仍面临性能差距,因为该领域的复杂性带来了挑战。本研究聚焦于自身免疫领域,其中主要的关注实体包括自身免疫性疾病、自身抗体(即可能标志或导致这些疾病的分子)、其分子靶点、在体内的位置以及相关的临床症状。本文介绍了AAbAAC(AutoAntibodies and Autoimmunity Annotated Corpus,自身抗体与自身免疫标注语料库),这是一个从PubMed中选取的115篇摘要的语料库,我们对其中实体及其关系进行了人工标注。首先,AAbAAC被用于评估多种方法在命名实体识别(NER)任务上的表现;其次,用于微调NER模型。我们的研究展示了AAbAAC在自身免疫领域信息抽取中的效用,并表明微调后NER性能有预期提升。这体现了为专业领域进行小规模标注工作的价值,并有助于自身免疫的计算研究。AAbAAC语料库可在以下地址获取:https://github.com/f-maury/AAbAAC。 ## 1 引言 自身免疫性疾病源于适应性免疫系统功能障碍,此时自身抗体(即针对自身物质的抗体)靶向自身分子。这些抗体通常可在血液或脑脊液中检测到,并广泛用作自身免疫性疾病的生物标志物,在鉴别诊断中起关键作用。自身免疫性疾病总体上影响全球约3–5%的人口(Ahsan, 2023 (https://arxiv.org/html/2606.13051#bib.bib1);Shapira等, 2010 (https://arxiv.org/html/2606.13051#bib.bib18))。然而,单独来看,许多此类疾病属于罕见病(Hayter and Cook, 2012 (https://arxiv.org/html/2606.13051#bib.bib8))。部分由于这些疾病的罕见性,目前没有单一的集中资源包含所有自身免疫的相关信息。实际上,相关的领域知识分散在各种来源中,包括许多近期研究论文。因此,信息抽取是一种研究自身免疫性疾病的有效途径,它通过自动化处理大量文档,将其转化为结构化、可互操作且机器可读的知识库。 近来,基于BERT的模型在信息抽取任务中持续取得最先进性能,特别是在针对目标领域文档进行微调后。虽然存在许多领域特定模型,但在许多情况下,将通用模型适配到高度专业化或小众领域所需的高质量标注数据仍然缺乏。据我们所知,在人类自身免疫领域,目前尚无专门针对自身免疫性疾病和自身抗体的手工标注语料库,用于评估或微调识别自身抗体、自身免疫性疾病及其关系的模型。为填补这一空白,我们提出了AAbAAC,一个对与自身免疫相关的实体和关系进行标注的PubMed摘要语料库,并展示了其在命名实体识别(NER)中的价值。 第2节回顾相关工作。第3节描述了创建语料库的方法,第4节介绍最终的语料库。第5节介绍了使用AAbAAC进行命名实体识别(NER)的实验设置,第6节报告相关结果。最后,论文总结了该新语料库所支持的未来工作展望。 ## 2 相关工作 ### 2.1 现有的自身免疫资源 一些通用且广泛使用的知识库和资源服务于广泛的生物医学用途,例如人类表型本体(HPO)(Gargano等, 2024 (https://arxiv.org/html/2606.13051#bib.bib6))、Orphanet (Rath等, 2012 (https://arxiv.org/html/2606.13051#bib.bib15))或UMLS (Bodenreider, 2004 (https://arxiv.org/html/2606.13051#bib.bib2))。这些资源包含了自身免疫性疾病和自身抗体的信息,但对于现实世界的研究来说,它们不够详尽、细致或及时。实际上,自身免疫是一个专门且不断发展的话题,并非通用资源的重点。不过,它们仍可用于生成初始的自身抗体名称列表,进而用于信息抽取。 还有更专门的资源被开发出来,包含抗体、自身抗体或相关元素的信息。例如,IEDB (Vita等, 2025 (https://arxiv.org/html/2606.13051#bib.bib22))是一个关于表位(即抗体结合的抗原区域)的数据库,以及AAgAtlas (Wang等, 2017 (https://arxiv.org/html/2606.13051#bib.bib24)),它专注于自身抗原。这些资源各自关注与自身免疫研究相关的主题,但没有一个能汇集临床医生或研究人员所需的自身免疫领域所有相关知识。然而,出于信息抽取的目的,这些资源可用于从抗原名称中构建自身抗体名称列表。 一些用于生物医学信息抽取的标注文本语料库已经存在,但据我们所知,没有一个专门针对人类自身免疫和自身免疫性疾病。例如,MedMentions语料库 (Mohan and Li, 2019 (https://arxiv.org/html/2606.13051#bib.bib12))以通用方式处理生物医学领域,标注了大多数语义类型的UMLS术语。因此,它可能包含最常见的自身免疫性疾病和自身抗体,但不包含那些不对应UMLS术语的罕见情况,也不包含实体之间的关系。ABAG语料库 (Dinh等, 2022 (https://arxiv.org/html/2606.13051#bib.bib4))专注于抗体和抗原,但并非专门针对自身免疫,也不提供实体间关系的标注。因此,现有资源对于自身免疫相关的信息抽取用途有限,因为从这些资源中分离出专门针对自身免疫的标注将具有挑战性,且会导致自身免疫相关概念的覆盖范围有限。 ### 2.2 自身免疫领域的NER 许多工作使用词典和基于规则的方法进行NER,并取得了不错的性能。这类词典可以从本体或数据库中构建。例如,Remaki等人(2025 (https://arxiv.org/html/2606.13051#bib.bib16))近期的工作使用了这种组合,包括SNOMED CT (Wang等, 2002 (https://arxiv.org/html/2606.13051#bib.bib23))中的术语和规则,以提取与免疫介导炎症性疾病相关的生物学检查和药物。 另一项由Subramanian和Ganapathiraju(2017 (https://arxiv.org/html/2606.13051#bib.bib20))开展的工作使用简单的正则表达式提取抗体名称,基于抗体常被写作“X antibody”或“antibody to X”,其中“X”是抗体的靶点。这种方法不需要可能的靶点名称词典,但无法覆盖抗体在文本中可能被提及的各种方式。此外,在自身免疫的背景下,这种方法将难以区分自身抗体和普通抗体。 多头注意力和基于变换器的语言模型架构的发展,使得从长文本中高效提取信息成为可能,且比基于规则的方法具有更高的灵活性和上下文感知能力。对于NER任务,像基于BERT的模型 (Devlin等, 2019 (https://arxiv.org/html/2606.13051#bib.bib3))这样的编码器模型表现优异,同时比大语言模型(LLM)更轻量且计算成本更低 (Naguib等, 2024 (https://arxiv.org/html/2606.13051#bib.bib13))。原始BERT模型已被适配到许多领域,包括生物医学领域。然而,我们未发现任何专门用于识别自身免疫相关实体类型的模型。 ## 3 语料库创建方法 ### 3.1 文本选择 为了选择一组待标注的相关文本,我们首先从HPO术语构建了一个自身抗体名称及其同义词的词典,并用它查询PubMed API (Sayers, 2018 (https://arxiv.org/html/2606.13051#bib.bib17)),获取科学论文的标题和摘要。这是因为HPO包含描述某些自身抗体检测试验阳性结果的术语(位于HP:0030057下的术语)。其中大多数采用“anti-X antibody positivity”的形式,其中“anti-X antibody”是靶向抗原“X”的自身抗体的名称。我们依赖这种正则语法提取自身抗体的名称,并手动审查结果。我们还通过去除所选前缀和后缀,将每个自身抗体名称简化为核心字符串,然后将该核心与替代词缀重新组合,生成词汇变体。例如,“anti-smooth muscle antibody”通过去除“anti”和“antibody”简化为“smooth muscle”,产生的一个变体是“smooth muscle autoantibody”。总体而言,该词典包含来自HPO 2024-07-01版本的285种独特自身抗体的总共10,916个变体。平均而言,词典中的每种自身抗体有38.30个变体,包括HPO中已列出的同义词。 对于词典中的每种自身抗体类型,使用如下形式的查询在PubMed中搜索:“(”autoantibody_name_1“[Title/Abstract] OR ”autoantibody_name_2“[Title/Abstract] AND humans[MeSH Terms] AND (antibodies[MeSH Terms] OR autoantibodies[MeSH Terms])”。添加了MeSH术语过滤器,以仅选择标注了“人类”以及“抗体”或“自身抗体”的论文。这个过程返回了总共56,750个标题和摘要。我们使用的完整查询可在项目的GitHub仓库中找到。 尽管经过了MeSH术语过滤,部分获得的文本仍不相关,原因可能是非英文或与自身免疫无关。因此,我们实施了额外过滤:使用从HPO派生的词典进行精确匹配,对摘要进行自动预标注,同时使用GLiNER识别疾病和自身抗体名称。这种预标注使用了一个专门针对生物医学领域的GLiNER版本(“urchade/gliner_large_bio-v0.1”)。该模型是GLiNER large的早期版本,在PubMed摘要上进行了微调。 只保留至少包含一个HPO自身抗体术语匹配,或至少包含一个疾病预标注和一个自身抗体预标注的文本,将文本集减少到44,890篇。 其中,随机选择了120篇文本用于人工标注,其中5篇因与自身抗体无关或非英文文本而被手动剔除,最终得到115篇文本。初始选择大小为120,因为我们目标是获得约100篇文本的语料库,并预计会有少量文本被排除。 ### 3.2 标注指南与流程 标注由4名具有医学信息学、生物学或药学背景的标注员完成。该小组通过两次预标注批次制定了标注指南,以在标注活动开始前确定主要实体类型、难点和边缘案例 (Hovy and Lavid, 2010 (https://arxiv.org/html/2606.13051#bib.bib9))。标注指南可在以下GitHub仓库中获取:https://anonymous.4open.science/r/aabaac-FA3F。标注了五种类型的实体:“自身抗体”、“自身抗体靶点”、“疾病”、“症状或临床体征”和“自身抗体位置”;以及十种不同类型的关系:“与...相关”、“与...不相关”、“可能与...相关”、“由...引起”、“是...的靶点”、“引用...”、“非连续实体”(该关系用于链接同一个实体的多个分离部分)、“是...的同义词”、“位于...”和“是...的子类”。 为了简化标注员的工作,约定不标注嵌套实体之间的明显关系,这些关系将在人工标注后自动添加。例如,当“靶点”出现在“自身抗体”的跨度内时(这在“anti-X antibody”等结构中很典型),指导标注员不添加“是...的靶点”关系。类似地,当“自身抗体”出现在相关“症状或临床体征”的跨度内时,指导标注员不添加“与...相关”关系。这些关系将在人工标注后自动添加。 每篇文本由2名标注员独立标注,但没有一名标注员标注所有文本。每位标注员与其他标注员配对频率相等,每对标注相同数量的文本。使用Doccano (Nakayama等, 2018 (https://arxiv.org/html/2606.13051#bib.bib14))对已进行了实体预标注(但未进行关系预标注)的文本进行标注。这些预标注是通过字符串匹配和GLiNER获得的。Doccano网络界面如图1 (https://arxiv.org/html/2606.13051#S3.F1)所示。  图1:在Doccano网络界面中标注的文本示例。 文本以编号小批量(每批约4篇)发送给标注员,标注员可以按任意顺序、在一次或多次会话中、在活动结束前的任何时间自由标注。最后,进行了一次裁决,将每篇文本两位标注员的标注结果进行比对,由首席标注员决定最终的共识标注。 ## 4 最终语料库描述 本节包含115篇文本的最终裁决语料库的描述性计数和统计数据。文本长度变异很大(从50到3600字符,如表1 (https://arxiv.org/html/2606.13051#S4.T1)所示),标注内容也是如此(实体数从2到88个,关系数从0到55条)。部分原因是一些文本仅限于文章标题,而摘要为空。 表1:语料库通用统计。 | 统计量 | 值 | |--------|-----| | 文本数量 | 115 | | 总字符数 | 97,786 | | 平均字符数 | 850.3 | | 中位字符数 | 730 | | 字符数标准差 | 618.7 | | 总实体数 | 4,192 | | 平均实体数 | 36.45 | | 中位实体数 | 32 | | 实体数标准差 | 21.15 | | 总关系数 | 1,680 | | 平均关系数 | 14.61 | | 中位关系数 | 12 | | 关系数标准差 | 11.38 | 在每种类型的实体数量上也观察到不平衡,尤其是“自身抗体位置”仅出现64次(见表2 (https://arxiv.org/html/2606.13051#S4.T2)),而“疾病”是最常见的实体,出现1159次。 表2:按实体类型划分的语料库计数与分布。 | 实体类型 | 计数 | 占比 | |----------|------|------| | 自身抗体 | 842 | 20.1% | | 自身抗体靶点 | 672 | 16.0% | | 疾病 | 1159 | 27.6% | | 症状或临床体征 | 1124 | 26.8% | | 自身抗体位置 | 64 | 1.5% | | 其他(非实体) | 331 | 7.9% | 每种关系类型的出现次数变化极大。大多数关系标注为“与...相关”(735次,见表3 (https://arxiv.org/html/2606.13051#S4.T3)),这可以解释为其定义较宽泛;“是...的靶点”(494次);以及“是...的同义词”(226次)。有些关系类型几乎未被使用,例如“由...引起”(13次),这可能是由于自身免疫中因果关系的表述较为模糊或罕见。
相似文章
ACAT:一个用于高效基于方面情感数据集标注的协作平台
ACAT 是一个基于 Web 的协作标注平台,支持四种基于方面的情感分析(ABSA)工作流,其核心特性是在导出时自动运行 ETL 流水线以计算标注者间一致性(IAA)指标,从而直接生成可用于训练的数据集。该平台在 1,002 条餐厅评论上完成了验证,标注中位耗时为 31.58 秒,原始 IAA 最高达 0.86。
可配置临床信息提取与Agentic RAG:有效、失效及原因分析
ACIE是一款用于临床信息提取的智能体RAG系统,在核医学医师对7,326个实例的判断中达到96.5%的接受率,解决了异质性患者背景和缺失元数据的挑战。
AutoMedBench:迈向基于智能体AI模型的医学自动研究
AutoMedBench是一个面向自主医学AI研究工作流的基准测试,评估智能体在五个阶段中处理多种医学影像任务的表现。阶段级评分显示,验证阶段最弱,凸显了智能体工作流中可靠验证的必要性。
DocAnnot——利用生成式AI驱动的自动标注加速关键信息提取数据集的创建
介绍DocAnnot框架,该框架使用大型视觉语言模型、OCR以及一种空间感知的上下文匹配算法,自动生成用于文档关键信息提取的训练数据集,减少人工标注工作量。在CORD和SROIE基准测试中评估,取得了合理的F1分数,并实现了高效的人工验证。
用于改进临床试验工作流程准确性和效率的AI辅助协议信息提取
Banting Health AI的研究人员展示了一个利用生成式大语言模型和检索增强生成(RAG)技术进行临床试验协议信息自动提取的AI系统,准确率达89%,相比独立LLM的62.6%有显著提升,AI辅助工作流程任务完成速度快40%,并降低认知负荷。