在细节中查找幽门螺杆菌:基于证据的多智能体病例发现——来自胃活检报告

arXiv cs.AI 论文

摘要

本文介绍了Nimblemind多智能体系统(nMAS),用于从胃活检报告中提取幽门螺杆菌感染证据,在216个特征病例决策中达到98.61%的准确率,并显示出相比人工审查显著节省时间。

arXiv:2607.06435v1 Announce Type: new 摘要:来自新加坡的数据显示,约31%的人口有幽门螺杆菌感染的证据。持续的H. pylori感染与慢性活动性胃炎和消化性溃疡病相关,根除H. pylori是预防胃癌的关键。然而,支持H. pylori阳性和H. pylori相关胃炎的证据可能分布在异构的编码和自由文本报告字段中,并且需要对断言和否定进行上下文解释,限制了关键词搜索,并使人工审查难以规模化。我们使用来自新加坡大型医疗系统的54份去标识胃活检病理报告,对Nimblemind多智能体系统(nMAS)进行了回顾性试点评估,这是一种字段名驱动的、与证据关联的提取工作流。评估了四个临床医生范围内的二元字段:胃活检、活检状态、H. pylori阳性和H. pylori相关胃炎。在216个特征病例决策中,nMAS正确分类了213个,总体准确率为98.61%。一个单独实现的UMA风格MiniMax M2.5比较器产生了相似的总体和每字段分类指标。尽管预测性能相似,但nMAS保持统一的报告级输出并附带支持性源句子;因此,所展示的贡献在于工作流集成和可追溯性,而非预测优越性。在一个说明性的、未测量的场景下,审查1,000份报告,人工审查每份五分钟,而基于证据的验证每份五秒,将审查时间从83.3工时减少到1.4工时,节省81.9工时,约6,100美元的潜在员工时间价值。更大规模的多机构研究应评估证据跨度正确性、临床医生验证时间和泛化性。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:40

# 在细微处发现幽门螺杆菌:基于胃活检报告的证据关联多智能体病例发现

来源:https://arxiv.org/html/2607.06435  
Yufan Wang¹, Anit Kumar Sahu⁵, Yan Fei Ng², Daniel Kang¹, Shayan Vassef¹, Soorya Ram Shimgekar¹, Koustuv Saha⁴, Piyum Zonooz¹, Navin Kumar¹, Chee Leong Cheng²³, and Li Yan Khor²³  

###### 摘要

来自新加坡的数据显示,约31%的人口存在幽门螺杆菌感染的证据。持续性幽门螺杆菌感染与慢性活动性胃炎和消化性溃疡病相关,根除该菌是预防胃癌的关键。然而,支持幽门螺杆菌阳性和幽门螺杆菌相关性胃炎的证据可能分布在异构的编码和自由文本报告字段中,需要结合上下文解读断言与否定,从而限制了关键词搜索,并使人工审查难以规模化。我们利用Nimblemind多智能体系统(nMAS)——一种字段名驱动、证据关联的提取工作流程——对来自新加坡某大型医疗系统的54份去标识化胃活检病理报告进行了回顾性试点评估。评估了四个临床医生界定的二值字段:胃活检、活检状态、幽门螺杆菌阳性和幽门螺杆菌相关性胃炎。在216项特征-案例决策中,nMAS正确分类了213项,整体准确率达98.61%。独立实施的UMA风格MiniMax M2.5比较器产生了相似的总体分类指标和各字段分类指标。尽管预测性能相似,但nMAS保持了统一的报告级输出并附有支持的源句子;因此其贡献在于工作流程集成和可追溯性,而非预测优越性。在一个说明性的、未实际测量的场景下,对1000份报告进行审查:人工审查每份5分钟,而基于证据关联验证每份5秒,可将审查时间从83.3个工日减少到1.4个工日,对应节省81.9个工日及约6100美元的潜在工时价值。更大规模的多机构研究应评估证据跨度正确性、临床医生验证时间和泛化能力。

## I. 引言

据估计,约31%的新加坡人口存在幽门螺杆菌感染证据,且患病率随年龄增长而增加,并因种族而异[1]。持续性幽门螺杆菌感染与慢性活动性胃炎和消化性溃疡病相关,而根除该菌是预防胃癌的核心措施[2, 3, 4]。因此,可靠识别经活检确认的幽门螺杆菌阳性报告,对于治疗复查、根除随访、临床审核、研究队列组建以及质量改进工作流程至关重要。

基于病理学的病例发现并非简单的关键词搜索任务。相同的微生物术语可能出现在肯定、否定、既往或辅助染色等不同语境中;例如,“发现幽门螺杆菌”和“未发现幽门螺杆菌”包含相同目标术语,但需要的标签相反。相关证据还可能分布在编码标本字段、标本标签、诊断、镜检描述和辅助检测评论中,使得人工审查难以规模化。缓慢的人工审查可能延迟治疗复查、根除随访和质量改进行动,从而可能限制及时的患者护理[5, 6, 7]。按每份报告5分钟计算,筛查1000份候选病理报告需要约83个工日,才能开始后续审查或分析。

基于规则和监督学习的提取系统可以改善分类,但通常需要针对特定任务进行标注、维护或重新训练,以适应报告模板和目标模式的变化。大型语言模型提供了更强的可配置性,但提取出的标签除非与支持的源文本关联,否则在临床审核或研究中难以使用。这些局限性促使人们需要一种可复用的提取工作流程,结合可配置的字段定义、源文本锚定、验证以及可供临床医生审查的输出[8, 9, 10, 11]。

为弥补这一空白,我们评估了Nimblemind多智能体系统(nMAS)——一种模块化、字段名驱动、证据关联的工作流程,专门用于从胃活检病理报告中提取幽门螺杆菌相关特征。nMAS将用户指定的目标字段路由至分层的提取模块,并返回结构化标签及支持的源文本证据,以供临床医生验证。

在本试点研究中,我们将nMAS应用于来自新加坡某大型医疗系统的54份去标识化胃活检病理报告。我们评估了四个临床医生界定的二值字段:胃活检、活检状态、幽门螺杆菌阳性和幽门螺杆菌相关性胃炎。我们评估该工作流程是否能在保留源链接证据以供临床医生验证的同时,支持初步的幽门螺杆菌病例发现。

## II. 相关工作

**基线临床与病理信息提取。** 当解读依赖于段落上下文、否定、歧义措辞和当地报告惯例时,人工审查仍是参考标准,但难以规模化。在乳腺病理摘要提取中,Wieneke等人发现,一个自然语言处理系统仍标记了49.1%的报告需要人工审查,并错误编码了30.8%的报告[12]。

基于关键词的检索可以识别包含预定义术语的报告,但本身无法解决断言状态、段落位置或诊断上下文[8, 13]。

基于规则的自然语言处理系统通过字典、正则表达式、段落解析、断言检测和否定处理扩展了关键词匹配。例如,梅奥诊所的临床文本分析与知识提取系统(cTAKES)展示了在电子健康记录应用中的模块化临床文本处理能力[13],基于规则的方法也已被应用于病理报告提取[8, 14]。

**基于学习与基于大语言模型的医学摘要提取。** 监督学习和基于Transformer的方法可以对临床上下文进行建模,超越精确的关键词匹配。特定领域的语言模型如BioBERT改善了生物医学命名实体识别、关系抽取和问答任务的性能[15]。然而,监督式临床信息提取系统通常依赖于特定任务的标注数据和模型开发,这限制了其在提取目标或输出模式发生变化时的灵活性[8, 16]。当临床医生需要为不同的审核、研究队列或疾病特定工作流程定义新的变量时,这一局限性尤为突出。

大型语言模型(LLM)实现了更灵活的零样本和基于提示的摘要提取。UniMedAbstractor(UMA)使用可配置的提示模板和前沿模型,从真实世界数据中结构化多个临床属性[16]。在病理学领域,Truhn等人评估了GPT-4在结直肠癌和胶质母细胞瘤组织病理学报告中的零样本提取能力[9];Balasubramanian等人比较了多种LLM在乳腺癌病理报告中结构化提取的表现[10]。这些研究表明,基于LLM的摘要提取可根据不同的提取模式进行配置。然而,临床应用仍需要可复用的模式、对不确定性和否定的可靠处理,以及识别无支持输出的机制[17, 18]。

**新加坡及区域内的现行解决方案。** 临床自然语言处理(NLP)也已在新加坡及其他亚洲医疗环境中得到评估,但直接针对幽门螺杆菌胃活检病理提取的、可比较的工作仍然有限。在新加坡,Hardjojo等人开发了用于症候群监测的临床病史提取器(CHESS),这是一个基于规则的系统,可从自由文本的初级医疗电子病历中提取传染病症状,并区分肯定、否定和可疑断言[19]。Tay等人在新加坡肿瘤学环境中评估了自然语言处理方法,用于从放射学报告中推断转移性疾病部位[20]。这些研究支持了本地临床自由文本结构化的可行性,但它们处理的是初级医疗监测和肿瘤放射学,而非胃活检病理学。

区域内的胃肠道研究提供了与本任务更接近的比较。在韩国,Song等人开发了一个自然语言处理流水线,用于从非结构化食管胃十二指肠镜检查报告和关联的病理报告中提取胃部疾病信息,包括与幽门螺杆菌相关性胃炎相关的类别[21]。Bae等人开发了相关流水线,用于从自由文本结肠镜和病理报告中提取质量指标,展示了自动摘要提取如何支持大规模胃肠道质量监测[22]。这些研究表明,在亚洲医疗环境中进行胃肠道报告提取是可行的。然而,它们主要评估特定任务的流水线,并未涉及针对新加坡胃活检报告的可配置、字段名驱动、证据关联的多智能体工作流程。

总体而言,先前的研究表明,在本地和区域医疗环境中进行临床自由文本摘要提取和胃肠道报告提取是可行的[19, 20, 21, 22]。然而,它们并未直接解决当前操作用例:从新加坡胃活检病理报告中可配置地提取幽门螺杆菌相关特征,同时保留源文本证据以供临床医生验证。这一空白很重要,因为经活检确认的幽门螺杆菌病例发现支持根除随访、治疗结果审核、研究队列组建和质量改进审查[5, 6, 7]。本研究通过评估nMAS在四个临床医生界定的目标特征(胃活检、活检状态、幽门螺杆菌阳性和幽门螺杆菌相关性胃炎)上的表现来填补这一空白。

## III. 数据

**数据集概述。** 评估数据集由来自新加坡中央医院(SGH)解剖病理科的54份去标识化胃活检病理报告记录组成。新加坡中央医院是一家服务于多种族人群的大型三级医院[23, 24]。

每份报告级记录包含去标识化的管理元数据、编码的标本和诊断字段、医嘱和程序信息、签出信息以及完整的病理报告文本。在源表中,这些字段包括标本标识符、接收日期、去标识化的患者字段、TCode和MCode字段、诊断报告文本、医嘱地点、程序代码、签出字段、参考目标标签和参考证据跨度。分析前,直接的患者标识符已被移除或替换为去标识化占位符,而提取所需的临床相关措辞得以保留。

这些报告反映了不同病理医生之间异质的自由文本报告风格,包括标本标签、诊断措辞、微生物描述、否定模式、镜检描述和辅助检测措辞的差异。一条典型记录可能既包含编码的组织字段,例如“T57010(胃活检)”,也包含诊断文本,例如“胃;活检。重度慢性急性胃窦和胃体胃炎,伴轻度幽门螺杆菌定植”。这说明了提取任务为何需要结构化和非结构化证据:编码字段有助于识别胃活检标本,而诊断文本可能支持幽门螺杆菌阳性和幽门螺杆菌相关性胃炎。

表I展示了评估数据集中的代表性去标识化示例及其对应的参考标签。这些示例旨在说明评估数据格式和金标准标签定义。提示级示例、字段定义和用于指导提取的保护性规则在方法部分单独描述。

**表I:代表性去标识化胃活检病理摘录及其参考目标标签。**

**目标特征。** 评估了四个二值目标特征。这些特征是通过临床医生参与的界定过程选定的。最初,一个更广泛的潜在胃活检提取目标集与四位临床医生(包括资深病理医生)进行了评审,以确定用于实际幽门螺杆菌相关病例发现所需的最少结构化信息。胃活检和活检状态被纳入作为队列定义字段,用于确认解剖部位和标本类型。幽门螺杆菌阳性和幽门螺杆菌相关性胃炎被纳入作为疾病相关性字段。这四个特征综合起来,既区分了相关胃活检标本与非目标记录,又将微生物检测与幽门螺杆菌与胃炎之间的明确诊断关联区分开来。

1.  胃活检:报告是否表明是胃或胃活检标本。
2.  活检:病例是否为活检标本,而非非活检标本类型。
3.  幽门螺杆菌阳性:是否发现幽门螺杆菌、幽门螺杆菌微生物或幽门螺杆菌样微生物。
4.  幽门螺杆菌胃炎:报告是否支持幽门螺杆菌相关性胃炎,例如明确与幽门螺杆菌相关的活动性慢性胃炎。

**参考标准和证据标注。** 为每份报告及四个目标特征中的每一个定义了临床医生评审的参考标签。参考标签是使用完整的去标识化报告记录确定的,包括编码字段、标本标签、最终诊断文本、镜检描述、微生物相关陈述以及(如有)辅助染色评论。当初始标注出现分歧时,通过额外的一位病理医生裁决解决,并将最终裁决标签作为参考标准。在适用的情况下,记录了参考证据跨度,以记录

相似文章

MEDSYN: 复杂临床病例中多证据综合的多模态大语言模型基准测试

arXiv cs.CL

MEDSYN 是一个多语言多模态基准,用于评估多模态大语言模型(MLLMs)在复杂临床病例上的表现,每个病例最多包含 7 种不同的视觉证据类型。研究表明,虽然前沿模型在鉴别诊断生成方面与人类专家相当,但所有 MLLMs 在最终诊断选择中均存在显著差距,原因是异质临床证据综合能力不足。