可重构放射学标签:无需重新标注
摘要
本文介绍了一种流水线方法,只需一次结构化标注即可将自由文本的胸部X光报告转换为多标签矩阵,通过字典编辑即可重新配置标签方案而无需重新标注,从而显著节省成本和时间。
arXiv:2607.06597v1 公告类型:交叉
摘要:公开的胸部X光片(CXR)数据集通常以小型、固定标签方案(如CheXpert-14)发布。然而,底层的自由文本报告描述了更多的发现——哪些发现重要取决于任务、站点和读者。我们发布了一个流水线,将自由文本报告转换为多标签矩阵,然后通过字典编辑而不是新的推理过程来重新配置标签方案,即无需重新标注语料库。经过这次一次性标注后,从缓存注释中重新配置MIMIC-CXR(22.3万份报告)仅需196秒,且无API成本,而使用Claude Opus 4.7进行等效的重新标注则需要\$6.6K。使用58标签分类法,我们显示43\%的CXR研究至少包含一个CheXpert-14之外的发现。在这些标签上训练的影像探针在共享目标上与CheXpert-14探针表现相当,同时在专家审查的长尾标签上达到0.78 AUROC,而这些标签是CheXpert-14无法表示的。这些结果表明放射学标注的工作单元可以不同:一旦报告被结构化,标签方案就成为一种可编辑的配置,而非需要重新标注的语料库。
查看缓存全文
缓存时间: 2026/07/09 07:51
# 1 引言 来源:https://arxiv.org/html/2607.06597 marginparsep 已被更改。topmargin 已被更改。marginparpush 已被更改。页面布局违反了 ICML 样式。请不要更改页面布局,也不要引入 geometry、savetrees 或 fullpage 等会更改布局的包。我们无法可靠地撤销对样式的任意更改。请移除违规的包或更改布局的命令,然后重试。可重新配置的放射学标签,无需重新标注 Jean-Benoit Delbrouck Dave Van Veen Akash Pattnaik Kalina Slavkova Javid Abderezaei Harris Bergman Khan Siddiqui ††脚注文字:通讯作者:Jean-Benoit Delbrouck \. 公开的胸部X光片(CXR)数据集通常附带一套小而固定的标签方案,例如 CheXpert-14。然而,底层的自由文本报告描述了更多发现——哪些发现是重要的取决于具体任务、机构和阅片者。我们发布了一个流程:通过一次结构化的标注过程,将自由文本报告转换为多标签矩阵,随后通过字典编辑而非新的推理过程来重新配置标签方案——即无需重新解析或重新标注语料库。经过这一次性处理后,从缓存标注中重新配置 MIMIC-CXR(22.3万份报告)仅需196秒且无API成本,而使用 Claude Opus 4.7 进行等效重新标注则需要约6600美元。使用一个包含58个标签的分类体系,我们发现43%的CXR研究包含至少一个CheXpert-14之外的发现。基于这些标签训练的影像探针在共享目标上与 CheXpert-14 探针表现相当,同时在专家审核的长尾标签上达到0.78的AUROC,而这些标签是 CheXpert-14 无法表示的。这些结果表明放射学标注的工作单元可以不同:一旦报告被结构化,标签方案就变成了一个可编辑的配置,而非需要重新标注的语料库。 放射学影像模型的价值取决于用于训练和评估它们的标签。对于许多胸部X光片(CXR)分类器而言,这些标签是一个多标签向量:每个发现对应一个条目,标记为存在、不存在或不确定。在过去十年中,这些向量通常通过自动标注器从放射学报告中推导得出。在CXR中,标准工具是基于规则的系统,如 NegBio (Peng 等, 2018) 和 CheXpert-NLP (Irvin 等, 2019),然后是 BERT 分类器如 CheXbert (Smit 等, 2020);所有这些都应用于包含14个发现的 CheXpert 分类体系。同样的模式也出现在CXR之外:CT-RATE (Hamamci 等, 2024) 通过标注一小部分子集并将 RadBERT 风格分类器蒸馏到剩余语料库来标注胸部CT报告。最近,大型语言模型(LLM)被用于提取更广泛的标签集 (Dorfner 等, 2025),而实体关系提取器如 RadGraph (Jain 等, 2021; Delbrouck 等, 2024) 则生成下游工具可消费的结构化报告标注。这些发展使得大规模放射学标注变得可行,但大多数依赖于固定方案。这是一种有损的抽象:报告描述了设备、疾病、亚型、不确定性、解剖结构和特定机构的用语,这些可能不符合方案。正确的方案还取决于具体任务:一个应用可能需要胸膜异常,另一个需要区分胸腔积液与胸膜增厚,再一个可能需要考虑侧别、严重程度或时间变化。除了任务依赖性,方案选择还依赖于阅片者:放射科医生可能对发现的存在与否或描述存在分歧 (Abujudeh 等, 2010; Bruno 等, 2015)。这些变异源使得灵活性成为标注系统的一个有用属性;然而,固定分类体系限制了模型的学习内容和研究者的测量范围。 实际的障碍在于语料库规模的方案迭代。手动重新标注需要稀缺的放射科医生时间 (McDonald 等, 2015)。蒸馏流程(如 CT-RATE 使用的)在目标标签改变时需要新的标注和训练循环。LLM 可以更灵活地重新标注报告,但每次方案更改都需要对语料库进行另一次推理过程,带来重复成本、隐私约束和可重复性问题:在 MIMIC-CXR 上使用 Claude Opus 4.7 进行一次推理大约需要6600美元¹,除非本地运行否则必须将报告文本发送到API,并且可能随着提示或模型而变化。因此,瓶颈不在于一次性生成标签,而在于安全、廉价且可重复地更改它们。 为解决此问题,我们提出一种无需重复全语料库推理即可重新配置放射学标签方案的方法:一次性结构化报告标注过程将报告理解与下游标签定义分离。本文中使用“无需重新标注”即指此特定含义——语料库被解析一次且不再重新解析——而非声称没有任何标注发生。对于每个发现,例如胸腔积液,放射科医生定义一小套表达该发现的短语,如“pleural effusion”、“hydrothorax”或“fluid in the pleural space”。一个结构化报告标注器(SRA)在语料库上运行一次,为每份报告提取报告作者描述的发现,每个发现标记为存在、不确定或不存在。然后通过将放射科医生定义的短语与此缓存的结构化输出进行匹配来编译标签。别名词典(我们称之为放射学别名)将每个目标标签映射到表达它的报告短语。重新配置方案——编辑标签、添加新标签或使标签适应新机构——只需要编辑词典并在本地重新编译;结构化标注过程不会重新运行,因此无需额外的全语料库推理。每个标签还存储匹配的短语和报告标记,因此审阅者可以检查产生该标签的证据。我们的代码和完整别名词典发布在 https://github.com/hopprai/radlabels。 本文其余部分组织如下。 第2节定义了标注问题并论证了可重新配置方案的必要性。 第3节描述了我们方法的两个组成部分:SRA(第3.1节)和放射学别名(第3.2节)。 第4节描述了数据集、分类体系和评估设置(第4.1节),然后评估了报告标签提取(第4.2节)和下游影像模型效用(第4.3节)。 第5节讨论了局限性,第6节给出结论。 ## 2 问题陈述 公开放射学数据集附带一套小而固定的标签,通常是CXR上的 CheXpert-14 (Irvin 等, 2019) 或胸部CT上从放射科医生标注中蒸馏出的18个发现面板 (CT-RATE, Hamamci 等, 2024)。固定集便于基准测试,但它们与报告匹配不佳。瓶颈不仅在于生成标签;更在于定义、更改和审计它们。 要点。放射学标签方案是临床选择,而非固定对象;它们随着疾病、阅片者、机构和任务而变化。 #### (i) 标签是开放式的。 随着时间的推移,新发现、设备和亚型会出现:LVAD、Impella泵和更新的起搏器型号不在上述任何分类体系中。报告也是长尾分布:常见发现占主导,而许多临床重要的发现各自出现在不到1%的研究中 (Holste 等, 2022)。即使在CXR上,PadChest (Bustos 等, 2020) 也包含174个不同的影像学发现,是 CheXpert-14 的十倍以上。即使对于固定的疾病,“正确”的标签也取决于下游用途:一项研究可能需要粗粒度的胸膜异常;另一项需要细粒度的胸膜增厚与胸腔积液与气胸;第三项可能需要考虑侧别或严重程度的版本。这种不匹配不仅是美学上的:粗粒度标签内的隐藏亚组会导致下游模型出现临床意义上的失败 (Oakden-Rayner 等, 2020)。 #### (ii) 放射科医生之间存在分歧。 CXR和横断面成像上的观察者间变异性已有充分记录:经验丰富的阅片者之间的差异率根据任务在2-20%范围内 (Abujudeh 等, 2010; Bruno 等, 2015)。同一发现也可能被表述为“effusion”、“fluid in the pleural space”或“blunting of the costophrenic angle”。固定方案硬编码了一组人的选择,并使每个下游用户继承这些选择。 #### (iii) 手动重新标注不可扩展。 放射科医生是日益稀缺的资源:每位放射科医生的工作量随着横断面成像数量的增加而显著增长 (McDonald 等, 2015)。用新标签重新标注单个大型数据集(如 MIMIC-CXR,22.3万份报告)需要一名放射科医生全职工作数月,且每次方案更改都必须重复此过程。当存在手绘标注子集时,通常的变通方法是蒸馏:例如,CT-RATE (Hamamci 等, 2024) 涉及在一小部分子集上标注18个发现,随后训练一个 RadBERT 风格分类器来标注其余部分。更改那18个发现仍需要另一次标注和蒸馏循环。我们依赖的用于评估的杰出手工整理数据集——CheXpert 5x200 (Irvin 等, 2019)、CXR-LT 2024 任务2 (Holste 等, 2024) 和 PadChest-GR (Castro 等, 2024)——之所以存在,恰恰因为它们规模小(几百到几千例研究)或者因为围绕它们组织了大型联盟。 #### (iv) LLM 重新标注快速但成本高、受隐私约束且非确定性。 LLM 原则上可以标注放射科医生能标注的任何内容,最近的工作表明 LLM 在 CXR 报告上与专家标注者具有竞争力 (Dorfner 等, 2025)。然而在大规模下,成本、隐私、速度和可重复性都成为问题。用前沿模型重新标注 MIMIC 规模的语料库成本约6600美元,且与语料库大小线性增长(第4.2节)。许多机构无法将报告文本发送给第三方API;批量作业可能需要数天;提示或模型的变化会无声地改变标签。基于规则和基于 BERT 的标注器避免了成本和隐私问题,但硬编码了固定分类体系,并且已知会引入自身噪声 (Olatunji 等, 2019)。 要点。瓶颈不在于一次性生成标签;而在于安全、廉价且可重复地更改它们。 #### 期望结果。 一个有用的流程应允许用户*重新配置*标签方案,而无需重新标注语料库:更改应易于应用、本地化且确定性、开放且可审计到产生每个标签的报告标记。接下来描述的方法满足所有这些要求。 ## 3 方法 我们的方法包含两个组成部分,对应引言中的高层描述。*结构化报告标注器*(第3.1节)读取每份报告一次,并将其转换为带有状态的结构化发现列表。*放射学别名*(第3.2节)是一个小型的、由放射科医生编辑的词典,将每个标签映射到几个短语。将这些短语与解析后的输出进行匹配,产生最终标签。标注器过程是唯一昂贵的步骤,并被缓存,因此更改标签集仅需编辑词典。 ### 3.1 结构化报告标注器(SRA) 结构化报告标注器(SRA)将放射学报告转换为*语义图*:节点是临床概念,边是关系,每个节点带有状态(存在、不存在或不确定)。在本工作中,我们使用 RadGraph-XL (Delbrouck 等, 2024) 作为 SRA。其节点是解剖结构(如“pleura”、“aorta”)或观察(如“effusion”、“pacemaker”),每个标记为明确存在、不确定或明确不存在。其边编码关系,如位于(effusion →located\_at pleura)、修饰(small →modify effusion)和提示。每个节点还存储标记位置,以便每个标签可以回溯到报告文本。其他 SRA 也符合相同模式²,并且在本提议框架中可作为 RadGraph-XL 的直接替换。运行 SRA 是唯一计算密集的步骤,且每份报告只需支付一次。标注被缓存,下游标签更改只需重新编译别名。使用数据并行推理,我们的设置在大约22分钟内用3个A100处理了10万份报告;第4.2节报告端到端吞吐量。 要点。一次运行结构化报告标注器;为未来的标签定义重复使用其结构化输出。 ### 3.2 放射学别名 放射学别名将 SRA 标注转换为多标签矩阵。用户编辑一个词典,将每个疾病键映射到以下内容: - •一个别名短语列表(例如,pleural\_effusion: “pleural effusion”, “pleural fluid”, “hydrothorax”, ...); - •一个可选的父标签(例如,pleural\_abnormality),从子标签推导得出并在下游实验中使用(第4.3节); - •可选的排除短语,用于处理标记重叠冲突。例如,pleural\_effusion 排除“pericardial effusion”,因此心脏周围的积液不会标记为胸膜积液。 完整别名词典随代码发布;附录B和表7给出了本文使用的标签组和代表性别名的紧凑视图。 #### 标注一个研究。 对于每个观察节点,我们收集与其关联的词语(解剖结构、修饰语和连接的观察),并检查是否有任何______ (Note: The translation cuts off at the end because the original text also ends abruptly with "dis". The user provided the source text which appears incomplete at the end. I'll translate what was given, noting the cut-off.)
相似文章
面向纵向胸部X光报告的过渡感知型Best-of-N采样
本文介绍了一种过渡感知型Best-of-N采样方法,这是一种无需训练的方法,通过使用集合到集合的距离度量来编码既往与当前检查之间的变化,从而生成纵向胸部X光报告。
一轮足矣:面向任务异构多标签医学图像分类的解析联邦学习
提出了一种解析联邦学习框架,仅需一轮或两轮通信即可完成任务异构下的多标签医学图像分类,在ChestXray14数据集上以高达18.44的BACC和13.24的AUC分数优于现有方法。
RadAgent:用于胸部CT逐步解读的工具型AI代理
RadAgent是一种使用工具的AI代理,通过可解释的逐步推理生成胸部CT报告,将临床准确率相对提升36.4%,并实现37%的忠实度——这是现有3D视觉语言模型所不具备的能力。该系统提供完全可检查的推理轨迹,使临床医生能够验证和优化诊断输出。
RE-AD:数据标注的实时需求遵循
介绍RE-AD框架,该框架利用LLMs实时验证数据标注质量,在生产环境中实现了82%的错误接受与修复率。
重新审视用于3D CT报告生成的LLM适配:规模与诊断先验研究
本文研究了将大语言模型适配到3D CT报告生成的参数高效策略,提出了RAD3D-Prefix,一个轻量级的诊断先验条件框架,该框架保持LLM冻结,仅需极少的可训练参数。结果表明,冻结更大的LLM(约10亿参数以上)并仅训练轻量级投影层,能够在性能、泛化能力和计算效率之间实现更优的权衡。