用于放射学报告结构化和质量保证的多智能体AI系统及独立放射科医生评估

arXiv cs.CL 论文

摘要

本文介绍了一种本地部署的多智能体AI系统,用于放射学报告结构化和质量保证,放射科医生评估显示其性能良好。

arXiv:2608.18072v1 公告类型:新 摘要:目的:开发和评估一种用于放射学报告结构化和质量保证的本地部署多智能体AI系统。 材料与方法:本回顾性研究纳入了2023年和2024年由15名认证放射科医生口述的胸部、腹部和盆腔CT检查的638份放射学报告。开发了一个多智能体AI管道来执行报告结构化和质量保证(QA)。该系统使用正则表达式规则和本地大型语言模型,将报告在句子层面结构化为标准化的解剖学部分。它还检测了发现部分和印象部分之间或部分内部的不匹配;性别-解剖冲突;以及未记录的关键发现沟通。两名认证放射科医生独立评估了45份报告的子集。 结果:多智能体系统将所有报告(22,270个句子)的发现部分结构化为预定义的解剖学格式,同时保留了原始报告内容。系统标记了90份(14.1%)报告,最常见的是部分不匹配(80份报告,12.5%)。在放射科医生评估中,两位评审者一致认为31份(69%)被正确重构,2份报告(4%)被错误重构,对剩余的12份报告(27%)存在分歧。两位评审者一致认为没有遗漏临床重要信息,也没有引入虚构内容。总体QA性能在84%的评估报告中被评为“优秀”或“良好”,其余报告被评为“一般”。 结论:本地部署的多智能体AI系统将放射学报告结构化和质量保证结合在一个工作流程中。该系统在放射科医生评估中显示出良好性能。此类系统可能支持放射学实践中报告和质量保证的标准化。
查看原文
查看缓存全文

缓存时间: 2026/08/19 10:14

# 用于放射科报告结构化与质量保证的多智能体AI系统及放射科医师独立评估
来源:https://arxiv.org/html/2608.18072
\\correspondance

\\extraAuth

Iryna Hartsock1,∗, Cesar Lam2, Christopher Otteni2, Aliya Qayyum2, Robert Gatenby2, Cyrillo Araujo2, and Ghulam Rasool1,2,3,4

###### 摘要

目的:开发并评估一个本地部署的、用于放射科报告结构化与质量保证的多智能体AI系统。材料与方法:本回顾性研究收集了638份由15位具有执业认证的放射科医师于2023至2024年口述的胸部、腹部和盆腔CT检查放射科报告。我们开发了一个多智能体AI流水线,用于执行报告结构化和质量保证。该系统利用正则表达式规则和本地大型语言模型,在句子层面将报告结构化为标准化的解剖学分区。它还能检测“所见”与“印象”部分之间或内部的不匹配;性别-解剖学冲突;以及关键发现未记录传达的情况。两位具有执业认证的放射科医师独立评估了一个45份报告的子集。结果:多智能体系统将所有报告(22,270个句子)的“所见”部分结构化为预定义的解剖学格式,同时保留了原始报告内容。系统标记了90份(14.1%)报告,最常见原因为部分间不匹配(80份,12.5%)。在放射科医师评估中,两位评审者均认同31份(69%)报告被正确重构,2份(4%)被错误重构,对其余12份(27%)报告的判断存在分歧。两位评审者均认同未遗漏任何重要临床信息,也未引入虚构内容。总体质量保证性能在84%的受评估报告中被评为“优秀”或“良好”,其余报告被评为“尚可”。结论:一个本地部署的多智能体AI系统将放射科报告结构化和质量保证整合于单一工作流程中。该系统在放射科医师评估中表现出良好性能。此类系统可能支持放射科实践中报告标准化和质量保证的实现。

\\helveticabold

## 1关键词:

多智能体人工智能,放射科报告,结构化报告,质量保证,大型语言模型

††firstpage:1## 2引言

放射科报告的一个挑战是结构不一致或缺失,这可能导致接诊医师忽略关键临床信息或花费时间去寻找它\(17 (https://arxiv.org/html/2608.18072#bib.bib1)\)\。放射科报告包含诸如“所见”和“印象”等部分,其中“所见”有时按解剖区域或器官描述。然而,“所见”在报告中的组织和放置方式在不同放射科医师间可能存在差异,这可能会使放射科医师与接诊临床医师之间的沟通复杂化\(2 (https://arxiv.org/html/2608.18072#bib.bib2),15 (https://arxiv.org/html/2608.18072#bib.bib3)\)\。此外,缺乏一致结构的放射科报告可能会限制其在研究、质量监控和临床决策支持系统中的二次利用\(13 (https://arxiv.org/html/2608.18072#bib.bib4)\)。

已提出多种方法来解决这些局限性。结构化报告模板已被开发用于标准化放射科报告并提高一致性,尽管由于对工作流程负担和报告灵活性的担忧,其采纳情况不一\(17 (https://arxiv.org/html/2608.18072#bib.bib1),12 (https://arxiv.org/html/2608.18072#bib.bib16)\)。近年来,自然语言处理和大型语言模型方法已被探索用于从叙述性放射科报告中提取结构化信息,或将自由文本报告转换为结构化格式\(1 (https://arxiv.org/html/2608.18072#bib.bib5),7 (https://arxiv.org/html/2608.18072#bib.bib6),18 (https://arxiv.org/html/2608.18072#bib.bib15)\)。这些方法通常侧重于提取特定发现、生成标签或总结报告内容,而不保留原始报告的全部内容。

另一个挑战是报告差异或沟通错误的存在,这可能导致误解、治疗延迟或不恰当的临床管理\(3 (https://arxiv.org/html/2608.18072#bib.bib7)\)。在某些情况下,报告内的不一致可能要求临床医师重新检查影像学研究以求澄清。语音识别系统的广泛采用进一步凸显了质量控制的必要性,因为语音转文本报告可能引入转录错误或无意的措辞更改\(11 (https://arxiv.org/html/2608.18072#bib.bib8)\)。自动化方法比人工审核更高效地检测此类不一致,特别是在高报告量环境中。近期研究探索了使用大型语言模型自动检测放射科报告中的错误,证明了大型语言模型能够识别报告文本中的某些类型的不一致\(16 (https://arxiv.org/html/2608.18072#bib.bib9),4 (https://arxiv.org/html/2608.18072#bib.bib10),14 (https://arxiv.org/html/2608.18072#bib.bib11),9 (https://arxiv.org/html/2608.18072#bib.bib12),10 (https://arxiv.org/html/2608.18072#bib.bib13)\),这代表了临床AI研究中一个新兴且快速发展的方向\(8 (https://arxiv.org/html/2608.18072#bib.bib14)\)。

在这项工作中,我们提出了一个多智能体AI系统,该系统在保留原始报告文本的同时,标准化放射科报告组织结构并执行自动质量保证。该系统将报告中的句子分配到预定义的解剖学分区,而不重写内容。它还识别不一致之处,包括“所见”与“印象”之间的不匹配、部分内的差异、性别-解剖学冲突,以及未记录传达的关键发现。这种方法在允许放射科医师保持其报告风格的同时,实现了结构化报告和自动化质量检查。一个报告子集由放射科医师评估,以评估多智能体AI系统的质量。

## 3材料与方法

### 3.1放射科报告

在本回顾性研究中,我们收集了638份基于胸部、腹部和盆腔CT扫描的完整放射科报告。这些报告由15位具有执业认证的放射科医师于2023年至2024年期间使用语音识别系统口述。报告长度从146到1,594个单词不等,平均为438个单词。十四位放射科医师以不同风格按器官分区组织“所见”部分,而一位放射科医师的报告“所见”部分则基本无结构。放射科报告在机构防火墙后处理,使用本地部署的AI模型。机构审查委员会批准了该研究,并豁免了对参与放射科医师和患者的知情同意要求。

### 3.2结构化任务的报告预处理

对于结构化任务,使用基于规则的模式匹配来识别部分边界,从而提取“所见”部分。实现了一个自定义句子分割算法,以处理放射科特有的格式,包括编号列表、多行句子和标点符号不一致的情况。使用基于规则的模式匹配,将简短的随访片段(例如,“与先前相比稳定”)有条件地与前一句合并,以保留上下文含义。这些步骤为后续基于器官的报告结构化提供了句子级输入。

参考说明图1:提出的多智能体AI流水线用于放射科报告结构化和质量保证的概览。结构化任务在句子层面运行,并将“所见”部分的内容重组为预定义的解剖学分区。每个句子首先由基于规则的智能体(智能体1)评估。与设备相关的句子以及未被智能体1分类的重复句子被直接路由到DeepSeek-R1推理模型(智能体3)。其他未分类的句子由LLaMA-3模型(智能体2)处理,仍然未分类或被分配到非特定“其他”类别的句子随后由智能体3审查。质量保证由一个单独的DeepSeek-R1智能体(智能体4)在整个报告层面执行,该智能体标记潜在的报告不一致之处,并为标记分配严重等级。右上角面板显示了一个“所见”-“印象”不匹配的输出示例;类似的输出也针对性别-解剖学差异和关键发现未记录传达的情况生成。
### 3.3多智能体AI系统流水线

我们开发了一个用于放射科报告结构化和质量保证的四智能体流水线,如图1所示。前三个智能体将发现组织成如图2所示的预定义解剖格式,而第四个智能体执行报告层面的质量保证。第一个智能体使用一个包含约600个覆盖常见解剖区域和放射学发现的正则表达式模式的领域特定词典执行确定性句子分类。分类规则和解剖分配是在一位具有执业认证的放射科医师的输入下开发的,旨在将常见发现分类到预定义的解剖分区中。第二个智能体应用一个大型语言模型(LLaMA-3–8B,量化为q8)来处理规则未涵盖的情况,使用完整的“所见”文本和本地句子上下文来推断器官层面的关联。第三个智能体采用一个推理大型语言模型(DeepSeek-R1-Distill-Llama-70B,量化为q4)处理需要额外上下文解释的选定句子。与设备相关的句子使用设备特定的正则表达式模式识别,并直接路由到DeepSeek-R1,因为它们通常需要同时分配到“设备”部分和描述设备位置或相关发现的相关解剖分区。智能体1无法分类的重复句子也绕过LLaMA智能体,直接路由到DeepSeek-R1。此外,DeepSeek-R1审查由LLaMA智能体未分类或分配到“其他”类别的句子。在所有情况下,被分类的句子与完整的“所见”部分一起提供。

第四个智能体同样基于DeepSeek-R1-Distill-Llama-70B(量化为q4),在整个报告层面运行,以识别具有临床意义的不一致性,包括跨部分和部分内的侧别差异、否定反转、极性冲突、器官或节段不匹配、大小或单位差异、性别-解剖学不一致,以及未记录传达的潜在关键发现,同时抑制“所见”和“印象”之间临床上可接受的总结差异。质量保证智能体还为每份报告分配一个总体严重等级(无、轻微、严重或关键)。

所有基于大型语言模型的智能体都使用针对其各自任务量身定制的结构化提示,并生成预定义的JSON输出以供自动化下游处理。结构化智能体执行单次推理,无需重试循环,而质量保证智能体在严格JSON解析失败时使用最多五次尝试的重试机制。该流水线使用Python实现,并在计算集群上使用单个NVIDIA H100 GPU和12个CPU核心执行。本地大型语言模型推理通过Ollama111https://ollama.com/(访问于2026年6月4日)平台进行,该平台提供量化的LLaMA-3-8B和DeepSeek-R1-Distill-Llama-70B模型。多智能体流水线可在以下网址获取:https://github.com/lab-rasool/Multi-agent-AI-system-for-Radiology-Report-Structuring-and-Quality-Assurance\。

### 3.4专家评估流程

临床评估由两位具有执业认证的放射科医师使用标准化评估表进行独立审查。评估放射科医师与原始报告作者群体不同。抽样并提供了固定的45份报告子集给所有评审者,包括每位报告作者三份报告(作者身份已编辑)。对于每位报告作者,从智能体系统标记的报告中随机选择最多三份;如果标记的报告少于三份,则包含所有标记的报告,其余案例从未标记的报告中随机抽样,以保持每位作者三份报告。此抽样程序产生了41份已标记和4份未标记的报告。审查侧重于智能体系统的结构化和质量保证两个组成部分。评审者评估句子级分类是否被正确分配到相应的基于器官的分区,结构化过程中是否遗漏了任何临床相关的信息或引入了任何虚构内容,以及结构化报告是否比原始报告更适用于临床审查。评审者还评估了系统标记的错误是否正确和完整,严重程度分配是否适当,质量保证大型语言模型智能体生成的推理是否逻辑一致且临床合理,以及质量保证智能体的整体性能。除非另有说明,结果部分报告的评估结果代表两位评审者的一致意见。

参考说明图2:使用提出的多智能体AI系统对放射科报告“所见”部分进行自动结构化的示例。左面板显示了一个合成放射科报告中的原始“所见”部分。右面板显示了系统相应的结构化输出,其中发现被重组为预定义的基于器官的分区。由该流水线处理的放射科报告的所有“所见”部分均被转换为这种结构化格式。

## 4结果

### 4.1放射科报告结构化

多智能体AI系统处理的638份放射科报告(22,270个句子)中“所见”部分内容的句子级分类总结见表1。大多数句子由基于规则的阶段处理,智能体1(正则表达式)分类了18,493个句子(83.0%)。智能体2(LLaMA 3)处理了2,729个句子(12.3%),主要捕获简单模式匹配不足的情况,而智能体3(DeepSeek-R1)分类了1,041个句子(4.7%),这些句子需要额外的推理或消歧。只有7个句子(<0.04%)未被分类;这些并非真正的遗漏,而是报告部分标题。由于报告未一致使用标点符号,因此使用分隔符(例如,换行符和间距)的组合确定句子边界,这偶尔会将标题隔离为独立句子。

性能在放射科医师之间通常一致,但在使用后续智能体的频率上存在一些差异。由放射科医师3、6和13撰写的报告中,智能体1分类的句子比例最高(分别为93.3%、90.0%和90.3%),表明与基于规则的模式高度一致。相比之下,来自放射科医师2和4的报告显示了基于大型语言模型的智能体(智能体2和3合计)的最大使用率(分别为26.7%和27.2%),反映出对上下文分类的更大依赖。来自放射科医师11的报告显示了智能体3的最高使用率(12.7%),表明与其他放射科医师相比,有更高比例的句子需要更深层次的推理或消歧。

### 4.2放射科报告质量保证

...

相似文章

ReportQA: 基于问答的放射学报告评估

arXiv cs.CL

本文提出了ReportQA,一种基于问答的放射学报告评估框架,利用大语言模型回答临床相关问题,相较于现有指标,与放射科医生判断的一致性更好。

RadAgent:用于胸部CT逐步解读的工具型AI代理

Hugging Face Daily Papers

RadAgent是一种使用工具的AI代理,通过可解释的逐步推理生成胸部CT报告,将临床准确率相对提升36.4%,并实现37%的忠实度——这是现有3D视觉语言模型所不具备的能力。该系统提供完全可检查的推理轨迹,使临床医生能够验证和优化诊断输出。

迈向自主且可审计的医学影像模型开发

Hugging Face Daily Papers

介绍AMID,一个用于医学影像模型开发的自主多智能体框架,利用LLM智能体来规划、执行和验证实验。在20项医学影像任务中,它优于通用MLE系统,并接近人类设计的解决方案。

一种用于CT扫描中可靠且可审计的空间关系验证的模块化代理

Hugging Face Daily Papers

本文提出了一种模块化的医学成像代理,通过将任务分解为解析、定位和几何规则来验证CT扫描中的空间关系,实现了94.1%的准确率,并在基准测试中以42.5个百分点的优势超越了端到端视觉语言模型,同时确保了可审计的推理过程。