RadFusion:面向阈值可控的放射学报告生成
摘要
RadFusion 是一个通过将多标签分类器与基于 VQA 的生成器以及 LLM 重写步骤相融合,为放射学报告生成增加阈值可控性的框架,支持灵敏度-特异性的权衡以及基于 ROC 的验证。在 MIMIC-CXR 上的实验表明,其诊断准确性得到提升,报告行为也更适应临床需求。
arXiv:2608.10505v1 公告类型:新
摘要:针对放射科医生短缺的问题,自动化放射学报告生成正在快速发展。然而,与感知模型不同,现有的生成模型无法对其诊断内容的灵敏度-特异性权衡进行控制。这种控制至关重要,因为临床场景各不相同:急诊分诊优先考虑灵敏度以减少漏诊,而确诊性判读则强调特异性以限制不必要的干预。单一固定报告既无法适应这些场景,也无法支持监管审批中广泛预期的基于 ROC 的验证。我们提出了 RadFusion,一个为报告生成赋予阈值可控性的框架。我们的方法将提供各疾病置信度分数的多标签分类器与详细描述医学发现的基于 VQA 的报告生成器相融合;随后,LLM 对报告进行重写,使报告中的诊断结论在所选阈值下遵循分类器的决策,同时仍然基于生成器的描述。在 MIMIC-CXR 上,RadFusion 的性能符合分类器的 ROC 曲线:扫描阈值并将报告映射回类别标签,可以重现分类器已获验证的 ROC 性能。这种一致性使得生成的报告可以通过 ROC 分析进行定量评估,增强了监管审批的说服力,并支持选择与临床情境相匹配的工作点。此外,两种模型类型的结合相较于不受控生成提高了诊断准确性:在特异性匹配时灵敏度提高了 6.9%,在灵敏度匹配时特异性提高了 20.7%。这些结果表明,RadFusion 使报告生成在临床上更可适应、可定量验证,并且诊断上更可靠。
查看缓存全文
缓存时间: 2026/08/12 08:25
# RadFusion:迈向阈值可控的放射学报告生成
来源:https://arxiv.org/html/2608.10505
Ying Jin, Noel C. F. Codella, John Corring, Mu Wei, Dinei Florencio, Eric Horvitz
Microsoft
{ying.jin, ncodella, john.corring}@microsoft.com
{muhsin.wei, dinei, horvitz}@microsoft.com
###### 摘要
自动放射学报告生成技术正在快速发展,以应对放射科医生短缺的问题。然而,与感知模型不同,现有的生成模型无法对其诊断内容的灵敏度—特异度权衡进行控制。这种控制至关重要,因为临床场景各不相同:急诊分诊更注重灵敏度以减少漏诊,而确诊性判读则强调特异度以限制不必要的干预。固定单一的报告既无法适应这些场景,也无法支持监管审批中广泛预期的基于ROC的验证。我们提出RadFusion,一个为报告生成赋予阈值可控能力的框架。我们的方法将多标签分类器(提供每种疾病的置信度分数)与基于VQA的报告生成器(详细描述医学发现)相融合;随后,一个LLM对报告进行改写,使其陈述的诊断结果在所选阈值下遵循分类器的决策,同时保持基于生成器描述的事实依据。在MIMIC-CXR上,RadFusion的性能与分类器的ROC曲线一致:扫描阈值并将报告映射回类别标签,可以复现分类器经过验证的ROC性能。这种一致性使生成的报告能够通过ROC分析进行定量评估,从而为监管审批提供更强支撑,并支持选择与临床场景匹配的工作点。此外,将两类模型相结合相比无控制的生成方式提升了诊断准确性:在特异度匹配时灵敏度提高6.9%,在灵敏度匹配时特异度提高20.7%。这些结果表明,RadFusion使报告生成在临床上更可适应、在数量上更可验证、在诊断上更可靠。
## 1 引言
解读医学图像并将发现以书面报告形式传达,是临床诊疗中的核心任务。随着放射科医生日益短缺,自动化这一任务的价值不断提升。然而,临床应用所需求的不仅仅是固定且看似合理的报告:诊断行为必须适应多样化的临床场景,并支持监管验证。图像分类器等感知模型能够满足这些需求,因为其数值置信度分数可以通过阈值化来权衡灵敏度与特异度,并支持在FDA审批等监管流程中广泛使用的基于ROC的验证(Food, 2007 (https://arxiv.org/html/2608.10505#bib.bib218))。这种阈值控制等同于在模型的ROC曲线上选择工作点,可满足多样的临床需求:急诊分诊需要较低阈值以优先保证灵敏度、减少漏诊,而确诊性评估则需要较高阈值以优先保证特异度、限制不必要的干预。然而,感知模型受限于预定义的类别:分类器可能给出肺炎概率为87%,却无法描述其解剖位置、范围或潜在病因。报告生成模型则提供了互补的能力,能够生成临床报告实践中标准的、开放词汇的表达性文本。然而,这些模型缺乏置信度估计或基于阈值的机制,使其难以被准确评估和调整,最终在通向可信、可部署的临床AI的道路上留下空白(Lin et al., 2024 (https://arxiv.org/html/2608.10505#bib.bib379))。
放射学报告生成通常被视为图像描述任务,并且随着大型视觉—语言模型的最新进展而飞速发展(Chaves et al., 2024 (https://arxiv.org/html/2608.10505#bib.bib242); Hyland et al., 2023 (https://arxiv.org/html/2608.10505#bib.bib244); Chen et al., 2024 (https://arxiv.org/html/2608.10505#bib.bib212); Zhou et al., 2024 (https://arxiv.org/html/2608.10505#bib.bib189); Zhang et al., 2025 (https://arxiv.org/html/2608.10505#bib.bib190); Tu et al., 2024 (https://arxiv.org/html/2608.10505#bib.bib245))。尽管性能不断提升,这种图像描述范式只能生成单一、固定的报告,缺乏调整诊断工作点的机制。虽然文本生成的可控性和置信度估计在通用领域已有研究,但现有工作并未通过类别特定阈值来控制生成文本。例如,一类工作(Dathathri et al., 2019 (https://arxiv.org/html/2608.10505#bib.bib356); Yang and Klein, 2021 (https://arxiv.org/html/2608.10505#bib.bib369))研究可控文本生成,在词元级别引导生成朝向期望属性;另一类工作(Kadavath et al., 2022 (https://arxiv.org/html/2608.10505#bib.bib229); Xiong et al., 2024 (https://arxiv.org/html/2608.10505#bib.bib370))则关注候选答案的基于置信度的自我评估。据我们所知,阈值可控的文本生成在临床部署和监管审批中仍是一个关键但尚未充分探索的问题。
为填补这一空白,我们提出RadFusion,一种阈值可控的放射学报告生成框架,将生成报告的诊断内容与医学图像分类器的ROC特性对齐。RadFusion融合了三个组件:(1)一个分类模型,产生校准后的逐类别置信度分数;(2)一个基于VQA的报告生成模型,产生详细的放射学报告并支持后续查询以获取更多细节;(3)一个现成的大语言模型,将报告改写为使其陈述的诊断与阈值调整后的分类结果一致,同时保持基于报告生成模型发现的事实基础,以保留临床特异性。通过改变阈值,系统可生成覆盖不同诊断工作点的报告,每个工作点对应不同的灵敏度—特异度权衡。此外,由于输出文本在事实上与分类器一致,数值置信度估计可作为文本报告的补充,从而实现基于ROC的监管验证,并简化与自动化系统的集成。
RadFusion是一个可移植框架,广泛适用于各类分类器和报告生成模型。本文进一步研究了每个组件的不同实现方式如何影响最终性能,并通过系统比较确定了最优配置。在MIMIC-CXR(Johnson et al., 2019 (https://arxiv.org/html/2608.10505#bib.bib128))上的实验表明,经阈值调整的报告表现出预期的凹形ROC行为,曲线下面积与底层分类器紧密一致。此外,阈值控制相比无控制的生成方式提升了诊断准确性,在特异度匹配时灵敏度提高6.9%,在灵敏度匹配时特异度提高20.7%。综合来看,这些结果展示了本工作的三项贡献:
- **临床适应性**:临床医生可自定义报告,从而选择与临床场景匹配的工作点。
- **监管验证**:对生成报告进行基于ROC的评估,为监管审批提供了可行路径。
- **诊断准确性**:融合互补的模型类型,比无控制的生成方式具有更高的诊断准确性。
## 2 相关工作
**放射学报告生成。**早期工作将编码器—解码器架构应用于放射学报告生成:R2Gen(Chen et al., 2020 (https://arxiv.org/html/2608.10505#bib.bib209))引入了记忆驱动的Transformer,R2GenCMN(Chen et al., 2022 (https://arxiv.org/html/2608.10505#bib.bib107))增加了跨模态记忆,CvT2DistilGPT2(Nicolson et al., 2023 (https://arxiv.org/html/2608.10505#bib.bib211))结合了视觉Transformer与蒸馏解码器。近期方法利用大型视觉—语言模型,包括LLaVA-Rad(Chaves et al., 2024 (https://arxiv.org/html/2608.10505#bib.bib242))、MAIRA(Hyland et al., 2023 (https://arxiv.org/html/2608.10505#bib.bib244); Bannur et al., 2024 (https://arxiv.org/html/2608.10505#bib.bib363))、CheXagent(Chen et al., 2024 (https://arxiv.org/html/2608.10505#bib.bib212))、MedVersa(Zhou et al., 2024 (https://arxiv.org/html/2608.10505#bib.bib189))、Libra(Zhang et al., 2025 (https://arxiv.org/html/2608.10505#bib.bib190))、MedGemma(Sellergren et al., 2025 (https://arxiv.org/html/2608.10505#bib.bib258))和Med-PaLM M(Tu et al., 2024 (https://arxiv.org/html/2608.10505#bib.bib245))。互补性策略,包括知识驱动建模(Li et al., 2019 (https://arxiv.org/html/2608.10505#bib.bib136); Zhang et al., 2020 (https://arxiv.org/html/2608.10505#bib.bib377))、基于提示的方法(Jin et al., 2024a (https://arxiv.org/html/2608.10505#bib.bib227))、区域引导生成(Tanida et al., 2023 (https://arxiv.org/html/2608.10505#bib.bib257))和检索增强(Sun et al., 2025 (https://arxiv.org/html/2608.10505#bib.bib378)),都提升了事实基础。QRad(Jin et al., (https://arxiv.org/html/2608.10505#bib.bib362))是一种基于预训练MedImageInsight(Codella et al., 2024 (https://arxiv.org/html/2608.10505#bib.bib246))编码器的最先进模型,统一了报告生成与医学VQA任务,并作为我们框架中的报告生成组件。然而,所有这些模型都只能生成单一、固定的报告,缺乏调整诊断行为或选择工作点的机制。
**医学视觉问答。**医学VQA提供了通过自然语言查询提取临床信息的接口(Lau et al., 2018 (https://arxiv.org/html/2608.10505#bib.bib380); He et al., 2020 (https://arxiv.org/html/2608.10505#bib.bib381); Liu et al., 2021 (https://arxiv.org/html/2608.10505#bib.bib382))。Med-Flamingo(Moor et al., 2023 (https://arxiv.org/html/2608.10505#bib.bib291))和LLaVA-Med(Li et al., 2024 (https://arxiv.org/html/2608.10505#bib.bib241))等多模态模型将视觉—语言架构应用于医学领域,而Rad-ReStruct(Pellegrini et al., 2023a (https://arxiv.org/html/2608.10505#bib.bib278))提出了用于结构化报告的分层VQA,RaDialog(Pellegrini et al., 2023b (https://arxiv.org/html/2608.10505#bib.bib279))则将报告生成与多轮对话相结合。由于放射学报告中常见遗漏,我们的框架使用医学VQA从图像中恢复遗漏信息,从而在低阈值将某个发现翻转为阳性时提供有依据的描述。
**可控文本生成。**PPLM(Dathathri et al., 2019 (https://arxiv.org/html/2608.10505#bib.bib356))、FUDGE(Yang and Klein, 2021 (https://arxiv.org/html/2608.10505#bib.bib369))和无分类器引导(Ho and Salimans, 2022 (https://arxiv.org/html/2608.10505#bib.bib374))等可控生成方法在解码过程中引导词元概率朝向期望属性。虽然这些方法在风格或语义控制上有效,但它们不支持类别特定的诊断阈值或工作点选择。
**置信度估计与校准。**现有关于LLM置信度估计的工作包括基于logit的P(True)方法(Kadavath et al., 2022 (https://arxiv.org/html/2608.10505#bib.bib229))、口头化置信度(Xiong et al., 2024 (https://arxiv.org/html/2608.10505#bib.bib370); Li et al., 2025 (https://arxiv.org/html/2608.10505#bib.bib277))、基于采样的自一致性(Wang et al., 2023 (https://arxiv.org/html/2608.10505#bib.bib371))以及链式思维输出的信息几何(Lau et al., 2025 (https://arxiv.org/html/2608.10505#bib.bib6))。校准则通过事后温度缩放(Guo et al., 2017 (https://arxiv.org/html/2608.10505#bib.bib372); Platt, 1999 (https://arxiv.org/html/2608.10505#bib.bib373))或训练期间的适当评分规则(Blasiok et al., 2023 (https://arxiv.org/html/2608.10505#bib.bib275); Fröhlich and Williamson, 2024 (https://arxiv.org/html/2608.10505#bib.bib276))将预测置信度与经验正确性对齐;近期面向特定任务的方法通过均匀质量分箱划分输入空间,以逼近贝叶斯最优校准器(Manggala et al., 2025 (https://arxiv.org/html/2608.10505#bib.bib5))。对于放射学报告生成,Wang et al.(2024 (https://arxiv.org/html/2608.10505#bib.bib375))在训练期间通过不确定性加权损失来考虑置信度,但在推理时未提供控制机制。我们的框架建立在这些基础之上:逐类别置信度分数通过温度缩放进行校准,使阈值可预测地映射到工作点,而基于logit的P(Yes)提取则提供了另一种分类器实现方式。
## 3 方法
### 3.1 概述
RadFusion通过将生成报告的诊断决策*符合*(conform)于在所选阈值下运行的分类模型的决策,同时保留生成模型的临床表现力,从而实现阈值可控的报告生成。它是一个可移植框架,适用于广泛的分类器和报告生成模型。在本节中,我们首先介绍能够产生最优整体性能的实现,然后介绍每个组件的备选设计;这些实现之间的比较将在第5节(https://arxiv.org/html/2608.10505#S5)中讨论。
图1:RadFusion概览,我们的阈值可控报告生成框架。分类模型为预定义疾病类别生成置信度分数,并通过阈值化为二值决策。报告生成模型生成初始报告。LLM改写器将两者的输出结合起来,使报告中的诊断陈述与二值分类结果一致,同时保留临床细节。我们使用QRad作为支持后续问题的报告生成模型,以获取初始报告中遗漏的证据。
如图1(https://arxiv.org/html/2608.10505#S3.F1)所示,RadFusion融合了三个组件:
1. **感知模型**(第3.2节 (https://arxiv.org/html/2608.10505#S3.SS2)):给定一张胸部X光图像,我们使用分类器为K个预定义疾病类别生成数值置信度分数 \(\{P(C_i=1)\}_{i=1}^{K}\)。给定阈值 \(\tau\),它产生二值预测 \(\hat{y}_i = \mathbf{1}[P(C_i=1) > \tau]\),将类别划分为阳性(疾病存在)和阴性(疾病不存在)。
2. **报告生成模型**(第3.3节 (https://arxiv.org/html/2608.10505#S3.SS3)):给定同一张图像,报告生成模型生成一份自由文本的放射学报告 \(r\),描述阳性和阴性发现。与分类器的二值标签相比,这种开放词汇的报告包含更丰富的信息,包括每个发现的解剖位置、严重程度、进展和临床背景。
3. **LLM改写器**(第3.4节 (https://arxiv.org/html/2608.10505#S3.SS4)):一个现成的大语言模型,将分类器的二值决策 \(\hat{y}\) 与报告的详细描述 \(r\) 结合,将报告改写为使其陈述的诊断与阈值化类别对齐,同时保持基于原始报告中临床属性的依据。
通过针对每个类别从0到1扫描阈值 \(\tau\),RadFus...相似文章
ReportQA: 基于问答的放射学报告评估
本文提出了ReportQA,一种基于问答的放射学报告评估框架,利用大语言模型回答临床相关问题,相较于现有指标,与放射科医生判断的一致性更好。
面向交互式放射报告起草的离散扩散语言模型
本文适配了一个混合专家扩散语言模型DiffusionGemma-26B用于交互式放射报告起草,结果表明其在医学视觉问答中匹配或超越自回归模型,解码速度提高3.5-4.4倍,并具备双向填充能力。
AnchorDiff: 拓扑感知的掩码扩散与基于置信度的重写用于放射学报告生成
AnchorDiff提出了一种拓扑感知的掩码扩散框架用于放射学报告生成,整合了基于RadGraph的临床锚点和基于置信度的重写,在MIMIC-CXR和MIMIC-RG4基准测试上取得了最先进的结果。
用于交互式放射学报告起草的离散扩散语言模型
本文改编了一种扩散语言模型用于交互式放射学报告起草,表明其在准确性上与自回归模型相当,同时提供独特的填充能力,使放射科医生能够修复报告片段并让模型填充它们之间的文本。
RadAgent:用于胸部CT逐步解读的工具型AI代理
RadAgent是一种使用工具的AI代理,通过可解释的逐步推理生成胸部CT报告,将临床准确率相对提升36.4%,并实现37%的忠实度——这是现有3D视觉语言模型所不具备的能力。该系统提供完全可检查的推理轨迹,使临床医生能够验证和优化诊断输出。