@MSFTResearch:放射学AI正在超越报告生成。CARE-X探索了一种统一方法,结合灵活推理、……

X AI KOLs Timeline 模型

摘要

微软研究院推出了CARE-X,一个统一的胸部X射线视觉-语言模型,它结合了灵活推理、校准预测和工具增强测量,用于临床有用的放射学解读。

放射学AI正在超越报告生成。CARE-X探索了一种统一方法,结合灵活推理、校准预测和基于测量的工具,用于胸部X射线解读。https://t.co/LDCVgTxH2t https://t.co/GHoOTbv2lx
查看原文
查看缓存全文

缓存时间: 2026/08/12 10:21

放射学AI正在超越报告生成。CARE-X探索了一种统一的方法,结合灵活推理、校准预测和基于测量的工具,用于胸部X光解读。https://t.co/LDCVgTxH2t https://t.co/GHoOTbv2lx


放射学AI的新方法

来源:https://www.microsoft.com/en-us/research/blog/introducing-care-x-towards-clinically-useful-radiology-vlms-with-auxiliary-supervision-reward-aligned-learning-and-tool-augmented-measurement/ 工具增强型放射学视觉语言模型(VLM)工作流示意图。一个编排器将用户的图像查询路由到VLM,VLM执行图像分析,调用测量工具计算心脏宽度、胸腔宽度和心胸比(CTR),并返回带有视觉叠加层的诊断指标。研究说明:CARE-X是一个研究模型,不是微软的产品或许可的医疗设备。它尚未获得任何监管机构的批准或许可,不用于临床诊断、筛查或患者护理。下文所述结果为回顾性研究发现,并不证明CARE-X在任何临床使用中的安全性、有效性或适用性。提及潜在工作流仅描述未来研究领域,并非当前可用的能力或推荐用途。

概览

  • 挑战:胸部X光解读涉及多种任务,既需要富有表现力的报告生成,也需要校准的诊断预测。
  • CARE-X是一个统一的胸部X光VLM,面向多样化的临床解读任务。它结合生成和结构化预测,提供自由文本推理和确定性输出。
  • CARE-X使用强化学习(DAPO)在多任务环境中奖励临床正确性。
  • 在与CARE-X分开的实验中,我们将Qwen3-VL-4B-Instruct与确定性测量工具配对,评估直接计算是否能在依赖测量的条件下比单独视觉近似带来更好的性能。
  • 在来自Narayana Health的真实印度临床数据上进行了验证,包括罕见的ICU病理学和CT确认的扩大相关疾病。

放射科医生的需求:任务多样性、灵活性和临床保真度

一个临床有用的放射学AI系统必须支持广泛的任务,适应不同的工作流,并产生医学上准确的输出。

放射科医生和其他临床医生使用胸部X光有多种不同目的。一个临床有用的AI系统必须能够支持这些任务。它可能被要求生成详细的发现和简洁的印象用于报告,回答关于发现存在、不存在或位置的问题,识别医疗设备并评估其位置,或精确定位图像中异常出现的位置。

这些任务也需要不同类型的输出,从叙述性报告到校准的诊断分数。最重要的是,它们需要临床准确性。一份报告如果遗漏了一个发现、反转了否定表达或错误识别了位置,即使表面看起来写得完美,在临床上也是错误的。某些发现在一种情境中可能无关紧要,在另一种情境中却至关重要。

CARE-X(https://www.microsoft.com/en-us/research/publication/care-x-towards-clinically-useful-radiology-vlms-with-auxiliary-supervision-reward-aligned-learning-and-tool-augmented-measurement/)被开发为一个研究模型,用来探索统一方法如何应对这些多样化需求。该系统结合了生成和判别能力、临床对齐优化以及基于工具的推理,以支持更广泛的放射学工作流,同时保持临床保真度。

视频系列

On Second Thought with Sinead Bovell (https://www.microsoft.com/en-us/research/story/on-second-thought/)

On Second Thought

一个由Sinead Bovell主持的视频系列,围绕人们对AI的各种疑问展开。来自微软内部的专家声音,我们将解读这一快速变化技术的张力与前景,探索正在演变的可能。

当前放射学视觉语言模型的不足

尽管近期模型在任务广度上令人印象深刻,但放射科医生的需求与当前系统所能提供的之间仍存在关键差距:

  1. **缺乏用于诊断决策的校准置信度。**生成式VLM以自由文本形式预测诊断,但通常不提供校准的置信度分数。在临床环境中,置信度很重要。临床医生无法在不同临床情境中调节敏感度-特异度的权衡——这是实际部署的重要要求。判别式模型提供了这些特性,但缺乏开放式生成的灵活性。
  2. **交叉熵损失不优化临床保真度。**标准训练方法将所有token级错误同等对待,无论其临床后果如何。一个坐标错误可能不会比一个无害的措辞变化受到更多惩罚。一个“是”可能被翻转为“否”,尽管临床意义完全不同。遗漏一个危及生命的发现可能和忽略一个次要观察受到相同的训练惩罚。因此,模型并没有被显式优化以关注患者护理中最重要的事项。
  3. **缺乏处理依赖测量的发现的能力。**一些放射学发现不仅仅需要视觉识别。心脏增大、纵隔增宽等放射学征象依赖于精确测量。例如,模型可能正确识别胸部X光片是AP位还是PA位采集,但确定心脏增大需要测量心脏宽度和胸腔宽度并确定心胸比。这些量应当被测量和计算,而不是在考虑投照体位、曝光、患者旋转等变量时进行视觉近似。

综合来看,这些差距需要的不仅仅是一个流畅的生成模型。系统必须结合广泛的任务覆盖、结构化预测、临床对齐优化,以及在需要直接测量的地方引入定量工具。


CARE-X:单一模型,灵活输出

CARE-X将多样化解读能力集成到一个模型中,根据各任务需求采用生成式或双模式推理:

任务类型CARE-X的功能推理模式
报告生成:发现生成详细的发现部分生成式
报告生成:印象生成简洁的诊断印象生成式
存在性和否定评估判断病理是否存在并处理否定表达双模式:生成式 + 辅助头
疾病定位评估识别异常出现的位置生成式
细粒度多标签疾病分类跨多个标签对异常进行分类生成式
多标签管路和导线分类识别可见的医疗设备生成式
管路和导线异常位置检测判断设备位置是否正确双模式:生成式 + 辅助头
异常短语定位定位所描述的病理发现双模式:生成式 + 辅助头
解剖结构定位定位29个解剖区域双模式:生成式 + 辅助头

表1:CARE-X任务覆盖和推理模式

双模式推理意味着单次前向传播同时产生自回归响应和带有置信度分数的结构化辅助头预测。这提供了自由文本的灵活性,同时在需要工作点控制的任务中提供可调节阈值的输出。

CARE-X架构和训练方法

CARE-X构建在SigLIP2-so400M视觉编码器和Phi-4-mini-instruct(3.8B)语言模型之上,通过轻量级适配器连接。为了同时支持自由文本生成和结构化临床预测,模型在共享语言主干上增加了任务特定辅助头,用于分类和视觉定位。这些辅助头提供校准的诊断预测和空间定位信号,同时与生成式语言模型共享表示。它们不是独立训练,而是与语言建模目标共同训练,使结构化监督能够丰富共享表示,并提升同一任务上的生成性能。

**训练。**CARE-X采用三阶段监督微调流程(视觉预训练、适配器/辅助头训练和LoRA适配),随后进行基于DAPO的强化学习。DAPO针对临床报告、诊断准确性和空间定位质量优化任务特定奖励。

CARE-X架构,包含SigLIP2视觉编码器、Phi-4-mini主干、分类和定位辅助头、语言建模以及用于报告生成、VQA和定位的DAPO对齐。图1:CARE-X模型。(左)带任务特定辅助头的监督微调——分类、定位和语言建模——共享同一个Phi-4-mini-instruct主干。分类头输出校准的P(是)/P(否)分数;定位头输出带置信度的边界框坐标;语言建模头生成自由文本响应。(右)DAPO在报告生成、定位和VQA之间使用任务特定奖励进行多任务强化对齐。

辅助监督:结构化预测增强生成

这项工作的一个核心发现是,将判别式辅助头与生成式VLM共同训练能够丰富共享表示,从而在同一任务上获得更强的生成性能,同时提供校准的结构化预测。

定位改进

辅助定位头在生成式解码基础上持续改善定位性能。在解剖结构定位(Chest ImaGenome)上,mAP和mIoU分别提升+28.2个百分点和+6.2个百分点;而在短语定位(PadChest)上获益最大,mAP提升+24.6个百分点,mIoU提升+14.1个百分点。复合空间损失增强了共享表示中的几何精度。

DAPO弥补了与专用检测头之间的差距

经DAPO训练的生成输出接近或超过SFT辅助检测头。在解剖结构定位上,CARE-X生成式输出(0.868 mAP)超过了SFT检测头(0.865)。这具有实际意义——它表明奖励对齐学习可以让自回归空间解码达到与结构化预测相同的水平,从而在测试时无需辅助头,为临床医生提供单一的生成式推理模式。

可调工作点的校准分类

除了表示丰富之外,分类头还提供了独特的部署优势:具有可调阈值的校准概率分数允许临床医生通过单次前向传播在高敏感度筛查和高特异度确认之间切换——这是纯生成式架构无法提供的能力。

模型推理设置敏感度 ↑PPV ↑F1 ↑
CARE-X生成式0.9320.8950.913
CARE-X(Th=0.5)辅助头0.9430.8850.913
CARE-X(Th=0.6)辅助头0.8550.9270.890
CheXOne生成式0.8780.8540.866
MedGemma生成式0.7980.8860.839

表2:Chest ImaGenome上的异常分类性能。可调阈值支持工作点选择。


在四个基准上表现强劲的报告生成

在论文的比较范围内,CARE-X在MIMIC-CXR、IU-Xray、CheXpert-Plus和ReXGradient上的大多数报告指标上取得了最强性能。CRIMSON是一个保留度量,用于评估异常发现并按临床严重程度加权错误,结果表明这些提升反映了具有临床意义的改进,而不仅仅是针对特定奖励的优化。

CARE-X与基线报告生成模型在四个胸部X光数据集——ReXGradient、MIMIC-CXR、IU-Xray和CheXpert-Plus上的CRIMSON分数(↑)。CARE-X(高亮)在每一个数据集上都取得了最高CRIMSON分数。图2:CARE-X与基线报告生成模型在四个胸部X光数据集——ReXGradient、MIMIC-CXR、IU-Xray和CheXpert-Plus上的CRIMSON分数(↑)。CARE-X(高亮)在每一个数据集上都取得了最高CRIMSON分数。

CARE-X在ReXVQA上达到94%准确率

截至2026年8月,CARE-X在ReXrank RexVQA排行榜上排名第一(在新标签页中打开)(https://rexrank.ai/)。在ReXVQA基准(41,007个跨五个临床相关类别的问答对)上,CARE-X达到了94%的总体准确率,比排名第二的公开模型高出六个百分点。

雷达图比较了三个模型在六个类别上的ReXVQA准确率:CheXOne-R1、MedGemma和CARE-X。图3:ReXVQA在五个发现质量维度——否定、存在性、位置、鉴别诊断、几何信息和总体上的准确率。CARE-X在每个轴上均一致优于CheXOne-R1和MedGemma,在鉴别诊断、位置评估和否定方面的优势最大。


一些放射学发现依赖于定量测量而非视觉模式。在与CARE-X分开的实验中,我们构建了一个推理时流水线,将Qwen3-VL-4B-Instruct与确定性测量工具结合,使模型能够在图像理解和精确计算之间交替。Qwen3-VL-4B-Instruct在整个推理过程中保持对X光片的视觉访问,调用工具来识别解剖标志、计算测量值,并按需评估诊断阈值。这创建了一个多轮推理循环,将感知和测量交织在一起,使模型能够在做出诊断之前结合视觉上下文和精确的定量证据。

示意图展示了医疗助理使用视觉语言模型(VLM)分析胸部X光图像并提供诊断指标的工作流。关键组件包括处理提示和工具调用的编排器、执行感知和工具调用来测量心脏和胸腔宽度的助理,以及通过视觉叠加层和以红蓝显示的计算心胸比(CTR)综合诊断。*图4:工具增强的定量推理流水线。编排器调解多轮循环:VLM对图像进行推理(感知),发出结构化工具调用,接收确定性结果,并综合最终诊断。*尽管不需要任务特定训练,但这种方法在所有评估的基于测量的条件上显著优于仅感知推理。结果表明,对于依赖阈值的诊断,直接计算临床定义的测量值比单独采用视觉近似更可靠。

更广泛地说,这种测量增强方法可以扩展常规从胸部X光片中获得的定量评估集合,从而增强临床工作流。例如,主动脉扩张通常不在胸部X光片上量化,往往仅在其他适应证的CT扫描中偶然发现。由于延迟检测可能导致不良心血管结局,可靠的基于胸部X光片的筛查可以更早识别和随访主动脉扩张。

条件感知F1工具F1Δ F1
心脏增大74.5696.00+21.4
纵隔增宽72.6397.47+24.8
主动脉结增大60.3199.76+39.5
升主动脉增大39.33100.00+60.7
降主动脉增大†28.57100.00+71.4
平均值+43.6

表3:仅感知与工具增强测量的对比。五个条件的平均F1提升为43.6个百分点。


在印度临床数据上的验证:罕见ICU条件和CT确认的

相似文章

RadAgent:用于胸部CT逐步解读的工具型AI代理

Hugging Face Daily Papers

RadAgent是一种使用工具的AI代理,通过可解释的逐步推理生成胸部CT报告,将临床准确率相对提升36.4%,并实现37%的忠实度——这是现有3D视觉语言模型所不具备的能力。该系统提供完全可检查的推理轨迹,使临床医生能够验证和优化诊断输出。