CT-$\Delta$Bench:面向纵向3D医学影像差异报告与视觉语言模型的基准

arXiv cs.CL 论文

摘要

介绍了CT-ΔBench,这是一个用于纵向3D CT影像差异报告与视觉语言模型的基准,同时包括变化感知指标和基线模型DeltaMed。

arXiv:2608.11534v1 公告类型:新 摘要:在医学影像中,计算机断层扫描(CT)的临床价值不仅在于描述当前疾病状态,更关键的是能够对一系列扫描进行纵向比较,以确定疾病演变——这一过程是疗效评估、复发检测和持续患者管理的基础。然而,尽管时间比较在临床决策中占据核心地位,现有的医学基础模型仍大多局限于单次检查的理解,导致基于时间的对照分析未得到充分解决。为弥补这一空白,我们研究纵向影像差异报告任务,即模型接收同一患者的两次不同时间扫描,并生成描述其间间隔变化的临床有意义报告。我们引入了CT-$\Delta$Bench,一个专门用于该任务的基准,采用患者级划分以防止信息泄漏。为了更好地评估该任务,而不仅仅依赖于表面文本相似性,我们进一步开发了专门用于捕捉临床有意义纵向变化的变化感知指标,并进行了独立医师验证,以评估合成参考和事件提取流程的可靠性。我们还比较了直接配对CT推理与间接两阶段流程(后者首先生成单时间点报告,然后进行文本差异比较)。最后,我们提出了DeltaMed,一个用于直接配对CT差异报告的基线模型,并在基准训练集上对其进行训练。综上,这些贡献为具有时间感知能力的医学基础模型奠定了基础,使其能更好地反映真实世界中的纵向临床推理。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:27

# 面向纵向3D医学影像差异报告的视觉语言模型基准测试 来源:https://arxiv.org/html/2608.11534 Jingbo WangShaogang Ren & Zihao Wang致谢:通讯作者。所属机构:田纳西大学查塔努加分校邮箱:[{hcw575,ydk297,sren9,zihao.wang}@tennessee.edu](mailto:) ###### 摘要 在医学影像中,计算机断层扫描(CT)的临床价值不仅在于描绘当前的疾病状态,更关键的是能够通过纵向比较同一患者的系列扫描来判定疾病演变,这一过程支撑着疗效评估、复发检测以及持续的患者管理。然而,尽管时间比较在临床决策中占据核心地位,现有的医学基础模型仍主要局限于单次检查的理解,对基于时间维度的交叉检查研究关注不足。为填补这一空白,我们研究了纵向影像差异报告任务,该任务要求模型输入同一患者在不同时间点的两次扫描,并生成具有临床意义的报告,描述两次扫描之间的间隔变化。我们引入了CT-ΔBench,一个专为此任务设计的基准测试,采用患者级别的数据划分以防止信息泄露。为更好地评估该任务而不仅仅依赖表面文本相似度,我们还开发了变化感知评估指标,专门用于捕捉具有临床意义的纵向变化,并进行了独立的医师验证以评估合成参考标准及事件提取流程的可靠性。我们还比较了直接成对CT推理与间接两阶段流程(先生成单时间点报告,再进行文本差异比较)。最后,我们提出了DeltaMed,一个用于直接成对CT差异报告的基线模型,并在基准训练集上进行了训练。综上所述,这些贡献为具有时间感知能力的医学基础模型奠定了基础,使其能够更真实地反映现实世界中的纵向临床推理。111代码和数据可在https://huggingface.co/datasets/tangkg/CT-DeltaBench获取 ## 1引言 医学影像在现代临床诊疗中扮演核心角色,X射线、超声、磁共振成像(MRI)和计算机断层扫描(CT)等模态为诊断、治疗规划和疾病监测提供了互补信息<sup>1 (https://arxiv.org/html/2608.11534#bib.bib1);3 (https://arxiv.org/html/2608.11534#bib.bib8)</sup>。在许多场景下,其价值不仅在于描述单次检查,更在于支持跨时间的纵向比较<sup>3 (https://arxiv.org/html/2608.11534#bib.bib2)</sup>。在这些模态中,CT对于癌症监测、治疗后评估以及慢性胸部疾病和进展性疾病的随访尤为重要,临床医生经常需要比较既往和当前扫描,以判断异常是否新出现、进展、消退、消失或保持稳定<sup>8 (https://arxiv.org/html/2608.11534#bib.bib10);3 (https://arxiv.org/html/2608.11534#bib.bib7);2 (https://arxiv.org/html/2608.11534#bib.bib15)</sup>。尽管这一临床重要性显而易见,但自动化放射学报告生成目前仍主要集中在单次检查的理解上。现有的面向CT的报告生成研究和3D医学视觉语言模型仍主要针对单个CT体量生成描述,而非直接对时间配对的扫描进行推理<sup>1 (https://arxiv.org/html/2608.11534#bib.bib11);5 (https://arxiv.org/html/2608.11534#bib.bib12);1 (https://arxiv.org/html/2608.11534#bib.bib3);2 (https://arxiv.org/html/2608.11534#bib.bib13)</sup>。然而,随访解读不仅依赖于*当前存在什么*,还依赖于*发生了什么变化*,而且这种时间判断往往比单一的静态描述更具临床可操作性。这一任务对CT而言尤其具有挑战性,因为成对体量推理计算量大,跨时间点的解剖对应关系往往不完美,且许多临床重要的变化是细微且局部化的<sup>2 (https://arxiv.org/html/2608.11534#bib.bib4)</sup>。此外,在生成时间差异的自然语言摘要时,模型特别容易出现信息遗漏和幻觉<sup>8 (https://arxiv.org/html/2608.11534#bib.bib10);1 (https://arxiv.org/html/2608.11534#bib.bib14);2 (https://arxiv.org/html/2608.11534#bib.bib4)</sup>。因此,纵向CT差异报告比传统的单次CT报告生成要求高得多。为填补这一空白,我们研究了*纵向CT差异报告*,该任务要求模型接收同一患者的两次CT扫描,并生成具有临床意义的间隔变化描述。我们通过建立一个专门的基准CT-ΔBench来解决这一问题,该基准采用患者级别划分,以便在无信息泄露的情况下严格评估成对CT推理。为更好地评估临床有意义的纵向变化,我们进一步开发了变化感知评估指标,其动机源于已知的传统基于文本的指标在放射学报告生成中的局限性<sup>6 (https://arxiv.org/html/2608.11534#bib.bib5);2 (https://arxiv.org/html/2608.11534#bib.bib6)</sup>。最后,我们研究了解此任务的直接和间接两种范式,包括直接成对CT推理、间接两阶段报告差异比较,以及一个专门的基线模型DeltaMed,该模型在基准训练集上进行了训练。本工作的主要贡献如下:1)我们将*纵向CT差异报告*定义为一个独立的基准任务,并引入CT-ΔBench,这是一个具有患者级别划分的新基准,用于系统评估。2)我们开发了变化感知评估指标,超越表面文本相似度,更好地评估临床有意义的纵向变化。3)我们在零样本和微调设置下对多个大型模型进行了基准测试,包括对直接成对CT推理与间接两阶段流程的受控比较。4)我们提出了DeltaMed,一个用于直接成对CT差异报告的基线3D模型,并在基准训练集上对其进行了训练。 ## 2相关工作 ### 2.1单次研究医学影像报告生成 自动医学报告生成主要是在放射学领域得到研究,尤其是在胸部X射线方面,公共数据集如IU X-Ray、MIMIC-CXR和CheXpert推动了大规模图像到文本模型的发展<sup>7 (https://arxiv.org/html/2608.11534#bib.bib16);1 (https://arxiv.org/html/2608.11534#bib.bib17);1 (https://arxiv.org/html/2608.11534#bib.bib18)</sup>。早期方法大多将通用图像描述架构进行改造,以从单张图像或单个检查生成报告,而后续工作则强调长文本生成、更强的视觉-文本对齐、改进的事实一致性,以及更具临床意义的评估<sup>1 (https://arxiv.org/html/2608.11534#bib.bib19);1 (https://arxiv.org/html/2608.11534#bib.bib20)</sup>。最近,这一研究方向已扩展到其他医学影像模态,包括CT、MRI以及体量数据场景,通常由新兴的医学视觉语言模型提供支持。尽管如此,大多数现有方法仍然遵循*单次研究*的范式,即模型一次生成一份单一检查的报告,而不是显式地对同一患者的多次检查之间的时间关系进行推理<sup>2 (https://arxiv.org/html/2608.11534#bib.bib13)</sup>。 ### 2.2纵向医学影像理解 第二条研究思路将时间上下文、既往研究或纵向结构引入医学视觉-语言学习,但其中大部分研究聚焦于胸部X射线而非体量成像。例如,3 (https://arxiv.org/html/2608.11534#bib.bib22)构建了Longitudinal-MIMIC,利用既往胸部X射线和既往报告来改进当前报告起草;BioViL-T显式建模图像-报告序列的时间结构,并引入MS-CXR-T用于时间生物医学视觉-语言评估<sup>3 (https://arxiv.org/html/2608.11534#bib.bib21)</sup>;MAIRA-2则将包含既往检查(如果可用)的实际情况报告上下文纳入接地报告生成<sup>2 (https://arxiv.org/html/2608.11534#bib.bib23)</sup>。更广泛地说,这些研究表明纵向信息可以改善医学影像理解和报告生成。然而,先前的方法通常仍被框定为当前检查报告,其中既往研究仅作为辅助上下文使用,而不是直接生成以总结间隔变化为主要目的的*差异感知*报告<sup>3 (https://arxiv.org/html/2608.11534#bib.bib22);2 (https://arxiv.org/html/2608.11534#bib.bib23);3 (https://arxiv.org/html/2608.11534#bib.bib21)</sup>。此外,现有的大部分工作仍集中在2D胸部X射线,而非配对的体量CT推理。相比之下,我们的基准聚焦于直接成对CT推理和临床有意义的纵向变化的显式评估。 ### 2.3医学报告生成的基准与评估 公共数据集和基准对医学报告生成研究至关重要。经典资源如IU X-Ray、MIMIC-CXR和CheXpert支撑了大部分胸部X射线文献<sup>7 (https://arxiv.org/html/2608.11534#bib.bib16);1 (https://arxiv.org/html/2608.11534#bib.bib17);1 (https://arxiv.org/html/2608.11534#bib.bib18)</sup>,而较新的基准如CT-RATE、RadBench和M3D-Bench则将范围扩展至3D影像、多模态交互和通用医学基础模型<sup>2 (https://arxiv.org/html/2608.11534#bib.bib24);1 (https://arxiv.org/html/2608.11534#bib.bib11)</sup>。尽管取得了这些进展,大多数现有基准仍主要评估单次研究描述、分类、检索或问答,而不是显式的跨时间点差异报告。评估同样已成为一项主要挑战。传统词汇指标如BLEU和ROUGE易于计算,但往往与临床正确性的相关性较差。为解决这一问题,前人研究引入了更多报告感知和事实感知的评估方法。CheXbert从放射学报告中提取结构化标签用于基于标签的评估<sup>2 (https://arxiv.org/html/2608.11534#bib.bib25)</sup>,RadGraph定义了放射学文本中实体和关系的图模式<sup>1 (https://arxiv.org/html/2608.11534#bib.bib14)</sup>,Yu等人表明RadGraph F1和RadCliQ与放射科医生判断的相关性优于纯词汇指标<sup>2 (https://arxiv.org/html/2608.11534#bib.bib4)</sup>。最近,GREEN利用大语言模型以更可解释的方式识别临床显著报告错误<sup>2 (https://arxiv.org/html/2608.11534#bib.bib6)</sup>。总体而言,这些研究表明医学报告评估应超越表面相似度,走向事实和临床意义上的正确性。 ## 3基准 ### 3.1问题定义 参见图1:*纵向CT差异报告*的任务示例。给定同一患者的既往CT扫描It1I_{t_{1}}和随访CT扫描It2I_{t_{2}},模型生成差异感知报告RΔR_{\Delta},描述具有临床意义的间隔变化,如新出现、消失、增大、减小或稳定的发现。我们研究*纵向CT差异报告*,这是一个基准任务,评估模型是否能对同一患者在不同时间点获取的两次CT扫描进行推理,并生成描述间隔变化的具有临床意义的报告(图1 (https://arxiv.org/html/2608.11534#S3.F1))。形式上,每个样本由配对输入(It1,It2)(I_{t_{1}},I_{t_{2}})组成,其中It1I_{t_{1}}和It2I_{t_{2}}分别表示较早和随访的CT扫描。目标输出是一个差异感知报告RΔR_{\Delta},总结两次检查之间临床相关的时间变化,例如新出现的发现、进展、消退、消失或稳定。与传统的单次CT报告生成相比,该任务需要显式的跨时间点推理。基准的设计目标不仅是评估模型是否能分别描述每次扫描,还要求其能够正确识别并提供有意义的临床变化描述。 ### 3.2基准构建 我们在CT-RATE<sup>1 (https://arxiv.org/html/2608.11534#bib.bib9)</sup>(一个包含3D CT体积和放射学报告的公共数据集)的基础上建立了纵向基准。我们筛选出具有多次CT检查的患者,通过为同一患者选择不同时间点的两次扫描来形成纵向配对,分别记为较早扫描It1I_{t_{1}}和随访扫描It2I_{t_{2}}。其对应的放射学报告记为Rt1R_{t_{1}}和Rt2R_{t_{2}}。CT-RATE提供了不同时间点的报告数据,但未包含明确的临床有意义的纵向描述。我们使用Gemini-2.5-Flash为每个配对样本构建纵向目标报告。具体来说,仅使用既往和随访报告中的“发现”和“印象”部分作为模型输入。给定Rt1R_{t_{1}}和Rt2R_{t_{2}}中的源部分,模型被指示生成一份临床基础性差异报告,以放射学风格的自然语言仅总结两次研究之间的间隔变化。提示语明确鼓励聚焦变化的总结,同时避免复制或详尽复述原始报告的完整内容。如图2 (https://arxiv.org/html/2608.11534#S3.F2)(a)所示,提取的报告部分被传递给Gemini-2.5-Flash,以生成包含“差异发现”和“差异印象”的结构化参考差异报告。合成的报告记为RΔR_{\Delta}。它作为纵向CT差异报告的参考目标,聚焦于时间变化描述,而非单时间点报告重建。因此,每个基准样本表示为一个三元组:(It1,It2,RΔ)(I_{t_{1}},I_{t_{2}},R_{\Delta}),其中输入是配对的CT检查,输出是差异感知报告。这种构建方式支持对纵向配对CT推理和聚焦变化的报告生成进行系统评估。生成的基准被划分为训练集和验证集,分别用于模型训练和评估。为防止各子集之间的信息泄露,我们按患者级别进行划分。具体来说,基准中的每个配对CT-报告样本均来自不同的患者。训练集包含2,638个配对检查,验证集包含169个配对检查。参见图2:CT-ΔBench基准构建和评估概览。(a) 基准构建。对于同一患者的每个纵向CT对,我们仅保留既往和随访放射学报告中的“发现”和“印象”部分,并提示Gemini-2.5-Flash合成一份包含“差异发现”和“差异印象”的参考差异报告。(b) 评估指标。模型生成的差异报告使用通用文本指标(ROUGE-L、BERTScore和BLEURT)和变化感知指标进行评估。在变化感知评估中,使用Qwen-14B提取具有五种变化类型(新出现、消失、增大、减小和稳定)的原子变化事件,然后进行事件级别匹配以计算Change-F1、Mis

相似文章

DataComp-VLM:面向视觉语言模型的改进型开放数据集

Hugging Face Daily Papers

本文介绍了DataComp-VLM(DCVLM),这是一个用于评估视觉语言模型数据策展策略的综合基准。作者发现,数据混合而非数据过滤能显著提升性能,由此产生的DCVLM-Baseline数据集在33项下游任务中取得了最先进的结果。

重新审视用于3D CT报告生成的LLM适配:规模与诊断先验研究

arXiv cs.CL

本文研究了将大语言模型适配到3D CT报告生成的参数高效策略,提出了RAD3D-Prefix,一个轻量级的诊断先验条件框架,该框架保持LLM冻结,仅需极少的可训练参数。结果表明,冻结更大的LLM(约10亿参数以上)并仅训练轻量级投影层,能够在性能、泛化能力和计算效率之间实现更优的权衡。

IMCBench:面向图像基础医疗对话的多模态大语言模型基准

arXiv cs.AI

IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。