语料库特征分析与逆向宪法微调用于风格感知放射学报告

arXiv cs.CL 论文

摘要

本文提出一种方法,利用语料库特征分析和逆向宪法微调来提升AI生成放射学报告与真实放射科医生写作风格的对齐度。该方法在文本对齐指标上取得显著改进,验证了其在风格感知报告生成中的有效性。

arXiv:2609.14226v1 公告类型:新 摘要:自动放射学报告生成在诊断准确性上已快速发展,但生成的报告在结构、用词和不确定性表达等方面常偏离真实放射科医生的写作规范,直接影响临床医生的信任和用户体验。为解决此问题,我们使用Bio-ClinicalBERT嵌入、UMAP降维和HDBSCAN聚类对CheXpert Plus数据集中的2,000份报告进行风格变异分析,识别出五种不同的报告模式,它们在病理焦点、叙事结构和词汇偏好上各有差异。基于这些发现,我们调整逆向宪法AI框架,从放射科医生撰写的报告对中推导出风格导向的宪法,无需正式偏好数据集。该宪法编码了语气、用词、不确定性校准和报告结构的规范,并纳入MedGemma-4B基础模型在25,245个CheXpert Plus训练对上的监督微调。宪法微调显著提升文本对齐度(BLEU-4:从0.006升至0.308;ROUGE-L:从0.171升至0.484),相比未微调基线。这些增益体现了结构和词汇对齐的质变,而非边际改进,因为基线模型因格式不匹配得分接近零。总体而言,我们确立语料库级风格表征和宪法建模作为生成符合真实放射科医生写作规范的放射学报告的有效且高效数据策略。
查看原文
查看缓存全文

缓存时间: 2026/09/15 08:51

# 语料库特征化与逆向宪法式微调在风格感知放射学报告生成中的应用
来源:https://arxiv.org/html/2609.14226
Elijah Renner  
所属机构:斯坦福大学 [email protected]  
Rayan Ansari  
所属机构:斯坦福心血管研究所 斯坦福大学 [email protected]  
Alaa Youssef  
所属机构:斯坦福大学医学院放射科 [email protected]

###### 摘要

自动化放射学报告生成在诊断准确性方面已取得快速发展,但生成的报告在结构、措辞和不确定性表达等方面,经常偏离真实放射科医生写作风格的惯例。这一差距直接影响临床医生的信任度和用户体验。为此,我们使用Bio-ClinicalBERT嵌入、UMAP降维和HDBSCAN聚类技术,对来自CheXpert Plus数据集的2000份报告进行了风格变异特征分析,识别出五种不同的报告模式,它们在病理重点、叙事结构和词汇偏好上存在差异。基于这些发现,我们调整了逆向宪法AI框架,从放射科医生撰写的报告对中推导出以风格为重点的宪法,无需正式的偏好数据集。这份宪法编码了语气、措辞、不确定性校准和报告结构等方面的规范,并将其纳入到MedGemma-4B基础模型在25,245个CheXpert Plus训练对上的监督微调过程。宪法式微调使文本对齐度显著提升(BLEU-4: 0.006→0.308; ROUGE-L: 0.171→0.484),相较于未微调的基线模型效果明显。这些增益体现了结构和词汇对齐的质变而非边际改进,因为基线模型由于格式不匹配产生了接近零的分数。总体而言,我们证明了语料库级别的风格特征分析和宪法建模是一种有效且数据高效的方法,能够生成符合真实放射科医生写作惯例的放射学报告。

###### 索引词:

风格,宪法AI,放射学报告,报告生成

## I 引言

### I-A 问题陈述

放射学报告是放射科医生将影像学发现转化为临床指导的主要媒介,它将观察、解读和诊断印象综合成一份文件,为下游诊疗决策提供依据\[1 (https://arxiv.org/html/2609.14226#bib.bib8)\]。有效的报告不仅要求诊断准确,还需要正确的语法、主动语态、明确的措辞和逻辑组织,以确保发现被正确理解和采取行动\[1 (https://arxiv.org/html/2609.14226#bib.bib8)\]。风格失败的临床代价是巨大的,因为无法清晰有效地沟通结果是放射科医生被提起医疗事故诉讼的三大最常见理由之一\[2 (https://arxiv.org/html/2609.14226#bib.bib9)\]。然而,风格仍然是自动化报告生成中很大程度上未被探索的维度。

大型语言模型(LLMs)和视觉-语言模型的最新进展,使得自动化系统能够生成诊断内容日益强大的胸片报告\[3 (https://arxiv.org/html/2609.14226#bib.bib6),4 (https://arxiv.org/html/2609.14226#bib.bib11)\]。在前瞻性临床环境中,AI辅助的草稿报告已被证明在保持临床质量的同时,将文档编写时间缩短了15%以上\[5 (https://arxiv.org/html/2609.14226#bib.bib27)\],并且AI生成的报告在准确性和放射科医生信心方面被评为与人工撰写报告相当或更优\[6 (https://arxiv.org/html/2609.14226#bib.bib26)\]。然而,该领域主要关注通过测量CheXbert标签一致性和RadGraph F1来评估临床准确性,而相对较少关注生成的报告是否符合真实放射科医生写作风格的惯例。这一差距在临床上意义重大:一份事实完整但风格错位(例如,使用被动结构、过度模糊表达、非标准章节排序或非常规词汇)的报告可能阻碍临床决策,并削弱从业人员对自动化输出的信任。同时,标准的词汇重叠度量指标(如BLEU和ROUGE)会对表面形式不同但语义有效的报告进行惩罚,而未评估临床正确性\[7 (https://arxiv.org/html/2609.14226#bib.bib23),8 (https://arxiv.org/html/2609.14226#bib.bib18)\]。因此,需要一种能够明确表征和强制执行写作风格的方法,以弥合这一建模和评估的差距。

### I-B 相关工作

放射学报告的自然语言处理(NLP)。大量工作将NLP应用于放射学报告,任务包括标签提取、发现分类和报告摘要生成\[9 (https://arxiv.org/html/2609.14226#bib.bib10)\]。领域自适应编码器,如Bio-ClinicalBERT\[10 (https://arxiv.org/html/2609.14226#bib.bib20)\]和RadBERT\[11 (https://arxiv.org/html/2609.14226#bib.bib19)\],在报告摘要生成和异常句子分类等放射学特定任务上,性能优于通用领域BERT模型。结构化标注工具,如CheXbert\[12 (https://arxiv.org/html/2609.14226#bib.bib7)\],能够从自由文本报告中自动提取14种放射学表现。NLP流程已被应用于广泛的放射学任务,包括检测初步报告与最终报告之间的差异\[13 (https://arxiv.org/html/2609.14226#bib.bib13)\]、描述随时间变化的表现及其临床意义\[14 (https://arxiv.org/html/2609.14226#bib.bib14)\],以及识别如肺结节等偶然发现\[15 (https://arxiv.org/html/2609.14226#bib.bib16)\]。基于模板的生成方法,例如"替换并报告"(Replace and Report)\[16 (https://arxiv.org/html/2609.14226#bib.bib15)\],通过识别异常发现并将其替换到正常报告模板中来构建报告,在IU X-Ray和MIMIC-CXR数据集上,在BLEU、ROUGE-L、METEOR和CIDEr指标上相较于端到端基线实现了显著改进。

风格感知生成。尽管写作惯例具有临床重要性,但风格在自动化报告生成中受到的关注相对较少。Yan等人\[17 (https://arxiv.org/html/2609.14226#bib.bib12)\]提出了一种将内容与风格解耦的两步方法:一个专用模型提取临床实体并将其表示为序列化的RadGraph格式,然后一个冻结的LLM使用少量放射科医生示例,以目标作者的风格将该内容具体化。他们的人工评估发现,超过75%的情况下,AI生成的报告与真实报告无法区分,尽管标准NLP指标并未提高。最近,Delbrouck等人\[18 (https://arxiv.org/html/2609.14226#bib.bib21)\]引入了结构化放射学报告生成(SRRG),它使用GPT-4将来自MIMIC-CXR和CheXpert Plus\[19 (https://arxiv.org/html/2609.14226#bib.bib3)\]的自由文本报告重新格式化为标准化的解剖学章节结构,认为现有数据集中的风格变异性损害了生成一致性和评估可靠性。

宪法与基于对齐的方法。宪法AI(CAI)\[20 (https://arxiv.org/html/2609.14226#bib.bib4)\]提供了一个原则性框架,通过一套自然语言原则将行为准则嵌入语言模型。Findeis等人\[21 (https://arxiv.org/html/2609.14226#bib.bib5)\]引入了逆向宪法AI(ICAI),它逆转了这一过程:给定一个成对偏好数据语料库,ICAI使用LLM生成候选原则,按语义相似性进行聚类以消除冗余,并在数据上验证每个原则的预测能力。Henneking和Beger\[22 (https://arxiv.org/html/2609.14226#bib.bib17)\]进一步完善了ICAI算法,证明改进的原则生成和嵌入过程提高了提取的宪法在合成和现实世界数据集上的准确性和泛化能力。我们的工作将这个框架调整到医学领域,从放射科医生撰写的报告中提取风格原则,而不需要正式的偏好数据集。

评估指标。先前的研究已经指出BLEU和ROUGE在放射学报告评估方面的根本局限性\[7 (https://arxiv.org/html/2609.14226#bib.bib23),23 (https://arxiv.org/html/2609.14226#bib.bib22)\]:词汇重叠指标无法区分风格上恰当的释义与临床错误的内容,并且与专家放射科医生的偏好没有可靠的相关性。ReEvalMed\[8 (https://arxiv.org/html/2609.14226#bib.bib18)\]进一步表明,生成的报告在标准指标上得分很高,但未能捕捉到具有临床意义的错误或区分错误严重程度。临床指标如RadGraph F1\[24 (https://arxiv.org/html/2609.14226#bib.bib30)\]和CheXbert标签一致性\[12 (https://arxiv.org/html/2609.14226#bib.bib7)\]解决了事实正确性问题,但未捕捉风格。GREEN指标\[7 (https://arxiv.org/html/2609.14226#bib.bib23)\]使用LLM来识别和分类临床显著错误,提供了一种更具可解释性且与专家判断一致的评估方式。CXPMRG-Bench\[25 (https://arxiv.org/html/2609.14226#bib.bib24)\]等基准测试为在CheXpert Plus上比较生成模型提供了标准化的基线。我们的工作使用BLEU-4和ROUGE-L作为风格对齐的代理指标,并将在这些已知局限性的背景下讨论这一选择的含义。

### I-C 贡献

本工作的贡献如下:

- •我们系统地表征了CheXpert Plus放射学报告子集\[19 (https://arxiv.org/html/2609.14226#bib.bib3)\]中的风格变异,通过Bio-ClinicalBERT嵌入\[10 (https://arxiv.org/html/2609.14226#bib.bib20)\]、UMAP降维\[26 (https://arxiv.org/html/2609.14226#bib.bib28)\]和HDBSCAN聚类\[27 (https://arxiv.org/html/2609.14226#bib.bib29)\]识别出五个不同的报告聚类。
- •我们构建了一个以风格为重点的宪法,该宪法基于逆向宪法AI\[21 (https://arxiv.org/html/2609.14226#bib.bib5),22 (https://arxiv.org/html/2609.14226#bib.bib17)\]的原则推导而来,捕捉了语气、措辞、不确定性表达、结构和临床伦理方面的惯例,无需正式的偏好数据集。
- •我们证明了对MedGemma-4B\[28 (https://arxiv.org/html/2609.14226#bib.bib25)\]进行宪法式监督微调,显著提高了与放射科医生写作风格的词汇对齐度,相较于未微调的基线模型,BLEU-4提高了5000%,ROUGE-L提高了183%。
- •我们提供了一种可复制的方法论,用于从成对的临床文本语料库中提取特定领域的风格宪法,其潜在适用性可扩展到放射学之外的其他结构化文档任务。

## II 方法

### II-A 数据描述

我们使用来自斯坦福AIMI中心的CheXpert Plus数据集\[19 (https://arxiv.org/html/2609.14226#bib.bib3)\]。CheXpert Plus包含223,462张胸片及其配对的去识别化全文放射学报告,提供图像-报告对,其中报告对于风格分析至关重要。

使用CheXbert\[12 (https://arxiv.org/html/2609.14226#bib.bib7)\]对放射科医生的报告进行标注,我们分析了标签分布。这些标签对应于每种放射学表现的阳性、阴性和不确定提及。

表I:CheXbert标签在放射科医生报告中的分布

### II-B 报告特征化

为了表征CheXpert Plus报告中存在的风格和疾病层面的变异,我们使用CheXbert\[12 (https://arxiv.org/html/2609.14226#bib.bib7)\]对具有代表性的放射科医生撰写报告样本进行标注,为14种放射学表现中的每一种生成阳性、阴性和不确定的注释。然后,我们使用Bio-ClinicalBERT\[10 (https://arxiv.org/html/2609.14226#bib.bib20)\](一个在临床出院记录上预训练的领域自适应编码器)为随机选择的2000份报告子集生成密集的语义嵌入。为了使高维嵌入空间更容易聚类,我们应用UMAP\[26 (https://arxiv.org/html/2609.14226#bib.bib28)\]进行非线性降维,随后使用HDBSCAN\[27 (https://arxiv.org/html/2609.14226#bib.bib29)\],这是一种基于密度的算法,能够识别任意形状的聚类,无需预定义聚类数量。此过程产生了五个离散的聚类。对于每个聚类,我们检查了CheXbert标签的分布、特定放射学表现的分布以及词汇特征的模式,为后来在宪法中编码的风格成分提供了经验基础。

请参见标题

图1:三种主要方法的流程:报告特征化、宪法生成和MedGemma微调。

### II-C 宪法生成

我们利用逆向宪法AI的原则来创建一个控制生成报告风格的宪法。由于缺乏偏好数据集,我们调整了Findeis等人\[21 (https://arxiv.org/html/2609.14226#bib.bib5)\]的框架,用成对的放射科医生撰写报告代替传统的偏好注释。提示一个LLM从每对报告中提取共享的风格特征,包括重复出现的句法模式、领域特定词汇、短语和结构。在解析所有提取的特征后,我们按Henneking和Beger\[22 (https://arxiv.org/html/2609.14226#bib.bib17)\]完善的“生成-聚类-去重”流程,将相似的特征聚类在一起并移除重复项,以产生一套紧凑且无冗余的指南。最终,宪法包含了输出和写作指南的说明,并纳入了诸如保护机密性和避免过度自信推测等伦理考量。

### II-D MedGemma监督微调

我们在从CheXpert Plus\[19 (https://arxiv.org/html/2609.14226#bib.bib3)\]中抽取的25,245个图像-报告训练对子集上,对MedGemma-4B\[28 (https://arxiv.org/html/2609.14226#bib.bib25)\]进行了监督微调(SFT)。一个静态的系统提示,应用于所有训练示例,嵌入了生成的宪法以及明确的结构指令,指示模型生成包含五个标准化章节的报告:\[NARRATIVE\](叙述)、\[HISTORY\](病史)、\[COMPARISON\](比较)、\[IMPRESSION\](印象)和\[SUMMARY\](总结)。这种结构化输出格式便于评估时与参考报告进行章节级别的比较,并符合文献中呼吁更一致、结构化临床报告的主张\[18 (https://arxiv.org/html/2609.14226#bib.bib21)\]。

### II-E 评估

为了量化宪法式微调对输出质量的影响,我们使用BLEU-4\[29 (https://arxiv.org/html/2609.14226#bib.bib1)\]和ROUGE-L\[30 (https://arxiv.org/html/2609.14226#bib.bib2)\]作为词汇对齐的度量标准,评估了2000份针对未见过胸片图像生成的报告,与保留的放射科医生撰写的参考报告进行对比。BLEU-4捕捉生成文本与参考文本之间的四元组精度,使其对结构和术语的一致性敏感,而ROUGE-L衡量最长公共子序列,反映句子级别的流畅性和叙事连贯性。两个指标都在基础MedGemma-4B模型和宪法式微调模型的输出上计算,使用相同的测试集。

相似文章

基于部分观测目标的锥形束CT报告生成中的临床推理

arXiv cs.CL

本文提出了一种用于锥形束CT报告生成的复合目标,该目标优先考虑事实蕴含而非词汇重叠,表明优化词汇指标会损害事实准确性。它发布了一个数据集和代码,并展示了一个在极性、侧别和牙齿水平一致性约束下生成受限临床报告的系统。

小而足:通过LoRA适配器对AI编辑文本进行逐用户风格重写

arXiv cs.CL

本文介绍了InMyStyle,一个隐私优先的系统,它在小型语言模型(0.5B–7B)上使用LoRA适配器,无需显式提示即可将AI编辑过的文本重写为符合个人用户写作风格的文本。评估显示,不同模型规模下质量趋于平稳,表明紧凑型模型足以胜任此任务。

重新审视用于3D CT报告生成的LLM适配:规模与诊断先验研究

arXiv cs.CL

本文研究了将大语言模型适配到3D CT报告生成的参数高效策略,提出了RAD3D-Prefix,一个轻量级的诊断先验条件框架,该框架保持LLM冻结,仅需极少的可训练参数。结果表明,冻结更大的LLM(约10亿参数以上)并仅训练轻量级投影层,能够在性能、泛化能力和计算效率之间实现更优的权衡。