通过非专业摘要放射报告提高健康素养:对BioNER与检索增强生成的评估

arXiv cs.CL 论文

摘要

本研究评估了检索增强生成(RAG)和命名实体识别(NER)在改善放射报告自动非专业摘要中的应用,发现NER提升了可读性和质量,而RAG的效果因微调而异。

arXiv:2609.02396v1 Announce Type: new 摘要:放射报告主要为临床医生编写,其专业术语常常使患者难以理解。因此,许多患者转向公开可用的大型语言模型(LLMs)来帮助解释他们的报告,尽管已充分记录了事实不准确和幻觉的风险。自动非专业摘要生成已成为一种有前景的替代方案,但检索增强和临床知情方法在放射特定通信中的有效性尚未充分探索。本研究探讨了检索增强生成(RAG)和命名实体识别(NER)在改善自动生成的非专业摘要的质量、事实一致性和可读性方面,相比标准基于LLM的生成的程度。我们开发了一个框架,结合基于NER的临床相关发现提取与用于上下文锚定的RAG机制,在两个模型(Qwen, BioBART)的少样本和微调变体上进行评估。结果表明,NER持续改善可读性和整体质量,而单独的RAG没有益处,并且可能从无关的检索术语中引入幻觉。在少样本设置中,结合RAG和NER会降低性能,但在微调时改善可读性。微调的BioBART与NER结合实现了最佳整体性能,突显了实体感知提取是改善患者友好摘要的主要驱动力。
查看原文
查看缓存全文

缓存时间: 2026/09/03 05:53

# 通过非专业人员总结放射学报告以提升健康素养:对BioNER与检索增强生成的评估
来源:https://arxiv.org/html/2609.02396

**作者**:
Egecan Çelik Evgin  
*单位:* 土耳其奥齐耶根大学人工智能与数据工程系  
*邮箱:* [[email protected]](mailto:[email protected])

İlknur Karadeniz  
*单位:* 土耳其加拉塔萨雷大学计算机工程系  
*邮箱:* [[email protected]](mailto:[email protected])

Olcay Taner Yıldız  
*单位:* 土耳其奥齐耶根大学人工智能与数据工程系  
*单位:* 土耳其奥齐耶根大学计算机科学系  
*邮箱:* [[email protected]](mailto:[email protected])

###### 摘要
放射学报告主要为临床医生撰写,其专业术语通常使患者难以解读。因此,许多患者转向公开可用的大语言模型(LLM)来帮助解释报告,尽管这些模型存在事实不准确和产生幻觉的已记录风险。自动生成面向非专业人员的摘要已成为一种有前景的替代方案,然而,检索增强和临床知识引导的方法在放射学特定沟通方面的有效性仍待深入探索。本研究调查了检索增强生成(RAG)和命名实体识别(NER)在改善自动生成的非专业摘要的质量、事实一致性和可读性方面,相比标准基于LLM的生成的效果。我们开发了一个结合基于NER的临床相关发现提取与用于上下文锚定的RAG机制的框架,在两个模型(Qwen,BioBART)的少样本和微调变体上进行了评估。结果表明,NER持续提升了可读性和整体质量,而单独的RAG没有带来益处,并可能因检索到无关术语而引入幻觉。将RAG与NER结合在少样本设置中降低了性能,但在微调时提升了可读性。微调的BioBART与NER结合取得了最佳的整体性能,这凸显了实体感知提取是改善患者友好型摘要的主要驱动力。

## 1 引言
放射学报告记录了X射线、计算机断层扫描(CT)和磁共振成像(MRI)等医学影像检查的结果,是医疗专业人员之间的主要沟通手段。然而,这些报告通常使用专业的生物医学术语和复杂的临床语言撰写,导致患者难以理解。因此,许多患者难以解读他们的影像结果并完全理解报告发现的含义。为了更好地了解他们的健康状况并做出明智的治疗决策,患者经常寻求额外的信息。传统上,这涉及在线搜索医学术语和症状。如今,许多患者使用基于大语言模型(LLM)的聊天机器人,如ChatGPT、Gemini和DeepSeek来获取健康相关信息OpenAI(2022) (https://arxiv.org/html/2609.02396#bib.bib7);Google(2024) (https://arxiv.org/html/2609.02396#bib.bib8);DeepSeek-AI(2024) (https://arxiv.org/html/2609.02396#bib.bib9)。然而,这些系统可能生成不准确或幻觉的内容,可能导致患者误解他们的放射学发现或对错误信息过度信任。

这种沟通鸿沟会限制患者的理解和健康素养,从而推动了将放射学报告翻译为患者友好语言的方法的研究。最近的工作探索了检索增强生成(RAG),通过将生成输出锚定在外部知识中来改善非专业摘要的质量和事实一致性Guo et al.(2024) (https://arxiv.org/html/2609.02396#bib.bib44)。与此同时,命名实体识别(NER)已被用于识别临床相关术语,这些术语可以指导和约束生成更准确和相关的内容。然而,对于放射学特定的非专业摘要,基于检索和实体感知方法的比较有效性仍有待深入探索,尤其是在不同规模和训练机制的模型之间。

为了解决这一差距,我们在四个涵盖不同临床环境和成像模式的公开放射学报告数据集上评估了我们的方法:PadChest、BIMCV-COVID19+、Open-i和MIMIC-CXRBustos et al.(2020) (https://arxiv.org/html/2609.02396#bib.bib1);de la Iglesia Vayá et al.(2020) (https://arxiv.org/html/2609.02396#bib.bib2);Demner-Fushman et al.(2012) (https://arxiv.org/html/2609.02396#bib.bib3);Johnson et al.(2019) (https://arxiv.org/html/2609.02396#bib.bib4)。

本研究的主要贡献是:
- • 一个结合和比较基于RAG和增强NER的放射学报告非专业摘要方法框架;
- • 一个最先进的通用LLM与一个生物医学小语言模型的比较;
- • 使用少样本基线与微调模型变体进行系统比较。

本文的其余部分组织如下:第2节回顾相关工作,第3节描述方法,第4节展示结果和讨论,第5节总结论文。

## 2 相关工作
非专业摘要与标准摘要的不同之处在于其对非专业读者可读性的强调。在生物医学领域,BioLaySumm共享任务于2023年、2024年和2025年举办Goldsack et al.(2023) (https://arxiv.org/html/2609.02396#bib.bib20);Goldsack et al.(2024) (https://arxiv.org/html/2609.02396#bib.bib21);Xiao et al.(2025) (https://arxiv.org/html/2609.02396#bib.bib6),旨在生成相关、可读且事实准确的非专业摘要。BioLaySumm 2025共享任务2特别关注从放射学报告生成非专业摘要,下面讨论的几种方法就是为此任务开发的。

**基于微调的方法:** AEHRC在共享任务2的开放和封闭子任务中使用全监督微调取得了最佳整体性能,比较了T5-Large与LLaMA-3.2-3B,并发现T5-Large更优,未使用LoRA、量化或RAGZhang et al.(2025) (https://arxiv.org/html/2609.02396#bib.bib23);Raffel et al.(2020) (https://arxiv.org/html/2609.02396#bib.bib24);Meta AI(2024) (https://arxiv.org/html/2609.02396#bib.bib25)。KHU_LDI,排名第二的开放赛道系统,使用QLoRA对Qwen2.5-3B-Instruct和Qwen3-4B进行微调,结合了3样本提示和生成-反馈-优化流程Moriazi and Sung(2025) (https://arxiv.org/html/2609.02396#bib.bib26);Dettmers et al.(2023) (https://arxiv.org/html/2609.02396#bib.bib27);Yang et al.(2024) (https://arxiv.org/html/2609.02396#bib.bib28);Yang et al.(2025) (https://arxiv.org/html/2609.02396#bib.bib29);Madaan et al.(2023) (https://arxiv.org/html/2609.02396#bib.bib30)。MetninOzU使用基于摘要的摘要设置排名第三,表明更短的输入仍然可以获得较高的事实性得分Evgin et al.(2025) (https://arxiv.org/html/2609.02396#bib.bib42)。

**基于提示的方法:** 5cNLP,排名第二的封闭赛道系统,依赖于结构化提示而非微调,测试了Llama-3.3-70B-Instruct和GPT-4.1;他们最好的结果使用GPT-4.1,并通过BERT-large嵌入选择少样本放射学示例Lossio-Ventura et al.(2025) (https://arxiv.org/html/2609.02396#bib.bib49)。Proff等人比较了GPT-4o、Llama-3-70B和Mixtral-8x22B在放射学报告简化方面的表现,发现所有模型都提高了可读性,尽管开源模型比GPT-4o产生了更多的高风险错误Proff et al.(2026) (https://arxiv.org/html/2609.02396#bib.bib35)。

**基于RAG的方法:** CUTN_Bio使用Zephyr-7B-beta的RAG流水线在共享任务2的封闭赛道中获得第三名,通过SciSpacy提取医学术语,并从ChromaDB存储的维基百科定义中检索Sivagnanam et al.(2025) (https://arxiv.org/html/2609.02396#bib.bib31);Tunstall et al.(2023) (https://arxiv.org/html/2609.02396#bib.bib32);Neumann et al.(2019) (https://arxiv.org/html/2609.02396#bib.bib33);Chroma(2026) (https://arxiv.org/html/2609.02396#bib.bib34)。同一团队在子任务1.2(外部知识非专业摘要)中获得第二名,使用了类似的RAG方法,以MedCAT进行术语提取,以LLaMA-3-8B-Instruct进行生成Kraljevic et al.(2021) (https://arxiv.org/html/2609.02396#bib.bib37);Meta AI(2024) (https://arxiv.org/html/2609.02396#bib.bib25)。Sun等人提出了FactMM-RAG,它在生成之前通过RadGraph检索事实相似的报告内容,以提高生成的放射学报告的准确性Sun et al.(2025) (https://arxiv.org/html/2609.02396#bib.bib36)。LaySummX应用了检索增强微调,在微调LLaMA 3.1(使用LoRA)之前,使用摘要检索相关的全文块Lin and Yu(2025) (https://arxiv.org/html/2609.02396#bib.bib43)。Guo等人引入了检索增强非专业语言生成,检索UMLS和维基百科定义以提供缺失的背景解释Guo et al.(2024) (https://arxiv.org/html/2609.02396#bib.bib44)。UIUC_BioNLP使用了一个提取-然后-摘要的流水线,结合了维基百科定义检索和基于DPR的段落检索You et al.(2024) (https://arxiv.org/html/2609.02396#bib.bib45)。

**基于NER的方法:** ISIKSumm使用了一个基于BART的系统,并使用Stanza NER添加了生物医学实体标签,以改进对技术术语的处理Colak and Karadeniz(2023) (https://arxiv.org/html/2609.02396#bib.bib41)。Gupta和Krishnamurthy的LayForge系统使用BioBERT NER识别生物医学术语,并在摘要重写之前纳入UMLS定义,以小幅牺牲ROUGE分数为代价提高了可读性和事实性Gupta and Krishnamurthy(2025) (https://arxiv.org/html/2609.02396#bib.bib38);Lee et al.(2020) (https://arxiv.org/html/2609.02396#bib.bib39);Bodenreider(2004) (https://arxiv.org/html/2609.02396#bib.bib40);Lin(2004) (https://arxiv.org/html/2609.02396#bib.bib12)。Ming等人使用MeSH术语引导LLM为非专业读者提供更有信息量的背景上下文Ming et al.(2025) (https://arxiv.org/html/2609.02396#bib.bib46)。

总体而言,先前的工作主要孤立地探索了基于RAG和基于NER的策略,很少有研究在统一框架内或跨规模和训练机制(少样本 vs. 微调)差异显著的模型直接比较它们的有效性。本研究通过系统地比较基于RAG和增强NER的放射学报告非专业摘要策略来解决这一差距。

## 3 方法论
### 3.1 模型
本研究使用了两个模型:Qwen3.5-0.8BQwen团队(2026) (https://arxiv.org/html/2609.02396#bib.bib10),一个近期的通用小语言模型,和BioBART-v2-largeYuan et al.(2022) (https://arxiv.org/html/2609.02396#bib.bib11),一个专门在生物医学文本上预训练的模型。这种配对使得可以比较一个强大的通用模型和一个为生物医学领域适配的较小模型。

### 3.2 数据集和评估集
本研究使用了四个公开的放射学报告数据集,涵盖不同的临床环境和成像模式:PadChest、BIMCV-COVID19+、Open-i和MIMIC-CXR。PadChest包含来自约67,000名患者的超过160,000张胸部X射线图像,而BIMCV-COVID19+包括COVID-19 X射线和CT研究,包含21,342例CR、34,829例DX和7,918例CT病例Bustos et al.(2020) (https://arxiv.org/html/2609.02396#bib.bib1);de la Iglesia Vayá et al.(2020) (https://arxiv.org/html/2609.02396#bib.bib2)。Open-i较小,有7,470张胸部X射线图像和3,955份报告,而MIMIC-CXR是最大的数据集,包含来自真实临床报告的227,835项研究和377,110张图像Demner-Fushman et al.(2012) (https://arxiv.org/html/2609.02396#bib.bib3);Johnson et al.(2019) (https://arxiv.org/html/2609.02396#bib.bib4)。非专业摘要是使用Layman's RRG框架从临床报告自动生成的Zhao et al.(2026) (https://arxiv.org/html/2609.02396#bib.bib5),合并的数据集在BioLaySumm 2025共享任务中使用Xiao et al.(2025) (https://arxiv.org/html/2609.02396#bib.bib6)。然而,共享任务测试集的非专业摘要并未公开。为了解决这个问题,将原始训练集分割以构建一个新的测试集,目标是获得比共享任务中使用的更大的评估集。分割是随机进行的(种子 = 42)以避免偏差;这与第3.4节中描述的三个少样本示例报告的采样不同,后者使用了相同的种子值进行单独的采样步骤。由此产生的分割包括168,036份训练报告(89.38%)、14,971份验证报告(7.96%)、5,000份测试报告(2.66%)和3份少样本示例报告,平均令牌数总结在表1(https://arxiv.org/html/2609.02396#S3.T1)中。

**表1:数据集分割统计**
放射学报告:放射学报告中的平均令牌数;非专业摘要:非专业摘要中的平均令牌数。

### 3.3 评估指标
生成的摘要从三个维度进行评估:相关性、可读性和事实性。所有指标都使用最小-最大归一化进行缩放,以将其值置于可比较的范围内Han et al.(2011) (https://arxiv.org/html/2609.02396#bib.bib22)。三个指标组之间没有应用额外的权重,因为每组包含相同数量的指标。对于相关性和事实性指标,分数越高表示性能越好;对于所有可读性指标(FKGL,DCRS,SLE),分数越低表示性能越好(即,更简单、更易读的文本)。

**相关性:** ROUGELin(2004) (https://arxiv.org/html/2609.02396#bib.bib12)衡量预测和黄金非专业摘要之间的词语重叠;我们报告ROUGE-1、ROUGE-2和ROUGE-L的平均F1。METEORBanerjee and Lavie(2005) (https://arxiv.org/html/2609.02396#bib.bib13)通过考虑词干和同义词超越了精确匹配,提供了相关性的补充视角。BERTScoreZhang et al.(2020) (https://arxiv.org/html/2609.02396#bib.bib14)通过比较预测和黄金摘要之间的上下文词嵌入来衡量语义相似性,基于最接近的令牌匹配计算精确率、召回率和F1。

**可读性:** FKGLKincaid et al.(1975) (https://arxiv.org/html/2609.02396#bib.bib15)根据句子和单词长度估计摘要的年级水平,较长的句子和单词会产生更高(可读性更低)的分数。DCRSDale and Chall(1948) (https://arxiv.org/html/2609.02396#bib.bib16)通过将单词熟悉度与常用词列表进行比较来补充FKGL,捕捉FKGL可能遗漏的情况,例如短但不熟悉的单词(例如,“understand”)。SLECripwell et al.(2023) (https://arxiv.org/html/2609.02396#bib.bib17)是一个基于转换器的指标,仅需要预测的摘要,使用一个带有回归头的RoBERTa-base模型来生成简洁度分数。

**事实性:** SummaCLaban et al.(2022) (https://arxiv.org/html/2609.02396#bib.bib18)使用蕴含和矛盾分数评估源报告与预测摘要之间的句子级一致性,惩罚矛盾内容。FENICEScirè et al.(2024) (https://arxiv.org/html/2609.02396#bib.bib19)在声明级别评估事实性。

相似文章

不让任何读者掉队:人人都能理解的多智能体摘要

arXiv cs.CL

本文提出了NRLB,一个面向平实语言摘要的多智能体框架,通过模拟不同读者群体(小学生、非母语者、注意力缺陷者)来提高可读性,同时保持事实准确性,该框架在多个数据集和人工评估中得到了验证。

评估AI生成的癌症患者摘要

arXiv cs.CL

本研究采用双重评估框架,使用人类领域专家和LLMs作为评估者,评估面向癌症患者的AI生成摘要,重点关注医疗保健应用中的准确性、临床相关性和安全性。