RESPClinBench:呼吸专科护理中多模态临床决策与纵向疾病管理的基准测试
摘要
介绍了RESPClinBench,一个用于呼吸科临床决策的真实世界场景基准,评估了七个LLM在COPD和肺结节病例上的表现。发现了任务特定的局限性,包括影像幻觉和用药安全风险。
arXiv:2608.04514v1 公告类型:新
摘要:背景:呼吸专科护理需要多模态解读、纵向风险评估、符合指南的干预以及全病程管理,而这些在应试型医学基准中并未得到充分体现。目的:开发RESPClinBench——一个基于真实世界场景的呼吸科临床决策基准,并评估七个当代大语言模型在AECOPD-PIM和PNBIM上的表现。方法:RESPClinBench病例改编自已去标识化的呼吸科临床数据。三位主治级别的呼吸科医生修订了病例、参考答案和原子化临床行动要点,同时一位资深呼吸科专家进行了交叉审查和最终裁决。AECOPD-PIM包含427个开放式的COPD病例,PNBIM包含196个结合了胸部CT与结构化临床信息的多模态肺结节病例。七个模型通过标准化API推理(温度为0,最大输出长度为8192个令牌)生成了4,361条回复。一个自动化框架将最终得分计算为原子化行动召回率和基于评分标准的LLM-as-a-Judge评估的算术平均值。结果:在623个病例中,平均最终得分为68.58。Qwen3.6-27B总体排名第一,得分71.22;Qwen3.5-397B-A17B在PNBIM中领先,得分72.48;Qwen3.6-27B在AECOPD-PIM中领先,得分71.11。在PNBIM回复中,影像幻觉和严重医疗风险的发生率分别为31.85%和8.16%;在AECOPD-PIM回复中,用药安全风险和严重医疗风险的发生率分别为26.93%和1.44%。结论:RESPClinBench识别了多模态肺结节评估和纵向COPD管理中的任务特定局限性。将显式的临床行动覆盖率、整体评估和独立的安全标记相结合,为模型选择和前瞻性验证提供了临床基础。
查看缓存全文
缓存时间: 2026/08/06 07:48
# RESPClinBench:呼吸专科护理中多模态临床决策与纵向疾病管理的基准测试 来源:https://arxiv.org/html/2608.04514 陈智澳门科技大学 中国澳门陈睿瑶上海人工智能实验室 中国上海陆璐上海人工智能实验室 中国上海梁恒瑞广州医科大学附属第一医院 中国广州广州呼吸健康研究院 中国广州黄超毅广州医科大学附属第一医院 中国广州林一洛广州呼吸健康研究院 中国广州丁静如上海人工智能实验室 中国上海钟云上海人工智能实验室 中国上海苏宇铭广州医科大学附属第一医院 中国广州广州呼吸健康研究院 中国广州徐杰上海人工智能实验室 中国上海 ###### 摘要 背景:呼吸专科护理需要多模态解读、纵向风险评估、遵循指南的干预以及全病程管理,而这些在以考试为导向的医学基准测试中鲜有体现。 目的:开发RESPClinBench,一个基于真实世界场景的呼吸科临床决策基准测试,并评估七个当代大语言模型在AECOPD-PIM和PNBIM上的表现。 方法:RESPClinBench病例改编自已去标识化的呼吸科临床数据。三位主治级呼吸科医师修订了病例、参考答案和原子临床行动要点,一位资深呼吸科专家进行了交叉审核和最终裁定。AECOPD-PIM包含427个开放式COPD病例,PNBIM包含196个结合胸部CT与结构化临床信息的多模态肺结节病例。七个模型通过标准化API推理生成了4,361条响应,温度为0,最大输出长度为8192个token。一个自动化框架计算最终得分,作为原子行动召回率和基于量规的LLM-as-a-Judge评估的算术平均值。 结果:在623个病例中,平均最终得分为68.58。Qwen3.6-27B总体排名第一,得分71.22;Qwen3.5-397B-A17B在PNBIM中领先,得分72.48;Qwen3.6-27B在AECOPD-PIM中领先,得分71.11。影像幻觉和严重医疗风险分别出现在31.85%和8.16%的PNBIM响应中;药物安全风险和严重医疗风险分别出现在26.93%和1.44%的AECOPD-PIM响应中。 结论:RESPClinBench识别出多模态肺结节评估和纵向COPD管理中的任务特定局限性。将明确的临床行动覆盖、整体评估和独立安全标志相结合,为模型选择和前瞻性验证提供了临床依据。 11footnotetext:\*通讯作者:徐杰([email protected]),苏宇铭(su\[email protected])*关*键词大语言模型⋅慢性阻塞性肺疾病⋅急性加重⋅肺结节⋅纵向管理 ## 1 引言 大语言模型(LLMs)已从通用文本生成器迅速发展为能够回答医学问题、综合临床记录、生成鉴别诊断并参与模拟会诊的系统。MultiMedQA等里程碑式评估表明,语言模型能够编码大量临床知识,并在某些医学问答任务上接近专家水平[25 (https://arxiv.org/html/2608.04514#bib.bib1),26 (https://arxiv.org/html/2608.04514#bib.bib2)]。更近期的系统已展现出日益复杂的对话和鉴别诊断行为[30 (https://arxiv.org/html/2608.04514#bib.bib3),18 (https://arxiv.org/html/2608.04514#bib.bib4)]。这些进展推动了将LLM用于患者沟通、文档记录、临床决策支持和医学教育的提议。然而,在执业许可式考试中的优异表现并不能证明已具备专科实践的 readiness。考试问题通常是静态的,包含经过精心筛选的信息,并且奖励选出唯一最佳答案。而实际护理要求模型判断哪些信息可靠、哪些仍然未知、新证据是否改变先前计划,以及哪些错误可能立即造成伤害。 更广泛的临床评估证据强化了这一担忧。一项对519项医疗保健LLM研究的系统综述发现,准确性主导了评估设计,而真实患者护理数据、校准、公平性、工作流程影响和部署考虑则较为少见[3 (https://arxiv.org/html/2608.04514#bib.bib5)]。在一项基于重症监护病例的大型评估中,LLM在指令遵循、实验室检查解读、指南遵守以及对临床信息顺序和数量的鲁棒性方面表现出局限性[11 (https://arxiv.org/html/2608.04514#bib.bib6)]。一项随机临床试验进一步表明,仅仅让临床医生使用LLM并不一定能改善诊断推理[10 (https://arxiv.org/html/2608.04514#bib.bib7)]。最近的研究和评估框架已将正确的最终答案与推理过程的质量、一致性和临床可用性区分开来[13 (https://arxiv.org/html/2608.04514#bib.bib8),23 (https://arxiv.org/html/2608.04514#bib.bib9),29 (https://arxiv.org/html/2608.04514#bib.bib10),22 (https://arxiv.org/html/2608.04514#bib.bib11),1 (https://arxiv.org/html/2608.04514#bib.bib12)]。这些发现促使人们呼吁建立具有更强构念效度、情景真实性、临床有意义的错误分类法和明确安全性评估的基准[1 (https://arxiv.org/html/2608.04514#bib.bib12),37 (https://arxiv.org/html/2608.04514#bib.bib13),8 (https://arxiv.org/html/2608.04514#bib.bib14),36 (https://arxiv.org/html/2608.04514#bib.bib15),32 (https://arxiv.org/html/2608.04514#bib.bib16),14 (https://arxiv.org/html/2608.04514#bib.bib17),28 (https://arxiv.org/html/2608.04514#bib.bib18)]。 呼吸医学特别适合基于情景的评估,因为它同时需要纵向疾病管理(以慢性阻塞性肺疾病(COPD)为例)和多模态诊断推理(以肺结节评估为例)。COPD体现了纵向评估的必要性。急性加重风险取决于症状、既往急性加重史、药物使用、氧合、肺功能、合并症以及近期治疗反应。因此,有效的管理需要识别不同就诊之间的变化,并协调吸入剂优化、依从性、康复、疫苗接种、监测和升级治疗的统筹规划。2026年慢性阻塞性肺疾病全球倡议(GOLD)报告提供了诊断、风险评估、预防和纵向治疗的当前建议,而近期分析则探讨了人工智能在整合呼吸护理中日益增长的作用[9 (https://arxiv.org/html/2608.04514#bib.bib19),2 (https://arxiv.org/html/2608.04514#bib.bib20)]。近期的呼吸LLM研究评估了专科门诊诊断、肺活量图解读、肺结节随访和纵向CT评估[21 (https://arxiv.org/html/2608.04514#bib.bib21),4 (https://arxiv.org/html/2608.04514#bib.bib22),19 (https://arxiv.org/html/2608.04514#bib.bib23),34 (https://arxiv.org/html/2608.04514#bib.bib24),16 (https://arxiv.org/html/2608.04514#bib.bib25)]。然而,模型可能生成一份看似合理的COPD总结,却遗漏了关键的药物安全检查,未能个体化非药物管理,或者在证据不足的情况下建议更改治疗。 肺结节管理提出了一个互补的多模态挑战。风险评估取决于病灶的CT表现、大小、衰减、形态、多发性、间隔变化、临床背景以及特定管理框架的适用性。偶发结节、筛查检出结节、亚实性结节、既往癌症患者以及免疫功能低下患者不一定遵循相同的路径[35 (https://arxiv.org/html/2608.04514#bib.bib26),15 (https://arxiv.org/html/2608.04514#bib.bib27),17 (https://arxiv.org/html/2608.04514#bib.bib28),27 (https://arxiv.org/html/2608.04514#bib.bib29),5 (https://arxiv.org/html/2608.04514#bib.bib30),6 (https://arxiv.org/html/2608.04514#bib.bib31)]。任务不仅仅是判断结节为良性或恶性。临床医生必须确定现有信息是否支持随访观察、进一步影像检查、多学科讨论、组织诊断或手术,同时避免延迟癌症评估和避免不必要的侵入性操作。近期研究显示LLM在肺结节随访和纵向CT解读方面表现令人鼓舞,但也发现了错误的间隔时间、无依据的特征描述和可能有害的建议[34 (https://arxiv.org/html/2608.04514#bib.bib24),16 (https://arxiv.org/html/2608.04514#bib.bib25)]。 多模态LLM的出现既增加了呼吸决策支持的潜在价值,也增加了风险。医学影像解读要求模型将语言锚定在可见区域,并将观察到的发现与临床推断区分开来。2025年发表的综述强调,多模态系统仍然容易受到解剖结构幻觉、定位能力弱、推理不一致和校准不佳的影响[20 (https://arxiv.org/html/2608.04514#bib.bib32),24 (https://arxiv.org/html/2608.04514#bib.bib33)]。在肺结节评估中,一个响应可能看起来临床水平很高,却凭空虚构出棘状突起、胸膜牵拉、血管聚集或间隔生长,而这些在所提供的图像中并无依据。这类错误尤其成问题,因为后续建议可能在逻辑上一致,却建立在虚构的前提之上。因此,基准测试不仅需要捕捉最终管理方案是否类似指南,还需要捕捉从影像观察到风险解读再到行动的链条是否以证据为基础。 开放式专科评估也带来了方法学上的挑战。当存在多种临床可接受的表述时,精确匹配准确性并不合适,但完全整体的评分可能奖励流畅性而忽略遗漏的行动。基于指南的检查清单和原子临床要点通过识别哪些诊断、监测、治疗、安全网或升级要素被明确包含来提高透明度。相反,基于量规的评估可以捕获那些难以简化为关键词匹配的适当性、优先级、内部一致性和可用性。最近关于医生验证的基准测试和自动化评估器的研究支持将结构化标准与专家校准判断相结合,同时也警告评估器模型需要验证,不应被视为绝对可靠[37 (https://arxiv.org/html/2608.04514#bib.bib13),8 (https://arxiv.org/html/2608.04514#bib.bib14),36 (https://arxiv.org/html/2608.04514#bib.bib15),32 (https://arxiv.org/html/2608.04514#bib.bib16)]。安全性必须保持为一个独立的分析层面,因为无依据的安抚、危险的药物调整或虚构的影像发现所带来的临床后果不等同于轻微遗漏。 为了弥补这些不足,我们开发了RESPClinBench,一个用于呼吸科临床决策和全病程疾病管理的真实世界、基于情景的基准测试。它源自去标识化的临床数据,保留了真实实践的复杂性,并评估从风险识别、诊断到干预、监测和长期随访的完整护理路径。AECOPD-PIM评估COPD的纵向预测和管理,而PNBIM将胸部CT图像与结构化临床信息相结合用于肺结节评估。通过结合互补的模态和疾病轨迹,RESPClinBench为在将模型整合到呼吸工作流程之前识别模型能力、任务特定局限性和安全风险提供了一个以临床为基础的框架。 ## 2 方法 ### 2.1 研究设计和基准测试范围 RESPClinBench被设计为一项基于情景的呼吸专科护理临床决策评估。该基准测试不是测试孤立的事实回忆,而是代表实际实践中所需的决策序列,包括风险识别、多模态或纵向证据的整合、选择适当的诊断或治疗路径、监测治疗反应、预防恶化以及规划持续护理。其三个组织领域是多模态数据融合诊断、慢性病风险预测和干预,以及与医疗风险控制相关的诊断依从性。本分析使用了两个代表互补呼吸工作流程的开放式数据集:纵向COPD急性加重管理和多模态肺结节评估(表1 (https://arxiv.org/html/2608.04514#S2.T1))。 ### 2.2 真实世界数据改编和专家审核 所有基准病例均改编自已去标识化的真实世界呼吸科临床数据。三位主治级呼吸科医师作为主要临床改编者,而不仅仅是事后审核者。对于每个来源病例,他们重建了临床相关的时间顺序,选择了任务所需的信息,标准化了问题,起草并迭代修订了专家参考答案,并将最终答案分解为简洁的原子临床行动要点。在修订过程中,医师们删除了无依据、冗余、过于宽泛或模糊的陈述;将建议与所提供的证据和适用指南进行协调;并确保每个原子要点都独立可回答、具有临床意义且适合自动化匹配。他们还检查了原始记录中的合并症、治疗暴露、不确定性和纵向变化是否在不泄露隐藏标签的情况下得以保留。一位资深呼吸科专家独立交叉审核了完整的问题-答案-行动包,并进行了最终裁定。该审核涵盖来源保真度、内部一致性、指南符合性、临床合理性、可回答性、安全性和完整性。关于病例框架、参考答案内容或原子要点纳入的分歧通过修订解决,存在未解决歧义或证据不足的病例被排除。这一多阶段工作流程用于为临床内容和自动化评估建立准确稳定的参考标准。 表1:RESPClinBench数据集和评估目标概览数据集临床重点项目数输入模态主要能力AECOPD-PIMAECOPD预测、干预和全病程管理427纵向文本和结构化临床数据风险预警;趋势解读;药物审核;监测;非药物干预;升级治疗PNBIM肺结节良恶性识别和动态管理196胸部CT图像加人口学、暴露史、实验室和病史数据基于影像的风险评估;良恶性鉴别;诊断规划;治疗和随访管理 ### 2.3 AECOPD-PIM AECOPD-PIM包含427个开放式病例,改编自
相似文章
LongMedBench:面向长时程临床决策的医疗智能体基准测试
LongMedBench 是一个新的基准测试,用于评估基于LLM的医疗智能体在长时程临床决策中的表现。它使用来自 MIMIC-IV 的真实电子健康记录数据,包含335名具有多次就诊记录的患者,并提出了针对事实问答、时序推理和长时程决策的评估套件。
EHRBench:用于大语言模型临床决策的自动化可靠电子健康记录基准
EHRBench是一个自动化且可靠的基准测试,利用真实电子健康记录评估大语言模型在临床决策任务上的表现,涵盖诊断、治疗和预后任务,包含近100万个问答条目。
MedBench v5:面向临床多模态模型的动态、过程导向且具有幻觉感知能力的基准测试
MedBench v5 是一个面向临床多模态模型的动态、过程导向的基准测试,集成了幻觉检测和压力测试,超越静态问答,评估在信息流压力下的推理和稳定性。
在标准化病例中评估大语言模型在动态临床决策中的表现
研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。
ClinicalMC:面向大语言模型的多疗程临床决策基准
ClinicalMC是一个基准,旨在评估大语言模型在多疗程临床决策中的表现,包含中文和英文数据集以及一个多智能体评估框架。