独立LLM与预定义智能体流水线用于解释ICU死亡率预测:基于eICU演示数据集的可行性研究
摘要
本可行性研究比较了独立LLM与预定义智能体流水线在解释ICU死亡率预测中的效果,发现智能体方法改善了指南依据和患者特异性细节,但需要基于归因的检查以确保安全性。
arXiv:2608.26109v1 Announce Type: new
摘要:机器学习模型可以准确预测ICU死亡率,但仅特征归因方法很少提供床边使用所需的临床叙述。大型语言模型(LLMs)可能弥合这一差距,多步骤智能体流水线是一个合理的扩展,因为它们分离了数据解释、指南检查和最终解释。本修订版可行性研究保留了原始的独立与智能体比较,同时使主要临床发现更加明确。使用保留的本地eICU演示数据集(2,353次ICU住院;8.1\%死亡率),XGBoost达到了AUROC为0.855(95\% CI 0.796--0.906)和AUPRC为0.332(95\% CI 0.217--0.494)。在分层的38个案例解释子集中,独立LLM产生了1个明确结果泄露的解释,而四步智能体流水线没有产生任何泄露。在与SHAP审查子集重叠的14个案例中,独立LLM显示出更高的SHAP对齐(平均Jaccard 0.171 对比 0.077)和更高的一致性(92.9\% 对比 78.6\%),而智能体流水线显示出更高的指南依据(0.762 对比 0.143)、更高的值特异性(0.236 对比 0.143)和略高的合理性(0.700 对比 0.671)。临床上,结果表明,智能体分解可能改善安全相关的依据和患者特异性细节,但在用于高风险解释之前,应配合基于归因的检查。
查看缓存全文
缓存时间: 2026/08/28 09:27
# 独立LLM与预设智能体流水线用于解释ICU死亡率预测:eICU演示数据集的可行性研究 来源:https://arxiv.org/html/2608.26109 陈雪,张皓云,魏子涵,王紫薇*,施嘉豪,王子宇,谢启阳 \(a美国圣克拉拉大学,圣克拉拉,美国;b美国马萨诸塞大学阿默斯特分校,阿默斯特,美国;c美国宾夕法尼亚大学,费城,美国;d美国卡内基梅隆大学,匹兹堡,美国;e美国纽约大学,布鲁克林,美国;f美国维克森林大学,温斯顿-塞勒姆,美国;g美国东北大学,波士顿,美国;1这些作者贡献均等。\*通讯作者:王紫薇。\) ###### 摘要 机器学习模型能准确预测ICU死亡率,但特征归因方法本身很少能提供临床所需的床边叙事。大语言模型可能弥合这一差距,而多步骤智能体流水线是合理的扩展,因为它们将数据解读、指南核查和最终解释分离开来。这项修订后的可行性研究保留了原始的独立模型与智能体流水线对比,同时使主要临床发现更加明确。使用保留的本地eICU演示数据集(2,353次ICU住院;8.1%死亡率),XGBoost达到了0.855(95% CI 0.796–0.906)的AUROC和0.332(95% CI 0.217–0.494)的AUPRC。在一个分层的38例解释子集上,独立LLM产生了1例明确结果泄露的解释,而四步骤智能体流水线没有产生任何泄露。在与SHAP审查子集重叠的14个病例中,独立LLM显示出更高的SHAP一致性(平均Jaccard系数0.171 对比 0.077)和更高的方向一致性(92.9% 对比 78.6%),而智能体流水线显示出更高的指南依据度(0.762 对比 0.143)、更高的数值特异性(0.236 对比 0.143)和略高的合理性(0.700 对比 0.671)。临床意义上,结果表明智能体分解可能改善与安全性相关的依据和患者特异性细节,但在用于高风险风险解释前,应结合基于归因的检查。 ## 1引言 重症监护病房(ICU)的死亡率预测仍是重症监护风险建模的核心基准。当应用于结构化电子健康记录数据时,现代机器学习模型通常在区分度上超越经典的严重程度评分\[1 (https://arxiv.org/html/2608.26109#bib.bib1),2 (https://arxiv.org/html/2608.26109#bib.bib2)\]。实际障碍不仅在于纯粹的预测性能;还在于临床医生是否能够理解和审核模型为何将特定患者标记为高风险\[3 (https://arxiv.org/html/2608.26109#bib.bib3)\]。 事后可解释性方法如SHAP很有价值,因为它们能识别影响模型预测的特征\[4 (https://arxiv.org/html/2608.26109#bib.bib4),10 (https://arxiv.org/html/2608.26109#bib.bib10)\]。然而,特征归因不等于临床解释。一个变量的排序列表,即使在数学上是忠实的,本身并不产生临床医生用于验证、分诊和沟通的病理生理叙述\[12 (https://arxiv.org/html/2608.26109#bib.bib12)\]。这一差距激发了人们对大语言模型(LLMs)的兴趣,LLMs可以将结构化值转化为简洁的、基于临床概念的自然语言推理\[5 (https://arxiv.org/html/2608.26109#bib.bib5),6 (https://arxiv.org/html/2608.26109#bib.bib6),7 (https://arxiv.org/html/2608.26109#bib.bib7)\]。 单一的LLM提示是一个有吸引力的基线,但它可能将多个推理步骤压缩到一个不透明的响应中。智能体系统提供了一种替代方案,通过将任务分解为数据解读、正式标准应用、鉴别诊断构建和综合\[14 (https://arxiv.org/html/2608.26109#bib.bib14),15 (https://arxiv.org/html/2608.26109#bib.bib15)\]。这种分解在重症监护领域尤其具有吸引力,因为阈值、综合征标准以及多个相互作用的器官系统都至关重要。因此,我们原始的研究设计提出了三个研究问题: 1. RQ1:标准机器学习模型从结构化的首24小时数据预测ICU死亡率的准确性如何? 2. RQ2:独立LLM能否产生临床合理且与SHAP归因保持一定一致性的解释? 3. RQ3:结构化的智能体流水线是否比独立LLM产生更高质量、更具临床依据的解释? 这份修订后的稿件保留了相同的问题和基本理念,但仅报告受可审计本地工件集支持的结论。具体而言,RQ1在保留队列上进行了定量解答,而RQ2和RQ3则在从同一版本化测试快照生成的已审计解释子集上进行了解答。 ## 2结果 ### 2.1队列特征与预测性能 研究队列包含2,353次成人ICU住院,院内死亡率为8.1%(n=191)。非存活者年龄更大,且心率、呼吸频率、乳酸和血尿素氮值均高于存活者。基线描述性统计见表1 (https://arxiv.org/html/2608.26109#S2.T1)。 表1:研究队列的基线特征XGBoost在保留的测试集上优于逻辑回归,尽管两个模型都表现出在低事件发生率下预期的典型精确度-召回率限制。XGBoost达到了0.855(95% CI 0.796–0.906)的AUROC和0.332(95% CI 0.217–0.494)的AUPRC,而逻辑回归达到了0.823(95% CI 0.752–0.886)的AUROC和0.345(95% CI 0.218–0.506)的AUPRC(表2 (https://arxiv.org/html/2608.26109#S2.T2);图1 (https://arxiv.org/html/2608.26109#S2.F1))。这些区分度估计与先前基于结构化EHR数据的ICU死亡率建模研究一致\[1 (https://arxiv.org/html/2608.26109#bib.bib1),2 (https://arxiv.org/html/2608.26109#bib.bib2)\]。 表2:保留测试集上的自助法区分度指标。参考标题图1:逻辑回归和XGBoost在保留测试集上的受试者工作特征曲线和精确度-召回率曲线。 ### 2.2使用SHAP的全局特征归因 SHAP摘要图在临床上仍然连贯。年龄、最低血氧饱和度(SpO2)、血尿素氮、乳酸和呼吸频率是保留的XGBoost模型中最有影响力的特征,与诸如高龄、低氧血症、肾功能障碍和呼吸功能障碍等公认的ICU死亡率相关因素吻合良好\[11 (https://arxiv.org/html/2608.26109#bib.bib11)\]。摘要图见图2 (https://arxiv.org/html/2608.26109#S2.F2)。 参考标题图2:XGBoost模型的SHAP摘要图。每个点代表一名患者,颜色表示特征值。 ### 2.3独立LLM审计与保留的解释质量 重新生成的独立解释集包含38个输出。对解释文本的直接审计发现1个解释存在明确的结果泄露术语,并将其从有效比较集中移除。此次审计后,保留了37个解释,其中14个与预先存在的SHAP审查的患者子集重叠,因此可以针对特征归因进行评估。 在这14个无泄露的重叠病例中,解释质量仍然参差不齐(表3 (https://arxiv.org/html/2608.26109#S2.T3);图3 (https://arxiv.org/html/2608.26109#S2.F3))。平均SHAP一致性为0.171(95% CI 0.075–0.279),50.0%的病例显示出任何特征重叠。解释合理性中等(平均0.671,95% CI 0.571–0.764),而与模型预测风险标签的方向一致性仍然很高,为92.9%(95% CI 78.6–100.0)。数值特异性较低(平均0.143,95% CI 0.029–0.300),指南依据度有限(平均0.143,95% CI 0.071–0.238)。综合来看,这些结果表明独立LLM可以产生简洁且方向一致的叙述,但这些叙述与模型的顶级SHAP特征仅适度一致。 表3:结果泄露审计与保留的独立解释质量指标。参考标题图3:经审计的独立解释质量指标及自助法置信区间。为显示方便,方向一致性已归一化至0-1尺度。 ### 2.4智能体流水线比较 原始稿件中的相同四步骤智能体设计在此重新拟合中得以保留,因为它对于RQ3至关重要。该流水线包括临床数据解读器、指南顾问、鉴别诊断推理器和最终综合器。每个步骤都在版本化脚本中进行了重写,以避免结果泄露并仅使用清洗后的提示面向值。架构如图4所示 (https://arxiv.org/html/2608.26109#S2.F4)。 重新生成的智能体运行也产生了38个输出,没有一个被标记为明确结果泄露。有14个病例与SHAP审查子集重叠,因此可以与重新生成的独立基线进行直接比较(表4 (https://arxiv.org/html/2608.26109#S2.T4);图5 (https://arxiv.org/html/2608.26109#S2.F5))。比较模式并非单调。智能体流水线的SHAP一致性低于独立基线(平均Jaccard系数0.077,95% CI 0.018–0.143,对比0.171,95% CI 0.075–0.279),方向一致性也较低(78.6% 对比 92.9%)。相比之下,它显示出明显更强的指南依据度(0.762,95% CI 0.571–0.929,对比0.143,95% CI 0.071–0.238)、更高的数值特异性(0.236,95% CI 0.093–0.407,对比0.143,95% CI 0.029–0.300)、更频繁地提及患者特异性数据(85.7% 对比 64.3%)以及略高的合理性(0.700,95% CI 0.557–0.843,对比0.671,95% CI 0.571–0.764)。这些结果表明,任务分解使解释在临床标准和支持性证据方面更加明确,但并未使其更接近底层死亡率模型的主要SHAP特征。 表4:独立LLM与预设智能体流水线之间经审计的解释质量比较。 步骤 1:临床数据解读器 输入:清洗后的患者值及参考范围 输出:包含患者特定值及临床意义的异常性摘要 ↓\\downarrow 步骤 2:指南顾问 输入:患者数据及步骤1摘要 输出:结构化应用SIRS、SOFA、qSOFA和KDIGO样式标准 ↓\\downarrow 步骤 3:鉴别诊断推理器 输入:患者数据及步骤1-2输出 输出:带有证据和机制的、按重要性排序的死亡率驱动条件 ↓\\downarrow 步骤 4:最终综合器 输入:患者数据及步骤1-3输出 输出:结构化JSON解释,与独立基线相同模式 图4:为RQ3保留的预设无结果泄露智能体流水线。参考标题图5:独立LLM与预设智能体流水线之间经审计的解释质量比较。为显示方便,方向一致性已归一化至0-1尺度。 ## 3讨论 修订后的分析优先考虑三个具有临床意义的发现。首先,结构化的死亡率模型具有足够的区分度来证成解释工作,其最有影响力的特征——年龄、氧合状态、血尿素氮、乳酸和呼吸频率——是重症监护中生理不稳定的公认标志。其次,独立LLM通常在正确方向上产生简洁的风险叙述,但解释在患者特异性数值方面往往薄弱,且与SHAP归因仅适度一致。第三,预设的智能体流水线减少了明确泄露,并产生了更多基于指南、更具患者特异性的解释,但这种改进伴随着较低的SHAP一致性和较低的方向一致性。 这些发现支持了原始动机,同时阐明了实际权衡。特征归因和自然语言解释可以是互补的:SHAP有助于识别是什么驱动了模型,而LLM可以将异常值转化为可读的临床叙述。然而,不应仅仅因为智能体流水线更具结构性就假定它更优。在本研究中,分解改善了指南使用和床边可读性,但并未自动恢复驱动XGBoost预测的最强特征。因此,一个临床有用的系统可能需要两个组成部分:用于模型保真度的归因检查,以及用于可解释性的基于指南的语言层。 修订后的分析还强调了直接影响解释可靠性的数据质量问题。在面向提示的测试快照中,在排除低于20 mmHg的无效值后,84.7%的行中平均动脉压缺失;在将一个华氏度样式异常值统一为摄氏度后,93.4%的行中体温缺失;81.5%的行中乳酸缺失;13.2%的行中重建的格拉斯哥昏迷评分不可用。这些数值在临床上很重要,因此应将其缺失性呈现出来而非隐藏;否则,LLM可能听起来比可用证据支持的更确定。 仍存在一些局限性。eICU演示数据集相对于全面的ICU队列规模较小。只有14个生成的病例与保留的SHAP审查子集重叠,因此围绕比较解释指标的置信区间仍然较宽。两个生成器都使用了单个本地基础模型运行,因此观察到的差异反映的是特定实施的独立提示和特定实施的任务分解,而非架构无关的真理。归因比较也依赖于从叙述性因素到结构化模型特征的启发式映射。最后,自动解释指标仍然是临床医生判断的替代品,而非重症监护专家前瞻性评估的替代品。最近关于基于检索的会话式LLM风险评估评估的工作同样强调,面向风险的LLM输出应根据证据依据和任务相关参考信息来判断,而不仅仅是流畅性或合理性\[16 (https://arxiv.org/html/2608.26109#bib.bib16)\]。 尽管存在这些局限性,修订后的稿件通过使证据更加透明而加强了原始会议草稿。它增加了一个可审计的正面对比,使泄露明确化,将提示清洗规则与下游解释分离,并将智能体分解呈现为一个可衡量的权衡,而非类别性的收益。 ## 4方法 ### 4.1数据来源与队列 我们使用了eICU协作研究数据库演示版v2.0.1\[9 (https://arxiv.org/html/2608.26109#bib.bib9)\]。原始研究中保留的队列定义包括年龄至少18岁、ICU住院时间至少4小时且医院出院状态非缺失的成人。最终队列包含2,353次ICU住院,主要结局是院内死亡率。 ### 4.2结构化特征与面向提示的清洗 特征来源于首24小时,涵盖人口统计学、生命体征、实验室检查结果和APACHE相关神经变量。版本化重新拟合保留了原始模型输入,但为解释流水线添加了面向提示的清洗规则。格拉斯哥昏迷评分仅从有效的APACHE眼、运动和言语组成部分重建;负值哨兵值不被视为临床数值。高于45的体温值被视为华氏度,
相似文章
RealICU:大型语言模型代理是否能理解长上下文ICU数据?一个超越行为模仿的基准测试
RealICU是一个事后标注的基准测试,用于评估ICU场景中的大型语言模型(LLM),涵盖四个由医生驱动的任务。实验表明,现有LLM在回忆-安全权衡和锚定偏差方面存在困难,而一种新的结构化记忆代理改善了推理能力,但未能完全消除安全故障。
从结构化临床数据预测心血管风险的大语言模型
本文提出了一种混合框架,将结构化临床数据与LLM生成的叙述相结合,用于冠状动脉疾病预测,在变量提取方面实现了高保真度,并比较了机器学习模型与基于LLM的零样本和少样本分类。
Patients-like-me:用于可解释临床预测的变分LM-GNN框架
本文提出了Patients-like-me(PLM),一个统一的LM-GNN框架,将局部患者语义与全局队列结构相结合,用于可解释的临床预测。它引入了一种变分期望最大化算法,并在MIMIC-III和MIMIC-IV上展示了最先进的结果,同时提供参考患者解释。
语言模型作为接口,而非预言机:用于儿童阑尾炎的混合LLM-ML系统
本文介绍了ClaMPAPP,一种混合架构,使用LLM作为接口从临床叙述中提取特征,然后将这些特征传递给XGBoost分类器进行儿童阑尾炎诊断,展示了相比端到端LLM基线更高的鲁棒性和安全性。
一种用于LLM零样本适应谵妄预测的知识注入框架
提出一种用于零样本ICU谵妄预测的轻量化知识注入框架,该框架在推理时用外部临床知识增强结构化电子健康记录数据摘要,在无需微调的LLaMA模型上,AUROC提升高达8.57个百分点。