通过反事实临床审计揭示ICU脓毒症管理中医学离线强化学习的毒性模仿
摘要
本文介绍了反事实临床审计(CCA)框架,用于评估ICU脓毒症管理的离线强化学习智能体,揭示了‘毒性模仿’——智能体复制标准指标无法检测的有害治疗模式。使用MIMIC-III数据,表明医学决策Transformer在乳酸升高时未能升级血管加压药,而因果Transformer表现安全。
arXiv:2608.11410v1 公告类型:新
摘要:离线强化学习(RL)为优化ICU治疗决策提供了巨大前景,但标准评估指标均方误差(MSE)和拟合Q评估(FQE)仅评估行为模仿,无法检测毒性模仿——一种智能体复制有害模式的失败模式,例如在舒适护理过渡期间停止治疗。利用MIMIC-III数据库,我们提出了反事实临床审计(CCA)框架,该框架通过基于脓毒症生存运动(SSC)指南的生理扰动来压力测试RL智能体。我们审计了医学决策Transformer(MedDT)和历史因果Transformer(HCT-RL),后者采用因果动作屏蔽、基于倾向性的重要性加权和保守Q学习。CCA显示,MedDT在乳酸升高时反而降低血管加压药剂量,与复苏指南相矛盾,而HCT-RL保持生理一致的反应。这些发现暴露了统计拟合与临床安全之间的系统性错位,支持反事实审计作为医学RL的必要评估标准。
查看缓存全文
缓存时间: 2026/08/13 15:35
# 摘要
来源:https://arxiv.org/html/2608.11410
通过反事实临床审计揭示 ICU 脓毒症管理中医学离线强化学习的毒性模仿
Hangqi Ren1, Junyi Liao2
1 范德堡大学工程学院,纳什维尔,田纳西州,美国;
2 杜克大学普拉特工程学院,达勒姆,北卡罗来纳州,美国
离线强化学习(RL)在优化ICU治疗决策方面展现出相当大的前景,但标准评估指标——均方误差(MSE)和拟合Q评估(FQE)——仅评估行为模仿,无法检测毒性模仿。这是一种失败模式,即智能体复现有害模式,例如在舒适护理过渡期间撤除治疗。利用MIMIC-III数据库,我们提出了反事实临床审计(CCA)框架,该框架通过基于脓毒症生存运动(SSC)指南的生理扰动对RL智能体进行压力测试。我们审计了医学决策Transformer(MedDT)和历史因果Transformer(HCT-RL),后者采用因果动作屏蔽、基于倾向性的重要性加权和保守Q学习。CCA揭示,MedDT在乳酸升高时反而减少血管升压药剂量,与复苏指南相矛盾,而HCT-RL保持生理一致的反应。这些发现暴露了统计拟合与临床安全性之间的系统性错位,支持将反事实审计作为医学RL的必要评估标准。
关键词:因果推断、深度学习、重症监护、人工智能、临床决策支持、评估
## 引言
离线强化学习(RL)已成为重症监护病房(ICU)临床决策支持的一种有前景的方法。通过从历史电子健康记录(EHRs)中学习治疗策略,RL智能体可以优化序贯决策以最大化患者的长期结局。1,2 AI Clinician研究表明,RL衍生的策略可能改善脓毒症管理,3 后续工作采用深度Q网络、Actor-Critic方法和决策Transformer,取得了令人鼓舞的模拟结果。4–7
尽管如此,医学RL的临床部署仍远未成为现实。8,9 核心障碍在于评估方法。当前基准依赖预测准确性(MSE)或基于价值的代理指标,如拟合Q评估(FQE),10,11 它们评估智能体的动作与历史临床医生行为的接近程度,但对干预措施背后的因果逻辑不敏感。9,12 高保真模仿即使在模仿行为源自非治疗模式时也能获得较好的分数。这一局限性反映了从观察性数据进行因果推断的更广泛挑战,其中虚假关联可能被误解为有效的临床策略。13,14
在ICU血流动力学支持中,我们识别出一个临床上显著的混杂因素。Sepsis-3将脓毒性休克定义为需要血管升压药以维持平均动脉压(MAP)≥65 mmHg且血清乳酸水平>2 mmol/L,尽管已进行充分的液体复苏。15 脓毒症生存运动(SSC)指南进一步建议乳酸引导的复苏和血管升压药滴定以维持血流动力学目标。16 然而,现实世界实践中血管升压药的撤除往往并非源于生理改善,而是源于向舒适护理的过渡。17,18 研究记录显示,在死亡的ICU患者中,维持生命治疗的撤除率从0%到84%不等。19 这些情况共同在历史ICU数据中产生了一个系统性混杂:指南要求升级血管升压药,而姑息性撤除在观察性记录中产生相反的模式,且没有治疗目标标签来区分两者。我们将其称为姑息性混杂。
没有因果基础,高容量序列模型可能将护理撤除模式解释为对代谢应激的有效反应。我们将这种失败模式定义为毒性模仿:智能体无意中将有害的临床模式学习为最优策略,恰好在指南要求加强治疗时推荐减少支持。
为了解决这一安全缺口,我们提出了反事实临床审计(CCA)框架,该框架通过基于临床指南的受控生理扰动对策略进行压力测试。CCA包括三项审计:虚假稳健性(Spurious Robustness),用于测试对非临床噪声的不变性;因果趋势(Causal Trend),用于验证剂量-反应与指南的一致性;以及上下文剪刀探针(Contextual Scissor Probe),用于评估基于休克严重程度的紧急度缩放。
我们通过使用MIMIC-III数据库审计两种架构来验证CCA:20,21 标准医学决策Transformer(MedDT)6 和引入因果动作屏蔽的历史因果Transformer(HCT-RL)。我们的贡献是:(1)将毒性模仿描述为源自姑息性混杂的关键失败模式;(2)引入CCA作为标准评估指标的必要补充;(3)证明因果屏蔽和重要性加权能有效抑制标准架构无法应对的姑息性混杂。
## 方法
### 数据集与预处理
我们使用MIMIC-III临床数据库(v1.4)20,21 提取符合Sepsis-3标准的成年患者。15 我们的流程遵循Komorowski等人。3 状态空间 \(\mathcal{S}\in\mathbb{R}^{44}\) 包括生命体征、实验室结果和人口统计学特征。与原始离散公式不同,我们定义了连续动作空间 \(\mathcal{A}\in\mathbb{R}^{2}\),表示静脉输液和血管升压药剂量。我们使用 \(L=6\) 个时间步(每个4小时)的滑动窗口,在患者层面按70%/15%/15%划分训练/验证/测试集。相似文章
RealICU:大型语言模型代理是否能理解长上下文ICU数据?一个超越行为模仿的基准测试
RealICU是一个事后标注的基准测试,用于评估ICU场景中的大型语言模型(LLM),涵盖四个由医生驱动的任务。实验表明,现有LLM在回忆-安全权衡和锚定偏差方面存在困难,而一种新的结构化记忆代理改善了推理能力,但未能完全消除安全故障。
EHR-MPC:基于生成式患者数字孪生的脓毒症治疗推理时控制
本文介绍了EHR-MPC框架,该框架通过使用电子健康记录训练患者的生成式数字孪生,将学习患者动态与治疗优化解耦,然后在推理时应用模型预测控制,在多个医院的脓毒症队列上实现了与强化学习基线相当或更优的性能。
面向临床智能体的世界反馈:在FHIR环境中诊断强化学习
本文研究了在FHIR环境中为临床协议执行任务使用来自世界反馈的强化学习,识别了诸如高静默完成上限和零梯度任务等结构性障碍,并引入了具有更低上限的MedAgentBench-v3。它表明,由于这些障碍,纯强化学习表现不如基于规则的SFT,并提出了一种结合SFT+RL的方法。
信任但验证:通过事后对抗性审计和多智能体反馈循环减轻医疗幻觉
本文提出了一种多智能体‘信任但验证’系统,旨在减少大语言模型中的医疗幻觉。该系统在关于违禁药物的临床问题上测试了三种开放获取模型,实现了53%的幻觉错误率降低。
压力测试医学大语言模型揭示基准准确率之外的潜在安全病理
本文介绍了AI-MASLD,一个用于医学大语言模型的压力审计框架,揭示了基准准确率如何掩盖严重的安全故障,并展示了开放权重模型在安全维度上可以媲美或超越专有模型。