认证AI分诊ICU警报
摘要
本文提出了一种经认证的AI方法,用于将ICU警报分为保留、抑制或推迟,在减少误报的同时提供安全保证,并在VTaC基准测试中实现高精度。
arXiv:2609.12365v1 公告类型:新
摘要:在VTaC基准测试中,71%的室性心动过速警报是误报,但静音真实警报可能会延迟对危险心律失常的识别。我们将警报减少重新定义为三方分诊(保留、抑制或推迟),并界定此分析视为有害的决策:在抑制的警报中,真实警报的比例在独立同分布事件抽样下,以95%的置信度保持在用户设定的预算以下。共享波形记录的警报是相关的,因此聚类分析是一种敏感性检查。在官方划分中,5%的预算在所有三个随机种子中均通过认证,抑制了74.8%的误报,同时静音了1.5%的真实警报,AUROC为0.953,挑战评分为83.33,在数值上与已发布的十一个系统中最强的相当。我们的主要发现衡量了多重性成本:校正针对每个候选者收费,因此更精细的网格可以严格减少认证范围。在校准保留下,我们声明的885单元网格在15次折叠运行中有1次通过认证,而在单独的选择分区上选择网格则有8次通过认证。我们预测每个预算所需的校准体积,使无法认证的预算成为一个设计参数。最后,在策略网格中添加学习的可靠性维度并未锐化认证边界。
查看缓存全文
缓存时间: 2026/09/14 08:42
# 经认证的ICU警报AI分诊
来源:https://arxiv.org/html/2609.12365
###### 摘要
在VTaC基准测试中,71%的室性心动过速警报是假警报,但静默真实警报可能延误危险心律失常的识别。我们将警报减少重构为三向分诊(保留、抑制或延迟),并约束此分析视为有害的决策:在抑制的警报中,真警报比例在用户设定的预算下保持低于95%置信度(基于独立同分布事件采样)。共享波形记录的警报具有依赖性,因此聚类分析是一项敏感性检验。在官方划分中,5%预算在所有三个随机种子下均通过认证,抑制74.8%的假警报,同时仅静默1.5%的真警报,AUROC为0.953,挑战评分为83.33,数值上可与已发布的十一个系统中最强者媲美。我们的核心发现衡量了多重性代价:校正对每个候选策略收费,因此更精细的网格必然能认证更少策略。在校准保持数据集下,我们设定的885单元网格仅认证15次折折运行中的1次,而在独立选择划分上选择网格则认证8次。我们预测每个预算所需的校量化体积,使无法认证的预算成为设计参数。最后,在策略网格中添加学习的可靠性维度未能优化认证前沿。
††研讨会:健康机器学习(ML4H)2026††论文集::预印本
###### 关键词
假警报减少,室性心动过速,选择性预测,风险控制,多模态生理波形,VTaC
## 1引言
重症监护病房的床旁监测仪生成心律失常警报的速度超过了临床注意力所能处理的范围,且大部分是假警报(Drew等人,2014;Sendelbach和Funk,2013;Cvach,2012)。室性心动过速(VT)是关键案例:它可能危及生命,因此静默真实VT警报可能延误危险心律失 VTaC基准测试提供了5,037个由专家裁定的VT警报,包含多导联心电图和脉搏波形。
分类器阈值在灵敏度与特异性间权衡,但从未说明何时证据过于不完整或退化以至于无法行动。在回顾性裁定中,自然输出是三向(保留、抑制或延迟审查);不安全抑制是此分析控制的终点。部署需要的是该速率的有限样本边界,以及该边界对标注数据的成本说明。本文在VTaC上做出五点贡献:
1. 1\.VT警报抑制的安全保证。我们将裁定构建为从预设网格中选择保留/抑制/延迟策略,并在独立同分布事件采样下使用“先学习后测试”进行认证,并采用记录聚类自举法探测该假设忽略的依赖性。据我们所知,尚无已发布的VTaC系统报告有害错误的有限样本边界。
2. 2\.临床策略网格上的多重性成本。已知Bonferroni对每个候选策略收费;但实际任务的账单规模尚不明确。更精细的网格搜索更多策略,但为每个策略支付更严格的校正水平,因此超过某一点后,更多候选策略反而认证更少:在选择划分而非按惯例选择网格,使认证的折折运行从15次中的1次增加到8次(α=0.05),并在官方划分上复现。
3. 3\.无区分惩罚的认证。基础分数不受策略层影响,在官方划分上,我们在所有报告指标上与最强已发布基线相当。
4. 4\.可计算的认证成本。当预算无法认证时,我们报告是样本还是模型构成障碍,并预测其需要多少标注警报。
5. 5\.框架可表达的负面结果。学习的证据可靠性评分器响应对类别概率几乎无影响的退化,但无论在干净还是退化队列中,或在网格表面上任何位置,基于该评分器门控抑制均未优化认证前沿。
此处所有实验数值均由代码从存储的制品中重新生成,代码中不包含结果字面量;附录M记录了早期审计及其强制的更正。
## 2相关工作
##### 假警报减少。
PhysioNet/CinC 2015挑战赛(Clifford等人,2015;Clifford等人,2016)建立了多模态分析用于假心律失常警报,其最强参赛方案通过脉搏波形验证心跳(Plesinger等人,2016;Aboukhalil等人,2008)并根据信号质量加权通道(Li等人,2008)。VTaC(Lehman等人,2023)规模大一个数量级,由至少两名专家独立标注并裁定,在固定记录级划分上报告监督、对比和生成基线;我们采用其实时输入和评分协议,附录C中列出了偏差。互补方向是预训练质量感知波形编码器:QualityFM(Guo等人,2025)在配对的高质量和低质量信号间自蒸馏,并报告VT假警报检测作为其迁移任务之一。我们不比较编码器;更强的骨干网络在认证受模型限制时可能有益,但表calreq发现此处几乎所有失败都受样本限制。
##### 选择性预测与风险控制。
带拒绝选项的弃权可追溯到Chow(1970);Geifman和El-Yaniv(2017)为给定置信率函数约束选择性风险,已在其搜索访问的阈值间校正置信预算(El-Yaniv和Wiener,2010,另见)。此处不同之处在于二维族、特定行动的终点,以及校正必须覆盖的网格规模。共形和风险控制方法(Vovk等人,2005;Bates等人,2021;Angelopoulos等人,2024;Angelopoulos和Bates,2023)提供此类保证,“先学习后测试”(Angelopoulos等人,2025)将其扩展到非单调损失,将每个候选策略视为假设检验。我们将其应用于二维族,与常见的固定序列变体不同,我们对整个网格(4.3节)进行校正。已知Bonferroni对每个候选策略收费,自适应“先学习后测试”(Zecchin等人,2025)通过e过程序贯测试(Farzaneh和Simeone,2026,综述见)应对此问题。其节省在于测试轮次,每轮购买新数据;在非自适应策略于水平评估时,它与“先学习后测试”一致,这是我们的场景,即一个冻结样本同时评估所有885个候选策略。因此我们测量成本而非消除它。与所约束量最接近的是选择性共形风险控制(Xu等人,2025),其约束接受条件下的预测集损失,而我们约束在行动事件中一种有害行动的比率;其在第一阶段阈值上的搜索支付相同的多重性,5.5节测量。
##### 缺失模态。
模态丢弃(Neverova等人,2016)提高对缺失通道的鲁棒性,Ma等人(2022)表明除非融合针对此设计,否则Transformer在缺失模态下性能急剧下降;6%的VTaC事件无可用脉搏通道,因此此处每个模型都带有掩码。
## 3数据与评估协议
##### 数据集。
VTaC v1.0(Lehman等人,2024)包含来自美国三家医院三制造商ICU监测仪的5,037个VT警报事件,采样率250 Hz,警报发生前五分钟及后一分钟。模态覆盖不均匀:每个事件至少携带一个ECG通道,但部分缺少第二个,部分无脉搏通道(PLETH或ABP),因此基准测试是多变模态设计而非意外。注1:v1.0版本包含每个事件90,000个样本(250 Hz),即六分钟,发生于300秒,而基准测试论文文本描述为十秒;所有窗口均从发生向后测量,因此无输入受影响。每个事件有最终裁定标签y∈{0,1},y=1表示真实警报:1,441个真警报(28.6%)和3,596个假警报。事件属于2,260条波形记录(每条记录2.23个事件)。发布版不暴露患者标识符,因此记录不相交划分是可实现的最强划分;我们描述为“记录安全”,而非“患者安全”。
##### 两个分支。
两个分支共享架构、目标、优化器和策略族,仅在已发布基准固定的输入约定及其导致的唯一架构差异(令牌步长)上不同(4.1节)。开发分支将所有5,037个事件汇集为五个记录不相交的外层折,每个外层折内按记录不相交方式分为训练、检查点选择、策略选择和策略认证角色,以外层折为评估,使用60秒警报前窗口(三个时隙:两个ECG,一个脉搏);三个随机种子(317, 911, 2718)产生15次折折运行。由于官方测试划分被溶解到池中,**此分支无任何数字可与已发布VTaC结果比较**。**官方划分分支**严格遵循已发布划分(测试:226条记录中的482个事件,137个真警报),并遵循已发布实时协议(Lehman等人,2023):10秒窗口,四个通道零插补,逐段z标准化,以及挑战评分(TP+TN)/(TP+TN+FP+5FN)在验证最大化阈值下,附录C列出偏差。其校准划分(819 + 842个事件)仅从官方**训练集**中切割,因此测试集从不用于选择或认证。划分分配是提交的、经哈希验证的制品,在每个阶段检查不相交性。
##### 预处理。
ECG通道应用60 Hz陷波和1-30 Hz巴特沃斯带通,PLETH应用0.5-5 Hz带通,ABP无滤波;每个事件内z标准化。若匹配的表头通道存在且在窗口内至少持有一个有限样本,则时隙**可用**;不可用时隙零填充并在掩码m∈{0,1}^C中标记。表头命名的时隙仍可能失败此测试,因此开发缓存有45个事件仅有一个可用ECG时隙,304个事件无可用脉搏时隙(对比仅按表头的44和292)。所有事件均保留在评估总体中。
## 4方法
### 4\.1哨兵:可用性感知多模态编码器
图arch总结模型。每个事件提供波形x∈R^{C×L},覆盖C个模态时隙的L个样本,以及可用性掩码m。跨时隙共享的主干在每个时隙生成T个令牌,宽度d=512;不可用时隙的令牌全程置零,注意力池化为每个时隙一个向量,不可用时隙池化为零而非来自插补零的值。融合是四个自注意力层作用于拼接的令牌,掩码使脉搏令牌可关注附近ECG令牌但绝非全局原始样本。融合证据向量z∈R^d是时隙池化输出的可用性加权均值,分类器头将其映射到真警报概率p=σ(·),σ为逻辑函数。开发分支中令牌步长s=40,官方划分分支中s=8:较短窗口强制改变,因为在s=40下,10秒窗口产生62个令牌,少于±64令牌融合半径,因此局部注意力退化为全局。
可靠性头消耗z、掩码m、来自通道头的逐时隙可靠性分数q∈R^C,以及移位兼容性置信度:第一个ECG时隙与其他每个时隙在17个令牌移位(±8令牌,步长40下±1.3秒,步长8下±0.26秒)的余弦一致性最大softmax。其d+3C-1个输入(开发分支520,官方分支523)以z为主导。兼容性是学习的一致性特征而非脉搏传导时间估计,r=σ(·)描述证据而非生理。
##### 目标。
训练最小化模态丢弃下无权重二元交叉熵,加上对同一批次独立干预视图的三个辅助损失:被丢弃时隙的掩码跨模态重建、声明采集干预的逐时隙识别,以及*证据质量*目标,即该视图中源可用时隙未被掩码和干预的比例,由可靠性logit回归。每个目标都是训练循环应用干预的可观察结果;无一使用VT标签。附录B给出主干、损失权重和优化器设置。
### 4\.2分诊策略族
策略是一个三元组(τ_sup,τ_rel,τ_ret)。若p≤τ_sup且r≥τ_rel,则事件被*抑制*;若p≥τ_ret(保留胜过任何重叠),则被*保留*;否则*延迟*。有害事件是被分配*抑制*的真实警报;*不安全抑制风险*为Pr(y=1|抑制)。保留优先,因此抑制集合为{p≤τ_sup, r≥τ_rel, p<τ_ret},当τ_ret>τ_sup使重叠为空时,该集合独立于τ_ret。这在汇集分支-预算-准则-族216个单元中所有选出的172个策略中成立,因此在那里认证集合即部署集合;我们验证此点而非假设。划分运行不记录阈值,因此我们不为其声称。保留阈值随后固定为在91点网格上保留至少95%真警报的最大值(策略选择划分)。相似文章
印度母婴护理的可审计紧急分诊
本文介绍了TRACE,一个使用LLMs和规则引擎的分解系统,旨在提高印度母婴护理紧急分诊的准确性和可审计性,增强召回率并减少误报。
人工智能临床工具一旦投入使用,真的能改变护理吗?
一位医院工作人员反思了用于脓毒症和病情恶化的AI警报系统在现实中的影响,指出误报会导致脱敏,并且即使模型很好,如果没有整合到临床工作流程中,也会难以发挥作用。
心理健康领域的教育型人工智能:基于三流微调大语言模型的自动化临床督导与风险分诊框架
本文提出了一种三流微调大语言模型框架,用于心理健康领域的自动化临床督导,实现了高精度的技术识别,并将督导分诊延迟从72小时降低到实时。
基于数十万份心电图训练的AI模型,更准确地预测心脏性猝死风险
加州大学伯克利分校的研究人员利用数十万份心电图训练了一个AI模型,该模型能够检测到一种此前未被识别的信号,相比现有方法更准确地预测心脏性猝死风险,每年有望挽救数千人的生命。
人工智能辅助的胎心监护:用于信号重建、胎心率分析和变异评估的统一模型
本文提出了一种基于AI的胎心率监测模型,该模型能够重建信号、分析变异,并以高灵敏度和特异性检测减速/加速。