显性还是隐性?多模态临床AI中逐模态失败分析的可复用框架
摘要
本文提出了一个与模型无关的框架,用于多模态临床AI中的逐模态失败分析,以区分在丢弃某个模态时出现的显性失败与隐性失败。该框架在植入的ground truth上进行了验证,并应用于EchoJEPA和HuBERT-ECG嵌入进行LVEF预测,结果表明丢弃echo后误差几乎翻倍。
查看缓存全文
缓存时间: 2026/08/04 17:40
论文页面 - 响亮还是沉默?多模态临床AI中按模态失败分析的可复用框架
来源:https://huggingface.co/papers/2608.01462 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
多模态临床模型通常以所有模态都存在时的准确性来评判,但在实际部署中往往会有模态缺失;例如,在常规进行心电图的场景中,超声心动图常常不可用。除了准确性损失的大小之外,还有两个问题值得关注:哪个模态对此负责,以及一旦该模态被丢弃,模型是响亮地失败还是沉默地失败。这种区分是逐样本且按模态级别的,并且不同于事后特征归因(例如 SHAP)。模型经常被替换;而回答这些问题的评估框架是可以复用的。我们提出了一个模型无关的模态失败分析框架:给定 N 个模态嵌入、任意一个掩码感知探针和标签,它返回逐样本的失败分类法、一个按模态的互补性矩阵(将错误归因于各模态),以及一个区分可监控失败与那些远离决策边界且未被标记地通过的失败的“响亮 vs 沉默”丢弃剖面,仅使用部署时可观测的信号。我们将其作为一个小型的、经过单元测试的工具包发布,并针对植入的 ground truth 进行验证。在各种随机种子下,它能够恢复植入的模态主导性和互补子集,报告每个模态的响亮/沉默比率,并扩展到三模态互补性矩阵;由于植入的结构是通过构造已知的,这验证的是逐样本归因的恢复能力,而非临床性能。然后,我们在冻结的 EchoJEPA 和 HuBERT-ECG 嵌入上,针对 LVEF 和 EF<=40% 的 HFrEF 门控,在配对的 MIMIC-IV 队列上实例化该框架,其中在留出测试集(n=245)上,丢弃超声心动图会使误差几乎翻倍。限制队列规模的回声-心电图重叠范围本身,就是针对心脏基础模型的一个部署发现。我们所有的工作可以在 https://github.com/criticaldata/PRIMED-AI 找到。
查看 arXiv 页面 (https://arxiv.org/abs/2608.01462)查看 PDF (https://arxiv.org/pdf/2608.01462)GitHub (https://github.com/criticaldata/PRIMED-AI)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.01462)
在你的 agent 中获取此论文:
hf papers read 2608\.01462
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2608.01462 即可从此页面链接到它。
引用此论文的数据集 0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.01462 即可从此页面链接到它。
引用此论文的 Space 0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2608.01462 即可从此页面链接到它。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到它。
相似文章
定义多模态人工智能系统的十种失败模式
该文章基于基准测试论文和研究,列举了十种多模态AI系统中有记录的失败模式,在这些模式中,模型会生成流畅但与实际输入不符的回答。
大型语言模型作为统一多模态学习器用于临床预测
该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。
量化LLM推理中的无声失败:基于分类法的空洞收敛与失败模式转变分析
本文通过一个基于分类法的分析,对多个模型和基准测试中的30,000个思维链输出进行研究,证明了训练后量化可以无声地改变大语言模型的推理方式,即使任务准确性保持不变。
使用不规则电子健康记录的多模态提示学习用于重症监护患者的鲁棒监测
该论文提出了一种多模态提示学习框架,用于处理电子健康记录中的缺失模态,以实现重症监护病房中的鲁棒临床预测,引入了四种提示类型来捕获依赖关系和交互作用。
从黑箱到临床洞察:一个用于语音认知障碍检测的多阶段可解释框架
本文提出一个多阶段可解释框架,结合基于SHAP的词元归因、理论指导的语言特征以及LLaMA-3.1-70B-Instruct大语言模型推理,用于解释基于Transformer的语音模型在认知障碍检测中的表现,取得了良好的临床一致性及高可用性评分。