显性还是隐性?多模态临床AI中逐模态失败分析的可复用框架

Hugging Face Daily Papers 论文

摘要

本文提出了一个与模型无关的框架,用于多模态临床AI中的逐模态失败分析,以区分在丢弃某个模态时出现的显性失败与隐性失败。该框架在植入的ground truth上进行了验证,并应用于EchoJEPA和HuBERT-ECG嵌入进行LVEF预测,结果表明丢弃echo后误差几乎翻倍。

多模态临床模型通常在所有模态都存在的情况下以准确性进行评判,但部署时会移除模态;在常规使用心电图(ECG)的环境中,超声心动图往往无法获得。因此,除了准确性损失的大小之外,还有两个问题至关重要:哪个模态负有责任,以及一旦该模态被丢弃,模型是显性失败还是隐性失败。这种区分是逐样本、逐模态的,并且不同于事后特征归因(如SHAP)。模型经常被更换,而回答这些问题的评估方法是可以复用的。我们提出了一个与模型无关的模态失败框架:给定N个模态嵌入、任何掩码感知的探针以及标签,它返回逐样本失败分类、一个将误差归因于各模态的逐模态互补性矩阵,以及一个显性vs隐性丢弃概况——仅使用部署时可观测的信号,将可监测的失败与那些远离决策边界且未被标记而通过的失败区分开来。我们将其发布为一个小型、经过单元测试的测试工具,并针对植入的ground truth进行了验证。在不同的随机种子下,它能恢复所植入的模态主导性和互补子集,报告各模态的显性vs隐性比率,并可扩展至三模态互补矩阵;由于植入的结构在构造时是已知的,这验证的是对逐样本归因的恢复,而非临床性能。随后,我们在配对的MIMIC-IV队列上,将该框架实例化于冻结的EchoJEPA和HuBERT-ECG嵌入上,用于LVEF预测和EF≤40%的HFrEF门控;在留出测试集(n=245)上,丢弃echo几乎使误差翻倍。狭窄的echo-ECG重叠限制了队列规模,这本身就是一个关于心脏基础模型的部署发现。我们的所有工作可在 https://github.com/criticaldata/PRIMED-AI 找到。
查看原文
查看缓存全文

缓存时间: 2026/08/04 17:40

论文页面 - 响亮还是沉默?多模态临床AI中按模态失败分析的可复用框架

来源:https://huggingface.co/papers/2608.01462 作者:

摘要

多模态临床模型通常以所有模态都存在时的准确性来评判,但在实际部署中往往会有模态缺失;例如,在常规进行心电图的场景中,超声心动图常常不可用。除了准确性损失的大小之外,还有两个问题值得关注:哪个模态对此负责,以及一旦该模态被丢弃,模型是响亮地失败还是沉默地失败。这种区分是逐样本且按模态级别的,并且不同于事后特征归因(例如 SHAP)。模型经常被替换;而回答这些问题的评估框架是可以复用的。我们提出了一个模型无关的模态失败分析框架:给定 N 个模态嵌入、任意一个掩码感知探针和标签,它返回逐样本的失败分类法、一个按模态的互补性矩阵(将错误归因于各模态),以及一个区分可监控失败与那些远离决策边界且未被标记地通过的失败的“响亮 vs 沉默”丢弃剖面,仅使用部署时可观测的信号。我们将其作为一个小型的、经过单元测试的工具包发布,并针对植入的 ground truth 进行验证。在各种随机种子下,它能够恢复植入的模态主导性和互补子集,报告每个模态的响亮/沉默比率,并扩展到三模态互补性矩阵;由于植入的结构是通过构造已知的,这验证的是逐样本归因的恢复能力,而非临床性能。然后,我们在冻结的 EchoJEPA 和 HuBERT-ECG 嵌入上,针对 LVEF 和 EF<=40% 的 HFrEF 门控,在配对的 MIMIC-IV 队列上实例化该框架,其中在留出测试集(n=245)上,丢弃超声心动图会使误差几乎翻倍。限制队列规模的回声-心电图重叠范围本身,就是针对心脏基础模型的一个部署发现。我们所有的工作可以在 https://github.com/criticaldata/PRIMED-AI 找到。

查看 arXiv 页面 (https://arxiv.org/abs/2608.01462)查看 PDF (https://arxiv.org/pdf/2608.01462)GitHub (https://github.com/criticaldata/PRIMED-AI)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.01462)

在你的 agent 中获取此论文:

hf papers read 2608\.01462

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2608.01462 即可从此页面链接到它。

引用此论文的数据集 0

没有数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.01462 即可从此页面链接到它。

引用此论文的 Space 0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2608.01462 即可从此页面链接到它。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到它。

相似文章

定义多模态人工智能系统的十种失败模式

Reddit r/ArtificialInteligence

该文章基于基准测试论文和研究,列举了十种多模态AI系统中有记录的失败模式,在这些模式中,模型会生成流畅但与实际输入不符的回答。

大型语言模型作为统一多模态学习器用于临床预测

arXiv cs.AI

该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。