MuteBench:不完整多模态融合中的模态不可用容忍度评估
摘要
MuteBench是一个基准测试,用于评估多模态融合模型在临床数据集上的模态缺失和模态内部缺失条件下的性能。它提供了关于架构鲁棒性的见解,并表明基于扩散的插补方法可以有所帮助。
arXiv:2605.15235v1 公告类型:新
摘要:多模态生理数据驱动从重症监护室到可穿戴设备的临床AI系统,但传感器在实践中经常失效。常见两种失效模式:模态缺失(整个通道缺失)和模态内部缺失(连续时间片段丢失)。目前没有基准测试在受控严重程度下跨多个临床数据集评估两种失效模式下的多种融合架构。我们提出MuteBench,一个覆盖7个临床领域的9个数据集、6种融合架构和2种缺失数据模式,共125,000个样本的基准测试。通过该基准测试,我们发现架构族是鲁棒性最强的预测因子,其重要性超过参数数量。通道独立模型能很好地容忍模态缺失,但在模态内部缺失(尤其是短序列)上可能敏感。课程模态丢弃仅在训练中使用的最大丢弃率范围内可靠地提供保护。我们还发现通道数、序列长度和模态对齐共同决定哪种失效模式构成更大威胁。最后,PTB-XL案例研究表明,基于扩散的插补可以改善模态内部缺失下的下游分类,对于其专家路由对受损输入最敏感的模型,收益最大,但跨数据集的更广泛验证仍是一个开放方向。MuteBench为实践者选择现有架构和指导未来鲁棒多模态融合方法设计提供具体指导。
查看缓存全文
缓存时间: 2026/05/18 06:38
# MuteBench:面向不完整多模态融合的模态不可用容忍度评估 来源:https://arxiv.org/html/2605.15235 Wugeng Zheng 中佛罗里达大学 [email protected] Ziwen Kan 中佛罗里达大学 [email protected] Tianlong Chen 北卡罗来纳大学教堂山分校 [email protected] Chen Chen 中佛罗里达大学 [email protected] Song Wang 中佛罗里达大学 [email protected] ###### 摘要 多模态生理数据为从重症监护室到可穿戴设备的临床AI系统提供动力,但传感器在实践中经常会失效。两种常见的失效模式是:模态缺失(整个通道完全缺失)和模态内缺失(连续时间段的数据丢失)。目前没有基准能够在受控严重程度下,在多个不同临床数据集上同时评估这两种失效模式下多种融合架构的性能。我们提出 MuteBench,这是一个涵盖 9 个数据集(来自 7 个临床领域)、6 种融合架构和 2 种数据缺失模式,共计超过 125,000 个样本的基准。通过该基准,我们发现架构族是鲁棒性的最强预测因子,其重要性超过参数数量。通道独立模型能很好地容忍模态缺失,但对模态内缺失可能很敏感,尤其是在短序列上。课程式模态丢弃仅在训练中使用的最大丢弃率范围内提供可靠保护。我们还发现,通道数量、序列长度和模态对齐方式共同决定了哪种失效模式构成更大的威胁。最后,一项基于 PTB-XL 的案例研究表明,基于扩散的插补可以改善模态内缺失下的下游分类性能,对于其专家路由对损坏输入最敏感的模型提升最大,尽管在更多数据集上的广泛验证仍是一个待探索的方向。MuteBench 为从业者提供了具体且基于数据集的指导,既用于选择现有架构,也用于指导未来鲁棒多模态融合方法的设计。 ## 1 引言 多模态生理数据是现代临床 AI [1,37] 的核心,它结合了 ECG、EEG、PPG 和结构化记录,用于支持疾病预测、严重程度评估和健康监测 [47,33,9]。然而,传感器在实践中经常会失效。导联脱落、设备失去接触以及传输错误导致数据段丢失 [7,41],从而产生两种不同的失效模式。*模态缺失* 发生在整个通道缺失时 [50],而 *模态内缺失* 是指在活动通道内连续时间段的数据丢失 [5]。这两种失效在部署和数据收集过程中都会出现,使得不完整的多模态数据成为临床数据集的一个常见特征。尽管如此,大多数多模态模型在训练和评估时都假设模态是完整可用的 [45,11],忽略了临床实践中常见的不完整性。即使数据是完整的,训练动态也倾向于某些模态而非其他 [44,16],因此实际中许多多模态模型依赖一个主导模态,而其他模态则未被充分利用。因此,模态缺失加剧了这些已有的不平衡,而不是创造了一个全新的挑战。最近的证据进一步表明,这两种失效模式会导致不一致的方法排名 [3],然而,目前没有工作能在受控严重程度下,在多个不同临床信号上同时评估多种架构在这两种模式下的表现(表 1),这使得从业者在构建鲁棒的多模态融合系统时缺乏明确的指导。 为了弥补这一空白,我们引入了模态不可用容忍度评估基准(MuteBench),涵盖来自 7 个临床领域的 9 个数据集,总样本数超过 125,000(数据集规模从 515 到 64,726 条记录不等),以及来自三个架构族的 6 种融合模型:通道独立模型、混合专家融合模型和共享-特有分解模型。所有模型均在受控严重程度下的两种缺失条件下进行评估,产生 270 种评估配置,并在三个独立的随机种子上重复(总共 810 次运行)。数据集通道数从 2 到 78 不等,序列长度从 48 到 3,000 个时间步,采样率从每小时一次的临床观察到 4,000 Hz 的生理波形,涵盖了所有三种模态对齐类型的二分类、多分类和多标签任务。一个框架无关的缺失注入库在所有代码库中注入相同的确定性模式,确保性能差异反映的是架构选择,而非数据管线的差异。 我们的主要贡献如下: - • **首个同时评估多种缺失条件下多个融合架构和临床数据集鲁棒性的基准。** MuteBench 是首个同时跨越多个轴进行评估的基准:来自 7 个临床领域的 9 个数据集、来自三个模型族的 6 种融合架构,以及在受控严重程度下的模态缺失和模态内缺失。框架无关的缺失注入库和统一的评估协议确保观察到的性能差异反映的是架构,而非管线差异。 - • **关于鲁棒性驱动因素的实证见解。** 对全部九个数据集的基准测试揭示,架构族是鲁棒性的主要驱动因素,而非参数数量。通道独立模型在模态缺失下最稳定,而共享-特有模型在同质信号下最能处理模态内缺失。数据集的通道数和序列长度共同决定了哪种失效模式更具破坏性。课程式模态丢弃提供强有力的保护,但仅限于训练中覆盖的缺失率范围内。 - • **扩散插补作为模态内缺失的潜在补救措施。** 在一项涉及三个模型的 PTB-XL 案例研究中,基于扩散的插补改善了模态内缺失下的下游分类性能,提升幅度随缺失严重程度增加。对于其专家路由对损坏输入最敏感的模型,提升最大,而那些已经在结构上处理模态内间隙的架构受益较小。在模态缺失下,这种好处可以忽略不计,因为完全缺失的通道为重建提供的条件信号极少。 表 1:多模态鲁棒性基准的功能比较。MuteBench 是首个在受控严重程度下,在多个融合架构和临床生理数据集上评估不同缺失条件下鲁棒性的基准。 基于这些发现,我们的 MuteBench 为在现实世界缺失情况下选择融合架构提供了具体且考虑数据集的指导。除了评估之外,我们的发现还通过识别控制每种失效模式敏感性的结构属性(模态对齐类型、通道数和序列长度),直接指导未来鲁棒多模态融合模型的设计。具体来说,我们的结果表明,在开发鲁棒融合架构时,应将数据集属性(如通道数、序列长度和模态对齐类型)视为一等设计输入,而不是事后通过通用的缺失数据策略来处理。MuteBench 及其发现共同为在真实传感器失效条件下基准测试和设计鲁棒的临床多模态融合系统建立了首个系统性的基础。 ## 2 相关工作 **临床多模态基准。** 临床多模态基准分为两类。第一类涵盖医学问答 [18,36]、基于临床图像和指南的 LLM 和 LVLM 推理 [40,15,24,10,17],以及结合放射学图像的结构化电子病历表的多模态 QA [2]。这些工作都侧重于文本驱动或知识驱动的推理,不涉及连续采样的生理信号。第二类针对面向任务的临床预测,结合时间序列、波形和结构化特征 [6,50,46]。Liang 等人 [25] 引入了一个具有鲁棒性评估的通用基准,但没有区分模态缺失和模态内缺失模式,也没有专注于临床生理信号。现有的基准没有系统性研究不同的缺失模式如何与多种融合架构下的信号结构相互作用,这留下了多模态临床评估中一个重要且未被解决的空缺。 **临床时间序列中的缺失数据。** 大多数多模态医疗预测模型是在假设模态完全可用的前提下开发和基准测试的 [45],但这一假设在真实临床实践中很少成立。临床生理信号中的缺失数据有两种形式:模态缺失(整个传感器流缺失)和模态内缺失(活动通道内的连续时间间隔缺失)。单模态方法通过缺失感知的循环模型 [5]、连续时间注意力网络 [34] 和基于图的传感器丢弃编码器 [51] 来解决这些挑战。对于多模态设置,现有方法包括生成式重建缺失模态 [26]、共享-特有特征分解 [43,48] 和基于提示的适配 [22]。这些方法各自在单个数据集上独立提出和评估,缺乏跨架构或跨临床信号结构的统一比较。 **鲁棒性基准。** 仍存在两个空缺。首先,没有基准能在受控严重程度下,在临床生理信号上同时评估多种融合架构在两种缺失模式下的表现。MultiBench [25] 和 MC-BEC [6] 各自仅解决其中一个维度。其次,没有基准考虑数据集结构(模态对齐类型、通道数和序列长度)如何与缺失模式类型相互作用以决定性能退化程度。缺少这一点,就难以判断哪些架构选择适合哪种部署场景。我们通过九个临床数据集(涵盖三种模态对齐结构)、六种融合架构和两种缺失模式(各两个严重程度级别)来填补这两个空缺。表 1 详细列出了这一比较。如第 4 节所示,架构排名可能在两种失效模式之间反转,这使得孤立的评估具有误导性。 ## 3 数据集 参见图注 图 1:MuteBench 概览。我们评估了来自 7 个临床领域的 9 个数据集以及三个代表性融合架构族(通道独立模型、混合专家融合模型和共享-特有分解模型)在受控严重程度下两种系统性缺失模式下的表现。 本节描述 MuteBench 中使用的数据集。我们选择了来自 7 个临床领域(图 1 左)的 9 个数据集,覆盖广泛的真实世界条件,以便我们的鲁棒性发现反映普遍趋势而非特定数据集的伪影。以下小节描述了我们的选择标准和模态定义。 ### 3.1 数据集选择与模态定义 我们整理了来自 7 个领域(例如 ICU、心脏病学、可穿戴活动追踪)的 9 个数据集,涵盖多种任务形式(二分类、多分类、多标签),以衡量空间和时间鲁棒性。这种多样性确保了所评估的融合策略能够在多样的输入结构和临床目标下进行测试,从而全面评估其在多样化临床环境中的泛化能力。我们将数据集分为三种模态对齐类型,以隔离结构对齐如何影响模型恢复缺失信息的能力。 **类型 1(同质且对齐)** 数据集共享相同的格式和时间轴(例如 12 导联 ECG),测试纯空间补偿能力。**类型 2(异质且对齐)** 数据集具有不同的物理域但同步的时间轴(例如 EEG 和呼吸),测试跨域时序推理能力。**类型 3(异质且不对齐)** 数据集缺乏空间和时间同步(例如异步的临床记录结合静态元数据),在最困难的对齐条件下测试模型。详细的选择标准和正式的模态定义见附录 C。 参见图注 图 2:缺失数据条件的评估。左(完整):原始、完全观测的信号。中(模态缺失):整个模态(例如 B 和 E)以概率 p 被丢弃,模拟整个传感器失效。右(模态内缺失):每个通道独立地掩码连续的时间段,模拟短暂中断(如运动伪影)。 ### 3.2 数据集统计 该基准涵盖来自 7 个临床和生理领域的 9 个数据集,总计超过 125,000 个样本。数据集规模相差两个数量级以上:HAR-UP [27] 最小,有 515 个样本;PPG-DaLiA [30] 最大,有 64,726 个样本。ICU 数据集处于中等规模,MIMIC-IV [19] 贡献了 5,100 个患者片段,Challenge-2012 [35] 约有 4,000 次住院记录。心脏数据集规模类似:PTB-XL [42] 提供 21,837 条记录,Chapman-Shaoxing [52] 提供 10,646 条记录。任务形式同样多样。三个数据集针对二分类:HAR-UP、MIMIC-IV 和 Challenge-2012。四个数据集需要多分类预测,类别数从 3 到 9:Sleep-EDF [21] 区分 5 个睡眠阶段,PPG-DaLiA 涵盖 9 种活动类型,WESAD [31] 识别 3 种情感状态,CirCor [28] 对 3 种心脏杂音严重程度进行分级。剩余两个数据集 PTB-XL 和 Chapman-Shaoxing 使用多标签预测,分别有 5 种诊断标签。
相似文章
MulTaBench:基于文本与图像的多模态表格学习基准测试
介绍了 MulTaBench,一个包含40个数据集的基准测试,用于文本和图像模态的多模态表格学习。实验表明,任务特定的嵌入调优优于冻结的预训练嵌入,特别是在模态提供互补预测信号时。
MedBench v5:面向临床多模态模型的动态、过程导向且具有幻觉感知能力的基准测试
MedBench v5 是一个面向临床多模态模型的动态、过程导向的基准测试,集成了幻觉检测和压力测试,超越静态问答,评估在信息流压力下的推理和稳定性。
Blind-Spots-Bench:评估多模态模型中的盲点
介绍Blind-Spots-Bench,这是一个旨在揭示现代多模态AI模型在人类认为简单的任务上持续失败的基准。评估了一系列模型,揭示了性能差距,并且没有单一模型在所有任务类型中占据主导地位。
MuseBench: 对多模态大语言模型中意图层面视听艺术理解的基准评估
MuseBench是一个全面基准,旨在评估多模态大语言模型对视听艺术中细微意图层面的理解,结果显示即使最佳模型也仅达到48.29%的准确率,而人类专家为87.18%。
MCBench: 面向全模态大语言模型的多语境安全评估基准
MCBench是一个新基准,用于评估全模态大语言模型在视觉、音频和文本模态下的安全性。它包含1196个场景,并发现当前模型难以进行跨模态安全推理。