MedMix: 在模态异构性下的专业化一致性联邦稀疏MoEs
摘要
MedMix是一个语义对齐框架,用于联邦多模态稀疏MoE,通过协调路由和专家专业化解决模态异构性,在医疗AI数据集上实现性能提升。
查看缓存全文
缓存时间: 2026/08/17 10:15
# 模态异构性下保持专业化一致性的联邦稀疏专家混合模型
来源:https://arxiv.org/html/2608.13911
Adiba Orzikulova Dong Min Kim Jaehong Yoon Sung\-Ju Lee
###### 摘要
联邦多模态医疗人工智能在客户端和样本层面均面临模态异构性问题:客户端可能系统性缺乏特定模态类型的访问权限,而同一客户端内的单个记录可能包含不同的部分模态子集。稀疏专家混合架构是实现模态自适应计算的一种有前景的解决方案,但其在联邦学习中的应用在跨客户端模态异构性下较为脆弱——本地学习到的路由策略可能在不同客户端间产生分歧,并导致专家朝不兼容的专业化方向发展。不同客户端可能将相同的已观测模态配置分配给不同的专家,或在不同的缺失模态配置上训练相同索引的专家,导致标准聚合过程错位或覆盖稀疏专家混合模型旨在学习的专业化特性。为应对这一挑战,我们提出了MedMix——一种针对联邦多模态稀疏专家混合模型的语义对齐框架,该框架利用模态上下文协调跨客户端路由和专家专业化。在客户端侧,MedMix使用*模态上下文感知路由*,通过每个标记的模态身份、位置和不完整性上下文来指导专家选择。在跨客户端层面,它采用*共识引导路由对齐*,为共享模态模式构建服务器端共识锚点,并将本地批处理级路由分布与这些锚点对齐。作为这些路由机制的补充,*客户端自适应专家聚合*利用客户端特定的模态模式原型来匹配和聚合跨客户端的功能相似专家。在真实世界多模态医疗数据集上的实验表明,在多样化的模态异构性和模态不完整性设置下,MedMix取得了最佳的平均F1分数,在严重异构性条件下提升尤为显著。
## 1引言
在医疗人工智能中,多模态数据(如MRI影像、实验室检测和临床文本报告)通过捕捉患者状态的互补证据,能够实现更准确、更稳健的推断[7 (https://arxiv.org/html/2608.13911#bib.bib7)]。这一能力在真实临床环境中尤为重要,涵盖从阿尔茨海默病诊断[27 (https://arxiv.org/html/2608.13911#bib.bib27), 28 (https://arxiv.org/html/2608.13911#bib.bib28)]到使用异构电子健康记录进行ICU结果预测[12 (https://arxiv.org/html/2608.13911#bib.bib12), 10 (https://arxiv.org/html/2608.13911#bib.bib10), 11 (https://arxiv.org/html/2608.13911#bib.bib11)]的多种场景。然而,跨机构部署多模态模型仍受两个关键挑战制约。
首先,医疗数据具有*隐私敏感性*,因此通常被隔离在各个机构内部。HIPAA(健康保险可携带性和责任法案)和GDPR(通用数据保护条例)等法规使得集中原始患者记录在法律和操作上不可行,这促使联邦学习成为默认的协作范式[16 (https://arxiv.org/html/2608.13911#bib.bib16), 13 (https://arxiv.org/html/2608.13911#bib.bib13), 19 (https://arxiv.org/html/2608.13911#bib.bib19), 20 (https://arxiv.org/html/2608.13911#bib.bib20), 21 (https://arxiv.org/html/2608.13911#bib.bib21)]。其次,临床记录表现出普遍的模态不完整性[10 (https://arxiv.org/html/2608.13911#bib.bib10), 12 (https://arxiv.org/html/2608.13911#bib.bib12), 27 (https://arxiv.org/html/2608.13911#bib.bib27)]。在机构层面,医院由于设备、工作流程和临床实践的差异,其常规可用的模态可能不同。在患者层面,单个记录可能只包含部分模态,因为检测未开具、扫描未进行或笔记不可用。这些因素引发了*双层模态异构性*[21 (https://arxiv.org/html/2608.13911#bib.bib21)],包括跨客户端的模态可用性差异和客户端内部的患者级不完整性变化。
稀疏专家混合架构[24 (https://arxiv.org/html/2608.13911#bib.bib24), 14 (https://arxiv.org/html/2608.13911#bib.bib14), 5 (https://arxiv.org/html/2608.13911#bib.bib5)]因其能够将不同输入分配给专门的专家,而在模态不完整性下的多模态学习中颇具吸引力。近期的多模态专家混合方法在集中式设置中表现出对任意或不完整模态组合的强大鲁棒性[30 (https://arxiv.org/html/2608.13911#bib.bib30), 8 (https://arxiv.org/html/2608.13911#bib.bib8)]。然而,在双层模态异构性下,它们与联邦学习聚合的交互较为脆弱。当客户端以不同频率观测到不同的模态组合时,本地训练会在不同客户端间引发不同的路由信号。这可能导致路由器对共享的模态配置也发展出客户端特定的专家偏好。此外,这些发散的路由模式影响了专家本地训练的方式:相同索引的专家在不同客户端上可能接收来自不同模态上下文的输入。因此,相同索引的专家可能获得不同的功能角色,削弱了直接聚合所需的专业化语义兼容性。这削弱了联邦聚合的益处,导致在模态异构性下性能下降(见图1 (https://arxiv.org/html/2608.13911#S2.F1))。
我们提出了MedMix,一个用于联邦多模态稀疏专家混合模型的语义对齐框架,旨在模态异构性下协调跨客户端路由和专家专业化。MedMix包含三个互补组件:(1)*模态上下文感知路由*,利用每个标记的模态身份、位置和不完整性上下文指导专家选择;(2)*共识引导路由对齐*,为共享模态模式构建可靠的共识路由锚点,并将本地批处理级路由分布与这些锚点对齐;(3)*客户端自适应专家聚合*,利用客户端特定的模态模式原型来匹配和聚合功能相似的专家,同时保持客户端特定的专业化一致性。通过耦合这些机制,MedMix促进了跨客户端语义一致的路由和专家专业化,同时使聚合适应异构的模态分布。
我们在两个真实世界的多模态医疗基准上评估了MedMix:ADNI[27 (https://arxiv.org/html/2608.13911#bib.bib27)],整合了MRI、基因组、临床和生物标本模态,用于阿尔茨海默病评估;以及MIMIC\-IV[12 (https://arxiv.org/html/2608.13911#bib.bib12), 10 (https://arxiv.org/html/2608.13911#bib.bib10)],整合了实验室测量、临床笔记和诊断代码,用于ICU结果预测。两个数据集都表现出自然的模态不完整性。为了系统地研究联邦异构性,我们构建了具有不同程度客户端间模态可用性偏移和客户端内样本级模态不完整性的划分,包括极端的模态排他性设置。在这些场景中,MedMix取得了最佳的平均F1分数,在更强的模态异构性下提升更明显。这些结果突出了通过稳定路由和异构性感知专家聚合来保持联邦多模态专家混合模型跨客户端专业化一致性的重要性。我们的贡献总结如下:
- • 我们识别了联邦多模态专家混合模型在双层模态异构性下的一个关键脆弱性:客户端特定的模态分布引发了跨客户端不一致的路由行为和专家专业化,削弱了有效联邦聚合所需的专业化语义兼容性。
- • 我们提出了MedMix,一个联邦多模态稀疏专家混合模型框架,它促进跨客户端路由和专家专业化的语义一致性,同时使聚合适应模态异构性。
- • 我们在多样化的模态异构性场景下,在ADNI和MIMIC\-IV数据集上评估了MedMix,展示了其相对于强大的联邦多模态和专家混合基线的一致改进,尤其是在严重模态异构性下。
## 2背景
参见标题图1:模态异构性下联邦专家混合专业化的脆弱性。(a)路由分歧:归一化的Top\-k专家激活频率。在相同观测模态配置下,客户端表现出不同的路由偏好。(b)专家错位:两个客户端专家层输出的联合t\-SNE可视化,点按Top\-1路由专家着色。重新排列的颜色和聚类结构表明相同索引的专家获得了不同的客户端特定语义角色。(c)聚合影响:聚合后相对于聚合前本地模型的验证F1变化,ΔF1=F1post−F1pre\\Delta\\mathrm\{F1\}=\\mathrm\{F1\}\_\{\\mathrm\{post\}\}\-\\mathrm\{F1\}\_\{\\mathrm\{pre\}\},在通信轮次和5个种子上取平均。在平衡划分中聚合有益,但在异构模态分布下变得不可靠,反映出跨客户端专业化一致性的降低。#### 多模态联邦学习。
我们研究在模态不完整性下的监督多模态联邦学习。有K个客户端和M个可能的模态。客户端k拥有数据集\\mathcal\{D\}\_\{k\}=\\\{\(\\mathbf\{x\}\_\{i,k\},y\_\{i,k\},\\mathbf\{r\}\_\{i,k\}\)\\\}\_\{i=1\}^\{n\_\{k\}\},其中\\mathbf\{x\}\_\{i,k\}=\\\{x^\{m\}\_\{i,k\}\\\}\_\{m=1\}^\{M\}是多模态输入,y\_\{i,k\}是标签,\\mathbf\{r\}\_\{i,k\}\\in\\\{0,1\\\}^\{M\}是模态可用性掩码,指示观测到了哪些模态。\\Omega\(\\mathbf\{r\}\)=\\\{m:r^\{m\}=1\\\}表示观测到的模态集。目标是学习一个全局模型f\_\{\\theta\}:
min\_\{\\theta\}\\sum\_\{k=1\}^\{K\}\\frac\{n\_\{k\}\}\{n\}\\mathbb\{E\}\_\{\(\\mathbf\{x\},y,\\mathbf\{r\}\)\\sim\\mathcal\{D\}\_\{k\}\}\\left\[\\ell\\left\(f\_\{\\theta\}\(\\mathbf\{x\},\\mathbf\{r\}\),y\\right\)\\right\],\\qquad n=\\sum\_\{k=1\}^\{K\}n\_\{k\}\.(1)
这里,f\_\{\\theta\}\(\\mathbf\{x\},\\mathbf\{r\}\)表示仅使用\\Omega\(\\mathbf\{r\}\)中的模态进行预测。
#### 稀疏专家混合模型。
稀疏专家混合模型通过仅对每个输入激活参数的稀疏子集来增加模型容量[24 (https://arxiv.org/html/2608.13911#bib.bib24)]。近期的多模态专家混合方法进一步表明,稀疏专家路由在模态不完整性和任意模态组合下是有效的[8 (https://arxiv.org/html/2608.13911#bib.bib8), 30 (https://arxiv.org/html/2608.13911#bib.bib30)]。给定输入掩码\\mathbf\{r\},每个观测到的模态m\\in\\Omega\(\\mathbf\{r\}\)被编码为\\mathbf\{H\}^\{m\}=g\_\{m\}\(x^\{m\}\)。对于标记表示\\mathbf\{h\},标准稀疏专家混合路由器计算路由分布
\\mathbf\{q\}\(\\mathbf\{h\}\)=\\mathrm\{softmax\}\(W\_\{g\}\\mathbf\{h\}\).(2)
专家混合层根据\\mathbf\{q\}\(\\mathbf\{h\}\)激活Top\-s个专家,并使用相应的路由权重组合它们的输出。本地训练通常用负载均衡正则项[30 (https://arxiv.org/html/2608.13911#bib.bib30)]增强任务损失,以防止专家坍缩并鼓励平衡的专家利用。
#### 模态异构性下联邦学习中专家混合模型的脆弱性。
隐私约束和普遍的模态不完整性促使医疗人工智能采用具有稀疏专家混合融合的多模态联邦学习。然而,双层模态异构性打破了稀疏专家混合组件在跨客户端保持语义可比性的隐含假设:客户端可能学习不同的路由策略,并为相同索引的专家分配不同的功能语义。为了描述模态异构性对联邦稀疏专家混合模型的影响,我们分析了标准专家混合联邦学习基线的路由行为和专家表示。
图1(a, b)聚焦于两个具有共享模态集的代表性客户端。图1(a)报告了每个专家的归一化Top\-k激活频率。在标准联邦聚合隐含的跨客户端可比性假设下,相同的模态类型应在跨客户端中对应相似的专家使用情况。然而,客户端表现出不同的激活模式,表明模态异构性破坏了跨客户端的路由一致性。图1(b)进一步显示专家本身在语义上错位。专家层输出的t\-SNE可视化揭示了跨客户端不同的颜色和聚类结构,其中颜色表示Top\-1路由专家。这表明相同索引的专家不一定学习到语义兼容的函数,而是朝着由本地模态分布引发的客户端特定功能角色漂移。这种语义错位削弱了联邦聚合预期的收益。图1(c)报告了聚合后相对于聚合前本地模型的验证F1变化。虽然在平衡模态分布下聚合始终有益,但在异构模态分布下其效果变得不可靠,有时改进甚微甚至导致性能下降。这些结果表明联邦稀疏专家混合模型在模态异构性下是脆弱的,凸显了在路由和聚合过程中保持跨客户端专业化一致性的机制需求。更全面的分析详见附录E。
## 3MedMix
MedMix包含三个关键组件:(1)*模态上下文感知路由*,利用每个标记的模态身份、位置和不完整性上下文指导专家选择;(2)*共识引导路由对齐*,为共享模态模式构建可靠的共识路由锚点,并将本地批处理级路由分布与这些锚点对齐;(3)*客户端自适应专家聚合*,利用客户端特定的模态模式原型来匹配和聚合功能相似的专家,同时保持客户端特定的专业化一致性。附录A详细描述了该算法。
### 3\.1模态上下文感知路由
标准的专家混合路由器通常从标记表示计算专家选择分数[4 (https://arxiv.org/html/2608.13911#bib.bib4), 8 (https://arxiv.org/html/2608.13911#bib.bib8), 17 (https://arxiv.org/html/2608.13911#bib.bib17), 30 (https://arxiv.org/html/2608.13911#bib.bib30)]。然而,在双层模态异构性下,相似的标记表示可能出现在不同的观测上下文中:一个模态可能被单独观测,与不同的互补模态一起观测,或在客户端特定的模态可用性模式下观测。由于这些上下文影响标记的解释方式,仅基于标记的路由可能混淆需要不同专家专业化行为的输入。我们通过引入*模态上下文感知路由*来解决这个问题,该路由利用每个标记的模态身份相似文章
TIER-MoE: Trust-Informed Expert Routing via Conditional Modality Risk for Multimodal Fusion in Biomedical Classification
This paper introduces TIER-MoE, a risk-guided subspace mixture-of-experts model for multimodal biomedical classification that estimates sample-specific modality reliability from out-of-fold predictions and routes modalities to experts, improving performance and calibration on four public datasets.
Mix-MoE:通过混合专家混合提升大语言模型的多语言机器翻译
Mix-MoE提出了一种混合专家混合框架,通过专门的专家组和傅里叶变换增强的路由机制来缓解多语言机器翻译中的参数干扰,相比基线方法取得了显著改进。
LongMoE:基于轨迹感知的混合专家模型的纵向多模态学习
LongMoE提出了一个统一框架,同时解决多模态临床学习中的模态缺失和纵向动态问题,利用上下文感知插补、注意力令牌化、轨迹感知编码和稀疏混合专家路由。在ADNI、OASIS-3和MIMIC-IV上的实验表明,在缺失模态情况下鲁棒性得到提升,同时在完整模态设置下仍具有竞争力。
面向混合专家模型中一致专家选择的多层级上下文建模
本文提出了多层级上下文融合MoE(MCF-MOE)框架,通过集成跨层语义聚合和局部词元级交互,提升了混合专家模型中的路由一致性,在语言建模和理解基准测试上优于强基线。
MEDSYN: 复杂临床病例中多证据综合的多模态大语言模型基准测试
MEDSYN 是一个多语言多模态基准,用于评估多模态大语言模型(MLLMs)在复杂临床病例上的表现,每个病例最多包含 7 种不同的视觉证据类型。研究表明,虽然前沿模型在鉴别诊断生成方面与人类专家相当,但所有 MLLMs 在最终诊断选择中均存在显著差距,原因是异质临床证据综合能力不足。