通过交互感知的Mixture-of-Experts理解结构化健康数据
摘要
本文研究了利用结构化健康记录的多层次视图,通过交互感知的Mixture-of-Experts进行中风后僵硬预测。尽管性能提升微乎其微,但路由归因揭示了不同视图间系统性的重要性差异,强调视图构建是实现可解释性的关键。
arXiv:2607.12255v1 公告类型:新
摘要:我们研究了利用结构化健康记录的多层次视图,通过交互感知的Mixture-of-Experts进行中风后僵硬预测。尽管性能提升微乎其微,但路由归因揭示了不同视图间系统性的重要性差异,强调了视图构建是实现可解释性的关键。
查看缓存全文
缓存时间: 2026/07/15 04:18
# 通过交互感知的混合专家模型理解结构化健康数据
来源:https://arxiv.org/html/2607.12255
###### 摘要
我们研究了用于脑卒中后僵硬预测的交互感知混合专家模型,该模型利用结构化健康记录的多层次视图。尽管性能提升微乎其微,但路由归因揭示了不同视图间系统性的重要性差异,强调了视图构建是可解释性的关键。
结构化健康数据,混合专家模型,临床预测,可解释性,机器学习
## 1 引言
结构化健康数据是临床预测的主要基质,涵盖账单编码、诊断、手术、生命体征以及其他以表格形式组织的非规则临床测量数据 (Shickel et al., 2018 (https://arxiv.org/html/2607.12255#bib.bib1); Xu and others, 2025 (https://arxiv.org/html/2607.12255#bib.bib2))。常见的建模方法反映了这种结构,梯度提升决策树和表格神经网络在结构化健康数据任务上仍然是强大的基线模型 (Chen and Guestrin, 2016 (https://arxiv.org/html/2607.12255#bib.bib3); Gorishniy et al., 2021 (https://arxiv.org/html/2607.12255#bib.bib4); Somepalli et al., 2021 (https://arxiv.org/html/2607.12255#bib.bib5); Popov et al., 2020 (https://arxiv.org/html/2607.12255#bib.bib6); Wang et al., 2021 (https://arxiv.org/html/2607.12255#bib.bib7); Shwartz-Ziv and Armon, 2022 (https://arxiv.org/html/2607.12255#bib.bib8); McElfresh and others, 2023 (https://arxiv.org/html/2607.12255#bib.bib9))。然而,大多数结构化数据模型要么将记录视为单一的表格输入,使得临床上有意义的交互需要隐式学习,要么附加上文本或影像等天然不同的模态。目前尚不清楚,将单一结构化记录转换为多种替代表示,并建模它们之间的交互,是否能在提升预测性能的同时使预测过程更易于解释。
为了探讨这一问题,我们采用多视图学习的术语,其中**视图**表示同一底层示例的不同表示 (Sun, 2013 (https://arxiv.org/html/2607.12255#bib.bib32))。多视图学习旨在利用不同视图间的互补和共享信息,并已得到广泛应用——例如,在医学诊断中融合影像和临床文本 (Wang et al., 2018 (https://arxiv.org/html/2607.12255#bib.bib35)),或在活动识别中结合不同的传感器模态 (Zhang et al., 2019 (https://arxiv.org/html/2607.12255#bib.bib36))。然而,如何为**单一**结构化健康记录构建和利用多个视图仍然研究不足。
对于结构化健康数据,这类视图可以在多个层面上构建。在**模型层面**,当相同的结构化输入通过不同的预测模型时,每个模型学到的表示构成一个视图,因为不同架构编码了不同的归纳偏置 (Gorishniy et al., 2021 (https://arxiv.org/html/2607.12255#bib.bib4); Popov et al., 2020 (https://arxiv.org/html/2607.12255#bib.bib6); Shwartz-Ziv and Armon, 2022 (https://arxiv.org/html/2607.12255#bib.bib8))。在**数据层面**,相同的结构化输入可以按临床语义划分为管理、手术、诊断、生命体征和代码组 (Johnson and others, 2023 (https://arxiv.org/html/2607.12255#bib.bib13); Ma and others, 2025 (https://arxiv.org/html/2607.12255#bib.bib14))。在**表示层面**,记录可以通过不同的范式进行编码——基于图的患者-特征结构 (Brody et al., 2022 (https://arxiv.org/html/2607.12255#bib.bib15); Choi et al., 2020 (https://arxiv.org/html/2607.12255#bib.bib16); Rocheteau et al., 2021 (https://arxiv.org/html/2607.12255#bib.bib17))、表格表示学习以及来自记录自然语言渲染的文本嵌入 (Hegselmann et al., 2023 (https://arxiv.org/html/2607.12255#bib.bib18); Lee and others, 2024 (https://arxiv.org/html/2607.12255#bib.bib19); Steinberg et al., 2021 (https://arxiv.org/html/2607.12255#bib.bib20))。此外,虽然简单拼接不同视图有可能提升预测性能,但它无法区分视图特有信号与跨视图共享或仅通过组合才出现的信号,这在医疗等敏感语境下对于提供解释至关重要。
为了原则上表征这些区分,我们采用了部分信息分解(PID)框架,该框架将一组视图关于目标的信息分解为冗余、唯一和协同信息 (Williams and Beer, 2010 (https://arxiv.org/html/2607.12255#bib.bib21); Bertschinger et al., 2014 (https://arxiv.org/html/2607.12255#bib.bib22); Liang et al., 2023 (https://arxiv.org/html/2607.12255#bib.bib23))。具体而言,我们采用了近期提出的 I2MoE 框架 (Xin et al., 2025 (https://arxiv.org/html/2607.12255#bib.bib24)),该框架通过专门化的专家路由输入,并显式呈现视图特有和协同信号,用于研究脑卒中后僵硬预测。我们使用了一个包含 129,401 次住院的全国住院脑卒中队列。通过这一设置,我们检验了模型层面、数据层面和表示层面的视图——均来自同一结构化健康记录——是否能为预测和解释提供有用的交互结构。
我们的结果显示,引入多视图方法在预测性能上提升甚微,这与视图是同一记录的替代分解而非独立模态的认知一致。尽管如此,路由归因揭示,模型层面、数据层面和表示层面的视图设计在不同视图间产生了系统性的重要性分配差异,并且这些分配在相似患者间具有局部一致性。这些发现表明,即使预测收益有限,视图构建对于可解释性仍是一项有意义的设计选择,并指出基于路由的归因是构建结构化健康记录解释的实用视角。
## 2 相关工作
##### 结构化表格健康建模。
结构化健康数据是临床预测的核心,因为它们大规模地捕获了诊断、手术、利用率和纵向测量数据 (Shickel et al., 2018 (https://arxiv.org/html/2607.12255#bib.bib1); Xu and others, 2025 (https://arxiv.org/html/2607.12255#bib.bib2))。这些数据通常被建模为单一的表格表示。梯度提升树,包括 XGBoost,仍然是表格预测的强大基线 (Chen and Guestrin, 2016 (https://arxiv.org/html/2607.12255#bib.bib3)),而表格神经架构如 SAINT、NODE 和 DCN-V2 为结构化输入提供了有竞争力的替代方案 (Somepalli et al., 2021 (https://arxiv.org/html/2607.12255#bib.bib5); Popov et al., 2020 (https://arxiv.org/html/2607.12255#bib.bib6); Wang et al., 2021 (https://arxiv.org/html/2607.12255#bib.bib7))。然而,这些方法在很大程度上保留了单一视图的处理方式,并抽象掉了每个测量所代表的不同临床概念。我们询问的是,是否可以将单一结构化健康记录通过多种视图定义来表达,以及这些视图是否能使交互感知的预测和解释更有信息量。
##### 交互建模与可解释性。
基于结构化记录的临床预测通常依赖于变量之间的联合作用而非孤立作用。带有成对项的可解释加性模型已表明,选择的特征交互可以在保持可检查性的同时支持临床风险预测 (Caruana et al., 2015 (https://arxiv.org/html/2607.12255#bib.bib29)),而神经交互检测和后验归因方法则解释训练好的预测器中的依赖关系 (Tsang et al., 2018 (https://arxiv.org/html/2607.12255#bib.bib31); Lundberg and Lee, 2017 (https://arxiv.org/html/2607.12255#bib.bib30))。这些方法主要在变量或变量对的层面上操作。相比之下,基于视图的建模在融合之前将结构化记录组织成更高级别的来源,将问题转移到每个视图是否贡献了独特的、重复的或联合有用的信号。部分信息分解将这些情况形式化为唯一信息、冗余信息和协同信息 (Williams and Beer, 2010 (https://arxiv.org/html/2607.12255#bib.bib21); Bertschinger et al., 2014 (https://arxiv.org/html/2607.12255#bib.bib22); Liang et al., 2023 (https://arxiv.org/html/2607.12255#bib.bib23))。I2MoE 通过在预测性 MoE 中通过唯一、协同和冗余专家实现了这一思想 (Xin et al., 2025 (https://arxiv.org/html/2607.12255#bib.bib24))。我们的工作使用这一框架来评估当所有视图都从同一个结构化健康记录构建时,视图层面的交互建模是否有用。
## 3 方法
表 1:预测性能总结。∗ 表示在随机种子下相对于 XGBoost 具有统计显著性提升。
### 3.1 任务定义
为了研究当单一结构化记录通过替代视图表达时,交互感知模型的行为,我们将脑卒中后僵硬预测作为一个二分类任务。队列来自 2016-2020 年成人 HCUP/NIS 脑卒中住院患者,包含 129,401 次住院。HCUP/NIS 是美国医院住院患者的全付款人数据库,来自医院账单数据,包含通常可从出院摘要中获得的临床和资源使用信息。我们使用临床医生精选的 55 个 ICD-10-CM 代码定义僵硬。选定的预测变量涵盖管理因素、手术、诊断、临床体征和分组后的 ICD 指标。
### 3.2 三种视图定义
对于结构化健康数据,视图结构通常是建模选择而非原始记录的固定属性。这些记录的结构化性质允许在建模流程的不同阶段定义替代视图:在建模前通过分组变量,在建模过程中通过特定架构的编码器,以及在上游编码后通过融合学习到的表示。我们使用这三个阶段来定义数据层面、模型层面和表示层面的视图,同时保持 I2MoE 公式固定。
#### 3.2.1 模型层面视图
模型层面的公式将表格预测骨干网络的表示视为视图。我们用 SAINT、NODE 和 DCN-V2 编码完整的已处理记录 (Somepalli et al., 2021 (https://arxiv.org/html/2607.12255#bib.bib5); Popov et al., 2020 (https://arxiv.org/html/2607.12255#bib.bib6); Wang et al., 2021 (https://arxiv.org/html/2607.12255#bib.bib7)),这三种模型专为结构化表格输入设计,具有不同的归纳偏置:基于注意力的特征建模、受树启发的表示学习和显式特征交叉。它们的隐藏表示被传递给专门的唯一专家,评估表格专用模型是否从相同的记录产生不同的预测信号。
#### 3.2.2 数据层面视图
数据层面的公式通过语义特征划分定义视图。记录被分为管理、手术、诊断、临床体征和 ICD 指标组。每组由一个单独的多层感知机唯一专家编码。这检验了当视图对应于同一结构化记录中临床上相关的子领域时,交互结构是否会显现。
#### 3.2.3 表示层面视图
表示层面的公式在上游编码后定义视图。对于每位患者,我们使用冻结的 GATv2 编码器 (Brody et al., 2022 (https://arxiv.org/html/2607.12255#bib.bib15)) 获取图表示,使用冻结的 NODE 编码器 (Popov et al., 2020 (https://arxiv.org/html/2607.12255#bib.bib6)) 获取表格表示,以及使用应用于记录结构化文本渲染的冻结 Qwen3-Embedding 编码器 (Zhang et al., 2025 (https://arxiv.org/html/2607.12255#bib.bib33)) 获取文本表示。然后这些嵌入由 I2MoE 融合。这评估了在视图特定的表示学习之后,交互感知的融合是否更有用。
### 3.3 I2MoE 公式与目标
设 {hm}m=1M 表示视图特定的表示,其中对于模型层面和表示层面视图 M = 3,对于数据层面视图 M = 5。遵循 I2MoE (Xin et al., 2025 (https://arxiv.org/html/2607.12255#bib.bib24)),我们为每个视图使用一个唯一专家、一个协同专家、一个冗余专家和一个重加权网络 g:
y^ = σ(∑_{m=1}^M w_m^u f_m^u(h_m) + w^s f^s(h) + w^r f^r(h)),(1) 其中 [w_1^u, ..., w_M^u, w^s, w^r] = g([h_1; ...; h_M])。协同专家旨在捕获仅当视图联合考虑时才出现的信号,而冗余专家则捕获跨视图共享的信号。
我们优化任务损失和弱监督的 I2MoE 交互损失,该损失鼓励唯一、协同和冗余专家分别捕获视图特定、组合和共享信息:
L_total = L_task + λ_int L_int,(2) 我们请读者参考 Xin et al. (2025 (https://arxiv.org/html/2607.12255#bib.bib24)) 以获取 L_int 的完整构建。
### 3.4 实验协议
对于每种视图定义,我们训练一个完整的 I2MoE 模型,包含唯一、协同和冗余专家,以及三个消融版本:移除协同专家、移除冗余专家、两者都移除。我们使用 AUROC、AUPRC 和 F1 评估预测性能,所有预测结果在 30 个随机种子上进行平均。我们使用专家路由权重在两个层面进行解释。全局解释总结每个视图定义如何在队列层面将预测质量分配给唯一、协同和冗余专家,通过在测试队列和多次重训练中平均专家路由权重来估计。局部解释询问具有相似学习表示的患者是否获得相似的专家权重分配。为此,我们使用表示层面的模型,比较学习表示空间中最邻近患者与随机匹配患者之间的专家路由距离。
## 4 实验与结果
### 4.1 预测性能
三种视图定义与强大的图和表格基线相比具有竞争力,但其优势依赖于指标(表1 (https://arxiv.org/html/2607.12255#S3.T1))。与 XGBoost 相比,模型层面视图在 AUROC 和 AUPRC 上显示出统计显著的提升,而表示层面视图在 F1 上显示出统计显著的提升,但 AUROC 较低。数据层面视图与 XGBoost 在主要指标上没有显著差异。这是我们研究中的核心实证模式。单一结构化健康记录可以重新表达为模型层面、数据层面或表示层面的视图,并且这些选择会改变预测行为。然而,性能提升有限,因为这些视图是同一底层记录的替代分解,而非独立模态。
### 4.2 交互消融
交互相似文章
通过不确定性感知的多专家融合增强卒中康复中的临床决策
本文介绍了xAARA,一种不确定性感知的多专家融合引擎,通过提供校准的不确定性和可解释的说明来增强卒中康复的临床评估,在动作质量评估中实现了高精度并降低了预测不确定性。
面向可解释、鲁棒且可审计的临床预测的多模态路由
本文提出了一种用于临床预测的显式多模态路由框架,利用EHR数据,通过离散的单模态、双模态和三模态路径,以及推理时路径掩码来模拟缺失模态,实现对结构化变量、临床笔记和胸部X射线的可解释、鲁棒且可审计的推理。
iLENS: 可解释的LLM引导的混合专家模型用于神经影像生存分析
本文介绍了iLENS,一种可解释的、由大语言模型(LLM)引导的混合专家(MoE)框架,用于阿尔茨海默病的生存预测和患者亚型分析。该方法为其路由决策提供了透明且基于生物学的合理解释,弥合了高性能生存分析与可解释临床决策支持之间的差距。
从结构化临床数据预测心血管风险的大语言模型
本文提出了一种混合框架,将结构化临床数据与LLM生成的叙述相结合,用于冠状动脉疾病预测,在变量提取方面实现了高保真度,并比较了机器学习模型与基于LLM的零样本和少样本分类。
面向阿尔茨海默病患者的药物感知金融剥削检测——基于边缘感知交互风险建模
本文提出了一种药物感知框架,将用药依从性数据与交易监控相结合,以检测阿尔茨海默病患者的认知风险金融事件,并在药物诱导的脆弱窗口期内显示召回率提升。