通过变分深度嵌入发现可解释的EEG微状态:基于多象限评估的系统架构搜索
摘要
本文提出了Conv-VaDE,这是一种用于发现可解释脑电图(EEG)微状态的变分深度嵌入模型,该模型联合学习地形重构和概率软聚类。它包含对静息态EEG数据进行评估的系统架构搜索,以确定最佳模型配置以实现稳定性和可解释性。
查看缓存全文
缓存时间: 2026/05/13 06:22
# 通过变分深度嵌入发现可解释的脑电微状态:基于多象限评估的系统性架构搜索 来源: https://arxiv.org/html/2605.10947 \\copyrightclause 本文版权归作者所有。根据知识共享署名 4.0 国际许可协议 (CC BY 4.0) 允许使用。\\conferenceLate-breaking work, Demos and Doctoral Consortium, colocated with the 4th World Conference on eXplainable Artificial Intelligence: July 01–03, 2026, Fortaleza, Brazil \[orcid=0009-0007-8428-7019, [email protected], \]\\cormark[1]\\fnmark[1] \[orcid=0000-0003-3702-4826, [email protected], \]\\fnmark[1] \[orcid=0000-0002-2718-5426, [email protected], \]\\fnmark[1] \\cortext \[1\]通讯作者。\\fntext\[1\]这些作者贡献同等。 Andrea VisentinLuca LongoSchool of Computer Science and Information Technology, University College Cork, Western Road, Cork, T12 XF62, IrelandArtificial Intelligence and Cognitive Load Research Lab, University College Cork, IrelandInsight RI Research Centre for Data Analytics, University College Cork, Ireland (2026) ###### 摘要 脑电(EEG)微状态分析将连续的脑电活动分割为短暂的、准稳定的地形配置,反映离散的脑功能状态。传统的修改版 K-均值(Modified K-Means)等方法直接在电极空间中进行硬分配,缺乏学习到的潜在表示、生成式解码器以及将潜在配置解码为可验证头皮地形图的机制,从而限制了模型的透明度和可解释性。为此,我们提出了卷积变分深度嵌入(Conv-VaDE)模型,该模型在共享潜在空间中联合学习地形重构和概率软聚类。Conv-VaDE 支持将聚类原型生成解码为可验证的头皮地形图,用概率软分配取代不透明的硬分区。我们采用极性不变性方案,并对聚类数量($K \in [3, 20]$)、潜在维度、网络深度和通道宽度进行四维网格搜索,以系统揭示每种架构设计选择如何塑造所学 EEG 微状态表示的质量、稳定性和可解释性。该模型在 LEMON 闭眼静息态 EEG 数据集上对十名参与者进行评估,采用地形模板形成、聚类稳定性和全局解释方差(GEV)。架构搜索结果表明,深度 $L=4$ 在所有 18 个最佳配置中一致出现,在模型扫描中 $K=4$ 时取得最佳 GEV 0.730 和轮廓系数 0.229,其中具有紧凑通道宽度和小潜在维度的中等深度网络在整个 $K$ 范围内占据主导地位。这些结果表明,原则性的架构搜索而非模型规模,是通过变分深度嵌入实现可解释且稳定的 EEG 微状态发现的关键。 ###### 关键词: 脑电微状态\\sep变分自编码器\\sep高斯混合模型\\sep极性不变性\\sep超参数扫描\\sep聚类验证\\sep机制可解释性 ## 1 引言 脑电微状态是头皮电势短暂、准稳定的空间分布,通常持续 60–120 毫秒,将连续的脑活动划分为一系列离散的功能状态\[MICHEL2018577,Lehmann:2009\]。Lehmann 及其同事确立,微状态的时间统计数据,包括平均持续时间、发生率、转换概率和分数覆盖率,是敏感的生物标志物,后续研究将其与认知处理以及精神分裂症和抑郁症等神经精神疾病联系起来\[brechet2022eeg,murphy2020abnormalities,Lehmann:2009\]。 作为微状态分析的主要聚类算法,修改版 K-均值(ModKMeans)基于空间相关性将每个时间点分配给最近的微状态类别,将相反符号的图视为等效。这种硬分配丢弃了关于过渡或模糊区域的信息,在这些区域中,头皮地形可能真正反映两个或更多潜在微状态的混合物。此外,固定 $K=4$ 个微状态的惯例虽然基于早期的群体水平发现,但可能无法捕捉个体脑动态的全部复杂性;已知最佳聚类数量随数据集、记录条件和临床人群而变化\[MICHEL2018577\]。关键的是,ModKMeans 直接在电极空间运行,没有学习到的表示也没有解码器,无法提供重建或验证其发现的聚类中心作为头皮地形图的机制。最近应用于 EEG 微状态的深度学习架构\[zhao2025identifying,sikka2020investigating,thukral2025convolutional\]通过学习非线性映射,使聚类中心能重建为头皮地形图,从而解决了一些这些缺点。然而,这些方法要么依赖于对冻结潜在空间的事后聚类,要么将微状态框架为监督分类,确定最佳微状态数量的挑战仍未解决。 这一差距促使了一种生成式方法,该方法将学习到的解码器与捕获分配不确定性的概率聚类机制相结合。变分深度嵌入(VaDE)\[jiang2017variational\]结合变分自编码器和高斯混合模型先验,联合学习结构化表示和概率聚类分配。本研究通过卷积变分深度嵌入(Conv-VaDE)模型将 VaDE 扩展到 EEG 微状态分析,并研究聚类数量、潜在维度、网络深度和通道宽度如何影响所学微状态模板的质量、稳定性和可解释性,通过系统的四维网格搜索。 ## 2 相关工作 **传统微状态分析。**微状态分析由 Lehmann 等人规范化\[Lehmann:2009\],并由 Michel 和 Koenig系统化\[MICHEL2018577\],他们建立了带通滤波、全局场功率(GFP)峰值提取、空间聚类和时间标签分配的流水线,构成了当代微状态研究的基础。通过大规模规范性研究确定了四个典型类别(通常称为 A–D)\[koenig1999deviant,KOENIG200241\],并仍作为标准参考。修改版 K-均值和原子化及聚集层次聚类是主要的聚类算法\[Poulsen289850\],两者都在电极空间中进行硬分配,即每个时间点被分配给恰好一个微状态。这些方法通过其距离度量(通常是绝对空间相关性)实现极性不变性,而不是通过表示本身;头皮地形及其符号反转的对应物在分配期间被视为代表相同的微状态,这意味着算法隐式处理极性,而没有明确地将这种不变性编码到模型中。聚类质量传统上通过全局解释方差(GEV)进行评估,它衡量分配的微状态模板在多大程度上解释了观察到的头皮地形\[MICHEL2018577\]。标准分析流水线应用修改版 K-均值(ModKMeans),通过在 GFP 峰值采样的多通道 EEG 电压向量上进行聚类来拟合原型头皮电压分布,此时空间配置最稳定。然后将所得的微状态模板投影回完整的连续 EEG 记录,将每个时间点分配给其最相关的微状态图,从而捕捉超出孤立 GFP 峰值的每个微状态的时间范围。尽管文献中广泛报告四个典型微状态类别,但这一数字反映的是经验惯例,而非算法本身的约束\[Poulsen289850,vonwegner2018eeg\]。 **用于 EEG 微状态的深度学习。**深度学习架构已在 EEG 微状态研究的多个方面得到探索。Thukral 等人\[thukral2025convolutional\]在 EEG 地形图上训练卷积自编码器,并用 ModKMeans 对潜在空间进行聚类,改进了直接电极空间聚类的轮廓系数和 Davies-Bouldin 得分。Zhao 等人\[zhao2025identifying\]将微状态识别框架化为监督序列到序列分类,达到 74.26% 的准确率。Sikka 等人\[sikka2020investigating\]开发了基于 LSTM 的自编码器,以捕捉 EEG 数据中复杂的时间依赖性,使用所学表示对连续记录中的微状态转换建模。这些方法依赖于在网络外部应用的事后聚类程序,且由于缺乏生成式解码器,内部表示无法重建,导致发现的微状态模板成为黑箱。此外,它们都没有在训练期间强制执行极性不变性。缺乏极性不变性冒着创建冗余聚类的风险,这些聚类沿无关的符号轴分割单一脑状态。 **深度聚类和变分方法。**在单个网络中联合优化表示学习和聚类的深度聚类方法,比事后聚类提供了更连贯的替代方案,在后者中,表示学习和聚类被视为独立任务。深度嵌入聚类(DEC)\[xie2016unsupervised\]联合优化表示学习和聚类,但缺乏解码器,意味着它仅优化聚类目标,没有空间可视化或检查头皮地形。其改进变体,改进的深度嵌入聚类(IDEC)\[guo2017improved\]通过添加重建损失和解码器解决了这一问题,但解码器是确定性的而非生成式的,阻止了 EEG 片段对微状态模板的概率分配。变分深度嵌入(VaDE)\[jiang2017variational\]通过在高斯混合模型(GMM)先验(假设数据由 $K$ 个高斯分布的混合生成的概率模型)嵌入 VAE 框架来解决这一问题,优化混合增强证据下界,端到端训练编码器、解码器和 GMM 参数。这与事后聚类冻结潜在空间的两阶段流水线不同,因为聚类目标在学习过程中塑造潜在几何结构。简单、可扩展且稳定的变分深度聚类(S3VDC)通过在前训练期间交错 Kullback-Leibler 散度(KL)正则化扩展了 VaDE,以防止后验崩溃,这是一种近似后验忽略潜在代码且解码器仅从先验生成的故障模式\[fu2019cyclical,cao2020simple\]。Fu 等人\[fu2019cyclical\]表明,KL 权重的循环退火缓解了这种崩溃,允许编码器在学习到信息丰富的表示之前应用完整的 KL 惩罚。 **可解释性视角。**从可解释性的角度来看,内在方法和事后方法之间的区别是本工作的核心\[rudin2019stop\]。事后方法如 LIME\[ribeiro2016should\](通过局部拟合简单的可解释模型来解释单个预测)和 SHAP\[lundberg2017unified\](基于合作博弈论为每个输入特征分配贡献值),通过局部近似其决策边界来解释已训练模型,但需要单独的归因步骤,且不保证忠实于模型的内部推理。相比之下,内在可解释性内置于模型架构中:解释是模型自身的输出,而非外部近似。在生成模型的背景下,VAE 解码器通过将潜在代码映射到数据空间提供内在可解释性\[9166477\]。系统的架构评估通过揭示设计选择如何影响模型行为来补充这一点,以 Lipton 分类法的意义贡献于模型透明度\[lipton2018mythos\]。 ## 3 方法论 本研究采用二次研究方法,利用现有的 LEMON 静息态 EEG 数据集构建并实证评估新颖的 Conv-VAE-GMM 架构。^1^ 假设是:如果基于 GMM 先验的 VaDE 型 Conv-VaDE 模型在静息态 EEG 数据上训练,并接受对聚类数量、潜在维度、网络深度和通道宽度的系统性四维架构搜索,那么具有紧凑通道宽度的中等深度架构将在搜索空间中始终占主导地位,产生最稳定和可解释的微状态模板,如更高的轮廓系数、更低的 Davies-Bouldin 指数、更高的 Calinski-Harabasz 指数和更高的 GEV 所示,同时生成式解码器将能够直接将每个 GMM 组件中心重建为可验证的头皮地形。 参见图 1 标题:Conv-VaDE 将 EEG 记录处理为地形图,并使用具有 GMM 结构潜在空间的卷积编码器对其聚类,通过七分量目标进行训练,并在多个表示和距离度量下进行评估。 **数据理解与准备。**LEMON 数据集\[babayan2019mind\]包含 $f_s = 250$ Hz、61 通道、10-10 导联系统的闭眼静息态 EEG。从数据集中选择了十名参与者。通用平均参考和零相位 FIR 带通滤波器(2–20 Hz)保持时间对齐并防止相位引起的微状态边界模糊。通过 Pycrostates\[ferat2022pycrostates\]提取 GFP 峰值(最小峰间距离:3 个样本),并通过方位等距投影和三次插值投影到 $40 \times 40$ 地形图像上\[ahmed2022examining\]。仅计算训练集上的 Z 分数归一化及 $\pm 5\sigma$ 截断:$x_{\text{norm}} = \text{clip}((x - \bar{x}_{\text{train}})/\sigma_{\text{train}}, -5, +5)$。90/10 的训练/评估分割最大化训练数据;评估集未增强。 **模型架构。**编码器将 $x \in \mathbb{R}^{1 \times 40 \times 40}$ 通过四个 Conv2d 层(ndf $\to 2$ndf $\to 4$ndf $\to 8$ndf)与批量归一化、LeakyReLU($\alpha=0.2$)和丢弃($p=0.2$),然后自适应平均池化和全连接层通过重参数化\[kingma2022autoencodingvariationalbayes\]产生 $(\mu_\phi, \log\sigma^2_\phi) \in \mathbb{R}^{d_z}$。解码器与此镜像,使用 ConvTranspose2d 和线性最终激活。GMM 先验\[jiang2017variational\] $p(z) = \sum_{k=1}^K \pi_k \mathcal{N}(z; \mu_k^{(c)}, \text{diag}(\sigma_k^{2(c)}))$ 进行端到端优化。搜索变化 $K \in \{3, \dots, 20\}$, $d_z \in \{16, 32, 64\}$, depth $\in \{2, 3, 4\}$, ndf $\in \{32, 64, 128\}$,产生 486 个唯一配置,在 10 名受试者中评估。 **极性不变性与训练目标。**极性不变性...
相似文章
通过稀疏自编码器实现脑电图基础模型的机制可解释性
本文对三个脑电图基础模型(SleepFM、REVE、LaBraM)应用TopK稀疏自编码器,提取可解释的特征字典,并引入了概念引导框架,揭示了表征失败和临床纠缠问题。
先连续后离散:解决维度坍塌问题的VQ-VAE
本文探讨了VQ-VAE中常见的维度坍塌问题,指出模型表示通常局限于低维子空间。研究提出了一种“自编码器预热(AE Warm-Up)”策略,即首先将模型作为未量化的自编码器进行训练,从而提升重建质量并增加潜在空间的有效维度。
比较用于解释抑郁症检测中黑盒EEG模型的事后可解释性AI方法
本文比较了应用于基于EEG的抑郁症检测的InceptionTime模型的几种事后可解释性方法,发现方法之间部分收敛,同时强调了方法学上的差异性和局限性。
Stateful Visual Encoders for Vision-Language Models
本文介绍了一种用于视觉-语言模型的有状态视觉编码器,该编码器基于先前的特征来调节视觉表示,从而在多图像和智能体设置中实现更好的视觉比较。该方法在跨图像空间聚合、纵向放射学等任务上展现出一致的改进。
Brain-CLIPLM:基于脑电压缩语义表征的语言重建解码
研究人员提出Brain-CLIPLM,一个两阶段脑电到文本解码框架,利用对比学习提取语义锚点,并结合基于检索的大语言模型(LLM)及思维链(CoT)推理进行句子重建。该方法在测试中达到67.55%的Top-5句子检索准确率和85.00%的Top-25准确率,显著优于直接解码基线模型,跨被试评估证实了其良好的泛化能力。研究结果表明,脑电到文本解码应聚焦于恢复压缩后的语义内容,而非完整句子重建。