Delta2Gamma: 用于阿尔茨海默病检测的EEG频段自适应对比学习

arXiv cs.LG 论文

摘要

Delta2Gamma是一个自监督学习框架,它将EEG信号分解成频段,并使用自适应对比学习进行阿尔茨海默病检测,达到92.4%的准确率。

arXiv:2608.17231v1 Announce Type: new 摘要:低成本、可扩展的痴呆症筛查仍然是一个开放问题。基于成像的诊断成本高昂且难以广泛部署。脑电图(EEG)便携且成本低廉,但其记录噪声大,受试者间差异显著,且携带的临床标签很少。我们通过Delta2Gamma来解决这个问题,这是一个自监督框架,通过对比每个信号的增强视图从无标签数据中学习EEG表示。Delta2Gamma不是将EEG视为单一流,而是将每个记录分解为五种标准神经节律(delta, theta, alpha, beta, gamma)。每个频段都有自己的编码器和投影头。每个频段还有一个温度参数,在对比训练期间自适应预测,从而自动平衡不同信号统计特性的频段。在ADFTD队列中,采用严格的留一受试者验证方案,Delta2Gamma以92.4%的准确率将阿尔茨海默病与认知正常对照区分开来。这超过了监督学习骨干网络和最近的专用EEG方法。
查看原文
查看缓存全文

缓存时间: 2026/08/19 10:24

# Delta2Gamma:基于频段自适应对比学习的脑电图阿尔茨海默病检测
来源:https://arxiv.org/html/2608.17231
朴灿佑 附录:韩国高丽大学人工智能系,首尔,韩国 [email protected] 金灿佑 附录:韩国高丽大学人工智能系,首尔,韩国 [email protected]

###### 摘要

低成本、可扩展的痴呆症筛查仍是一个待解决的问题。基于影像的诊断成本高昂且难以广泛部署。脑电图(EEG)具有便携且成本低廉的优势,但其记录信号噪声大、个体间差异显著,且临床标注数据稀缺。我们通过Delta2Gamma框架应对这一挑战,该自监督框架通过对每个信号的增强视图进行对比,从未标注的脑电数据中学习表征。与将脑电视为单一信号流不同,Delta2Gamma将每次记录分解为五种典型的神经节律波段(δ波、θ波、α波、β波、γ波)。每个波段拥有独立的编码器和投影头。每个波段还在对比训练过程中自适应预测一个温度参数,使得具有不同信号统计特性的波段得以自动平衡。在严格遵循"留一法"协议的ADFTD数据集上,Delta2Gamma以92.4%的准确率将阿尔茨海默病与认知正常对照组区分开来。该性能超越了监督式主干网络及近期的专用脑电方法。

###### 索引术语:

频段头、自监督学习、脑电图、自适应温度、痴呆症、表征学习

## I 引言

全球人口老龄化及痴呆症患病率的爆炸性增长构成了一场公共卫生危机,正给全球社会经济结构和医疗保健系统带来沉重压力[23 (https://arxiv.org/html/2608.17231#bib.bib1),17 (https://arxiv.org/html/2608.17231#bib.bib2)]。传统诊断方法,如磁共振成像(MRI)和正电子发射断层扫描(PET),因成本高、可及性有限且依赖大型固定设备和专业人员[10 (https://arxiv.org/html/2608.17231#bib.bib7)],在早期检测方面价值有限。由于这些模式受限于专业医疗中心,无法作为面向广泛高危人群的一线筛查工具。因此,痴呆症的前驱阶段——轻度认知障碍——难以被发现,大多数患者仅在症状显著进展后才被确诊[31 (https://arxiv.org/html/2608.17231#bib.bib8)]。

脑电图(EEG)提供了一种可扩展的替代方案。它无创、直接且定量地测量大脑功能下降[7 (https://arxiv.org/html/2608.17231#bib.bib9)],不同于仅通过血流变化间接反映神经活动的功能性MRI。通过直接记录神经元产生的电信号,脑电图反映了定义痴呆症的神经病理变化如何损害大脑功能,为认知衰退的神经生理学基础提供了关键见解[35 (https://arxiv.org/html/2608.17231#bib.bib10)]。这些特性使得脑电图非常适合在医院外进行便携、可重复且经济实惠的认知监测。其他低成本数字生物标志物也在并行研究中:大型语言模型(LLMs)应用于自发性语音,通过对转录叙述的思维链推理来检测AD[28 (https://arxiv.org/html/2608.17231#bib.bib43)];将其与视觉语言模型结合用于图片描述任务可进一步提高检测效果[29 (https://arxiv.org/html/2608.17231#bib.bib44)];甚至临床启发的认知测试套件也被重新用于评估LLMs本身的推理能力[30 (https://arxiv.org/html/2608.17231#bib.bib45)]。然而,这些行为标志物依赖于语言产出和任务配合,而脑电图直接测量潜在的神经功能障碍,这促使我们专注于静息态记录。

大量研究识别出了阿尔茨海默病(AD)和其他痴呆症的可量化频谱特征,可概括为大脑振荡的整体*减慢*。患者表现出低频波段(δ波,0–4 Hz;θ波,4–8 Hz)功率增加[22 (https://arxiv.org/html/2608.17231#bib.bib3)],同时高频波段(包括α波,8–12 Hz;β波,12–30 Hz)功率降低,尤其是与短时记忆等高级认知功能紧密相关的γ波段(>30 Hz)功率显著下降[40 (https://arxiv.org/html/2608.17231#bib.bib11)]。这些波段特异性的变化促使模型需要单独处理每种节律,而非将信号压缩为单一表征。基于这些生物标志物,本文的主要贡献在于:
1. 1.频率波段特异性编码:我们提出Delta2Gamma架构,将脑电图分解为五种典型波段(δ、θ、α、β、γ),并使用独立的CNN编码器和投影头处理每个波段,以保留波段特异性的神经信息。
2. 2.有效的痴呆症分类:我们设计了一个自监督模型,能够捕捉痴呆症的神经生理学特征(δ/θ波增强,α/β波减弱),在严格的受试者独立评估下达到了最先进的准确率。

## II 所提方法

该框架(图1 (https://arxiv.org/html/2608.17231#S2.F1))包含两个阶段:自监督预训练和线性评估。我们对未标注的脑电数据进行对比学习,使模型学习通用的信号特征,同时数据增强生成对变换具有鲁棒性的表征。

参见图注 图1:Delta2Gamma模型概述。(a) 自监督预训练:对未标注脑电数据进行增强,然后通过带正则化的自适应NT-Xent对比损失训练编码器,在五个波段(δ、θ、α、β、γ)学习表征。(b) 线性评估:在冻结的预训练编码器之上添加分类器,用于AD vs. 认知正常(CN)分类。线性层上的数字表示层维度。### II-A 自监督多波段架构

我们基于SimCLR[4 (https://arxiv.org/html/2608.17231#bib.bib21)]构建,这是一种对比自监督方法,能将同一样本的增强视图拉近,同时将不同样本推开。我们的适配版本(图1 (https://arxiv.org/html/2608.17231#S2.F1)(a))专为脑电图设计:模型同时处理五个频率波段,并为每个波段使用独立的投影头进行细粒度特征学习。这在未标注脑电数据丰富但标签稀缺的临床环境中尤其有价值。预训练过程见算法1 (https://arxiv.org/html/2608.17231#alg1)。

形状为[C, L](C=19个通道;L=秒数×500 Hz采样率)的原始多通道脑电信号,通过带通滤波器分解为五个典型波段(δ:0.5–4 Hz,θ:4–8 Hz,α:8–13 Hz,β:13–30 Hz,γ:30–45 Hz),得到五个形状为[5, C, L]的并行视图。频段提取器使用并行的一维深度可分离卷积(核大小7,填充3,组数=C),随后进行批归一化[11 (https://arxiv.org/html/2608.17231#bib.bib6)]和ReLU[1 (https://arxiv.org/html/2608.17231#bib.bib5)]激活,因此每个通道被独立处理以保持其时间模式[16 (https://arxiv.org/html/2608.17231#bib.bib12)]。然后,每个波段通过一个独立的编码器,该编码器包含三个卷积块(通道数递增:32→64→128),其间穿插批归一化、ReLU和最大池化层,输出形状为[5, C, L/32]。全局平均池化汇总时间动态,五个池化输出通过一个带有批归一化和ReLU的全连接层融合成一个紧凑的5×128维嵌入,即每个波段一个投影向量。

算法 1 基于SimCLR的自监督预训练 1:未标注脑电数据 D,批次大小 B,轮次 E 2:预训练多频编码器 f_θ 3:初始化编码器 f_θ,波段 {δ, θ, α, β, γ},头 {g_k}_{k=1}^{5},温度网络 {φ_k}_{k=1}^{5} 4:对于 e=1 到 E 5:对于每个小批量 B={x_i}_{i=1}^{B},x_i ∈ ℝ^{C×T} 6: B^{(1)} ← 弱增强(B); B^{(2)} ← 强增强(B) 7:对于每个视图 v ∈ {1,2},波段 b 8: x_b^{(v)} ← 带通滤波(B^{(v)})_b 9: z_b^{(v)} ← g_b(CNN_b(x_b^{(v)})) 10:结束 11:对于每个波段 b 12: τ_b ← φ_b(z_b^{(1)}, z_b^{(2)}) 13: L^{(b)} ← NTXent(z_b^{(1)}, z_b^{(2)}, τ_b) + λ( (d/2) log τ_b + 1/τ_b ) 14:结束 15:根据 L_total=∑_b L^{(b)} 更新参数 16:结束 17:结束 18:返回 f_θ

### II-B 数据增强

自监督学习的核心是通过前置任务从数据本身提取有意义的信号。对于每个脑电图信号,我们使用高斯噪声(标准差0.03)、幅度缩放(因子在[0.8, 1.2]区间)以及在时间域和频率域各10%的随机遮蔽,并以10%的概率丢弃10%的通道,来生成两个语义相同但形态不同的视图。这两个视图构成一个实例判别任务:同一信号的视图构成正对,不同信号的视图构成负对,驱使模型学习对噪声和变换具有鲁棒性的表征。通过对比每个信号的弱视图和强视图,鼓励编码器丢弃无关变化,同时保留与诊断相关的波段特异性结构。

### II-C 训练目标

预训练损失聚合了带温度正则化的每个波段自适应NT-Xent损失[42 (https://arxiv.org/html/2608.17231#bib.bib23)]:L_pt = ∑_{b=1}^B L_b,其中

L_pt = ∑_{b=1}^B ( - (1/τ_b^+) sim(z_b^+, z_b) + (1/τ_{n^*}^b-) max_{n=1,...,N} sim(z_b, z_b^-_n) + β Ω(τ_b^+) - β Ω(τ_{n^*}^b-) ),

sim(·,·) 是正对 (z_b^+, z_b) 或负对 (z_b, z_b^-_n) 上的余弦相似度;N 是负样本数量;τ_b^+ 和 τ_{n^*}^b- 是可学习的自适应正、负温度,其中 n^* = arg max_n sim(z_b, z_b^-_n);β ≥ 0 控制正则项

Ω(τ) = (d'/2) log(τ) + 1/τ,

其中 d' 是投影维度;这促使 τ → 2/d'。与固定温度的SimCLR不同,每个波段接收到一个动态预测的温度,反映其分布和学习难度。因此,每个波段获得的对比信号强度与其自身统计特性相匹配,解决了单一全局温度无法解决的均匀性-容忍度权衡问题,并稳定了具有不同功率分布的波段的训练过程。

### II-D 下游任务

对于分类,我们在预训练编码器之上附加一个三层MLP(隐藏层大小为512和256,各带ReLU[1 (https://arxiv.org/html/2608.17231#bib.bib5)]、批归一化和dropout[37 (https://arxiv.org/html/2608.17231#bib.bib4)],dropout率分别为0.3和0.2),输出层大小与类别数相同。我们考虑了冻结编码器(线性评估,图1 (https://arxiv.org/html/2608.17231#S2.F1)(b))和微调所有参数两种方式。

## III 实验设置

预训练使用AdamW[18 (https://arxiv.org/html/2608.17231#bib.bib30)]优化器(批次大小64,学习率1×10^{-4}),自适应NT-Xent损失(温度范围[0.05, 0.5],β=0.01),权重衰减1×10^{-5},并采用带热重启的余弦退火策略。线性评估使用留一法(LOSO)交叉验证,冻结编码器权重,AdamW优化器(批次大小32,学习率1×10^{-4}),交叉熵损失。两个阶段均最多运行100个轮次,并在NVIDIA RTX 4090 GPU上实施早停(耐心值为10)。

### III-A 数据集

我们使用公开的ADFTD数据集[21 (https://arxiv.org/html/2608.17231#bib.bib24)]:来自88名参与者的静息态、闭眼记录(36名AD,23名额颞叶痴呆[FTD],29名CN)。平均MMSE评分:AD为17.75,FTD为22.17,CN为30。使用Nihon Kohden EEG-2100系统,采用19个头皮电极(10-20系统),采样率500 Hz,阻抗低于5 kΩ。由于仅凭脑电图难以识别FTD,分类聚焦于AD vs. CN;23名FTD受试者(未用于分类)提供未标注数据用于自监督预训练。

### III-B 预处理与分割

我们计算所有通道的平均参考,因为参考方式对幅度测量有重要影响,并应用6阶巴特沃斯带通滤波器(0.5–45 Hz)[24 (https://arxiv.org/html/2608.17231#bib.bib25)],以保留区分AD与CN的相关活动。随后通过独立成分分析的盲源分离去除眼动和肌电伪影[6 (https://arxiv.org/html/2608.17231#bib.bib18)],所有操作均在MNE-Python[8 (https://arxiv.org/html/2608.17231#bib.bib19)]中进行。闭眼脑电被分割为30秒的时段,与睡眠研究中使用的标准时段长度一致[27 (https://arxiv.org/html/2608.17231#bib.bib46)],并最大限度减少外部刺激的影响[44 (https://arxiv.org/html/2608.17231#bib.bib20)]。

### III-C 评估协议与指标

留一法(LOSO)交叉验证[15 (https://arxiv.org/html/2608.17231#bib.bib22)]在N-1个受试者上训练,在留出的受试者上测试,对所有受试者重复此过程。通过防止跨受试者数据泄露,它提供了一种严格、现实的泛化能力估计,适用于个体间差异性大的情况。我们报告准确率、精确率、召回率、加权F1分数和AUC。

## IV 结果与讨论

### IV-A 留一法性能

我们与使用Braindecode[34 (htt...

相似文章