STDA-Net:基于频谱图的跨数据集睡眠分期领域适应

arXiv cs.LG 论文

摘要

本文介绍了STDA-Net,一种利用2D频谱图和对抗学习进行跨数据集睡眠分期的领域适应框架。在公共数据集上,与现有的1D EEG基线方法相比,该方法显示出更高的准确性和稳定性。

arXiv:2605.06736v1 公告类型:新论文 摘要:由于脑电图(EEG)导联配置、采样率、记录环境和受试者人群的差异,跨数据集的准确睡眠分期仍然具有挑战性。尽管深度学习在自动睡眠分期方面展现出巨大的潜力,但大多数现有的跨数据集方法依赖于一维EEG信号表示,而在无监督领域适应框架中使用基于二维频谱图的输入在很大程度上尚未得到探索。在此,我们提出了STDA-Net(基于频谱图的时间领域适应网络),该框架结合了用于频谱图特征提取的卷积神经网络(CNN)、用于睡眠动态时间建模的双向长短期记忆(BiLSTM)模块,以及用于源域到目标域特征对齐的领域对抗神经网络(DANN),在训练过程中无需任何目标域的标注数据。我们在三个公开数据集Sleep-EDF、SHHS-1和SHHS-2上进行了实验,涵盖了六种跨数据集迁移设置。结果表明,所提出的框架达到了89.03%的平均准确率和87.64%的平均宏F1分数,在平衡分类性能方面始终优于现有的1D基线方法,且在五次独立运行中的方差显著降低,表明稳定性和可重复性得到了改善。总体而言,这些发现表明,2D频谱图表示结合时间建模和对抗领域适应,为跨数据集睡眠分期提供了一种比传统1D EEG输入更稳健且具竞争力的替代方案。
查看原文
查看缓存全文

缓存时间: 2026/05/11 06:46

# STDA-Net:基于频谱图的跨数据集睡眠分期领域自适应

来源:https://arxiv.org/html/2605.06736
Unaza Tallal1, Shruti Kshirsagar1, and Ankita Shukla2
1Unaza Tallal 和 Shruti Kshirsagar 隶属于美国威奇托州立大学计算学院,地址:1845 N. Fairmount, Wichita, KS 67260, USA;邮箱:[email protected], [email protected]
2Ankita Shukla 隶属于美国内华达大学拉斯维加斯分校计算机科学与工程系;邮箱:[email protected]

###### 摘要

由于脑电图(EEG)导联设置、采样率、记录环境和受试者人群的差异性,跨数据集的准确睡眠分期仍然具有挑战性。尽管深度学习在自动化睡眠分期方面展现出巨大的潜力,但大多数现有的跨数据集方法依赖于二维(1D)EEG信号表示,而在无监督领域自适应框架中使用二维(2D)频谱图输入的方法尚未得到充分探索。在此,我们提出了 STDA-Net(基于频谱图的时序领域自适应网络),这是一个结合了卷积神经网络(CNN)用于频谱图特征提取、双向长短期记忆网络(BiLSTM)模块用于睡眠动态的时序建模,以及领域对抗神经网络(DANN)用于在训练过程中无需任何目标领域标记数据即可实现源域到目标域特征对齐的框架。我们在三个公开数据集 Sleep-EDF、SHHS-1 和 SHHS-2 上,在六种跨数据集迁移设置下进行了实验。结果表明,所提出的框架平均准确率达到 89.03%,平均宏 F1 分数达到 87.64%,在平衡分类性能方面始终优于现有的 1D 基线方法,且在五次独立运行中方差显著降低,表明了其稳定性和可重复性的提升。总体而言,这些发现表明,2D 频谱图表示结合时序建模和对抗性领域自适应,为跨数据集睡眠分期提供了比传统 1D EEG 输入更稳健且具有竞争力的替代方案。

关键词——睡眠分期,EEG 频谱图,无监督领域自适应,跨数据集泛化,对抗学习,双向 LSTM,卷积神经网络。

## I 引言

准确的睡眠分期是睡眠障碍临床诊断、监测和管理的基础,对药物评估、心理健康监测以及减少依赖资源密集型手动多导睡眠图(PSG)评分的自动化工具的开发具有广泛的影响\[27 (https://arxiv.org/html/2605.06736#bib.bib37),34 (https://arxiv.org/html/2605.06736#bib.bib3)\]。尽管深度学习在自动化分期系统方面取得了显著进展,但在临床环境中获取用于模型训练的大规模标注数据集仍然困难\[12 (https://arxiv.org/html/2605.06736#bib.bib2)\];这一挑战在跨数据集场景中尤为关键,因为受试者、传感器和采集协议的差异会导致领域偏移和源域-目标域不匹配\[11 (https://arxiv.org/html/2605.06736#bib.bib7)\]。虽然多导睡眠图(PSG)仍然是睡眠监测的金标准,但其多传感器设置使得数据采集资源消耗巨大\[27 (https://arxiv.org/html/2605.06736#bib.bib37)\],这促使人们对更实用的替代方案产生兴趣;因此,脑电图(EEG)已成为广泛用于睡眠分期的模态。它使用较少的记录通道捕获与睡眠相关的大脑活动\[34 (https://arxiv.org/html/2605.06736#bib.bib3)\],特别是单通道 EEG 在有效特征提取和可靠自动化分类方面仍面临持续的挑战\[37 (https://arxiv.org/html/2605.06736#bib.bib4)\]。二维时频表示(如频谱图)已被证明可以提供与睡眠分期相关的互补时序和频谱信息\[31 (https://arxiv.org/html/2605.06736#bib.bib5)\),本文将其作为特征建模的基础。然而,现有深度学习方法的主要局限性在于其在跨数据集设置下的性能下降,因为数据集间的分布差异导致领域偏移\[11 (https://arxiv.org/html/2605.06736#bib.bib7)\]。尽管领域自适应和迁移学习已成为提高模型泛化能力的有效策略\[5 (https://arxiv.org/html/2605.06736#bib.bib22),13 (https://arxiv.org/html/2605.06736#bib.bib13)\],但针对基于二维频谱图的跨数据集睡眠分期的领域自适应关注较少\[18 (https://arxiv.org/html/2605.06736#bib.bib6)\]。

针对这一空白,本文提出了 STDA-Net(基于频谱图的时序领域自适应网络),这是一个利用 2D EEG 频谱图进行睡眠分期无监督领域自适应的框架。所提出的框架集成了基于 CNN 的特征提取器、用于领域不变特征学习的无监督 DANN 模块\[5 (https://arxiv.org/html/2605.06736#bib.bib22)\]以及用于睡眠动态时序建模的 BiLSTM,旨在提高跨域泛化能力的同时,保留基于单通道 EEG 睡眠分析的实际优势。本工作的主要贡献如下:

1. 我们提出了 STDA-Net,这是一个在 2D EEG 频谱图上运行的跨数据集睡眠分期框架。该架构集成了三个组件:一个从频谱图中提取每周期(epoch)特征的 CNN 编码器,一个捕获连续周期间时序依赖关系的 BiLSTM,以及一个无需目标标签即可对齐源域和目标域特征分布的对抗性领域自适应(DANN)模块。
2. 我们进行了系统的消融实验,以量化所提框架中时序建模、辅助监督和对抗性自适应各自的贡献。
3. 在三个数据集上进行的实验证明了所提出框架在跨数据集设置下的鲁棒性。

本文其余部分组织如下:第二部分(Section II)回顾了睡眠分析中领域自适应的相关工作。第三部分(Section III)介绍了所提出的方法论。第四部分(Section IV)详细说明了实验设置,包括数据集描述和评估协议。第五部分(Section V)展示了结果并讨论了我们发现,包括消融实验结果和基线对比。最后,第六部分(Section VI)总结了本研究。

## II 相关工作

深度学习已成为自动睡眠分期分类的主导方法,CNN、Transformer 和混合架构在基于 EEG 的睡眠分析中表现出强大的性能\[19 (https://arxiv.org/html/2605.06736#bib.bib9)\]。在现有方法中,单通道 EEG 因其有助于区分睡眠阶段的频率特异性模式而受到广泛关注;例如,\[37 (https://arxiv.org/html/2605.06736#bib.bib4)\]提出了 SingleChannelNet,这是一种端到端的睡眠分期分类模型,使用原始单通道 EEG 且无需手工特征。现有模型大致可分为直接在原始波形上训练的 1D 方法\[30 (https://arxiv.org/html/2605.06736#bib.bib11)\]和将 EEG 转换为频谱图等时频表示的 2D 方法\[18 (https://arxiv.org/html/2605.06736#bib.bib6)\];比较研究表明,2D 表示在某些情况下可以优于 1D 方法,尽管其有效性取决于数据集、信号表示和模型架构\[18 (https://arxiv.org/html/2605.06736#bib.bib6),10 (https://arxiv.org/html/2605.06736#bib.bib12),17 (https://arxiv.org/html/2605.06736#bib.bib31),1 (https://arxiv.org/html/2605.06736#bib.bib30)\]。除了标签稀缺外,跨数据集的模型泛化已成为一个关键问题,因为跨数据集性能下降源于受试者人群、传感器变异性和通道配置差异导致的领域偏移\[16 (https://arxiv.org/html/2605.06736#bib.bib32),23 (https://arxiv.org/html/2605.06736#bib.bib33),15 (https://arxiv.org/html/2605.06736#bib.bib35)\]。为了解决这个问题,\[11 (https://arxiv.org/html/2605.06736#bib.bib7)\]探索了单通道 EEG 的跨场景迁移学习,并报告了改进的跨域性能,而\[33 (https://arxiv.org/html/2605.06736#bib.bib14)\]提出了 SleepDG,一个在五个数据集上验证的多级领域对齐框架。为了减少领域差异,先前的研究主要依赖于 1D 信号表示;\[13 (https://arxiv.org/html/2605.06736#bib.bib13),22 (https://arxiv.org/html/2605.06736#bib.bib34)\]表明对抗性领域自适应有效减少了可穿戴睡眠数据及其他领域中的源域-目标域差距,\[3 (https://arxiv.org/html/2605.06736#bib.bib10)\]提出了 ADAST,将未共享的注意力机制与双分类器和迭代自训练相结合以提高伪标签质量,而\[21 (https://arxiv.org/html/2605.06736#bib.bib15)\]引入了 DDAST,结合自适应批归一化和基于伪标签的自训练进行受试者间对齐。最近,基于 EEG 的领域自适应研究通过对抗性联合对齐、基于熵的学习和最少 EEG 通道的主动学习提高了跨数据集睡眠分期性能\[7 (https://arxiv.org/html/2605.06736#bib.bib16),6 (https://arxiv.org/html/2605.06736#bib.bib18)\]。尽管如此,在睡眠分期的无监督领域自适应中使用 2D 频谱图表示仍然 largely unexplored( largely 未探索),这激发了所提出的 STDA-Net 框架的研究动机。

## III 所提出的方法论

所提出的 STDA-Net 框架如图 1 所示 (https://arxiv.org/html/2605.06736#S3.F1)。如图所示,该框架由四个相互连接的组件组成:预处理和频谱图生成模块、共享 CNN 周期编码器、BiLSTM 时序序列模块,以及使用无监督领域自适应设置的领域对抗判别器,在训练中使用标记的源域数据和未标记的目标域数据。本节其余部分将详细描述每个组件。

> **图 1:** 所提框架的端到端流水线。实线箭头表示数据流。虚线箭头表示训练期间的梯度流。

### III-A EEG 预处理与频谱图生成

来自源域和目标域的原始单通道 EEG 信号被独立处理以生成标准化的 2D 频谱图。SHHS-1 和 SHHS-2 中 C4-A1 通道的信号被下采样至 100 Hz,以匹配 Sleep-EDF 中 Fpz-Cz 通道的采样率,所有信号均使用 4 阶巴特沃斯滤波器在 0.5 至 30 Hz 之间进行带通滤波,以保留与睡眠相关的频率信息。遵循 AASM 标准,记录被分割为非重叠的 30 秒周期,深度睡眠阶段 S3 和 S4 合并为单一的 N3 类,排除未知周期,并去除睡眠前后 30 分钟以上发生的清醒片段。随后应用 Z-score 归一化以减轻振幅差异。

每个 30 秒周期使用汉明窗和 50% 重叠的短时傅里叶变换(STFT)转换为 2D 时频表示\[35 (https://arxiv.org/html/2605.06736#bib.bib17)\],得到大小为 $76 \times 60$ 的归一化单通道频谱图 $x_i \in \mathbb{R}^{1 \times F \times T}$。为了对连续周期间的时序依赖建模,应用步长为 $S=5$ 个周期的滑动窗口 $L=10$(对应 5 分钟的连续睡眠);序列严格在单个记录边界内构建,以避免时序泄露。

### III-B CNN 周期编码器

输入序列中的每个频谱图通过共享的 CNN 主干独立处理,以提取具有判别性的周期级特征表示。编码器由四个卷积块组成,每个块包含一个 $3 \times 3$ 卷积、批归一化和 GELU 激活函数,在第二和第三块中应用步长为 2 的下采样,并在每个块后跟随残差单元以稳定训练。全局平均池化和带有 dropout($p=0.3$)的全连接层随后将特征投影为 128 维向量:

$$z_i = E_{\theta}(x_i) \in \mathbb{R}^{128} \quad (1)$$

由两个带有 GELU 激活和 dropout 的全连接层组成的辅助分类头应用于这些周期级特征,以提供直接的每周期监督,并在联合优化期间促进稳定的特征学习\[18 (https://arxiv.org/html/2605.06736#bib.bib6)\]:

$$\hat{y}^{\text{aux}} = \text{softmax}(W_2 \cdot \text{GELU}(W_1 \cdot z_i + b_1) + b_2) \quad (2)$$

编码器总共包含约 160 万个参数。

### III-C BiLSTM 时序模块

周期级特征序列 $Z = \{z_1, ..., z_L\}$ 输入到一个双层双向 LSTM 中,每个方向的隐藏层大小为 128,产生上下文感知表示:

$$H = \text{BiLSTM}(Z) \in \mathbb{R}^{L \times 256} \quad (3)$$

其中 $h_t \in \mathbb{R}^{256}$ 表示时间点 $t$ 处前向和后向隐藏状态的拼接。线性变换后跟随 softmax 生成最终的睡眠阶段预测\[9 (https://arxiv.org/html/2605.06736#bib.bib39)\]:

$$\hat{y}_t^{\text{main}} = \text{softmax}(W_c h_t + b_c) \quad (4)$$

时序建模在跨数据集设置中特别有益,因为睡眠阶段转换模式(例如,N1 很少出现在 N3 和 REM 之间,从 Wake 到 REM 的直接转换不常见)受生物约束且在跨域中相对一致,从而自然补充了对抗性对齐目标。

### III-D 领域对抗训练

为了减少源域和目标域 CNN 特征之间的领域差距,在周期特征级别应用基于 DANN 的对抗训练\[5 (https://arxiv.org/html/2605.06736#bib.bib22)\]。领域判别器 $D_{\psi}$ 实现为具有 128 和 64 个单元的两个隐藏层、ReLU 激活、dropout 和单个 sigmoid 输出的 MLP 判别器,并训练以区分源域和目标域特征,而 CNN 编码器 $E_{\theta}$ 通过梯度反转层(GRL)\[4 (https://arxiv.org/html/2605.06736#bib.bib8)\]训练以迷惑判别器:

$$d_i = D_{\psi}(\text{GRL}_{\lambda}(z_i)) \quad (5)$$

领域自适应应用于每周期 CNN 特征级别,而不是 BiLSTM 输出级别,因为领域差异主要源于频谱特征表示,而时序转换模式倾向于在跨域中相对一致。适应权重 $\lambda$ 遵循渐进式调度:

$$\lambda = \frac{2}{1 + \exp(-10p)} - 1$$

相似文章

按部就班:使用评分规则的自动睡眠分期分类

arXiv cs.AI

本文提出了一种确定性的、基于规则的睡眠分期方法,该方法明确实现了美国睡眠医学学会(AASM)的评分规则,并提供了逐时段的自然语言解释。在50份多导睡眠图记录中,该方法与多数投票共识达到了60.5%的逐时段一致性,为不透明的深度学习模型提供了透明性的补充。