基于多导睡眠图脑电图信号的睡眠呼吸暂停分类深度学习方法
摘要
本文对多种深度学习架构进行了全面比较,包括视觉Transformer和图注意力网络,用于从多通道脑电图信号中自动检测睡眠呼吸暂停,使用在拓扑数据分析特征上训练的视觉Transformer获得了0.750的最佳测试AUC。
arXiv:2607.15477v1 公告类型:新
摘要:通过多导睡眠图诊断睡眠呼吸暂停仍然资源密集且依赖于耗时的手动数据分析和评分。最近的研究表明,睡眠呼吸暂停事件对中枢神经系统的影响可以通过脑电图(EEG)信号检测到。然而,大多数研究在不同数据集上使用单一特征类型并结合不同的分类算法。在本工作中,我们在一个儿科受试者数据集上,对用于从多通道脑电图自动检测睡眠呼吸暂停的深度学习架构和特征表示进行了全面比较。我们评估了视觉Transformer和图注意力网络在多种信号表示上的表现:原始时间信号、短时傅里叶变换频谱图、基于相干性的图以及两个拓扑数据分析(TDA)衍生特征。通过训练集和测试集的年龄和性别匹配,我们在2410名儿科受试者上训练,并在575名儿科受试者上测试。我们使用基于TDA特征训练的视觉Transformer模型获得了0.750的最佳测试AUC。跨患者人口统计学(年龄、性别、AHI严重程度)和睡眠阶段(N1、N2、N3、REM)的分层分析揭示了显著的性能差异。我们的结果证明了基于脑电图的自动OSA筛查的可行性,同时强调了临床部署中的关键挑战。
查看缓存全文
缓存时间: 2026/07/20 09:28
# 基于多导睡眠脑电图信号的睡眠呼吸暂停分类深度学习方法
来源:https://arxiv.org/html/2607.15477
###### 摘要
通过多导睡眠图诊断睡眠呼吸暂停仍然资源密集,且依赖耗时的手动数据分析和评分。近期研究表明,睡眠呼吸暂停事件对中枢神经系统的影响可通过脑电图信号检测。然而,现有研究大多在不同数据集上使用单一特征类型,并结合不同的分类算法。在本工作中,我们基于单一儿科受试者数据集,对多通道脑电图自动睡眠呼吸暂停检测的深度学习架构和特征表示进行了全面比较。我们评估了视觉变换器和图注意力网络在不同信号表示上的表现:原始时间序列信号、短时傅里叶变换频谱图、基于相干性的图,以及两种拓扑数据分析衍生特征。通过对训练集和测试集进行年龄和性别匹配,我们在 2410 名儿科受试者上训练,并在 575 名儿科受试者上测试。我们使用基于拓扑数据分析特征训练的视觉变换器模型取得了最佳测试 AUC 0.750。按患者人口统计学(年龄、性别、AHI 严重程度)和睡眠阶段(N1、N2、N3、REM)进行分层分析揭示了显著的性能差异。我们的结果证明了基于脑电图的自动 OSA 筛查的可行性,同时突出显示了临床部署所需面临的关键挑战。
## 一、引言
阻塞性睡眠呼吸暂停是一种高度流行的睡眠障碍,全球估计影响 9.36 亿成人和高达 6.4% 的儿童[2,20]。睡眠呼吸暂停的特征是睡眠期间上气道完全或部分反复阻塞。OSA 会导致间歇性低氧、睡眠碎片化和白天过度嗜睡。若不治疗,OSA 会显著增加心血管疾病和全因死亡率的风险[18]。
尽管具有临床意义,OSA 仍被低估诊断[12]。目前诊断依赖于整夜多导睡眠监测,该监测监测多种生理信号,包括脑电图、心电图、呼吸努力和血氧饱和度。虽然多导睡眠监测研究是 OSA 分类的金标准,但这些研究需要昂贵的设备、专门的睡眠实验室以及训练有素的技术人员手动对睡眠阶段和呼吸事件进行评分[26]。此过程耗时、劳动密集,且受评分者间差异影响[17]。这些限制在诊断流程中造成了显著瓶颈,并限制了及时 OSA 诊断的可及性,尤其是在资源有限的环境中。
虽然 OSA 本质上是一种呼吸系统疾病,但睡眠呼吸暂停的症状和影响通过中枢神经系统功能障碍表现出来。反复的呼吸暂停事件会引发短暂的觉醒,破坏睡眠结构,阻止恢复性深睡眠和 REM 睡眠。这些反复的觉醒,加上间歇性低氧,导致慢性睡眠紊乱,表现为白天过度嗜睡、认知功能受损、情绪障碍和生活质量下降[32]。此外,新出现的证据表明,慢性 OSA 引起的低氧可能导致长期神经损伤,包括记忆和执行功能关键区域的灰质减少[19]。
脑电图通过大脑的电活动直接测量这些中枢神经系统效应,为呼吸暂停事件对大脑的影响提供了独特的见解。与检测呼吸阻塞(鼻气流、胸腹运动)或其直接生理后果(血氧饱和度下降)的外周传感器不同,脑电图捕捉了睡眠紊乱的特征,如觉醒模式、频带改变和睡眠阶段碎片化。
机器学习和深度学习的最新进展已显示出从生理信号自动检测睡眠障碍的前景[31]。脑电图信号对于 OSA 检测尤其具有信息量,因为呼吸暂停事件会引发脑电图信号模式的变化[1,22]。然而,基于脑电图信号的自动 OSA 分类面临技术挑战。多通道记录的脑电图信号呈现高维、复杂的时空模式,需要复杂的特征提取。此外,模型性能必须在不同人口统计学、合并症和 OSA 严重程度的异质患者群体中泛化,才能实现临床实用性。
虽然有数项研究使用单通道心电图和其他生理信号将深度学习应用于 OSA 检测,但较少有研究在不同特征表示上全面评估多通道脑电图方法[28]。近期工作探索了用于单通道脑电图的卷积神经网络[1]、用于脑电图频谱图的 YOLO 架构[29],以及使用手工特征的传统机器学习[33]。然而,这些研究通常关注单一特征类型或架构,限制了理解哪种信号表示最能捕捉脑电图信号中的呼吸暂停特征。此外,大多数先前工作仅报告汇总性能指标,而未按患者人口统计学或睡眠阶段对结果进行分层,考虑到 OSA 表现在年龄、性别和疾病严重程度方面的已知差异,这对于临床部署是必不可少的考虑因素。
本研究通过全面评估用于多通道脑电图 OSA 检测的深度学习架构和特征表示来解决这些空白。我们研究了四种不同的信号表示:(1) 原始时间序列信号,(2) 捕捉时频动态的短时傅里叶变换频谱图,(3) 编码通道间功能连接性的基于相干性的图表示,以及 (4) 源自持续同调的拓扑数据分析特征。拓扑数据分析在表征睡眠相关脑电图模式方面显示出潜力[24]。
我们使用两种深度学习架构评估特征表示:适用于生理信号的视觉变换器,以及用于基于连接性表示的图注意力网络[7]。为确保临床相关性,我们进行了严格的分层分析,涵盖患者人口统计学(年龄组、性别、AHI 严重程度)和睡眠阶段(N1、N2、N3、REM),识别出影响真实场景中检测性能的关键因素。
我们的主要贡献有三方面。首先,我们首次对用于多通道脑电图 OSA 检测的多种深度学习架构和特征表示进行了全面比较。其次,我们将基于拓扑数据分析的特征(HEPC 和 AP FAPC)引入 OSA 检测,并证明其与传统表示相比在捕捉呼吸暂停特征方面的有效性。第三,我们进行了广泛的人口统计学和睡眠阶段分层分析,揭示了不同亚群体之间的性能差异,这对公平且稳健的临床部署具有关键意义。
## 二、相关工作
近期有大量关于从脑电图信号检测睡眠呼吸暂停的研究。Mahmud 等人 (2021) 的先前工作发现,变分模态分解可以成功分解脑电图信号,从而仅从脑电图信号进行睡眠呼吸暂停分类[21]。结合 CNN-BiLSTM 深度学习模型,作者使用受试者独立评估方法,在三个成人受试者数据集上获得了平均 F1 分数超过 0.90。虽然这项工作获得了高 F1 分数,但所用数据集规模较小,最大的数据集包含 25 名主要为男性的受试者。Barnes 等人 (2022) 的其他工作开发了一个用于单通道睡眠呼吸暂停检测的卷积神经网络[1]。该模型在三个成人受试者数据集上达到了 69.9% 的准确率和 10 折平均 AUC 0.804。Zhao 等人 (2021) 的进一步工作使用传统深度学习模型,在两个脑电图通道上结合手动特征提取,涉及 30 名受试者[33]。虽然这项研究达到了 88.99% 的良好准确率,但关于训练集和测试集人口统计学的信息报告很少。Tanci 等人 (2025) 的工作尝试使用目标检测网络 YOLOv8 对短时傅里叶变换脑电图特征进行睡眠呼吸暂停事件检测,总体准确率达到 93.7%[29]。未报告受试者人口统计学,但作者根据睡眠呼吸暂停严重程度对模型结果进行了分层,显示各严重程度间 F1 分数一致。Irurueta 等人 (2025) 的近期工作使用卷积神经网络对脑电图信号进行仅脑电图睡眠呼吸暂停事件检测,达到了最佳 AUC 0.689[13]。Manjunath 等人 (2024) 的其他工作使用短时傅里叶变换和卷积神经网络,从儿科患者的 30 秒脑电图信号预测血氧饱和度下降,达到了最佳平衡准确率 66.8%[22]。关键是,这项研究是针对儿科患者而非成人进行的,并在训练和测试分割中考虑了年龄和性别。
## 三、方法
### III-A 数据集
本研究使用美国全国儿童医院睡眠数据库数据集,包含来自 3673 名儿科患者的 3984 次多导睡眠监测研究[15,16,11]。该数据集包含完整的多导睡眠监测研究,包括脑电图、脉搏血氧仪、鼻部和口腔传感器等。此外,数据集还包含技术人员对睡眠阶段和睡眠呼吸事件(包括血氧饱和度下降、中枢性、混合性和阻塞性呼吸暂停事件)的标注。我们使用从受试者收集的脑电图采样率为 256 Hz 且为 7 通道脑电图的研究。在本工作中,我们使用以 256 Hz 采样的 30 秒 7 通道脑电图信号组。在将数据集过滤为具有适当 7 个脑电图通道和 256 Hz 采样率的受试者后,我们剩下 2985 名受试者。如果呼吸暂停、低通气、血氧饱和度下降标签(阳性情况)或正常呼吸标签(阴性情况)覆盖窗口的 75%,我们将特定 30 秒窗口标记为“呼吸紊乱”(阳性)或“正常呼吸”(阴性)。数据按受试者分割,即一个受试者的数据不会同时出现在训练集和验证集中。此外,我们进行了按年龄和性别分层的训练/验证分割,意味着训练集和验证集具有相同的各年龄和性别组比例。基于此标记策略,我们的训练集包含 71,547 个阳性标签和 2,130,666 个总标签(阳性率 3.36%),而测试集包含 17,066 个阳性标签和 505,817 个总标签(阳性率 3.37%)。
呼吸暂停-低通气指数是用于分类睡眠呼吸暂停严重程度的常见指标。其计算方法是对一夜睡眠中的呼吸暂停和低通气事件总数进行计数,然后除以总睡眠时间。在儿科受试者中,AHI < 1 视为健康,1 ≤ AHI < 5 视为轻度睡眠呼吸暂停,5 ≤ AHI < 10 视为中度睡眠呼吸暂停,AHI ≥ 10 视为重度睡眠呼吸暂停[25]。我们在第 IV-C 节中使用这些标准按睡眠呼吸暂停严重程度对受试者进行分层。
### III-B 特征提取方法
#### III-B1 原始脑电图信号
我们的第一个特征表示是原始脑电图信号。我们使用 60 Hz 和 120 Hz 三阶巴特沃斯带阻滤波器过滤电力线噪声。由于我们关注的是以 256 Hz 采集的 30 秒 7 通道脑电图数据组,此特征产生一个特征数组 F ∈ ℝ^{7 × 7681}。我们对原始信号不进行进一步滤波,也不处理基线漂移或应用任何数据删除或插值过程。
#### III-B2 短时傅里叶变换
我们测试的第二种特征化技术是短时傅里叶变换。我们对原始脑电图信号进行电力线噪声滤波,然后使用汉宁窗函数计算具有 129 个频率仓(0.5 - 128 Hz)的短时傅里叶变换。具体来说,我们为每个通道 m 计算以下离散短时傅里叶变换:
S_m[q,p] = Σ_{k=0}^{N-1} X_m[k] \overline{w[k-ph]} e^{-i 2π q k/N} (1)
其中 q, p ∈ Z 分别表示时间和频率索引,\overline{w} 是汉宁窗函数的复共轭,X_m 是信号第 m 个通道的离散采样值。此过程产生 S ∈ ℂ^{129 × 62},一个具有 129 个频率仓和 61 个时间仓的复数值数组。短时傅里叶变换数组的幅度经过对数变换和 Z 归一化,得到对应 7 个通道的数组 F ∈ ℝ^{7 × 129 × 62}。
#### III-B3 基于相干性的图构建
为了测试整合功能连接性度量的特征,我们基于多通道脑电图信号构建了一个图表示。该图包含 7 个节点,每个节点对应 7 个电极之一。任意两个通道之间的信号相干性表示对应两个节点之间边的权重,而按第 III-B2 小节方法计算的该通道的短时傅里叶变换则是节点特征。为了计算相干性,我们取一组时间序列信号 X_i(t),其中 i ∈ V = {1, ..., 7} 表示通道,t ∈ {1, ..., T} 是信号的时间样本。我们首先计算通道 m 和 n 之间的平滑周期图 \hat{f}_{m,n}。然后,我们计算所有通道 m, n 之间的幅度平方信号相干性如下:
C(X_m, X_n, ω_k) = |\hat{f}_{m,n}(ω_k)|^2 / ( \hat{f}_{m,m}(ω_k) \hat{f}_{n,n}(ω_k) ) (2)
这产生一个特征矩阵 C ∈ ℝ^{7 × 7 × 129},表示每个频率仓处脑电图通道的功能连接性。我们使用向量 C_{m,n} 来表示由 C 表示的 7×7 全连接图中任意两个通道之间的边权重,并使用短时傅里叶变换值 F_m ∈ ℝ^{129 × 62}相似文章
Omni-Sleep:基于中枢-自主神经系统动态分层对比学习的睡眠基础模型
Omni-Sleep 是一种睡眠基础模型,它利用分层对比学习从多模态多导睡眠图中捕捉中枢神经系统-自主神经系统动态,在睡眠分期和多疾病分类上优于强基线模型。
STDA-Net:基于频谱图的跨数据集睡眠分期领域适应
本文介绍了STDA-Net,一种利用2D频谱图和对抗学习进行跨数据集睡眠分期的领域适应框架。在公共数据集上,与现有的1D EEG基线方法相比,该方法显示出更高的准确性和稳定性。
揭示多模态儿科睡眠嵌入中的轨迹和拓扑特征
本文研究了用于儿科睡眠分析的掩码自编码器多模态嵌入的潜在结构。结果表明,通过几何、拓扑和临床特征增强嵌入,可以改善睡眠相关事件的预测和校准。
稀缺神经数据的尺度感知注意力:基于Sleep-EDF EEG的RG-Flow Transformer
本文介绍了RG-Flow Transformer,这是一种具有重正化群归纳偏置的模型,用于分析稀缺的脑电图数据。它在Sleep-EDF数据集上的睡眠分期任务中与普通Transformer进行对比,发现没有准确率优势,但通过恢复谱指数展示了更好的可解释性。
按部就班:使用评分规则的自动睡眠分期分类
本文提出了一种确定性的、基于规则的睡眠分期方法,该方法明确实现了美国睡眠医学学会(AASM)的评分规则,并提供了逐时段的自然语言解释。在50份多导睡眠图记录中,该方法与多数投票共识达到了60.5%的逐时段一致性,为不透明的深度学习模型提供了透明性的补充。