I\textsuperscript{2}RiMA:基于EEG信号的精神压力检测的谱黎曼表示与时序注意力

arXiv cs.LG 论文

摘要

I²RiMA是一种新颖的帧间-帧内黎曼流形注意力网络,用于基于EEG的精神压力检测。它构建频率特定的空间协方差,并使用时序注意力来改进跨被试的压力分类,实现了高达82.78%的平衡准确率。

arXiv:2607.01279v1 公告类型:新 摘要:跨被试EEG压力检测仍然具有挑战性,因为具有判别性的压力相关模式既依赖于被试个体,又依赖于具体频率。传统的黎曼方法主要在时域中建模空间协方差,忽略了对于高级认知状态解码至关重要的神经振荡,而标准的时序分词化常常破坏跨片段的时间连贯性。为解决这些局限性,我们提出了\method{},一种用于基于EEG的压力检测的帧间-帧内黎曼流形注意力网络。\method{}在每个频率点上独立构建空间协方差矩阵,并将其映射到SPD切空间,保留了通道间几何结构与频率特定的判别线索。它进一步引入频率聚类聚合,以选择信息丰富的频谱分量,并通过形成紧凑的、数据驱动的、与EEG节律对齐的频率聚类来减少冗余。最后,一个帧间-帧内切片注意力模块跨EEG序列自适应地整合局部切片级别的频谱动态和全局时序上下文。在三个数据集上的实验表明,\method{} consistently 优于五个最先进的基线方法,实现了高达82.78%的平衡准确率,同时保持高效,仅需1.60M参数和31.95M FLOPs。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:39

# I2RiMA:基于频谱黎曼表示与时序注意力的脑电信号心理压力检测

来源:https://arxiv.org/html/2607.01279
何成∗¹ & 彭崑宇∗² & 韩尚跟∗¹ & 马金铭¹ & 丁金宏³ & 夏立坤¹†
¹首都师范大学信息工程学院神经计算与智能感知实验室,中国北京
²卡尔斯鲁厄理工学院,德国
³首都师范大学心理学院,中国北京

###### 摘要

跨被试脑电压力检测仍然具有挑战性,因为与压力相关的判别性模式既依赖于被试个体,又具有频率特异性。传统的黎曼方法主要在时域中建模空间协方差,忽略了对于高级认知状态解码至关重要的神经振荡,而标准的时序令牌化往往破坏了切片间的时序连贯性。为了解决这些局限,我们提出了 I2RiMA——一种用于基于脑电的压力检测的帧内-帧间黎曼流形注意力网络。I2RiMA 在每个频率点独立构建空间协方差矩阵,并将其映射到 SPD 切空间,从而保留了通道间的几何结构以及频率特异性的判别性线索。它还引入了频率聚类聚合,以选择信息丰富的频谱分量,并通过形成与 EEG 节律对齐的紧凑、数据驱动的频率聚类来降低冗余。最后,一个帧内-帧间切片注意力模块自适应地整合了局部切片级的频谱动态和跨 EEG 序列的全局时序上下文。在三个数据集上的实验表明,I2RiMA 一致优于五种最先进的基线方法,在 MIST Control、MIST Stress 和 SEED 上分别达到了高达 82.78% 的平衡准确率,同时仅使用 1.60M 参数和 31.95M FLOPs,保持了高效性。

## 1 引言

心理压力是一个普遍存在的公共卫生问题,尤其是在年轻人中,超过 60% 的人报告有持续的中度至高度压力 [Fu et al. (2023)](https://arxiv.org/html/2607.01279#bib.bib1); [Steele et al. (2014)](https://arxiv.org/html/2607.01279#bib.bib2)。由于长期压力会增加患抑郁症、焦虑症和心血管疾病的风险 [Meier et al. (2015)](https://arxiv.org/html/2607.01279#bib.bib3),因此迫切需要客观且可扩展的压力检测方法。EEG 因其毫秒级的时间分辨率、无创便携的特性以及对心理状态的敏感性,提供了一种有前景的解决方案 [da Silva (2013)](https://arxiv.org/html/2607.01279#bib.bib4)。最新的无线干电极系统进一步支持在临床环境之外的日常 EEG 压力监测 [Arpaia et al. (2020)](https://arxiv.org/html/2607.01279#bib.bib5)。

大量工作探索了基于 EEG 的压力检测,采用了传统机器学习、深度学习和黎曼几何等方法。然而,现有方法面临两个关键局限。首先,传统的黎曼方法通常从时域 EEG 信号构建协方差矩阵 [Mognon et al. (2011)](https://arxiv.org/html/2607.01279#bib.bib47),这适用于具有时间局部化响应的低级任务,例如视觉诱发电位解码 [Wang et al. (2024)](https://arxiv.org/html/2607.01279#bib.bib19)。相比之下,像压力和情绪这样的高级状态涉及分布式的、频谱结构化的神经动力学,使得时域通道协方差变得不足。尽管频域协方差是一种自然的替代方案,但简单地构建可能会混淆频率信息,并掩盖具有生理意义的特定频带模式。此外,EEG 协方差矩阵位于 SPD 流形上 [Barachant et al. (2010)](https://arxiv.org/html/2607.01279#bib.bib8);直接进行欧几里得向量化忽略了这种几何结构并导致信息损失,特别是在跨被试分布偏移的情况下 [Yger et al. (2016)](https://arxiv.org/html/2607.01279#bib.bib9)。

其次,大多数现有的 EEG 令牌化流程将连续信号分割成固定长度的窗口,并独立处理每个窗口。这种设计丢弃了相邻切片之间的时间连贯性,尽管已有研究表明这种上下文对于心理状态分类具有判别性信息 [Grissmann et al. (2017)](https://arxiv.org/html/2607.01279#bib.bib10)。最近的基于 Transformer 的 EEG 模型 [Yang et al. (2023)](https://arxiv.org/html/2607.01279#bib.bib6); [Jiang et al. (2024)](https://arxiv.org/html/2607.01279#bib.bib7); [Li et al. (2024)](https://arxiv.org/html/2607.01279#bib.bib11) 改进了序列建模,但它们仍然常常将每个 EEG 切片视为独立的令牌。因此,它们难以同时捕捉切片内的局部频谱结构和切片间的全局时间依赖关系,而这两者对于稳健的高级认知状态识别都是必不可少的。

受这些观察的启发,我们提出了 I2RiMA——一种用于基于 EEG 的压力检测的帧内-帧间黎曼流形注意力网络。I2RiMA 建立在两个关键见解之上。首先,与压力和情绪相关的 EEG 信号表现出依赖于状态的、频率特异性的空间模式。由于不同的 EEG 频带反映了不同的神经动力学 [Buzsáki et al. (2012)](https://arxiv.org/html/2607.01279#bib.bib12),I2RiMA 在每个频率点独立构建协方差矩阵,并将其映射到 SPD 切空间,从而在不过早混合频谱信息的情况下保留了通道间的黎曼几何结构。一个频率聚类聚合模块进一步选择信息丰富的频率特异性黎曼特征并减少冗余,从而产生紧凑且可解释的表示。其次,较长的时间窗口提高了切片内的可分性,同时减少了切片间的变异性,这表明了互补的局部和全局时间线索。为了捕捉这种结构,I2RiMA 引入了一个帧内-帧间切片注意力融合模块,通过线性编码、注意力加权和加权融合来自适应地聚合 EEG 切片,在保留局部判别模式的同时对序列级时间上下文进行建模。总之,频率感知的黎曼表示和帧内-帧间切片注意力融合使得能够获得几何保持、生理基础扎实且时间上下文化强的 EEG 表示,从而实现稳健的跨被试压力检测。

我们的主要贡献总结如下:

1.  我们提出了 I2RiMA,一种用于跨被试 EEG 压力检测的频率感知黎曼网络。它在每个频率点构建协方差矩阵,并将其映射到 SPD 切空间,从而保留了通道间几何结构和频率特异性的判别模式。
2.  我们引入了频率聚类聚合以进行数据驱动的特征选择和冗余减少,同时结合帧内-帧间切片注意力融合,以捕捉连续 EEG 中的局部切片级模式和全局时间依赖关系。
3.  实验表明,I2RiMA 在 MIST Control、MIST Stress 和 SEED 上分别达到了最先进的 77.59%、75.88% 和 82.78% 的平衡准确率,同时仅使用 1.60M 参数和 31.95M FLOPs。

## 2 相关工作

基于 EEG 的压力检测 基于 EEG 的压力检测方法通常遵循两种范式:传统机器学习和深度学习。传统方法依赖手工设计的时域、频域或非线性特征,并结合 SVM 和 KNN 等分类器。代表性研究包括:用于工作负荷识别的特征融合 [Pei et al. (2020)](https://arxiv.org/html/2607.01279#bib.bib13)、用于实时压力评估的额叶 alpha 不对称性 [Arpaia et al. (2020)](https://arxiv.org/html/2607.01279#bib.bib5)、结合 EEG 和 ECG 特征的多级压力分类 [Xia et al. (2018)](https://arxiv.org/html/2607.01279#bib.bib29),以及用于抑郁症检测的线性/非线性 EEG 特征 [Cai et al. (2018)](https://arxiv.org/html/2607.01279#bib.bib14)。深度学习方法通过捕捉 EEG 的空间、频谱和时间模式实现端到端的表示学习,包括:用于跨被试运动想象解码的时空建模 [Lv et al. (2025)](https://arxiv.org/html/2607.01279#bib.bib15)、用于工作负荷评估的 R3DCNN [Zhang et al. (2018)](https://arxiv.org/html/2607.01279#bib.bib16)、具有多分支 LSTM 和层级注意力的 MuLHiTA [Xia et al. (2022)](https://arxiv.org/html/2607.01279#bib.bib17),以及用于抑郁症检测的相空间重构与几何特征 [Akbari et al. (2021)](https://arxiv.org/html/2607.01279#bib.bib18)。尽管取得了进展,许多方法仍然局限于单被试或小规模评估,并且由于被试间差异,在跨被试设置中常常出现显著的性能下降 [Giannakakis et al. (2019)](https://arxiv.org/html/2607.01279#bib.bib20)。

跨被试 EEG 学习。跨被试泛化是 EEG 解码的核心挑战。BIOT [Yang et al. (2023)](https://arxiv.org/html/2607.01279#bib.bib6) 采用通道嵌入对齐来减轻个体差异,LaBraM [Jiang et al. (2024)](https://arxiv.org/html/2607.01279#bib.bib7) 利用大规模预训练来增强泛化能力,NeuroBOLT [Li et al. (2024)](https://arxiv.org/html/2607.01279#bib.bib11) 通过多维度表示学习从原始 EEG 合成 fMRI 信号。领域适应和迁移学习是主要策略 [Lotte et al. (2018)](https://arxiv.org/html/2607.01279#bib.bib45),然而它们主要解决跨被试分布偏移,而忽略了被试内时间领域漂移 (ISTDS) [Jayaram et al. (2016)](https://arxiv.org/html/2607.01279#bib.bib21)——即单个被试的 EEG 分布在实验会话间因疲劳、电极阻抗变化和生理波动而发生变化的现象 [Zanetti et al. (2021)](https://arxiv.org/html/2607.01279#bib.bib22)。

EEG 的黎曼学习。多通道 EEG 信号的协方差矩阵位于 SPD 流形 \mathcal{S}_{++}^C 上,该流形具有非欧几里得几何结构。在欧几里得空间中进行传统向量化会破坏这种结构,导致信息损失 [Barachant et al. (2010)](https://arxiv.org/html/2607.01279#bib.bib8)。仿射不变黎曼度量 (AIRM) 提供了对个体差异的鲁棒性 [Barachant et al. (2011)](https://arxiv.org/html/2607.01279#bib.bib32),而 Log-Euclidean 度量则提供了具有几何一致性的计算效率 [Congedo et al. (2017)](https://arxiv.org/html/2607.01279#bib.bib23)。黎曼方法在 BCI 和 EEG 分类中表现出显著的性能提升,特别是在跨被试场景中 [Yger et al. (2016)](https://arxiv.org/html/2607.01279#bib.bib9)。然而,现有的黎曼方法通常从时域信号构建单个协方差矩阵,混合了频率信息并掩盖了频率特异性的空间模式 [Congedo et al. (2017)](https://arxiv.org/html/2607.01279#bib.bib23)。

时间聚合与注意力建模。基于 Transformer 的方法 [Yang et al. (2023)](https://arxiv.org/html/2607.01279#bib.bib6); [Jiang et al. (2024)](https://arxiv.org/html/2607.01279#bib.bib7); [Li et al. (2024)](https://arxiv.org/html/2607.01279#bib.bib11) 在令牌级别对 EEG 序列进行建模,但通常独立处理每个切片,既忽略了切片内的频谱动态,也忽略了切片间的时间连贯性。尽管已经探索了层级和流形注意力机制 [Xia et al. (2022)](https://arxiv.org/html/2607.01279#bib.bib17); [Pan et al. (2022)](https://arxiv.org/html/2607.01279#bib.bib26) 用于时间聚合,但这些方法通常假设跨被试和会话的特征分布是稳定的。相比之下,I2RiMA 将频率感知的黎曼流形学习与帧内-帧间切片注意力融合相结合,用于跨被试 EEG 压力检测,从而弥补了这一差距 [Giannakakis et al. (2019)](https://arxiv.org/html/2607.01279#bib.bib20)。

## 3 问题形式化

#### 输入定义

令 \mathcal{D} = \{ (\mathbf{X}_u, y_u) \}_{u=1}^U 表示一个 EEG 数据集,其中 \mathbf{X}_u \in \mathbb{R}^{C \times L} 是第 u 次试验,具有 C 个通道和 L 个样本,y_u \in \{1, \ldots, G\} 是类别标签。每次试验被分割成 m 个不重叠的切片 \mathcal{S} = \{s_1, \ldots, s_m\},其中 s_i \in \mathbb{R}^{C \times T}。FFT 将每个切片变换到频域:\mathbf{X}_{\text{freq}} \in \mathbb{R}^{B \times m \times C \times F},其中 B 是批量大小,F 是频率点数。

#### 任务定义

我们将跨被试压力检测任务定义为学习一个分类器 f_\theta,该分类器能泛化到未见过的被试上。形式化地,给定训练被试 \mathcal{P}_{\text{train}} 和测试被试 \mathcal{P}_{\text{test}},且 \mathcal{P}_{\text{train}} \cap \mathcal{P}_{\text{test}} = \emptyset,目标是使测试分布上的期望交叉熵损失 \ell 最小化,如公式 1 所定义:

\theta^* = \arg\min_{\theta} \;\mathbb{E}_{(\mathbf{X}, y) \sim \mathcal{D}_{\text{test}}} \left[ \ell \left( f_\theta(\mathbf{X}), y \right) \right] \tag{1}

#### 学习目标

我们寻求一个表示映射 \phi: \mathbb{R}^{C \times L} \to \mathbb{R}^d,该映射满足三个性质:(1) **几何保持**——\phi 通过黎曼流形建模保留 EEG 信号的空间结构;(2) **时间连贯性**——\phi 通过注意力融合同时编码切片内的局部频谱模式和切片间的全局依赖关系;(3) **跨被试鲁棒性**——\phi 对被试间的分布偏移具有不变性。

## 4 方法

### 4.1 I2RiMA 概述

I2RiMA 通过图 1 所示的双模块架构来解决跨被试 EEG 压力检测问题。给定维度为 \mathbb{R}^{C \times L}(C=64 通道)的原始多通道 EEG 信号,每次试验首先被分割成 m 个不重叠的切片,并通过 FFT 变换到频域,得到 \mathbf{X}_{\text{freq}} \in \mathbb{R}^{m \times C \times F},其中 F 是频率箱的数量。在分割之前,应用标准的预处理步骤,包括重采样、ICA 伪迹去除、带通滤波 (0.5–50 Hz) 和 z-score 归一化。

黎曼流形特征提取 (RMFE) 模块在每个频率点 f 独立构建协方差矩阵 \mathbf{R}_f \in \mathcal{S}_{++}^C,从而保留了对于压力区分至关重要的频率特异性空间相关性。然后,每个 SPD 矩阵通过 Log-Euclidean 算子映射到切空间,并向量化为 \mathbf{h}_f \in \mathbb{R}^{D_0},得到频谱-空间特征 \mathbf{H}_{\text{freq}} \in \mathbb{R}^{m \times F \times D_0},其中 D_0 = C(C+1)/2。

无监督切片注意力聚合 (USAA) 模块随后分两个阶段处理这些特征。首先,K-Means 聚类将相关频率分组为 K 个聚类,对应于典型的 EEG 波段;聚类内的加权聚合后接跨聚类拼接,产生紧凑的切片特征 \mathbf{H} \in \mathbb{R}^{m \times D},其中 D = K \times D_0。第

相似文章