EEG-VID:面向EEG解码和辅助目标选择的任务引导潜在预测预训练

arXiv cs.LG 论文

摘要

EEG-VID引入了任务引导的潜在预测预训练,以改善在会话和受试者偏移下的EEG解码,在辅助机器人场景中实现了超过随机水平的目标选择。

arXiv:2609.00566v1 公告类型:新 摘要:我们提出EEG-VID,一个任务引导的潜在预测预训练框架,用于在会话和受试者偏移下进行EEG解码。EEG-VID使用指数移动平均目标编码器和弱任务引导,从近期历史预测未来的潜在EEG状态,然后进行监督微调。在VIG-48和BCI Competition IV-2a/IV-2b上,第一阶段在42个匹配的骨干-数据集-协议比较中有41个提高了平均准确率,包括所有12个留一受试者设置,最大增益为16.22个百分点。在48区域跨天VIG-48任务中,EEG-VID实现了6.52%的Top-1和30.50%的Top-5准确率。在一项单独的六名参与者离线机器人场景研究中,候选约束目标选择在受试者特定校准后达到了40.24%,而随机水平为25%。这些结果支持任务引导的潜在预测作为EEG解码和场景约束辅助目标选择的可迁移预训练策略。
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:17

# EEG-VID:面向EEG解码与辅助目标选择的任务导向潜在预测预训练
来源:https://arxiv.org/html/2609.00566
Junyi MaYuxuan WuYanzi Miao††thanks:关志忠和苗燕子来自中国矿业大学信息与控制工程学院,中国徐州(邮箱:[email protected][email protected])。††thanks:Junyi Ma来自上海交通大学自动化与智能传感学院,中国上海(邮箱:[email protected])。††thanks:Yuxuan Wu来自上海交通大学自动化与智能传感学院,中国上海,同时隶属于上海创新研究院,中国上海(邮箱:[email protected])。

###### 摘要

**目标:** 我们探究任务导向的潜在预测预训练能否在会话和受试者偏移下改进EEG解码,以及四个电极的空间后验是否能支持辅助目标选择。
**方法:** EEG-VID利用指数移动平均(EMA)目标编码器和弱任务引导,从近期历史中预测未来潜在EEG状态,然后微调预训练模型以进行监督解码。我们将相同的阶段1目标应用于五种EEG骨干网络,并用循环神经网络和Transformer替代方案替换所提出的预测器,以测试可迁移性和对预测器的依赖性。
**结果:** 在48区域跨天VIG-48任务中,EEG-VID达到6.52% Top-1和30.50% Top-5准确率。在VIG-48和BCI竞赛IV-2a/IV-2b中,阶段1在42组匹配的骨干网络-数据集-协议比较中有41组提高了平均准确率,包括所有12种留一受试者外(LOSO)设置,最大增益达16.22个百分点。弱任务引导在所有18组合并模型-数据集比较中均优于仅潜在预训练。替代预测器在54组比较中有48组优于直接监督,而所提预测器在54组匹配比较中有45组表现最佳。在一项单独的六名参与者离线机器人场景研究中,经过受试者特定校准后,候选约束目标选择达到40.24%,而机会水平为25%。由于VIG-48中视线不受约束,其空间结果在可穿戴设备层面进行解释,而非作为特定来源的皮质解码。
**结论:** 弱任务引导提高了潜在预测预训练在不同EEG解码器和分布偏移下的一致性,而由此产生的空间后验支持超越机会水平的场景约束目标选择。
**意义:** 任务导向的潜在预测为在会话和受试者偏移下的EEG解码提供了一种可迁移的预训练策略,并将低通道EEG空间后验与场景约束相结合,用于辅助目标选择。

###### 索引术语:

辅助机器人、脑机接口、EEG解码、表示学习。

## I 引言

可靠的目标选择是辅助操作的基本要求。在机器人能够到达或抓取物体之前,它必须推断出用户意图选择哪个目标。EEG为语言或手动输入受限的用户提供了非侵入性控制信号,但由于信号存在噪声且在不同会话和用户间存在差异,实际的解码仍然困难。已建立的卷积和基于Transformer的EEG解码器可以学习有效的判别特征\[1 (https://arxiv.org/html/2609.00566#bib.bib4),2 (https://arxiv.org/html/2609.00566#bib.bib5),3 (https://arxiv.org/html/2609.00566#bib.bib6),4 (https://arxiv.org/html/2609.00566#bib.bib7)\],然而这些特征可能会随着电极放置、接触阻抗、疲劳和其他非平稳因素而发生偏移。

监督式EEG解码器优化任务判别性,但并未明确建模跨窗口预测结构。潜在预测可以捕捉时间动态,但它也可能保留可预测的与任务无关的组成部分,如缓慢漂移、眼部活动或视觉诱发电位。因此,EEG-VID在未来的潜在状态预测中添加了弱任务引导,使预训练强调与解码相关的可预测组成部分(图1 (https://arxiv.org/html/2609.00566#S1.F1))。

参见图注 图 1:EEG-VID的动机与范式比较。EEG-VID结合了时间预测一致性和弱任务引导,并将解码的网格区域后验限制在由场景导出的候选目标中,用于辅助目标选择。基于此观察,我们开发了EEG-VID,采用任务导向的潜在预测预训练(阶段1)和监督式EEG解码(阶段2)。我们重点关注这种预训练目标是否能在不同EEG解码器之间,在会话和受试者偏移下迁移,而非它是否仅对EEG-VID有益。

我们在内部的VIG-48跨天数据集和BCI竞赛IV-2a/IV-2b\[5 (https://arxiv.org/html/2609.00566#bib.bib22),6 (https://arxiv.org/html/2609.00566#bib.bib23),7 (https://arxiv.org/html/2609.00566#bib.bib21)\]上评估此问题,使用合并的跨会话、受试者内和留一受试者外协议。阶段1应用于五种现有EEG骨干网络\[1 (https://arxiv.org/html/2609.00566#bib.bib4),2 (https://arxiv.org/html/2609.00566#bib.bib5),3 (https://arxiv.org/html/2609.00566#bib.bib6),8 (https://arxiv.org/html/2609.00566#bib.bib10),9 (https://arxiv.org/html/2609.00566#bib.bib11)\],并用循环和Transformer替代方案替换所提出的预测器,以进一步测试观察到的益处是否依赖于特定的预测器架构。

一项单独的六名参与者离线机器人场景研究考察了在场景约束目标选择下所学空间后验的辅助相关性。在所有评估中,阶段1在42组匹配的骨干网络-数据集-协议比较中有41组提高了平均准确率,包括所有12种LOSO设置。替代预测器在54组比较中有48组优于直接监督。经过受试者特定校准后,机器人场景选择达到40.24%,而机会水平为25%。由于VIG-48中视线不受约束,我们在可穿戴设备层面而非特定来源皮质解码层面解释其空间解码结果。

主要贡献如下:

- •我们提出了一种任务导向的潜在预测预训练目标,结合未来状态预测和弱任务监督,以学习可预测的EEG表示,这些表示对下游解码仍然有用。
- •我们将阶段1制定为一种骨干网络无关的预训练目标,并通过不同EEG解码器、预测器架构以及会话和受试者偏移协议下的匹配比较来评估其迁移性。
- •我们评估了所提策略在低通道跨天视觉解码设置中的效果,并在一项六名参与者离线机器人场景研究中进一步测试了其在场景约束目标选择中的应用。

## II 相关工作

### II-A 基于EEG的意图解码

EEG长期以来用于在脑机接口和康复系统中解码用户意图和认知状态。经典范式包括运动想象\[2 (https://arxiv.org/html/2609.00566#bib.bib5),1 (https://arxiv.org/html/2609.00566#bib.bib4)\]、稳态视觉诱发电位\[10 (https://arxiv.org/html/2609.00566#bib.bib8)\]、P300事件相关电位\[11 (https://arxiv.org/html/2609.00566#bib.bib9)\]和视觉刺激分类\[8 (https://arxiv.org/html/2609.00566#bib.bib10),9 (https://arxiv.org/html/2609.00566#bib.bib11),12 (https://arxiv.org/html/2609.00566#bib.bib55)\]。近期研究将基于EEG的视觉接口扩展到大规模自然图像和物体解码\[13 (https://arxiv.org/html/2609.00566#bib.bib40),8 (https://arxiv.org/html/2609.00566#bib.bib10),14 (https://arxiv.org/html/2609.00566#bib.bib3)\]、脑监督图像编辑\[15 (https://arxiv.org/html/2609.00566#bib.bib12)\]和3D视觉感知\[9 (https://arxiv.org/html/2609.00566#bib.bib11)\]。除了单纯的解码,辅助脑机接口系统还将神经意图与自主或共享机器人控制相结合\[16 (https://arxiv.org/html/2609.00566#bib.bib43),17 (https://arxiv.org/html/2609.00566#bib.bib44),18 (https://arxiv.org/html/2609.00566#bib.bib45),19 (https://arxiv.org/html/2609.00566#bib.bib18),20 (https://arxiv.org/html/2609.00566#bib.bib46),21 (https://arxiv.org/html/2609.00566#bib.bib47)\]。这些系统大多基于固定或聚合的观察窗口进行判别性目标训练。而我们的工作则在监督解码之前学习EEG潜在动态中的预测结构。

### II-B EEG表示学习与自适应

EEG表示学习面临低信噪比、非平稳性以及显著的受试者/会话变异性等挑战\[22 (https://arxiv.org/html/2609.00566#bib.bib13)\]。这些分布偏移促使了针对跨会话和跨受试者EEG解码的迁移、对齐和受试者无关学习的发展\[23 (https://arxiv.org/html/2609.00566#bib.bib27),24 (https://arxiv.org/html/2609.00566#bib.bib28),25 (https://arxiv.org/html/2609.00566#bib.bib29),26 (https://arxiv.org/html/2609.00566#bib.bib30),27 (https://arxiv.org/html/2609.00566#bib.bib14),28 (https://arxiv.org/html/2609.00566#bib.bib26),29 (https://arxiv.org/html/2609.00566#bib.bib48),30 (https://arxiv.org/html/2609.00566#bib.bib49),31 (https://arxiv.org/html/2609.00566#bib.bib50),32 (https://arxiv.org/html/2609.00566#bib.bib15),33 (https://arxiv.org/html/2609.00566#bib.bib54)\]。现有方法还包括信号预处理和通道选择\[4 (https://arxiv.org/html/2609.00566#bib.bib7)\]、时空神经网络架构\[1 (https://arxiv.org/html/2609.00566#bib.bib4),2 (https://arxiv.org/html/2609.00566#bib.bib5),3 (https://arxiv.org/html/2609.00566#bib.bib6),34 (https://arxiv.org/html/2609.00566#bib.bib25)\],以及轻量级或受试者特定校准。

自监督和预训练EEG表示学习涵盖了对比、时间上下文和其他前置任务目标\[35 (https://arxiv.org/html/2609.00566#bib.bib31),36 (https://arxiv.org/html/2609.00566#bib.bib32),37 (https://arxiv.org/html/2609.00566#bib.bib20),38 (https://arxiv.org/html/2609.00566#bib.bib51)\]、掩码或预测性表示学习\[39 (https://arxiv.org/html/2609.00566#bib.bib19),40 (https://arxiv.org/html/2609.00566#bib.bib52)\]以及更大的跨数据集预训练模型\[41 (https://arxiv.org/html/2609.00566#bib.bib33),42 (https://arxiv.org/html/2609.00566#bib.bib34),43 (https://arxiv.org/html/2609.00566#bib.bib35),44 (https://arxiv.org/html/2609.00566#bib.bib36)\]。纯粹的自监督预测目标并未明确优先考虑对特定下游任务有信息量的可预测EEG组成部分。

### II-C 潜在预测建模

预测性表示学习在表示空间中建模未来或缺失信息,而非重构原始观测。对比预测编码通过预测未来潜在状态来学习表示\[45 (https://arxiv.org/html/2609.00566#bib.bib37)\],而data2vec则预测上下文化的潜在目标\[46 (https://arxiv.org/html/2609.00566#bib.bib38)\]。目标编码器方法(如BYOL和I-JEPA)进一步证明了直接在表示空间中进行预测性学习的可能性\[47 (https://arxiv.org/html/2609.00566#bib.bib39),48 (https://arxiv.org/html/2609.00566#bib.bib16)\]。对于EEG,潜在预测避免了原始信号重构,后者可能要求模型表示与任务无关的信号变异。关键挑战在于保留对下游任务有信息量的可预测组成部分。我们研究弱任务引导是否能在不同骨干网络和受试者偏移的预测性EEG表示中保留与任务相关的结构。

## III 方法

参见图注

图 2:EEG-VID的整体架构。阶段1通过从历史EEG窗口预测未来EEG表示来学习潜在EEG状态转移动态,该过程由EMA目标编码器监督,并由弱辅助分类项引导。阶段2将学到的动态表示迁移到监督式视觉意图区域解码。本节介绍EEG-VID,一个用于区域级视觉意图解码的两阶段框架(图2 (https://arxiv.org/html/2609.00566#S3.F2))。EEG-VID首先通过潜在预测预训练,从历史EEG窗口学习到未来EEG表示的潜在转移,然后将学到的动态表示迁移到监督式区域解码。关键思想是,未来潜在状态预测提供了时间一致性约束,而弱任务引导则鼓励学到的可预测结构保持与下游解码相关。

### III-A 问题定义

对于每个视觉目标选择试验,用户观察一个被划分为$N \times M$网格的视觉场景,对应$NM$个候选区域。给定一个历史EEG窗口序列
$\mathbf{X}_{t} = \{\mathbf{x}_{t-K+1}, \ldots, \mathbf{x}_{t}\}$,其中$\mathbf{x}_{t} \in \mathbb{R}^{L \times C}$表示第$t$个EEG窗口,$K$, $L$, $C$分别表示历史窗口数、窗口长度和EEG通道数,目标是预测用户意图目标的区域标签$h_{t} \in \{0, \ldots, NM-1\}$。

EEG-VID不是独立解码每个EEG窗口,而是建模历史与未来潜在EEG状态之间的时间转移。在训练期间,模型学习从历史窗口预测未来潜在EEG表示。在推理时,仅需要$\mathbf{X}_{t}$。

### III-B 多尺度时间-统计混合EEG编码器

在线编码器$E_{\theta}$将每个EEG窗口映射到潜在EEG状态表示。为了结合学到的时间模式与稳定的信号描述符,我们使用双分支编码器(图3 (https://arxiv.org/html/2609.00566#S3.F3))。时间分支建模多尺度动态,而统计分支汇总额外的信号统计量。

#### III-B1 时间分支

一个多尺度时间干应用核大小为$\{3, 7, 11, 15\}$的并行一维卷积,
$$
\mathbf{u}^{(k)}_{\tau} = \mathrm{Conv1D}_{k}(\mathbf{x}_{\tau}), \quad k \in \mathcal{K},
$$
其输出沿通道维度拼接、归一化,通过GELU激活,并由一个$1 \times 1$卷积投影到共同的嵌入维度,
$$
\mathbf{U}_{\tau} = \mathrm{FrontProj}\left(\mathrm{Concat}_{k \in \mathcal{K}} \mathbf{u}^{(k)}_{\tau}\right),
$$
之后经过BatchNorm、GELU和一个通道压缩激励模块。两个空洞残差块(扩张率为1和2)扩大感受野,添加可学习的位置嵌入,并由一个Transformer编码器捕获窗口内的长程依赖性,
$$
\mathbf{H}_{\tau} = \mathrm{Transformer}\left(\mathrm{ResBlock}(\mathbf{U}_{\tau}) + \mathbf{P}\right).
$$
然后,LayerNorm和注意力池化得到窗口级时间表示$\mathbf{z}^{\mathrm{temp}}_{\tau} = \mathrm{AttnPool}(\mathrm{LayerNorm}(\mathbf{H}_{\tau}))$。

#### III-B2 统计分支

对于每个窗口,我们计算六个通道级时间描述符——均值、标准差、均方根、绝对均值、一阶差分标准差和线长度——以及成对通道相关性和分箱对数功率谱特征。它们的拼接$r_{\tau} = [r^{\mathrm{time}}_{\tau} \parallel r^{\mathrm{c}}_{\tau} \ldots]$被投影到潜在状态空间。

相似文章