堆叠LoRA:面向运动想象解码中的被试自适应EEG基础模型

arXiv cs.LG 论文

摘要

提出了堆叠LoRA,一种将被试不变知识与被试特定知识解耦的框架,用于使EEG基础模型适应运动想象解码,在多个基准上提升了准确率。

arXiv:2607.03094v1 公告类型: 新 摘要:脑电图(EEG)解码在脑机接口(BCI)中面临重大挑战:显著的个体间差异限制了有效的跨被试泛化。因此,实际系统仍然主要依赖于从零训练并需要单独重新校准的被试特定模型。EEG基础模型最近成为一种有前景的替代方案;然而,即使是大型预训练模型也不能简单地用作固定特征提取器,在可靠地应用于下游任务之前仍需要额外的适应。在这项工作中,我们通过有针对性的适应策略来应对这一挑战。基于最近的EEG基础模型(如REVE、LaBraM和LUNA),我们研究了不同低秩适应策略对运动想象分类的影响。我们提出了一种框架,从结构上将主题不变知识与主题特定神经特征解耦:每个适应层中的低秩更新被拆分为一个全局适配器(在所有被试上联合训练)和被试特定适配器(每个吸收个体差异)。为了评估每条路径的贡献,我们比较了三种适应策略:(i)被试特定LoRA (ii)全局LoRA 和(iii)堆叠LoRA,结合了全局和被试特定适配器。在BCI Competition IV-2a、PhysioNet运动想象和临床Zuo2025基准上的实验表明,堆叠LoRA有效减轻了被试间差异,在大多数骨干网络和数据集组合中达到了最佳准确率。我们的进一步分析表明,全局路径和被试特定路径之间的最佳平衡取决于目标群体:对于大型、多样化的队列,共享适配器就足够了,而在临床记录的高会话间变异性下,被试特定适应则具有决定性作用。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:40

# Stacked LoRA 用于运动想象解码中的受试者自适应脑电图基础模型
来源:https://arxiv.org/html/2607.03094

11institutetext:IMT Atlantique, Lab-STICC, Brest, France

###### 摘要

脑电图(EEG)解码在脑机接口(BCIs)中面临一个主要挑战:显著的个体间差异限制了有效的跨受试者泛化。因此,实际系统仍然主要依赖于从头训练并需要个体重校准的特定受试者模型。脑电图基础模型最近作为一种有前景的替代方案出现;然而,即使是大型预训练模型也不能简单地用作固定特征提取器,在可靠地应用于下游任务之前,仍需进行额外的适应。在本工作中,我们通过有针对性的适应策略来解决这一挑战。基于近期脑电图基础模型如REVE、LaBraM和LUNA,我们研究了不同低秩适应策略对运动想象分类的影响。我们提出一个框架,从结构上将受试者不变知识与受试者特定神经特征解耦:每个适应层的低秩更新被拆分为一个在所有受试者上联合训练的*全局*适配器,以及每个吸收个体变异性的*受试者特定*适配器。为评估每条路径的贡献,我们比较了三种适应策略:(i) 受试者特定LoRA、(ii) 全局LoRA,以及(iii) 结合了全局和受试者特定适配器的堆叠LoRA。在BCI Competition IV-2a、PhysioNet运动想象以及临床Zuo2025基准上的实验表明,Stacked LoRA有效缓解了个体间差异,在绝大多数骨干网络与数据集组合中取得了最佳准确率。我们的分析进一步揭示,全局路径与受试者特定路径之间的最优平衡取决于目标群体:对于大规模、多样化的群体,共享适配器就足够;而在临床记录的高会话间变异下,受试者特定适应则具有决定性作用。

## 1 引言

脑电图(EEG)可实现非侵入式大脑监测,支持从癫痫诊断到脑机接口(BCIs)[1(https://arxiv.org/html/2607.03094#bib.bib1),2(https://arxiv.org/html/2607.03094#bib.bib2)]等广泛的临床与研究应用。在BCI范式中,运动想象(MI)解码因其在恢复严重神经功能障碍患者沟通与运动控制方面的潜力而备受关注[3(https://arxiv.org/html/2607.03094#bib.bib3),4(https://arxiv.org/html/2607.03094#bib.bib4)]。然而,将MI解码转化为稳健的现实世界系统仍然是一个开放性挑战,主要原因在于脑电图信号表现出显著的个体间变异性:由于解剖结构、电极放置和认知策略的差异,特定心理状态相关的神经模式在不同个体间差异很大。这种变异性限制了基于一个群体训练的模型对新受试者的泛化能力,且大多数实际BCI流程仍然依赖于成本高昂的逐受试者重校准环节[5(https://arxiv.org/html/2607.03094#bib.bib5)]。

基础模型最近作为一种有前景的范式出现,以解决这一局限性。这些模型在汇集了多个受试者、设置和任务的大型语料库上训练,学习到丰富的潜在表征,能够以最少的额外监督转移到下游应用[6(https://arxiv.org/html/2607.03094#bib.bib6)]。在脑电图领域,REVE[8(https://arxiv.org/html/2607.03094#bib.bib8)]是当前最先进的基础模型之一,通过掩码自编码[7(https://arxiv.org/html/2607.03094#bib.bib7)]在超过60,000小时的脑电图记录(来自25,000名受试者)上预训练,在近期一项涵盖36项脑电图任务的大型基准测试[9(https://arxiv.org/html/2607.03094#bib.bib9)]中(平均)排名第一。得益于其4D傅里叶位置编码,REVE能够原生处理任意电极布局和记录长度,使其可直接应用于在不同实验协议下收集的异构数据集。然而,即使是大型基础模型也不能简单地作为冻结特征提取器部署:通用预训练分布与特定下游任务或受试者群体之间的差异需要有针对性的微调。近期工作已从不同角度处理这一问题。Klein等人[11(https://arxiv.org/html/2607.03094#bib.bib11)]提出了受试者条件层(Subject-Conditioned Layer),将每个适应权重分解为一个共享组件和一个低秩的受试者特定校正,在单一MI数据集(BCI Competition IV [15(https://arxiv.org/html/2607.03094#bib.bib15)])上使用CNN和类似ViT的架构均显示出改进。

参数高效微调(PEFT)技术,特别是低秩适应(LoRA)[10(https://arxiv.org/html/2607.03094#bib.bib10)],已成为以适度计算成本适应大型基础模型的首选方法。通过向冻结骨干网络注入小型可训练秩分解矩阵,LoRA将更新参数数量从数百万减少到数千,同时性能可与全参数微调相媲美。然而,在多受试者数据集上简单地应用单一共享LoRA可能会混淆两种不同来源的变异:真正在受试者间共享的类别判别模式,以及每个个体特有的受试者特定神经特征。未能分离这些组件意味着适配器必须同时学习可泛化表征以适应下游任务,并考虑个体噪声,这本质上是相互冲突的目标。近期研究越来越关注管理PEFT中竞争目标之间的干扰。MTLoRA[12(https://arxiv.org/html/2607.03094#bib.bib12)]将低秩适应扩展到多任务设置,通过将参数更新显式分解为任务共享和任务特定组件,在保留共同骨干网络的同时减少了跨任务干扰。Jiang等人[13(https://arxiv.org/html/2607.03094#bib.bib13)]处理了一个互补的挑战,提出一种微调策略,保护预留的大多数参数免受梯度更新,从而在适应过程中使稳定的预训练表征免受噪声或冲突任务信号的影响。基于这些见解,DELoREAN[14(https://arxiv.org/html/2607.03094#bib.bib14)]提出了一种双路径适配器架构,该架构训练一个共享适配器以及用于自然语言处理的可丢弃任务特定专家适配器;专家适配器在训练期间吸收领域特定噪声,并在推理时丢弃,从而仅使稳健的共享表征泛化到未见数据。在五种语言和多个视觉-语言数据集的分布外基准上,DELoREAN显示出相对于标准LoRA的一致改进,并提供了理论和实证证据表明两条适配器路径学习的是正交子空间。

在本文中,我们将这些工作路线结合起来,并将其应用于使用基础模型进行受试者自适应脑电图解码的问题。基于近期的脑电图基础模型,我们提出了**Stacked LoRA**,一种在同一个前向传播中明确解耦任务级知识与受试者特定神经特征的适应框架。权重更新被分解为:(i) 在所有受试者上联合训练、捕获共享任务表征的*全局适配器*,以及 (ii) 每个受试者一个、吸收个体变异性而不影响共享路径的*受试者特定适配器*。我们将此框架的三种实例化(全局LoRA、受试者特定LoRA和堆叠LoRA)与线性探测基线进行比较,将其作为即插即用的适应机制应用于三个近期脑电图基础模型——REVE[8(https://arxiv.org/html/2607.03094#bib.bib8)]、LaBraM[24(https://arxiv.org/html/2607.03094#bib.bib24)]和LUNA[24(https://arxiv.org/html/2607.03094#bib.bib24)],在三个公开可用的MI数据集上:BCI Competition IV-2a[15(https://arxiv.org/html/2607.03094#bib.bib15)]、PhysioNet运动想象[22(https://arxiv.org/html/2607.03094#bib.bib22)]以及临床基准Zuo2025[23(https://arxiv.org/html/2607.03094#bib.bib23)]。我们的实验揭示了每种策略的互补优势,并提供了关于何时受试者特定专业化最有益的实践指导。

我们的主要贡献是:(i) 提出了Stacked LoRA,一种双适应架构,将每个低秩更新分解为一个跨受试者共享的全局适配器和每个受试者的受试者特定适配器;(ii) 我们将其作为即插即用机制实例化到三个脑电图基础模型(REVE、LaBraM和LUNA)上,在冻结骨干网络之上使用单一微调阶段;(iii) 我们在三个规模、通道数和临床相关性各异的MI数据集上进行了系统评估,表明全局适应与受试者级适应之间的最优平衡取决于目标群体的结构。

## 2 方法

### 2.1 问题形式化

我们考虑多受试者脑电图分类问题。令 Y={1,…,C}\\mathcal{Y} = \{1,\ldots,C\} 表示 CCC 个类别(例如,左手、右手、脚、舌头用于MI)的集合。数据从 NNN 个受试者收集;受试者 jjj 的记录定义了一个域 Sj\\mathcal{S}_j,由标记的EEG试验 (x,y)(x,y) 组成,其中 x∈RE×Tx \in \mathbb{R}^{E \times T}(EEE 个电极,TTT 个时间样本),y∈Yy \in \mathcal{Y}。由于电极放置、阻抗条件和个体神经生理学在不同参与者之间存在差异,因此 NNN 个受试者 {Sj}j=1N\{\mathcal{S}_j\}_{j=1}^N 的分布在各个域之间差异很大,即使对于相同的类别标签也是如此。

我们的目标是针对每个受试者 jjj 学习一个分类器 fj:RE×T→Yf_j: \mathbb{R}^{E \times T} \to \mathcal{Y},该分类器最小化在 Sj\mathcal{S}_j 上的期望交叉熵损失,同时利用所有域中存在的共享结构。我们通过在大型预训练脑电图基础模型之上构建 fjf_j,并使用PEFT以少量额外参数进行适应来解决这一问题。

### 2.2 低秩适应(LoRA)

给定一个预训练权重矩阵 W∈Rdout×dinW \in \mathbb{R}^{d_{out} \times d_{in}},LoRA[10(https://arxiv.org/html/2607.03094#bib.bib10)]在不修改 WWW 本身的情况下适应相应层。更新被参数化为一个秩为 rrr 的分解式 BABA,其中 B∈Rdout×rB \in \mathbb{R}^{d_{out} \times r},A∈Rr×dinA \in \mathbb{R}^{r \times d_{in}},且 r≪min⁡(din,dout)r \ll \min(d_{in}, d_{out});只有 AAA 和 BBB 接收梯度。前向传播如下所示:

h=Wx+αrBAx,h = Wx + \frac{\alpha}{r} BAx,  (1)

其中 α\alpha 是一个固定的缩放系数。这将每层的可训练参数量从 doutdind_{out} d_{in} 减少到 r(dout+din)r (d_{out} + d_{in}) 个参数,同时保持原始骨干网络不变。

### 2.3 Stacked LoRA

我们的适应策略扩展了[14(https://arxiv.org/html/2607.03094#bib.bib14)]中的DELoREAN框架,该框架将LoRA更新拆分为一个在所有训练域之间共享的组件和每个域一个的组件。DELoREAN最初用于解决语言和视觉中的任务级变异性。在这里,我们将相同的双组件结构重新用于一个变异性源于受试者的情境。我们提出的变体,**Stacked LoRA**,将低秩更新的一个分支专用于群体级解码规律,而并行的分支(每个受试者一个)则专用于个体相对于该共同行为的偏差。

在每一个配备了适配器的层上,低秩更新被写为一个*全局*项(始终激活)和一个*受试者特定*项(仅在匹配受试者的试验上激活)之和。对于从受试者 j∈{1,…,N}j \in \{1,\dots,N\} 抽取的输入 xxx,层输出为:

h=(W+αgrgBgAg+αsrs∑k=1N1{x∈Sk}BkAk)x,h = \left( W + \frac{\alpha_g}{r_g} B_g A_g + \frac{\alpha_s}{r_s} \sum_{k=1}^N \mathbf{1}\{x \in \mathcal{S}_k\} B_k A_k \right) x,  (2)

其中 (Ag,Bg)(A_g, B_g) 为秩 rg 和尺度 αg 的全局适配器,而 {(Ak,Bk)}k=1N\{(A_k, B_k)\}_{k=1}^N 为 N 个受试者特定适配器,每个秩为 rs 且尺度为 αs。指示函数 1{x∈Sk}\mathbf{1}\{x \in \mathcal{S}_k\} 实现了一种严格的、基于受试者身份的路由:对于任何给定的试验,恰好选择一个受试者特定适配器,即索引与试验来源匹配的那个。骨干网络 W 在整个过程中保持冻结。

#### 全局适配器。

由于 (Ag,Bg)(A_g, B_g) 接收批次中每一个试验的梯度,其最优值取决于所有受试者分布的混合,而不是任何一个单独的受试者分布 Sj。因此,它收敛于冻结骨干网络尚未提供且在整个训练集上一致的输入-输出映射部分,即在消除受试者特定噪声后的EEG信号的类别判别成分。在这个意义上,(Ag,Bg) 充当了下游任务的任务级先验。

#### 受试者特定适配器。

每个 (Aj,Bj) 仅在受试者 j 的试验上训练,因此不同的受试者分支从批次的互不相交的切片接收更新。由于骨干网络和全局适配器已经建模了群体间的共享模式,每个受试者分支不需要重复建模,而是负责建模单个参与者特有的残差。

### 2.4 适应策略

请参考图标题图1:Stacked LoRA框架:冻结的骨干网络(预训练的EEG基础模型)增加了共享的全局适配器 (Ag,Bg)(A_g, B_g) 和 N 个受试者特定适配器 (Ak,Bk)(A_k, B_k)。为了隔离每条路径的贡献,并确定受试者自适应增益的实际来源,我们在三种互补策略下实例化了该框架:

- •**全局LoRA**。仅保留全局适配器,产生一个在所有受试者上联合训练的单一共享低秩更新。此策略作为一个群体级基线,在微调时忽略受试者身份。
- •**受试者特定LoRA**。仅保留受试者特定适配器,每个受试者拥有一个独立的低秩适配器,且无共享组件。此策略探究在未强制跨受试者共享时,受试者级专业化的作用。
- •**Stacked LoRA**。两条路径同时激活,在同一前向传播中结合全局适配器和受试者特定适配器,这是完整的框架。

### 2.5 训练细节

所有策略共享在冻结骨干网络之上的单一微调阶段。在冻结骨干网络的顶部附加一个分类头:输出标记首先被展平,使用RMSNorm[17(https://arxiv.org/html/2607.03094#bib.bib17)]进行归一化,通过一个丢弃层(p=0.1),然后由一个线性层投影到目标类别的数量。训练使用AdamW[26(https://arxiv.org/html/2607.03094#bib.bib26)],学习率为 10^{-4},采用余弦退火调度并包含10%的线性预热,最多训练25个epoch,早停策略。

相似文章

Video2LoRA: 视觉-语言模型的参数化视频内化

Hugging Face Daily Papers

本文介绍Video2LoRA,一种直接从视频表示预测低秩适配(LoRA)权重的方法,能够在冻结的视觉-语言模型中实现高效的视频处理。它将视觉令牌负载降低最多1500倍,查询TTFT降低6-80倍,同时在视频摘要和字幕生成基准上保持性能。

Hybrid-LoRA:桥接全微调与低秩适应的后训练方法

arXiv cs.LG

Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。

元学习上下文学习实现无需训练的跨被试脑解码

Hugging Face Daily Papers

# 论文页面 - 元学习上下文学习实现无需训练的跨被试脑解码 来源:[https://huggingface.co/papers/2604.08537](https://huggingface.co/papers/2604.08537) 作者:,,,,,,,,,,,,, ## 摘要 一种元优化方法通过少量图像-脑示例快速推断个体独特神经编码模式,无需跨被试及扫描仪微调,即可实现可泛化的语义视觉解码。[视觉解码](https://huggingface.co/papers?q

MoE$^2$-LoRA:当MoE模型遇上MoE风格的低秩适配

arXiv cs.CL

MoE2-LoRA 引入了一种双通道路由条件投影(Routing-Conditioned Projection)和一个全局 LoRA 专家池,以实现用于微调 MoE 模型的 MoE 风格低秩适配,在保留通用能力的同时取得了最先进的准确率。