跨深度聚合和软路由专家在EEG基础模型微调中的数据集依赖性效果
摘要
本文研究了跨深度聚合和软路由专家在EEG基础模型微调中对多个数据集的影响,显示出不一致的益处和显著的计算开销。
arXiv:2609.17886v1 Announce Type: new
摘要:EEG解码任务依赖于不同的时间动态和跨通道关系。我们测试通过使用跨深度注意力残差(AttnRes)和两个软路由专家库增强CBraMod,是否能改善完全微调的EEG基础模型。在FACED、ISRUC、SEED-V和PhysioNet-MI上进行匹配的三种子实验后,完整模型相对于完全微调的平均平衡准确度分别变化了-0.12、+1.27、+0.77和-1.27个百分点。单独使用AttnRes在三个数据集上提高了平均平衡准确度,而在AttnRes之上添加专家仅对FACED和SEED-V有帮助。这些收益伴随着显著的开销:AttnRes需要2.11到2.88倍的运行时间和1.78到2.67倍的内存,而完整模型需要2.41到3.04倍的运行时间和1.86到2.85倍的内存。总体而言,添加的模块产生了数据集依赖的、有时相反的效果,而不是相对于完全微调的一致收益。
查看缓存全文
缓存时间: 2026/09/17 08:59
# 跨深度聚合与软路由专家在EEG基础模型微调中的数据集依赖效应
来源:https://arxiv.org/html/2609.17886
###### 摘要
EEG解码任务可能依赖不同的时间动态和跨通道关系。我们测试了专门化模块是否通过增强CBraMod,添加跨深度注意力残差(AttnRes)和两个软路由专家库,来改善完全微调的EEG基础模型。在FACED、ISRUC、SEED-V和PhysioNet-MI上进行的匹配三随机种子实验中,完整模型的平均平衡准确率相对于完全微调分别变化了−0.12、+1.27、+0.77和−1.27个百分点。单独使用AttnRes在三个数据集上提高了平均平衡准确率,而在AttnRes基础上添加专家库仅对FACED和SEED-V有帮助。这些增益伴随着相当大的开销:AttnRes需要2.11–2.88倍的运行时间和1.78–2.67倍的内存,而完整模型需要2.41–3.04倍的运行时间和1.86–2.85倍的内存。总体而言,添加的模块产生了数据集依赖的、有时甚至相反的效果,而不是相对于完全微调带来一致的增益。
###### 关键词:
EEG基础模型,CBraMod,微调,软路由专家容量,EEG适配
††地址:1范德堡大学计算机科学系
2耶鲁大学生物医学信息学与数据科学系††脚注:本文已提交IEEE考虑发表。版权可能在未通知的情况下转移,此后此版本可能不再可访问。
## 1引言
脑电图(EEG)以高时间分辨率记录多通道神经活动,并支持多种解码任务,包括情绪识别、睡眠分期和运动想象。解码这些信号需要对分布在时间和通道上的模式进行建模,但相关的结构可能因任务和数据集而异。因此,传统的EEG模型通常包含显式的时间和空间处理[7 (https://arxiv.org/html/2609.17886#bib.bib6), 12 (https://arxiv.org/html/2609.17886#bib.bib7)]。
近期的EEG基础模型在广泛的EEG语料库上预训练大型编码器,并将它们的表示迁移到下游任务。CBraMod、LaBraM和BrainGPT等模型展示了这种用于可迁移EEG表示学习的范式[13 (https://arxiv.org/html/2609.17886#bib.bib1), 4 (https://arxiv.org/html/2609.17886#bib.bib2), 14 (https://arxiv.org/html/2609.17886#bib.bib3)]。当适配这样的预训练编码器时,完全微调允许所有骨干网络参数发生变化。这就提出了一个实际问题:额外的专门化模块是否仍然有帮助,或者一个完全可训练的骨干网络能否自行学习类似的变换?
我们使用CBraMod并通过两种受EEG解码变异性启发的互补机制来研究这个问题。首先,跨深度注意力残差(AttnRes)结合来自编码器较早层的表示,允许下游处理利用不同深度学习到的特征,而不是仅依赖标准残差路径。当不同的EEG任务依赖于不同的时间或跨通道模式时,这可能是有用的。其次,软路由专家库使用依赖于输入的路由权重来组合多个非线性专家网络,允许模型对不同的EEG输入应用不同的变换。相关的专家路由方法最近已被探索用于EEG表示学习[9 (https://arxiv.org/html/2609.17886#bib.bib4)]。因此,我们比较了完全微调、带有AttnRes的完全微调以及带有AttnRes和专家的完整模型,以测试这些机制是否在完全可训练的骨干网络之外提供了互补的优势。
我们的贡献有三方面。首先,我们测试当预训练的EEG骨干网络已经完全可训练时,这些额外模块是否提供进一步的好处。其次,我们使用跨情绪识别、睡眠分期和运动想象的匹配三随机种子比较,分离跨深度聚合和软路由专家容量的影响。第三,我们表征了数据集依赖的性能变化,以及计算成本和类别及受试者层面的影响。
图1:跨深度专家增强与阶段性比较。跨深度AttnRes在最终表示被两个独立的软路由专家库与共享FFN并行处理之前,结合了CBraMod的早期状态。下图总结了评估的阶段:完全微调(Full FT)、+AttnRes 以及 +AttnRes + 专家。
## 2跨深度与软路由专家容量
我们的基线是对CBraMod进行完全微调。在增强模型中,骨干网络保持可训练,同时我们添加了跨深度注意力残差(AttnRes)和两个独立的专家库。AttnRes学习较早块输出的加权组合,而不是仅使用标准残差路径[6 (https://arxiv.org/html/2609.17886#bib.bib5)]。
### 2.1跨深度聚合
CBraMod通过一堆编码器块处理EEG表示。对于目标块i,令 H_j ∈ ℝ^(B×C×S×D) 表示可用作源的较早表示,并令 S_i 表示可用的源,包括patch嵌入和前面块的输出。我们形成
α_{i,j} = softmax_{j ∈ S_i} (q_i^⊤ RMSNorm_i (H_j)),
H̃_i = ∑_{j ∈ S_i} α_{i,j} H_j,
其中 q_i ∈ ℝ^D 和 RMSNorm_i 是每个目标块学习的(每个块400个参数,12个块共4,800个)。在无门控设置中,H̃_i 在 norm1 和自注意力之前替换常规输入,然后应用其通常的残差更新。softmax权重在每个位置的可用深度状态上计算,并且聚合从编码器块0开始,而不仅仅在最终池化时。
### 2.2软路由专家容量
在顶层(最终)编码器层,令 B 表示基线预FFN表示,A 表示其AttnRes增强的对应物。我们为每个样本形成一个路由特征向量 u = [μ(B); μ(A); μ(A-B)],其中 μ 对通道和patch轴取平均。实现的路由器使用所有三项,包括差值 A-B。令 X 表示提供给专家的层归一化预FFN表示。每个专家是一个使用数据集协议指定dropout率的200–800–200 GELU MLP。对于每个库 b ∈ {A, B},模型计算
p^{(b)} = softmax(r_b(u)/τ),
R_b(X) = ∑_{e=1}^4 p^{(b)}_e E^{(b)}_e(X),
F(X) = F_shared(X) + R_A(X) + R_B(X),
其中 τ=1.5。这里 F_shared 是常规的密集FFN输出。两个库使用独立的路由器和专家参数,但接收相同的归一化token表示。它们是独立的可学习参数库,而不是固定的空间或频谱算子。每个路由向量通过平均通道和patch轴对每个样本计算一次,并在该样本的token中共享。路由器在每个库中形成所有四个专家的加权混合。我们使用密集路由,因此每个专家根据其路由权重对每个样本都有贡献。这避免了稀疏专家调度或负载平衡机制带来的额外影响[11 (https://arxiv.org/html/2609.17886#bib.bib8), 2 (https://arxiv.org/html/2609.17886#bib.bib9)]。
## 3实验方案
我们评估了用于情绪识别的FACED和SEED-V,用于睡眠分期的ISRUC,以及用于运动想象的PhysioNet-MI[1 (https://arxiv.org/html/2609.17886#bib.bib10), 8 (https://arxiv.org/html/2609.17886#bib.bib11), 5 (https://arxiv.org/html/2609.17886#bib.bib12), 10 (https://arxiv.org/html/2609.17886#bib.bib13), 3 (https://arxiv.org/html/2609.17886#bib.bib14)]。表1 (https://arxiv.org/html/2609.17886#S3.T1)总结了固定的数据集划分和训练时间表。在每对比较中,两个条件使用相同的预训练CBraMod检查点、预处理、划分、分类器和检查点选择规则。对于ISRUC,我们使用受试者1–80/81–90/91–100的相同顺序划分,并且在配对条件下保持不变。SEED-V保留了固定的CBraMod LMDB基准协议以保持可比性,并非受试者不相交的。
表1:匹配比较中使用的数据集和训练协议。Ch.,EEG通道数;BS,批大小。*SEED-V使用固定的CBraMod LMDB基准划分,而非受试者不相交的划分。
每个条件使用三个预先指定的随机种子运行:3407、2024和2027。最佳检查点使用验证Cohen's κ选择,然后在留存测试集上评估一次。我们报告平衡准确率(BA)、加权F1(wF1)和Cohen's κ。结果表中的分数乘以100以简洁呈现,所有差值均基于使用相同数据集协议和种子的配对运行计算。因为我们只使用三个预先指定的种子,我们将配对差异视为描述性而非推断性的。
*实现细节。* 我们使用来自第0层的无门控预注意力AttnRes。路由器使用128的隐藏宽度,专家输出权重初始化为零。所有参数遵循表1 (https://arxiv.org/html/2609.17886#S3.T1)中的固定数据集时间表;分类器使用所有patch表示。
端到端训练的墙上时钟时间和分配的峰值CUDA内存在相同的NVIDIA A6000环境中对匹配的运行进行测量。作为诊断,按类别召回率在匹配的种子上取平均。对于PhysioNet-MI,我们还分析了跨17名留存受试者的配对BA变化,并通过自举法估计这些受试者的不确定性。验证轨迹使用检查点选择标准。
## 4结果与讨论
表3 (https://arxiv.org/html/2609.17886#S4.T3)和表3 (https://arxiv.org/html/2609.17886#S4.T3)总结了跨四个数据集的测试性能、配对增强效应和计算开销。
图2:跨三个匹配种子的类别平均召回率变化。第一行显示AttnRes减去Full FT,第二行显示完整模型减去AttnRes;值是描述性的百分点变化,共享的发散色标以零为中心,范围从−12到+12。
表2:匹配的完全微调和跨深度专家增强下的测试性能。每个方法单元格报告BA / wF1 / κ,表示在种子3407、2024和2027上的平均值±样本标准差。所有分数乘以100以简洁呈现;Full FT作为每个数据集的协议内参考。
表3:阶段性组件比较和成本。BA是匹配种子上的平均值±标准差,乘以100。ΔAttnRes 表示 AttnRes − Full FT,ΔExperts|AttnRes 表示完整模型 − AttnRes。时间和内存列(C表示完整模型)是相对于Full FT的比率。
### 4.1异质性能变化
完整模型显示出异质的、数据集依赖的效应。ISRUC显示最大的正向完整模型平均BA差异:所有三个配对种子都支持完整模型,平均BA高出1.27±1.46个百分点;加权F1和κ分别增加1.90±1.66和2.40±1.89个百分点。PhysioNet-MI显示相反的BA变化,−1.27±0.26个百分点,所有种子均为负值。FACED在三个匹配种子中未显示一致优势(−0.12±1.24 BA;一个正向种子),而SEED-V的平均值略高(+0.77±0.74 BA;两个正向种子)。跨所有四个数据集,BA、加权F1和κ显示相同方向的变化。
因此,最佳表现阶段因数据集而异(表3 (https://arxiv.org/html/2609.17886#S4.T3))。
### 4.2分量级增量效应
表3 (https://arxiv.org/html/2609.17886#S4.T3)定义了ΔAttnRes为AttnRes减去Full FT,ΔExperts|AttnRes为完整模型减去AttnRes。AttnRes在ISRUC、SEED-V和PhysioNet-MI上相对于Full FT提高了平均BA,但在FACED上降低了它。在AttnRes基础上添加专家降低了ISRUC和PhysioNet-MI的平均BA,但提高了FACED和SEED-V的BA;加权F1和κ显示相同方向。这些相反的阶段性效应表明,仅比较Full FT与最终模型可能掩盖AttnRes和专家模块如何产生不同贡献。因为添加专家也增加了参数数量,ΔExperts|AttnRes衡量的是完整专家模块的总体增量效应,而非单独隔离路由效应。
在选定的检查点上,基于熵的有效专家数量(总结有多少专家被有意义地使用)在数据集、种子和库之间范围为2.57–4.00,而主导专家最多获得0.91的top-1分配。这些仅用于推理的路由器统计数据未用于模型选择。
### 4.3类别级阶段性效应
为表征哪些类别促成了总体变化,我们重新评估了选定的测试检查点,并计算了匹配条件之间的类别召回率变化。图2 (https://arxiv.org/html/2609.17886#S4.F2)显示了集中的、数据集特定的类别效应。在ISRUC上,AttnRes主要提高了N2的召回率(+11.7个百分点),同时降低了N3(−7.2),而专家阶段部分逆转了这两种变化。在PhysioNet-MI上,专家逆转了AttnRes对类别2的增益,并降低了类别0–1的召回率。这些模式表明,不同类别在不同阶段获得和失去性能,而不是所有类别均匀变化。
在PhysioNet-MI上,专家降低了12/17名留存受试者的BA(中位配对ΔBA=−1.98;受试者自举95% CI [−3.29, −0.16])。在ISRUC上,在所有种子的第19–23个训练周期内,AttnRes在验证κ上保持高于Full FT(+4.1至+5.2平均点),而PhysioNet-MI专家劣势在验证上的表现则不太一致。
### 4.4精度-计算权衡
这些精度变化带来了相当大的计算开销。AttnRes仅增加了4,800个参数,但需要2.11倍–2.88倍的运行时间和1.78倍–2.67倍的内存;完整模型增加了2.73M个参数,需要2.41倍–3.04倍的运行时间和1.86倍–2.85倍的内存。因为AttnRes保留了中间激活,仅凭参数数量无法捕捉其实际计算成本。
## 5局限性与结论
本研究仅限于一个骨干网络、每个数据集一个协议和三个种子;SEED-V不是受试者不相交的,且数据集差异混淆了任务和划分。专家阶段比较缺乏参数匹配的密集控制。此外,无门控AttnRes从微调开始就改变了块输入,且诊断分析是描述性的。
在评估的CBraMod设置中,跨深度聚合和专家容量显示出数据集依赖的、有时甚至相反的效果,而非相对于完全微调的一致优势。相似文章
基于重建的脑电图基础模型中的非周期与低频频谱偏差
本文识别并解释了一种基于重建的脑电图基础模型中的频谱偏差:嵌入表示过度表征非周期和低频成分,而低估振荡成分(尤其在高频段),导致低资源场景下性能不佳。
EEG-AS:通过行为重建实现EEG基础模型的实例级选择
本文提出EEG-AS,一种算法选择框架,通过重建行为实现在多个EEG基础模型之间的实例级选择,从而提高神经解码性能。
EEG基础模型中的身份陷阱:诊断性审计
本文识别并诊断了EEG基础模型中的“身份陷阱”,即高准确率可能源于受试者身份特征而非真实的临床生物标志物。它提出了FMScope,一种冻结表示协议以分离这些信号,并证明了受试者身份混杂在三模型中普遍存在且可通过线性方法移除。
fMRI基础模型的扩展性研究
本文对fMRI基础模型进行了一项扩展性研究,揭示了模型性能取决于预训练数据规模、模型规模和训练时长的组合,而不仅仅是计算资源。
通过稀疏自编码器实现脑电图基础模型的机制可解释性
本文对三个脑电图基础模型(SleepFM、REVE、LaBraM)应用TopK稀疏自编码器,提取可解释的特征字典,并引入了概念引导框架,揭示了表征失败和临床纠缠问题。