跨被试运动想象脑电图分类中的贝叶斯完全池化方法
摘要
本文介绍了一项大规模研究,将贝叶斯完全池化模型与频率学派基线方法在跨被试运动想象脑电图分类中进行比较,发现贝叶斯方法在可靠性上略有提升,但计算成本更高,实际收益有限。
arXiv:2607.22980v1 公告类型:新
摘要:脑机接口(BCI)长久以来一直追求免校准操作,但分类器通常仅通过判别能力进行基准测试,忽视了预测概率是否经过良好校准——考虑到非平稳脑电图(EEG)信号以及分布偏移下过度自信的点估计分类器的风险,这是一个有意义的差距。我们进行了一项大规模研究,将贝叶斯完全池化模型与频率学派基线方法在20个数据集的跨被试左手与右手运动想象脑电图分类中进行对比。六个频率学派流水线各自与一个共享相同特征工程的类似贝叶斯流水线配对,并通过马尔可夫链蒙特卡洛后验采样进行拟合。我们的主要指标是布里尔分数,分解为可靠性和分辨率,同时使用AUROC评估判别能力,使用香农熵评估锐度。每个指标通过随机效应元分析(REML,Knapp-Hartung调整)进行分析,并通过留一法影响分析进行验证。贝叶斯完全池化在可靠性上产生了统计上显著但实际意义不大的改进,并增加了预测不确定性(锐度降低);布里尔分数、分辨率和判别能力没有显著差异。所有指标的跨研究异质性较低,但可靠性结果对留一法剔除敏感。我们还分析了计算成本,发现贝叶斯流水线消耗的能量大约是频率学派对应方法的十三倍,这一成本相对于普通家用电器仍然适中。这些结果表明,仅靠贝叶斯完全池化对跨被试运动想象分类的实际收益有限,而跨被试和跨会话的部分池化是未来工作中更有前景的方向。
查看缓存全文
缓存时间: 2026/07/28 06:23
# 运动想象脑电图跨被试分类中的贝叶斯完全池化方法
来源:https://arxiv.org/html/2607.22980
###### 摘要
脑机接口(BCI)长期以来一直寻求免校准的操作,但分类器的基准测试通常仅依据判别能力,而忽略预测概率是否校准良好——考虑到非平稳脑电图(EEG)信号以及在分布偏移下点估计分类器过度自信的风险,这是一个有意义的差距。我们开展了一项大规模研究,对比了贝叶斯完全池化模型与频率学派基线方法在20个数据集的跨被试左手与右手运动想象EEG分类中的表现。六条频率学派流水线各搭配一条共享相同特征工程的相似贝叶斯流水线,通过马尔可夫链蒙特卡洛后验采样拟合。我们的主要指标是Brier分数,分解为可靠性和分辨率,同时使用AUROC衡量判别能力,使用香农熵衡量锐度。每个指标均通过随机效应荟萃分析(REML,Knapp-Hartung调整)进行分析,并通过留一法影响分析进行验证。贝叶斯完全池化在可靠性上产生了统计学显著但实际不显著的改善,并增加了预测不确定性(锐度降低);Brier分数、分辨率和判别能力均无显著差异。所有指标的研究间异质性均较低,但可靠性结果对留一法剔除敏感。我们还分析了计算成本,发现贝叶斯流水线的能耗大约是频率学派对应流水线的十三倍,但相对于常见家用电器而言,这一成本仍然适中。这些结果表明,单独的贝叶斯完全池化对跨被试运动想象分类提供的实际益处有限,而跨被试和跨会话的部分池化是未来工作更有希望的方向。
关键词:脑机接口,运动想象,贝叶斯机器学习,概率校准,荟萃分析,脑电图
## 1 引言
脑机接口(BCI)研究的一个长期目标是开发免校准设备。无论是由于疲劳、饥饿还是传感器凝胶干燥,当前非侵入性脑测量技术输出的信号都会随时间变化。更糟的是,虽然人类大脑具有通用的功能模式,但个体差异显著。应对会话间变化的最古老、最可靠的策略是训练。比数月的训练稍好一点的是,我们可以简单地对每次新使用重新校准BCI。虽然对被试来说有些麻烦,但这可能仅需10分钟。
基于最大后验估计(MAP)的小规模EEG分类研究表明,跨被试和跨会话的部分池化是一个有前途的研究方向[23 (https://arxiv.org/html/2607.22980#bib.bib8)]。即使对于会话内BCI,全贝叶斯多级/层次模型也被证明可以改善判别能力[49 (https://arxiv.org/html/2607.22980#bib.bib9)]。作为这些结果的补充,基于极大似然估计(MLE)的已建立(无池化和完全池化)BCI模型的大规模基准测试,已经揭示了分类器按名称和类别在判别能力方面的有序排名[7 (https://arxiv.org/html/2607.22980#bib.bib21)]。
为了大规模实验部分池化对BCI预测性能的影响,我们对左手和右手运动想象脑电图(MI-EEG)分类中的贝叶斯完全池化流水线与频率学派基线进行了实证研究。判别指标如接收者操作特征曲线下面积(AUROC)是衡量BCI的最常见方式。然而,判别能力与校准无关[36 (https://arxiv.org/html/2607.22980#bib.bib22)],并且在非平稳EEG的分布偏移下可能严重失准。
除了判别能力,我们还将频率学派流水线控制与贝叶斯流水线处理在校准方面进行了对比。我们使用一个proper评分规则作为主要比较指标。作为次要指标,我们分析了校准/可靠性、分辨率、判别能力和锐度[46 (https://arxiv.org/html/2607.22980#bib.bib10)]。我们的实验是一项大规模研究,汇总了20个左手和右手MI-EEG数据集的二分类结果。总结是,通过贝叶斯完全池化,我们在可靠性和锐度上发现了统计学显著差异,但结果并不具有实际显著性。
在第2节 (https://arxiv.org/html/2607.22980#S2)中,我们简要概述贝叶斯机器学习的预备概念,指出可能对BCI有益的的关键特征以及最近的迁移学习研究。此外,我们阐述实验的指标及其对构建可信机器学习的重要性。由于我们的基准分析除了p值之外还包括效应量、不确定性和研究间异质性测量的讨论,我们也会解释这些内容。第3节 (https://arxiv.org/html/2607.22980#S3)概述了我们的实验设计,第4节 (https://arxiv.org/html/2607.22980#S4)揭示结果,第5节 (https://arxiv.org/html/2607.22980#S5)我们对结果进行解读。最后,我们描述了我们的工作如何能够支持未来的研究。
## 2 背景
### 2.1 模型构建
在监督学习中,任务T学习从输入x∈X到输出y∈Y的映射f。输入x通常是固定维度的向量x∈RD,其中D是向量的维度。经验E以一组N个输入-输出对D={ (xn,yn) }n=1N的形式给出,称为训练集,其中N是样本量。在分类问题中,输出空间是一组C个无序且互斥的标签,称为类别Y={C1, C2, ..., CC}。训练的问题通常是为模型找到一组参数,解决如公式1所示的极大似然估计[34 (https://arxiv.org/html/2607.22980#bib.bib3)]。
p(y|x, θ̂) 使得 θ̂ = argmaxθ Σn=1N log p(yn|xn, θ). (1)
贝叶斯机器学习让我们对权重建模概率分布,从而能够在预测中表示不确定性。对于训练集D、输出y、输入x和模型权重θ,我们有公式2中的贝叶斯机器学习处理方式[3 (https://arxiv.org/html/2607.22980#bib.bib5)]。然而,贝叶斯框架有一个主要缺点,即涉及对参数空间的积分[2 (https://arxiv.org/html/2607.22980#bib.bib6)]。这在微积分中很常见:求导数(例如梯度下降)比求积分更容易。在有限的计算预算和充足的训练数据下,使用点估计通常更好[2 (https://arxiv.org/html/2607.22980#bib.bib6)],不过,通常贝叶斯机器学习对应更好的泛化能力[35 (https://arxiv.org/html/2607.22980#bib.bib4)]。
p(y|x, D) = ∫ p(y|x, θ) p(θ|D) dθ 其中 p(θ|D) ∝ p(θ) p(D|θ). (2)
参数的不确定性通过贝叶斯机器学习自然地、连贯地通过后验概率分布p(θ|D)建模。此外,这种不确定性估计可以推广到具有组级结构的数据集上的多级/层次模型[32 (https://arxiv.org/html/2607.22980#bib.bib11)]。事实上,多级建模是使用贝叶斯方法的常见动机。对于BCI,直观上可以看到多级建模如何应用于跨被试和跨会话。考虑到EEG信号的群体水平非平稳性,贝叶斯机器学习通过原则性的不确定性量化方法提供了有用的估计能力。
### 2.2 预测验证
在构建预测器时,我们的目标是在可靠性的前提下最大化锐度[14 (https://arxiv.org/html/2607.22980#bib.bib23)]。这一概念直观地指靶心图的准确度和精确度,其中预测可能是紧密/分散和居中/偏离中心的。形式上,令ŷm为一个预测,可以取M个值ŷ1, ŷ2, ..., ŷM中的任何一个,令yn为相应的目标,可以是N个值y1, y2, ..., yN中的任何一个。准确度通常是指个体预测与其所预测事件之间的平均对应关系。可靠性、分辨率、判别能力和锐度是准确度的组成部分[46 (https://arxiv.org/html/2607.22980#bib.bib10)]。
可靠性,或称校准,对应于给定预测ŷr时平均观测值yp,总结了条件分布p(yp|ŷr)。分辨率也涉及p(yp|ŷr),衡量对于不同预测ŷr和ŷs,观测值yp的条件平均值之间的差异。判别能力是分辨率的逆概念,它涉及给定不同目标yp和yq时,预测ŷr的条件平均值之间的差异。锐度是仅与预测本身相关的属性,而不考虑它们对应的观测值,表征预测的无条件分布p(ŷr)[46 (https://arxiv.org/html/2607.22980#bib.bib10)]。
预测验证最容易通过非概率预测的离散预报量来理解,例如所有预测中真阳性和真阴性比例计算的准确度。概率预测的验证更为细致。由于非概率预测不包含不确定性的表达,因此每个预测是否正确是明确的。Brier分数(BS)是一种常见的概率预测,本质上是预测的均方误差。BS对预测与观测值之间配对差异的平方进行平均,如公式3所示,其中K是配对数量[46 (https://arxiv.org/html/2607.22980#bib.bib10)]。
BS = (1/K) Σk=1K (yk - ŷk)². (3)
预测验证可能在大气科学中发展最为完善,该领域采取了校准优先的研究方法[46 (https://arxiv.org/html/2607.22980#bib.bib10)]。另一方面,机器学习主要通过判别优先的方法发展[11 (https://arxiv.org/html/2607.22980#bib.bib12)]。然而,在过去几年中,机器学习研究人员越来越多地构建校准感知模型[17 (https://arxiv.org/html/2607.22980#bib.bib24)]。贝叶斯机器学习通常提供校准更好的模型,因为它们对参数空间进行平均,而不是优化可能导致过度自信(过于锐利)估计的点估计[35 (https://arxiv.org/html/2607.22980#bib.bib4)]。这促使在高风险场景中使用贝叶斯方法以实现可信机器学习。
### 2.3 证据合成
荟萃分析的目标是定量综合来自多项研究的证据[19 (https://arxiv.org/html/2607.22980#bib.bib13)]。通常更偏好对效应量进行荟萃分析,因为它们关注感兴趣的问题(实际显著性)而非零假设(统计显著性)[4 (https://arxiv.org/html/2607.22980#bib.bib14)]。效应量捕捉两个实体之间关系的方向和大小。对于某个研究k,我们记真实效应θk,观测效应θ̂k和抽样误差εk,如公式4所示。在汇总结果时,荟萃分析根据标准误(SE)对研究进行加权,标准误由抽样分布的标准差定义[19 (https://arxiv.org/html/2607.22980#bib.bib13)]。
θ̂k = θk + εk. (4)
公式4被称为随机效应模型,它假设不仅存在一个真实的效应量(固定效应模型),而是存在一个真实效应量的分布。随机效应模型的目标是估计真实效应分布的平均值。它规定存在第二个误差源ζk,由真实效应量θk只是一个包含均值μ的真实效应量总体分布的一部分的事实引入,得到公式5。随机效应模型的一个关键假设是ζk的大小与k无关。这就是随机效应模型的可交换性假设[19 (https://arxiv.org/html/2607.22980#bib.bib13)]。
θ̂k = μ + ζk + εk. (5)
随机效应模型的挑战在于我们必须考虑误差ζk。为此,我们必须估计真实效应量分布的方差τ²。找到哪种τ²估计器对不同类型数据表现最佳是正在进行的研究。DerSimonian-Laird估计器基于闭式表达式,而限制性最大似然通过迭代算法找到τ²的最优值。虽然合并效应的显著性检验通常假设正态分布,称为Wald检验,但Knapp-Hartung方法基于t分布,在研究数量较少时使用[19 (https://arxiv.org/html/2607.22980#bib.bib13)]。
τ²用于估计真实效应量在荟萃分析中的变异程度,称为研究间异质性。极端异质性可能意味着这些研究毫无共同之处,解释合并效应没有意义。量化研究间异质性的困难在于要确定有多少变异可归因于抽样误差,有多少可归因于真实效应量差异。I²统计量是效应量变异中不由抽样误差引起部分的百分比。预测区间(PIs)给出了根据当前证据,我们预期未来研究的效应量会落入的范围[19 (https://arxiv.org/html/2607.22980#bib.bib13)]。
研究间异质性可能由以相似文章
堆叠LoRA:面向运动想象解码中的被试自适应EEG基础模型
提出了堆叠LoRA,一种将被试不变知识与被试特定知识解耦的框架,用于使EEG基础模型适应运动想象解码,在多个基准上提升了准确率。
Bio-MF:低延迟高保真EEG到fNIRS跨模态生成用于混合运动想象脑机接口
Bio-MF是一个一步式生成框架,用于EEG到fNIRS跨模态生成,实现混合运动想象脑机接口的低延迟高保真合成。
元学习上下文学习实现无需训练的跨被试脑解码
# 论文页面 - 元学习上下文学习实现无需训练的跨被试脑解码 来源:[https://huggingface.co/papers/2604.08537](https://huggingface.co/papers/2604.08537) 作者:,,,,,,,,,,,,, ## 摘要 一种元优化方法通过少量图像-脑示例快速推断个体独特神经编码模式,无需跨被试及扫描仪微调,即可实现可泛化的语义视觉解码。[视觉解码](https://huggingface.co/papers?q
MPP-GNN:基于fMRI的阿尔茨海默病分类中的受试者自适应社区检测
本文提出了MPP-GNN,一种元概率池化图神经网络,能够自适应地发现受试者特定的脑模块,用于基于fMRI的阿尔茨海默病分类,在两个公开数据集上取得了最先进的AUC,并与规范的脑网络组织保持一致。
贝叶斯模型合并
介绍贝叶斯模型合并(BMM),这是一个即插即用的双层优化框架,用于将多个任务特定的专家模型合并为一个单一模型,在视觉和语言基准测试上实现了最先进的性能。