SW-ProxyCE:从公共 EEG 编码器到私有下游模型的零查询对抗性迁移
摘要
本文提出了 SW-ProxyCE,一个零查询对抗性攻击框架,该框架从公共 EEG 编码器迁移到私有下游模型,展示了 EEG 基础模型的安全风险。
arXiv:2608.16931v1 Announce Type: new
摘要:脑电图(EEG)基础模型最近成为 EEG 解码的一种有前景的范式,通过从大规模异质神经记录中学习可重用表示。然而,EEG 基础编码器的公开发布,在促进下游开发的同时,也引入了一种此前未被探索的安全风险:公开可用的表示可能使私有下游模型变得脆弱。本文研究了在公共编码器和私有下游设置中 EEG 基础模型部署中的对抗性迁移攻击,其中攻击者对发布的编码器具有白盒访问权限和一个小的任务匹配的标记参考集,但无法访问或查询受害者参数、输出或梯度。我们提出了收缩白化代理交叉熵(SW-ProxyCE),这是一个无查询的任务感知攻击框架,通过收缩白化类别原型从一个小的标记参考集中恢复任务级决策几何,从而无需训练额外的替代分类器即可生成可迁移的对抗样本。我们在三个 EEG 任务上使用三个通用基础编码器和一个范式特定的预训练编码器评估了 SW-ProxyCE,涵盖了跨受试者和受试者内场景中的线性探测和全微调下游模型。结果表明,从公共编码器和有限标记参考生成的对抗样本可以有效地迁移到无法访问的下游模型。SW-ProxyCE 一致地优于任务无关的表示偏移攻击,揭示了 EEG 基础模型的强大可迁移性并不一定带来对抗鲁棒性。我们的代码将在 GitHub 上提供。
查看缓存全文
缓存时间: 2026/08/19 10:17
# SW-ProxyCE:从公共EEG编码器到私有下游模型的零查询对抗迁移
来源:https://arxiv.org/html/2608.16931
林华聪¹ 丁坤¹ 杜东瑞¹
¹
###### 摘要
脑电图(EEG)基础模型近期作为一种有前景的范式出现,通过从大规模异构神经记录中学习可复用的表示,用于EEG解码。然而,EEG基础编码器的开放发布,虽然促进了下游发展,但也引入了先前未探索的安全风险:公开可用的表示可能使私有下游模型变得脆弱。本文研究了在公开编码器-私有下游模型设置下EEG基础模型部署中的对抗迁移攻击,其中攻击者拥有对已发布编码器的白盒访问权限和一个小的任务匹配标签参考集,但无法访问或查询受害者参数、输出或梯度。我们提出了收缩白化代理交叉熵(SW-ProxyCE),一种无需查询的任务感知攻击框架,它通过收缩白化类别原型从少量标签参考集中恢复任务级决策几何结构,无需训练额外的代理分类器即可生成可迁移的对抗样本。我们使用三个通用基础编码器和一个范式特定的预训练编码器,在跨主体和主体内场景下,针对三个EEG任务评估了SW-ProxyCE,涵盖了线性探测和全微调下游模型。结果表明,仅通过公开编码器和有限标签参考生成的对抗样本,可以有效迁移至无法访问的下游模型。SW-ProxyCE始终优于任务无关的表示偏移攻击,揭示了EEG基础模型的强大迁移能力并不必然带来对抗鲁棒性。我们的代码将在GitHub上发布。
¹¹¹ https://github.com/ccclh/SW-ProxyCE
见插图
图1:传统针对特定任务模型的对抗攻击与从公共EEG编码器到私有下游模型的零查询对抗迁移设置之间的比较。
## 引言
脑机接口(BCI)在神经活动与外部设备之间建立了直接通信路径,使用户无需依赖传统的神经肌肉通路即可传达意图并与辅助或智能系统交互(Cincotti等人,2008 (https://arxiv.org/html/2608.16931#bib.bib1))。脑电图(EEG)是BCI最广泛使用的非侵入性模态之一,其实际效用关键依赖于将神经动态准确解码为任务相关状态、意图或控制命令(Tariq, Trivailo, and Simic,2018 (https://arxiv.org/html/2608.16931#bib.bib24))。然而,传统的EEG解码器通常为特定主体、数据集或范式开发,在跨主体和记录配置(Liu等人,2025 (https://arxiv.org/html/2608.16931#bib.bib14))以及下游任务(Liu等人,2026a (https://arxiv.org/html/2608.16931#bib.bib12))上泛化能力较差。EEG基础模型近期作为一种改进此类泛化能力的方法出现。通过在大规模异构EEG语料库上进行预训练,这些模型旨在学习可复用的神经表示,这些表示可以通过线性探测(LP)和全微调(FT)等策略适应不同的下游任务(Jiang, Zhao, and Lu,2024 (https://arxiv.org/html/2608.16931#bib.bib7);Cui等人,2024 (https://arxiv.org/html/2608.16931#bib.bib2);Wang等人,2025 (https://arxiv.org/html/2608.16931#bib.bib26);Liu等人,2026a (https://arxiv.org/html/2608.16931#bib.bib12))。在实践中,预训练编码器检查点通常公开发布,并随后被多个下游用户重用,以构建独立开发的特定任务EEG系统。
尽管取得了这些进展,但公开发布的EEG基础编码器的对抗安全影响在很大程度上尚未被探索。如图1 (https://arxiv.org/html/2608.16931#S0.F1)(a) 所总结,现有的EEG对抗攻击主要针对完整的特定任务模型,在白盒、基于查询的黑盒或传统的基于迁移的黑盒设置下进行(Zhang and Wu,2019 (https://arxiv.org/html/2608.16931#bib.bib32);Jiang, Zhang, and Wu,2019 (https://arxiv.org/html/2608.16931#bib.bib8);Liu等人,2021 (https://arxiv.org/html/2608.16931#bib.bib15))。白盒攻击假定可以访问受害者的参数和梯度,而基于查询的黑盒攻击则依赖于来自受害者的重复反馈来估计攻击方向或训练替代模型。基于迁移的攻击避免了对受害者的直接访问,但通常通过单独训练的特定任务源模型生成扰动,该模型提供明确的分类目标。
这些假设并未完全刻画EEG基础模型部署的特点,后者造成了明显的访问不对称性:上游预训练编码器是公开可用的,而从其适应的下游模型可能保持私有且无法被查询。尽管这些私有模型可能在分类头、训练数据和适应策略上有所不同,但它们共享一个共同的预训练来源,并可能保留公共编码器表示和梯度结构的一部分。因此,通过已发布编码器优化的扰动在下游适应后可能仍然有效,使公共编码器成为跨其他无法访问的EEG系统的潜在共享上游攻击面。这提出了一个根本问题:攻击者能否利用公开发布的EEG编码器生成可迁移至从其派生的私有下游模型的对抗样本,而无需访问或查询这些模型?
为弥合这一差距,我们制定了一个公共编码器迁移攻击设置,如图1 (https://arxiv.org/html/2608.16931#S0.F1)(b) 所示,其中攻击者拥有对已发布预训练EEG编码器的白盒访问权限和一个小的任务匹配标签参考集,但无法访问或查询私有下游模型。在此设置下,我们提出了收缩白化代理交叉熵(SW-ProxyCE),一种无需受害者查询且任务感知的攻击,它从有限的参考集中构建类别原型,并在无需训练额外代理模型的情况下推导出代理分类目标。SW-ProxyCE进一步采用收缩白化来减少各向异性类内变化的影响,并在参考有限的情况下稳定基于原型的比较。
在三个EEG任务、四个预训练编码器、LP和FT受害者以及LOSO和主体内协议下的实验表明,SW-ProxyCE能有效迁移至无法访问的下游模型,并始终优于任务无关的表示偏移攻击。本工作的主要贡献总结如下:
- • 我们识别并形式化了EEG基础模型部署中先前未充分探讨的安全风险:公开发布的预训练编码器可以作为多个从其适应的私有下游模型的共享上游攻击面。
- • 我们提出了SW-ProxyCE,一种无需受害者查询且任务感知的对抗迁移框架,它从少量标签参考集中构建基于原型的交叉熵目标。其收缩白化的代理几何结构在捕捉任务级类别竞争的同时,缓解了各向异性和估计不佳的类内变化。
- • 我们在三个EEG任务、四个公开可用的预训练编码器、LP和FT下游受害者以及LOSO和主体内协议下进行了系统评估。结果表明,仅通过公共编码器生成的对抗样本,无需受害者访问或查询,即可有效迁移至无法访问的下游模型。
## 相关工作
### EEG基础模型
EEG基础模型(FM)最近作为一种有前景的范式出现,用于从大规模异构EEG语料库中学习可迁移的表示。早期的研究,如BENDR (Kostas, Aroca-Ouellette, and Rudzicz,2021 (https://arxiv.org/html/2608.16931#bib.bib10)) 和BIOT (Yang, Westover, and Sun,2023 (https://arxiv.org/html/2608.16931#bib.bib29)) 证明了自监督EEG表示学习和跨数据集迁移的可行性。近期的模型进一步探索了多种预训练目标和架构,包括自回归token建模 (Cui等人,2024 (https://arxiv.org/html/2608.16931#bib.bib2))、掩码时空表示学习 (Wang等人,2024 (https://arxiv.org/html/2608.16931#bib.bib25)) 和紧凑掩码信号重建 (Wang等人,2025 (https://arxiv.org/html/2608.16931#bib.bib26))。除了通用预训练外,MIRepNet (Liu等人,2026b (https://arxiv.org/html/2608.16931#bib.bib13)) 研究了用于运动想象解码的范式特定预训练。尽管取得了这些进展,现有的EEG FM研究主要关注于提高下游准确性和迁移性,而它们在对抗扰动下的鲁棒性和安全性在很大程度上尚未被探索 (Kuruppu等人,2026 (https://arxiv.org/html/2608.16931#bib.bib11);Liu等人,2026a (https://arxiv.org/html/2608.16931#bib.bib12);Dai等人,2026 (https://arxiv.org/html/2608.16931#bib.bib3))。
### 对抗EEG模型攻击
现有的针对EEG解码系统的对抗攻击研究主要关注有监督的特定任务模型,并根据攻击者对受害者模型的访问权限通常分为白盒和黑盒攻击(Wu等人,2023 (https://arxiv.org/html/2608.16931#bib.bib28);Meng, Jiang, and Wu,2023 (https://arxiv.org/html/2608.16931#bib.bib18))。在白盒访问下,早期研究证明了EEG分类器对精心制作的输入扰动的脆弱性(Zhang and Wu,2019 (https://arxiv.org/html/2608.16931#bib.bib32)),随后将对抗操纵扩展到EEG回归模型和BCI拼写器(Meng等人,2019 (https://arxiv.org/html/2608.16931#bib.bib19);Zhang等人,2021 (https://arxiv.org/html/2608.16931#bib.bib33))。后来的工作研究了更具结构性和实际动机的扰动,包括在EEG通道、时间样本或脑电活动图(BEAM)表示上的稀疏攻击(Feng, Wang, and Ding,2021 (https://arxiv.org/html/2608.16931#bib.bib5);Yu等人,2023 (https://arxiv.org/html/2608.16931#bib.bib31))、物理约束攻击(Wang等人,2022 (https://arxiv.org/html/2608.16931#bib.bib27))、注意力引导的通用扰动(Zhong等人,2025 (https://arxiv.org/html/2608.16931#bib.bib35))和基于对抗过滤的攻击(Meng等人,2024 (https://arxiv.org/html/2608.16931#bib.bib17))。
黑盒EEG攻击通常遵循基于查询或基于迁移的策略。基于查询的方法利用受害者模型的反馈来训练替代模型(Jiang, Zhang, and Wu,2019 (https://arxiv.org/html/2608.16931#bib.bib8)),或使用有限数量的硬标签查询迭代构建低失真扰动(Qian等人,2025 (https://arxiv.org/html/2608.16931#bib.bib21))。基于迁移的方法则通过特定任务的源模型生成对抗样本,并评估产生的扰动在对抗独立训练的目标模型(通常跨不同模型架构)时是否仍然有效(Liu等人,2021 (https://arxiv.org/html/2608.16931#bib.bib15);Jung等人,2023 (https://arxiv.org/html/2608.16931#bib.bib9);Yi等人,2024 (https://arxiv.org/html/2608.16931#bib.bib30))。尽管此类方法避免了对目标参数的直接访问,但它们通常依赖于完整的任务感知源预测器,并且通常假设源模型和目标模型是在相同或紧密匹配的数据分布上训练的。
尽管取得了实质性进展,现有的EEG对抗研究在很大程度上关注于完整的特定任务模型,而没有捕捉到EEG基础模型部署中的公共编码器/私有下游访问不对称性。据我们所知,这是第一项系统研究从公开发布的EEG编码器到无法访问的下游模型的对抗迁移的工作。
## 问题定义与安全分析
### 公共编码器部署与威胁设置
在我们考虑的部署模式中,预训练的EEG编码器被公开发布供下游重用,而从其适应的模型保持私有。令 fθ0 表示公共编码器。从中派生的私有下游模型表示为 Fvic=A(fθ0,Dtask),(1) 其中 A 代表下游适应过程,Dtask 表示私有任务特定的适应数据。攻击者拥有对公共编码器 fθ0 的白盒访问权限,包括其架构和参数,并且可以通过该编码器计算输入梯度。相比之下,Fvic 的架构、参数、输出和梯度对攻击者不可用。此外,在生成对抗样本期间不允许对受害者模型进行查询。我们假设攻击者拥有一个独立于私有下游模型及其训练数据获得的小型任务匹配标签参考集。这里,任务匹配表示参考样本与受害者模型共享相同的预测任务和标签空间。此类参考可以从具有兼容任务定义的公开可用数据集获取,或在兼容的实验方案下收集。我们将参考集表示为 Dref={\(xir,yir\)}i=1N,N=KC,(2) 其中 C 是任务类别数,K 是每个类别的参考样本数。参考集与 Dtask 和用于攻击评估的试验不相交。我们考虑数字域中的无目标扰动,并假设攻击者可以在下游推理之前修改EEG试验。给定一个带标签 y 的试验 x,攻击者构造 xadv=x+δ,满足 ‖δ‖∞≤ε。攻击生成使用 Dref 以及通过 fθ0 的前向传播和输入梯度,不涉及 Fvic。
### 公共编码器的下游迁移风险
尽管下游模型 Fvic 保持私有,但公共编码器 fθ0 完全暴露给潜在的攻击者。由于下游适应可能保留从预训练编码器继承的部分表示结构,因此通过 fθ0 生成的对抗扰动在适应后可能仍然有效,并迁移至私有下游模型。对于一对试验-标签 (x, y),我们表征由公共编码器引起的迁移风险为 Rtransfer(x,y)=E(Fvic,G(x,y;fθ0,Dref),y),(3) 其中 G(x,y;fθ0,Dref)=xadv...相似文章
提升脑机接口的安全性
本文提出了一种轻量级卷积神经网络架构,用于提高基于脑电图的脑机接口的对抗鲁棒性,通过对抗攻击评估,并显示出比现有模型更好的分类性能。
通过稀疏自编码器实现脑电图基础模型的机制可解释性
本文对三个脑电图基础模型(SleepFM、REVE、LaBraM)应用TopK稀疏自编码器,提取可解释的特征字典,并引入了概念引导框架,揭示了表征失败和临床纠缠问题。
EEG基础模型中的身份陷阱:诊断性审计
本文识别并诊断了EEG基础模型中的“身份陷阱”,即高准确率可能源于受试者身份特征而非真实的临床生物标志物。它提出了FMScope,一种冻结表示协议以分离这些信号,并证明了受试者身份混杂在三模型中普遍存在且可通过线性方法移除。
基于语义对齐的连续潜变量预测建模用于脑电-语言基础模型
该论文提出了BLPM,一种脑电-语言基础模型,利用连续潜变量预测建模和语义对齐将脑电信号映射到文本嵌入,在多样任务和数据集上实现了可泛化的神经解码。
背景也重要:用可迁移攻击攻破医学视觉语言模型
MedFocusLeak 首次提出针对医学视觉语言模型的可迁移黑盒对抗攻击,通过不可察觉的背景扰动在六种成像模态上误导临床诊断。