通过稀疏自编码器实现脑电图基础模型的机制可解释性

arXiv cs.LG 论文

摘要

本文对三个脑电图基础模型(SleepFM、REVE、LaBraM)应用TopK稀疏自编码器,提取可解释的特征字典,并引入了概念引导框架,揭示了表征失败和临床纠缠问题。

arXiv:2605.13930v1 Announce Type: new 摘要:脑电图基础模型在临床性能上达到了最先进水平,但其预测所依赖的内部计算仍不透明——这是临床信任的障碍。我们在三种架构不同的脑电图Transformer(SleepFM、REVE和LaBraM)上应用TopK稀疏自编码器,从其嵌入中提取稀疏特征字典。通过将这些特征基于临床分类(异常、年龄、性别和药物)进行 grounding,我们跨架构基准测试了单义性和纠缠性。一个单一的超参数流程,由内在字典健康审计驱动,能够稳健地应用于所有三种架构。通过概念引导,我们引入了一种“目标 vs. 离目标”探针区域指标来量化引导选择性,并揭示了三种操作模式:选择性可引导、编码但纠缠、以及未编码。该框架暴露了关键的表征失败:“破坏球”式干预会破坏全局模型性能,以及临床纠缠问题(如年龄-病理混淆),其中抑制一个概念而不损害另一个是不可能的。最后,一个频谱解码器将这些干预映射回幅度谱,将潜在操作转化为生理上可解释的频率特征,例如病理性慢波抑制和$\alpha$-波段恢复。
查看原文
查看缓存全文

缓存时间: 2026/05/15 06:25

基于稀疏自编码器的脑电图基础模型机制可解释性
来源: https://arxiv.org/html/2605.13930
William Lehn-Schiøler1,2,3&Magnus Ruud Kjær2&Rahul Thapa4, 5&Magnus Guldberg Pedersen1,3&Anton Storgaard Mosquera1,3&Nick Williams6&Radu Gătej1&Tue Lehn-Schiøler1&Sándor Beniczky7,8&Sadasivan Puthusserypady2&James Zou4,5&Lars Kai Hansen3

###### 摘要

脑电图(EEG)基础模型在临床任务中达到了最先进的性能,但其驱动预测的内部计算过程仍然不透明,这成为临床信任的障碍。我们应用TopK稀疏自编码器(SAE),跨越三种架构不同的EEG变换器模型:SleepFM、REVE和LaBraM,从它们的嵌入中提取稀疏特征字典。通过将这些特征锚定到临床分类标准(异常、年龄、性别和用药情况),我们跨架构基准测试了特征的单义性和纠缠程度。一个基于内在字典健康审计驱动的单一超参数设置过程,在所有三种架构上均表现出稳健的迁移性。通过概念引导,我们引入了一种“目标 vs. 非目标”探测区域指标来量化引导选择性,并揭示了三种操作模式:可选择性引导、已编码但纠缠、以及未编码。该框架暴露了关键的表征失败:“破坏球”式干预会导致全局模型性能崩溃,以及临床纠缠现象(例如年龄-病理混淆),此时抑制一个概念不可避免地会破坏另一个概念。最后,通过频谱解码器将这些干预映射回幅度谱,将潜在操作转化为生理上可解释的频率特征,例如病理性慢波抑制和α频带恢复。

1BrainCapture, 孔恩斯灵比, 丹麦
2DTU Health Tech, 丹麦技术大学, 孔恩斯灵比, 丹麦
3DTU Compute, 丹麦技术大学, 孔恩斯灵比, 丹麦
4Department of Biomedical Data Science, 斯坦福大学, 斯坦福, 加利福尼亚州, 美国
5Department of Computer Science, 斯坦福大学, 斯坦福, 加利福尼亚州, 美国
6Seer Medical, 墨尔本, 澳大利亚
7Filadelfia癫痫医院, 迪亚纳伦德, 丹麦
8哥本哈根大学医院, 哥本哈根, 丹麦

## 1 引言

在大规模语料库上预训练的EEG基础模型在多种任务上表现出色:睡眠分期、病理检测和脑机接口解码[28 (https://arxiv.org/html/2605.13930#bib.bib2),8 (https://arxiv.org/html/2605.13930#bib.bib4),16 (https://arxiv.org/html/2605.13930#bib.bib5),19 (https://arxiv.org/html/2605.13930#bib.bib6),20 (https://arxiv.org/html/2605.13930#bib.bib3)]。然而,产生这些预测的内部计算过程仍然不透明。与图像模型不同——注意力图已经能给出粗略的视觉故事——EEG模型处理的是多通道时间序列,其临床相关事件(如纺锤波、K复合波、δ波、癫痫样放电)是瞬态的、分布在多个通道上,并由数十年的人类专家知识所定义[5 (https://arxiv.org/html/2605.13930#bib.bib28)]。理解EEG基础模型学习了 *什么*,以及它在 *哪里* 学到了这些知识,既是一个科学问题,也是临床信任的要求。

机制可解释性[10 (https://arxiv.org/html/2605.13930#bib.bib13),11 (https://arxiv.org/html/2605.13930#bib.bib12)]通过逆向工程网络内单个方向的功能角色来解决这一问题。核心障碍是叠加[11 (https://arxiv.org/html/2605.13930#bib.bib12)]:一个具有 d 维的变换器层可以通过稀疏共激活表示多达 N ≫ d 个特征,这使得单个神经元无法解释。稀疏自编码器(SAEs)[6 (https://arxiv.org/html/2605.13930#bib.bib16),27 (https://arxiv.org/html/2605.13930#bib.bib15),21 (https://arxiv.org/html/2605.13930#bib.bib17)]已成为在语言模型中恢复这些特征的主要工具。一小部分但不断增长的文献将该工具包应用于医学影像[25 (https://arxiv.org/html/2605.13930#bib.bib11),24 (https://arxiv.org/html/2605.13930#bib.bib10)]、蛋白质语言模型[26 (https://arxiv.org/html/2605.13930#bib.bib9)]以及在神经信号上训练的变换器[13 (https://arxiv.org/html/2605.13930#bib.bib7),17 (https://arxiv.org/html/2605.13930#bib.bib8)]。尽管取得了这些进展,EEG基础模型仍未得到解决;此前没有工作能够从冻结的EEG编码器完整地连接到稀疏特征字典、临床概念归因以及跨架构的频谱级机制解释。

#### 贡献.

我们做出以下贡献:

1. 1.**跨架构可解释性管线**:我们引入了一个统一的框架来解读EEG变换器,弥合了高维嵌入与临床生理学之间的鸿沟。该管线集成了逐层TopK SAE、通过概念激活向量测试(TCAV)进行概念归因、以及概念引导,利用一个单一的、在三种不同架构(SleepFM, REVE, LaBraM)上均保持稳健的超参数选择过程。交互式框架可在以下网址获取:
2. 2.**临床语义分类法**:我们提出了一种分类法,通过将临床特征划分为三种模式来审计编码器表示:可分离(单义)、纠缠(多义共激活)和死亡(语义无信息/不活跃)。这作为一种工具,用于识别潜在的临床偏差,其中年龄或用药等标签会与病理共激活。
3. 3.**通过概念引导的选择性**:我们形式化了一个基于探测的选择性指标,计算目标“引导曲线”与非目标“引导曲线”之间的面积,以评估模型干预的保真度。这使我们能够区分选择性概念移除和“破坏球”式干预——在后一种情况中,特征抑制会无意中导致整个嵌入空间崩溃。
4. 4.**机制性频谱解释**:通过将引导后的激活重新通过频谱解码器解码,我们将抽象的潜在嵌入转换为人类可解释的空间。这为模型归因提供了机制性证据,使专家能够验证病理预测是否由生理学相关的特征驱动。

## 2 背景

### 2.1 EEG基础模型

我们研究了三种架构不同的EEG变换器模型,它们涵盖两种不同的自监督预训练目标(多模态对比学习和掩码令牌预测);这些模型在表1 (https://arxiv.org/html/2605.13930#S2.T1) 中进行了总结。所有三个编码器随后在同一二元正常/异常分类目标上进行端到端微调,该目标稍后用作临床概念。性能指标可在表2 (https://arxiv.org/html/2605.13930#S4.T2) 中找到。

### 2.2 TopK稀疏自编码器

在激活 a ∈ Rd 上训练的 TopK SAE[23 (https://arxiv.org/html/2605.13930#bib.bib18)] 学习:

z = TopK(Wenc (a - μℓ) / σℓ, k),  â = Wdec z + bdec,    (1)

其中 z ∈ RN,Wdec ∈ Rd×N 的列(解码器方向 wi ∈ Rd)具有单位范数;N ≜ d · E,E 是扩展率。传统的 SAE 公式使用 L1 稀疏惩罚[7 (https://arxiv.org/html/2605.13930#bib.bib14)],这鼓励但不保证稀疏性。我们转而使用 TopK 硬约束[27 (https://arxiv.org/html/2605.13930#bib.bib15)]:为所有 N 个特征计算预激活(在使用 μℓ 和 σℓ 标准化输入后,μℓ 和 σℓ 是在层 ℓ 的训练分割激活上计算的每维度均值和标准差),然后将除 k 个最大值之外的所有值设为零。这样,每个令牌恰好有 k 个特征被激活,使稀疏性直接可控。

表 1: 编码器概览。检查了三种架构不同的 EEG 变换器,它们采用不同的 SSL 目标:多模态对比学习 (SleepFM)、掩码令牌重建 (REVE) 和掩码频谱预测 (LaBraM)。SleepFM 在 PSG 数据(EEG, ECG, EMG 和呼吸)上使用多模态对比目标进行预训练,而 REVE 和 LaBraM 仅在 EEG 上预训练。所有三个随后在同一二元正常/异常目标上进行端到端微调。

| 编码器 | 架构 | d | 层数 | 令牌长度 | SSL 目标 | 模态 | ≈ 小时数 |
| :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- |
| SleepFM[28 (https://arxiv.org/html/2605.13930#bib.bib2)] | SetTransformer | 128 | 3 | 1 sec | MMC (InfoNCE)[29 (https://arxiv.org/html/2605.13930#bib.bib31)] | PSG | 585,000 |
| REVE[8 (https://arxiv.org/html/2605.13930#bib.bib4)] | Transformer | 512 | 22 | 1 sec | MAE[15 (https://arxiv.org/html/2605.13930#bib.bib32)] | EEG | 60,000 |
| LaBraM[16 (https://arxiv.org/html/2605.13930#bib.bib5)] | BERT-style | 200 | 12 | 1 sec | MSP (VQ / BEiT)[2 (https://arxiv.org/html/2605.13930#bib.bib33)] | EEG | 2,500 |

### 2.3 TCAV 和概念归因

概念激活向量[18 (https://arxiv.org/html/2605.13930#bib.bib23)]通过在表示空间中对分离 XC 和 X¬C 的线性分类器来定义概念 C,产生一个单位范数方向 vC ∈ Rd。我们还在 SAE 激活 z ∈ RN 上训练一个线性探针 w,为每个示例分配一个敏感性 SC(x) = w⊤ z(x)。TCAV 分数是敏感性为正的概念示例的比例:

TCAVC = |{x ∈ XC : SC(x) > 0}| / |XC|,    (2)

其显著性针对 Nrand = 50 个随机标签零假设 CAV 进行评估。

## 3 方法论

该管线(图1 (https://arxiv.org/html/2605.13930#S3.F1))在冻结的编码器上分四个阶段运行。阶段 I–III 使用已建立的可解释性组件(线性探测[1 (https://arxiv.org/html/2605.13930#bib.bib35),3 (https://arxiv.org/html/2605.13930#bib.bib36)]、字典学习[7 (https://arxiv.org/html/2605.13930#bib.bib14)]、概念归因[22 (https://arxiv.org/html/2605.13930#bib.bib25)]);新颖的贡献是阶段 IV(概念引导),它利用字典和频谱解码器为任何 TCAV 归因产生机制性的、频谱级别的解释。

参见图注

图 1: 管线概览。从一个冻结的 EEG 基础模型开始:(阶段 I)一个浅层 MLP *频谱解码器* 将令牌嵌入翻译回人类可解释的空间。(阶段 II)对于每个变换器层,一个 TopK SAE 从归一化的编码器激活中恢复一个稀疏的、过完备的特征字典。(阶段 III)SAE 特征通过 TCAV 映射到已知的临床概念。(阶段 IV)*概念引导* 将前 n 个概念富集的特征激活替换为目标组质心,通过 SAE 和频谱解码器解码该干预,以产生机制性的、频谱级别的解释。

### 3.1 数据集与预处理

我们使用一个使用 BrainCapture 的 BC-1 收集的临床 27 导联 EEG 数据集,包含 3,036 名受试者[12 (https://arxiv.org/html/2605.13930#bib.bib1)]。该队列中男性占 57.8%,包括儿童和成人群体。记录平均时长 33.8 分钟,其中 30.2%(917 次 session)被识别为异常;在这些异常记录中,76.4% 显示癫痫样放电。EEG 信号使用[14 (https://arxiv.org/html/2605.13930#bib.bib24)]的演进版本进行预处理。该管线在重采样到编码器的原生频率(SleepFM 为 128 Hz,REVE 和 LaBraM 为 200 Hz)之前,应用带通滤波(0.5-70 Hz)和陷波滤波(50 Hz)。记录被分割成不重叠的 60 秒窗口。受试者通过 scikit-learn 的 GroupShuffleSplit(随机种子 42)按照 80% 训练集/10% 验证集/10% 测试集进行划分。

### 3.2 阶段 I:频谱解码器

频谱解码器(SD)是一个浅层 MLP,它将冻结的编码器令牌嵌入 t ∈ Rd 映射到每个频率仓的幅度和相位:
    Âν, (cos φ̂ν, sin φ̂ν) = SD(t), ν = 1, ..., F.    (3)
对于所有编码器,F = 64 个仓,0-64 Hz(与预处理中应用的 70 Hz 低通滤波器一致;第 3.1 节)。相位被参数化为一对单位向量,以消除 2π 不连续性。SleepFM 令牌在通道上取平均;REVE 和 LaBraM 令牌是每通道每秒的。

频谱解码器有两个作用:(i) 它提供了一个生理学词汇表,用于通过 SD(w) 解释任何方向 w ∈ Rd,并且 (ii) 它是概念引导(第 3.5 节)的最后阶段。

### 3.3 阶段 II:逐层 SAE 训练

对于每个编码器层 ℓ,我们收集所有可用的训练分割令牌激活,按维度归一化,并训练一个具有 E · d 个特征的 TopK SAE,其中 d 是编码器嵌入维度,E 是 *扩展率*(控制相对于编码器的字典大小)。我们将稀疏预算与字典大小成比例缩放,k = k0 · E,其中 k0 = 8,使得在扩展扫描中,每个编码器的每个令牌活跃比例 k/N = k0/d 是恒定的。这将两个超参数耦合到单个 E 轴上,并确保在 E 之间进行比较时,是在匹配的相对稀疏度下进行的,而不是在匹配的绝对 k 下。重建目标是在归一化激活上的 MSE;死的神经元(在 500 步内从未触发)按照[27 (https://arxiv.org/html/2605.13930#bib.bib15)]的方法定期重采样。

### 3.4 阶段 III:通过 TCAV 进行概念归因

对于每个概念 C ∈ {异常、年龄组、性别、用药(精神类)、用药 (ASM)},我们通过 Kfold = 10 折 L2 正则化逻辑回归在密集层 ℓ 激活 a 上获得 vC,然后在 z 上拟合探针 w 并根据等式 2 计算 TCAVC。对于特征富集,我们应用单侧 z 检验,并进行 Benjamini–Hochberg 校正(q < 0.05,N 个同时假设),以识别概念富集的 SAE 特征,这些特征构成阶段 IV 的排名池。

### 3.5 阶段 IV:概念引导

概念引导为 SAE 字典的表征保真度提供了干预证据,并针对模型无关的 *选择性* 标准进行评估。给定一个目标临床概念 CC(例如年龄)和一个次要的非目标概念(例如异常),该协议包括:

1. 按 CAV 对齐排序。概念方向通过将其投影到每个 SAE 解码器方向 wi ∈ Rd 上映射到稀疏字典,从而得到基于对齐的排名:
    rankC(i) = |vC · wi|    (4)
2. 计算目标概念质心。我们定义质心 ct

相似文章

EEG基础模型中的身份陷阱:诊断性审计

arXiv cs.LG

本文识别并诊断了EEG基础模型中的“身份陷阱”,即高准确率可能源于受试者身份特征而非真实的临床生物标志物。它提出了FMScope,一种冻结表示协议以分离这些信号,并证明了受试者身份混杂在三模型中普遍存在且可通过线性方法移除。

利用语言模型的稀疏特征解读大脑对语言的反应

arXiv cs.CL

本文介绍了Augmented Sparse Encoding Models,利用语言模型的稀疏特征解读大脑对语言的反应,并在高场7T fMRI数据上进行了验证。该模型恢复了已知的神经调谐特性,并发现了一个新的体素群体,该群体对与人相关的内容具有调谐特性。