iMINDBench: 颅内脑电图(iEEG)多机构神经解码基准

arXiv cs.LG 论文

摘要

介绍iMINDBench,一个颅内脑电图(iEEG)多机构神经解码基准,它在三个自然电影观看数据集上评估模型在十五个解码任务上的表现,以实现一致的比较。

arXiv:2609.18104v1 公告类型:新 摘要:颅内脑电图(iEEG)广泛用于直接记录大脑内电极的电活动,使其成为神经解码的有吸引力的模态。然而,iEEG解码的进展,特别是朝向通用基础模型,仍然难以可靠地测量:数据集是特定任务或机构的,限制了跨任务和记录环境的泛化证据,且预处理选择会强烈影响性能,使得模型改进难以与预处理增益区分开来。因此,我们介绍iMINDBench,一个颅内脑电图(iEEG)多机构神经解码基准,它在三个自然电影观看数据集上评估模型在共享的十五个解码任务套件上的表现。该基准还定义了标准化预处理路径和固定评估划分,以支持一致的模型比较。使用iMINDBench,我们发现评估的预训练系统在其各自的预处理路径中通常优于基线,而强大的频谱基线在跨机构数据集中仍具有竞争力。在我们的规模研究中,添加多达25倍来自其他受试者或机构的监督数据,仅比会话内训练带来少量或任务依赖的增益。总之,这些发现突出了需要改进强大预处理基线的iEEG模型,并更有效地利用跨受试者和机构的数据。项目网站:https://imindbench.github.io/
查看原文
查看缓存全文

缓存时间: 2026/09/17 09:14

# iMINDBench:颅内脑电图多机构神经解码基准测试
来源:https://arxiv.org/html/2609.18104
Geeling Chau¹ Saba Hashemi² Yonghyeon Gwon³ Eshani Patel¹,⁴ Jan DeWitt⁵ Christopher Wang⁵ Andrii Zahorodnii⁵ Sabera J. Talukder¹ Danny Dongyeop Han³ Chun Kee Chung³ Maryam M. Shanechi² Yisong Yue¹
¹加州理工学院 ²南加州大学 ³首尔国立大学 ⁴卡内基梅隆大学 ⁵麻省理工学院
††通讯作者:[email protected] ††同等贡献

###### 摘要

颅内脑电图(iEEG)被广泛用于直接记录大脑内部电极的电活动,这使其成为神经解码的一种极具吸引力的模态。然而,iEEG解码的进展,尤其是面向通用基础模型的进展,仍然难以可靠地衡量:数据集通常是特定任务或特定机构的,这限制了跨任务和记录环境泛化的证据,且预处理选择会强烈影响性能,使得模型改进难以与预处理增益区分开来。因此,我们推出了iMINDBench,这是一个颅内脑电图多机构神经解码基准测试,它在一个共享的、包含十五个解码任务的套件上对模型进行评估,该套件基于三个自然主义电影观看数据集。该基准测试还定义了标准化的预处理轨迹和固定的评估划分,以支持一致的模型比较。使用iMINDBench,我们发现评估的预训练系统在其各自的预处理轨迹内通常优于基线,而强大的频谱基线在跨机构数据集上仍具有竞争力。在我们的规模研究中,添加来自其他受试者或机构的多达25倍的监督数据,与会话内训练相比,仅带来微小或任务依赖性的增益。总的来说,这些发现强调了需要改进强大预处理基线的iEEG模型,并更有效地利用跨受试者和机构的数据。项目网站:https://imindbench.github.io/

## 1 引言

神经解码旨在寻找能够跨受试者、机构和记录条件泛化的模型,同时只需要最少的患者特定校准。颅内脑电图(iEEG)是实现这一目标的极具吸引力的设置,因为它能以高时间分辨率直接记录来自人脑内部电极的神经活动。然而,iEEG解码的进展仍然难以评估,因为现有研究不仅在数据集和任务选择上存在差异,在预处理流程和划分构建上也常有不同。因此,表面上的基准改进可能反映的是评估设置的变化,而非神经建模本身的进步。

现有的资源解决了这一问题的重要部分。多机构iEEG基准测试,如Omni-iEEG [1] 和Mayo/FNUSA [2],证明了临床记录可以在不同站点之间统一,但主要关注癫痫发作、病理、高频振荡或相关的癫痫学任务。自然主义解码资源,如Neuroprobe [3]、Brain Treebank [4]和AJILE12 [5],提供了可解释的自然主义解码任务,但评估通常仅限于单一数据集或机构设置。当前的模型在神经输入表示和预处理流程上也各不相同,使得改进难以与评估设置的变化区分开来。

因此,我们推出了iMINDBench,这是一个颅内脑电图多机构神经解码基准测试,涵盖来自三个机构的自然主义电影观看数据集的十五个语言、听觉和视觉解码任务。该基准测试使用固定的评估划分和指定的预处理轨迹,评估范围涵盖规模领域和单元可解性子集。结果按数据集和预处理轨迹分别报告,以揭示模型性能在不同机构和输入表示之间的变化。

该基准测试揭示了这些控制为何重要。首先,评估的预训练系统在主要单元上,于其各自的预处理轨迹内通常优于非预训练基线。然而,强大的多分辨率短时傅里叶变换(Multi-STFT)基线在跨机构数据集上与预训练系统相比仍具有竞争力。这些基线为开发学习到的表征提供了参考点,这些表征应匹配或超越工程化频谱特征在跨机构场景中的优势。其次,通过在不同机构之间对齐任务和神经信号元数据,该基准测试使我们能够检验模型是否受益于同一任务上的额外受试者和机构。在我们的规模研究中,添加来自同一数据集的其他受试者总体上是有益的,尽管增益仍小于来自额外目标会话数据的增益。添加来自其他数据集和机构的数据产生更弱且更依赖任务的改进。这些结果凸显了将更广泛的监督转化为目标会话解码可靠改进的难度。

通过支持这两种互补的评估,iMINDBench能够在任务、机构和预处理轨迹之间对通用iEEG模型进行更系统的评估,有助于识别其优势在哪些方面是通用的,在哪些方面仍局限于评估设置。

#### 贡献.

- • 基准测试制品。我们推出了一个跨机构iEEG解码基准测试,涵盖三个独立收集的电影观看数据集和十五个对齐的解码任务。
- • 评估契约。iMINDBench定义了固定的划分、可解性子集、标准化的Multi-STFT和波形预处理轨迹,以及监督训练规模领域。
- • 基准测试发现。强大的频谱基线与预训练系统相比仍具有竞争力,为学习到的表征提供了参考点。在我们的规模研究中,更广泛的监督微调带来的收益有限且依赖任务,这推动了能从异质神经数据中更有效学习的模型。

## 2 相关工作

#### 数据集和基准测试.

颅内脑电图因其能在行为过程中以高时间分辨率记录人类神经活动,对于自然主义神经解码极具吸引力,但临床记录稀疏、非均匀且具有机构特异性 [6]。现有的iEEG基准测试涵盖了这一领域的重要部分。Mayo/FNUSA图表元素数据集 [2] 和Omni-iEEG [1] 表明多机构临床iEEG可以统一,但关注于癫痫发作、病理、高频振荡或相关的癫痫学目标。自然主义资源,如Brain Treebank [4]、Neuroprobe [3]、BYD [7]、Pippi [8] 和AJILE12 [5],提供了电影、语言、视听、运动或活动标签,但未能在一个评估协议中联合控制任务、机构和预处理的异质性。

尽管头皮脑电图基准测试(如MOABB [9] 和最近的脑电图基础模型评估 [10, 11])存在,但它们无法干净地迁移到iEEG:头皮脑电图是容积导电且带限的,而iEEG直接从皮层记录并保留了高频活动(约70–250 Hz),这对认知解码很重要 [6, 12]。此外,iEEG电极放置由临床决定而非固定,这打破了大多数脑电图流程和基础模型背后的标准化导联假设。这些差异使得颅内脑电图需要单独的基准测试框架。

#### 神经基础模型和预处理.

近年来电生理学基础模型使得共享评估变得越来越必要。iEEG模型,如BrainBERT [13]、Brant [14]、PopT [15]、BaRISTA [16]、MVPFormer [17] 和DIVER-1 [18],连同脑电图基础模型,如LaBraM [19] 和EEGPT [20],解决了规模、受试者变异性、通道不匹配、空间布局和低信噪比等问题。然而,它们的评估条件在波形输入、频谱图或超级图、学习到的token、冻结的嵌入、空间元数据、预训练语料库和划分单元等方面存在差异。最近的一篇脑电图基础模型综述认为评估仍然异质且有限 [10],一项广泛的EEG-FM基准测试发现,微调的基础模型在数据丰富的设置中表现良好,但在数据稀缺的情况下,通常并不明显优于紧凑的神经或经典解码器 [11]。该基准测试针对相应的iEEG问题:模型比较应在明确的任务、机构、划分和预处理规范内进行,当输入表示发生变化时,应重新运行匹配的基线。

## 3 基准测试设计

该基准测试旨在评估解码改进是否在机构、预处理轨迹和行为目标发生变化时,在共享评估设置下仍然有效。为支持这一点,iMINDBench在多个自然主义iEEG数据集之间标准化预处理和评估,同时揭示任务和机构间的性能差异。它还支持受控的规模实验,以检验额外的监督数据是否能改进跨会话、受试者和机构的解码。图1总结了该基准测试的工作流程,包括数据集、预处理轨迹、划分和解码领域。

请参见图注图1:多机构、多任务神经解码基准测试。该基准测试在三个机构之间对齐自然主义解码任务和患者元数据,并定义预处理轨迹、划分和解码领域。(a) 包含三个自然主义电影观看颅内脑电图(iEEG)数据集:Neuroprobe、Bang! You’re Dead (BYD) 和 Pippi。(b) iEEG神经记录通过明确的预处理轨迹进行处理,这些轨迹可能包括多分辨率短时傅里叶变换(Multi-STFT)、波形以及自定义预处理器,作为模型输入以解码语言、视觉和听觉任务类别。(c) 该基准测试定义了具有挑战性的时间划分、数据规模场景和单元可解性子集。### 3.1 数据集和任务

#### 数据集.

当前版本结合了Neuroprobe/Brain Treebank [3, 4]、Bang! You’re Dead (BYD) 电影观看数据集 [7] 和 Pippi [8]。与原始Neuroprobe基准测试相比,我们将Neuroprobe/Brain Treebank组件的评估限制在五个留出的受试者/会话单元,以便剩余的Brain Treebank记录可用于模型预训练,而不会与基准测试目标重叠。每个数据集包含在电影或视听刺激呈现期间采集的神经记录,但数据集在记录持续时间、电极覆盖范围、受试者/会话结构和机构实践方面存在差异。Neuroprobe/Brain Treebank提供较长的电影观看记录和相对较大的会话内训练集;BYD引入了不同的机构和刺激背景,记录较短且受试者/会话结构更明确;Pippi提供了一个较小的独立数据集,具有不同的电极覆盖范围和刺激统计特性。图2总结了由此产生的跨机构在数据集规模、电极覆盖范围和任务支持方面的变化。

请参见图注图2:数据集覆盖在不同机构和任务之间存在异质性。(a) 平均训练样本数量、主要受试者/会话-任务单元和每个受试者的电极数量。(b) 电极位置显示在相同数据集的左/下方坐标空间中。(c) 任务条形图报告每个对齐解码任务的主要受试者/会话-任务单元数量。
#### 统一化.

iMINDBench对齐了解码目标和电极元数据,以支持跨机构的比较。BYD和Pippi使用Neuroprobe/Brain Treebank的刺激特征提取流程,具有数据集特定的注释和时间对齐。可用的电极坐标和解剖标签被统一到共享的约定上。采集、电极布局和覆盖范围方面的差异仍然是评估设置的一部分。附录A描述了对齐程序并记录了源数据集的采集元数据。

#### 任务.

该基准测试包含十五个解码任务,遵循原始Neuroprobe任务定义 [3],涵盖语言、听觉和视觉领域。这些包括语音存在、句子起始、GPT-2意外度、音高、音量、光流、亮度和人脸计数解码。支持二分类和多分类标签模式;本文报告二分类结果。每个样本将一个1秒的神经窗口与一个刺激标签配对。连续注释通过在每个会话内对比低值和高值范围进行二值化,而分类注释被映射为二值标签。完整的任务定义和数据集特定的标签构建细节见附录B。

### 3.2 划分和领域

#### 划分.

我们遵循Neuroprobe的会话内两折划分程序,用于每个数据集-受试者/会话-任务组合,称为一个评估单元。在数据集上应用此程序可保持与Neuroprobe的兼容性,包括为Neuroprobe提交重用兼容的运行。在每一折内,训练、验证和测试样本来自电影中基本连续的部分。预处理统计量从训练划分中估计,并原封不动地应用于验证和测试数据。每个单元的最终分数是两折的平均值。

#### 规模领域.

规模领域在保持相同目标单元和评估划分的前提下,改变监督微调数据的来源。会话内仅使用目标会话数据,代表使用其校准标签适应新受试者/会话。会话内数据集添加来自同一数据集中其他受试者/会话单元的监督样本。多数据集进一步添加来自其他机构的监督样本。这些领域测试更广泛的监督是否能超越目标会话校准改进解码。

#### 单元可解性子集.

许多评估单元在当前基线下仍接近随机水平。这可能反映了在记录电极位置处任务相关信号较弱。

相似文章

BrainBench:面向全面脑电图理解的大型语言模型基准测试

arXiv cs.AI

BrainBench 是一个新的统一基准,用于评估大型语言模型在全面、指令条件下的脑电图理解能力,涵盖 17 个数据集、172 项任务和超过 4000 个真实数据实例。论文评估了 13 个 LLM 在两种执行范式下的表现,表明脑电图能力因模型和操作化方式而异。