MEL:用于fMRI翻译的坐标保持型EEG标记化
摘要
本文介绍了MEL,一个用于EEG到fMRI翻译的坐标保持型EEG标记化框架,通过显式建模血流动力学延迟和频谱空间动态,解决表示接口不匹配问题,并改善预测性能优于基线方法。
arXiv:2608.29304v1 Announce Type: new
摘要:将脑电图(EEG)转换为功能磁共振成像(fMRI)对于医学神经影像学、临床脑状态监测和多模态神经解码非常重要,因为它旨在从快速且易获取的电生理记录中推断空间组织的血流动力学活动。现有的EEG到fMRI研究主要追求更强的解码器,但问题也受到表示接口不匹配的限制:fMRI响应是延迟的、时间积分的且空间分布的,而通用的EEG编码经常纠缠时间滞后、通道身份和频带结构。我们提出多频段EEG潜在状态标记化(MEL),一个坐标保持的EEG表示框架,将每个目标fMRI响应锚定到其前序EEG历史,并组织成滞后-通道-频率神经状态标记。通过显式捕获血流动力学延迟和频谱空间动态,MEL将fMRI相关的EEG表示与容量控制的读出对齐,而不完全依赖模型缩放。在VU EEG-fMRI基准和外部Oddball数据上的实验表明,MEL改善了预测性能优于强大的NeuroBOLT基线。消融和控制实验进一步表明,增益来自结构化的EEG表示,而不是泄漏、捷径统计或解码器容量。
查看缓存全文
缓存时间: 2026/09/01 13:13
# MEL:用于fMRI翻译的坐标保持型EEG分词框架 来源:https://arxiv.org/html/2608.29304 ###### 摘要 将脑电图(EEG)翻译为功能性磁共振成像(fMRI)对医学神经影像学、临床脑状态监测和多模态神经解码具有重要意义,因为它旨在从快速可获取的电生理记录中推断空间组织的血流动力学活动。现有EEG-to-fMRI研究主要追求更强的解码器,但该问题也受限于表示接口不匹配:fMRI响应具有延迟性、时间整合性和空间分布性,而通用的EEG编码往往纠缠了时间滞后、通道身份和频带结构。我们提出多频带EEG潜在状态分词(Multi-band EEG Latent-state Tokenization, MEL),这是一种坐标保持的EEG表示框架,将每个目标fMRI响应锚定在其先前的EEG历史之上,并将其组织为滞后-通道-频率神经状态分词。通过显式捕获血流动力学延迟和谱空间动力学,MEL将与fMRI相关的EEG表示与容量受控的解码输出对齐,而非完全依赖模型扩展。在VU EEG-fMRI基准数据集和外部Oddball数据集上的实验表明,MEL相比强大的NeuroBOLT基线提升了预测性能。消融研究和对照实验进一步表明,这种提升源于结构化的EEG表示,而非数据泄露、捷径统计或解码器容量。 1北京师范大学-香港浸会大学联合国际学院 2香港大学 3北京大学 [email protected], [email protected], [email protected], [email protected], [email protected] ## 引言 EEG-to-fMRI翻译旨在根据脑电图(EEG)预测空间分布的血氧水平依赖(BOLD)响应。EEG提供毫秒级时间分辨率的电生理活动,而功能性磁共振成像(fMRI)则在皮层和皮层下区域提供更精细的空间定位。这两种模态之间的可靠映射可以支持多模态神经解码、脑状态监测以及大规模神经动力学的研究。然而,EEG-to-fMRI预测并非普通的跨模态回归。首先,时间点tt的BOLD活动反映的是前序时间窗口内累积的神经活动,而非瞬时的EEG采样(Logothetis等, 2001 (https://arxiv.org/html/2608.29304#bib.bib33); Buxton等, 1998 (https://arxiv.org/html/2608.29304#bib.bib4); Glover, 1999 (https://arxiv.org/html/2608.29304#bib.bib18))。其次,相关的电生理证据分布在各个电极上。第三,神经活动通过频率特异性的节律表达,其与BOLD的关系随状态和解剖区域而变化(Buzsáki和Draguhn, 2004 (https://arxiv.org/html/2608.29304#bib.bib5); Cohen, 2014 (https://arxiv.org/html/2608.29304#bib.bib8); Scheeringa等, 2011 (https://arxiv.org/html/2608.29304#bib.bib41))。因此,fMRI目标最好被看作是跨时间滞后、通道和频率坐标的结构化神经历史的结果。这就引出了核心问题:*为了保留解码延迟血流动力学响应所需的信息,电生理历史应以何种形式表示?*当这些因素被呈现而没有明确的目标相关语义时,解码器必须从有限的配对EEG-fMRI数据中推断它们的关系。因此,预测误差可能源于表示接口限制,而不仅仅是解码器容量不足。 (参见图注)图1:以表示为中心的视角看待ROI级别的EEG-to-fMRI预测。许多EEG编码隐式地建模滞后、通道和频率信息,而MEL在解码前将这些轴暴露为显式的目标相对坐标。先前的EEG-to-fMRI研究通过跨模态回归、电极图建模、基于Transformer的转码、预训练EEG编码器和体素生成等方法来处理这种映射(Calhas和Henriques, 2020 (https://arxiv.org/html/2608.29304#bib.bib6); Liu和Sajda, 2023 (https://arxiv.org/html/2608.29304#bib.bib32); Afrasiyabi等, 2025 (https://arxiv.org/html/2608.29304#bib.bib2); Calhas和Henriques, 2022 (https://arxiv.org/html/2608.29304#bib.bib7); Lanzino等, 2024 (https://arxiv.org/html/2608.29304#bib.bib27); Li等, 2024b (https://arxiv.org/html/2608.29304#bib.bib31); Roos等, 2025 (https://arxiv.org/html/2608.29304#bib.bib39); He等, 2025 (https://arxiv.org/html/2608.29304#bib.bib20); Yao等, 2025 (https://arxiv.org/html/2608.29304#bib.bib48))。这些方法显著增强了预测器的表达能力,可以建模时间、空间和谱依赖性。然而,滞后、通道和频率的目标相对含义通常是在网络内隐式学习得到的。同时,同步EEG-fMRI研究已确立了延迟的神经血管耦合以及频带限制的EEG活动与区域性BOLD波动之间的系统性关联(Goldman等, 2002 (https://arxiv.org/html/2608.29304#bib.bib19); Huster等, 2012 (https://arxiv.org/html/2608.29304#bib.bib22); Jorge等, 2014 (https://arxiv.org/html/2608.29304#bib.bib24); Philiastides等, 2021 (https://arxiv.org/html/2608.29304#bib.bib38))。 这种区分很重要,因为保留信息并不等同于将其以一种可从有限配对观测中可靠学习的形式暴露出来。一个展平的特征向量可能保留所有数值,同时让它们的生理关系保持隐式,而一个大型端到端解码器可能只能通过额外的容量和优化来恢复这些关系。我们则考虑表示本身是否可以使相关结构直接可访问。在这种视角下,一个有用的表示应满足两个经验标准。首先,其优势应在容量受控的解码输出下保持可见,而非完全依赖模型扩展。其次,当时间滞后、通道身份、频率语义与fMRI目标之间的对应关系被刻意破坏时,性能应下降。这些标准将表示假设转化为一个可直接检验的论断。 为检验这一假设,我们提出MEL(多频带EEG潜在状态分词),这是一种坐标保持的EEG表示框架。对于每个目标fMRI响应,MEL锚定先前的EEG历史,将其划分为时间滞后分箱,计算通道维度的典型频带功率,应用仅训练阶段的校准,并构建滞后-通道-频率分词。由此产生的表示可以使用岭回归或紧凑的多层感知机进行解码。MEL并非声称EEG频带功率或滞后谱分析本身是新的。相反,它将这些经典测量组织成一个显式的目标锚定坐标系,而非时间压缩摘要或坐标语义被隐式处理的编码。 MEL预计在预测依赖于扩展神经历史上的分布式多通道和多频带活动时特别有用。初级感觉ROI可能已经通过强大的预训练编码器得到了有效表示,因为它们的响应可能相对局部化或与刺激相关联。相反,高级认知、皮层下和全局目标可能更强烈地依赖于跨时间的分布式神经状态动力学。我们将这种解剖模式视为经验预期,而非普遍的生理假设。 **贡献**。我们的主要贡献包括: - •我们将ROI级别的EEG-to-fMRI预测形式化为一个*表示接口问题*,其动机源于EEG-fMRI耦合的延迟、分布和振荡特性。 - •我们引入MEL,一种确定性的坐标保持分词框架,它将目标前的EEG历史组织为训练校准的滞后-通道-频率坐标,供下游解码使用。 - •我们在扫描内、严格的留一被试外和外部数据集设置下评估MEL,并结合容量受控的解码输出、对应关系破坏对照、以及时间和谱消融研究,以表征该表示何时以及为何有效。 ## 方法 ### 概述 MEL被设计为表示接口,而非高容量预测器。给定目标fMRI响应yt,MEL锚定先前的EEG段Et−H:t,将其划分为滞后分箱,保留通道身份,提取典型频带功率坐标,应用仅训练阶段的校准,并将结果分词立方体向量化,用于容量受控的ROI响应解码。频带功率被用作稳定的生理测量;方法论的对象是任务锚定的坐标系,该坐标系保留了EEG证据发生的时间、记录位置以及其所属的振荡成分。 (参见图注)图2:MEL的总体框架。该方法将每个fMRI目标锚定到其先前的EEG历史,通过仅训练阶段的校准频带功率提取构建滞后-通道-频率分词,并使用容量受控的解码输出将所得表示解码为ROI响应。 ### 任务锚定 令E∈RT×C表示具有T个时间样本和C个通道的EEG记录。令yt∈RR为目标时间点t的fMRI ROI响应,其中R是目标ROI的数量。MEL通过将目标锚定到先前的EEG历史窗口来形成每个监督样本: St=(Et−H:t,R,yt), (1) 其中H表示EEG历史长度,R是ROI集合。此锚定步骤很重要,因为EEG-to-fMRI预测不是同步映射。它明确编码了y_t依赖于延迟的EEG历史这一假设。 ### 滞后-通道网格 EEG历史Et−H:t被划分为一组时间滞后分箱L={l1,...,lL}。对于每个通道c和滞后箱ℓ,MEL提取一个局部EEG段: gc,l=Et−l−Δ:t−l,c, (2) 其中Δ是分箱持续时间。由此产生的滞后-通道网格为 Gt={gc,l}c=1,l=1C,L∈RC×L。 (3) 与通用序列块不同,此网格保留了通道身份以及相对于fMRI目标的时间延迟。 ### 频带功率分词构建 对于每个滞后-通道段gc,l,MEL在典型EEG频带B={δ,θ,α,β,γ}上计算频带功率。令φf表示频带f的频率支持。频带分词为: xc,l,f=log(1+1|Il|∑τ∈Il[Bf(Ec)(τ)]2), (4) 其中Bf(⋅)表示第f个典型EEG频带的带通滤波算子,Ec表示通道c的目标前EEG历史,Il表示属于滞后箱ℓ的样本。 完整的MEL分词立方体为: Xt=ΦMEL(Gt),[Xt]c,l,f=xc,l,f, (5) Xt∈RC×L×F。 这里F=|B|,每个元素xc,l,f是由一个EEG通道、一个血流动力学滞后箱和一个频带索引的坐标感知神经状态分词。 **算法 1 MEL分词与ROI响应解码** 0:EEG记录 E, 目标时间 t, ROI集合 R, 历史长度 H, 滞后分箱 L, 频带 B, 训练统计量 μtr, σtr 0:预测的ROI响应 ŷt 1:锚定目标样本 St=(Et−H:t,R,yt) 2:将 Et−H:t划分为滞后-通道段 {gc,l}c=1,l=1C,L 3:初始化校准分词立方体 X̃t∈RC×L×F 4:对于每个坐标三元组 (c,l,f)∈{1,...,C}×L×B 5:提取段 gc,l并应用带通算子 Bf 6:根据频带功率定义计算对数频带功率分词 xc,l,f 7:校准分词 x̃c,l,f=(xc,l,f−μc,l,ftr)/(σc,l,ftr+ε) 8:存储 [X̃t]c,l,f←x̃c,l,f 9:结束循环 10:按固定顺序向量化分词 xtflat=vec(X̃t) 11:解码ROI响应 ŷt=gθ(xtflat) 12:返回 ŷt ### 仅训练阶段校准 为避免泄露,归一化统计量仅从训练集估计。令μc,l,ftr和σc,l,ftr表示每个MEL坐标的训练集均值和标准差。归一化分词为: x̃c,l,f=xc,l,f−μc,l,ftrσc,l,ftr+ε。 (6) 这产生了校准的分词立方体X̃t。所有验证、测试和外部样本都使用相同的训练集统计量进行转换。 ### ROI响应解码 MEL与模型无关。校准后,分词立方体按固定坐标顺序向量化: xtflat=vec(X̃t)∈RCLF。 (7) 预测的ROI响应为: ŷt=gθ(xtflat)。 (8) 我们评估岭回归和紧凑的多层感知机(MLP)解码输出。岭回归求解: min∑tW,b‖yt−Wxtflat−b‖22+λ‖W‖22, (9) 而MLP解码输出使用紧凑的非线性映射。由于解码输出是容量受控的,强劲的性能表明MEL在解码器之前暴露了预测结构,而非仅仅依赖大型模型容量。 ### 算法特性 MEL被有意设计为确定性的表示算法。算法1概述了执行此分词过程所需的详细步骤。它并非引入新的优化目标,而是改变了EEG历史呈现给解码器的坐标系。这为EEG-to-fMRI预测提供了两个有用的特性,并解释了该算法为何在不同解码输出选择中保持稳定。 **命题1(坐标保持)**。给定固定的滞后集L、通道集C、频带组B以及向量化顺序,MEL定义了一个确定性映射 ΦMEL:Et−H:t↦X̃t∈RC×L×F。 (10)
相似文章
在慢速fMRI上微调语言编码模型提升对快速ECoG的预测
本文表明,尽管fMRI的时间分辨率较低,但在fMRI数据上微调语言编码模型能提升其对ECoG记录中神经活动的预测能力。研究结果表明,丰富的'慢速'fMRI数据可以增强针对'快速'ECoG数据的模型。
基于语义对齐的连续潜变量预测建模用于脑电-语言基础模型
该论文提出了BLPM,一种脑电-语言基础模型,利用连续潜变量预测建模和语义对齐将脑电信号映射到文本嵌入,在多样任务和数据集上实现了可泛化的神经解码。
面向脑功能连接表征学习的网络感知双线性分词方法
NERVE提出了一种网络感知的双线性分词方法,用于基于掩码自编码器的脑功能连接矩阵自监督学习,改善跨发育队列的表征学习。
超越扁平化令牌:基于可重用TriDim模块的结构保留EEG解码
本文提出了TriDim,一种用于EEG解码的可重用模块,它能保留空间和时间结构,在多个数据集上实现最先进的性能,并改进现有模型。
EEG基础模型中的身份陷阱:诊断性审计
本文识别并诊断了EEG基础模型中的“身份陷阱”,即高准确率可能源于受试者身份特征而非真实的临床生物标志物。它提出了FMScope,一种冻结表示协议以分离这些信号,并证明了受试者身份混杂在三模型中普遍存在且可通过线性方法移除。