通过孪生自监督学习从fMRI中学习鲁棒且任务不变的功能表征
摘要
本文介绍了BrainSimSiam,一种轻量级自监督框架,利用孪生网络从仅正样本对中学习鲁棒的fMRI表征,即使在有限数据下也能在下游任务上取得强劲表现。
arXiv:2605.28990v1 公告类型: 新
摘要: 功能磁共振成像(fMRI)是研究人脑功能的有力工具。然而,数据采集成本高昂以及精神科评定量表固有的主观性,通常导致数据集样本量小且标签质量参差不齐,尤其在针对特定神经系统疾病时。加之fMRI数据固有的高维度,这些限制显著增加了模型过拟合的风险。近年来,通过合并多个数据集来开发fMRI基础模型的兴趣日益增长;然而,预训练和微调所需的计算资源往往令人望而却步。我们证明,一种轻量级自监督框架能够生成适用于各种不同下游任务的表征,其性能优于全监督基线模型,并接近大规模模型的性能。我们引入了BrainSimSiam,一种数据高效的自监督表征学习框架,利用仅正样本数据对来学习鲁棒且可泛化的特征。我们证明,所学表征在多个下游分类与回归任务上取得了强劲性能,突显了BrainSimSiam在数据受限的神经影像应用中的潜力。
查看缓存全文
缓存时间: 2026/05/29 09:14
# 通过孪生自监督学习从fMRI中学习鲁棒且任务不变的功能表征
来源:https://arxiv.org/html/2605.28990
Peiyu Duan, Nicha C. Dvornek, Lawrence H. Staib, Denis Sukhodolsky, Pamela Ventola, James S. Duncan
###### 摘要
功能磁共振成像(fMRI)是研究人脑功能的强大工具。然而,数据采集的高成本以及精神科评定量表固有的主观性,往往导致数据集样本量小且标签质量参差不齐,尤其是在针对特定神经疾病时。结合fMRI数据天然的高维特性,这些局限性显著增加了模型过拟合的风险。近年来,通过整合多个数据集来开发fMRI基础模型的兴趣日益增长;然而,预训练和微调所需的计算资源通常是难以承受的。我们证明,一个轻量级的自监督框架能够生成跨多种下游任务泛化的表征,其性能优于全监督基线,并接近大规模模型的水平。我们引入了BrainSimSiam,一个数据高效的自监督表征学习框架,它利用仅含正例的数据对来学习鲁棒且可泛化的特征。我们证明,所学表征在多个下游分类和回归任务上取得了强劲性能,突显了BrainSimSiam在数据有限的神经影像应用中的潜力。
###### 关键词:
ASD、对比学习、数据高效学习、fMRI、GNN
††期刊:医学影像分析
\[bme\]机构=生物医学工程系,地址=耶鲁大学,城市=纽黑文,州=CT,国家=美国
\[rad\]机构=放射学与生物医学影像,地址=耶鲁医学院,城市=纽黑文,州=CT,国家=美国
\[ee\]机构=电气工程,地址=耶鲁大学,城市=纽黑文,州=CT,国家=美国
\[csc\]机构=儿童研究中心,地址=耶鲁医学院,城市=纽黑文,州=CT,国家=美国
## 1 引言
通过深度学习与功能磁共振成像(fMRI)的整合,在理解阿尔茨海默病\[1 (https://arxiv.org/html/2605.28990#bib.bib22)\]、注意缺陷多动障碍(ADHD)\[3 (https://arxiv.org/html/2605.28990#bib.bib21)\]和自闭症谱系障碍(ASD)\[24 (https://arxiv.org/html/2605.28990#bib.bib15)\]等神经和精神疾病方面取得了显著进展。尽管这些疾病本质上是异质性的\[11 (https://arxiv.org/html/2605.28990#bib.bib25),13 (https://arxiv.org/html/2605.28990#bib.bib23),7 (https://arxiv.org/html/2605.28990#bib.bib24)\],大多数监督学习框架往往依赖二元分类标签。将多样的疾病亚型和健康对照(HC)简化为二元类别,可能会掩盖有意义的亚型差异,潜在地导致模型过拟合和可解释性降低。
此外,由于疾病严重程度的变异性以及评估中的人为因素,神经疾病的标签本身就包含噪声。虽然机器学习推动了医学影像领域的巨大进步,但模型通常仍然容易受到标签噪声的影响\[30 (https://arxiv.org/html/2605.28990#bib.bib6)\]。在监督学习设置中,即使采用强大的数据增强和正则化技术\[10 (https://arxiv.org/html/2605.28990#bib.bib18),24 (https://arxiv.org/html/2605.28990#bib.bib15)\],过拟合仍然可能产生扭曲的决策边界,限制模型的泛化能力。与标签无关的方法,尤其是无监督和自监督学习,为实现更鲁棒的表征学习和下游性能提供了一条有希望的途径。
针对fMRI分析,研究者已提出多种机器学习架构,涵盖监督\[10 (https://arxiv.org/html/2605.28990#bib.bib18),24 (https://arxiv.org/html/2605.28990#bib.bib15),36 (https://arxiv.org/html/2605.28990#bib.bib12)\]和自监督\[28 (https://arxiv.org/html/2605.28990#bib.bib10),38 (https://arxiv.org/html/2605.28990#bib.bib7),21 (https://arxiv.org/html/2605.28990#bib.bib13),37 (https://arxiv.org/html/2605.28990#bib.bib8),45 (https://arxiv.org/html/2605.28990#bib.bib48)\]范式。尽管架构多样,大多数方法在采集过程中,无论对于静息态还是任务态数据,都将fMRI视为一个同质的序列。近年来,越来越多的证据表明,与静息态fMRI数据相比,任务态fMRI提供了更丰富、更具行为学依据的信息\[17 (https://arxiv.org/html/2605.28990#bib.bib20),44 (https://arxiv.org/html/2605.28990#bib.bib19)\]。此外,由不同fMRI任务范式引起的功能变异产生了信息丰富的对比,可用于学习鲁棒的任务不变功能表征。对于数据有限的应用,将任务态fMRI序列截断为任务同质的子序列也增加了有效样本量。
在这项工作中,我们引入了脑部简单孪生表征学习(BrainSimSiam),这是一个轻量级且数据高效的自监督fMRI表征学习框架。在一个两阶段训练方案中,我们展示了预训练的BrainSimSiam编码器在下游应用的多层感知机(MLP)探查和端到端微调设置中,都能产生更鲁棒的判别模型。实验在分类和回归任务上进行,包括对生物和行为表型的预测。我们的贡献如下:
- 1. 我们开发了一个针对任务态fMRI的自监督表征学习框架,在检查的两个数据集上,其表现均优于监督和自监督基线。
- 2. 通过一个在训练和事后解释中应用的联合感兴趣区域(ROI)掩码方案,我们统一了体素级fMRI和基于图的功能视图。相同的机制通过将配准后的结构T1加权或弥散MRI与功能脑图结合,可以轻松支持多模态融合。
- 3. 我们利用不同任务刺激间的对比作为自然的增强手段,来学习任务不变表征,从而将诱发反应与自发脑动力分离开来。
## 2 相关工作
### 2.1 图神经网络(GNN)
GNN是一类处理图结构数据的神经网络家族\[20 (https://arxiv.org/html/2605.28990#bib.bib27),34 (https://arxiv.org/html/2605.28990#bib.bib29),15 (https://arxiv.org/html/2605.28990#bib.bib28)\]。在基于ROI的脑图中,节点对应于感兴趣区域,边编码功能或结构连接\[24 (https://arxiv.org/html/2605.28990#bib.bib15),36 (https://arxiv.org/html/2605.28990#bib.bib12),12 (https://arxiv.org/html/2605.28990#bib.bib16)\]。GNN通过迭代聚合每个节点邻居的信息进行学习。令\(h_i^k\)表示节点\(i\)在第\(k\)层的特征,\(\mathcal{N}(i)\)表示其邻居集合。GNN的通用消息传递更新可描述为:
\[
h_i^{k+1} = \phi\left(h_i^k, m_{ij, j \in \mathcal{N}(i)} \mid m_{ij} = \psi\big(h_i^k, h_j^k, e_{ij}\big)\right) \tag{1}
\]
其中\(\psi\)计算消息\(m\),\(e_{ij}\)是边属性,\(\phi\)产生更新后的节点表示。
### 2.2 简单孪生网络(SimSiam)
对比学习框架,如MoCo v2\[5 (https://arxiv.org/html/2605.28990#bib.bib30)\]和SimCLR\[4 (https://arxiv.org/html/2605.28990#bib.bib31)\],通过将同一样本的不同增强视图拉近,同时推开其他样本,来学习不变性。与监督预训练相比,它们对标签噪声和虚假相关性表现出更强的鲁棒性,但通常需要借助大批量或记忆队列来支持大量负样本。SimSiam\[6 (https://arxiv.org/html/2605.28990#bib.bib26)\]通过使用带有预测头的停止梯度孪生架构,消除了对负样本的需求,在自然图像应用中取得了具有竞争力的性能,且训练过程大幅简化。这一特性在神经影像设置中也具有优势,因为该设置中批次大小通常有限,依赖大量负样本集的对比方法在操作上脆弱。
虽然负样本可能提供信息,但在fMRI中定义可泛化的负样本颇具挑战。将不同受试者视为负样本预设了受试者间的不相似性,并丢弃了共享的功能模式。从任务标签构建负样本会使特征与标签空间纠缠,导致过度简化和任务束缚的表征,从而损害跨任务泛化能力。
因此,我们采用SimSiam\[6 (https://arxiv.org/html/2605.28990#bib.bib26)\]作为我们的fMRI表征学习框架,这是学习跨下游任务可泛化表征的更合适选择。
## 3 数据与预处理
### 3.1 人类连接组计划(HCP)数据集
我们使用WU–Minn人类连接组计划(HCP)S1200年轻成人发布版\[32 (https://arxiv.org/html/2605.28990#bib.bib1)\]的任务态fMRI扫描数据,包含七种任务范式:情感、赌博、语言、运动、关系、社会和工作记忆。所有图像均空间归一化到MNI152标准空间,并重采样为2 mm各向同性体素。在排除缺少任务运行或行为测量的受试者后,最终队列包括1,005名参与者(表1)。评估采用5折交叉验证,每折人数相等。
表1:HCP数据集中受试者的统计信息
### 3.2 Biopoint数据集
表2:Biopoint数据集中ASD和HC受试者的统计信息
参见图1:Biopoint数据集中生物运动和杂乱运动任务的示例
参见图2:模型架构。(a) 通用SimSiam框架。(b) BrainSimSiam编码器\(f\)。
Biopoint数据集\[18 (https://arxiv.org/html/2605.28990#bib.bib2)\]包含在一项ASD研究中获取的任务态fMRI,使用了12个点光源显示视频作为任务刺激。每个24秒的视频属于两类之一:描绘具有社会意义的人类动作的生物运动,以及具有随机点轨迹的杂乱运动(图1)。来自两个任务的视频在采集过程中以交替模块呈现,旨在突显自闭症儿童在感知生物运动方面的缺陷。
预处理遵循Yang等人\[42 (https://arxiv.org/html/2605.28990#bib.bib3)\]的方法,图像归一化到MNI152标准空间,并重采样为2 mm各向同性体素。数据集包括75名ASD儿童和43名年龄和认知能力匹配的健康对照(HC)。评估时,我们使用分层5折交叉验证,以保持每折中ASD/HC比例相近。对于每个受试者,我们将Biopoint fMRI序列截断为与12个视频刺激对齐的12个模块。每个24秒的模块在我们的表征学习实验中被视为一个独立任务。在表2中,我们展示了Biopoint数据集中受试者的生理性别和年龄统计信息。
参见图3:BrainSimSiam预训练及下游应用的流程
### 3.3 图构建与图像预处理
在HCP数据集中,每个任务实例对应一个完整的任务态fMRI运行。数据实例总数为\(7035 = 1005 \times 7\)。在Biopoint数据集中,由于样本量有限,我们将一个任务实例定义为在单个视频刺激期间获取的fMRI时间序列的每个不重叠滑动窗口子序列,从而得到\(1416 = 118 \times 12\)个数据实例。对于每个数据实例,我们推导出fMRI数据的两种互补视图,描述如下。
#### 3.3.1 功能脑图视图
对于功能脑图,每个fMRI序列使用Shen图谱(268个ROI)进行HCP数据集的分割,使用Desikan–Killiany图谱(84个ROI)进行Biopoint数据集的分割\[26 (https://arxiv.org/html/2605.28990#bib.bib5),8 (https://arxiv.org/html/2605.28990#bib.bib4)\]。按照Li等人\[24 (https://arxiv.org/html/2605.28990#bib.bib15)\]提出的脑图构建方法,我们计算ROI时间序列之间的皮尔逊相关和偏相关。节点特征定义为皮尔逊相关矩阵的对应行,而边保留为ROI之间偏相关系数绝对值中强度最高的5%。
#### 3.3.2 空间激活图像视图
3D图像输入通过对fMRI时间序列进行体素级时间平均获得,生成一个平均激活图作为强度分布。尽管只保留了时间平均后的强度,但3D平均图像计算快速且轻量。
虽然基于ROI的功能脑图已成功应用于fMRI分析\[24 (https://arxiv.org/html/2605.28990#bib.bib15),12 (https://arxiv.org/html/2605.28990#bib.bib16),36 (https://arxiv.org/html/2605.28990#bib.bib12)\],但它们主要编码区域间的相对连接,忽略了绝对信号强度。相比之下,时间平均的3D fMRI体积保留了体素级强度,提供了数据的互补空间视图。这种互补表征本身已成功应用于机器学习辅助的年龄预测和ASD分类等任务\[9 (https://arxiv.org/html/2605.28990#bib.bib35),23 (https://arxiv.org/html/2605.28990#bib.bib36)\]。在实际年龄预测等应用中,体素级特征也被证明优于粗粒度ROI输入\[14 (https://arxiv.org/html/2605.28990#bib.bib37),22 (https://arxiv.org/html/2605.28990#bib.bib38)\]。在我们的实验中,我们发现包含3D图像强度信息对于fMRI表征学习的性能至关重要。
## 4 方法
### 4.1 符号与问题定义
假设存在一个包含所有不同fMRI任务的任务集\(\mathcal{J}\)。对于来自受试者\(i\)和fMRI任务\(j \in \mathcal{J}\)的每个fMRI时间序列,我们生成一个ROI级功能脑图\(G_{i,j}\)和一个3D平均强度图像\(I_{i,j}\)。一个具有\(n\)个ROI的图拥有节点特征顶点集\(V_{i,j}\)和带权边的边集\(E_{i,j}\)。一个输入实例为:
\[
x_{i,j} = (I_{i,j},\, G_{i,j}), \quad G_{i,j} = (V_{i,j}, E_{i,j}).
\]
我们在预训练中的目标是学习一个编码器\(f: x \rightarrow \mathbb{R}^d\),将每个数据实例映射为一个紧凑的向量表征\(z_{i,j} \in \mathbb{R}^d\),
\[
z_{i,j} = f(x_{i,j}).
\]
对于下游分类和回归,我们在编码器\(f\)上附加一个目标特定的头部\(g\),编码器可以是冻结的或微调的,以学习到的表征\(z\)作为输入。令\(y_{i,k}\)表示受试者\(i\)在预测任务\(k\)上的目标特定标签,
\[
y_{i,k} = g_k(z_{i,j}) \quad \forall j \in \mathcal{J}.
\]
### 4.2 BrainSimSiam架构
图2a展示了通用SimSiam\[6 (https://arxiv.org/html/2605.28990#bib.bib26)\]框架。对于每个输入实例\(x\),我们采样两个增强视图\(x_1\)和\(x_2\)。共享的编码器\(f\)和预测器\(h\)将输入映射到学习到的表征\(z_1\)和\(z_2\)及其预测器输出\(p_1\)和\(p_2\)相似文章
元学习上下文学习实现无需训练的跨被试脑解码
# 论文页面 - 元学习上下文学习实现无需训练的跨被试脑解码 来源:[https://huggingface.co/papers/2604.08537](https://huggingface.co/papers/2604.08537) 作者:,,,,,,,,,,,,, ## 摘要 一种元优化方法通过少量图像-脑示例快速推断个体独特神经编码模式,无需跨被试及扫描仪微调,即可实现可泛化的语义视觉解码。[视觉解码](https://huggingface.co/papers?q
面向脑功能连接表征学习的网络感知双线性分词方法
NERVE提出了一种网络感知的双线性分词方法,用于基于掩码自编码器的脑功能连接矩阵自监督学习,改善跨发育队列的表征学习。
超越并行跟踪:交互式多特征融合驱动来自非侵入性脑记录的语义重建
本文介绍了一种用于非侵入性脑记录语义重建的多特征融合框架,通过交叉注意力机制结合静态词汇(Word2Vec)和动态上下文(GPT)表示,在脑到文本解码中取得了最先进的性能。
基于小波图像变换和谱流匹配的功能磁共振时间序列生成用于脑疾病识别
本文提出DSFM,一种新颖的生成框架,利用小波分解和谱流匹配合成逼真的fMRI时间序列,用于脑疾病识别,解决了数据稀缺和非平稳性挑战。
稀疏自编码器将大脑-LLM对齐映射到皮层语义拓扑
本文使用稀疏自编码器将大语言模型分解为可解释的特征,并表明语义特征能够解释大脑与皮层语义拓扑的对齐,且该结论在英语、中文和法语中均具有泛化性。