MnemoDyn: 从40K fMRI序列中学习静息状态动力学

arXiv cs.LG 论文

摘要

MnemoDyn是一个基于动力系统的模型,在40K fMRI序列上训练,用于学习静息状态动力学,在重建质量上优于基于Transformer的方法,并在多样化人群中泛化良好。

arXiv:2608.23936v1 公告类型:新 摘要:我们提出一个基于动力系统的静息状态功能磁共振成像(rs-fMRI)模型,该模型在约40K个rs-fMRI序列的数据集上训练,覆盖了各种公开和可授权访问的数据集。虽然大多数现有方案使用Transformer骨干网络,但我们利用多分辨率时间建模来捕捉分区脑区间的动力学。我们展示MnemoDyn计算效率高,并在多样化人群和扫描协议中泛化能力很强。当与当前最先进的基于Transformer的方法进行基准测试时,MnemoDyn始终提供更优的重建质量。总体而言,我们发现通过这种大规模在(非专有)rs-fMRI数据集上的预训练,我们得到了一个高性能模型,适用于各种下游任务。我们的结果还为模型在小样本研究中的有效性提供了证据,这对于神经影像学研究具有广泛意义,因为静息状态fMRI是常用的成像模态。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:29

# 从40K FMRI序列学习静息态动态特征  
来源:https://arxiv.org/html/2608.23936  
Sourav Pal¹、Viet Luong¹、Hoseok Lee²、Tingting Dan³、Guorong Wu³、Richard Davidson¹、Won Hwa Kim²、Vikas Singh¹  
¹威斯康星大学麦迪逊分校,美国麦迪逊  
²浦项科技大学(POSTECH),韩国浦项  
³北卡罗来纳大学教堂山分校,美国教堂山  
{spal9, vhluong, rjdavids}@wisc.edu  
{hslee0608, wonhwa}@postech.ac.kr  
[email protected]  
{Tingting_Dan, guorong_wu}@med.unc.edu  

###### 摘要  
我们提出了一种基于动态系统的静息态功能磁共振成像(rs-fMRI)模型,训练于包含约40K rs-fMRI序列的大规模数据集,涵盖多种公开及需授权使用的数据资源。与当前多数基于Transformer的架构不同,我们采用多分辨率时序建模方法来捕捉脑区间的动态特征。实验表明,MnemoDyn具有计算高效性,并在不同人群和扫描协议间展现出优异的泛化能力。与当前最先进的Transformer方法相比,MnemoDyn在重建质量上持续表现更优。总体而言,通过在大规模(非专有)rs-fMRI数据集上进行预训练,我们获得了一个在多种下游任务中表现优异的模型。研究结果还证明了该模型在小样本研究中的有效性,这对神经影像学研究具有重要意义,因为静息态fMRI是常用的成像模态之一。  

## 1 引言  
理解静息态血流动力学信号背后的潜在动态特征,对于手术规划、癫痫灶定位以及推动更广泛的神经科学研究至关重要(Deco等人,2011;Friston,2011)。静息态功能磁共振成像(rs-fMRI)等模态可提供编码丰富神经过程的时间信号(Smith等人,2013)。一个重要目标是建立能够捕捉这些信号空间和时间结构的模型(Breakspear,2004),并支持跨个体、机构/站点及协议的统计分组检验与预测(Yamashita等人,2019)。实现此目标需要可复现的模型,能够从大规模神经影像数据中学习表征。近年来,基础模型(Foundation models)的发展(Bommasani等人,2021)为此提供了新思路。例如,这类模型最初为自然语言处理设计,后已扩展到视觉(Dosovitskiy等人,2020)、机器人(Brohan等人,2022)及其他领域(Radova等人,2025;Wang等人,2025)。  

大多数基础模型的共同特点是采用基于注意力的架构——最突出的是Transformer模块,它通过自注意力机制实现灵活的上下文建模。语言模型(Brown等人,2020;Chowdhery等人,2023)在大多数自然语言任务中表现优异,因此基于Transformer的架构也被扩展到序列建模问题,包括时间序列数据(Zhou等人,2021;Liu等人,2023;Chen等人,2025)。  

**替代方案的动机**  
Transformer模型为构建fMRI基础模型提供了良好起点。近期研究(Caro等人;Dong等人,2024)表明,基于注意力的模型能有效捕捉rs-fMRI序列中的时间依赖关系(Kim等人,2023),并很好地建模长程依赖。这类方法在计算资源充足、数据量大且采用标准采集协议(通常采集5-7分钟静息态数据)时效果良好(Birn等人,2013)。但探索替代方案仍有其必要性:  
1. 在睡眠研究和临床神经科学等新兴应用中(Yang等人,2024),常需处理更长采集数据(例如长达8小时的连续rs-fMRI数据)。从整夜fMRI中刻画rs-fMRI动态特征,需要在不显著增加计算量的前提下处理更长序列。  
2. 在实际常见小数据集场景中,更样本高效的架构将简化基础模型的微调数据需求。  
3. 计算/参数更高效的架构更易于在临床环境中部署。  

**图1:MnemoDyn框架概览**  
我们的rs-fMRI基础模型将时间信号视为潜在动态系统中的轨迹,该系统由可学习算子参数化。流程始于对大规模rs-fMRI队列的数据整理与预处理,将其转化为标准化的灰质坐标表示。预训练阶段通过学习多分辨率非线性动力学算子  
$$\frac{dz(t)}{dt}=f_{\theta}(z(t))$$  
使模型能捕捉跨尺度时间依赖,同时保留局部动态特征。微调阶段采用轻量级适配层,使预训练模型适应不同下游队列。所生成的表征支持在不同人群(年龄、性别、认知特征、神经退行性标志物等)中预测临床变量,凸显MnemoDyn从大规模动态建模向科学任务泛化的能力。  

**基于算子学习的动态建模**  
与基于注意力的序列建模不同,神经影像时间序列数据更适合寻求建模大脑活动潜在动态结构的方法。我们不必在原始信号空间或潜在空间学习自回归映射,而是尝试学习支配观测时间动态的底层算子。这种方法将大脑视为在高维潜在空间中生成轨迹,该空间由未知但可学习的动态系统支配。这至少部分符合神经科学对大脑活动源于复杂动态过程的理解(Deco等人,2011;Breakspear,2004;Sanz-Leon等人,2015)。近期状态空间模型(Gu等人)和liquid-FM(Hasani等人)的研究也凸显了受动态系统启发的序列建模策略的价值。  

我们的架构MnemoDyn学习演化算子,而非依赖自回归序列建模和隐式隐藏状态循环。具体而言,解(算子)将初始条件和输入映射到完整潜在轨迹,我们使用多分辨率小波基参数化演化核,部分灵感来自神经科学研究(D’Angelo & Jirsa,2022;Basar等人,1999)。这样,算子能在保持时间局部性的同时处理多时间尺度特征。小波与伪微分算子的相互作用产生高度稀疏表示(bey,1991),带来计算效率。  

**主要贡献**:  
1. (i) 我们提出了一种小波参数化的演化算子,无需注意力机制即可捕捉多尺度时间依赖,并能高效扩展到长序列。该设计消除了对位置嵌入或分词方案的依赖,这些方案通常复杂、领域依赖且对超参数敏感。  
2. (ii) 在多个rs-fMRI数据集的重建、分类和回归任务中,我们持续优于基于Transformer的最先进基线。  
3. (iii) 开源rs-fMRI基础模型:在40K rs-fMRI序列上训练的MnemoDyn将公开发布,供小型数据集使用和微调。  

我们的研究表明,基于多分辨率分析的算子模型为建模rs-fMRI数据相关动态提供了强大替代方案,可作为注意力密集型架构的补充。这些模型为数据驱动的、原理清晰且在资源受限环境中可部署的大脑动态发现开辟了新途径。  

## 2 大脑动态建模  
我们现在建立rs-fMRI信号潜在动态的建模框架。将时间血流动力学测量视为由潜在动态系统生成,该系统定义在观测神经信号的低维多尺度表示上。我们采用潜在动态系统(John等人,2022)框架建模演化,即分解观测信号为隐藏神经过程(McCormick等人,2022)和测量过程。令 $x(t):t \rightarrow \mathbb{R}^n$ 表示高维观测时间序列数据(如rs-fMRI)。用 $x_t \in \mathbb{R}^n$ 表示离散时间步 $t$ 的观测信号,其中 $n$ 是脑区数量(例如分区、体素或EEG通道数)。令 $z_t \in \mathbb{R}^d$ 表示潜在神经状态,假设其按某种(可能非线性的)动态演化。状态空间模型(Gu等人;Gu & Dao)的一般形式为:  

$$z_{t+1} = f(z_t, u_t; \theta) + w_t \quad \text{(潜在状态转移)}$$  
$$x_t = h(z_t; \phi) + v_t \quad \text{(观测模型)}$$  

其中 $u_t \in \mathbb{R}^m$ 是可选的外部输入(如刺激或任务),可设为零。这里,$f:\mathbb{R}^d \times \mathbb{R}^m \rightarrow \mathbb{R}^d$ 定义转移动态,参数为 $\theta$;$h:\mathbb{R}^d \rightarrow \mathbb{R}^n$ 是将潜在空间映射到观测的函数,参数为 $\phi$;$w_t \sim \mathcal{N}(0,Q)$ 和 $v_t \sim \mathcal{N}(0,R)$ 分别是潜在过程和观测噪声。  

**连续时间建模的优势**  
尽管离散时间状态空间模型广泛使用,但连续时间建模神经动态具有一些优势(Billings等人,2017)。大脑信号本质上是连续的,即使测量(如fMRI)在离散时间点获取。通过使用微分方程框架,我们寻求以连续形式更好地建模神经状态的时间演化。常微分方程(ODEs)(Hartman,2002)为编码平滑性、时间局部性以及已知结构约束(如反映生物物理先验的线性松弛、振荡成分或守恒定律)提供了原理性方法。这种连续时间视角为分析潜在神经过程演化带来了控制理论和算子学习的工具(Lee等人,2022;Cai等人,2021)。该策略还使我们能绕过基于注意力模型所需的分词和分块策略。  

**参数化ODE作为连续时间模型**  
我们将潜在状态 $\mathbf{z}(t) \in \mathbb{R}^d$ 视为由向量场 $F:\mathbb{R}^d \times \mathbb{R}^m \rightarrow \mathbb{R}^d$ 驱动的常微分方程(ODE)演化:  

$$\frac{d\mathbf{z}(t)}{dt} = F(\mathbf{z}(t), \mathbf{u}(t); \theta), \quad \mathbf{z}(0) = \mathbf{z}_0$$  

其中 $\mathbf{u}(t) \in \mathbb{R}^m$ 表示可选外部控制或输入信号,$\theta$ 是支配动态的参数(Chen等人,2018;Finlay等人,2020)。从状态空间自然引出ODE框架,这看似受限,但后续将看到更通用的形式能通过积分算子很好地处理非马尔可夫动态。需注意 $f$ 和 $F$ 是不同的数学对象:一个是离散映射,另一个是微分算子,但它们紧密关联。$f$ 近似于 $F$ 定义的ODE的 $\Delta t$ 时间流。注意 $f$ 通常可通过对 $F$ 应用数值积分方案得到。例如,欧拉方法给出更新:  

$$\mathbf{z}_{t+1} \approx \mathbf{z}_t + \Delta t \cdot F(\mathbf{z}_t, \mathbf{u}_t), \quad \text{即} \quad f(\mathbf{z}_t, \mathbf{u}_t) = \mathbf{z}_t + \Delta t \cdot F(\mathbf{z}_t, \mathbf{u}_t)$$  

众所周知,离散时间动态 $f$ 可视为由 $F$ 生成的连续流的欧拉步近似。  

**从ODE到算子学习**  
连续时间框架将 $\mathbf{z}(\cdot)$ 视为合适函数空间(如 $C^1([0,T];\mathbb{R}^d)$)中的函数,并将演化建模为函数到函数的映射。具体而言,ODE (3) 的解 $\mathbf{z}(t)$ 可视为参数化非线性算子 $\mathcal{T}_{\theta}$ 作用于函数空间的输出(Boullé & Townsend,2024;Subedi & Tewari,2025):  

$$\mathcal{T}_{\theta}:\left(\mathbf{z}_0, \mathbf{u}(\cdot)\right) \mapsto \mathbf{z}(\cdot)$$  

它将初始状态和控制函数映射到完整潜在轨迹。$\mathcal{T}_{\theta}$ 表示由向量场 $F$ 在初始条件 $\mathbf{z}(0)=\mathbf{z}_0$ 下诱导的流算子,$\theta$ 为参数。连续时间的观测模型通常为:  

$$\mathbf{x}(t) = H(\mathbf{z}(t); \phi) + \mathbf{v}(t)$$

相似文章

机械场网络:面向多变量系统的结构化神经动力学

arXiv cs.LG

本文介绍MF-Net,一种循环动力学模型,通过共享场状态表示多变量系统,并学习用于联合演化的机械转移。它在实现有竞争力的预测的同时,还能对学习到的关系进行可解释的结构化读取。