FM-fMRI:基于事件条件流匹配的静息态到任务态fMRI时间序列合成

arXiv cs.LG 论文

摘要

提出FM-fMRI,一种事件条件流匹配模型,能够从静息态fMRI合成任务fMRI时间序列,在Human Connectome Project和内部自闭症队列上实现了优于基线的频谱和连接一致性,并改进了下游自闭症分类性能。

arXiv:2605.26423v1 公告类型:新 摘要:基于任务的功能磁共振成像(task-fMRI)可直接反映任务诱发的神经动态,但其获取成本高昂且难以大规模采集,这促使了从广泛可用的静息态fMRI(rsfMRI)进行静息态到任务态的合成。我们提出了FM-fMRI,一种事件条件流匹配模型,该模型学习一个连续时间条件向量场,从而能够根据受试者的rsfMRI和任务事件信息生成任务ROI时间序列。该公式支持基于ODE的快速采样以及对异构事件计划的灵活条件控制。我们并未优化逐点重建,而是使用多种互补指标评估生成的信号,这些指标探讨时间与频谱结构、受试者与群体层面的连接组一致性以及分布对齐。在公开的Human Connectome Project和内部BioPoint自闭症队列上,FM-fMRI在频谱和连接一致性方面达到了最强结果,并在分布级匹配上优于条件扩散模型、生成对抗网络(GANs)和变分自编码器(VAEs)基线。此外,我们通过使用我们的方法合成任务fMRI ROI时间序列来扩充BioPoint队列,从而改进了下游自闭症分类,展示了在数据受限的临床环境中的实用价值。代码将在GitHub上发布。
查看原文
查看缓存全文

缓存时间: 2026/05/27 09:10

# FM-fMRI:基于事件条件流匹配的静息态到任务态fMRI时间序列合成
来源:https://arxiv.org/html/2605.26423
11生物医学工程系,22放射学与生物医学成像系,33电气工程系
耶鲁大学,纽黑文,康涅狄格州,美国
33email:camille\.duan@yale\.edu王继尧Nicha C\. Dvornek Junlin YangZiqi GaoLawrence H\. StaibJames S\. Duncan

###### 摘要

任务态fMRI可提供任务诱发神经动力学的直接读数,但获取成本高且难以大规模采集,这促使利用广泛可用的静息态fMRI(rsfMRI)进行静息态到任务态的合成。我们提出FM-fMRI,一个**事件条件流匹配**模型,该模型学习一个连续时间条件向量场,用于从受试者的rsfMRI和任务事件信息生成任务ROI时间序列。该公式支持基于ODE的快速采样以及异构事件调度的灵活条件。我们不是优化逐点重建,而是使用互补标准评估生成的信号,这些标准探测时间和频谱结构、受试者和组水平连接组一致性以及分布对齐。在公开的人类连接组项目和内部Biopoint自闭症队列上,FM-fMRI在频谱和连接组一致性方面取得了最强结果,并且在分布级别匹配上优于条件扩散、生成对抗网络(GAN)和变分自编码器(VAE)基线。此外,我们通过用我们的方法合成任务态fMRI ROI时间序列来增强Biopoint队列,改善了下游的自闭症分类,展示了在数据有限的临床环境中的实用价值。代码将在GitHub上提供。

## 1 引言

任务态功能磁共振成像(tfMRI)是量化大脑在受控认知和情感需求下如何重新配置的主要工具,它可以揭示疾病相关的改变和补偿动力学,从而比静息态fMRI(rsfMRI)支持更敏感地识别疾病[29][27]。然而,由于其严格的实验控制、更长的扫描时间和持续的受试者参与,tfMRI成本高昂且在操作上脆弱。这些限制使得tfMRI难以大规模采集,尤其在儿科、老年人和临床队列中更具挑战性。rsfMRI相对容易获取且广泛可用,这促使了静息态到任务态的生成,即从rsfMRI合成任务诱发的信号,以拓宽对任务状测量的访问,并在tfMRI稀缺时实现数据增强。

现有的静息态到任务态方法通常将静息连接映射到任务激活或对比图,最近的图神经网络、卷积架构和Transformer改善了预测性能[22,18,16,17,10]。然而,这些公式针对的是静态摘要而非ROI分辨的任务时间序列,并且它们的确定性目标倾向于回归到条件均值,低估了分布变异性和任务诱发的动态。基于GAN、VAE和扩散模型的通用多变量时间序列生成器可以产生随机样本[30,31,19,14],并且神经影像特异性变体已开始为临床预测添加任务对齐目标[11];然而,它们仍然难以用实验计划进行控制,并且很少受约束以保留fMRI结构(如低频频谱和功能连接)。需要一个生成框架,该框架原生支持结构化条件、高效采样和可微约束执行。流匹配和修正流通过学习连续时间向量场进行条件生成,解决了这一问题,实现了稳定训练和基于ODE的采样,并提供了直接处理来纳入结构化的、可微的约束[12,15,13]。尽管有这些优势,基于流的公式很少被探索用于静息态条件、时序控制的tfMRI时间序列合成,并带有显式的频谱和连接组约束。

我们提出FM-fMRI,一个**事件条件流匹配**框架,通过一个学习的连续时间条件向量场,从受试者的rsfMRI和实验计划时序合成任务诱发的ROI时间序列。我们的主要贡献有三方面:(1)用于静息态到任务态fMRI生成的事件条件流匹配公式;(2)优先评估神经生物学真实性,如频谱、连接组和分布级别有效性,包括恢复组水平连接结构,而非逐点重建;(3)在多个tfMRI任务上实现强大的合成性能,合成的任务信号在数据有限的临床环境中改善了下游学习。

## 2 方法

我们将静息态到任务态合成建模为给定静息态动态和实验时序的条件下生成任务诱发的ROI时间序列(图1),
\[
x_{\text{task}} \sim p_{\theta}(x_{\text{task}} \mid x_{\text{rest}}, e)
\]
其中\(x_{\text{task}} \in \mathbb{R}^{T \times V}\)表示具有V个区域和T个时间点的ROI时间序列,\(x_{\text{rest}}\)是静息态输入,\(e\)编码任务事件信息。

参见图注:图1:FM-fMRI概述。(A) 输入和编码器:静息态ROI时间序列被编码以参数化结构化的先验,事件信息被编码为事件标记;(B) 训练:我们通过交叉注意力学习事件调节的速度场,优化流匹配、连接和频谱感知目标。(C) 推断:通过积分学习的ODE合成任务时间序列轨迹。

**静息态编码器** 给定静息态输入\(x_{\text{rest}} \in \mathbb{R}^{T_{\text{rest}} \times V}\),我们使用基于补丁的Transformer编码器提取受试者特定的上下文嵌入\(c = f_{\text{enc}}(x_{\text{rest}})\)。一个预置的[CLS]标记聚合序列信息,其最终表示用作静息上下文。

**结构化先验** 我们没有使用从各向同性高斯噪声初始化的典型流匹配设置,而是学习一个受试者上下文依赖的结构化先验,专门针对fMRI信号:
\[
x_0 = \mu(c) + \sigma(c) \epsilon_{\text{colored}} + U(c)z \quad z \sim \mathcal{N}(0, I_K),
\]
其中\(\mu(c)\)和\(\sigma(c)\)是静息条件化的每ROI均值和标准差头,\(U(c) \in \mathbb{R}^{V \times K}\)是静息条件化的低秩空间因子,秩K=8,捕获结构化的跨ROI协方差。项\(\epsilon_{\text{colored}}\)是一个具有功率谱密度正比于1/f的时间模板,以更好地捕获fMRI信号的高低频功率[1]并稳定训练。

**任务fMRI事件标记** 任务事件信息源自FSL风格的事件时序文件[5],其中包含执行的任务类型s、时间持续时间d、刺激幅度a和任务开始时间o。对于第k个事件,我们将信息解析为元组\((o_k, d_k, a_k, s_k)\)。我们将\(o_k, d_k\)转换为TR单位(除以TR),并对\(a_k\)进行z评分。图1中的任务事件标记(e)嵌入为
\[
e_k = \phi_{\text{MLP}}([o_k, d_k, a_k]) + E_{\text{cond}}(s_k),
\]
其中\(\phi_{\text{MLP}}\)投影连续时序特征,\(E_{\text{cond}}\)是任务事件类型的可学习嵌入。

**事件条件交叉注意力** 为了允许实验结构的时间特异性调制,事件标记通过速度网络中的交叉注意力融入[25]。查询从当前状态的线性投影计算得出,\(Q = W_q x_t\),而键和值来自事件标记\(K = W_k e\),\(V = W_v e\)。注意力权重为\(A = \mathrm{softmax}\left(\frac{QK^\top}{\sqrt{d_{\text{ev}}}} + M\right)\),其中M掩码填充的事件。得到的事件上下文\(\mathrm{e}_{\text{ctx}} = AV\)与\(x_t\)、静息上下文c和时间嵌入拼接,然后预测速度。这使得每个时间点能够选择性地关注相关任务事件。

**条件流匹配** 我们使用流匹配训练条件速度场\(v_{\theta}(t, x_t, c, e)\)。给定先验样本\(x_0\)和真实任务信号\(x_1\),我们构建线性插值\(x_t = (1-t)x_0 + t x_1, \quad t \sim \mathcal{U}(0,1)\),目标速度为\(v^{*}(x_t, t) = x_1 - x_0\)。流匹配目标为
\[
\mathcal{L}_{\text{FM}} = \mathbb{E}_{t, x_0} \left[ \left\| v_{\theta}(t, x_t, c, e) - (x_1 - x_0) \right\|_2^2 \right].
\]
在实践中,\(v_{\theta}\)由一个轻量级MLP参数化,按时间点应用:我们拼接\(x_t\)、静息上下文c、可学习的时间嵌入\(\psi(t)\)和事件派生的上下文向量。

**连接和频谱感知目标** 我们添加辅助损失以保留神经生理结构,超越逐点保真度。对于功能连接(FC),让\(R_{ij}(x)\)表示ROI i和j之间的皮尔逊相关性;我们定义一个加权的FC损失,强调保留强的任务相关连接。
\[
\mathcal{L}_{\text{FC}} = \sum_{i<j} w_{ij} \left( R_{ij}(\hat{x}_1) - R_{ij}(x_1) \right)^2, \quad w_{ij} = |R_{ij}(x_1)|^2,
\]
对于频谱保真度,让\(P_i(f) = |\mathcal{F}(x_i)(f)|^2\)表示ROI i的功率谱;在生理相关频带\(\mathcal{B}\)(0.01–0.05 Hz)[33]上,我们使用
\[
\mathcal{L}_{\text{PSD}} = \sum_{i} \sum_{f \in \mathcal{B}} \left( \log P_i^{\hat{x}_1}(f) - \log P_i^{x_1}(f) \right)^2.
\]
总体训练目标为\(\mathcal{L} = \mathcal{L}_{\text{FM}} + \lambda_{\text{FC}} \mathcal{L}_{\text{FC}} + \lambda_{\text{PSD}} \mathcal{L}_{\text{PSD}}\)。

我们使用Adam(学习率\(1 \times 10^{-3}\);权重衰减\(1 \times 10^{-5}\))对所有模型优化50个epoch,批大小为16。在测试时,通过积分学习的ODE
\[
\frac{d\mathbf{x}}{dt} = v_{\boldsymbol{\theta}}(t, x, c, e)
\]
从t=0到1,使用显式Euler固定步长求解器,从学习的结构化先验\(x_0\)开始,得到\(x(1)\)作为合成的任务fMRI信号[2]。

## 3 实验与结果

**数据集与数据预处理** 我们用两个队列评估静息态到任务态合成,这两个队列涵盖了大规模规范fMRI和临床任务fMRI设置。对于人类连接组项目(HCP)[24],我们使用了1025名受试者,这些受试者具有配对rsfMRI和跨越七个范式的tfMRI。对于每个run,我们使用AAL图谱[23]提取区域平均BOLD时间序列,得到配对的静息输入和任务目标。对于FM-fMRI,我们额外利用任务时序文件,其中包含刺激开始、持续时间和条件信息。为了评估HCP之外的泛化能力,我们还在Biopoint队列[6](118名参与者;75名自闭症患者和43名对照)上进行了评估,使用Shen268图谱[20]提取ROI时间序列。对于两个数据集,我们使用受试者不重叠的分割:70%训练,15%验证,15%测试,以防止数据泄露。

表1:按指标分组的受试者水平生成性能。最佳值以粗体显示。
| 指标 | 模型 | Emotion | Gambling | Language | Motor | Relational | Social | WM |
|------|------|---------|----------|----------|-------|------------|--------|----|
| PSD ↓ | TimeGAN[30] | 2.0546 | 1.9923 | 1.9109 | 1.9390 | 1.9305 | 1.9179 | 1.9371 |
| | TimeVAE[21] | 2.0517 | 1.9721 | 1.8791 | 1.8829 | 1.8805 | 1.8560 | 1.9093 |
| | Diffusion-TS[31] | 4.0047 | 4.0942 | 3.9848 | 4.0620 | 3.9983 | 4.1018 | 3.9994 |
| | DDPM[4] | 1.7793 | 1.6921 | 1.5944 | 1.6350 | 1.6719 | 1.7894 | 1.4799 |
| | LSTM-GAN[32] | 2.1006 | 2.0959 | 1.9916 | 1.9727 | 2.0687 | 2.1236 | 1.8706 |
| | **FM-fMRI** | **1.6001** | **1.5399** | **1.4222** | **1.3634** | **1.4305** | **1.5601** | **1.3189** |
| 相似性FC ↑ | TimeGAN[30] | 0.2546 | 0.2229 | 0.2307 | 0.1723 | 0.2473 | 0.2630 | 0.2296 |
| | TimeVAE[21] | 0.2795 | 0.2653 | 0.2640 | 0.2433 | 0.2942 | 0.3078 | 0.2580 |
| | Diffusion-TS[31] | 0.0442 | 0.0168 | 0.0109 | 0.0026 | 0.0123 | 0.0078 | 0.0073 |
| | DDPM[4] | 0.2677 | 0.2618 | 0.2454 | 0.2429 | 0.2056 | 0.2087 | 0.2274 |
| | LSTM-GAN[32] | 0.2935 | 0.1432 | 0.2305 | 0.2439 | 0.2593 | 0.3399 | 0.1968 |
| | **FM-fMRI** | **0.5684** | **0.5455** | **0.5272** | **0.5302** | **0.5606** | **0.6046** | **0.5366** |
| cFID ↓ | TimeGAN[30] | 98.06 | 114.91 | 127.31 | 151.15 | 121.47 | 120.66 | 116.97 |
| | TimeVAE[21] | 105.62 | 116.22 | 129.48 | 154.58 | 127.17 | 123.59 | 118.43 |
| | Diffusion-TS[31] | 177.12 | 188.78 | 194.03 | 220.74 | 194.29 | 202.80 | 189.29 |
| | DDPM[4] | 35.69 | 41.16 | 39.59 | 44.66 | 40.43 | 46.80 | 48.78 |
| | LSTM-GAN[32] | 113.76 | 257.37 | 128.54 | 142.30 | 159.14 | 102.28 | 184.56 |
| | **FM-fMRI** | **24.13** | **130.67** | **237.50** | **35.57** | **29.82** | **30.76** | **39.97** |
| MAE ↓ | TimeGAN[30] | 0.7676 | 0.7658 | 0.7662 | 0.7702 | 0.7551 | 0.7527 | 0.7670 |
| | TimeVAE[21] | 0.7661 | 0.7620 | 0.7562 | 0.7532 | 0.7471 | 0.7431 | 0.7529 |
| | Diffusion-TS[31] | 0.9393 | 0.9382 | 0.9315 | 0.9445 | 0.9351 | 0.9392 | 0.9174 |
| | DDPM[4] | 0.8016 | 0.8005 | 0.8040 | 0.8019 | 0.8002 | 0.8029 | 0.8025 |
| | LSTM-GAN[32] | 0.7797 | 0.7904 | 0 |

相似文章

NeuroSonic:基于条件流匹配的脑电图到语音重建

arXiv cs.LG

NeuroSonic 提出了一种条件流匹配框架,用于从脑电图信号重建连续语音。通过学习一个确定性的概率流速度场,解决了神经数据与声学数据之间的结构不匹配问题。在跨受试者基准测试中,相比现有的GAN、扩散和均值流基线,该方法在感知质量上取得了高达26.3%的提升。

Recursive Flow Matching

Hugging Face Daily Papers

引入了 Recursive Flow Matching (RecFM),一种用于预测复杂时空动态的生成框架,以更少的步骤实现高保真度,并提高了准确性和速度,包括相比基于扩散的模拟器高达20倍的加速。

WaveDiT: 面向高效3D脑MRI合成的分布感知小波流匹配

Hugging Face Daily Papers

WaveDiT是一个条件流匹配框架,用于全分辨率3D脑MRI合成,在小波系数空间中运行,能够在标准GPU上高效生成,无需有损潜在压缩。它实现了与真实MRI分布及下游任务更好的对齐。