基于小波图像变换和谱流匹配的功能磁共振时间序列生成用于脑疾病识别
摘要
本文提出DSFM,一种新颖的生成框架,利用小波分解和谱流匹配合成逼真的fMRI时间序列,用于脑疾病识别,解决了数据稀缺和非平稳性挑战。
arXiv:2605.30387v1 Announce Type: new
摘要:功能磁共振成像(fMRI)通过测量随时间变化的血氧水平依赖(BOLD)信号,提供对动态脑活动的无创访问。然而,fMRI采集的资源密集型特性限制了数据驱动脑分析模型所需高保真样本的可用性。虽然现代生成模型可以合成fMRI数据,但它们通常难以复制原始BOLD信号固有的非平稳性、复杂的时空动态和生理变化。为了应对这些挑战,我们提出了双谱流匹配(DSFM),一种新颖的fMRI生成框架,它将BOLD信号的双频表示与谱流匹配级联起来。具体来说,我们的框架首先通过离散小波变换(DWT)将BOLD信号转换为小波分解图,以捕获全局化的瞬态和多尺度变化,并投影到跨脑区和时间的离散余弦变换(DCT)空间,以利用低频主导BOLD系数的局部能量压缩。随后,训练一个谱流匹配模型来生成类条件余弦频率表示。生成的样本通过逆DCT和逆DWT操作重建,以恢复生理上合理的时间域BOLD信号。这种双变换方法施加了结构化的频率先验,并保留了关键的生理脑动力学。最终,我们通过改进的下游基于fMRI的脑网络分类证明了我们方法的有效性。代码可在 https://github.com/htew0001/DSFM.git 获取。
查看缓存全文
缓存时间: 2026/06/01 09:23
# 基于小波图像变换与频谱流匹配的功能MRI时间序列生成及其在脑疾病识别中的应用
来源:https://arxiv.org/html/2605.30387
Hwa Hui Tew¹, Junn Yong Loo¹∗, Fang Yu Leong¹, Julia K\. Lau¹, Ding Fan¹, Hernando Ombao³, Raphaël C\.\-W\. Phan¹, Chee Pin Tan², Chee\-Ming Ting¹
¹马来西亚蒙纳士大学信息技术学院
²马来西亚蒙纳士大学工程学院
³阿卜杜拉国王科技大学统计项目
\{hwa\.tew, loo\.junnyong, ting\.cheeming\}@monash\.edu
###### 摘要
功能磁共振成像(fMRI)通过测量随时间变化的血氧水平依赖(BOLD)信号,提供了一种非侵入性观察动态脑活动的手段。然而,fMRI采集的资源密集型特性限制了用于数据驱动的脑分析模型所需的高保真样本的可用性。尽管现代生成模型可以合成fMRI数据,但在复制原始BOLD信号固有的非平稳性、复杂的时空动态以及生理变化方面,它们通常仍面临挑战。为了解决这些问题,我们提出了双谱流匹配(Dual\-Spectral Flow Matching, DSFM),这是一个新颖的fMRI生成框架,它将BOLD信号的双频表示与频谱流匹配级联起来。具体来说,我们的框架首先通过离散小波变换(DWT)将BOLD信号转换为小波分解图,以捕获全局化的瞬态和多尺度变化;然后,在脑区和时间维度上,将其投影到离散余弦变换(DCT)空间,以利用低频主导BOLD系数的局部化能量压缩。随后,训练一个频谱流匹配模型来生成基于类别条件的余弦频率表示。生成的样本通过逆DCT和逆DWT操作重建,以恢复生理上可信的时域BOLD信号。这种双变换方法施加了结构化的频率先验,并保留了关键的生理脑动态。最终,我们通过改进的下游基于fMRI的脑网络分类,证明了我们方法的有效性。代码可在 https://github.com/htew0001/DSFM.git 获取。
## 1 引言
深度生成建模的最新进展在合成神经影像模态(Yap等人,2024 (https://arxiv.org/html/2605.30387#bib.bib16))的真实且多样化的变体方面显示出令人鼓舞的能力。在现有模态中,功能磁共振成像(fMRI)信号提供了一种非侵入性的神经元活动视图,对于诊断神经精神和神经发育障碍(Noman等人,2022 (https://arxiv.org/html/2605.30387#bib.bib19); 2024 (https://arxiv.org/html/2605.30387#bib.bib17))至关重要。然而,fMRI数据采集成本高昂,且产生的数据集有限,通常存在类别不平衡问题(Tew等人,2025b (https://arxiv.org/html/2605.30387#bib.bib57))。这些缺陷限制了数据驱动脑分析模型的泛化能力,最终影响了针对神经和精神疾病的计算机辅助临床工具的可靠性(Bollmann 和 Barth, 2021 (https://arxiv.org/html/2605.30387#bib.bib14); Ting等人,2022 (https://arxiv.org/html/2605.30387#bib.bib20))。为了应对这些挑战,研究者们探索了用于fMRI信号合成的生成模型,以支持数据增强和下游应用(Power等人,2014 (https://arxiv.org/html/2605.30387#bib.bib15); Tew等人,2025b (https://arxiv.org/html/2605.30387#bib.bib57))。
大多数现有方法直接在功能连接(FC)空间中生成脑连接,其中BOLD信号的依赖关系由一个单一的相关矩阵汇总(Biswal 和 Uddin, 2025 (https://arxiv.org/html/2605.30387#bib.bib6))。例如,Tan等人(2024b (https://arxiv.org/html/2605.30387#bib.bib7))提出了一种DCGAN,它保留了连接组结构并提高了下游FC分类器的性能。类似地,BrainFC\-CGAN联合训练对抗损失和监督损失组件,以在合成样本上保留真实FC的受试者身份(Tan等人,2024a (https://arxiv.org/html/2605.30387#bib.bib8))。然而,这种FC表示将静态的成对关系编码为二元组,未能有效捕捉人脑网络内的瞬态网络状态(Shabestari等人,2025 (https://arxiv.org/html/2605.30387#bib.bib4))。
最近的研究重新审视了fMRI的时域建模,将其作为基于相关性的功能连接(FC)的一种替代方案。Yuan 和 Qiao(2024 (https://arxiv.org/html/2605.30387#bib.bib45))设计了diffusion\-TS,一种用于fMRI时间序列数据生成的去噪扩散概率模型(DDPM),显示出比GAN和(变分自编码器)VAE类生成模型更强的鲁棒性。Hu等人(2024 (https://arxiv.org/html/2605.30387#bib.bib5))提出了FM\-TS,它通过流匹配框架加速了采样步骤,同时提供了高质量的合成样本。虽然这些方法将重点从传统的FC转向了时间序列数据生成,但它们对神经影像学任务的可行性和有效性在很大程度上仍未得到探索。我们认为,将生成建模限制在FC矩阵或原始时间序列上,不足以忠实地再现大脑的瞬态状态、多尺度振荡和跨频率交互,因为难以分离出由生理驱动的波动(例如,心脏搏动、呼吸周期、运动伪影)(Biswal 和 Uddin, 2025 (https://arxiv.org/html/2605.30387#bib.bib6))。相比之下,一种捕获时间和频谱BOLD信息的时频/尺度表示可以完整地再现BOLD信号丰富的时空动态。受T2I\-Diff和ImagenTime的启发,两者都将时间序列信号视为图像生成任务(Tew等人,2025b (https://arxiv.org/html/2605.30387#bib.bib57); Naiman等人,2024 (https://arxiv.org/html/2605.30387#bib.bib56))。T2I\-Diff特别地重新建模并验证了这种基于时频图像的方法用于生成BOLD信号的可行性。至关重要的是,由于使用了固定分辨率的短时傅里叶变换(STFT)表示,性能提升有限,因为STFT忽略了精细的瞬态并衰减了频率幅度调制,导致在图像到信号的重建过程中出现伪影(Tew等人,2025b (https://arxiv.org/html/2605.30387#bib.bib57))。
为了解决这些问题,在本文中,我们提出了双谱流匹配(DSFM),这是一个fMRI生成框架,它级联了BOLD信号的两种频谱变换,并集成了频谱流匹配进行生成建模。我们的框架首先使用离散小波变换(DWT)分解BOLD信号,形成多分辨率的时间-尺度尺度谱图像。随后,我们计算离散余弦变换(DCT),以利用低频BOLD系数。这些变换产生了一个双谱视图,其中局部和全局动态被联合表示。此外,我们的框架引入了一种频谱域流匹配,用于基于受试者类别高效且高保真地生成时间-尺度fMRI尺度谱。生成的时频尺度谱随后通过图像到时间序列的变换还原为BOLD信号。我们的主要贡献总结如下:
1. 我们提出的DSFM框架首次联合利用了DWT和DCT,形成了一个统一的**双谱图像变换**,以捕获fMRI BOLD信号生成和脑部疾病分类所需的全局和局部时空及频谱特征。
2. 我们开发了一种**频谱流匹配**来模拟DCT域中的热耗散过程,以实现高效、由粗到细的生成,并与双谱表示的频率层次对齐。这使得DSFM能够利用fMRI信号中固有的频谱稀疏性来有效捕获多样的大脑特征。
3. 我们的结果表明,DSFM在无条件和有条件的频谱图像合成上表现出强劲的性能,并且与最近的时间序列和fMRI生成基线相比,在脑部疾病分类方面取得了改进。
参见图注:图1: DSFM的流水线。首先提取基于ROI的BOLD时间序列,然后进行基于DWT的多分辨率分解和分块2D DCT用于局部频谱编码。使用U\-ViT对DCT域中的速度场进行建模,用于基于ODE的采样。重建的信号(通过IDCT和IDWT)随后用于数据增强、FC矩阵构建和分类。最后,评估保真度和下游性能。
## 2 方法
### 2\.1 离散小波变换及其逆变换
图1 (https://arxiv.org/html/2605.30387#S1.F1) 提供了我们提出框架的概览。给定来自 \(S\) 个受试者的高维fMRI信号,记为 \(\mathcal{X} = \{x_s\}_{s=1}^S\),其中每个受试者 \(x_s \in \mathbb{R}^{D \times T}\) 包含 \(D\) 个感兴趣区域(ROI),在 \(T\) 个时间点上记录,我们的目标是学习潜在的真实数据分布 \(p_{\text{data}}(\mathcal{X})\),并生成一个与真实数据在统计上不可区分的合成分布 \(p_\theta(\mathcal{X})\)。与仅在时域中运行的传统时间序列生成任务不同,我们的方法使用DWT将fMRI时间序列转换为时间-尺度图像,定义如下:
\[
W(k, j) = \sum_{n=1}^N x(n) \, \psi_{j,k}[n],
\tag{1}
\]
其中 \(x_s(n)\) 是局部时间索引 \(n \in \{1, 2, \dots, N\}\) 处的BOLD信号。这里,\(\psi_{j,k}[n] = 2^{-k/2} \psi[2^k n - j]\) 是二进小波基函数,其中尺度 \(k \in \{1, 2, \dots, \lfloor \log_2 N \rfloor\}\) 控制频率分辨率,平移索引 \(j \in \{1, 2, \dots, N/2^k\}\) 确定时间位置,均源自母小波 \(\psi_{j,k}[n]\)。为了构建小波分解图,我们将每个小波子带上采样到原始时间长度,并沿着尺度轴堆叠它们,形成一个多分辨率的小波分解图。从而形成一个完整的小波系数张量 \(W(i, j, k) \in \mathbb{R}^{D \times T_\psi \times C}\),其中 \(T_\psi = N/2^C\) 且 \(C = \lfloor \log_2 N \rfloor\),它捕获了fMRI BOLD信号中的低频趋势和高频瞬态。我们进一步执行分量归一化,以突显跨脑区和时间的高、低系数之间的差异。如图2 (https://arxiv.org/html/2605.30387#S2.F2) 所示,这使得时间序列信号能够表示为具有保留的频谱-时间特征的多通道图像。
为了从生成的尺度谱表示中重建原始信号,我们首先对第 \(i^{\text{th}}\) 个ROI的预测小波分量 \(\hat{W}^{(i)}(j, k) \in \mathbb{R}^{T \times C}\) 进行反归一化。然后根据对应的二进尺度对这些系数进行下采样,并计算逆DWT(IDWT)以获得fMRI BOLD信号,如下所示:
\[
\hat{x}(n) = \frac{1}{N} \sum_{k=1}^C \sum_{j=1}^T W^{(i)}(j, k) \, \psi_{j,k}[n].
\tag{2}
\]
最后,通过所有尺度上的近似分量和细节分量的层次组合来重建这些小波子带,以获得每个受试者的重建时域信号 \(\hat{x}_s\)。这个过程确保了原始fMRI BOLD信号固有的频谱-时间特征得到良好保留。
参见图注:图2: 原始(第1和3行)与合成的BOLD信号(第2和4行)以及生成的归一化尺度谱。我们的框架生成新的合成BOLD信号,而非相关矩阵或功能连接,其分布统计量与原始样本高度匹配。
### 2\.2 用于BOLD信号的离散余弦变换
为了提取低频自发BOLD系数的局部化能量压缩。我们将第 \(k^{\text{th}}\) 个小波尺度的每个子带图 \(\hat{W}^{(k)}(i, j) \in \mathbb{R}^{D \times T_\psi}\) 划分为大小为 \(B \times B\) 的非重叠2D块,得到一组块(图像块):
\[
W^{(k)} \equiv \left\{ W_p^{(k)}(x, y) \in \mathbb{R}^{B \times B} \right\}_{p=1}^P,
\tag{3}
\]
其中 \(P\) 是每个子带图像的块数,\(B\) 是块大小。然后通过2D II型DCT变换每个块,如下所示:
\[
\begin{aligned}
D^{(k)}(u, v) = \; & \alpha(u) \alpha(v) \sum_{x=1}^B \sum_{y=1}^B W^{(k)}(x, y) \cos\left[\frac{(2x+1)u\pi}{2B}\right] \cos\left[\frac{(2y+1)v\pi}{2B}\right],
\end{aligned}
\tag{4}
\]
其中,如果 \(u=0\),则 \(\alpha(u) = \sqrt{\frac{1}{B}}\),否则 \(\alpha(u) = \sqrt{\frac{2}{B}}\)。在每个尺度 \(k\) 处得到的 \(D^{(k)}(u, v) \in \mathbb{R}^{B \times B}\) 表示每个块内的DCT系数。
为了恢复完整的图像表示,我们对每个块 \(D^{(k)}(u, v)\) 应用逆2D DCT(IDCT)。通过以下逆变换重建信号块:
\[
\begin{aligned}
\hat{W}^{(k)}(x, y) = \; & \sum_{u=1}^B \sum_{v=1}^B \alpha(u) \alpha(v) D^{(k)}(u, v) \cos\left[\frac{(2x+1)u\pi}{2B}\right] \cos\left[\frac{(2y+1)v\pi}{2B}\right].
\end{aligned}
\tag{5}
\]
一旦所有块都变换回原始空间域,我们就拼接这些图像块以恢复完整的子带图。由于DCT应用于非重叠块,重建只需将逆变换后的块拼回到它们在子带图像中的原始位置。这种分块DCT在ROI\-时间空间中保留了局部化的低频结构,而高频分量可以选择性地截断以抑制噪声。由此产生的滤波子带集可以传回IDWT,以恢复时域fMRI BOLD信号 \(\hat{x}_s(n)\),确保全局和局部频谱特征得以保留。
### 2\.3 DCT域中的频谱流匹配
最近的研究实证表明,基于像素的扩散模型在频域中表现出近似的自回归行为(Dieleman, 2024 (https://arxiv.org/html/2605.30387#bib.bib22); Falck等人,2025 (https://arxiv.org/html/2605.30387#bib.bib24))。具体来说,扩散模型(Ho等人,2020 (https://arxiv.org/html/2605.30387#bib.bib26); Song等人,2021 (https://arxiv.org/html/2605.30387#bib.bib25))倾向于在前向过程早期消除高频分量,然后随着扩散时间步的推进逐步消除较低频率的分量。虽然先前的研究集中在傅里叶基上,但这个属性在DCT域中也成立(Skorokhodov等人,2025 (https://arxiv.org/html/2605.30387#bib.bib29); Ning等人,2025 (https://arxiv.o相似文章
FM-fMRI:基于事件条件流匹配的静息态到任务态fMRI时间序列合成
提出FM-fMRI,一种事件条件流匹配模型,能够从静息态fMRI合成任务fMRI时间序列,在Human Connectome Project和内部自闭症队列上实现了优于基线的频谱和连接一致性,并改进了下游自闭症分类性能。
WaveDiT: 面向高效3D脑MRI合成的分布感知小波流匹配
WaveDiT是一个条件流匹配框架,用于全分辨率3D脑MRI合成,在小波系数空间中运行,能够在标准GPU上高效生成,无需有损潜在压缩。它实现了与真实MRI分布及下游任务更好的对齐。
FlowLet: 基于小波流匹配的条件性3D脑MRI合成
FlowLet是一个条件生成框架,通过在可逆小波域中使用流匹配生成基于年龄条件的3D脑MRI,高效改善低代表性年龄组的脑龄预测准确性。
SDFlow:用于时间序列生成的相似性驱动流匹配
本文介绍了 SDFlow,这是一种用于时间序列生成的相似性驱动流匹配框架,旨在解决自回归模型中的暴露偏差问题。通过在冻结的 VQ 潜在空间中进行低秩流形分解,SDFlow 实现了最先进的性能并显著提升了推理速度。
NeuroSonic:基于条件流匹配的脑电图到语音重建
NeuroSonic 提出了一种条件流匹配框架,用于从脑电图信号重建连续语音。通过学习一个确定性的概率流速度场,解决了神经数据与声学数据之间的结构不匹配问题。在跨受试者基准测试中,相比现有的GAN、扩散和均值流基线,该方法在感知质量上取得了高达26.3%的提升。