探索扩散变压器在多模态脑状态解码中的跨模态增强
摘要
本文提出了CoMA-DiT,一种用于多模态脑状态解码中潜在增强的双向跨模态扩散变压器,它通过将配对模态用作相互监督信号来增强听觉注意力解码和情感识别等任务的性能。
arXiv:2609.11341v1 公告类型:新
摘要:多模态脑状态解码主要集中在融合配对模态进行预测,但很少探索如何进一步利用它们的对应关系来丰富训练数据并改进多模态表示学习。为了解决这一差距,我们提出了CoMA-DiT,一种用于潜在增强的双向跨模态扩散变压器,它将配对模态视为相互生成监督源,而不仅仅是待融合的输入。CoMA-DiT通过跨模态注意力将速度预测条件化于配对模态,并通过可靠性门控残差机制自适应注入由此产生的变化。在多模态听觉注意力解码和情感识别上的实验表明,CoMA-DiT始终优于20个代表性基线,与无增强基线相比,在准确率和宏F1上分别实现了4.28%和6.70%的绝对提升。大量的消融、敏感性、可视化和可解释性分析进一步证明了其鲁棒性、泛化性和捕获功能相关跨模态交互的能力。这些发现支持了多模态学习的更广泛观点:配对模态不仅可以作为融合的输入,还可以作为相互增强的监督源。
查看缓存全文
缓存时间: 2026/09/12 08:27
# 探索扩散Transformer在多模态脑状态解码中的跨模态增强应用 来源:https://arxiv.org/html/2609.11341 ###### 摘要 多模态脑状态解码研究主要聚焦于融合配对模态进行预测,但鲜少探讨如何进一步利用其对应关系来丰富训练数据并提升多模态表征学习效果。为填补这一空白,我们提出了CoMA-DiT——一种用于潜在增强的双向跨模态扩散Transformer,它将配对模态视为相互生成监督的来源,而非仅仅作为待融合的输入。CoMA-DiT通过跨模态注意力将速度预测与配对模态条件化关联,并借助可靠性门控残差机制自适应地注入由此产生的变异性。在多模态听觉注意解码和情感识别任务上的实验表明,CoMA-DiT持续优于20个代表性基线方法,在准确率和宏观F1值上较无增强基线分别取得了4.28%和6.70%的绝对提升。大量的消融实验、敏感性分析、可视化分析和可解释性分析进一步验证了其鲁棒性、泛化能力以及捕捉功能性相关跨模态交互的能力。这些发现支持了更广泛的多模态学习视角:配对模态不仅可以作为融合的输入,也可以作为相互增强的监督来源。 1华中科技大学人工智能与自动化学院,中国 [email protected] ## 引言 多模态生理信号提供了关于认知与情感状态的互补信息,在诸如听觉注意解码(AAD)和情感识别(EMO)等脑状态解码任务中展现出巨大潜力。例如,脑电图(EEG)能以高时间分辨率捕捉神经活动,而眼电图(EOG)则反映了与注意、唤醒及情感相关的视觉反应。联合建模多模态信号可以提供比依赖单一模态更丰富的证据(Wang等人 2025b (https://arxiv.org/html/2609.11341#bib.bib53))。 图1:多模态学习方案比较。(a) 多模态融合将配对模态结合用于预测。(b) 单模态生成独立增强每个模态。(c) CoMA-DiT将每个模态作为主信号,其配对模态作为补充监督,生成跨模态增强的潜在表征。然而,大多数现有方法主要将配对生理信号视为待融合的输入,包括早期融合(Li等人 2020 (https://arxiv.org/html/2609.11341#bib.bib52))、中期融合(Yin等人 2026 (https://arxiv.org/html/2609.11341#bib.bib50); Zhuang等人 2026 (https://arxiv.org/html/2609.11341#bib.bib51))和晚期融合(Liu等人 2021 (https://arxiv.org/html/2609.11341#bib.bib13))。尽管这些方法有效,但它们侧重于如何组合模态进行预测,而忽略了其配对对应关系作为数据增强来源的潜力。 这一限制在生理信号解码领域尤为重要,因为数据采集成本高昂、数据集规模有限且受试者间的强变异性会损害泛化能力。现有增强算法通过信号变换或生成模型缓解数据稀缺问题,但它们主要是单模态的,独立地合成每个模态(Wang等人 2026b (https://arxiv.org/html/2609.11341#bib.bib49))。因此,在数据生成过程中,配对模态所包含的互补信息并未被明确利用。 因此,我们从互补的角度来构建多模态学习:配对模态不仅可以作为融合的输入,也可以作为跨模态增强的相互条件。基于这一理念,我们提出了CoMA-DiT——一种用于潜在增强的双向跨模态扩散Transformer。CoMA-DiT将每个模态编码为模态特定的标记,并通过跨模态注意力将速度预测与配对模态条件化关联。一个可靠性门控残差机制进一步控制跨模态变异性的注入,生成增强的潜在表征,该表征在保留模态特定信息的同时,融入了来自配对模态的互补证据。生成的潜在表征与真实潜在表征相结合,以改进下游的脑状态解码。图1 (https://arxiv.org/html/2609.11341#Sx1.F1)将传统的多模态融合和单模态生成与我们的跨模态增强方案进行了对比。 主要贡献总结如下: - •我们提出了用于多模态学习的跨模态增强概念,将配对模态作为相互生成的条件,而非传统的融合输入。 - •我们提出了CoMA-DiT,一个基于扩散Transformer构建的双向跨模态增强框架。它通过跨模态注意力将速度预测与配对模态条件化关联,并通过一个可靠性门控残差机制自适应地注入由此产生的跨模态变异性。 - •在AAD和EMO范式上的实验表明,CoMA-DiT优于20个代表性基线方法。消融实验和可解释性分析进一步证明了其鲁棒性、泛化能力以及捕捉功能性相关跨模态交互的能力。 ## 相关工作 ### 多模态脑状态解码 多模态脑状态解码结合同步的神经、行为和生理信号来推断认知或情感状态。在情感识别中,面部表情、语音、文本、EEG和EOG提供了互补的情感线索(Wu等人 2025 (https://arxiv.org/html/2609.11341#bib.bib11); Jiang等人 2020 (https://arxiv.org/html/2609.11341#bib.bib12); Liu等人 2021 (https://arxiv.org/html/2609.11341#bib.bib13))。类似地,EEG、EOG和声学特征也被整合以改进听觉注意解码(Liu等人 2026 (https://arxiv.org/html/2609.11341#bib.bib15))。 现有的多模态学习主要依赖早期、中期或晚期融合,分别结合输入(Li等人 2020 (https://arxiv.org/html/2609.11341#bib.bib52))、模态特定表征(Yin等人 2026 (https://arxiv.org/html/2609.11341#bib.bib50); Zhuang等人 2026 (https://arxiv.org/html/2609.11341#bib.bib51))或预测结果(Liu等人 2021 (https://arxiv.org/html/2609.11341#bib.bib13))。尽管架构不同,这些方法都优化了融合过程,但可能受到模态竞争(Huang等人 2021 (https://arxiv.org/html/2609.11341#bib.bib14))的影响,导致配对模态作为相互监督以扩展训练分布的作用未被充分利用。 ### 脑电信号增强与生成 脑电信号增强已被广泛研究,以缓解有限的样本大小和受试者间变异性(Wang等人 2026b (https://arxiv.org/html/2609.11341#bib.bib49); Rommel等人 2022 (https://arxiv.org/html/2609.11341#bib.bib17))。传统方法通过噪声注入、掩蔽、缩放(Zhang等人 2022 (https://arxiv.org/html/2609.11341#bib.bib18))、频率操作(Wang等人 2025a (https://arxiv.org/html/2609.11341#bib.bib10); Zhao等人 2022 (https://arxiv.org/html/2609.11341#bib.bib19))和通道变换(Wang等人 2024 (https://arxiv.org/html/2609.11341#bib.bib9); Krell and Kim 2017 (https://arxiv.org/html/2609.11341#bib.bib20))来扰动时间、频谱或空间结构。特征空间方法,包括SMOTE(Tseng等人 2024 (https://arxiv.org/html/2609.11341#bib.bib24))、Mixup(Zhang等人 2018 (https://arxiv.org/html/2609.11341#bib.bib21))和流形Mixup(M-Mixup)(Verma等人 2019 (https://arxiv.org/html/2609.11341#bib.bib22)),则通过对样本进行插值来正则化决策边界(Freer and Yang 2020 (https://arxiv.org/html/2609.11341#bib.bib25))。 深度生成模型进一步直接学习数据分布。生成对抗网络(GAN)已被应用于运动想象、睡眠分期、癫痫检测和情感识别的EEG合成(Goodfellow等人 2014 (https://arxiv.org/html/2609.11341#bib.bib26); Arjovsky等人 2017 (https://arxiv.org/html/2609.11341#bib.bib27); Gulrajani等人 2017 (https://arxiv.org/html/2609.11341#bib.bib28); Fahimi等人 2020 (https://arxiv.org/html/2609.11341#bib.bib29); Xu等人 2022 (https://arxiv.org/html/2609.11341#bib.bib30)),而变分自编码器(VAEs)和混合模型则支持概率重建和潜在采样(Kingma and Welling 2014 (https://arxiv.org/html/2609.11341#bib.bib48); Li等人 2023 (https://arxiv.org/html/2609.11341#bib.bib31); Tian等人 2023 (https://arxiv.org/html/2609.11341#bib.bib32))。自回归模型和扩散模型最近也被探索用于神经信号合成(Bird等人 2021 (https://arxiv.org/html/2609.11341#bib.bib33); Cui等人 2024 (https://arxiv.org/html/2609.11341#bib.bib34); Zeng等人 2023 (https://arxiv.org/html/2609.11341#bib.bib35))。尽管取得了进展,现有算法仍然主要是单模态的:即使有同步的模态可用,每个模态的信号也是独立生成的。其配对对应关系很少被用作互补的生成监督。 ### 用于生物信号生成的扩散模型 扩散模型通过迭代扰动和去噪学习数据分布,其训练稳定性优于对抗生成(Ho等人 2020 (https://arxiv.org/html/2609.11341#bib.bib2); Rombach等人 2022 (https://arxiv.org/html/2609.11341#bib.bib36))。扩散Transformer用基于标记的Transformer模块取代了传统的U-Net骨干网络,实现了可扩展的长程建模,并通过交叉注意力(Lv等人 2025 (https://arxiv.org/html/2609.11341#bib.bib38))、条件标记(Esser等人 2024 (https://arxiv.org/html/2609.11341#bib.bib37))和自适应归一化(Peebles and Xie 2023 (https://arxiv.org/html/2609.11341#bib.bib16))提供了灵活的条件化能力。这些特性使其非常适合多模态生成。 基于扩散的生物信号建模仍在发展中。现有研究已探索了合成EEG生成、掩蔽信号重建以及基于扩散的表征学习(Zeng等人 2023 (https://arxiv.org/html/2609.11341#bib.bib35); Cui等人 2024 (https://arxiv.org/html/2609.11341#bib.bib34))。Brain-DiT进一步引入了元数据条件化的扩散预训练用于多状态fMRI解码(Xia等人 2026 (https://arxiv.org/html/2609.11341#bib.bib39))。然而,当前方法主要依赖单模态信号、标签或元数据作为条件。配对生理模态相互条件化的双向增强在很大程度上尚未被探索。 ## 方法 ### 概述 我们考虑一个多模态训练集$\mathcal{D}=\{(\mathbf{X}_{i}^{a},\mathbf{X}_{i}^{b},y_{i})\}_{i=1}^{N}$,其中$\mathbf{X}_{i}^{a}$和$\mathbf{X}_{i}^{b}$是来自模态$a$和$b$的同步生物信号,$y_{i}$表示相应的脑状态标签。我们不将配对模态仅用于预测融合,而是利用其对应关系作为相互生成监督来增强模态特定的潜在表征。为清晰起见,模态$a$和$b$分别对应EEG和EOG。虽然以双模态设置呈现,但CoMA-DiT不限于单一模态对,可以扩展到两个以上的模态。 如图2 (https://arxiv.org/html/2609.11341#Sx3.F2)所示,该框架分两阶段优化。在第一阶段,模态特定编码器、双向跨模态扩散Transformer和任务分类器被联合训练。每个模态被编码为潜在标记,并用于条件化其配对模态的增强,而任务和生成目标共同保留判别性和跨模态信息。在第二阶段,编码器和CoMA-DiT被冻结,分类器在真实和增强的潜在表征联合集上进一步优化。 参考图注图2:所提出的CoMA-DiT跨模态增强的整体框架。 ### 模态特定编码 CoMA-DiT在潜在空间中运行,与骨干编码器的选择无关。它只需要将配对输入映射到潜在标记序列的模态特定编码器,因此可以在不同的脑状态解码任务中使用不同的解码骨干进行实例化。 形式上,两个模态特定编码器$f_{a}$和$f_{b}$将配对输入转换为潜在标记: $\mathbf{Z}^{a}=f_{a}(\mathbf{X}^{a}),\qquad \mathbf{Z}^{b}=f_{b}(\mathbf{X}^{b}),$ (1) 其中$\mathbf{Z}^{a}\in\mathbb{R}^{M_{a}\times d}$和$\mathbf{Z}^{b}\in\mathbb{R}^{M_{b}\times d}$。这里$M_{a}$和$M_{b}$表示两个模态的潜在标记数量,$d$是后续跨模态交互所需的共享标记维度。用于分类的最终表征通过拼接两个模态特定特征$\mathbf{r}=\left[\mathbf{Z}^{a};\mathbf{Z}^{b}\right]$获得。然后,一个轻量级分类器$h(\cdot)$预测脑状态为$\hat{\mathbf{y}}=h(\mathbf{r})$。 ### 跨模态扩散Transformer CoMA-DiT是一个双向的潜在增强模块。给定配对标记序列$\mathbf{Z}^{a}$和$\mathbf{Z}^{b}$,它学习模态条件化的残差变异并生成: $\mathbf{Z}^{a+}=\mathbf{Z}^{a}+\Delta^{a\leftarrow b},\qquad \mathbf{Z}^{b+}=\mathbf{Z}^{b}+\Delta^{b\leftarrow a},$ (2) 其中$\Delta^{a\leftarrow b}$表示在模态$b$条件下为模态$a$生成的变异性,反之亦然。尽管两种模态对特定任务的贡献可能不相等,但每种模态都可以为增强另一模态提供互补信息。因此,我们对两个方向都进行建模,允许配对模态相互丰富其表征。 对于每个方向,CoMA-DiT在潜在空间中采用速度预测目标。以$b \rightarrow a$方向为例,$\mathbf{Z}^{a}$表示目标模态标记,$\mathbf{Z}^{b}$表示源模态标记。我们采样时间步$\tau\sim\mathcal{U}(0,1)$和高斯噪声$\boldsymbol{\epsilon}^{a}\sim\mathcal{N}(0,\mathbf{I})$,并构建带噪目标标记为: $\mathbf{Z}^{a}_{\tau}=(1-\tau)\mathbf{Z}^{a}+\tau\boldsymbol{\epsilon}^{a}.$ (3) 对应的速度目标为$\mathbf{V}^{a}=\boldsymbol{\epsilon}^{a}-\mathbf{Z}^{a}$。 CoMA-DiT生成器$G_{\theta}$将带噪目标模态标记、源模态标记和时间步作为输入: $\hat{\mathbf{V}}^{a\leftarrow b},\mathbf{H}^{a\leftarrow b}=G_{\theta}(\mathbf{Z}^{a}_{\tau},\mathbf{Z}^{b},\tau),$ (4) 其中$\hat{\mathbf{V}}^{a\leftarrow b}$是预测的速度,$\mathbf{H}^{a\leftarrow b}$表示用于残差增强的隐藏目标标记。生成器$G_{\theta}$被实现为一个轻量级的跨模态DiT,由目标模态自注意力(TSA)、源到目标跨模态注意力(STCMA)和交叉模态前馈网络(CMFFN)组成。该结构通过在源模态标记与目标模态标记交互的同时处理目标模态标记的噪声版本,实现了条件化的去噪过程。
相似文章
MMDiff: 扩展扩散变换器以实现多模态生成
MMDiff 通过轻量级解码器将冻结的扩散变换器扩展为多模态生成系统,通过多时间步特征融合,在语义分割和其他感知任务上实现了显著改进。
UniDDT: 通过解耦扩散变换器统一多模态理解与生成
UniDDT提出了一种解耦扩散变换器框架,通过利用Noisy ViT编码器和LLM进行语义编码,统一了多模态理解与生成,在两个任务上均取得了强劲性能。
用于矛盾与犹豫识别的 Modality Discrepancy Transformer
本文介绍了 Modality Discrepancy Transformer (MDT),一种新型多模态融合框架,它增强了跨模态差异建模,用于在临床视频中识别矛盾与犹豫,在 BAH 数据集上优于基线方法。
MGDT:MLLM引导的扩散Transformer结合关系自适应混合专家模型用于多模态知识图谱补全
提出了M2GDT,一种新颖的MKGC框架,它利用MLLM引导的扩散Transformer与关系自适应混合专家模型来对齐和去噪多模态特征,在三个基准数据集上优于基线方法。
PerceptionDLM: 基于多模态扩散语言模型的并行区域感知
PerceptionDLM 提出了一种多模态扩散语言模型,通过结构化注意力掩码和高效提示实现并行区域感知,在不牺牲字幕质量的情况下实现更快的推理。实验表明,在多区域感知任务中,性能具有竞争力且速度大幅提升。