多模态域泛化的抑郁症检测:基于注意力的BiLSTM网络与域对抗训练

arXiv cs.LG 论文

摘要

一种新颖的、不依赖患者的自动抑郁症检测多模态框架,整合了BiLSTM与模态内和跨模态注意力机制以及域对抗训练,以提高跨说话人的泛化能力。在Androids-Corpus数据集上达到了93.2%的先进准确率。

arXiv:2607.22794v1 公告类型:新 摘要:基于深度学习的自动抑郁症检测已显示出潜力,但由于说话者间差异导致的域偏移,其泛化能力常受限。为解决这一关键问题,我们提出了首个不依赖患者的、结合域泛化(DG)的多模态抑郁症检测框架,同时利用声学和文本模态。该模型整合了双向长短期记忆网络(BiLSTM)与模态内及跨模态注意力机制,并辅以片段级融合进行决策。通过应用受神经网络域对抗训练(DANN)启发的梯度反转层,进一步增强了泛化能力,该层通过对立地限制模型识别个体说话者的能力,促进域不变表示,有效减少患者特定偏差。在Androids-Corpus数据集上采用5折交叉验证(CV)协议进行实验,评估了不同音频和文本特征提取器在不同片段时长下的配对组合,确定了MelSpec和ItalianBERT在30秒片段时长下为最优基线。在该基线上加入DG后,准确率提升2.5%,F1分数提升3.3%,达到93.2%的准确率、93.2%的精确率、96.2%的召回率和94.2%的F1分数,超越所有现有基准。广泛的消融研究评估了多模态融合、深度架构选择和DG的影响,突出了它们对稳健且可泛化的抑郁症检测的综合贡献。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:22

# 多模态域泛化用于抑郁症检测:基于注意力机制的双向LSTM网络与域对抗训练
来源:https://arxiv.org/html/2607.22794
Ali Tabaraei, Federico Simonetta, 和 Stavros Ntalampiras  
Ali Tabaraei 和 Stavros Ntalampiras 任职于米兰大学计算机科学系,意大利米兰。邮箱:[email protected][email protected]  
Federico Simonetta 任职于格兰萨索科学研究所 (GSSI) 计算机科学系,意大利拉奎拉。邮箱:[email protected]  
稿件于 2025年10月6日收到;2026年3月5日和2026年6月13日修订;2026年7月12日接收。(通讯作者:Ali Tabaraei。)

###### 摘要

基于深度学习的自动抑郁症检测已展现出潜力,但常因说话者间差异导致的域偏移而泛化能力受限。针对这一关键问题,我们首次提出了一种患者无关的多模态抑郁症检测框架¹,该框架融合了域泛化 (DG),并联合利用了声学与文本两种模态。所提模型整合了双向长短期记忆网络 (BiLSTM) 与模态内及跨模态注意力机制,并采用片段级融合进行决策。通过应用受神经网络域对抗训练 (DANN) 启发的梯度反转层,进一步增强了泛化能力——该层以对抗方式限制模型识别个体说话者的能力,从而促进域不变表示,有效减少了患者特定偏差。在 Android 语料库数据集上采用五折交叉验证 (CV) 协议进行实验,评估了不同时长片段下音频与文本特征提取器的多种组合,确定 MelSpec 与 ItalianBERT 在 30 秒片段时长下为最优基线。在该基线上加入 DG 后,准确率提升 2.5%,F1 分数提升 3.3%,达到 93.2% 准确率、93.2% 精确率、96.2% 召回率和 94.2% F1 分数,超越了所有现有基准。广泛的消融研究评估了多模态融合、深层架构选择以及 DG 的影响,突出了它们对稳健且可泛化的抑郁症检测的共同贡献。

¹本工作的源代码和文档可公开访问:https://github.com/tabaraei/MultimodalDG-depression-detection

## I. 引言

参见图注  
图1:所提出的用于多模态抑郁症检测的 DG 框架概述。每个说话者被表示为一个不同的域,用以模拟音频-文本模式中的独特变异性。域判别器约束特征提取器所学到的表示,以抑制说话者特定的特征,同时保留与抑郁相关的线索。这种对抗性设置促进了域不变特征,并增强了对未见过的域的泛化能力。

抑郁症是最普遍的精神健康障碍之一[43](https://arxiv.org/html/2607.22794#bib.bib1),若不治疗,可能发展为自残或自杀等严重后果[5](https://arxiv.org/html/2607.22794#bib.bib2)。这一风险凸显了对可靠自动化筛查方法的迫切需求,以补充现有的预防干预措施[52](https://arxiv.org/html/2607.22794#bib.bib11)。

为实现自动抑郁症检测,人工智能 (AI) 的最新进展推动了系统性地收集和分析行为与生理数据(包括语音、语言、面部表情和生物信号)的努力,这些数据可作为抑郁状态的独特指标[51](https://arxiv.org/html/2607.22794#bib.bib37),[34](https://arxiv.org/html/2607.22794#bib.bib9),[55](https://arxiv.org/html/2607.22794#bib.bib10)。随后,通常通过特征提取和建模阶段处理这些数据,以揭示与抑郁相关的模式。

在这些模态中,**语音**和**语言**特征已被证明是特别有用的抑郁生物标志物。具体而言,抑郁症患者常表现出重复性的声学模式[26](https://arxiv.org/html/2607.22794#bib.bib34),例如音高变异性降低、语速减慢和停顿更长[11](https://arxiv.org/html/2607.22794#bib.bib3),以及语言特征如自我聚焦表达和负面情绪[17](https://arxiv.org/html/2607.22794#bib.bib4)。

尽管标准的音频-文本机器学习 (ML) 模型在抑郁症检测中展现出改进的性能[22](https://arxiv.org/html/2607.22794#bib.bib20),但其临床部署仍面临一个关键障碍:缺乏主体无关的泛化能力。每个个体都有独特的言语特征和语言使用习惯,这可能导致模型捕捉到个人行为标记而非抑郁的病理指标。因此,尽管在已见过的受试者上表现良好,这些模型往往因说话者间的差异而难以泛化到新患者[35](https://arxiv.org/html/2607.22794#bib.bib51)。

为确保在现实世界筛查中的可靠性,诊断模型必须能够抵御此类变异。域自适应 (DA)[15](https://arxiv.org/html/2607.22794#bib.bib50)和域泛化 (DG)[58](https://arxiv.org/html/2607.22794#bib.bib49)是两种解决**域偏移**[23](https://arxiv.org/html/2607.22794#bib.bib7)下性能下降的方法,域偏移发生在训练数据(源域)与推理时遇到的数据(目标域)不同时。DA 需要在训练期间访问目标数据,而 DG 仅依赖源域来模拟域偏移,因此特别适合在抑郁症检测中增强诊断未见患者的鲁棒性[42](https://arxiv.org/html/2607.22794#bib.bib8)。

为了实现 DG 范式,如图1(https://arxiv.org/html/2607.22794#S1.F1)所示,受[40](https://arxiv.org/html/2607.22794#bib.bib46)启发,我们将每位患者的独特音频-文本数据视为一个独立的**域**。采用这一视角使我们能够将域偏移建模为说话者间变异性,源域和目标域分别对应于训练集和测试集中的患者。

虽然在文献中已经探索了多种 DG 方法,但**域不变表示学习**技术被广泛研究并被证明有效[48](https://arxiv.org/html/2607.22794#bib.bib5)。特别是,这些方法鼓励学习忽略域特定混杂因素、同时保留目标任务判别模式的表示[38](https://arxiv.org/html/2607.22794#bib.bib6)。

在此类别中,我们采用 Ganin 等人[16](https://arxiv.org/html/2607.22794#bib.bib53)提出的**神经网络域对抗训练 (DANN)** 来引导标准 ML 流程。我们的框架包含一个配备**梯度反转层 (GRL)**[16](https://arxiv.org/html/2607.22794#bib.bib53)的**域判别器**,当模型正确识别说话者时,它会惩罚模型。这种对抗机制驱动特征提取器学习对说话者特征不变的表示,同时保持病理信息。因此,它有助于实现一个隐私保护、参与者无关的抑郁症检测器,能够泛化到未见患者。

所提出的框架利用**多源 DG** 范式[58](https://arxiv.org/html/2607.22794#bib.bib49),通过**基于模型的融合**策略[25](https://arxiv.org/html/2607.22794#bib.bib129),[28](https://arxiv.org/html/2607.22794#bib.bib98)联合建模声学和文本特征,所有组件都封装在一个统一的架构中。我们的主要贡献包括:

- • 提出了一种新颖的多模态音频-文本架构,包含 BiLSTM 编码器、模态内和跨模态注意力模块以及片段级决策。
- • 对不同的特征提取器对(音频:MelSpec、HuBERT、Wav2Vec2;文本:BERT、ItalianBERT、XLMRoBERTa)以及不同的片段时长进行了全面分析。
- • 通过广泛的消融研究评估了每种模态和架构组件的相对贡献。
- • 在加入 DG 后取得了最先进的结果:准确率 93.2%,F1 分数 94.2%,尽管使用的训练数据减少了 20%,但仍优于先前的基准。

本文其余部分组织如下:第二部分(https://arxiv.org/html/2607.22794#S2)回顾了先前的研究以进行比较,总结多模态方法,并强调 DG 的相关性。第三部分(https://arxiv.org/html/2607.22794#S3)形式化问题,为第四部分(https://arxiv.org/html/2607.22794#S4)提供背景介绍,后者详细描述了所提方法的不同模块。第五部分(https://arxiv.org/html/2607.22794#S5)介绍了实验设置和标准化协议,随后第六部分(https://arxiv.org/html/2607.22794#S6)分析了结果,并进行了彻底的消融研究,从多个角度评估所提出的方法。最后,第八部分(https://arxiv.org/html/2607.22794#S8)和第七部分(https://arxiv.org/html/2607.22794#S7)总结了我们的结论并概述了未来工作的方向。

## II. 相关工作

本节总结先前的抑郁症检测研究作为比较参考,提供多模态抑郁症检测的简要但信息丰富的概述,并讨论域泛化在此背景下的相关性。

表 I:基于 Android 语料库的抑郁症分类研究概览。部分研究仅使用**阅读 (R)** 或**访谈 (I)** 数据,而其他研究则报告了两者融合 (R∧I) 或分别 (R∨I) 的结果,采用纯语音 (S) 或多模态 (M) 方法。高亮行与本研究不具可比性,因为我们仅使用访谈数据。

### II-A. 基于 Android 语料库的抑郁症检测

为了在第六部分C节(https://arxiv.org/html/2607.22794#S6.SS3)中进行比较,此处介绍先前在 Android 语料库[44](https://arxiv.org/html/2607.22794#bib.bib115)数据集(见第五部分A节(https://arxiv.org/html/2607.22794#S5.SS1))上的抑郁症检测工作。该数据集包含**访谈 (I)** 和**阅读 (R)** 任务的录音,促使研究者采用多种策略,独立或组合使用这些数据类型,如表 I(https://arxiv.org/html/2607.22794#S2.T1)所示。

部分研究报告了每种数据类型分别的抑郁症检测结果 (R∨I)。Tao 等人[44](https://arxiv.org/html/2607.22794#bib.bib115)的初始基线使用了 OpenSMILE 特征,其中 BS1 采用 SVM,BS2 采用带有片段级多数投票的 LSTM。Phukan 等人[31](https://arxiv.org/html/2607.22794#bib.bib113)提出了 FuSeR,一种使用 x-vector、TRILLsson 和 emoHuBERT 嵌入的深度融合模型,而 Ntalampiras[30](https://arxiv.org/html/2607.22794#bib.bib112)使用基于 MFCC、TEO 自相关包络和周期性特征的可解释 HMM 方法取得了竞争性表现。

相反,一些研究在其实验中整合了两种数据类型 (R∧I)。Tao 等人[45](https://arxiv.org/html/2607.22794#bib.bib117)开发了跨数据多级注意力 (CDMA),在 OpenSMILE 特征上使用启用注意力的 LSTM。Ilias 等人[21](https://arxiv.org/html/2607.22794#bib.bib111)将对数梅尔谱图及其一阶和二阶导数堆叠成 3D 表示,随后通过 AlexNet 提取特征,并使用**混合专家 (MoE)** 架构进行处理。Daly 和 Olukoya[8](https://arxiv.org/html/2607.22794#bib.bib13)使用混合 CNN-LSTM 处理 OpenSMILE 特征,同时用 BERT 编码 TF-IDF 转录本,在决策层融合模态特定输出。Zhou 等人[59](https://arxiv.org/html/2607.22794#bib.bib19)利用**自适应知识融合 (AKF)** 框架,联合建模来自 MFCC 特征的时域和通道域信息。Rezaee[36](https://arxiv.org/html/2607.22794#bib.bib15)的类似研究结合了 ResNet-18 主干和**时频通道注意力 (TFCA)** 机制,处理 STFT 谱图片段。

其他研究则专注于特定数据类型。使用阅读数据 (R),Tao 等人[46](https://arxiv.org/html/2607.22794#bib.bib116)利用 OpenSMILE 导出的相关表示预测抑郁症,而 Polle 等人[33](https://arxiv.org/html/2607.22794#bib.bib114)将 eGeMAPS 和 TRILLsson4 特征输入 XGBoost 以识别混淆偏差。Li 等人[27](https://arxiv.org/html/2607.22794#bib.bib14)采用脑启发强化学习架构,通过 1D-CNN 和 BiLSTM 模块处理 OpenSMILE 特征。

使用访谈数据 (I),Yu 等人[54](https://arxiv.org/html/2607.22794#bib.bib118)微调了基于 Wav2Vec2 的 PDEM 模型,并使用**核极限学习机 (KELM)** 进行分类,而 de Gennes 等人[9](https://arxiv.org/html/2607.22794#bib.bib109)使用逻辑回归对 HuBERT、Wav2Vec2 和 Whisper 嵌入进行了基准测试。Alsenani 等人[3](https://arxiv.org/html/2607.22794#bib.bib108)在 GRU 网络中处理 Wav2Vec2 音频和 BERT 文本嵌入。与[21](https://arxiv.org/html/2607.22794#bib.bib111)类似,Ilias 等人[20](https://arxiv.org/html/2607.22794#bib.bib110)提取了基于 3D AlexNet 的对数梅尔谱图和 ItalianBERT 文本特征,但改用交叉注意力。在近期工作中,Alsarrani 等人[2](https://arxiv.org/html/2607.22794#bib.bib12)对音频(OpenSMILE 或 Wav2Vec2)和 LIWC 文本特征采用多数投票。Zhang 和 Poellabauer[56](https://arxiv.org/html/2607.22794#bib.bib18)提出了基于对话的 CoPE (D-CoPE),用于 Wav2Vec2 和 XLM-RoBERTa,利用带有 GRL 的对抗性设置和对话级 Transformer。类似地,Wang 等人[50](https://arxiv.org/html/2607.22794#bib.bib16)提出了**多域特征对齐 (MDFA)**,使用 GRL 通过不同的编码器从滤波器组学习域不变表示。在他们最新的工作[49](https://arxiv.org/html/2607.22794#bib.bib17)中,他们使用了**多时频尺度块 (MTFS-Block)** 和 DWT 来增强 DepAudioNet 和 ECAPA-TDNN 基线。

这些研究大多仅依赖声学特征,忽略了文本信息的潜在收益。另一个局限性是其实验设计缺乏专门的**验证集**。尽管[54](https://arxiv.org/html/2607.22794#bib.bib118)使用了嵌套交叉验证,[30](https://arxiv.org/html/2607.22794#bib.bib112),[36](https://arxiv.org/html/2607.22794#bib.bib15),[59](https://arxiv.org/html/2607.22794#bib.bib19)保留了部分训练数据用于验证,但其他研究训练固定数量的周期,增加了过拟合和模型选择偏差的风险。

### II-B. 多模态抑郁症检测

抑郁症通过多种行为信号表现出来,使得整合音频、文本和视觉数据的多模态方法非常适合自动检测。通过捕捉互补线索,此类方法通常能够优于单模态系统。早期研究由 Yang 等人[53](https://arxiv.org/html/2607.22794#bib.bib107)进行,他们使用深度 CNN 融合了音频、视频和文本描述符,而 Haque 等人[18](https://arxiv.org/html/2607.22794#bib.bib104)后来应用因果 CNN 建模声学、语言和面部特征。在最近的一项研究中,

相似文章

使用LLM生成的嵌入从社交媒体文本中进行可解释的抑郁症检测

arXiv cs.CL

本文研究了使用大语言模型(LLMs)和监督分类器从社交媒体文本中检测抑郁症的方法,提出了一种基于提示的嵌入方法以增强可解释性。在多个数据集上的实验表明,零样本LLMs在二分类任务中表现良好,但在细粒度严重程度分类上表现不佳;而基于LLM摘要嵌入的监督模型在多分类和有序分类任务中取得了更一致的表现。

大型语言模型作为统一多模态学习器用于临床预测

arXiv cs.AI

该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。

基于LLM推理的多视角注意力多示例学习在认知扭曲检测中的应用

arXiv cs.CL

本文提出一个新颖框架,将大语言模型与多示例学习相结合,通过将话语分解为情绪、逻辑和行为三个维度,并使用多视角门控注意力机制来检测心理健康文本中的认知扭曲。该方法在韩文和英文数据集上展现了改进的性能,特别是对于具有高解释歧义性的扭曲。