对话时间动态能否改善双人抑郁检测?多模态视角下的初步探究
摘要
本文研究了对话时间动态(话轮对时序)作为一种轻量级模态,用于从双人临床访谈中自动检测抑郁。结果表明,一个紧凑的24维时序模块表现出色,并且在融合时能够补充标准的声学和语义特征。
arXiv:2607.03744v1 公告类型:新
摘要:基于临床访谈的自动抑郁检测通常对参与者话语的语义内容和声学特征进行建模。然而,临床医生与参与者之间的交互时序相对未被充分建模。我们研究了对话时间动态,特别是双人话轮对时序,作为与自监督编码器融合的主要模态。在DAIC-WOZ数据集上进行评估,我们将一个紧凑的24维时序模块与冻结的WavLM-large和RoBERTa-large基线检测器进行比较。该时序模块在开发集上实现了最高的单模态性能。此外,一种凸加权晚期融合策略将开发集和测试集的整体性能分别提升至0.804和0.669的宏F1分数。学习到的融合有效地将声学权重分配为零,表明对话时序可以作为双人抑郁筛查的一种轻量级、可解释的补充。
查看缓存全文
缓存时间: 2026/07/07 04:35
# 对话时间动态能否改善双人互动中的抑郁症检测?一项多模态视角的初步研究
来源:https://arxiv.org/html/2607.03744
Hanie Kanghttps://orcid.org/0009-0005-8023-96721,Huang-Cheng Chouhttps://orcid.org/0000-0003-2125-56892,Sudarsana Reddy Kadirihttps://orcid.org/0000-0001-5806-30532,Shrikanth Narayananhttps://orcid.org/0000-0002-1052-62042
###### 摘要
基于临床访谈的自动抑郁症检测通常对参与者语音的语义内容和声学特征进行建模。然而,临床医生与参与者之间的互动*时机*仍相对欠缺建模。我们研究*对话时间动态*,特别是双人对话中的话轮配对时机,将其作为一种主要模态,与自监督编码器进行融合。在DAIC-WOZ数据集上评估时,我们比较了一个紧凑的24维时间模块与冻结的WavLM-large和RoBERTa-large基线检测器。该时间模块在开发集上取得了最佳的单模态性能。此外,一种凸加权后期融合策略在开发集和测试集上分别将总体性能提升至0.804和0.669的宏F1值。学习到的融合有效地将声学部分的权重设为零,表明对话时机可作为双人抑郁症筛查的一种轻量级、可解释的补充手段。
## I 引言
抑郁症是全球最常见的精神健康障碍之一 [26 (https://arxiv.org/html/2607.03744#bib.bib2)],而基于语音的筛查作为一种低成本的临床评估补充手段被广泛研究 [25 (https://arxiv.org/html/2607.03744#bib.bib3),24 (https://arxiv.org/html/2607.03744#bib.bib4)]。大多数系统要么对**声学**特征(韵律和频谱语音特征,越来越多地由如WavLM [5 (https://arxiv.org/html/2607.03744#bib.bib19)] 等自监督模型编码)进行建模,要么对**语义**特征(参与者所说内容的词汇层面,通常使用如RoBERTa [20 (https://arxiv.org/html/2607.03744#bib.bib20)] 等上下文文本编码器)进行建模。
然而,临床访谈本质上是一种**双人互动**:访谈者(在DAIC-WOZ中,虚拟访谈者"Ellie")提问,参与者回答,交替进行。越来越多的研究表明,这种交流的**时机**包含与抑郁症相关的信息。在单个说话者层面,抑郁参与者往往反应较慢,在话轮内停顿更久且更频繁,语速降低 [28 (https://arxiv.org/html/2607.03744#bib.bib8),21 (https://arxiv.org/html/2607.03744#bib.bib9),8 (https://arxiv.org/html/2607.03744#bib.bib7)]。在交流层面,话轮切换描述符(话轮控制、话轮切换和话轮保持间隔)携带了超出声学信号本身的情感发作信息 [2 (https://arxiv.org/html/2607.03744#bib.bib10)]。计算研究同样发现,会话级别的言语/停顿/回应间隔 [13 (https://arxiv.org/html/2607.03744#bib.bib11)] 以及精细粒度声学标志之间的时长 [16 (https://arxiv.org/html/2607.03744#bib.bib12),30 (https://arxiv.org/html/2607.03744#bib.bib13)] 具有判别性。我们将这些互动层面的时间信号称为**对话时间动态**(CTD)。由于CTD描述的是交流的**结构**而非其词汇内容或短时帧频谱细节,它成为补充融合的一个可行候选。
近期三条研究线索共同指向同一潜在论断——时间具有判别性,但每条线索都留下了本文所要针对的具体空白。在同样具有临床访谈那种双人问/答结构(提问/回答)的**欺骗**检测中,Chou等人 [6 (https://arxiv.org/html/2607.03744#bib.bib15),7 (https://arxiv.org/html/2607.03744#bib.bib16)] 表明紧凑的双人话轮配对时间描述符能提升仅靠声学特征的检测效果,但他们未研究抑郁症。在DAIC-WOZ上,Fushimi等人 [13 (https://arxiv.org/html/2607.03744#bib.bib11)] 表明长期的话语/停顿/回应间隔有帮助,但将时间视为一种**单说话者**的声学特征。Zhang等人 [31 (https://arxiv.org/html/2607.03744#bib.bib14),30 (https://arxiv.org/html/2607.03744#bib.bib13)] 同样表明声学标志时间编码了纯文本模型忽略的抑郁症信号,但他们将其用于亚音位层面作为检索辅助,而非作为独立模态。在所有这些工作中,时间都有帮助;然而,访谈的**双人、转录级别的话轮结构**作为与强大自监督编码器融合的一级模态仍未被充分探索。
因此,我们将CTD视为独立模态,与冻结的WavLM-large声学特征和冻结的RoBERTa-large语义特征并列,在DAIC-WOZ [15 (https://arxiv.org/html/2607.03744#bib.bib5)] 上采用相同严格、无泄漏、受试者独立的协议进行评估。由此产生的研究定义了一个紧凑、可解释的24维CTD模块,来源于问/答话轮配对,比较了声学(A)、语义(T)、CTD及其两两/三路后期融合,并探求当与1024维的神经编码器平起平坐时,对话时间能赢得多少权重。在这个小型基准上,CTD是开发子集上最强的单模态;凸加权融合在开发集和测试集上都优于最佳单模态;最大的提升来自将CTD添加到语义中,而学习到的三路融合将声学权重设为零。我们将这些发现视为初步结果,并在第八节 (https://arxiv.org/html/2607.03744#S8) 讨论单个小型基准的统计局限性。我们的代码、种子/超参数/部署模型细节可在 https://github.com/dndbsl/depression-detection-ctd 获取。
## II 相关工作
### II-A 基于DAIC-WOZ的声学和语义抑郁症检测
AVEC挑战系列 [25 (https://arxiv.org/html/2607.03744#bib.bib3),24 (https://arxiv.org/html/2607.03744#bib.bib4)] 将DAIC-WOZ风格的音频/文本抑郁症评估确立为基准,全面的综述记录了基于语音的抑郁症及相关状况方法的广度 [8 (https://arxiv.org/html/2607.03744#bib.bib7)]。早期系统依赖手工设计的韵律和词汇特征及其融合 [1 (https://arxiv.org/html/2607.03744#bib.bib17)];近期工作采用自监督语音编码器如wav2vec 2.0 [3 (https://arxiv.org/html/2607.03744#bib.bib18)] 和WavLM [5 (https://arxiv.org/html/2607.03744#bib.bib19)],以及上下文文本编码器如RoBERTa [20 (https://arxiv.org/html/2607.03744#bib.bib20)],通常以SUPERB风格 [29 (https://arxiv.org/html/2607.03744#bib.bib21)] 使用轻量级头部探测冻结表示。由于AVEC未公开测试标签,DAIC-WOZ系统通常比较开发子集的结果 [14 (https://arxiv.org/html/2607.03744#bib.bib22),23 (https://arxiv.org/html/2607.03744#bib.bib23),27 (https://arxiv.org/html/2607.03744#bib.bib25),19 (https://arxiv.org/html/2607.03744#bib.bib26)],我们遵循这一惯例(第六节 (https://arxiv.org/html/2607.03744#S6));事实上,近期SSL系统在此惯例下报告了较高的开发宏F1值,包括WavLM/SSL集成分数0.800–0.829和WavLM-large层次模型0.81 [27 (https://arxiv.org/html/2607.03744#bib.bib25),19 (https://arxiv.org/html/2607.03744#bib.bib26)]。当报告留出测试集性能时,结果通常较为适中:近期基于语音基础模型的研究在DAIC/E-DAIC上报告测试或测试侧平均F1大约在0.5多到0.6多之间,即使使用了WavLM、HuBERT、wav2vec 2.0、AudioMAE或领域对抗训练 [10 (https://arxiv.org/html/2607.03744#bib.bib27),17 (https://arxiv.org/html/2607.03744#bib.bib28)]。我们使用冻结的WavLM-large和RoBERTa-large作为代表性的单模态骨干网络;它们在这里是基线,而非贡献,因为我们关注的是CTD在这类编码器之上添加了多少价值,而不是如何最大化声学或语义的准确性。
### II-B 语音时间与双人互动线索
一系列临床和计算研究将抑郁症与一个人**何时**以及**说多少**联系起来,而非仅与声音质量相关。精神运动迟缓作为抑郁症的核心症状,表现为反应减慢、停顿更长更频繁以及语速降低 [28 (https://arxiv.org/html/2607.03744#bib.bib8),21 (https://arxiv.org/html/2607.03744#bib.bib9)]。基于这些观察,Fushimi等人 [13 (https://arxiv.org/html/2607.03744#bib.bib11)] 提出了会话级别的声学特征集,明确总结了整个DAIC-WOZ会话中的话语、停顿和回应间隔,并报告这些长期时间描述符(特别是停顿间隔统计)在与传统短帧特征结合时能改进受试者独立分类,但单独使用时贡献不大。另一平行研究方向在更精细的亚音位粒度上捕捉时间。例如,Huang等人 [16 (https://arxiv.org/html/2607.03744#bib.bib12)] 对声学**标志** n-gram 的计数和时长进行建模,Zhang等人 [30 (https://arxiv.org/html/2607.03744#bib.bib13),31 (https://arxiv.org/html/2607.03744#bib.bib14)] 表明标志对之间的时长在抑郁和健康说话者之间存在显著差异,并可通过检索将抑郁相关时间注入基于文本的大型语言模型。这些方法的共同点是都将时间视为**参与者自身信号**的属性。另一种互补的观点——两个对话者之间的**协调**本身具有信息价值——在抑郁症研究中相对尚未被探索。具体而言,Aldeneh等人 [2 (https://arxiv.org/html/2607.03744#bib.bib10)] 表明双人话轮切换特征(话轮控制、话轮切换和话轮保持间隔)能改善临床访谈中的情感发作检测,这促使我们对访谈者-参与者之间的交流进行显式建模。
### II-C 作为特征集的对话时间动态
我们的CTD模块通过一个固定的、先前发表的描述符集实现了双人视角的运作化。该公式源于Chou等人 [6 (https://arxiv.org/html/2607.03744#bib.bib15),7 (https://arxiv.org/html/2607.03744#bib.bib16)] 的欺骗检测工作,他们将双人互动分割为连续的询问/回答(问题/答案)话轮配对,并为每对计算话轮时长、其差值、和值与比值、每方的有声/静音比、回应延迟(犹豫)以及反馈/静音计数。他们的结果表明,话轮级时间与语音声学并非冗余,并且来自交流双方的时间都可能具有判别性。由于临床访谈共享这种问/答结构(Ellie提问,参与者回答),测试相同的双人时间描述符能否迁移到抑郁症检测是顺理成章的。我们基本上原样复用该描述符集,并作为固定的、任务无关的特征库,以便在DAIC-WOZ上的任何预测价值反映的是线索本身,而非数据集特定的特征工程。
### II-D 抑郁症多模态融合
文本-音频(以及音频-视觉)融合在抑郁症研究中已有在架构层面的广泛研究,涵盖早期/特征拼接、后期/决策融合以及基于注意力的融合 [1 (https://arxiv.org/html/2607.03744#bib.bib17)]。一个反复出现的困难是维度不平衡:与高维神经嵌入拼接的低维、可解释描述符集往往被后者淹没。先前的时间相关研究通过将时间仅与另一个流融合 [6 (https://arxiv.org/html/2607.03744#bib.bib15),13 (https://arxiv.org/html/2607.03744#bib.bib11)] 或通过检索等独立机制注入 [31 (https://arxiv.org/html/2607.03744#bib.bib14)] 来规避此问题。我们则固定每个模态的检测器和评估协议,仅改变模态**集合**和分数级融合规则,在**分数**层级进行融合,这样24维时间模块和1024维神经编码器各自贡献一个独立的会话概率,处于平等地位。这隔离了**添加CTD**这一操作的影响,与任何编码器或协议的改变无关,并且通过开发集调优的凸组合可以揭示每个模态实际获得的权重。
引用图说明图1:三模态管道。三个检测器共享同一访谈的Ask/Res话轮分割,但**实例粒度**不同:冻结的WavLM-large声学分支配到参与者**话语**级别,而RoBERTa-large语义分支和24维CTD分支汇聚到参与者**话轮**级别。每个分支输出一个会话级别的抑郁概率(\(p_A, p_T, p_{\mathrm{CTD}}\));分数级凸融合使用开发集调优的权重和阈值将它们组合。学习到的三路权重 \((0.0, 0.3, 0.7)\) 将声学流驱动至零,因此部署的系统简化为RoBERTa+CTD。
## III 资源
我们使用DAIC-WOZ [15 (https://arxiv.org/html/2607.03744#bib.bib5)],该数据集包含由动画虚拟访谈者("Ellie")进行的半结构化临床访谈,附带音频、时间对齐的转录文本以及以PHQ-8≥10二值化(抑郁)的PHQ-8标签 [18 (https://arxiv.org/html/2607.03744#bib.bib6)]。DAIC-WOZ在过去近十年中一直被视为抑郁症评估的基准。然而,它已知存在规模小、噪声大,并且容易出现可重复性和泄漏问题 [9 (https://arxiv.org/html/2607.03744#bib.bib29)]。因此,我们将其用作受控基准,而非作为临床部署准备就绪的证据。这些标签是自评筛查分数,而非临床诊断,因此我们始终将任务视为抑郁症**筛查**。我们使用官方受试者独立的训练/开发/测试划分。排除10个会话 {318,321,341,362,373,409,444,451,458,480},因为它们是Patapati [22 (https://arxiv.org/html/2607.03744#bib.bib24)] 编录的数据完整性问题的会话,如转录文本或音频不同步、长时间非访谈中断、缺失访谈者话语以及PHQ-8或二值标签不匹配。我们手动对照该编录检查了这些会话,但由于该工作手动**修复**了它们,我们采取更保守的路线——**排除**这些会话,以确保没有手动重建的数据进入训练或评估。唯一依赖标签的排除(409)遵循的是该已发布的问题编录,而非我们对标签的自行检查,确保不使用任何留出信息。此后,一个共享的清洗步骤移除空或短(<100毫秒)的参与者话语。这留下180个会话。应用官方划分并与所有三种模态对齐后,我们得到102个训练、33个开发、45个测试会话,分别有29、12和14位抑郁参与者,占比约30%。所有模态均源自相同的、基于转录文本的Ask/Res话轮分割,因此三个检测器看到的是相同的会话单元。
## IV 基线
每种模态都是一个独立训练、可部署的检测器,输出每个会话的抑郁概率。声学和语义分支有意设计为**标准基线**,由冻结的自监督编码器(WavLM-large、RoBERTa-large)和轻量级探测头部组成,遵循已确立的实践。相似文章
双人交互中抑郁检测的说话人感知时序聚合策略:一项基准研究
本文介绍了DEPOOL,一个受控基准,评估了六种时序聚合架构在六种冻结语音主干网络上的表现,用于双人交互中的抑郁检测,发现许多配置会坍缩为单类别预测,并且鲁棒性应作为一个关键标准。
概率文本时间序列抑郁症检测
本文提出PTTSD,一种从临床访谈转录中检测抑郁症严重程度的概率框架,该框架对不确定性进行建模并提供时间可解释性,在基准数据集上取得了具有竞争力的性能。
多模态对话状态信号的可靠性如何?来自远程双人协作任务的证据
本文评估了用于测量远程双人协作任务中对话状态(如认知负荷和权力)的多模态特征的预测准确性、跨任务泛化能力和重测信度。研究结果表明,语言特征预测良好但泛化能力差,在控制说话者身份后声学可靠性下降,而交互特征提供了最可靠的信号。
基于AI心理健康对话的被动抑郁严重程度评估的LLMs微调
本文提出一种对LLMs进行微调的方法,用于从AI心理健康应用的对话记录中直接预测PHQ-9抑郁严重程度评分,通过包含6,283名用户的增强数据集,实现了与临床阈值的强相关性。
自发语音中对话成功感知的声学和面部标记
本文使用多模态特征(声学、面部、轮流说话)分析自发性双人Zoom对话,以识别对话成功感知的标记,发现语音和面部运动的协调与更高的互动质量相关。