概率文本时间序列抑郁症检测

arXiv cs.CL 论文

摘要

本文提出PTTSD,一种从临床访谈转录中检测抑郁症严重程度的概率框架,该框架对不确定性进行建模并提供时间可解释性,在基准数据集上取得了具有竞争力的性能。

arXiv:2511.04476v2 公告类型: 替换 摘要: 准确且可解释的抑郁症严重程度预测对于临床决策支持至关重要,然而现有模型通常缺乏不确定性估计和时间可解释性。我们提出PTTSD,一种从临床访谈话语序列中检测抑郁症的概率框架,能够预测PHQ-8分数并对校准后的不确定性进行建模。PTTSD包括序列到序列和序列到单一两种变体,两者都结合了LSTM、自注意力机制和残差连接,并使用高斯或Student-t分布输出头,通过负对数似然进行训练。序列到序列变体使得能够分析预测置信度在访谈过程中如何随时间变化,尽管目标是单一的会话级别分数。在E-DAIC和DAIC-WOZ上进行评估,PTTSD在纯文本系统中取得了具有竞争力的性能(例如,E-DAIC上MAE = 3.85,DAIC上3.55),并产生了良好校准的预测区间。消融实验证实了注意力和概率建模的价值,而三部分校准分析和定性案例研究则凸显了不确定性感知预测的临床相关性。
查看原文
查看缓存全文

缓存时间: 2026/07/13 08:00

# 概率性文本时间序列抑郁检测  
来源:https://arxiv.org/html/2511.04476  
Fabian Schmidt¹, Seyedehmoniba Ravan², Vladimir Vlassov¹  

¹ 瑞典皇家理工学院计算机科学系 ² 乌普萨拉大学信息技术系 通讯作者:[email protected] (https://arxiv.org/html/2511.04476v2/mailto:[email protected])  

###### 摘要  
对抑郁严重程度的准确且可解释的预测对于临床决策支持至关重要,然而现有模型往往缺乏不确定性估计和时间可解释性。我们提出PTTSD,一个从临床访谈话语序列中进行抑郁检测的*概率性*框架,该框架预测PHQ-8分数并对校准后的不确定性进行建模。PTTSD包含序列到序列和序列到单一两种变体,两者均结合了LSTM、自注意力、残差连接以及通过负对数似然训练的Gauss或Student’s-t输出头。序列到序列变体能够实现关于模型预测信心在访谈过程中如何演变的时间分析,尽管目标变量是单一的会话级分数。在E-DAIC和DAIC-WOZ上的评估表明,PTTSD在纯文本系统中达到了有竞争力的性能(例如,E-DAIC上MAE=3.85,DAIC上MAE=3.55),并产生了良好校准的预测区间。消融实验证实了注意力和概率性建模的价值,而三部分校准分析和定性案例研究凸显了不确定性感知预测的临床相关性。

概率性文本时间序列抑郁检测  

Fabian Schmidt¹, Seyedehmoniba Ravan², Vladimir Vlassov¹  
¹ 瑞典皇家理工学院计算机科学系,瑞典  
² 乌普萨拉大学信息技术系,瑞典  
通讯作者:[email protected] (https://arxiv.org/html/2511.04476v2/mailto:[email protected])  

## 1 引言  

抑郁仍然是全球主要致残原因之一,影响着全球超过3亿人WHO(2017 (https://arxiv.org/html/2511.04476#bib.bib32),2022 (https://arxiv.org/html/2511.04476#bib.bib33))。在临床医生有限的数字疗法和远程护理中,自动评估抑郁症状严重程度的可扩展工具提供了宝贵的支持。在这些工具中,处理临床访谈的基于文本的系统在预测标准化分数(如PHQ-8)方面显示出巨大潜力Kroenke等人(2009 (https://arxiv.org/html/2511.04476#bib.bib13))。  

近期方法通常将访谈转录建模为话语序列,并采用LSTM、Transformer或大型语言模型(LLMs)等架构Mandal等人(2025 (https://arxiv.org/html/2511.04476#bib.bib16));Fang等人(2023a (https://arxiv.org/html/2511.04476#bib.bib6));Nykoniuk等人(2025 (https://arxiv.org/html/2511.04476#bib.bib20));Sadeghi等人(2024 (https://arxiv.org/html/2511.04476#bib.bib29))。然而,大多数现有方法产生标量严重程度估计,而未量化不确定性——这在高风险的临床环境中是一个重要局限,因为当“PHQ-8 = 12”这样的预测伴随置信度度量时,其可操作性更强。  

我们认为,临床访谈的顺序性质为解决这一差距提供了自然机会。每个话语提供一个上下文相关的观察,累积序列逐步缩小了可能严重程度估计的空间。虽然预测目标,即PHQ-8评分,是单一的会话级值而非时变量,但*输入*本质上是顺序的,并对其进行建模提供了点估计系统所不具备的两个关键优势。首先,它允许概率模型捕获*偶然不确定性*,即由稀疏、矛盾或模糊语言引起的不确定性,并表达这种不确定性如何随着上下文积累而解决。其次,它允许可解释的时间分析:识别哪些话语驱动预测变化,以及模型信心在访谈过程中如何稳定(或未能稳定)。  

我们引入PTTSD,一个*概率性文本时间序列抑郁检测*模型,从话语级序列对PHQ-8分数进行时间上基于上下文的、校准的预测。PTTSD解决了该领域的两个关键差距。首先,它将点预测替换为经过校准的分布输出(通过负对数似然训练的Gauss或Student's-t头),使临床医生能够评估预测的严重程度和模型对该预测的信心。其次,通过其序列到序列(seq-to-seq)变体,它揭示了模型的预测信念如何在访谈中演变,提供了先前系统所缺乏的时间可解释性。因此,临床医生可以识别模型何时变得自信,哪些话语驱动了预测变化,以及哪里存在模糊性。  

我们在DAIC和E-DAIC基准上使用原始和重新转录的访谈评估PTTSD,并在标准指标(例如,DAIC上MAE=3.55,RMSE=4.77;E-DAIC上MAE=3.85,RMSE=4.52)上展示了有竞争力的性能,匹配或超过了近期纯文本基线的保留测试集表现,且无需依赖提示工程或手工特征。重要的是,PTTSD额外提供了校准的不确定性估计和可解释的时间动态——这些能力在先前系统中是不存在的。消融和敏感性分析进一步验证了概率损失设计、注意力机制和校准指标的贡献。  

总之,我们的主要贡献是:  

- • 我们提出了PTTSD,一个完全概率的序列模型,从话语级文本时间序列联合预测PHQ-8分数和校准的不确定性,并提供了彻底的校准、时间和敏感性分析以评估不确定性质量和临床相关性。  
- • 我们引入了seq-to-one和seq-to-seq两种形式。后者揭示了模型的预测信念(包括点估计和不确定性)如何在访谈过程中演变,用于时间可解释性分析,例如识别关键话语和追踪模型信心何时稳定。  
- • 我们在E-DAIC和DAIC测试集上通过实验证明了在纯文本模型中的有竞争力结果,同时提供了超越先前工作点预测的、经过校准的可解释不确定性估计。  

## 2 相关工作  

文本时间序列建模一直是近期自动抑郁检测工作的核心,特别是在临床访谈和治疗对话中。先前工作主要依赖点估计神经方法,如LSTM和基于注意力的Transformer,来建模文本数据中的时间依赖关系Mandal等人(2025 (https://arxiv.org/html/2511.04476#bib.bib16));Fang等人(2023a (https://arxiv.org/html/2511.04476#bib.bib6));Nykoniuk等人(2025 (https://arxiv.org/html/2511.04476#bib.bib20))。此类模型捕获顺序模式,但缺乏量化时间不确定性的机制。虽然LLMs提取更丰富的文本特征Sadeghi等人(2024 (https://arxiv.org/html/2511.04476#bib.bib29));Chen等人(2024 (https://arxiv.org/html/2511.04476#bib.bib3)),但大多数系统仍然是启发式或点估计,专注于结构或多模态融合,而非概率推理。相比之下,我们完全概率的端到端模型直接从原始话语中捕获不确定性,无需手工提示。  

值得注意的是,Qureshi等人(2019b (https://arxiv.org/html/2511.04476#bib.bib24))使用带有注意机制的多任务学习进行联合回归和分类,但不包含不确定性建模。类似地,基于提示的方法,如Zhang和Guo(2024 (https://arxiv.org/html/2511.04476#bib.bib36))通过语言模型提示将抑郁检测转化为小样本分类任务,但仍产生单点预测。基于图的架构Burdisso等人(2023 (https://arxiv.org/html/2511.04476#bib.bib2));Chen等人(2024 (https://arxiv.org/html/2511.04476#bib.bib3))对跨话语和问题的话语级上下文进行建模,提供增强的可解释性和结构感知,尽管它们也通常省略校准的不确定性。  

一个罕见的例外是Dia等人(2024 (https://arxiv.org/html/2511.04476#bib.bib5)),他们为创伤后应激障碍检测提出了一个随机Transformer,引入概率组件(如随机激活)来对跨模态的不确定性进行建模。然而,他们的工作聚焦于视觉信号,未涉及文本时间序列或PHQ-8回归。最近,Zhang等人(2025 (https://arxiv.org/html/2511.04476#bib.bib37))应用多实例学习(MIL)框架从长转录本估计抑郁严重程度,并为句子级的抑郁线索分配置信度分数。这种方法确实提供了实例级可解释性,但底层模型在贝叶斯意义上并非显式概率的。  

近期一些工作探索了公平或校准的不确定性估计。Li和Zhou(2025 (https://arxiv.org/html/2511.04476#bib.bib14))提出了公平不确定性量化(FUQ),用于跨人口群体的PHQ回归,采用保形预测区间。虽然对于公平性有效,但FUQ在分布输出级别操作,并未对访谈内部的时间演变进行建模。其他系统,如Mao等人(2023 (https://arxiv.org/html/2511.04476#bib.bib17))和Guo等人(2022 (https://arxiv.org/html/2511.04476#bib.bib10)),采用带有文本特征的BiLSTM或Transformer,有时通过主题信号增强,但仅关注点估计损失目标。  

## 3 概率性文本时间序列抑郁检测  

参见图注  
图1:PTTSD概览。话语被嵌入,通过BiLSTM和多头自注意力及残差连接编码,并映射到PHQ-8的预测分布。  

### 3.1 问题形式化  

我们将PHQ-8估计建模为对话语序列的概率回归。给定一个包含T个话语的转录本{u₁, ..., u_T}和话语嵌入e₁:ᵗ,模型将序列映射到会话级分数y ∈ ℝ的分布:  

p(y | e₁:ᵗ; θ)。  

我们研究两种PTTSD模型变体:  

- • *seq-to-one*:从完整话语序列预测一个单一分布。  
- • *seq-to-seq*:为每个前缀e₁:ᵗ生成一个逐话语分布p(y | e₁:ᵗ; θ),并针对相同的会话级标签y进行训练。  

我们注意到PHQ-8目标变量是每次会话的单一分数,而非时变量。因此,seq-to-seq变体并非对变化的目标进行建模。相反,它揭示了模型的*预测信念*——即其点估计μ̂_t和不确定性σ̂_t——如何随着对话上下文的积累而演变。这有两个目的:(i) 它允许时间可解释性分析,例如识别触发预测严重程度或不确定性大幅变化的话语,以及(ii) 它作为一种正则化形式,鼓励模型从部分上下文形成合理的估计,而非仅依赖全局序列特征。  

具体而言,一次访谈中(μ̂_t, σ̂_t)的轨迹支持三种类型的分析:(i) 不确定性如何随着上下文积累而降低,标志着模型“已看到足够”的信号;(ii) 误差和不确定性对齐,以测量高预测不确定性是否确实对应高误差(就相关性和区间覆盖而言);以及(iii) 识别关键话语,其中预测均值急剧变化或注意力质量集中,这可能对应访谈中临床显著的时刻。  

### 3.2 数据  

我们使用痛苦分析访谈语料库(DAIC)Gratch等人(2014 (https://arxiv.org/html/2511.04476#bib.bib9))和扩展DAIC(E-DAIC)DAIC‐WOZ项目(2019 (https://arxiv.org/html/2511.04476#bib.bib4))数据集,其中包含匿名的半结构化访谈转录和相关的患者健康问卷-8(PHQ-8)Kroenke等人(2009 (https://arxiv.org/html/2511.04476#bib.bib13))抑郁评分。每位参与者的数据包含从转录文件中提取的话语序列,以及指示抑郁严重程度的PHQ-8评分。PHQ-8是一种标准化的自我报告工具,评分范围为0到24,评估抑郁症状严重程度。DAIC‐WOZ语料库包含189次临床访谈会话。其扩展版本E-DAIC包含275次会话。两者仍然是少数公开可用的、基于对话的临床语料库,带有PHQ-8抑郁评分标注,并在心理健康研究典型的严格伦理和隐私保护下收集。关于PHQ-8和DAIC的更多细节分别见附录A (https://arxiv.org/html/2511.04476#A1)和附录B (https://arxiv.org/html/2511.04476#A2)。  

### 3.3 话语嵌入  

我们使用预训练句子编码器表示每个话语。我们的主要模型使用all-MiniLM-L6-v2 Sentence Transformer¹,这是一个仅有2200万个参数的紧凑模型,在Hugging Face MTEB嵌入排行榜上跨广泛任务取得了有竞争力的表现Muennighoff等人(2023 (https://arxiv.org/html/2511.04476#bib.bib18))。我们还评估了使用MentalBERT的替代模型变体Ji等人(2022 (https://arxiv.org/html/2511.04476#bib.bib11)),一个在心理健康相关语料上预训练的领域自适应BERT模型²。关于分词、池化和其他编码器细节见附录D (https://arxiv.org/html/2511.04476#A4)。  

### 3.4 主干:BiLSTM + 自注意力  

我们采用多层单向LSTM,将X编码为隐藏状态H ∈ ℝ^{T×H}。然后我们应用带残差连接的多头自注意力:  

A = Attention(H) + H,  

允许每个话语嵌入基于完整的对话上下文进行调节。在*seq-to-one*中,我们通过平均池化随时间聚合A。在*seq-to-seq*中,我们保留逐话语表示a_t。  

### 3.5 不确定性感知输出头  

独立的MLP头预测预测分布的参数,以建模PHQ-8分数(μ̂)和不确定性(σ̂)。  

p(y | ·) ∈ {𝒩(μ̂, σ̂²), Student-t(μ̂, σ̂, ν)}。  

对于*seq-to-one*,头以池化向量作为输入;对于*seq-to-seq*,头以每个a_t作为输入,预测每个时间步的参数。  

### 3.6 训练目标  

我们最小化真实PHQ-8在预测分布下的NLL。对于*seq-to-one*:  

ℒ = -log p(y | e₁:ᵗ; θ)。  

对于*seq-to-seq*,我们平均每个时间步的逐话语NLL。  

(注意:由于文章未完整结束,翻译至现有内容。后续内容可依此继续。)

相似文章

使用LLM生成的嵌入从社交媒体文本中进行可解释的抑郁症检测

arXiv cs.CL

本文研究了使用大语言模型(LLMs)和监督分类器从社交媒体文本中检测抑郁症的方法,提出了一种基于提示的嵌入方法以增强可解释性。在多个数据集上的实验表明,零样本LLMs在二分类任务中表现良好,但在细粒度严重程度分类上表现不佳;而基于LLM摘要嵌入的监督模型在多分类和有序分类任务中取得了更一致的表现。