使用LLM生成的嵌入从社交媒体文本中进行可解释的抑郁症检测

arXiv cs.CL 论文

摘要

本文研究了使用大语言模型(LLMs)和监督分类器从社交媒体文本中检测抑郁症的方法,提出了一种基于提示的嵌入方法以增强可解释性。在多个数据集上的实验表明,零样本LLMs在二分类任务中表现良好,但在细粒度严重程度分类上表现不佳;而基于LLM摘要嵌入的监督模型在多分类和有序分类任务中取得了更一致的表现。

arXiv:2506.06616v2 公告类型:替换 摘要:准确且可解释地检测社交媒体中的抑郁语言,有助于早期识别心理健康状况并提供及时的干预。本文研究了使用大语言模型(LLMs)和传统机器学习分类器进行三项基于社交媒体的心理健康预测任务:二分类抑郁症检测、抑郁症严重程度分类以及抑郁症、PTSD和焦虑症之间的鉴别诊断。我们比较了零样本LLMs与基于传统文本嵌入、心理语言学特征以及LLM生成的心理健康摘要嵌入训练的监督分类器。在多个公开的社交媒体文本数据集和五折交叉验证实验中,我们发现零样本LLMs在二分类抑郁症检测中表现出色且泛化能力强,但在细粒度严重程度预测上表现不佳。相比之下,基于LLM摘要嵌入训练的监督模型通常能达到更准确且一致的表现,尤其是在多分类和有序分类任务中。这些发现突显了当前LLMs在心理健康预测中的优势与局限,并表明将LLMs用作语义解释器而非仅作为端到端分类器,可能为构建更有效且可解释的心理健康评估系统提供一个有前景的方向。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:43

# 基于社交媒体文本的可解释抑郁症检测:利用大语言模型生成的嵌入

来源:https://arxiv.org/html/2506.06616
11机构:美国印第安纳州里士满厄勒姆学院计算机科学系
11邮箱:[email protected]; [email protected]
22机构:美国密歇根州伊普斯兰提东密歇根大学计算机科学系
22邮箱:[email protected]
\*通讯作者

###### 摘要

准确且可解释地检测社交媒体中的抑郁语言,有助于早期识别心理健康状况并为及时干预提供依据。本文研究了在大语言模型(LLM)和传统机器学习分类器在三个基于社交媒体的心理健康预测任务中的应用:二元抑郁症分类、抑郁症严重程度分类,以及抑郁症、创伤后应激障碍和焦虑症的鉴别诊断。我们将零样本大语言模型与基于传统文本嵌入、心理语言学特征以及大语言模型生成的心理健康摘要嵌入进行训练的有监督分类器进行了比较。在多个公开的社交媒体文本数据集和五折交叉验证实验中,我们发现零样本大语言模型在二元抑郁症分类中表现出强大的性能和泛化能力,但在细粒度严重程度预测方面表现不佳。相比之下,基于大语言模型摘要嵌入进行训练的有监督模型通常能实现更准确且更一致的性能,尤其是在多分类和有序分类任务中。这些发现凸显了当前大语言模型在心理健康预测方面的优势与局限性,并表明将大语言模型用作语义解释器(而非仅作为端到端分类器)可能为构建更有效、更可解释的心理健康评估系统提供一条有前景的方向。

## 1 引言

抑郁症等心理健康障碍影响着全球数亿人,由于社会污名、成本或缺乏护理途径,许多病例仍未得到诊断或治疗。随着个体越来越多地在社交媒体上表达自己的想法和情感,这些平台已成为评估心理健康的宝贵实时数据来源。从社交媒体帖子中自动检测抑郁语言,可以成为大规模、低成本的心理健康筛查和干预的有前途工具。先前的抑郁症分类方法通常依赖两类特征:心理语言学标记和基于预训练语言模型生成的文本嵌入。虽然基于语言查询与词频(LIWC)词典等心理语言学特征具有可解释性,但它们表现力有限。另一方面,传统句子嵌入能够捕捉丰富的语义信息,但可能缺乏对心理健康预测任务至关重要的特定情感线索。

在本工作中,我们提出了一种新颖的基于提示的嵌入方法,该方法利用大语言模型的推理能力来生成更具可解释性和语义丰富性的嵌入。我们并非直接嵌入原始输入文本,而是向大语言模型提出一个面向心理健康的问题,并为其提供用户的社交媒体帖子。然后,我们使用句子编码器从大语言模型生成的摘要中提取嵌入,并将其用作分类器的输入。这种方法通过迫使大语言模型生成超越表面句法的语义丰富解释,从而引导推理。它还通过允许大语言模型过滤无关信息来减少噪声。此外,它通过生成可供临床医生在干预或诊断过程中查阅的中间摘要,增强了可解释性。我们在五个基于社交媒体的抑郁症数据集上评估了我们的方法,发现大语言模型派生的摘要嵌入虽然在所有情况下并不总是更优,但在监督任务中,与使用原始文本嵌入的模型相比,通常能提升预测性能,并且在有序多分类任务中优于预训练的大语言模型。

本文的其余部分组织如下:第2节(https://arxiv.org/html/2506.06616#S2)回顾了相关工作,包括基于传统文本的社交媒体心理健康预测方法以及大语言模型在该领域的最新应用。第3节(https://arxiv.org/html/2506.06616#S3)介绍了我们的方法论,包括数据预处理、使用文本嵌入和心理语言学特征进行特征提取,以及大语言模型摘要嵌入的生成。第4节(https://arxiv.org/html/2506.06616#S4)报告了三个分类任务的实验结果:二元抑郁症分类、抑郁症严重程度分类,以及抑郁症、焦虑症和创伤后应激障碍的鉴别诊断。最后,第5节(https://arxiv.org/html/2506.06616#S5)对全文进行总结,讨论了关键发现和未来方向。

## 2 相关工作

### 2.1 基于语言的心理健康评估

文本数据,无论是来自书面语言、转录的语音还是在线互动,都为心理健康提供了一个强大的视角。众多研究表明,语言模式能够反映与心理障碍相关的情绪状态和临床症状。压力检测已通过多种文本来源进行了探索,包括在线博客和论坛帖子[1(https://arxiv.org/html/2506.06616#bib.bib1),2(https://arxiv.org/html/2506.06616#bib.bib2),3(https://arxiv.org/html/2506.06616#bib.bib3)]以及社交媒体互动[4(https://arxiv.org/html/2506.06616#bib.bib4),5(https://arxiv.org/html/2506.06616#bib.bib5),6(https://arxiv.org/html/2506.06616#bib.bib6),7(https://arxiv.org/html/2506.06616#bib.bib7)]。创伤后应激障碍的诊断也通过临床患者叙述[8(https://arxiv.org/html/2506.06616#bib.bib8),9(https://arxiv.org/html/2506.06616#bib.bib9)]、在线调查[10(https://arxiv.org/html/2506.06616#bib.bib10)]和转录的语音邮件[11(https://arxiv.org/html/2506.06616#bib.bib11)]进行。Sawalha等人[12(https://arxiv.org/html/2506.06616#bib.bib12)]认为,对半结构化虚拟访谈转录文本进行情感分析,使用基于VADER情感得分的随机森林模型,可以有效识别创伤后应激障碍患者。Mansoor等人[13(https://arxiv.org/html/2506.06616#bib.bib13)]引入了一种多模态AI模型,该模型分析多语言社交媒体数据以检测心理健康危机的早期迹象,并强调在现实世界心理健康系统中需要伦理保障和文化敏感的应用。Althoff等人[14(https://arxiv.org/html/2506.06616#bib.bib14)]使用计算话语方法,对基于文本消息的咨询对话进行了大规模定量分析。Ewbank等人[15(https://arxiv.org/html/2506.06616#bib.bib15)]开发了一种深度学习模型,用于在互联网认知行为疗法期间自动对患者话语进行分类。Bantilan等人[16(https://arxiv.org/html/2506.06616#bib.bib16)]提出了一种自然语言处理模型,用于检测远程治疗期间患者消息中的自杀风险,利用治疗师干预模式和专家注释来标记风险等级。这些研究突显了自然语言处理(NLP)在心理健康评估和干预方面日益增长的潜力,并展示了上下文和语言特征在这些模型现实世界适用性中的重要性。

### 2.2 用于心理健康预测的大语言模型

大语言模型的最新进展使其能够应用于广泛领域,包括心理健康状况的分析和预测。Xu等人[17(https://arxiv.org/html/2506.06616#bib.bib17)]评估了几种大语言模型在使用在线文本数据进行的心理健康预测任务上的表现。他们的研究结果表明,虽然零样本和少样本提示效果有限,但指令微调显著提高了准确性。Boggavarapu等人[18(https://arxiv.org/html/2506.06616#bib.bib18)]探索了使用增强检索生成(RAG)的大语言模型从临床笔记中预测心理健康相关的ICD-10-CM代码,发现当前的大语言模型在准确解释这些复杂代码方面仍然存在困难。他们的研究结果表明需要更好地将结构化医学知识整合到这些模型中。Malgaroli等人[19(https://arxiv.org/html/2506.06616#bib.bib19)]讨论了大语言模型通过改进诊断、监测和治疗来推进心理健康的潜力。他们也指出了诸如偏见、可及性和数据表征等挑战。Qian等人[20(https://arxiv.org/html/2506.06616#bib.bib20)]探索了基础模型(如大语言模型)如何通过个性化诊断、实时监测、情绪识别以及使用多模态数据的自适应干预来改变数字心理健康。他们提出了一个社会技术框架,该框架整合了受大脑启发的AI、临床监督和伦理考量。Hua等人[21(https://arxiv.org/html/2506.06616#bib.bib21)]综述了大语言模型在心理健康护理中的当前应用场景,并得出结论认为在咨询和临床支持方面存在有前景的用例,但大多数研究缺乏标准化的评估方法。这些研究共同表明了大语言模型在心理健康诊断和护理方面日益增长的潜力。解决模型可靠性、可解释性和评估严谨性方面的挑战,对于将大语言模型整合到现实临床环境至关重要。

### 2.3 作为推理和总结工具的大语言模型

除了直接分类,大语言模型还能对上下文进行推理,并总结复杂的叙述,以生成支持下游机器学习任务的结构化表示。SemCSE[22(https://arxiv.org/html/2506.06616#bib.bib22)]被提出作为一种无监督嵌入方法,该方法使用大语言模型生成的科学摘要总结作为语义丰富的训练信号,表明基于总结的表示可以提高下游任务的语义嵌入质量。Liu等人[23(https://arxiv.org/html/2506.06616#bib.bib23)]发现,从大语言模型生成的基因和细胞元数据描述中派生的嵌入,可以作为有效的语义表示,从而提高下游生物学分析任务的性能。此外,大语言模型可以用作中间表示生成器。Li和Zhou提出了一种无需训练的嵌入方法[24(https://arxiv.org/html/2506.06616#bib.bib24)],该方法将混合专家路由权重与隐藏状态表示相结合,表明大语言模型的内部激活也可以为下游嵌入任务提供有用的语义表示。这些工作激发了我们对基于总结的嵌入作为机制的探索,该机制结合了大语言模型的语义推理能力与传统分类器的透明度和效率。

## 3 方法

我们的方法主要分为五个阶段:数据预处理、文本嵌入与心理语言学特征提取、零样本大语言模型提示、大语言模型摘要嵌入生成,以及模型训练与评估。

### 3.1 数据预处理

我们对五个公开的基于社交媒体的心理健康数据集进行预处理,用于我们的实验:MHB[25(https://arxiv.org/html/2506.06616#bib.bib25)]、CAMS[26(https://arxiv.org/html/2506.06616#bib.bib26)]、HelaDepDet[27(https://arxiv.org/html/2506.06616#bib.bib27)]、RMHD[28(https://arxiv.org/html/2506.06616#bib.bib28)]和DepressionEmo[29(https://arxiv.org/html/2506.06616#bib.bib29)]。每个数据集由带有心理健康标签(主要与抑郁症相关)的用户生成的短文本条目组成。为了评估模型区分抑郁和非抑郁语言的能力,我们在组合数据集中包含了两个通用领域的Reddit控制数据集:RedditAITA[30(https://arxiv.org/html/2506.06616#bib.bib30)]和RedditTIFU[32(https://arxiv.org/html/2506.06616#bib.bib32)]作为非抑郁示例。选择这两个数据集是因为它们是公开可用的语料库,包含非正式的、第一人称的叙述,其风格与心理健康数据集中的社交媒体帖子相似。为了在两种控制来源之间保持平衡表示,我们对RedditTIFU进行了抽样,使其包含与RedditAITA相当的实例数量。

表 1:跨分类任务使用的数据集统计信息
| 数据集 | 任务 | 大小(帖子数) | 平均词数 | 标签(%) |
|--------|------|----------------|----------|------------|
| MHB[25] | 二元/鉴别诊断 | 7,452 | 253 | 抑郁症:43,焦虑症:45,创伤后应激障碍:12 |
| CAMS[26] | 二元 | 4,042 | 179 | 全部抑郁症 |
| HelaDepDet[27] | 二元/严重程度 | 33,498 | 120 | 最低:25,轻度:25,中度:23,重度:27 |
| RMHD[28] | 二元/鉴别诊断 | 658 | 236 | 抑郁症:34,焦虑症:25,其他:41 |
| DepressionEmo[29] | 二元 | 4,830 | 95 | 全部抑郁症 |
| RedditAITA[30] | 二元 | 24,795 | 386 | 全部非抑郁症控制 |
| RedditTIFU[32] | 二元 | 25,685 | 341 | 全部非抑郁症控制 |
| 总计(唯一) | — | 100,960 | — | — |

我们首先通过一系列预处理步骤对每个数据集进行清洗。删除重复条目,并仅保留文本长度在第10个百分位数和第90个百分位数之间的帖子,以排除异常值。对于每个数据集,仅保留与下游任务相关的列,同时删除诸如文本长度、作者发帖数和点赞数等元数据字段。我们的实验设置支持三种分类任务:

1. **二元抑郁症分类**:我们将所有五个与抑郁症相关的数据集与RedditAITA和RedditTIFU非抑郁症控制集结合,训练模型以区分抑郁与非抑郁内容。
2. **抑郁症严重程度分类**:使用提供分级的抑郁严重程度标签的HelaDepDet[27]数据集,我们训练模型预测包括最低、轻度、中度和重度在内的级别。
3. **鉴别诊断分类**:我们使用包含抑郁症、焦虑症和创伤后应激障碍多类别注释的MHB[25]和RMHD[28]数据集,评估模型区分相关心理健康状况的能力。

预处理后数据集的描述性统计信息,包括帖子数量、标签类别和以词数衡量的平均文本长度,汇总于表1(https://arxiv.org/html/2506.06616#S3.T1)。对于使用文本嵌入和机器学习分类器的监督实验,我们应用了确定性的五折分层交叉验证。每个任务数据集被划分为五个折叠,同时保持每个折叠内的类别分布。在每次迭代中,模型在四个折叠上进行训练,并在剩余的保留折叠上进行评估。值得注意的是,两种基于零样本大语言模型的分类方法不需要模型训练。这些方法直接使用提示策略在完整任务数据集上进行评估,不进行参数更新。

### 3.2 文本嵌入与心理语言学特征提取

为了建立基线性能,我们评估了基于两种传统特征表示组合进行训练的分类器:

#### 3.2.1 文本嵌入

我们提取了

相似文章

在线社区中抑郁症的认知语言指标:基于DistilBERT和全息约简表示的分析

arXiv cs.CL

本文提出了一种混合模型,将DistilBERT嵌入与全息约简表示向量相结合,编码认知语言特征(第一人称代词、绝对化词语、负面情绪比率),用于检测Reddit帖子中的抑郁症,取得了0.94的宏F1值,并表明理论驱动的特征能够补充上下文嵌入,为可解释的心理健康自然语言处理提供支持。