基于大语言模型的社交媒体抑郁风险评估

arXiv cs.CL 论文

摘要

研究者提出一种零样本LLM系统,通过Reddit帖子评估抑郁风险,在F1得分上表现优异,展示了可扩展的心理健康监测能力。

arXiv:2604.19887v1 公告类型:新增 摘要:抑郁症是全球最常见且致残性最高的精神疾病之一,常被漏诊和未充分治疗。社交媒体平台的大量普及为自动化监测心理健康提供了丰富的自然语言信号。本研究提出一种基于大语言模型(LLM)的系统,通过对Reddit帖子进行八种与抑郁相关情绪的多标签分类,并计算加权严重程度指数,实现抑郁风险评估。该方法在带注释的DepressionEmo数据集(约6,000条帖子)上以零样本方式进行评估,并应用于2024–2025年间从四个子版块收集的469,692条真实评论。最佳模型gemma3:27b 取得 micro-F1=0.75、macro-F1=0.70,与专门微调的模型(BART:micro-F1=0.80、macro-F1=0.76)表现相当。真实场景分析显示各社区风险画像一致且时间稳定,r/depression与r/anxiety之间存在显著差异。研究结果证明,以低成本、可扩展的方式实现大规模心理监测是可行的。
查看原文
查看缓存全文

缓存时间: 2026/04/23 10:02

# 基于大模型的社交媒体抑郁风险评估  
来源:https://arxiv.org/html/2604.19887  
Giorgia Gulino¹,Manuel Petrucci¹  
¹意大利罗马 Guglielmo Marconi 大学人文科学系  
通讯作者:[email protected]  

###### 摘要  

抑郁症是全球最常见、最致残的精神障碍之一,却常被漏诊或治疗不足。社交媒体平台的普及为自动化监测心理健康提供了丰富的自然语言信号。本文提出一种基于大语言模型(LLM)的系统,通过对 Reddit 帖文进行八种抑郁相关情绪的多标签分类,并计算加权严重度指数,实现抑郁风险评估。方法在零样本设定下于标注的 *DepressionEmo* 数据集(≈6,000 帖)上评估,并应用于 2024–2025 年四个子版块采集的 469,692 条真实帖文。最佳模型 gemma3:27b 取得 micro-F1=0.75、macro-F1=0.70,与专门微调的 BART(micro-F1=0.80,macro-F1=0.76)结果相当。真实环境分析显示各社区风险画像稳定且差异显著,r/depression 与 r/anxiety 间尤为明显。研究表明,低成本、可扩展的大规模心理监测方案切实可行。  

关键词:抑郁症;数字心理健康;大语言模型;Reddit;自动检测;提示工程;严重度指数  

## 1 引言  

抑郁症是全球最普遍、最致残的精神障碍,WHO 将其列为首要致残原因[11,25]。尽管有效疗法已存在,大量病例仍未被诊断或治疗不足,尤其在年轻群体中[11]。及时识别抑郁痛苦信号对早期干预至关重要。  

日常生活的数字化使社交媒体成为研究心理行为与情绪表达的天然观察站。人们在网上分享想法与情绪,构成间接却相关的心理健康信息源[15,5,17]。计算心理学研究表明,Reddit、Twitter 等平台上的文本包含情绪痛苦的语言标记,可用于早期识别抑郁风险[6,8,1]。  

自然语言处理(NLP)的进步使大规模在线文本的系统分析成为可能。基于 Transformer 的架构[7]及新近的大语言模型(LLM)可在大规模语料上学习深层语言表征,对情感细微之处具备经典方法难以捕捉的敏感度[9,12]。  

相较于微调模型,LLM 的最大运营优势在于可在零样本模式下部署,无需领域标注数据,大幅降低开发成本,同时提升对快速演变语言环境的适应性[20]。  

本文贡献如下:  

1. 基于八个临床相关情绪类别的加权抑郁严重度指数,灵感来自标准化 PHQ-9 与 BDI-II 量表。  
2. 通过 LLM 零样本多标签分类抑郁情绪的提示工程方法。  
3. 在 *DepressionEmo* 数据集[21]上系统评估九款本地运行 LLM(0.6B–27B 参数)与文献微调基线。  
4. 对 469,692 条 Reddit 帖文(2024–2025)进行真实环境分析,考察情绪分布、风险画像与纵向趋势。  

本系统无意替代临床评估,而是作为可扩展的大规模心理监测支持与分流工具,在有限且经济的本地硬件上运行。  

论文结构:第 2 节回顾抑郁严重度临床测量、NLP 抑郁检测演进及抑郁相关情绪研究;第 3 节阐述我们的严重度指数与引导 LLM 的提示设计;第 4 节报告受控与真实环境实验;第 5 节讨论结果;第 6 节总结。  

## 2 相关工作  

本节梳理三方面研究:临床抑郁严重度测量(2.1)、NLP 与机器学习抑郁检测演进(2.2)、抑郁相关情绪状态(2.3)。  

### 2.1 临床抑郁严重度测量  

抑郁严重度传统上通过标准化量表评估。DSM-5 定义九项核心症状:心境低落、快感缺失、睡眠与食欲紊乱、疲劳、注意力下降、无价值感或罪恶感、死亡念头[3,16]。PHQ-9 与 BDI-II 通过累加评分区分轻、中、重度抑郁[19]。  

尽管每项症状名义上等权,临床实践中特定指标权重更高:持续无望感是自杀观念与行为的强风险因子[22],自杀意图需立即干预。本文权重方案据此设定。  

### 2.2 NLP 与机器学习抑郁检测  

早期研究依赖传统 ML(SVM、逻辑回归)与手工语言特征:负面情绪词、第一人称代词、绝对化表达频率[6,1,10]。虽在受控环境有效,泛化能力有限。  

深度学习与 Transformer[7]带来显著提升。面向社交媒体语言的 BERTweet[18]与临床文本的 ClinicalBERT[2]在域内数据上可达 80–90% 准确率[13,9]。近期 GPT-3.5/GPT-4 在零/少样本场景亦展现筛查能力[20,23,14]。但 LLM 性能与规模强相关,大模型计算成本高昂[20]。  

### 2.3 抑郁相关情绪  

文献已识别抑郁症患者语言中反复出现的情绪类别。*DepressionEmo* 数据集[21]定义八类:愤怒、认知功能障碍、空虚、无望、孤独、悲伤、自杀意图、无价值。研究证实这些情绪并非独立,而是共现形成潜在抑郁痛苦构念[21,24]。  

## 3 方法  

### 3.1 抑郁严重度指数  

我们利用 LLM 对帖文标注的八维情绪构建复合指数。每种情绪视为二元变量(存在=1, absent=0),乘以其临床相关性权重 w_i:  

S = 1·anger + 1·cog_dysfunction  
  + 1·emptiness + 2·hopelessness  
  + 1·loneliness + 1·sadness  
  + 3·suicide_intent + 2·worthlessness  

权重依据:悲伤、孤独、愤怒、空虚、认知功能障碍为痛苦指标但特异性低(w=1);无望与无价值提示病情更重、预后更差(w=2);自杀意图最高危,需立即关注(w=3)[22,3]。  

SS 映射至四级严重度,参考 PHQ-9/BDI-II 阈值:  

- S=0–1:极小或无抑郁  
- S=2–4:轻度抑郁  
- S=5–6:中度抑郁  
- S≥7:重度抑郁(高警报)  

理论最高分 S=13(全部情绪存在)。  

### 3.2 提示工程  

情绪分析通过提示工程完成:每条帖文配结构化指令,引导 LLM 输出一致且机器可读的多标签分类。基础提示:  

```
分析以下 Reddit 评论的情感:“{post}”。  
请从下列情绪中选择适用的类别:{emotions}。  
以 JSON 对象回答,每项情绪为 true 或 false。
```

如需直接计算分数,扩展提示:  

```
……再按以下权重计算严重度分数:  
suicide_intent=3, hopelessness=2, worthlessness=2,  
cognitive_dysfunction=1, sadness=1, emptiness=1,  
loneliness=1, anger=1。  
返回字段 "severity_score",为被标记为 true 的情绪权重之和。
```

模型输出示例:  

```json
{
  "anger": false,
  "cognitive_dysfunction": true,
  "emptiness": false,
  "hopelessness": true,
  "loneliness": true,
  "sadness": true,
  "suicide_intent": false,
  "worthlessness": true,
  "severity_score": 7
}
```

所有模型均采用零样本模式,不提供任何示例,以评估其内在能力[12,20]。  

## 4 实验  

评估分两个阶段:受控基准与大规模真实环境分析。本节介绍完整实验框架:数据集与实验设置、参评模型、评价指标。  

### 4.1 数据集与实验设置  

##### 受控基准:DepressionEmo  

*DepressionEmo*[21] 含 ≈6,000 条已标注 Reddit 帖文,采用多标签方案。我们沿用作者提出的 80/20 训练/验证划分,对所有 LLM 仅在验证集评估,无微调。  

##### 真实环境基准:Reddit 2024–2025  

自研爬虫采集四个心理健康子版块:r/anxiety、r/depression、r/depression_partners、r/mentalhealth,时间 2024 年 1 月至 2025 年 5 月,共 469,692 帖(2024 年 318,000,2025 上半年 151,692)。各版块分布见表1。  

### 4.2 参评模型  

受控阶段对比九款本地 LLM(0.6B–27B,经 Ollama 本地运行)与文献微调基线(SVM、LightGBM、XGBoost、GAN-BERT、BERT、BART)。

相似文章

使用LLM生成的嵌入从社交媒体文本中进行可解释的抑郁症检测

arXiv cs.CL

本文研究了使用大语言模型(LLMs)和监督分类器从社交媒体文本中检测抑郁症的方法,提出了一种基于提示的嵌入方法以增强可解释性。在多个数据集上的实验表明,零样本LLMs在二分类任务中表现良好,但在细粒度严重程度分类上表现不佳;而基于LLM摘要嵌入的监督模型在多分类和有序分类任务中取得了更一致的表现。

在线社区中抑郁症的认知语言指标:基于DistilBERT和全息约简表示的分析

arXiv cs.CL

本文提出了一种混合模型,将DistilBERT嵌入与全息约简表示向量相结合,编码认知语言特征(第一人称代词、绝对化词语、负面情绪比率),用于检测Reddit帖子中的抑郁症,取得了0.94的宏F1值,并表明理论驱动的特征能够补充上下文嵌入,为可解释的心理健康自然语言处理提供支持。