基于推特上自我报告ADHD和ASD用户的DSM-5抑郁症状群体层面剖析:一项使用高级NLP与统计分析的前瞻性研究

arXiv cs.CL 论文

摘要

本研究分析了来自自我报告ADHD和ASD用户的推文,利用NLP刻画DSM-5抑郁症状,发现尽管分类性能有限,但两组在症状表达上存在群体层面的差异。

arXiv:2607.05626v1 公告类型:新 摘要:背景:抑郁症常与ADHD和自闭症谱系障碍(ASD)共存,但这两个群体在症状表达上的群体层面差异仍未得到充分探索。目的:我们考察了患有ADHD和ASD的社交媒体用户在推文中表达DSM-5抑郁症状的方式是否存在差异,以及这种差异是否在不同抑郁内容过滤水平下持续存在。方法:我们分析了来自792名用户(622名ADHD;170名ASD)的1,282,437条推特,这些用户均在推特上自我报告了诊断。推文首先使用零样本NLI进行抑郁相关性预过滤,然后使用在ReDSM5上微调的MentalRoBERTa将其分类为九种DSM-5症状。每个用户的症状档案按均值中心化处理。我们应用L1惩罚逻辑回归结合交叉验证来区分ADHD和ASD用户,并辅以Pearson相关系数分析症状共现,通过自举法测试了五个过滤阈值下的稳健性。结果:MentalRoBERTa在保留集上实现了0.901的宏F1分数,优于原始的ReDSM5基准。ADHD与ASD的分类表现稳定但一般(交叉验证ROC-AUC为0.645-0.653)。认知问题、睡眠问题、食欲改变和疲劳倾向于ADHD,而自杀意念和快感缺失倾向于ASD。两组之间出现了一个大致共享的症状共现结构;没有一对症状满足我们对于稳健的疾病特异性差异的标准。结论:在不同阈值下,ADHD和ASD社交媒体用户之间与抑郁相关的语言存在一致的群体层面差异,这反映了可重复性而非临床有效性。研究结果属于探索性,并不确立个体层面上的不同现象学。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:41

# 在推特上自称ADHD和ASD用户中DSM-5抑郁症状的人群层面特征分析:一项使用高级NLP和统计分析的探索性研究
来源:https://arxiv.org/html/2607.05626
PhDFaculty of Computer and Information Science, University of Ljubljana, SloveniaDavid NabergojFaculty of Computer and Information Science, University of Ljubljana, SloveniaMScFaculty of Computer and Information Science, University of Ljubljana, SloveniaJure DemšarFaculty of Computer and Information Science, University of Ljubljana, SloveniaPhDFaculty of Computer and Information Science, University of Ljubljana, Slovenia

###### 摘要

背景:抑郁常与注意缺陷/多动障碍(ADHD)和自闭症谱系障碍(ASD)共病。然而,这些群体在抑郁症状表达上的人群层面差异仍未得到充分探索。

目的:本研究考察了患有ADHD和ASD的社交媒体用户在推文中表达《精神障碍诊断与统计手册》第五版(DSM-5)抑郁症状的方式是否存在差异,重点关注九种症状在人群层面的相对突出性,并检验在不同抑郁内容过滤阈值下观察到的差异是否保持稳定。

方法:我们分析了一个诊断披露推特数据集中的792名用户(622名ADHD;170名ASD)的1,282,437条推文。使用零样本NLI对推文进行抑郁相关性预过滤,然后使用在ReDSM5(一个专家标注数据集)上微调的MentalRoBERTa将推文分类为九种DSM-5抑郁症状。为每位用户创建九症状特征并进行均值中心化。我们应用了带5折交叉验证的L1惩罚逻辑回归来区分ADHD和ASD用户,并辅以皮尔逊相关性来评估症状共现。我们通过五种过滤阈值(0.45–0.65)和1,000次重采样自助法以及跨阈值符号一致性检验了方法的稳健性。

结果:对于多标签抑郁症状分类,MentalRoBERTa在留出集上达到了宏F1为0.901(8/9个症状的F1≥0.85),显著优于原始ReDSM5基准。使用拟合逻辑回归进行ADHD与ASD分类得到了稳定但适中的性能(跨阈值的交叉验证ROC-AUC为0.645–0.653)。系数分析显示,认知问题、睡眠问题、食欲改变和疲劳持续倾向于ADHD,而自杀意念和快感缺失持续倾向于ASD(所有阈值下自助法选择率≥0.90)。精神运动性障碍显示出相同的倾向ASD的方向效应,稳定性略低。相关性分析显示两组之间大致共享的症状共现结构(36对中有17对在两组中均通过自助法检验且方向相同);没有一对满足我们预先指定的稳健的疾病特有差异标准。

结论:在多个分析阈值下,ADHD和ASD的自述社交网络用户中抑郁相关语言的人群层面差异被一致观察到,表明抑郁症状表达的独特模式。这些差异反映了人群层面的可重复性,而非临床有效性,应被视为探索性的,而非个体层面不同抑郁现象学的证据。

关键词:抑郁;DSM-5;ADHD;自闭症谱系障碍;数字表型;MentalRoBERTa;社交网络;自然语言处理;推特。

通讯作者:Muhammad Rizwan Faculty of Computer and Information Science University of Ljubljana Večna pot 113, Ljubljana 1000, Slovenia 邮箱:[email protected] (https://arxiv.org/html/2607.05626v1/mailto:[email protected])

## 1 引言

重度抑郁障碍是注意缺陷/多动障碍(ADHD)[1 (https://arxiv.org/html/2607.05626#bib.bib1),22 (https://arxiv.org/html/2607.05626#bib.bib22)]和自闭症谱系障碍(ASD)[2 (https://arxiv.org/html/2607.05626#bib.bib2),25 (https://arxiv.org/html/2607.05626#bib.bib25)]中最常见的精神共病之一,这两种是高度流行且常共病的神经发育疾病[23 (https://arxiv.org/html/2607.05626#bib.bib23),24 (https://arxiv.org/html/2607.05626#bib.bib24)]。流行病学研究一致报告,与神经典型对照者相比,这两个人群的抑郁症状发生率更高,患病率估计值因年龄、性别和确定方式而异很大。除了患病率差异,一些临床报告表明,抑郁本身的现象学在这两组之间也存在差异,包括执行功能障碍[3 (https://arxiv.org/html/2607.05626#bib.bib3),30 (https://arxiv.org/html/2607.05626#bib.bib30)]、自闭症倦怠和伪装相关的疲惫[4 (https://arxiv.org/html/2607.05626#bib.bib4),27 (https://arxiv.org/html/2607.05626#bib.bib27)]、奖赏敏感性和孤独感[5 (https://arxiv.org/html/2607.05626#bib.bib5)]以及自杀风险[26 (https://arxiv.org/html/2607.05626#bib.bib26)]等方面的差异。然而,同时描绘两种疾病中所有九种DSM-5症状的定量人群规模证据仍然相对匮乏[6 (https://arxiv.org/html/2607.05626#bib.bib6)]。

我们受到两个实际考虑的驱动。首先,社交媒体话语提供了一个相当大的自然窗口,用于观察个体如何描述自己的症状,补充了临床访谈的结构化语言[7 (https://arxiv.org/html/2607.05626#bib.bib7)],并且是更广泛的数字表型范式的一部分,用于从自然数据流推断行为和心理健康状态[43 (https://arxiv.org/html/2607.05626#bib.bib43)]。越来越多的研究应用自然语言处理技术分析社交媒体帖文来研究抑郁语言[8 (https://arxiv.org/html/2607.05626#bib.bib8),9 (https://arxiv.org/html/2607.05626#bib.bib9),33 (https://arxiv.org/html/2607.05626#bib.bib33)],方法涵盖从词袋和词典特征[10 (https://arxiv.org/html/2607.05626#bib.bib10),32 (https://arxiv.org/html/2607.05626#bib.bib32)]到基于Transformer模型(如BERT[11 (https://arxiv.org/html/2607.05626#bib.bib11),34 (https://arxiv.org/html/2607.05626#bib.bib34)])的上下文嵌入及其领域适应版本(如MentalBERT和MentalRoBERTa[14 (https://arxiv.org/html/2607.05626#bib.bib14)])。公开的诊断披露数据集也使得能够描述自称患有ADHD或ASD的个体如何在线描述自己的经历[12 (https://arxiv.org/html/2607.05626#bib.bib12),13 (https://arxiv.org/html/2607.05626#bib.bib13),31 (https://arxiv.org/html/2607.05626#bib.bib31)],尽管这些分析通常侧重于词汇或主题差异,而非正式定义的抑郁症状维度。其次,领域适应Transformer的成熟——特别是MentalRoBERTa[14 (https://arxiv.org/html/2607.05626#bib.bib14)],它在大型心理健康社交媒体语料库上进一步预训练了RoBERTa[15 (https://arxiv.org/html/2607.05626#bib.bib15)]——使得将DSM-5抑郁标准作为多标签文本分类任务并在句子层面达到可信性能成为可能。我们直接基于ReDSM5语料库[16 (https://arxiv.org/html/2607.05626#bib.bib16)]构建,其中每个句子都由持牌心理学家标注了九种DSM-5重性抑郁发作症状是否存在。

另一个方法论挑战促使了我们的分析设计。结合零样本预过滤、监督症状分类和下游组间比较的流程对设计选择敏感,特别用于零样本抑郁相关性过滤的概率阈值。我们没有选择单一截断值,而是将阈值视为敏感性参数,并在五个值(0.45–0.65)之间报告结果,要求发现在此范围内保持一致后才进行解释。我们进一步将阈值内自助法稳定性与跨阈值方向一致性结合起来,以区分稳健发现与那些幅度不稳定或缺乏支持的发现。

我们将本研究定位为探索性和人群层面。我们不试图筛选个体、诊断或从文本估计临床严重程度。相反,我们询问每个DSM-5抑郁症状维度在自述ADHD和ASD用户之间在人群层面是否存在系统性差异。本文做出四项贡献。第一,它提供了探索性的人群层面描述,说明九种DSM-5抑郁症状在两个社区之间如何被差异化强调。第二,它引入了一个两阶段分类流程,将零样本抑郁相关性预过滤器与在ReDSM5上微调的MentalRoBERTa多标签分类器相结合,并进行逐标签决策阈值校准。第三,它贡献了一个分级稳健性方案,明确区分了同时得到自助法稳定性和跨阈值一致性支持的发现与那些未得到支持的发现。第四,它增加了一项用户层面的共现分析,检验两组在抑郁症状成对组织方式上是否存在差异。

参见图注图1:用于检测ADHD和ASD推特用户中抑郁症状模式的研究工作流。用于检测ADHD/ASD推文中抑郁症状的两阶段NLI + 微调分类器流程,随后进行用户层面特征分析,为并行共现分析和判别性(ADHD vs ASD)分析提供输入。

## 2 方法

在本节中,我们首先描述数据来源,然后介绍两阶段推文层面分类流程及其校准。接着,我们讨论如何构建用户层面症状特征并比较ADHD和ASD用户,包括我们阈值敏感性设计和基于自助法的稳健性标准,最后以补充性的症状共现分析结束。图1 (https://arxiv.org/html/2607.05626#S1.F1) 概述了整体研究工作流。

### 2.1 数据来源

#### 2.1.1 推特数据

我们从IEEE DataPort[17 (https://arxiv.org/html/2607.05626#bib.bib17)]获取了推特心理健康数据集。源数据集涵盖多种心理健康状况的自述用户;在本研究中,我们仅考虑自述诊断为ADHD或ASD的用户子集,不分析该数据集包含的其他诊断组。该数据集包含那些在公开帖文中明确自述临床诊断为ADHD或ASD的用户的推文——不仅仅是症状的表达。用户和时间线帖子是通过使用诊断相关搜索规则的推特全文API识别的,从而能够检索历史推文。所有数据均公开可用,收集时间为2020年9月1日至2021年8月31日[17 (https://arxiv.org/html/2607.05626#bib.bib17)]。为与数据集保持一致,我们通篇使用“推特”,并注意到该平台在收集期后已更名为X。原始语料库包含来自622名自述ADHD用户的1,009,002条推文和来自170名自述ASD用户的273,435条推文(总计:来自792名用户的1,282,437条推文)。

#### 2.1.2 分类器训练的标注语料库

我们在ReDSM5[16 (https://arxiv.org/html/2607.05626#bib.bib16)]上训练并评估了多标签症状分类器,这是一个专家标注的Reddit帖子语料库,由持牌心理学家标注每个句子是否存在九种DSM-5重性抑郁发作标准[18 (https://arxiv.org/html/2607.05626#bib.bib18)](抑郁心境、快感缺失、食欲改变、睡眠问题、精神运动性障碍、疲劳、无价值感、认知问题和自杀意念)。预处理后,工作语料库包含1,814个句子,其中1,427个(1,379个唯一句)至少带有一个DSM-5症状标签。我们发现症状标签分布不均匀,即无价值感(n = 340)、抑郁心境(n = 364)、自杀念头(n = 190)、疲劳(n = 140)、快感缺失(n = 137)、睡眠问题(n = 112)、认知问题(n = 61)、食欲改变(n = 48)和精神运动性障碍(n = 35)。这种不平衡推动了下面第二阶段(多类模型训练)中描述的类别不平衡处理方法,并且我们在全文对最稀疏标签的发现会相应地更加谨慎地进行解释。ReDSM5训练数据的句子级标注在很大程度上减轻了领域转移[19 (https://arxiv.org/html/2607.05626#bib.bib19)]。与完整的Reddit帖子不同,句子级Reddit数据在长度和语义粒度方面更接近推文。由于症状提及通常在一个句子内表达(例如,“我有持续的悲伤”),句子级训练鼓励模型学习症状特定的上下文表示,而不是依赖长文档上下文。

### 2.2 推文层面分类流程

#### 2.2.1 第一阶段:零样本抑郁内容筛选

在第一阶段,我们在症状级分类之前筛选了所有1,282,437条推文的抑郁相关性,使用基于自然语言推理(NLI)的零样本抑郁相关性预过滤器:一个交叉编码器NLI模型(cross-encoder/nli-deberta-v3-large)针对两个候选标签对每条推文进行评分:“存在DSM-5抑郁症状”和“不存在DSM-5抑郁症状”。简而言之,基于NLI的零样本分类将每个候选标签重新表述为一个假设(例如,“这段文本表达了一种DSM-5抑郁症状”),并使用在大规模蕴含数据上训练的模型来判断推文(前提)是否蕴含该假设,这允许同一个预训练模型在没有任何标签特定训练数据的情况下对任意候选标签进行评分。我们强调,此阶段仅执行二元抑郁相关性筛选:它不识别推文表达的是哪种DSM-5症状。该判定完全由第二阶段微调的多标签MentalRoBERTa分类器做出,该分类器是流程中唯一产生症状级(多标签)输出的组件。它基于DeBERTa-v3架构[46 (https://arxiv.org/html/2607.05626#bib.bib46)],并且此类交叉编码器NLI模型在标准NLI基准上报告了同等规模通用蕴含模型中最强的已发表准确性[20 (https://arxiv.org/html/2607.05626#bib.bib20),47 (https://arxiv.org/html/2607.05626#bib.bib47)],使用SentenceTransformers Cross-Encoder类在合并的SNLI和MultiNLI语料库上训练[47 (https://arxiv.org/html/2607.05626#bib.bib47)]。监督替代方案需要一个人工标注的推特抑郁相关性语料库,而该语料库对于此人群不存在,并且存在将相关性筛选与第二阶段的症状级标签混淆的风险。由于我们的第一阶段任务本身就是一个蕴含判断(即推文是否蕴含其表达DSM-5抑郁症状的假设),我们认为这些通用NLI基准与其作为抑郁相关性筛选的适用性直接相关,而不需要零样本专用基准。

零样本NLI分类器的传统默认决策边界是正标签概率为0.5。

相似文章

在线社区中抑郁症的认知语言指标:基于DistilBERT和全息约简表示的分析

arXiv cs.CL

本文提出了一种混合模型,将DistilBERT嵌入与全息约简表示向量相结合,编码认知语言特征(第一人称代词、绝对化词语、负面情绪比率),用于检测Reddit帖子中的抑郁症,取得了0.94的宏F1值,并表明理论驱动的特征能够补充上下文嵌入,为可解释的心理健康自然语言处理提供支持。