在线社区中抑郁症的认知语言指标:基于DistilBERT和全息约简表示的分析
摘要
本文提出了一种混合模型,将DistilBERT嵌入与全息约简表示向量相结合,编码认知语言特征(第一人称代词、绝对化词语、负面情绪比率),用于检测Reddit帖子中的抑郁症,取得了0.94的宏F1值,并表明理论驱动的特征能够补充上下文嵌入,为可解释的心理健康自然语言处理提供支持。
arXiv:2606.00026v1 公告类型:新
摘要:本文研究了将基于认知的语言特征与基于Transformer的嵌入相结合是否能够提高在线文本中抑郁症的自动检测效果。基于贝克的抑郁认知理论,研究提取了可测量的认知扭曲特征,包括第一人称代词密度、绝对化词语以及Reddit帖子中抑郁相关社区和对照社区的负面情绪。使用Kaggle Reddit自杀与抑郁症检测数据集的一个子集,比较了两种分类流程:基线使用TF-IDF嵌入与朴素贝叶斯,以及混合模型将DistilBERT句子嵌入与编码认知语言特征的全息约简表示向量拼接,随后进行逻辑回归。混合DistilBERT HRR模型取得了0.94的宏F1值,而TF-IDF基线为0.80,5折交叉验证的F1从0.83提升到0.92,AUC从0.958提升到0.981。
查看缓存全文
缓存时间: 2026/06/02 15:35
# 在线社群中抑郁症的认知-语言指标:基于 DistilBERT 和全息约简表示的分析 来源:https://arxiv.org/html/2606.00026 ###### 摘要 本文探讨了将基于认知的语言特征与基于变换器的上下文嵌入相结合,是否能提升对在线文本中抑郁症的自动检测效果。本研究基于贝克的抑郁症认知理论,从 Reddit 上与抑郁症相关和对照社群中提取可测量的认知扭曲特征,包括第一人称代词密度、绝对化词语使用频率以及消极情绪词比例。研究使用了 Kaggle Reddit 自杀与抑郁症检测数据集中的 1,937 条帖子子集,比较了两种分类流程:作为基线的 TF-IDF 嵌入结合朴素贝叶斯,以及一种混合模型,该模型将 DistilBERT 句子嵌入与编码了认知语言特征的全息约简表示 (HRR) 向量拼接,再结合逻辑回归。混合 DistilBERT⊕HRR 模型的宏 F1 分数达到 0.94,而 TF-IDF 基线为 0.80;5 折交叉验证的 F1 分数从 0.83 提升至 0.92,AUC 从 0.958 提升至 0.981。这些改进表明,理论驱动的特征提供了超越单纯上下文嵌入的互补信号,而 HRR 组件则提供了模型预测与潜在认知结构之间的可解释关联。结果表明,基于认知的混合表示是面向可解释心理健康 NLP 的一个有前景的方向,并为未来在更大规模、纵向数据集以及为长文本设计的模型上的工作提供了动力。 **关键词:** 抑郁症检测,自然语言处理,DistilBERT,全息约简表示,认知-语言特征,Reddit,心理健康 ## 1. 引言 抑郁症影响着全球约 3.32 亿人,并且仍然是最容易被忽视的心理健康状况之一 (世界卫生组织,2025 (https://arxiv.org/html/2606.00026#bib.bib16))。传统的诊断方法依赖于人工流程,如临床访谈和自我报告问卷,这些方法难以规模化。这些方法资源密集、容易受到人为偏差影响,并且由于污名化或专业资源有限,许多人无法获得这些服务 (Tejaswini 等,2024 (https://arxiv.org/html/2606.00026#bib.bib15))。社交媒体的兴起为通过计算分析用户生成的文本来检测抑郁症的语言指标创造了重要机会。 从认知科学的角度来看,抑郁症会系统地影响语言产生。贝克的抑郁症认知理论 (Beck 等,1979 (https://arxiv.org/html/2606.00026#bib.bib2)) 认为,抑郁症与特定的认知扭曲有关,包括过度概括、二分法思维和过度的自我关注,并且这些扭曲会延伸到书面语言中。De Choudhury 等人 (2013 (https://arxiv.org/html/2606.00026#bib.bib4)) 的实证研究表明,抑郁症患者使用更多的第一人称单数代词、更多的负面情绪词汇以及更少的社会关系指代。这些语言特征可以为了解个体的认知状态提供一个直观的窗口,使得文本分析成为连接认知科学和心理健康研究的天然桥梁。 Reddit 具有匿名、长帖结构以及诸如 r/depression 和 r/SuicideWatch 等专门的心理健康社群,为这类研究提供了理想的语料库,正如 Tadesse 等人 (2019 (https://arxiv.org/html/2606.00026#bib.bib14)) 所强调的。目前存在几个公开可用的数据集,包括本研究所使用的 Kaggle Reddit 自杀与抑郁症检测数据集 (Komati, 2021 (https://arxiv.org/html/2606.00026#bib.bib8)),以及文献中广泛使用的 eRisk 基准数据集 (Losada 等,2020 (https://arxiv.org/html/2606.00026#bib.bib9))。 ## 2. 研究假设、动机与目标 一种结合认知-语言特征提取(如代词使用、情感词汇和二分法语言)与基于变换器的上下文嵌入的混合文本分析方法,将比任何一种方法单独使用,都能从 Reddit 帖子中实现更准确且更具可解释性的抑郁症检测。具体来说,将理论驱动的认知特征与数据驱动的深度表示相结合,将在针对性的 TF-IDF 基线模型基础上,使 F1 分数得到有意义的提升,同时提供基于贝克认知框架的可解释输出。 与强化学习 (RL) 的联系也颇具说服力:抑郁状态可能在结构上与已知的强化学习失效模式相似,包括有偏见的奖励信号、僵化的信念更新以及崩溃的探索。构建一个基于这些认知概念的检测系统,而不是将文本视为纯粹的统计模式匹配问题,可以发展出可迁移的见解,了解理论驱动的特征工程如何同时提升模型性能和可解释性。 具体的可衡量目标如下: 1. (i) 收集并预处理一个包含至少 2,000 条来自抑郁症相关和对照子版块 Reddit 帖子的语料库,并进行适当的伦理考量和数据清洗。 2. (ii) 实施并评估至少两种文本分析方法,衡量精确率、召回率和宏 F1 分数。 3. (iii) 分析已识别的认知-语言特征(二分法词语频率、第一人称代词密度、消极情绪词比例)并评估其区分能力。 4. (iv) 开发一种结合认知-语言特征与变换器嵌入的混合模型,目标是在基线基础上实现有意义且显著的 5-10% 的 F1 提升改进。 5. (v) 生成可解释的模型输出,将预测结果映射回特定的认知-语言标记。 ## 3. 重要性与知识贡献 抑郁症是全球范围内导致残疾和自杀的主要原因之一 (世界卫生组织,2025 (https://arxiv.org/html/2606.00026#bib.bib16)),可扩展的早期检测工具有助于缩小症状出现与治疗之间的差距。世界卫生组织估计,受影响者中只有不到一半接受了治疗,在低收入环境中这一差距更大。能够在公开的社交媒体文本上运行的自动化筛查工具,可以通过识别可能受益于早期干预的个人来补充临床支持。 本研究的主要知识贡献在于结合了两个目前相互脱节的研究方向。NLP 研究人员使用深度学习模型取得了高分类准确率,但通常缺乏心理学理论的支撑。认知科学家已经识别出抑郁症的稳健语言标记,但通常分析的是小型临床样本,而非大规模社交媒体数据。本研究整合了这两种视角,贡献了一种既数据驱动又理论指导的方法论。 如果成功,这项研究将证明认知基础不仅有助于结果的可解释性,还能提升 NLP 模型在心理健康应用中的稳健性和泛化能力。该方法论随后可以被调整用于检测其他认知障碍(如焦虑症、创伤后应激障碍),并扩展到其他语言和平台,从而为更广泛地推动人工智能在医疗保健领域的应用做出贡献。 ## 4. 现有解决方案的批判性分析 评估了三种在社交媒体文本中进行抑郁症检测的可靠方法。每种方法都代表了研究人员在解决此问题时会考虑的合理方法论。 ### 4.1 方法一:基于 LIWC 的心理语言学特征提取 语言查询与词频统计 (LIWC) 词典是一种成熟的从文本中提取心理语言学特征的工具 (Pennebaker 等,2015 (https://arxiv.org/html/2606.00026#bib.bib10))。它将词语分类到心理维度,如情感过程、认知过程和代词类型。Tadesse 等人 (2019 (https://arxiv.org/html/2606.00026#bib.bib14)) 使用 LIWC 特征结合机器学习分类器集成来检测 Reddit 上与抑郁症相关的帖子,使用特征组合和 SVM 分类器达到了 91% 的准确率。Islam 等人 (2018 (https://arxiv.org/html/2606.00026#bib.bib5)) 类似地使用了来自 Facebook 数据的 LIWC 特征,报告准确率在 60-80% 之间,具体取决于特征子集和分类器。 然而,LIWC 有明显的局限性:它使用封闭词表、词袋方法,忽略了词序、否定和上下文。例如,“I am not sad”和“I am sad”在负面情绪维度上会得到相似的 LIWC 分数。此外,Ricard 等人 (2018 (https://arxiv.org/html/2606.00026#bib.bib12)) 发现,依赖于词典特征在用户生成的社交媒体内容上,分类模型仅达到了不显著的 0.63 AUC,表明其可能缺乏可靠抑郁症筛查所需的灵敏度。另外,LIWC 是一个专有工具,需要许可费用,限制了可重复性。 在本研究中,LIWC 无法捕获上下文含义的缺陷至关重要,因此被**拒绝**采用。Reddit 上与抑郁症相关的语言通常是微妙的、讽刺性的,或者嵌入在需要超越词语级别计数的理解的叙述中。本研究改为使用开源替代方案(NLTK 和自定义词典)来提取类似特征。 ### 4.2 方法二:TF-IDF 与集成机器学习分类器 词频-逆文档频率 (TF-IDF) 结合 SVM、随机森林或逻辑回归等分类器是文本分类任务的标准基线。Chereddy 等人 (2024 (https://arxiv.org/html/2606.00026#bib.bib3)) 使用 TF-IDF 特征结合 SVM 进行抑郁症检测,发现 SVM 优于朴素贝叶斯,但需要显著更长的训练时间。 关键限制在于 TF-IDF 独立处理每个词,丢失了语义关系和上下文。Sabharwal 等人 (2025 (https://arxiv.org/html/2606.00026#bib.bib13)) 对 Reddit 抑郁分类进行了全面比较,使用九种传统机器学习算法与基于 BERT 的变换器进行对比。他们的结果显示,最佳传统模型(随机森林加 TF-IDF)达到 95% 的准确率,朴素贝叶斯达到 87%,而 BERT 达到 97%——存在 10 个百分点的差距。这一发现与 Tadesse 等人 (2019 (https://arxiv.org/html/2606.00026#bib.bib14)) 早期的研究结果相矛盾,后者报告了使用传统特征达到 91% 的准确率,这表明性能会因数据集特征和预处理选择的不同而有显著差异。 虽然本研究使用 TF-IDF 作为基线,但它无法捕捉区分抑郁症指示性语言与表面相似文本所必需的语义细微差别。因此,TF-IDF 被**拒绝**用作主要方法。 ### 4.3 方法三:微调 BERT/变换器模型 基于变换器的模型,特别是 BERT 及其变体,代表了当前的最新技术水平。Sabharwal 等人 (2025 (https://arxiv.org/html/2606.00026#bib.bib13)) 报告了在 Reddit 数据上使用基于 BERT 的多头注意力变换器达到了 97% 的分类准确率。这些模型能够捕获词语之间的上下文关系,并能处理否定、讽刺和复杂的句子结构。 然而,这些模型也有明显的缺点:它们需要大量的计算资源,完整 BERT 至少有 1.1 亿个参数,推理需要 GPU 内存。Bao 等人 (2024 (https://arxiv.org/html/2606.00026#bib.bib1)) 发现,虽然微调后的变换器能达到 86-93% 的分类准确率,但上下文中的 LLM 方法(少样本提示)可能低至约 45% 的准确率,这表明模型配置会极大地影响结果。至关重要的是,变换器模型是“黑箱”——临床医生无法轻易理解为何特定帖子被标记,这是临床采用的主要障碍 (Sabharwal 等,2025 (https://arxiv.org/html/2606.00026#bib.bib13))。 纯粹的微调 BERT 方法被**拒绝**用作唯一方法,因为它缺乏可解释性,并且计算需求超出了本研究的限制。本研究转而使用轻量级的 DistilBERT 嵌入与可解释的认知-语言特征相结合,在性能和可解释性之间取得了平衡。 ### 4.4 矛盾发现的总结 现有文献中存在显著差异。Tadesse 等人 (2019 (https://arxiv.org/html/2606.00026#bib.bib14)) 报告在 Reddit 数据上使用特征工程化的神经模型达到了 91% 的准确率,而 Sabharwal 等人 (2025 (https://arxiv.org/html/2606.00026#bib.bib13)) 发现在一个可比数据集上,最低的传统模型仅有 87%,但微调后的 BERT 变换器达到了 97%。相反,Bao 等人 (2024 (https://arxiv.org/html/2606.00026#bib.bib1)) 展示了微调后的变换器准确率在 86-93% 之间,具体取决于标签粒度。这些差异可能源于数据集大小和来源、标注方案(二分类 vs. 症状级别)以及预处理流程的不同,这强调了透明方法论和可重复评估的重要性。 ## 5. 方法 本研究使用了 Kaggle Reddit 自杀与抑郁症检测数据集 (Komati, 2021 (https://arxiv.org/html/2606.00026#bib.bib8)),收集了 1,000 条抑郁类帖子和 1,000 条对照帖子的平衡样本。经过预处理——包括去除 URL 和 Markdown、剥离 HTML 以及至少 10 个词的长度过滤——最终保留了 1,937 条帖子用于分析。基于贝克 (1979 (https://arxiv.org/html/2606.00026#bib.bib2)) 认知理论的认知-语言特征被提取出来,涵盖五个第一人称代词、二十个绝对化词语(例如“总是”、“完全”)以及 48 个消极情绪词。实施并评估了两个分类流程,使用了精确率、召回率、宏 F1 和 5 折交叉验证。 ### 5.1 方法一:TF-IDF 与多项式朴素贝叶斯(基线) TF-IDF 向量化器配置为 `max_features=5000` 和 `ngram_range=(1,2)`,以在词汇表达能力和较小语料库规模之间取得平衡,并去除英语停用词以减少噪音。在一个 80/20 分层划分(1,549 训练,388 测试)上训练了一个多项式朴素贝叶斯分类器。  如图 1 (https://arxiv.org/html/2606.00026#S5.F1) 所示,该模型实现了 0.80 的宏 F1 和 0.83 的 5 折交叉验证 F1,证实了稳定的泛化能力。分类器识别出的最具抑郁指示性的词汇包括“suicide”、“kill”和“anymore”,这与贝克 (1979 (https://arxiv.org/html/2606.00026#bib.bib2)) 框架预期的心理语言学信号一致。 ### 5.2 方法二:混合 DistilBERT⊕HRR 与逻辑回归 方法二生成 768 维的 DistilBERT [CLS] 嵌入以捕获上下文化的语义,以及 256 维的全息约简表示 (HRR) 向量以编码四个认知-语言特征。这些向量使用 NumPy 的水平堆叠进行拼接,产生一个 1,024 维的混合表示。DistilBERT 代表上下文化的词元级语义(细微差别、否定、叙述),而 HRR 向量则根据贝克理论捕获存在哪些认知模式。 HRR 编码器 (Kelly and Tomkins-Flana... (原文被截断,保留其完整性))
相似文章
使用LLM生成的嵌入从社交媒体文本中进行可解释的抑郁症检测
本文研究了使用大语言模型(LLMs)和监督分类器从社交媒体文本中检测抑郁症的方法,提出了一种基于提示的嵌入方法以增强可解释性。在多个数据集上的实验表明,零样本LLMs在二分类任务中表现良好,但在细粒度严重程度分类上表现不佳;而基于LLM摘要嵌入的监督模型在多分类和有序分类任务中取得了更一致的表现。
基于大语言模型的社交媒体抑郁风险评估
研究者提出一种零样本LLM系统,通过Reddit帖子评估抑郁风险,在F1得分上表现优异,展示了可扩展的心理健康监测能力。
psytechlab 在 CLPsych 2026:利用自然语言处理方法和大型语言模型进行社交媒体文本分析
本文描述了在 CLPsych 2026 共享任务中,使用包括 LSTM、BERT 和 LLMs 在内的自然语言处理方法分析社交媒体帖子中的心理健康状态,并在摘要任务中取得了最高的一致性得分。
DreamerNLplus:使用混合规则和RAG方法从社交媒体时间线对心理健康动态进行可解释建模
本文介绍了DreamerNLplus,这是一个混合框架,结合了LLM、DeBERTa、随机森林、规则方法和RAG,用于从社交媒体时间线对心理健康动态进行建模,以应对CLPsych 2026共享任务,在时间摘要和变化检测的子任务中取得了最高排名。
基于AI心理健康对话的被动抑郁严重程度评估的LLMs微调
本文提出一种对LLMs进行微调的方法,用于从AI心理健康应用的对话记录中直接预测PHQ-9抑郁严重程度评分,通过包含6,283名用户的增强数据集,实现了与临床阈值的强相关性。