超越社交媒体的心理健康障碍检测:现有数据集的系统综述
摘要
对非社交媒体自由文本数据集进行系统综述,用于心理健康障碍检测,识别当前资源中的偏见与空白。
arXiv:2607.03540v1 公告类型:新
摘要:及时检测心理健康障碍是一项重要的社会挑战。用于辅助检测的自然语言处理(NLP)和机器学习(ML)方法主要依赖于从社交媒体收集的数据。然而,这类数据集通常存在采样偏差和固有的伦理与隐私问题。克服这些局限性的一个途径是使用非社交媒体数据。我们首次对心理健康研究中使用的非社交媒体自由文本数据集进行了全面综述。我们采用PRISMA方法进行调研,并审查了多种语言的数据集。我们发现基于非社交媒体自由文本的数据集主要集中在英语和抑郁症检测上。这些数据集在人口统计、平台、数据类型、标注技术和研究方法上也各不相同。该系统综述还揭示了关键空白,并强调了开发更多样化、更可靠且更具临床相关性的资源的机会。
查看缓存全文
缓存时间: 2026/07/07 04:37
# 心理健康障碍检测超越社交媒体:现有数据集的系统性综述 来源:https://arxiv.org/abs/2607.03540 查看PDF (https://arxiv.org/pdf/2607.03540) > 摘要:及时发现心理健康障碍是一个重要的社会挑战。用于辅助检测的自然语言处理(NLP)和机器学习(ML)方法主要依赖从社交媒体收集的数据。然而,这类数据集通常存在抽样偏差以及固有的伦理和隐私问题。克服这些局限性的途径之一是利用非社交媒体数据。我们首次对心理健康研究中非社交媒体的自由文本数据集进行了全面综述。我们采用PRISMA方法开展调查,并审查了多种语言可用的数据集。我们发现,基于非社交媒体自由文本的数据集主要集中在英语和抑郁症检测上。这些数据集在人口统计、平台、数据类型、标注技术和方法论方面也存在差异。本次系统性综述还揭示了关键空白,并强调了开发更多样化、更可靠且具有临床相关性的资源的机遇。 ## 提交历史 来自:Sadiya Sayara Chowdhury Puspo [查看电子邮件 (https://arxiv.org/show-email/f079a157/2607.03540)] **\[v1\]** 2026年7月3日星期五 18:00:17 UTC(7,165 KB)
相似文章
基于大语言模型的社交媒体抑郁风险评估
研究者提出一种零样本LLM系统,通过Reddit帖子评估抑郁风险,在F1得分上表现优异,展示了可扩展的心理健康监测能力。
基于推特上自我报告ADHD和ASD用户的DSM-5抑郁症状群体层面剖析:一项使用高级NLP与统计分析的前瞻性研究
本研究分析了来自自我报告ADHD和ASD用户的推文,利用NLP刻画DSM-5抑郁症状,发现尽管分类性能有限,但两组在症状表达上存在群体层面的差异。
Team MKC 在 CLPsych 2026:通过社交媒体时间线动态捕捉和表征心理健康变化
本文介绍了一个基于LLM的流水线,用于从按时间顺序排列的社交媒体帖子中分析心理健康变化,参与CLPsych 2026共享任务。它可以进行帖子级别评估和用户级别时间建模,以捕捉心理健康的转变。
psytechlab 在 CLPsych 2026:利用自然语言处理方法和大型语言模型进行社交媒体文本分析
本文描述了在 CLPsych 2026 共享任务中,使用包括 LSTM、BERT 和 LLMs 在内的自然语言处理方法分析社交媒体帖子中的心理健康状态,并在摘要任务中取得了最高的一致性得分。
MentalMARBERT:面向阿拉伯语心理健康障碍检测的领域自适应预训练与两阶段微调
本文提出了MentalMARBERT,一个面向社交媒体文本中阿拉伯语心理健康障碍检测的领域自适应语言模型。该框架采用领域自适应预训练和两阶段微调方法,在新构建的包含50,670条推文的阿拉伯语心理健康数据集上实现了0.877的准确率和0.861的宏F1分数。