超越社交媒体的心理健康障碍检测:现有数据集的系统综述

arXiv cs.CL 论文

摘要

对非社交媒体自由文本数据集进行系统综述,用于心理健康障碍检测,识别当前资源中的偏见与空白。

arXiv:2607.03540v1 公告类型:新 摘要:及时检测心理健康障碍是一项重要的社会挑战。用于辅助检测的自然语言处理(NLP)和机器学习(ML)方法主要依赖于从社交媒体收集的数据。然而,这类数据集通常存在采样偏差和固有的伦理与隐私问题。克服这些局限性的一个途径是使用非社交媒体数据。我们首次对心理健康研究中使用的非社交媒体自由文本数据集进行了全面综述。我们采用PRISMA方法进行调研,并审查了多种语言的数据集。我们发现基于非社交媒体自由文本的数据集主要集中在英语和抑郁症检测上。这些数据集在人口统计、平台、数据类型、标注技术和研究方法上也各不相同。该系统综述还揭示了关键空白,并强调了开发更多样化、更可靠且更具临床相关性的资源的机会。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:37

# 心理健康障碍检测超越社交媒体:现有数据集的系统性综述
来源:https://arxiv.org/abs/2607.03540
查看PDF (https://arxiv.org/pdf/2607.03540)

> 摘要:及时发现心理健康障碍是一个重要的社会挑战。用于辅助检测的自然语言处理(NLP)和机器学习(ML)方法主要依赖从社交媒体收集的数据。然而,这类数据集通常存在抽样偏差以及固有的伦理和隐私问题。克服这些局限性的途径之一是利用非社交媒体数据。我们首次对心理健康研究中非社交媒体的自由文本数据集进行了全面综述。我们采用PRISMA方法开展调查,并审查了多种语言可用的数据集。我们发现,基于非社交媒体自由文本的数据集主要集中在英语和抑郁症检测上。这些数据集在人口统计、平台、数据类型、标注技术和方法论方面也存在差异。本次系统性综述还揭示了关键空白,并强调了开发更多样化、更可靠且具有临床相关性的资源的机遇。

## 提交历史

来自:Sadiya Sayara Chowdhury Puspo [查看电子邮件 (https://arxiv.org/show-email/f079a157/2607.03540)] **\[v1\]** 2026年7月3日星期五 18:00:17 UTC(7,165 KB)

相似文章