句级抑郁症状识别中的候选生成与定义引导验证
摘要
本研究提出一种两阶段框架,用于句级抑郁症状识别,采用候选生成与定义引导验证方法,在评估方法中取得了最佳准确率和F1分数。
arXiv:2609.01833v1 Announce Type: new
摘要:句级抑郁症状识别具有挑战性,因为相似的表达在症状相关性上可能不同,且语言模型的推断在诊断定义上缺乏充分依据。本研究提出一种两阶段框架,将症状候选生成与定义引导的验证分离。一个对比微调的句子编码器为每个句子生成一个症状候选,一个微调的语言模型使用句子、其上下文和候选特定的诊断定义来验证该候选是否存在或不存在,在回答之前根据该定义检查其判断。通过与编码器、基于推断的、医疗和通用LLM基线以及匹配的单阶段监督分类器进行评估,所提出的流程在所有方法中取得了最佳准确率和F1分数,其推理与专家编写的注释相匹配。初步临床审计表明与诊断定义有中等程度的一致性,解释质量强烈依赖于预测的正确性。结果支持将症状识别分解为候选生成和定义引导的验证,尽管对于稀有类别的性能仍然有限。
查看缓存全文
缓存时间: 2026/09/03 05:48
# 基于候选生成与定义引导验证的句子级抑郁症状识别 来源:https://arxiv.org/html/2609.01833 ###### 摘要 句子级抑郁症状识别具有挑战性,因为相似表达可能在症状相关性上存在差异,且语言模型推理在诊断定义的依据上不够充分。本研究提出一个两阶段框架,将症状候选生成与基于定义的验证分离开来。一个经过对比微调的句子编码器为每个句子生成一个症状候选项,而一个微调的语言模型则利用句子、其上下文以及候选项特有的诊断定义来验证该候选项是否存在,并在回答前根据该定义检查其判断结果。在针对编码器、基于推理的、医学的和通用大语言模型基线以及一个匹配的单阶段监督分类器进行评估后,所提流程在所有方法中获得了最佳准确率和F1分数,其推理过程与专家编写的标注一致。初步临床审计表明其与诊断定义的对齐程度中等,解释质量强烈依赖于预测的正确性。结果支持将症状识别分解为候选生成和基于定义的验证,尽管对于罕见类别的性能仍然有限。 ###### 索引词:人工智能、分类算法、数据挖掘、决策支持系统、深度学习、机器学习、心理健康、自然语言处理、精神病学、文本挖掘。 ††地址:系统与机器人研究所(ISR)、LARSyS、生物工程系、里斯本高等技术学院(IST)、1049-001 葡萄牙里斯本。 ††地址:系统与机器人研究所(ISR)、LARSyS、里斯本高等技术学院、里斯本大学、1049-001 葡萄牙里斯本。 ††地址:精神病学系、Beatriz Ângelo医院、2674-514 葡萄牙洛雷斯。 ††资助说明:本工作由LARSyS资助,资助编号:DOI:10.54499/LA/P/0083/2020 和 10.54499/UID/50009/2025。本文已提交给IEEE以供可能发表。版权可能未经通知转移,之后本版本可能无法访问。 ††通讯作者:通讯作者:李伟明(邮箱:[email protected])。 ## I 引言 社交媒体和在线心理健康社区的快速发展产生了大量描述用户情绪、行为和心理体验的非结构化文本[1 (https://arxiv.org/html/2609.01833#bib.bib1)]。相应地,基于文本的抑郁分析已从基于词典的情感分析和传统机器学习分类器发展到基于Transformer的语义模型[2 (https://arxiv.org/html/2609.01833#bib.bib2), 3 (https://arxiv.org/html/2609.01833#bib.bib3)]。然而,大多数现有研究在帖子或用户层面进行操作,并产生如抑郁状态或严重程度等聚合结果。虽然这对于大规模筛查很有用,但这些方法不一定能识别哪句话表达了特定的抑郁症状,或者该表达如何对应于《精神疾病诊断与统计手册》第五版(DSM-5)[4 (https://arxiv.org/html/2609.01833#bib.bib9), 5 (https://arxiv.org/html/2609.01833#bib.bib10)]定义的症状类别。最近的工作已经开始使深度学习抑郁检测器更直接地与DSM-5标准对齐,但这些系统仍然在文档或帖子层面进行分类,而不是将单个句子归因于特定的症状类别[6 (https://arxiv.org/html/2609.01833#bib.bib36)]。句子级症状识别提供了更细粒度和可追溯的分析目标。ReDSM-5通过将社交媒体帖子中的句子与符合DSM-5的抑郁症状标注联系起来,同时保留访问其来源帖子上下文的能力,支持了这项任务[7 (https://arxiv.org/html/2609.01833#bib.bib16)]。然而,症状表达可能是隐含的、语义重叠的、被否定的、有时间限定的,或依赖于周围文本。症状类别的长尾分布进一步使识别较少出现的表达变得复杂。上下文编码器如Sentence-BERT和MentalBERT为句子分类提供了有效的表示[8 (https://arxiv.org/html/2609.01833#bib.bib19), 9 (https://arxiv.org/html/2609.01833#bib.bib28)],而对比学习可以利用症状级别的监督来组织表示空间[10 (https://arxiv.org/html/2609.01833#bib.bib29)]。然而,即使是强大的编码器在重叠症状类别的边界附近也可能产生模糊的决策。自回归大语言模型(LLMs)提供了额外的上下文建模能力,但应用于每个句子时成本要高得多。此外,尽管具有指令遵循和结构化生成能力,大语言模型仍然存在事实不一致、偏见、提示敏感性和与临床医生不完全一致等问题[11 (https://arxiv.org/html/2609.01833#bib.bib5), 12 (https://arxiv.org/html/2609.01833#bib.bib6), 13 (https://arxiv.org/html/2609.01833#bib.bib7), 14 (https://arxiv.org/html/2609.01833#bib.bib8), 15 (https://arxiv.org/html/2609.01833#bib.bib26)]。因此,句子级DSM-5识别既需要选择性地使用大语言模型推理,也需要一个明确的参考来确定预测的症状是否有文本证据支持。然而,先前的句子级方法要么依赖于单一的、仅编码器的分类器而没有定义一致性检查,要么应用不以DSM-5标准为条件的通用零样本蕴含,要么在没有将候选生成与验证分开的情况下对每个句子调用大语言模型推理[7 (https://arxiv.org/html/2609.01833#bib.bib16), 16 (https://arxiv.org/html/2609.01833#bib.bib31), 17 (https://arxiv.org/html/2609.01833#bib.bib22), 18 (https://arxiv.org/html/2609.01833#bib.bib23)]。据我们所知,先前的工作尚未研究这种特定组合,即基于编码器的候选生成与候选特定的、基于定义的验证,其中大语言模型验证仅限于选定的症状候选。为了解决这些挑战,我们提出一个两阶段的句子级DSM-5症状识别框架,将症状候选生成与候选特定的存在性验证分开。在第一阶段,MentalSBERT-S(一个使用症状级别监督进行对比微调的句子编码器)为每个句子生成一个九类症状匹配分数,并选择得分最高的类别作为第一阶段候选。这种仅编码器的设计避免了对每个句子进行自回归生成,同时达到了直接微调的生成替代方案的准确性,如第四节所示。在第二阶段,一个单独微调的DeepSeek模型确定第一阶段候选是存在还是缺失。它接收目标句子、来源帖子上下文、候选症状以及一个简洁的、候选特定的、基于DSM-5信息的定义。在一次结构化推理调用中,模型形成一个二元判断,并在回答前检查其与所提供定义的一致性。因此,该框架产生一个句子级症状假设、一个经过一致性检查的二元状态,以及一个基于目标句子及其支持上下文的模型生成解释。此验证在标注层面进行,并非旨在作为完整的临床诊断评估。本文的主要贡献如下: 1. 我们将句子级DSM-5症状识别制定为一个两阶段任务,将九类症状候选生成与基于定义的、针对所选候选的二元验证分开。 2. 我们开发了MentalSBERT-S,一个对比微调的句子编码器,它通过单次前向传递直接生成第一阶段症状候选,在不需要自回归推理的情况下,达到了直接微调的生成替代方案的准确性。 3. 我们引入了一个微调的、基于定义的验证过程,该过程在一次结构化推理调用中结合了初始的存在/缺失判断与候选特定的、基于DSM-5信息的一致性检查。 4. 我们在监督编码器、NLI风格的零样本模型、直接大语言模型基线(包括MedGemma-4B-IT)以及一个在相同数据和骨干网络上训练的匹配的单阶段监督分类器上评估了该框架。评估包括三个训练种子、分层自助法置信区间、逐症状分析、组件消融、错误分析、推理效率测量以及初步的临床推理审计。本文其余部分组织如下。第二节回顾相关工作。第三节介绍所提框架。第四节描述实验设置和结果。第五节讨论研究发现、临床意义和局限性。第六节总结全文并概述未来研究方向。 ## II 相关工作 早期的基于文本的抑郁检测主要通过二元分类或严重程度估计来解决用户级或帖子级的筛查[4 (https://arxiv.org/html/2609.01833#bib.bib9), 5 (https://arxiv.org/html/2609.01833#bib.bib10), 19 (https://arxiv.org/html/2609.01833#bib.bib4)]。诸如SMHD、专家标注的自杀风险帖子、访谈语料库和上下文抑郁挑战赛等资源拓宽了心理健康自然语言处理的经验基础[20 (https://arxiv.org/html/2609.01833#bib.bib12), 21 (https://arxiv.org/html/2609.01833#bib.bib13), 22 (https://arxiv.org/html/2609.01833#bib.bib14), 23 (https://arxiv.org/html/2609.01833#bib.bib15)]。然而,在文档或用户历史上聚合的预测不一定能定位到表达临床相关症状的句子[24 (https://arxiv.org/html/2609.01833#bib.bib11)]。ReDSM-5通过将单个句子与符合DSM-5的抑郁症状类别联系起来,推进了更细粒度的公式化[7 (https://arxiv.org/html/2609.01833#bib.bib16)]。在这种设定下,链接的帖子仍然有助于解决否定、时间限定和不清楚的指代问题,但预测目标是单个句子所表达的症状证据。预训练的上下文编码器仍然是心理健康文本分析的坚实基础。适应心理健康语料库可以改善与心理健康状况相关的语言的表示[25 (https://arxiv.org/html/2609.01833#bib.bib17), 26 (https://arxiv.org/html/2609.01833#bib.bib18)]。例如,MentalBERT和MentalRoBERTa是在心理健康相关的社交媒体文本上预训练的,并在多个心理健康检测基准上进行了评估[8 (https://arxiv.org/html/2609.01833#bib.bib19)]。MentalBERT表示也与下游的神经分类器结合,用于抑郁和重度抑郁障碍检测[27 (https://arxiv.org/html/2609.01833#bib.bib20)]。从通用编码器到特定子版块心理健康分类的迁移学习同样被证明比通用预训练能提高标签区分度[28 (https://arxiv.org/html/2609.01833#bib.bib37)]。尽管这些模型可以学习症状判别性的上下文表示,但当症状类别共享语言线索、证据依赖于周围上下文,或罕见类别提供的监督有限时,固定标签决策仍然很困难。句子对和对比目标可以通过将相同标签的句子聚集在一起并分离跨类别的句子来进一步塑造表示空间[9 (https://arxiv.org/html/2609.01833#bib.bib28), 10 (https://arxiv.org/html/2609.01833#bib.bib29)];然而,它们的贡献必须通过受控消融实证确定。自然语言推理(NLI)提供了一种互补的公式化,其中标签描述被表达为假设并进行蕴含评估。Yin等人[16 (https://arxiv.org/html/2609.01833#bib.bib31)]确立了蕴含作为零样本文本分类的通用方法,而BART为NLI风格的迁移提供了一个广泛使用的序列到序列基础[29 (https://arxiv.org/html/2609.01833#bib.bib32)]。这种公式化与症状识别相关,因为症状定义可以转换为假设,而无需特定于任务的微调。然而,通用的蕴含训练不一定能捕捉到专门心理健康数据集的标注边界。因此,我们将NLI风格的零样本分类视为外部基线,而不是监督症状建模的替代品。大语言模型通过指令遵循、上下文推理和结构化生成,扩展了可以通过自然语言处理解决的临床和心理健康任务范围[17 (https://arxiv.org/html/2609.01833#bib.bib22), 18 (https://arxiv.org/html/2609.01833#bib.bib23)]。最近一篇关于大语言模型在心理健康中应用的系统综述同样报告说,大多数部署仍局限于筛查级分类,并强调需要可解释、临床可验证的输出,而非不透明的预测[30 (https://arxiv.org/html/2609.01833#bib.bib38)]。医学指令微调和领域对齐可以提高在医学任务上的性能,但强有力的基准结果并不能消除关于可能危害、偏见、提示敏感性或与临床医生不一致等问题的担忧[31 (https://arxiv.org/html/2609.01833#bib.bib24), 15 (https://arxiv.org/html/2609.01833#bib.bib26)]。当异质的症状表达(如快感缺失)必须映射到定义狭窄的临床类别时,这些担忧尤为重要[32 (https://arxiv.org/html/2609.01833#bib.bib21)]。因此,直接的零样本和少样本大语言模型方法是重要的基线,而受约束的输出以及模型生成的解释与临床审查的解释之间的明确分离仍然是必要的。经过医学调整的基础模型比单纯的大语言模型提示提供了更强的比较。MedGemma是一个源自Gemma 3的医学文本和视觉语言模型家族,并在医学推理、信息检索和图像理解任务上进行了评估[33 (https://arxiv.org/html/2609.01833#bib.bib33)]。MedGemma-4B-IT是一个实际规模的指令微调模型,无需特定于数据集的训练即可应用于文本医学任务。将其作为零样本基线纳入,可以测试通用的医学指令微调是否足以捕捉本研究中考虑的句子级DSM-5标注边界。临床知识可以通过诊断定义、结构化指令、外部文档或检索增强生成纳入到大语言模型推理中[34 (https://arxiv.org/html/2609.01833#bib.bib25), 15 (https://arxiv.org/html/2609.01833#bib.bib26), 35 (https://arxiv.org/html/2609.01833#bib.bib27)]。检索导向的系统引入外部证据,而定义条件推理则直接在模型输入中提供固定标准。对于句子级DSM-5识别,简洁的候选特定定义为评估目标句子及其局部上下文是否支持提议的症状提供了透明的参考。这种基于定义、自检的验证仍然是标注层面的一致性检查,而不是完整的诊断评估。总的来说,先前的工作提供了有效的
相似文章
多模态域泛化的抑郁症检测:基于注意力的BiLSTM网络与域对抗训练
一种新颖的、不依赖患者的自动抑郁症检测多模态框架,整合了BiLSTM与模态内和跨模态注意力机制以及域对抗训练,以提高跨说话人的泛化能力。在Androids-Corpus数据集上达到了93.2%的先进准确率。
基于优势加权排名的二元抑郁检测中潜在抑郁严重程度的揭示
提出了一种细粒度多模态框架,采用 Binary Advantage-weighting Ranking Loss 进行自动抑郁检测,在 D-vlog 和 LMVD 数据集上取得了最先进的结果。
大语言模型中抑郁症的可解释症状向量
本文通过Gemma-3-27B-PT的机制可解释性方法,提取抑郁症症状向量并与临床医生判断进行对齐,证明了可解释临床评估工具的应用前景。
概率文本时间序列抑郁症检测
本文提出PTTSD,一种从临床访谈转录中检测抑郁症严重程度的概率框架,该框架对不确定性进行建模并提供时间可解释性,在基准数据集上取得了具有竞争力的性能。
超越增强:评分引导的病理先验用于基于EEG的抑郁症检测
本文介绍了评分引导分类(SGC),这是一种利用无监督生成网络对基于EEG的抑郁症检测中的病理先验进行建模的框架,避免了合成数据增强,并提高了分类准确性。