当症状不足以诊断:大型语言模型在精神科筛查中的证据加权模式
摘要
本文介绍了一个以SCID为锚定的555次访谈基准,用于评估五种大型语言模型(LLMs)在精神科筛查中的表现。研究发现,虽然模型展现出潜力,但它们在存在功能保留或保护性背景的情况下倾向于低估症状证据,因此需要谨慎验证。
查看缓存全文
缓存时间: 2026/05/25 08:59
# 当症状不足时:大型语言模型精神科筛查中的证据加权模式 来源:https://arxiv.org/abs/2605.23148 查看 PDF(https://arxiv.org/pdf/2605.23148) > **摘要:** 随着心理健康护理需求超出临床医生提供的评估能力,可扩展的筛查工具日益迫切。大型语言模型(LLM)或许能从患者叙述中识别精神科风险,但其在不同诊断、人口统计学亚组以及证据使用模式中的可靠性仍不确定。我们引入了一个以 SCID 为锚定的基准,包含 555 个半结构化体验式访谈,并配有焦虑障碍、重性抑郁障碍、创伤后应激障碍以及任何当前心理健康障碍的诊断参考标签。利用零样本任务特定提示,我们评估了五种最先进的 LLM,并考察假阴性错误是否源于遗漏精神科证据,或对症状、功能损害和保护性情境线索的差异性加权。不同任务和模型的性能各异,准确率在 0.49 到 0.86 之间,马修斯相关系数在 0.16 到 0.38 之间。GPT-4.1 Mini 和 GPT-5 Mini 展现出最一致的疾病特异性准确率。亚组分析发现,男性参与者的抑郁分类准确率高于女性参与者,未发现一致的年龄相关模式,且在不同种族分层中存在适度的非均匀变异。证据整合分析表明,假阴性的焦虑和 PTSD 分类通常包含明确的症状证据,但同时伴有功能完好、应对能力或社会支持。功能损害证据使模型输出偏向阳性分类,而保护性情境证据则使输出偏离。这些发现表明,LLM 可能支持可扩展的精神科筛查,但在功能完好或保护性情境存在时,其倾向于低估症状证据的偏差,需要在临床部署前进行审慎验证。 ## 提交历史 来自:朱剑锋 \[查看邮箱(https://arxiv.org/show-email/c8efb6c7/2605.23148)\] **\[v1\]** 2026 年 5 月 22 日星期五 01:53:03 UTC(1,302 KB)
相似文章
诊断之前先询问:Safe-Psych,面向精神科领域大语言模型的序贯评估基准
介绍了Safe-Psych,一个用于评估大语言模型如何在精神科处理诊断不确定性的序贯基准,结果显示即使是强大的模型在临床证据不完整时也常常无法放弃诊断或寻求澄清。
LingxiDiagBench:一个用于中文精神科咨询与诊断中LLM评估的多智能体基准框架
介绍了LingxiDiagBench,这是一个大规模多智能体基准,用于评估LLM在中文精神科咨询与诊断中的表现。关键发现表明:二分类任务上准确率高(最高达92.3%),但多分类鉴别诊断性能较差(抑郁-焦虑共病识别43.0%,12类鉴别诊断28.5%),揭示了对话质量与诊断准确性之间的脱节。
在标准化病例中评估大语言模型在动态临床决策中的表现
研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。
CalBrief:大型语言模型证据校准式科学简报的试点诊断基准
本文介绍了CalBrief——一个包含16个证据包和96个人工验证结论的试点诊断基准,用于评估大型语言模型是否能够生成证据校准的科学简报。研究发现,结构化组织能提升推理能力,但显式的强度校准策略过于保守,且这种保守性主要源于标签空间的扩展,而非信号注入。
重新思考LLMs的心理测量学评估:自我报告何时以及为何能预测行为
本文研究了自我报告的心理测量指标何时以及为何能预测大型语言模型的实际行为,发现细粒度、行为特定的工具(计划行为理论)在同一对话中达到了人类水平的连贯性,而像大五人格这样的宽泛特质则不能。