MentalHospital:评估精神病学临床接诊的虚拟环境
摘要
MentalHospital是一个虚拟环境,旨在评估AI智能体与人类专家在精神病学临床接诊中的表现,涵盖问诊、检查、诊断和治疗规划。实验通过客观与主观指标比较人类专家、受训人员及多种大语言模型。
arXiv:2607.08257v1 公告类型:新
摘要:大语言模型(LLMs)在孤立的 psychiatry 任务(包括对话、诊断和治疗规划)中表现出色,但现有基准很少模拟完整的精神病学临床接诊。我们引入 $\textbf{MentalHospital}$,一个基于LLM的精神病学临床接诊虚拟评估环境。MentalHospital实现了主观问诊、客观检查、诊断评估和治疗规划(S.O.A.P.)工作流,使用基于技能的标准化病人,这些病人由1,193例去标识化的精神科电子健康记录(EHR)病例构建,涵盖所有主要ICD-11类别和76种疾病。每次接诊通过双轨协议进行评估,结合了与EHR参考的客观比较和对临床过程质量的主观评估。为了扩大专家判断的规模,我们开发了 $\textbf{MentalEval}$,五个领域特定评估器,涵盖沟通共情、问诊专业性、临床记录质量、诊断严谨性和治疗适当性,使用基于量规的SFT和专家指导的DPO进行训练。来自22名临床医生的调查支持MentalHospital的临床保真度(3.88/5),而MentalEval实现了与专家的强一致性,平均QWK为0.944。基准测试表明,即使是最强的LLM在客观精神病学能力上仍落后临床医生37.28个百分点,其中精神状态评估是关键瓶颈。
查看缓存全文
缓存时间: 2026/07/10 06:08
# 精神科医院:评估精神病学临床接触的虚拟环境
来源:https://arxiv.org/html/2607.08257
| 模型 | 客观比较 (%) | 主观评估 (1–5) |
|------|--------------|-----------------|
| | Inter. | Exam. | Note | Cate. | Diso. | Emp. | Prof. | Qual. | Rigor | App. |
| 医学实习生 | 78.23 | 71.05 | 82.91 | 81.42 | 72.58 | 1.63 | 3.86 | 3.87 | 2.33 | 2.47 |
| 人类专家 | 82.35 | 91.90 | 88.67 | 90.59 | 83.24 | 1.22 | 4.25 | 4.01 | 2.54 | 2.96 |
| 小型语言模型 | | | | | | | | | | |
| Llama-3-8B | 19.06 | 7.94 | 9.96 | 18.11 | 6.08 | 2.05 | 2.88 | 1.93 | 1.86 | 2.67 |
| Qwen3-14B | 23.19 | 8.33 | 12.12 | 23.55 | 15.19 | 1.96 | 2.90 | 2.17 | 2.20 | 2.83 |
| GPT-OSS-20B | 27.43 | 8.60 | 33.12 | 37.21 | 25.81 | 1.60 | 3.15 | 3.14 | 2.06 | 3.23 |
| QWQ-32B | 30.40 | 10.87 | 32.30 | 44.53 | 26.39 | 2.13 | 3.72 | 2.85 | 3.14 | 3.40 |
| 大型语言模型 | | | | | | | | | | |
| GPT-OSS-120B | 36.72 | 9.92 | 39.94 | 49.54 | 34.19 | 1.50 | 3.45 | 3.89 | 2.42 | 3.35 |
| Claude-Sonnet-4.6 | 30.44 | 21.28 | 34.81 | 50.28 | 34.57 | 1.72 | 3.39 | 2.70 | 2.22 | 3.17 |
| Deepseek-v4-Pro | 30.95 | 21.93 | 56.46 | 26.20 | 20.85 | 2.09 | 3.48 | 2.91 | 2.39 | 3.29 |
| GPT-5.5 | 69.06 | 22.99 | 45.44 | 70.23 | 49.85 | 1.50 | 3.63 | 3.66 | 2.21 | 3.48 |
| 医疗专用模型 | | | | | | | | | | |
| MedGemma-4B-it | 25.65 | 9.42 | 10.67 | 21.48 | 3.05 | 2.16 | 2.57 | 1.99 | 2.15 | 2.91 |
| MedGemma-27B-it | 43.12 | 16.05 | 35.91 | 32.27 | 10.10 | 2.05 | 2.83 | 2.67 | 2.33 | 3.17 |
| Baichuan-M2 | 51.29 | 24.76 | 50.54 | 80.56 | 43.19 | 1.29 | 2.85 | 2.91 | 2.44 | 3.33 |
## 4 实验
##### 任务定义。
我们将评估形式化为一个多阶段、混合类型的临床任务。给定一个病例cc,医生代理人需要完成一个包含主观访谈、客观检查、诊断评估和治疗规划的完整回合。该任务结合了三种形式:(1) 开放生成,包括对话、临床记录书写、诊断推理和治疗规划;(2) 多标签决策,包括检查推荐和类别级诊断;以及 (3) 排序后的障碍预测,用于确定诊断。我们从两个角度评估生成的轨迹和阶段输出:(i) 客观比较,衡量基于EHR的结果;(ii) 主观评估,衡量过程级别的临床质量。
##### 评估指标。
对于基于EHR的输出,包括检查推荐(Exam.)、临床访谈(Inter.)和临床记录生成(Note),我们衡量参考覆盖率:
$$\mathrm{Coverage}(y_c,\mathcal{K}_c)=\frac{1}{|\mathcal{K}_c|}\sum_{k\in\mathcal{K}_c}\mathbb{I}\left[k\preceq y_c\right],$$
(13)
其中 $\mathcal{K}_c$ 表示病例cc的EHR派生参考检查点集合,$k\preceq y_c$ 表示检查点k被生成的输出 $y_c$ 语义蕴含。我们使用保守的语义相似度阈值 $\tau=0.85$ 进行高精度自动匹配,并对低于该阈值的配对采用经验证的多LLM辅助语义匹配程序进行裁决。对于确定诊断,我们报告类别识别(Cate.)和障碍级诊断排名(Diso.),并使用nDCG评估诊断优先级。对于主观评估,MentalEval使用专家定义的评分标准评估沟通共情(Emp.)、访谈专业性(Prof.)、临床记录质量(Qual.)、诊断严谨性(Rigor)和治疗适当性(App.)。更多细节见附录K (https://arxiv.org/html/2607.08257#A11)。
##### 比较组。
我们考虑五个比较组:人类专家、医学实习生、众包工作者、通用LLM和医疗专用LLM。专家组由5名持证精神科医生和3名心理学专家组成。我们还纳入了14名医学实习生和8名非专业众包工作者。对于LLM,我们评估了一组通用模型,包括Llama-3-8B[16 (https://arxiv.org/html/2607.08257#bib.bib57)]、Qwen3-14B[52 (https://arxiv.org/html/2607.08257#bib.bib58)]、GPT-OSS-20B[1 (https://arxiv.org/html/2607.08257#bib.bib59)]、QwQ-32B[52 (https://arxiv.org/html/2607.08257#bib.bib58)]、GPT-OSS-120B[1 (https://arxiv.org/html/2607.08257#bib.bib59)]、DeepSeek-V4-Pro[27 (https://arxiv.org/html/2607.08257#bib.bib44)]、GPT-5.5[38 (https://arxiv.org/html/2607.08257#bib.bib53)]和Claude-Sonnet-4.6[5 (https://arxiv.org/html/2607.08257#bib.bib54)]。我们还包括面向医疗的LLM,包括MedGemma-4B-it[37 (https://arxiv.org/html/2607.08257#bib.bib55)]、MedGemma-27B-it[37 (https://arxiv.org/html/2607.08257#bib.bib55)]和Baichuan-M2[12 (https://arxiv.org/html/2607.08257#bib.bib60)]。
### 4.1 LLM能像临床医生一样互动吗?
我们在MentalHospital中评估了12个LLM、8位人类专家和14名医学实习生。如表3.2 (https://arxiv.org/html/2607.08257#S3.SS2)所示,当前LLM在客观临床能力方面与临床医生之间仍存在明显差距。与最强的医疗专用模型Baichuan-M2相比,医学实习生在所有五个客观指标上均获得更高分数,平均差距为27.17个百分点;人类专家进一步将差距扩大到37.28点。在主观评估中,LLM和临床医生显示出互补优势,而非任何一方的统一优越性。人类专家表现出更强的访谈专业性(4.25),反映出更高效、目标导向的临床信息收集,但在表达共情沟通方面得分较低(1.22)。相比之下,表现最好的LLM在表达共情(2.16 vs. 1.22)、诊断严谨性(3.14 vs. 2.54)和治疗适当性(3.48 vs. 2.96)方面达到或超过人类专家,而在访谈专业性(3.72 vs. 4.25)和临床记录质量(3.89 vs. 4.01)方面仍然较低。这些结果表明,LLM还不能可靠地替代临床医生,但可能在口头情感支持和基于证据的治疗协助方面提供互补价值。
表 3:按临床组成部分划分的覆盖率。
| 模型 | 访谈阶段 | 记录阶段 |
|------|----------|----------|
| | 主诉平均 | 精神状态平均 | 主诉平均 | 精神状态平均 |
| Qwen3-14B | 23.19 | 44.36 | 12.57 | 12.12 | 16.38 | 17.25 |
| MedGemma-4B-it | 25.65 | 40.69 | 10.45 | 10.67 | 9.68 | 6.66 |
| QWQ-32B | 30.40 | 50.90 | 17.84 | 32.30 | 42.91 | 34.22 |
| Deepseek-v4-Pro | 30.95 | 41.67 | 23.13 | 56.46 | 59.94 | 43.91 |
| GPT-5.5 | 69.06 | 85.38 | 55.72 | 45.44 | 55.34 | 65.89 |
### 4.2 LLM在临床互动中哪里不足?
表 4:标准化病人的技能增强病人构建消融实验。
| 病人变体 | 客观比较 (%) | 主观评估 (1–5) |
|----------|--------------|----------------|
| | 覆盖率↑ | 精确率↑ | 幻觉↓ | 逼真度↑ | 保真度↑ | 区分度↑ |
| 朴素提示 | 72.40 | 86.10 | 7.80 | 2.12 | 2.23 | 1.92 |
| 仅表示技能 | 72.40 (+0.00) | 85.72 (-0.38) | 9.04 (+1.24) | 4.12 (+2.00) | 3.82 (+1.59) | 3.72 (+1.80) |
| 仅记忆技能 | 84.83 (+12.43) | 91.64 (+5.92) | 4.52 (-4.52) | 3.55 (-0.57) | 3.87 (+0.05) | 2.77 (-0.95) |
| 完整病人 | 88.91 (+4.08) | 93.27 (+1.63) | 3.08 (-1.44) | 4.17 (+0.62) | 4.05 (+0.18) | 3.87 (+1.10) |
为了识别核心差距,我们将临床访谈和记录生成中的覆盖率分解为主诉(CC)和精神状态(MS),如表3 (https://arxiv.org/html/2607.08257#S4.T3)所示。当前LLM未能认识到精神状态检查在精神评估和诊断中的临床重要性。例如,GPT-5.5在访谈中显示出巨大差距(85.38 vs. 55.72),而DeepSeek-v4-Pro在记录生成中表现出类似模式(59.94 vs. 43.91)。
### 4.3 技能增强的病人构建是否能提高保真度?
我们通过客观评估和主观评估来评估病人构建的保真度,详细的实验设置见附录L (https://arxiv.org/html/2607.08257#A12)。如表4 (https://arxiv.org/html/2607.08257#S4.T4)所示,朴素提示可以达到合理的事实准确性,但在主观保真度方面表现较差,表明直接暴露EHR并不能产生逼真的病人模拟。表示技能显著提高了临床逼真度和病人区分度,而记忆技能则提高了证据覆盖率、精确度和幻觉控制。完整的构建方案实现了最佳的整体性能。
表 5:MentalEval训练与专家评分的消融结果。DPO在SFT之后应用。
| 评估器 | 基模型 (Qwen3-8B) | +SFT | +DPO |
|--------|-------------------|------|------|
| | QWK↑ | 准确率↑ | MAE↓ | QWK↑ | 准确率↑ | MAE↓ | QWK↑ | 准确率↑ | MAE↓ |
| MentalEval-共情 | 0.677 | 0.225 | 0.875 | 0.824 (+0.148) | 0.500 (+0.275) | 0.525 (-0.350) | 0.926 (+0.102) | 0.725 (+0.225) | 0.275 (-0.250) |
| MentalEval-专业 | 0.705 | 0.275 | 0.825 | 0.844 (+0.139) | 0.550 (+0.275) | 0.475 (-0.350) | 0.941 (+0.097) | 0.775 (+0.225) | 0.225 (-0.250) |
| MentalEval-记录 | 0.766 | 0.400 | 0.675 | 0.910 (+0.144) | 0.700 (+0.300) | 0.300 (-0.375) | 0.940 (+0.030) | 0.775 (+0.075) | 0.225 (-0.075) |
| MentalEval-诊断 | 0.828 | 0.475 | 0.575 | 0.887 (+0.059) | 0.725 (+0.250) | 0.325 (-0.250) | 0.967 (+0.080) | 0.875 (+0.150) | 0.125 (-0.200) |
| MentalEval-治疗 | 0.819 | 0.425 | 0.600 | 0.928 (+0.109) | 0.725 (+0.300) | 0.275 (-0.325) | 0.948 (+0.020) | 0.800 (+0.075) | 0.200 (-0.075) |
| 平均 | 0.759 | 0.360 | 0.710 | 0.879 (+0.120) | 0.640 (+0.280) | 0.380 (-0.330) | 0.944 (+0.066) | 0.790 (+0.150) | 0.210 (-0.170) |
见图3:与专家评分的一致性,MentalEval显示出最强的对齐。
### 4.4 MentalEval与专家判断一致吗?
MentalEval被设计为MentalHospital的任务专用评估器,而不是跨任意临床任务的通用LLM评审。因此,我们的目标是测试它是否能在MentalHospital评估设置中复现专家判断。
为了避免评估泄露,我们额外从协作医疗中心抽样了40个精神科EHR病例来构建MentalEval测试集。这些病例被严格排除在所有MentalEval训练数据之外。对于每个病例,我们抽样模型生成的响应,并在五个MentalEval维度上进行评估,总共获得200个维度级别的测试样本。每个样本由三位专家独立评分,只有一致同意的样本被保留作为专家验证的参考。我们在这个未见过专家标签病例的静默集上对两阶段训练程序进行消融。如表5 (https://arxiv.org/html/2607.08257#S4.T5)所示,基于评分规则的SFT一致性地改善了所有五个评估器,将平均QWK从0.759提高到0.879,并将MAE从0.710降低到0.380。专家指导的DPO进一步提高了一致性,达到平均QWK 0.944、准确率0.790和MAE 0.210。然后,我们将训练后的MentalEval与LLM作为评审、多LLM陪审团以及个别众包工作者评分进行比较,结果如图3 (https://arxiv.org/html/2607.08257#S4.F3)所示。MentalEval实现了最强的专家对齐,具有最高的QWK(0.926)和准确率(0.725),以及最低的MAE(0.275)。
### 4.5 MentalHospital是否提供了一个临床可信的环境?
见图4:MentalHospital的临床保真度评分。
我们进行了一项调查,以评估临床可信度,参与调查的有5名精神科医生、3名心理学家和14名医学实习生(完整问卷见附录M (https://arxiv.org/html/2607.08257#A13))。问卷涵盖五个维度:临床逼真度(CR)、病人保真度(PF)、病人区分度(PD)、评估可信度(EC)和培训适用性(TS),采用5点Likert量表。如图4 (https://arxiv.org/html/2607.08257#S4.F4)所示,MentalHospital获得了一致的积极评分,总体平均得分为3.88/5(95%自助法置信区间:[3.78, 3.98]),正面回答率为69.9%(95% CI:[64.8%, 75.0%]),负面回答率仅为5.1%(95% CI:[3.4%, 6.8%])。评分在培训适用性和评估可信度方面特别强,正面回答率分别为84.8%和75.0%,表明MentalHospital提供了一个临床上可信的环境。
### 4.6 定性错误分析
见图5:MentalHospital中的代表性病例。
图5 (https://arxiv.org/html/2607.08257#S4.F5)展示了在MentalHospital中观察到的两种代表性失败模式。在一个涉及焦虑和可能知觉障碍的病例中,GPT-5.5直接探查与幻觉相关的特征(如来源和内容),比Qwen3-14B获得了更高的客观证据覆盖率。然而,其响应中包含有限的共情确认,导致MentalEval共情分数较低。相反,Qwen3-14B提供了更明确的情感验证和安抚,但未能通过针对性的精神科提问来探索幻觉假设。这种对比表明,证据寻求行为与过程级别的沟通质量可能存在显著差异。一个模型可能恢复关键诊断证据,但提供较差的情感支持,而另一个模型可能显得具有共情,但在临床上信息不足。
## 5 相关工作
##### 精神科基准测试。
早期的医学LLM评估主要依赖于静态问答基准测试,测试医学知识回忆和考试式临床推理[40 (https://arxiv.org/html/2607.08257#bib.bib16),46 (https://arxiv.org/html/2607.08257#bib.bib17)]。这一范式后来扩展到更广泛的医学评估套件和真实世界临床基准测试,涵盖多样任务、安全性和临床可靠性[9 (https://arxiv.org/html/2607.08257#bib.bib19),7 (https://arxiv.org/html/2607.08257#bib.bib18),56 (https://arxiv.org/html/2607.08257#bib.bib20),4 (https://arxiv.org/html/2607.08257#bib.bib21)],后续工作进一步检查了临床安全性、专家共识和专门推理[47 (https://arxiv.org/html/2607.08257#bib.bib22),31 (https://arxiv.org/html/2607.08257#bib.bib23),51 (https://arxiv.org/html/2607.08257#bib.bib24),58 (https://arxiv.org/html/2607.08257#bib.bib27)]。与此同时,心理健康基准测试开始评估心理咨询、情感支持和心理治疗[25 (https://arxiv.org/html/2607.08257#bib.bib28),49 (https://arxiv.org/html/2607.08257#bib.bib26),55 (https://arxiv.org/html/2607.08257#bib.bib6)],而面向临床的精神科基准测试则专注于精神科实践、障碍识别和诊断推理[30 (https://arxiv.org/html/2607.08257#bib.bib29),14 (https://arxiv.org/html/2607.08257#bib.bib30),42 (https://arxiv.org/html/2607.08257#bib.bib5),41 (https://arxiv.org/html/2607.08257#bib.bib31)]。这些工作将亚临床心理健康支持与阈值级精神评估联系起来,但仍然主要评估孤立的响应或任务特定输出。最近的工作已转向多轮对话和模拟临床环境,测试跨轮次的上下文交互[54 (https://arxiv.org/html/2607.08257#bib.bib32),35 (https://arxiv.org/html/2607.08257#bib.bib33),29 (https://arxiv.org/html/2607.08257#bib.bib34),24 (https://arxiv.org/html/2607.08257#bib.bib35),53 (https://arxiv.org/html/2607.08257#bib.bib36),34 (https://arxiv.org/html/2607.08257#bib.bib62)]以及病人-医生模拟[36 (https://arxiv.org/html/2607.08257#bib.bib11),13 (https://arxiv.org/html/2607.08257#bib.bib10),28 (https://arxiv.org/html/2607.08257#bib.bib12),43 (https://arxiv.org/html/2607.08257#bib.相似文章
HealthBench-Psych: OpenAI HealthBench 的心理健康子集
HealthBench-Psych 引入了 OpenAI HealthBench 基准测试的一个心理健康子集,用于评估 LLMs 在心理健康对话中的表现,经过临床医生审查验证,并评估了 20 个模型作为可重复使用的资源。
VERA-MH:心理健康领域伦理与负责任AI的验证
VERA-MH是一个经过临床验证的评估框架,用于评估聊天机器人在心理健康支持中的安全性,重点关注自杀意念风险。它使用角色扮演对话和一个LLM-as-a-Judge(以LLM作为评判)结合临床评分规则来评估回复。
MyMentorLLM:一种用于刻意练习的多模态语音/文本心理治疗生成式AI环境,包含患者、受训者和专家
本文介绍了MyMentorLLM,这是一个利用大型语言模型进行心理治疗培训中刻意练习的多模态语音/文本模拟环境。它生成了2,100次认知行为疗法(CBT)培训课程,并评估了不同LLM下的情绪动态、治疗能力和诊断准确性。
WiseMind:一个知识引导的多智能体框架,用于准确且富有同理心的精神疾病诊断
WiseMind是一个知识引导的多智能体框架,利用大语言模型进行精神疾病诊断,通过结合用于循证逻辑的“理性思维”智能体和用于共情沟通的“情感思维”智能体,在模拟和真实患者交互中实现了85.6%的诊断准确率。该框架利用DSM-5结构化知识图谱减少幻觉,并在保持临床合理性和心理支持的同时,比单智能体基线高出15-54个百分点。
MedBench v5:面向临床多模态模型的动态、过程导向且具有幻觉感知能力的基准测试
MedBench v5 是一个面向临床多模态模型的动态、过程导向的基准测试,集成了幻觉检测和压力测试,超越静态问答,评估在信息流压力下的推理和稳定性。