在标准化病例中评估大语言模型在动态临床决策中的表现
摘要
研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。
大语言模型(LLMs)越来越多地被提出作为临床代理,然而静态的单轮基准无法捕捉模型在整个问诊过程中动态提供护理的能力:收集信息、规划治疗以及在连续的病情状态下调整长期管理。医学教育长期以来通过标准化患者(SP)解决了类似的问题:经过培训的演员一致地扮演临床案例,从而实现逼真的实践和客观的脚本化评估。在此,我们介绍了MedSP1000,一个源自SP的交互式临床代理评估基准,包括1638个SP案例,配有24602个轨迹级别的同行评审评分标准。MedSP1000将经过同行评审的SP教学案例转化为可执行场景,包含明确的SP案例脚本、临床环境背景以及经过人工验证的结构化评分标准。在每次模拟评估运行中,临床代理与患者代理和环境控制器进行闭环交互,其行为在整个问诊过程中根据原始材料中定义的专家标准进行评分。将MedSP1000应用于一系列通用和医学专用的大语言模型,我们发现静态基准的性能并不能可靠地转化为这些教育场景。表现最佳的模型GPT-5.5仅完成了60.4%的专家定义评分项,而最强的医学专用模型达到了40.0%;增加测试时计算并未带来可衡量的提升。这些结果表明,当前的大语言模型,包括为医学调整的代理系统,尚不足以安全地集成到实际临床实践中。更广泛地说,MedSP1000展示了过程级别的SP风格评估如何揭示单轮基准所遗漏的临床相关失败模式。
相似文章
大型语言模型与中医医生在中医领域中的真实世界临床病例评估
该研究使用真实世界临床病例评估了16个大型语言模型与60位执业中医医生的表现,发现LLMs在某些领域获得更高的专家分数,但存在差异和安全问题。它强调了LLMs在中医决策支持中的潜力和局限性。
ClinicalMC:面向大语言模型的多疗程临床决策基准
ClinicalMC是一个基准,旨在评估大语言模型在多疗程临床决策中的表现,包含中文和英文数据集以及一个多智能体评估框架。
诊断之前先询问:Safe-Psych,面向精神科领域大语言模型的序贯评估基准
介绍了Safe-Psych,一个用于评估大语言模型如何在精神科处理诊断不确定性的序贯基准,结果显示即使是强大的模型在临床证据不完整时也常常无法放弃诊断或寻求澄清。
MedGuideX:将可执行指南中的决策逻辑内化至大型语言模型用于临床推理
MedGuideX 将临床实践指南转化为可执行的决策逻辑,以生成事实性和反事实性的问答数据用于训练医学大语言模型,在临床推理基准测试中实现了平均准确率相对提升 10.28%。
MTDiag:面向临床意义的多轮诊断数据集,用于评估大语言模型
本文介绍了MTDiag,一个多轮诊断对话数据集,用于在现实临床诊断场景中评估大语言模型,解决了静态问答基准测试的局限性。