在标准化病例中评估大语言模型在动态临床决策中的表现
摘要
研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。
大语言模型(LLMs)越来越多地被提出作为临床代理,然而静态的单轮基准无法捕捉模型在整个问诊过程中动态提供护理的能力:收集信息、规划治疗以及在连续的病情状态下调整长期管理。医学教育长期以来通过标准化患者(SP)解决了类似的问题:经过培训的演员一致地扮演临床案例,从而实现逼真的实践和客观的脚本化评估。在此,我们介绍了MedSP1000,一个源自SP的交互式临床代理评估基准,包括1638个SP案例,配有24602个轨迹级别的同行评审评分标准。MedSP1000将经过同行评审的SP教学案例转化为可执行场景,包含明确的SP案例脚本、临床环境背景以及经过人工验证的结构化评分标准。在每次模拟评估运行中,临床代理与患者代理和环境控制器进行闭环交互,其行为在整个问诊过程中根据原始材料中定义的专家标准进行评分。将MedSP1000应用于一系列通用和医学专用的大语言模型,我们发现静态基准的性能并不能可靠地转化为这些教育场景。表现最佳的模型GPT-5.5仅完成了60.4%的专家定义评分项,而最强的医学专用模型达到了40.0%;增加测试时计算并未带来可衡量的提升。这些结果表明,当前的大语言模型,包括为医学调整的代理系统,尚不足以安全地集成到实际临床实践中。更广泛地说,MedSP1000展示了过程级别的SP风格评估如何揭示单轮基准所遗漏的临床相关失败模式。
相似文章
ClinicalMC:面向大语言模型的多疗程临床决策基准
ClinicalMC是一个基准,旨在评估大语言模型在多疗程临床决策中的表现,包含中文和英文数据集以及一个多智能体评估框架。
诊断之前先询问:Safe-Psych,面向精神科领域大语言模型的序贯评估基准
介绍了Safe-Psych,一个用于评估大语言模型如何在精神科处理诊断不确定性的序贯基准,结果显示即使是强大的模型在临床证据不完整时也常常无法放弃诊断或寻求澄清。
MedGuideX:将可执行指南中的决策逻辑内化至大型语言模型用于临床推理
MedGuideX 将临床实践指南转化为可执行的决策逻辑,以生成事实性和反事实性的问答数据用于训练医学大语言模型,在临床推理基准测试中实现了平均准确率相对提升 10.28%。
AIPatient Arena:基于电子健康记录的大语言模型在端到端临床咨询工作流中的评估
介绍了AIPatient Arena,一个基于电子健康记录的评估框架,用于评估大语言模型在临床能力的多个维度。研究揭示了在问诊和伦理方面的优势,但在处理模糊性和诊断准确性方面的弱点。
大型语言模型作为统一多模态学习器用于临床预测
该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。