在标准化病例中评估大语言模型在动态临床决策中的表现

Hugging Face Daily Papers 论文

摘要

研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。

大语言模型(LLMs)越来越多地被提出作为临床代理,然而静态的单轮基准无法捕捉模型在整个问诊过程中动态提供护理的能力:收集信息、规划治疗以及在连续的病情状态下调整长期管理。医学教育长期以来通过标准化患者(SP)解决了类似的问题:经过培训的演员一致地扮演临床案例,从而实现逼真的实践和客观的脚本化评估。在此,我们介绍了MedSP1000,一个源自SP的交互式临床代理评估基准,包括1638个SP案例,配有24602个轨迹级别的同行评审评分标准。MedSP1000将经过同行评审的SP教学案例转化为可执行场景,包含明确的SP案例脚本、临床环境背景以及经过人工验证的结构化评分标准。在每次模拟评估运行中,临床代理与患者代理和环境控制器进行闭环交互,其行为在整个问诊过程中根据原始材料中定义的专家标准进行评分。将MedSP1000应用于一系列通用和医学专用的大语言模型,我们发现静态基准的性能并不能可靠地转化为这些教育场景。表现最佳的模型GPT-5.5仅完成了60.4%的专家定义评分项,而最强的医学专用模型达到了40.0%;增加测试时计算并未带来可衡量的提升。这些结果表明,当前的大语言模型,包括为医学调整的代理系统,尚不足以安全地集成到实际临床实践中。更广泛地说,MedSP1000展示了过程级别的SP风格评估如何揭示单轮基准所遗漏的临床相关失败模式。
查看原文

相似文章

大型语言模型作为统一多模态学习器用于临床预测

arXiv cs.AI

该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。