标签
HealthCraft是一个强化学习环境,旨在评估急诊医学中LLM的安全性,揭示了像Claude Opus 4.6和GPT-5.4这样的前沿模型在实际多步骤任务中表现不佳,安全失败率高。
本研究评估了通过与大型语言模型(LLM)的交互式对话(通过 MedSyn 系统)如何提高急诊科医生在急诊环境中的诊断准确性,结果显示住院医师在处理疑难病例时的诊断准确率有显著提升。