标签
本研究采用双重评估框架,使用人类领域专家和LLMs作为评估者,评估面向癌症患者的AI生成摘要,重点关注医疗保健应用中的准确性、临床相关性和安全性。
本文评估了临床医生的成对偏好能否可靠反映大语言模型(LLM)的临床安全性,使用了来自超过736名临床医生对13个模型的26,804条判断。研究发现,偏好排名与安全关键失败的相关性较弱,并提出了一种经临床调整的排名,能更好地纳入基于评分标准的安全性信号。
本文提出了一种多智能体‘信任但验证’系统,旨在减少大语言模型中的医疗幻觉。该系统在关于违禁药物的临床问题上测试了三种开放获取模型,实现了53%的幻觉错误率降低。