标签
本文提出了一种利用具有挑战性的真实临床案例对多轮多模态诊断推理进行评估的方法,旨在衡量AI模型处理复杂医疗场景的能力。
本文提出了一种基于强化学习的框架,用于利用大型语言模型进行寻求证据的诊断推理。经过强化学习训练的7B模型在多语言临床咨询任务中优于更大的模型,表明专门的强化学习可以提炼高水平的临床推理。
本研究评估了提示语言(英语与法语)如何影响五个大型语言模型的诊断推理和准确性,使用了180个临床案例,发现大多数模型在英语下表现显著更好,只有o3是例外。
UMBC 研究人员发现,大语言模型在判断科学主张是否可行时,依据结果数据比依据实验描述更准确;不完整的实验背景反而会降低准确率。