如何不微调你的医疗大语言模型:深入探讨Mark Kaplan的healtthruth.ai——"覆盖并重构基础训练"
摘要
本文批评了Mark Kaplan通过其平台healtthruth.ai微调医疗大语言模型的方法,指出了在医疗AI中覆盖基础训练的陷阱。
暂无内容
相似文章
立场:医疗AI忽视真实治疗结果
本文立场文章论证了医疗AI在训练和评估中忽视了真实治疗结果,阻碍了其改善患者护理的能力,并建议纳入实际结果数据以符合循证医学原则。
在信息缺失情况下评估医疗人工智能:同源评审者与人工评分者改变表观安全性
本文将信息缺失压力测试推广至开放式医疗对话,发现大语言模型评审者的选择会显著改变表观安全性,且LLM评审者比临床医生更为宽松。
测量LLMs在误导性医疗语境下的认知韧性
介绍了MedMisBench,用于测量LLMs在误导性语境下维持正确医疗推理的能力。结果显示,在对抗性条件下,准确率从71.1%骤降至38.0%,临床专家组指出存在潜在危害。
无害原则?网络部署的医疗大语言模型中的幻觉与行为体层级滥用
本文对医疗大语言模型(包括定制MedGPT和开源模型)进行了大规模评估,发现其中25-30%的模型事实准确性较低,33.6-54.3%的模型违反操作阈值,揭示了系统性的安全风险。
医学AI在校准上失败,远早于它在口才上失败。
本文认为,医学AI可能因校准不佳和无法表达不确定性而失败,而非缺乏口才,并呼吁增加建立信任的功能。