标签
介绍了MedPIC-Bench,一个包含反事实问题的基准测试,用于评估大型语言模型在患者特定条件变化时是否正确应用药物安全规则;在28个LLM中,反事实问题的准确率显著下降,揭示了模型普遍无法修正判断的缺陷。
随着AI治疗聊天机器人越来越受欢迎,美国各州正在制定法律对其进行监管,以解决患者安全担忧。此前,Character.ai等平台遭到诉讼,且越来越多的人使用ChatGPT/Claude获取心理健康建议。
这篇观点文章认为,大语言模型尚不能安全用于自主临床决策支持,尤其是在对未分诊患者进行分诊时,原因在于缺乏在不完整信息和漏诊不对称成本条件下的稳健评估。
本文介绍了一项形成性研究,采用两阶段LLM流水线(Gemini 2.5 Pro 和 Flash)检测电子健康记录中的内部文档不一致性,分析了3000份出院小结,并提出了一种分级本体来对不一致性进行分类。
本文提出了一种具有来源感知能力、基于知识图谱的多智能体框架,该框架整合了来自Reddit和WebMD的患者叙事以及FDA针对九种抗抑郁药的药物不良事件报告,利用大语言模型(LLM)实体识别流水线实现了高准确率,并能够提供可追踪的精神科药物安全信息。
宾夕法尼亚州立大学的一项研究发现,像ChatGPT这样的AI聊天机器人回答日常健康问题的准确率接近76%,这引发了人们对它们在现实医疗应用中可信度的担忧。研究指出,AI工具可能更适合由医生使用,而非患者。