人机对话提升急诊诊疗的诊断准确性
摘要
本研究评估了通过与大型语言模型(LLM)的交互式对话(通过 MedSyn 系统)如何提高急诊科医生在急诊环境中的诊断准确性,结果显示住院医师在处理疑难病例时的诊断准确率有显著提升。
arXiv:2605.08533v1 公告类型:新论文
摘要:急诊医学中的临床决策需要在不确定性条件下快速、准确地进行诊断。尽管基准测试已取得进展,但关于 LLM 作为实时医生工作流程中交互式辅助工具的证据仍然匮乏。MedSyn 系统允许医生在仅提供主诉的情况下查看完整病历,并迭代地向 LLM 进行查询。七名医生(三名高年资医生,四名住院医师)在 52 个按难度分层的 MIMIC-IV 病例中完成了基线测试和 AI 辅助测试。盲法评估显示,住院医师在疑难病例中的正确率从 0.589 上升至 0.734;经难度标准化的完全正确率证实存在中等效应({\Delta} = 0.092; p = 0.071; d = 0.47)。自动化指标也佐证了这些提升:标准化任意匹配准确率提高了 0.156(p < 0.0001),且住院医师的 F1 分数提升幅度最大({\Delta} = 0.138; p < 0.0001)。对话分析揭示了依赖专业水平的策略差异(高年资医生提出有针对性、假设驱动的问题;住院医师则倾向于更广泛的查询),同时跨专业水平的一致性有所提高({\Delta} = 0.145; p < 0.0001)。交互式 LLM 支持显著增强了诊断推理能力。
查看缓存全文
缓存时间: 2026/05/12 07:16
# 人机对话提升急诊护理的诊断准确性 来源: https://arxiv.org/abs/2605.08533 作者:Burcu Sayin (https://arxiv.org/search/cs?searchtype=author&query=Sayin,+B),Ngoc Vo Hong (https://arxiv.org/search/cs?searchtype=author&query=Hong,+N+V),Ipek Baris Schlicht (https://arxiv.org/search/cs?searchtype=author&query=Schlicht,+I+B),Jacopo Staiano (https://arxiv.org/search/cs?searchtype=author&query=Staiano,+J),Pasquale Minervini (https://arxiv.org/search/cs?searchtype=author&query=Minervini,+P),Sara Allievi (https://arxiv.org/search/cs?searchtype=author&query=Allievi,+S),Nicola Susca (https://arxiv.org/search/cs?searchtype=author&query=Susca,+N),Nicola Osti (https://arxiv.org/search/cs?searchtype=author&query=Osti,+N),Alberto Maino (https://arxiv.org/search/cs?searchtype=author&query=Maino,+A),Vito Racanelli (https://arxiv.org/search/cs?searchtype=author&query=Racanelli,+V),Andrea Passerini (https://arxiv.org/search/cs?searchtype=author&query=Passerini,+A) 查看 PDF (https://arxiv.org/pdf/2605.08533) > 摘要:急诊医学中的临床决策需要在不确定性条件下做出快速、准确的诊断。尽管基准测试取得了进展,但关于大语言模型(LLMs)在医生实际工作流程中作为交互式辅助工具的证据仍然稀少。MedSyn 让医生在最初仅查看主诉的情况下,利用包含完整临床记录的大语言模型进行迭代式查询。七名医生(三名高年资医师,四名住院医师)在 52 个按难度分层的 MIMIC-IV 案例中完成了基线和人工智能辅助会话。盲法评估显示,住院医师在困难案例上的正确率从 0.589 上升至 0.734;难度标准化的完全正确率证实存在中等效应($\Delta$ = 0.092;p = 0.071;d = 0.47)。自动化指标证实了这些增益:标准化的任意匹配准确率提高了 0.156(p < 0.0001),住院医师表现出最大的 F1 分数增益($\Delta$ = 0.138;p < 0.0001)。对话分析揭示了依赖于专业水平的策略(高年资医师提出有针对性的、以假设为驱动的问题;住院医师则依赖更广泛的查询),且跨专业水平的一致性增加($\Delta$ = 0.145;p < 0.0001)。交互式大语言模型支持显著增强了诊断推理能力。 ## 提交历史 来自: Burcu Sayin Günel [查看邮件 (https://arxiv.org/show-email/91bf1b8b/2605.08533)] **[v1]**2026 年 5 月 8 日,星期五,22:40:10 UTC(1,666 KB)
相似文章
LLMs 是否已准备好协助医生?PhysAssistBench:用于交互式医生-患者-EHR 辅助的基准
介绍了 PhysAssistBench,这是一个用于评估 LLM 在交互式医生-患者-EHR 辅助中性能的基准。实验表明,当前模型在此场景下不可靠,凸显了协调能力的需求。
在信息缺失情况下评估医疗人工智能:同源评审者与人工评分者改变表观安全性
本文将信息缺失压力测试推广至开放式医疗对话,发现大语言模型评审者的选择会显著改变表观安全性,且LLM评审者比临床医生更为宽松。
长期历史感知的医疗对话合成与评估
本文介绍了一种利用大语言模型(LLMs)合成长期医疗对话数据集的框架,并创建了 MediLongChat,包含三个基准任务,用于评估医疗智能体的记忆与推理能力。实验表明,即使是最先进的 LLMs 也难以完成这些任务。
测量LLMs在误导性医疗语境下的认知韧性
介绍了MedMisBench,用于测量LLMs在误导性语境下维持正确医疗推理的能力。结果显示,在对抗性条件下,准确率从71.1%骤降至38.0%,临床专家组指出存在潜在危害。
MedAction:迈向主动式多轮临床诊断大语言模型
本文介绍了 MedAction 框架,该框架通过模拟迭代式的检查开具与假设更新,训练大语言模型(LLM)进行主动的多轮临床诊断。文章提出了一个新的数据集 MedAction-32K,并展示了开源模型在医学基准测试上的最先进水平(SOTA)性能。