大型语言模型与中医医生在中医领域中的真实世界临床病例评估

arXiv cs.CL 论文

摘要

该研究使用真实世界临床病例评估了16个大型语言模型与60位执业中医医生的表现,发现LLMs在某些领域获得更高的专家分数,但存在差异和安全问题。它强调了LLMs在中医决策支持中的潜力和局限性。

arXiv:2609.17544v1 Announce Type: new 摘要:大型语言模型(LLMs)正越来越多地被探索用于临床应用,但其在现实世界中医实践中的评估仍然有限。我们构建了一个包含来自62家医院的349个去标识化门诊病例的临床病例库,并使用从该库中选出的60个代表性病例评估了16个LLMs和60位执业中医医生作为比较组。模型输出和医生报告被匿名化,并由五位资深中医专家在九个诊断和治疗维度上进行评分。最先进的通用LLMs在专家评分上高于医生比较组,特别是在医疗建议、治疗原则和选定的诊断任务方面。然而,处方水平的分析揭示了在草药选择、剂量和治疗策略上的差异,定性安全审查发现幻觉和不良的模板化输出。这些发现突出了LLMs在中医决策支持中的潜力,同时强调了医生监督、安全约束和前瞻性临床评估的必要性。
查看原文
查看缓存全文

缓存时间: 2026/09/17 08:47

# 大语言模型与中医师对决:真实世界临床案例评估  
来源:https://arxiv.org/abs/2609.17544  
作者:谢嘉诚(https://arxiv.org/search/cs?searchtype=author&query=Xie,+J)、唐晓婷(https://arxiv.org/search/cs?searchtype=author&query=Tang,+X)、余阳(https://arxiv.org/search/cs?searchtype=author&query=Yu,+Y)、李晋普(https://arxiv.org/search/cs?searchtype=author&query=Li,+J)、李守力(https://arxiv.org/search/cs?searchtype=author&query=Li,+S)、荆丛丛(https://arxiv.org/search/cs?searchtype=author&query=Jing,+C)、杨彦涛(https://arxiv.org/search/cs?searchtype=author&query=Yang,+Y)、赵志勇(https://arxiv.org/search/cs?searchtype=author&query=Zhao,+Z)、张子阳(https://arxiv.org/search/cs?searchtype=author&query=Zhang,+Z)、宋麒麟(https://arxiv.org/search/cs?searchtype=author&query=Song,+Q)、安广辉(https://arxiv.org/search/cs?searchtype=author&query=An,+G)、徐冬(https://arxiv.org/search/cs?searchtype=author&query=Xu,+D)  

查看PDF (https://arxiv.org/pdf/2609.17544)  

> 摘要:大语言模型(LLMs)在临床应用中的探索日益增多,但其在真实世界中医实践中的评估仍存在空白。我们构建了包含来自62家医院349例去标识化门诊病例的临床案例库,并从该库中选取60例代表性病例,对16个大语言模型与60名在职中医师组成的对照组进行了评估。模型输出与医师报告均经匿名处理后,由五位资深中医专家从九个诊疗维度进行评分。前沿通用大语言模型在专家评分中优于医师对照组,尤其在医疗建议、治疗原则及部分诊断任务方面表现突出。然而,处方级分析揭示了中药选择、剂量及治疗策略方面的差异;定性安全审查则发现存在幻觉现象及不理想的模板化输出。这些发现凸显了大语言模型在中医决策支持方面的潜力,同时强调了医师监督、安全约束及前瞻性临床评估的必要性。  

## 提交历史记录  
发件人:谢嘉诚 \[查看邮件 (https://arxiv.org/show-email/98da81a0/2609.17544)\] **\[v1\]** 2026年7月15日 03:18:48 UTC(6,006 KB)

相似文章

在标准化病例中评估大语言模型在动态临床决策中的表现

Hugging Face Daily Papers

研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。

大型语言模型作为统一多模态学习器用于临床预测

arXiv cs.AI

该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。