提示语言影响大型语言模型的诊断推理和准确性
摘要
本研究评估了提示语言(英语与法语)如何影响五个大型语言模型的诊断推理和准确性,使用了180个临床案例,发现大多数模型在英语下表现显著更好,只有o3是例外。
arXiv:2605.19173v1 Announce Type: new
摘要:大型语言模型(LLMs)越来越多地被探索用于临床决策支持,但大多数评估都是用英语进行的,这使其在其他语言中的可靠性不确定。本文通过比较五个LLM(o3、DeepSeek-R1、GPT-4-Turbo、Llama-3.1-405B-Instruct和BioMistral-7B)在英语和法语上的表现,评估了提示语言对诊断推理和最终诊断准确性的影响。总共180个涵盖16个医学专业的临床案例由两位医生使用18分制进行评估,同时评价诊断准确性和推理质量。五个模型中有四个在英语下表现更好(平均差异0.37-0.91,调整后p<0.05),差异涉及推理的多个方面,包括鉴别诊断、逻辑结构和内部有效性。o3是唯一没有表现出整体语言效应的模型。这些发现表明,提示语言仍然是LLM临床性能的关键决定因素,对全球公平的语言文化部署具有重要意义。
查看缓存全文
缓存时间: 2026/05/20 08:24
# 提示语言影响大语言模型的诊断推理与准确性
来源:https://arxiv.org/html/2605.19173
\\keepXColumns
Adrien Bazoge Josselin Corvellec Sofiane Djillali Sid\-AhmedPierre\-Antoine Gourraud 数据诊所,南特大学医院,法国
###### 摘要
大语言模型 \(LLMs\) 在临床决策支持方面的应用日益受到探索,然而大多数评估均在英语环境下进行,其在其他语言中的可靠性仍不确定。本文通过比较五种LLM \(o3, DeepSeek\-R1, GPT\-4\-Turbo, Llama\-3\.1\-405B\-Instruct 和 BioMistral\-7B\) 在英语和法语下的表现,评估了提示语言对诊断推理和最终诊断准确性的影响。两位医生使用18分量表对涵盖16个医学专科的180个临床病例进行了评估,该量表同时评价诊断准确性和推理质量。五种模型中有四种在英语环境下表现更好 \(平均差异 0\.37–0\.91,调整后p<<0\.05\),差距体现在推理的多个方面,包括鉴别诊断、逻辑结构和内部效度。o3是唯一显示无整体语言效应的模型。这些发现表明,提示语言仍然是LLM临床表现的关键决定因素,对全球语言文化公平部署具有重要意义。
## 1 引言
在人工智能应用中,大语言模型 \(LLMs\) 的可及性正在迅速改变包括医学在内的许多行业,在辅助临床医生进行诊断推理和决策、减轻行政任务负担以释放医疗时间,以及方便人们获取基本健康建议等方面展现出应用前景[34 (https://arxiv.org/html/2605.19173#bib.bib1),6 (https://arxiv.org/html/2605.19173#bib.bib2),18 (https://arxiv.org/html/2605.19173#bib.bib3)]。通过编码大量临床知识并以近乎实时的方式大规模分析电子健康记录中的复杂信息,LLMs 有潜力支持不同专科和医疗系统的临床工作者,同时改善获取健康信息和高质量医疗服务的途径,特别是在资源匮乏的环境中[5 (https://arxiv.org/html/2605.19173#bib.bib4),3 (https://arxiv.org/html/2605.19173#bib.bib5),29 (https://arxiv.org/html/2605.19173#bib.bib6),22 (https://arxiv.org/html/2605.19173#bib.bib7)]。
尽管有这些潜力,但在将LLMs负责任地整合到临床实践之前,仍面临重要挑战,需确保创新符合希波克拉底价值观——优先考虑患者安全、自主性、隐私以及获得优质护理的平等机会[7 (https://arxiv.org/html/2605.19173#bib.bib8)]。大多数模型主要使用来自美国和欧洲等高收入地区的英语数据进行训练,并主要在英语环境下进行基准测试,这引发了对其在多语言和多元文化医疗环境中可靠性的担忧[9 (https://arxiv.org/html/2605.19173#bib.bib9),20 (https://arxiv.org/html/2605.19173#bib.bib10)]。这在医学领域尤为突出,因为语言与文化、流行病学、临床实践和法规密不可分。大量临床相关知识由于隐私限制而无法获取、未被充分代表或未出现在训练语料中。即使这些知识被编码,其有效使用也取决于在用户自身的语言、文化和医疗背景下的准确解释和应用。如果在训练和部署阶段缺乏强大的多语言和多文化对齐,LLMs 可能错失减少在获取可信健康信息、可靠临床决策支持和符合情境的适当护理方面不平等的机会,特别是对于那些语言和医疗现实在塑造这些模型的数据中代表性不足的人群。此外,对LLMs的评估大多依赖于简化的标准化多项选择题基准[29 (https://arxiv.org/html/2605.19173#bib.bib6),30 (https://arxiv.org/html/2605.19173#bib.bib11)],这未能捕捉真实临床常规实践的复杂性。因此,在真实世界临床环境中的评估仍然有限[18 (https://arxiv.org/html/2605.19173#bib.bib3),5 (https://arxiv.org/html/2605.19173#bib.bib4)],留下了其在多样化医疗环境中的可靠性和安全性的不确定性。
先前的研究已经证明了LLMs从模拟临床病例和连续临床遭遇中生成准确诊断和鉴别诊断的能力,但大多数评估仅在英语环境下进行[16 (https://arxiv.org/html/2605.19173#bib.bib12),26 (https://arxiv.org/html/2605.19173#bib.bib13),33 (https://arxiv.org/html/2605.19173#bib.bib14),21 (https://arxiv.org/html/2605.19173#bib.bib15),25 (https://arxiv.org/html/2605.19173#bib.bib16)]。少数在医学背景下探索多语言评估的研究要么病例数量有限[18 (https://arxiv.org/html/2605.19173#bib.bib3)],要么局限于医学考试的多项选择格式[4 (https://arxiv.org/html/2605.19173#bib.bib17),24 (https://arxiv.org/html/2605.19173#bib.bib18),32 (https://arxiv.org/html/2605.19173#bib.bib19),36 (https://arxiv.org/html/2605.19173#bib.bib20)],或者没有明确分析不同语言间的性能差异[5 (https://arxiv.org/html/2605.19173#bib.bib4)]。这些研究的新兴证据表明,模型性能在不同语言间可能存在显著差异[18 (https://arxiv.org/html/2605.19173#bib.bib3),4 (https://arxiv.org/html/2605.19173#bib.bib17),24 (https://arxiv.org/html/2605.19173#bib.bib18),32 (https://arxiv.org/html/2605.19173#bib.bib19),36 (https://arxiv.org/html/2605.19173#bib.bib20),15 (https://arxiv.org/html/2605.19173#bib.bib21)],这提出了一个疑问:在非英语环境下,临床决策任务(包括诊断推理)的性能是否保持一致。
为填补这一空白,我们设计了一个英法双语对比评估框架,用于评估诊断推理和最终诊断准确性,因为这些是临床决策的入口,对于提供有效的患者护理至关重要[13 (https://arxiv.org/html/2605.19173#bib.bib22),2 (https://arxiv.org/html/2605.19173#bib.bib23)]。我们评估了五种涵盖不同架构和能力水平的LLMs:o3[14 (https://arxiv.org/html/2605.19173#bib.bib24)]、DeepSeek\-R1[12 (https://arxiv.org/html/2605.19173#bib.bib25)]、GPT\-4\-Turbo[23 (https://arxiv.org/html/2605.19173#bib.bib26)]、Llama\-3\.1\-405B\-Instruct \(Llama\-405B\)[11 (https://arxiv.org/html/2605.19173#bib.bib27)] 和 BioMistral\-7B[17 (https://arxiv.org/html/2605.19173#bib.bib28)]。总共180个临床病例覆盖16个医学专科和多种诊断与推理类型,由两位医生使用18分量表独立评估,该量表评估最终诊断的准确性和基础临床推理的质量。
## 2 方法
### 2\.1 病例设计
本研究调查了内科及内外科专科中的诊断推理和临床诊断。主要侧重于技术性操作的学科(放射学、临床生物学、解剖病理学和核医学)以及纯外科领域被排除在外。保留了十六个专科,涵盖临床医学的广度:急诊与重症医学、内分泌与代谢、妇科、肿瘤血液科、肝病胃肠科、感染与热带病科、心血管内科、全科、内科、神经内科、头颈科、儿科、呼吸科、精神科、风湿科和泌尿肾病科。每个专科大约编写了10个病例(范围:6–17),除了全科——这是两位医生的专科,为其创建了32个病例,总计180个病例。每个病例都设计有预定义的预期诊断,并包含建立该诊断所需的所有信息,包括临床适宜时的第一线辅助检查结果。我们采用这种基于病例的设计来模拟早期临床接触的现实情况,例如门诊或急诊环境中的情况。在这些环境中,医生通常通过一组狭窄的有针对性的问题来工作,导致病史可能稀疏、不完整,或偶尔包含无关细节。
病例来源于三个渠道:(1) 由医生根据现行医疗指南全新创作的合成病例,(2) 改编自参考资料(教科书、讲义和住院医师培训资源)的病例,以及 (3) 基于真实临床接触的非识别性细节。改编自参考文本的病例被重新表述为病例格式,以满足预定义标准并尽量减少与模型在线训练数据潜在的重复。对于合成病例和真实病例,最终诊断由医生提出;对于基于参考文本的病例,诊断从来源中提取。诊断被视为预期诊断,无论其确定性如何,并反映了最相关、最可能或临床上可采取行动的病症。例如,在危重患者中,预期诊断是感染性休克,而不是识别特定病原体。根据背景,诊断可以是病因性的\(n= 113\)、综合征性的\(n= 54\) 或临床旁性的\(n= 13\)。
对于所有病例,医生提供了一个导向最终诊断的参考诊断推理路径。推理过程分为五种类型,尽管在实践中的临床推理通常涉及多种同时进行的方法,但为了分析目的,每种类型被分配一个单一的主要类型:
- •个案识别 \(n= 57\):基于模式识别或回忆先前遇到的病例的非分析性推理;对于简单和典型的病例有效,需要扎实的临床背景。
- •假设演绎 \(n= 37\):系统评估诊断假设,通常通过直觉模式识别产生,并通过病史采集、临床检查和辅助检查来测试,以确认或排除可能的诊断。
- •正向链式推理 \(n= 55\):一种分析过程,通过应用因果或条件规则(临床知识、病理生理学等)从临床和辅助检查结果逐步推导至诊断。
- •算法推理 \(n= 14\):一种二元的、逐步的过程,医生根据体征的存在与否或检查的阳性阴性结果,通过连续排除来得出诊断。
- •概率推理 \(n= 17\):使用患者群体的患病率数据以及临床和辅助检查结果的似然比来估计验后诊断概率;特别适用于诊断不确定的语境。
所有180个病例均用法语构建。每个病例及其相应的诊断推理和最终诊断均由两位医生独立翻译成英语。对所有病例进行了翻译的交叉验证,以确保临床准确性和语义等价性。
### 2\.2 模型选择与提示
评估了五种大语言模型,选择涵盖不同的架构、训练方法和可访问性级别。研究分两个阶段进行。在第一阶段(2024年8月至9月),评估了三个模型:2024年8月6日通过OpenAI API的GPT\-4\-Turbo,2024年9月10日通过NVIDIA API的Llama\-3\.1\-405B\-Instruct,以及本地部署在NVIDIA A100 80GB GPU上的BioMistral\-7B。在第二阶段(2025年7月),增加了两个具有改进推理能力的更新模型:通过DeepSeek API的DeepSeek\-R1和通过OpenAI API的OpenAI o3,两者均在2025年7月29日查询。
每个模型在每个语言下对每个病例查询一次,使用默认生成参数。提示在所有模型间相同,仅语言指令和病例文本在英语和法语之间变化:
提示模板以医生的身份为患者采集病史。尽力提供你的临床推理,以便做出准确的最终诊断。你的回答必须用 \{language\} 书写。将输出格式化为包含两个字段的json:‘diagnostic’ 表示你的最终诊断,‘clinical\_reasoning’ 表示你是如何推理出这个诊断的。 \{vignette\}
其中\{language\}被替换为“English”或“French”,\{vignette\}被替换为对应的英文或法文病例文本。
### 2\.3 评估框架
模型输出使用基于六个标准的18分量表进行评估(详细评分标准见补充表9 (https://arxiv.org/html/2605.19173#A2.T9))。五个标准评估诊断推理的质量:
#### 内部效度 \(0 到 5 分\)
该标准评估从病例中提取和解释相关数据的能力。高质量的回答需要包含病例中所有对诊断有用的元素,以及对有助于推理的辅助检查结果的解释。该项目还评估描述性发现是否被转化为恰当的医学术语(例如,“按压不褪色的紫色皮肤病变”应促使识别为紫癜)。同样,期望对数值临床数据进行情境化处理,例如将38\.5°C定义为发热,将高于阈值的收缩压定义为高血压,或将身体质量指数≥\\geq25 kg/m2定义为超重。同样的原则适用于辅助检查:当病例中未预先解释时,只要对诊断相关,我们期望将其整合进来。
#### 外部效度 \(0 到 3 分\)
该标准评估模型在病例描述之外引入的医学知识的科学准确性。如果未调用外部知识,则默认分配3分,以不惩罚那些通常对诊断并非必要的此类内容。
#### 假设与鉴别诊断 \(0 到 1 分\)
该标准评估生成相关假设和鉴别诊断的能力,理想情况下应按可能性或严重性进行组织。即使某个鉴别诊断很容易被排除,提及它通常也能丰富临床推理。如果医生的诊断推理中引用了鉴别诊断而模型遗漏了,则分配0分。相反,对于预期没有鉴别诊断的病例,给予满分,以避免惩罚否则有效的推理。
#### 逻辑结构 \(0 到 4 分\)
该标准衡量推理的连贯性和组织性,与内容准确性无关。特别注意逻辑呈现顺序(例如,临床数据通常先于辅助检查结果)、无矛盾以及避免不相关的陈述。
#### 表达 \(0 到 2 分\)
对表达错误、语义或句法错误进行扣分。当期望法语时生成英语回答也会被扣分。
第六个标准,最终诊断准确性 \(0 到 3 分\),将模型的诊断与医生建立的参考诊断进行比较。两位医生彼此不知晓对方的评估,独立评估了所有模型输出相似文章
大型语言模型在医学推理中表现出元认知敏感性
一项对照研究评估了大型语言模型在医学推理中的元认知敏感性,发现部分但存在缺陷的置信度校准,其随证据强度和冲突情境而变化。
强化学习用于大型语言模型的寻求证据诊断推理
本文提出了一种基于强化学习的框架,用于利用大型语言模型进行寻求证据的诊断推理。经过强化学习训练的7B模型在多语言临床咨询任务中优于更大的模型,表明专门的强化学习可以提炼高水平的临床推理。
确认我们的偏见?评估大型语言模型的能力、风险与社会影响
这篇预印本评估了六个大型语言模型在160个提示词中对提示框架和偏见提示的响应方式,发现LLMs即使在事实性语境下也会系统性地调整其响应以与提示框架保持一致,从而可能强化用户的偏见。
在标准化病例中评估大语言模型在动态临床决策中的表现
研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。
诊断之前先询问:Safe-Psych,面向精神科领域大语言模型的序贯评估基准
介绍了Safe-Psych,一个用于评估大语言模型如何在精神科处理诊断不确定性的序贯基准,结果显示即使是强大的模型在临床证据不完整时也常常无法放弃诊断或寻求澄清。