HealMed:医学领域大语言模型的多语言评估

arXiv cs.CL 论文

摘要

HealMed 是一个由专家审核的基准测试,用于评估医学领域大语言模型在九种语言上的表现,由医学专家开发以评估临床任务中的多语言性能。

arXiv:2608.19981v1 公告类型:新 摘要:我们提出 HealMed,一个由专家审核的多语言评估基准,用于医学领域的大语言模型。HealMed 在每种语言中包含 1,000 个示例,来自九个数据集,涵盖三种任务格式:MCQA、NLI 和开放式问答。该基准测试由来自九个国家和地区的 23 名医生和医学专家历时两年开发。每份翻译都由两名精通英语和相应目标语言的专家进行评估和修订。在 HealMed 上,低资源语言的性能下降最明显,尽管不同语言和模型之间的差距大小差异显著。最强的专有模型在跨语言方面最稳定,而许多开源和医学专业模型显示出更大且不太一致的差距。仅医学专业化并不能确保多语言鲁棒性。此外,专家修订可能会提高或降低测量性能,表明翻译质量对跨语言评估结果有实质性影响。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:16

# HealMed:大型语言模型在医学领域的多语言评估  
来源:https://arxiv.org/html/2608.19981  
HealMed研究团队  
所属单位:完整贡献者及所属单位列表请参见“贡献”部分。  
所属单位:\[4pt\]HealMed (https://huggingface.co/datasets/li-lab/HealMed)  

###### 摘要  
我们推出HealMed,一个经专家评审的基准,用于评估大型语言模型在医学领域的多语言能力。HealMed包含九种语言各1000条样本,来源于九个数据集,涵盖三种任务形式:多项选择问答(MCQA)、自然语言推理(NLI)和开放式问答。该基准由来自九个国家和地区的23名医生和医学专家历时两年开发完成。每段翻译均经过精通英语及对应目标语言的两位专家评审与修订。在HealMed上,低资源语言的性能下降最为显著,但不同语言和模型之间的差距差异明显。最强大的专有模型在各语言间表现最为稳定,而许多开源和医学专用模型则表现出更大且不一致的差距。仅具备医学专业知识并不能保证多语言稳健性。此外,专家修订可能提高或降低测评性能,表明翻译质量对跨语言评估结果有实质影响。  

## 1引言  
大型语言模型(LLMs)在医学执照考试问题上已展现出强劲性能,并能生成获得积极临床评价的长篇医疗回复Singhal et al. 2023 (https://arxiv.org/html/2608.19981#bib.bib28);Singhal et al. 2025 (https://arxiv.org/html/2608.19981#bib.bib29)。然而,这些能力的证据仍主要基于英语Ahuja et al. 2023 (https://arxiv.org/html/2608.19981#bib.bib2);Wu et al. 2025 (https://arxiv.org/html/2608.19981#bib.bib34);Xuan et al. 2025 (https://arxiv.org/html/2608.19981#bib.bib35)。英语基准上的性能并不能证明模型是否能理解医学概念或用其他语言可靠地传达,尤其是在训练数据和现有评估中代表性不足的语言Chen et al. 2025b (https://arxiv.org/html/2608.19981#bib.bib10);Singhal et al. 2025 (https://arxiv.org/html/2608.19981#bib.bib29)。因此,需要多语言评估来确定医学能力在跨语言时何处能迁移,何处会失效。  

目前已有一些多语言医学基准覆盖了问答和临床语言理解Qiu et al. 2024 (https://arxiv.org/html/2608.19981#bib.bib24);Alonso et al. 2024 (https://arxiv.org/html/2608.19981#bib.bib3);Wu et al. 2026 (https://arxiv.org/html/2608.19981#bib.bib33)。但其中许多是通过翻译英语测试集构建的。翻译可能改变医学术语、句法和上下文含义。这些变化会影响模型得分和排名Artetxe et al. 2020 (https://arxiv.org/html/2608.19981#bib.bib7);Singh et al. 2025 (https://arxiv.org/html/2608.19981#bib.bib27)。因此,目标语言的较低分数可能反映模型能力较弱、翻译错误或两者兼有。若无专家评审,这些误差来源无法分离。  

图1:HealMed概览。  
a. 基准范围,涵盖九种语言和九个源数据集的MCQA、NLI和开放式QA。  
b. 构建流程,包括英语源样本选择、机器翻译为八种目标语言、双语医学专家进行两阶段评审与修订,以及最终一致性检查和整理。  

在本文中,我们推出HealMed:用于医学AI的人工验证跨语言评估(Human-verified Evaluation Across Languages for Medical AI),一个经专家评审的医学基准,涵盖九种语言、九个源数据集和三类任务:多项选择问答(MCQA)、自然语言推理(NLI)和开放式问答(QA)。23名医生和医学专家参与了其构建和专家评审。每个目标语言实例均经过精通英语和对应目标语言的两位医学专家进行结构化的两阶段评审。  

我们在MCQA和NLI上评估了14个LLMs,并在开放式QA上评估了其中的十个模型。评估面板包括五个专有模型(GPT-5.4、o4-mini、Gemini-3-Flash、Claude-Sonnet-5和Claude-Opus-4.8)OpenAI 2026 (https://arxiv.org/html/2608.19981#bib.bib23);OpenAI 2025 (https://arxiv.org/html/2608.19981#bib.bib22);Google DeepMind 2025 (https://arxiv.org/html/2608.19981#bib.bib15);Anthropic 2026b (https://arxiv.org/html/2608.19981#bib.bib5);Anthropic 2026a (https://arxiv.org/html/2608.19981#bib.bib4),来自DeepSeekDeepSeek-AI 2024 (https://arxiv.org/html/2608.19981#bib.bib12)、QwenYang et al. 2024 (https://arxiv.org/html/2608.19981#bib.bib37);Yang et al. 2025 (https://arxiv.org/html/2608.19981#bib.bib36)、LLaMAGrattafiori et al. 2024 (https://arxiv.org/html/2608.19981#bib.bib16)和GemmaGemma Team et al. 2025 (https://arxiv.org/html/2608.19981#bib.bib14)家族的六个通用开源模型配置,以及三个医学专用模型:HuatuoGPT-o1Chen et al. 2025a (https://arxiv.org/html/2608.19981#bib.bib9)、MedGemmaSellergren et al. 2025 (https://arxiv.org/html/2608.19981#bib.bib26)和MediPhiCorbeil et al. 2025 (https://arxiv.org/html/2608.19981#bib.bib11)。开放式回复使用多语言LLM评判员协议进行评估。原始机器翻译版本和最终专家评审版本均保留以用于配对评估。  

我们发现,**最强大的专有模型兼具高准确性和跨语言稳定性能,而评估的开源和医学专用模型在低资源语言中表现出更大的性能损失**。后一组中的几个模型在高资源语言中表现强劲,但在低资源语言中急剧下降,表明仅靠医学专业知识无法弥合语言差距。  
**所有评估模型在低资源语言的MCQA和NLI上表现均较差**。这些损失集中在斯瓦希里语和祖鲁语,而泰语的表现仍接近日语和中文。  
**开放式QA呈现相同的大致模式**:GPT-5.4和Gemini-3-Flash在各资源组间保持稳定,但所有八个非专有模型在低资源组中均有下降。最大的下降主要与医学术语、流畅性和语言选择问题相关。  

配对比较显示,机器翻译和专家评审数据对多语言医学性能的评估可能得出不同结论。专家修订在某些语言-数据集组合中提高了测评性能,在其他组合中则降低了性能,且这些变化的幅度也因情境而异。在开放式QA中,专家评审数据在大多数语言-数据集组合中得分较低。这种不对称性表明LLM评判员可能与机器翻译问题和参考答案的字面措辞更一致。因此,机器翻译可能引入测量偏差,可能无法完全反映模型对自然表达的目标语言医学问题的性能。  

## 2HealMed数据集  
HealMed是一个经专家评审的多语言医学基准,用于评估医学AI系统在九种语言、三类任务和九个源数据集上的表现。图1 (https://arxiv.org/html/2608.19981#S1.F1)总结了基准范围和构建流程。HealMed与选定多语言医学基准(包括其范围、构建和人工评审程序)的详细比较见附录B (https://arxiv.org/html/2608.19981#A2)。  

### 2.1基准范围与构成  
我们从九个源数据集中总共选择了1000条英语样本。7个目标语言的机器翻译版本来自GlobMed111https://huggingface.co/collections/ruiyang-medinfo/globmed,而泰语翻译是通过Azure OpenAI API使用GPT-5.5通过零样本提示生成的。每个翻译实例随后由两位精通英语和对应目标语言的医学专家进行评审。因此,HealMed涵盖九种语言:英语、德语、西班牙语、葡萄牙语、日语、中文、泰语、斯瓦希里语和祖鲁语。  

HealMed涵盖三种互补的任务形式,旨在评估医学语言模型在不同输出约束下的表现,从固定选项预测和关系分类到自由形式生成。MCQA部分包括HeadQAVilares and Gómez-Rodríguez 2019 (https://arxiv.org/html/2608.19981#bib.bib30)、MedQAJin et al. 2021 (https://arxiv.org/html/2608.19981#bib.bib18)、MedExpQAAlonso et al. 2024 (https://arxiv.org/html/2608.19981#bib.bib3)和MMLU-ProWang et al. 2024b (https://arxiv.org/html/2608.19981#bib.bib32),要求模型从固定选项中选择正确答案。NLI部分包括BioNLIBastan et al. 2022 (https://arxiv.org/html/2608.19981#bib.bib8)和MedNLIRomanov and Shivade 2018 (https://arxiv.org/html/2608.19981#bib.bib25),要求模型将配对的生物医学或临床语句之间的逻辑关系分类为蕴含、矛盾或(如适用)中性。开放式QA部分包括ExpertQA-Bio、ExpertQA-MedMalaviya et al. 2024 (https://arxiv.org/html/2608.19981#bib.bib20)和LiveQAAbacha et al. 2017 (https://arxiv.org/html/2608.19981#bib.bib1),要求模型生成自由形式的答案。更多细节见附录A (https://arxiv.org/html/2608.19981#A1)。所有部分使用共同的采样、翻译和专家评审程序。  

### 2.2构建与专家评审  
每个目标语言实例均经过精通英语和对应目标语言的两位医学专家进行两阶段评审(图1 (https://arxiv.org/html/2608.19981#S1.F1)b)。两位专家将英语原文与原始机器翻译进行比较,并在五点量表上对准确性、流畅性和完整性进行评分。准确性反映语义保真度和医学术语的适当使用;流畅性反映语法正确性、自然度和专业用法;完整性反映在无遗漏或无根据添加的情况下保留源信息的程度。评分范围从1(表示严重缺陷)到5(表示无重大缺陷)。  

在第一阶段,审阅者1对原始机器翻译进行评分,并在必要时提供修正版本,在无需更改时保留原始措辞。审阅者还简要记录不准确或不自然的翻译。在第二阶段,审阅者2使用相同标准独立对原始翻译进行评分,验证第一次修订并修正任何剩余错误。此过程为每个目标语言实例生成了两组质量评分和一份最终专家修订翻译。  

图2:HealMed中MCQA和NLI任务的多语言性能。  
a. 14个模型在四个MCQA和两个NLI数据集上的宏观平均准确率。蓝色条形表示低资源语言均值,红色延伸部分表示与高资源语言均值的差距。圆形、方形和菱形分别表示专有、开源和医学专用模型。  
b. 各模型跨语言的准确率水平。  
c. 相对于英语的模型内准确率变化。灰色点代表单个模型;彩色点和水平线显示均值和四分位距。黑色、蓝色和红色分别表示英语、其他高资源语言和低资源语言。高资源语言包括英语、德语、西班牙语、葡萄牙语、日语和中文;低资源语言包括泰语、斯瓦希里语和祖鲁语。  

## 3模型在HealMed上的性能  
### 3.1 MCQA和NLI上的性能  
我们评估了14个模型的整体性能是否与跨语言稳定性相关(图2 (https://arxiv.org/html/2608.19981#S2.F2))。对于每个模型,我们计算了每个语言内四个MCQA和两个NLI数据集的宏观平均准确率,然后对九种语言取平均值。我们定义资源差距为高资源语言(英语、德语、西班牙语、葡萄牙语、日语和中文)与低资源语言(泰语、斯瓦希里语和祖鲁语)平均准确率之差222此分组遵循Joshi et al.的六级分类法Joshi et al. 2020 (https://arxiv.org/html/2608.19981#bib.bib19):第4-5类视为高资源,第2-3类视为低资源,基于标记NLP数据集和未标记数字文本的可用性,而非模型特定的预训练语料库。六个组成数据集的完整模型和语言级别准确率见附录H (https://arxiv.org/html/2608.19981#A8)。  

##### **专有模型在准确性和跨语言稳定性上均表现最佳。** 五个专有模型占据总准确率前五位,且资源差距最小,范围在1.9至5.5个百分点之间(图2 (https://arxiv.org/html/2608.19981#S2.F2)a)。它们在低资源语言的平均准确率为79.0%至84.0%,而开源和医学专用模型最高仅为60.0%。  

##### **对于非专有模型,高总体准确率并不能保证多语言稳定性。** Qwen2.5-72B-Instruct和Gemma-3-27B-it达到相似的总体准确率(分别为65.0%和65.3%),但它们的资源差距差异显著(26.8和9.7个百分点)。Qwen3-32B-thinking是总体表现最佳的非专有模型,但其在低资源语言的平均准确率比高资源语言低21.7个百分点。三个医学专用模型也表现出显著的资源差距(13.6–20.8个百分点)。因此,仅凭医学专业知识并不能确保在该模型面板中实现更强的跨语言稳定性。  

图3:HealMed上的开放式QA性能。  
a. 十个模型在三个QA数据集上的平均LLM评判员得分,进行宏观平均。蓝色和红色点分别显示高资源和低资源均值;菱形显示所有语言的均值。  
b. 相对于每个模型英语得分的分数变化。正值表示得分高于英语基线。灰色线显示单个模型,深色线显示其均值。  
c. 总分低于3分、安全分数为2分或更低,或存在特定语言和适用性问题的回复比例。其他高资源语言包括英语、德语、西班牙语、葡萄牙语、日语和中文。气泡大小和颜色表示比例;比例至少10%时显示数值。  

##### **相对于英语的性能损失集中在斯瓦希里语和祖鲁语,而泰语的降幅与日语和中文观察到的相似。** 所有八种翻译语言的平均准确率均低于英语(图2 (https://arxiv.org/html/2608.19981#S2.F2)b,c)。德语、西班牙语和葡萄牙语的降幅在2.1至3.8个百分点之间,日语、中文和泰语分别为6.1、6.5和5.9个百分点。斯瓦希里语(15.4个百分点)和祖鲁语(28.9个百分点)的降幅更大。14个模型中有8个在斯瓦希里语上损失至少10个百分点,有9个在祖鲁语上损失至少20个百分点。模型间变异相应增加:四分位距从英语的8.5个百分点扩大到斯瓦希里语的24.9个百分点和祖鲁语的44.4个百分点。将语言按资源水平分组后,

相似文章

MEDSYN: 复杂临床病例中多证据综合的多模态大语言模型基准测试

arXiv cs.CL

MEDSYN 是一个多语言多模态基准,用于评估多模态大语言模型(MLLMs)在复杂临床病例上的表现,每个病例最多包含 7 种不同的视觉证据类型。研究表明,虽然前沿模型在鉴别诊断生成方面与人类专家相当,但所有 MLLMs 在最终诊断选择中均存在显著差距,原因是异质临床证据综合能力不足。

MedicalBench:评估大型语言模型以改进医学概念提取

arXiv cs.CL

MedicalBench是一个新的基准测试,用于评估大型语言模型从电子健康记录中提取医学概念的能力,重点关注隐含推理和证据支撑。它包含823个专家标注的示例,并显示当前模型表现一般,突显了提取隐含表述的医学概念的难度。