MMed-Bench-IR:一个用于多语言医学信息检索的异构基准
摘要
MMed-Bench-IR是一个跨六种语言的多语言医学信息检索异构基准,评估跨语言对齐、概念区分和证据检索。它揭示了非英语查询的严重性能下降,凸显了现有仅英语评估的不足。
arXiv:2606.24200v1 公告类型: 新
摘要:临床环境中的检索增强生成(RAG)越来越需要针对主要以英文为基础的证据语料库进行多语言检索。多语言医学检索需要三种能力:跨语言对齐、概念区分和证据检索。然而,现有基准仅孤立评估这些能力,未衡量生物医学专业知识与多语言覆盖之间的交互。我们引入了MMed-Bench-IR,这是一个旨在跨6种语言和三个结构异构任务解耦这些维度的基准:(1) 基于统一医学语言系统(UMLS)的6,127个查询的跨语言医学问答检索,(2) 针对三个难度级别共4,975个混淆集的概念区分,以及(3) 用于RAG的2,040个质量保证查询的多语言证据检索。这三个任务在设计上共享零概念和查询重叠,确保总分反映真实的能力广度。对六个范式家族的十个系统的评估揭示了严重的跨语言失败:在英文上得分为0.818 nDCG@10的生物医学编码器,在日文上降至0.056,这是仅英文基准无法检测到的差距。
查看缓存全文
缓存时间: 2026/06/24 07:45
# MMed-Bench-IR:面向多语言医学信息检索的异构基准 来源:https://arxiv.org/html/2606.24200 Junhyeok Lee1,2,†\\dagger,Han Jang1,3,†\\dagger,Hyeonjin Goh3,Kyu Sung Choi1,2,3,∗\* 1首尔大学 2首尔大学医学院 3首尔大学医院 †\\dagger 同等贡献 ∗\* 通讯作者:ent1127@snu\.ac\.kr ###### 摘要 临床环境中的检索增强生成(RAG)越来越需要针对以英语为主的证据语料库进行多语言检索。多语言医学检索需要三种能力:跨语言对齐、概念区分和证据检索。然而,现有基准仅孤立地评估这些能力,未能衡量生物医学专业知识与多语言覆盖之间的交互作用。我们提出 MMed\-Bench\-IR,这是一个旨在将这三个维度解耦的基准,涵盖6种语言和三个结构异构的任务:(1)基于统一医学语言系统(UMLS)的6,127个查询的跨语言医学问答检索,(2)涵盖三个难度层级、共4,975个混淆集的概念区分任务,以及(3)用于RAG的多语言证据检索,包含2,040个质量保证的查询。这三个任务在设计上共享零概念和零查询重叠,确保总分反映真实的能力广度。对跨六个范式家族的十个系统的评估揭示了严重的跨语言失败:在英语中得分为0.818 nDCG@10的生物医学编码器在日语中降至0.056,这是仅英语基准无法检测到的差距。 # MMed-Bench-IR:面向多语言医学信息检索的异构基准 Junhyeok Lee1,2,†\\dagger,Han Jang1,3,†\\dagger,Hyeonjin Goh3,Kyu Sung Choi1,2,3,∗\* 1首尔大学 2首尔大学医学院 3首尔大学医院 †\\dagger 同等贡献 ∗\* 通讯作者:ent1127@snu\.ac\.kr ## 1 引言 参考图注图1:动机。(a) 仅针对英语的生物医学基准忽略了非英语查询。(b) 现有的多语言医学基准覆盖2-3种语言和一个任务。(c) MMed-Bench-IR 在6种语言和3种书写系统中评估所有三个维度。 大型语言模型在医疗保健中的应用日益增多 (Sahni and Carrus, 2023 (https://arxiv.org/html/2606.24200#bib.bib18)),其临床回答的质量很大程度上依赖于提供支持证据的检索系统 (Qiu et al., 2024 (https://arxiv.org/html/2606.24200#bib.bib15); Wang et al., 2024b (https://arxiv.org/html/2606.24200#bib.bib22))。然而,这些检索系统主要是为英语构建和评估的,这为非英语人群造成了日益扩大的差距。语言障碍与就医机会减少、不良事件发生率更高以及临床环境中健康结果较差相关 (Joo et al., 2023 (https://arxiv.org/html/2606.24200#bib.bib9)),最近的研究警告称,AI驱动的临床工具可能因在资源充足和数字代表性不足的语言之间表现出显著的性能差异,而加剧这些不平等 (Anyaegbuna et al., 2026 (https://arxiv.org/html/2606.24200#bib.bib2); Ortega et al., 2025 (https://arxiv.org/html/2606.24200#bib.bib13))。 一个关键的瓶颈在于检索阶段:驱动这些系统的嵌入模型和密集检索器通常缺乏处理多种语言所需的多语言对齐能力 (Yuan et al., 2022 (https://arxiv.org/html/2606.24200#bib.bib25); Liu et al., 2021 (https://arxiv.org/html/2606.24200#bib.bib10)),然而该领域缺乏系统衡量这一缺陷的方法。这种多语言医学检索问题可以分解为三种不同的能力:跨语言对齐,以便不同语言中的相同概念映射到相似的表示;概念区分,以便正确分离临床上容易混淆的实体,如1型和2型糖尿病;以及证据检索,以便任何语言的查询都能找到相关的英语段落。这三种能力各自都得到了充分研究 (Liu et al., 2021 (https://arxiv.org/html/2606.24200#bib.bib10); Remy et al., 2023 (https://arxiv.org/html/2606.24200#bib.bib16); Zhang et al., 2023 (https://arxiv.org/html/2606.24200#bib.bib27)),但现有基准没有对它们进行联合评估 (Thakur et al., 2021 (https://arxiv.org/html/2606.24200#bib.bib19); Muennighoff et al., 2023 (https://arxiv.org/html/2606.24200#bib.bib12)),使得该领域无法衡量一个维度上的进步是否以牺牲另一个维度为代价。 以往的工作只部分地处理了每个维度:诸如 SapBERT (Liu et al., 2021 (https://arxiv.org/html/2606.24200#bib.bib10)) 和 BioLORD-2023 (Remy et al., 2023 (https://arxiv.org/html/2606.24200#bib.bib16)) 等生物医学编码器仅在英语中评估,而诸如 MIRACL (Zhang et al., 2023 (https://arxiv.org/html/2606.24200#bib.bib27)) 等多语言基准则缺乏医学概念基础。最近在跨语言医学检索方面的工作 (Athar Sheikh et al., 2025 (https://arxiv.org/html/2606.24200#bib.bib3); Acharya et al., 2025 (https://arxiv.org/html/2606.24200#bib.bib1)) 覆盖有限的语言对,或针对多模态而非纯文本检索。多语言覆盖和生物医学专门化之间的交叉领域仍然未知 (图1 (https://arxiv.org/html/2606.24200#S1.F1); 第2节 (https://arxiv.org/html/2606.24200#S2))。 为了解决这些差距,我们引入了 MMed\-Bench\-IR,这是一个结构化的评估套件,涵盖6种语言(英语、西班牙语、法语、日语、汉语、俄语)和3种书写系统(拉丁字母、西里尔字母、中日韩文字)。受信息检索基准套件 BEIR (Thakur et al., 2021 (https://arxiv.org/html/2606.24200#bib.bib19)) 的启发,该套件展示了跨不同任务和领域的异构评估能够揭示单一基准无法发现的见解,我们将 MMed\-Bench\-IR 的理念基于将此原则应用于多语言医学信息检索。 它包含三个结构异构的任务:基于统一医学语言系统 (UMLS) Metathesaurus 本体 (Bodenreider 2004 (https://arxiv.org/html/2606.24200#bib.bib4)) 的跨语言医学问答检索,包含6,127个查询;概念区分任务,包含按三个难度级别组织的4,975个混淆集;以及面向检索增强生成 (RAG) 的多语言证据检索,包含2,040个质量保证的查询,针对包含80,049个段落的英语语料库。通过设计,这三个任务共享零注释概念重叠、零查询重叠以及最小的语料库词汇重叠,确保总分反映的是真实的能力广度,而非对单一技能的掌握。 我们的贡献如下: - •据我们所知,MMed-Bench-IR 是第一个联合评估多语言对齐和生物医学专门化的基准,涵盖6种语言、3种书写系统以及三个任务,且具有零概念和零查询重叠。 - •我们评估了跨六个范式家族的十个系统,并在所有任务中揭示了一致的范式级层次结构,其中概念区分成为最难的词汇瓶颈,BM25与最佳密集模型之间的差距为+0.38。 - •我们暴露了在仅英语评估中不可见的严重跨语言失败模式:在英语中得分为0.818 nDCG@10的生物医学编码器在日语中崩溃至0.056,公平性差距为0.76。 参考图注图2:MMed-Bench-IR 概览。三个任务针对6种语言的独特检索能力,具有零查询和CUI重叠。分数聚合为 MMed-IR 和每个任务的公平性差距。 ## 2 相关工作与范围 #### 多语言与生物医学检索模型。 最近的工作在多语言检索和生物医学检索方面分别取得了显著进展,但这两个维度在很大程度上仍然是脱节的。MMedC (Qiu et al., 2024 (https://arxiv.org/html/2606.24200#bib.bib15)) 和 Apollo (Wang et al., 2024b (https://arxiv.org/html/2606.24200#bib.bib22)) 整理了用于LLM训练的多语言医学语料库,但未提供检索评估。在检索器方面,BGE-M3 (Chen et al., 2024 (https://arxiv.org/html/2606.24200#bib.bib5)) 和 Multilingual-E5 (Wang et al., 2024a (https://arxiv.org/html/2606.24200#bib.bib23)) 支持超过100种语言,但缺乏医学概念基础,而 BioLORD-2023 (Remy et al., 2023 (https://arxiv.org/html/2606.24200#bib.bib16)) 和 MedCPT (Jin et al., 2023 (https://arxiv.org/html/2606.24200#bib.bib8)) 推动了生物医学实体表示的发展,但仅在英语中评估。基于UMLS (Bodenreider, 2004 (https://arxiv.org/html/2606.24200#bib.bib4)) 的实体链接工作,如 SapBERT (Liu et al., 2021 (https://arxiv.org/html/2606.24200#bib.bib10)) 和 CODER (Yuan et al., 2022 (https://arxiv.org/html/2606.24200#bib.bib25)),测试了概念对齐,但未测试段落检索。目前没有模型同时解决这两个维度。 #### 检索基准。 一些基准沿着单个维度推进了检索评估,但没有一个同时针对多语言和生物医学能力。BEIR (Thakur et al., 2021 (https://arxiv.org/html/2606.24200#bib.bib19)) 证实了域内性能不能预测域外泛化能力,从而推动了异构评估。MTEB (Muennighoff et al., 2023 (https://arxiv.org/html/2606.24200#bib.bib12)) 证明了没有单一的嵌入方法能够在不同任务中占主导地位,加强了多任务评估的需求。然而,两者都不针对生物医学领域。在多语言方面,MIRACL (Zhang et al., 2023 (https://arxiv.org/html/2606.24200#bib.bib27)) 和 Mr. TyDi (Zhang et al., 2021 (https://arxiv.org/html/2606.24200#bib.bib26)) 覆盖了多种语言,但未纳入医学术语或本体结构。尽管取得了这些进展,但现有基准无法评估多语言覆盖与生物医学专门化之间的交互作用。 #### 跨语言医学检索。 一小部分但日益增长的工作已经开始直接解决医学领域的跨语言检索问题。MUCHMORE 项目 (Volk et al., 2002 (https://arxiv.org/html/2606.24200#bib.bib21)) 探索了基于UMLS的跨语言信息检索(CLIR),涉及英语和德语医学摘要,将医学CLIR确立为一个研究方向。最近,CURE (Athar Sheikh et al., 2025 (https://arxiv.org/html/2606.24200#bib.bib3)) 评估了即时护理段落排序,涵盖英语、法语到英语以及西班牙语到英语的情况,但仅覆盖三种语言和单个检索任务。M3Retrieve (Acharya et al., 2025 (https://arxiv.org/html/2606.24200#bib.bib1)) 针对多模态医学检索而非多语言纯文本信息检索。MMed-Bench-IR 的区别在于,它在一个基准中联合评估概念对齐、概念区分和证据检索,涵盖6种语言和3种书写系统。 ## 3 基准设计原则 我们设计 MMed-Bench-IR 的原则是,基准的价值来自原则性的异构性而非数据集数量,并根据四个选择标准进行组织。 #### 能力异构性。 三个任务分离了不同的检索能力:跨语言概念对齐(任务1)、细粒度语义区分(任务2)和跨语言段落检索(任务3)。这种分离确保模型的聚合分数不能由单一能力的优势驱动。 #### 语言异构性。 六种语言跨越三个语系(印欧语系 [en, es, fr, ru]、汉藏语系 [zh]、日本语系 [ja])、三种书写系统(拉丁字母、西里尔字母、中日韩文字)以及不同水平的医学NLP资源可用性。这确保基准分数反映的是真正的多语言鲁棒性,而非在密切相关语言上的表现。 #### 难度异构性。 任务1涵盖5种语言的500个医学概念,其UMLS覆盖范围不同,从而在各语言之间产生自然的难度梯度。任务2包含三个难度层级(同义词、兄弟词、相关但不同),通过多编码器共识验证。任务3使用质量保证的翻译,保留率为83.7%。由此产生的分数分布跨系统覆盖了5倍的范围,且没有任务达到饱和。 #### 验证异构性。 每个任务使用不同的验证策略,针对不同的错误源:UMLS本体基础(任务1)、多编码器多数投票(任务2)以及双语概念保真度和回译问答(任务3)。这确保没有单一的验证盲点会在任务间传播。 表1:MMed-Bench-IR 基准统计信息。三个任务在检索设置、语料库规模、查询粒度和相关性定义方面结构不同,确保聚合分数反映能力广度。 ## 4 基准构建与特征描述 ### 4.1 基准统计信息 表1 (https://arxiv.org/html/2606.24200#S3.T1) 和图2 (https://arxiv.org/html/2606.24200#S1.F2) 总结了基准。这三个任务在结构上是互补的:任务1和任务2的概念空间之间共享零CUI重叠,并且成对语料库词汇重叠度低(任务1/2之间的Jaccard < 0.14,与任务3的重叠 < 0.02)。查询粒度范围从短概念术语(4至5个词)到生物医学问题(6.7个词),语料库规模跨越两个数量级(2,552到80,049个文档)。 ### 4.2 任务构建 #### 任务1:跨语言医学问答检索。 从 MMedBench (Qiu et al., 2024 (https://arxiv.org/html/2606.24200#bib.bib15)) 测试集的多语言医学问答数据中,我们提取问题主干(不含答案选项)作为查询,涵盖5种语言(法语被排除,因为在此粒度下少于50个查询通过了CUI标记管道)。每个查询通过一个级联标记器被标记为一个 UMLS CUI,该标记器首先尝试与UMLS首选术语和同义词进行精确词汇匹配,如果失败,则回退到生物医学链接器处理未匹配的查询。共享相同CUI的跨语言查询形成跨语言正例组。语料库由概念定义文本(1,290个正例 + 1,262个来自非匹配CUI的硬负例概念)组成,从而产生6,127个查询和跨500个概念的2,552个语料库文档。 #### 任务2:概念区分。 从 UMLS 2025AB Metathesaurus 概念文件 (MRCONSO.RRF) (Bodenreider, 2004 (https://arxiv.org/html/2606.24200#bib.bib4)) 中,我们解析了按源词汇分组的150万个概念原子,并在三个层级构建混淆集:层级1(同义词)包含具有不同表面形式或语言的相同CUI。层级2(兄弟词)配对共享相同源词汇和3字符代码前缀的不同CUI,这意味着它们在临床上相关但不同(例如,同一类别下的ICD-10代码)。层级3(相关)配对来自相同源词汇但不同代码前缀组的不同CUI,这意味着它们属于相同医学领域但明显不同。查询来自英语和中文表面形式,正例是任何语言中相同CUI的不同表面形式,查询自身的形式被排除在语料库之外。所有跨多种语言的6,340个语料库术语形成一个共享检索池。由于每个混淆集为其包含的每个唯一CUI生成一个查询,4,975个验证集产生4,143个评估查询。 #### 任务3:用于RAG的多语言证据检索。 来自 BioASQ 13 的340个英语生物医学问题
相似文章
MedicalBench:评估大型语言模型以改进医学概念提取
MedicalBench是一个新的基准测试,用于评估大型语言模型从电子健康记录中提取医学概念的能力,重点关注隐含推理和证据支撑。它包含823个专家标注的示例,并显示当前模型表现一般,突显了提取隐含表述的医学概念的难度。
IMCBench:面向图像基础医疗对话的多模态大语言模型基准
IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。
MEDSYN: 复杂临床病例中多证据综合的多模态大语言模型基准测试
MEDSYN 是一个多语言多模态基准,用于评估多模态大语言模型(MLLMs)在复杂临床病例上的表现,每个病例最多包含 7 种不同的视觉证据类型。研究表明,虽然前沿模型在鉴别诊断生成方面与人类专家相当,但所有 MLLMs 在最终诊断选择中均存在显著差距,原因是异质临床证据综合能力不足。
LongMedBench:面向长时程临床决策的医疗智能体基准测试
LongMedBench 是一个新的基准测试,用于评估基于LLM的医疗智能体在长时程临床决策中的表现。它使用来自 MIMIC-IV 的真实电子健康记录数据,包含335名具有多次就诊记录的患者,并提出了针对事实问答、时序推理和长时程决策的评估套件。
MedRealMM:一个用于中国在线医疗咨询的现实世界多模态基准
MedRealMM是一个基于真实医患交互构建的新的多模态基准,用于评估大语言模型在在线医疗咨询中的下一响应生成能力,并配有临床评价标准。