mamabench和mamaretrieval:评估母婴、新生儿及生殖健康领域医学检索增强生成的基准测试
摘要
本文介绍了MamaBench和MamaRetrieval两个基准测试,用于评估母婴、新生儿及生殖健康领域的医学检索增强生成,填补了现有问答和检索数据集的空白。
arXiv:2606.29467v1 公告类型:新
摘要:医学问答基准测试很少涉及助产士提出的母婴、新生儿、儿童及生殖健康问题,并且据我们所知,目前还没有公开的针对母婴健康指南检索的块级相关性基准测试。我们发布了两个基准测试来填补这些空白。mamabench是一个经过范围筛选的问答集,包含25,949个项目,来自七个现有专家撰写的来源,涵盖选择题、简答题和评分标准评分轨道;为了帮助用户校准用于评分标准轨道的LLM评判器,我们将HealthBench的医生标注的元评估重新调整到该领域。mamaretrieval将3,185个临床查询与一个包含63,650个块的母婴健康指南语料库上的分级(0-6)相关性标签配对,使用一个分解的评分标准,区分能够回答查询的块与仅仅相关主题的块。两个基准测试都基于三个决策:收集和筛选专家来源而不是自行编写问题,对相关性进行分级而不是二值化,以及测量并公开标签的局限性——范围分类器一致性、前沿评判器检查以及池化完整性审计——而不是将其视为绝对真理。一篇配套论文使用这些基准测试评估了一个部署在设备上的助手;两者均已开源供研究使用。
查看缓存全文
缓存时间: 2026/06/30 05:31
# 评估母婴与生殖健康领域医学检索增强生成的基准 来源:https://arxiv.org/html/2606.29467 ###### 摘要。医疗问答基准很少涵盖助产士在孕产妇、新生儿、儿童及生殖健康方面提出的问题,并且据我们所知,目前尚不存在用于孕产妇健康指南检索的公开分块级相关性基准。我们发布了两个填补这些空白的基准。mamabench 是一个范围过滤的问答集,包含从七个现有专家编写来源中汇集的 25,949 个条目,涵盖选择题、简答题和评分标准型题目;为帮助用户校准对评分标准类题目进行评分的 LLM 评判器,我们将 HealthBench 的医生标注元评估重新限定到该领域。mamaretrieval 将 3,185 个临床查询与 63,650 个分块的孕产妇健康指南语料库上的分级(0–66)相关性标签配对,使用一个分解的评分标准来区分回答查询的分块与仅仅涉及该主题的分块。三个决策塑造了这两个基准:汇集并筛选专家来源而非自行编写问题,对相关性进行分级而非二值化,以及衡量并披露标签的局限性——范围分类器一致性、前沿模型检查以及池化完整性审计——而非将其视为绝对标准。一篇配套论文使用这些基准评估了一个已部署的设备端助手;两者均公开用于研究。基准、检索、医疗问答、孕产妇健康、妇产科、LLM 作为评判器、TREC 池化 ## 1. 引言 医疗问答基准已经大量涌现,但孕产妇、新生儿、儿童及生殖健康——特别是撒哈拉以南非洲、助产士主导的初级保健环境——只占其中很小一部分。广泛使用的基准集利用了美国和印度的执业资格考试(MedQA (Jin et al., 2021), MedMCQA (Pal et al., 2022))或广泛的临床对话(HealthBench (Arora et al., 2025));AfriMed-QA (Nimo et al., 2025) 是泛非洲的,但涵盖多个专科。没有一个被限定在助产士在护理点实际提出的孕产妇、新生儿、儿童及生殖健康问题范围内。 检索方面的情况更糟。诸如 MIRAGE (Xiong et al., 2024) 之类的医学检索增强生成基准评估的是从语料库中提取的*端到端*答案,而非单个检索到的段落是否相关;经典的医学信息检索相关性集合(TREC 临床决策支持和精准医学赛道)是对照病例描述来评判完整的 PubMed 文章,而非已部署的 RAG 系统检索并注入提示中的简短指南分块。据我们所知,目前尚不存在用于孕产妇健康指南检索的公开分块级相关性基准。 我们发布了两个基准¹¹¹数据集:https://huggingface.co/datasets/nmrenyi/mamabench, https://huggingface.co/datasets/nmrenyi/mamaretrieval。构建代码:https://github.com/nmrenyi/mamabench, https://github.com/nmrenyi/mamaretrieval。仅供研究使用;部分来源为非商业用途(例如 AfriMed-QA, CC BY-NC-SA 4.0),每个条目的许可证记录在其按来源划分的清单中。来填补该领域的这些空白。两者均是为配套系统论文 (Ren Yi, 2026) 提供测试数据而构建的——该论文描述了一个已部署的、完全在设备端运行、为桑给巴尔助产士服务的 RAG 助手——但每个基准也可作为独立工具使用。 - • mamabench(§2)是一个范围过滤的问答基准:包含 25,949 个条目,来自七个专家编写来源,涵盖选择题、简答题和评分标准型题目,外加一个包含 6,853 个三元组的评判器校准辅助文件——这不是我们自己的标签,而是 HealthBench 的医生注释重新限定到本领域——用于在信任 LLM 评判器对开放式条目进行评分之前对其进行审查。其范围分类器通过与更大模型的一致性以及与先前标签的一致性进行交叉检查。 - • mamaretrieval(§3)将 3,185 个临床查询与 63,650 个分块的孕产妇健康指南语料库上的分级(0–66)相关性标签配对——一个分块级相关性基准,其粒度与实际 RAG 系统检索的分块一致,围绕基于信息检索相关性理论的分级临床相关性评分标准构建,其评判器通过与前沿参考模型检查来验证。 塑造这两个基准的三个决策构成了本文的主线: 1. (1) 从专家编写的来源进行汇集和筛选,而非自行编写新问题。临床策划工作已经存在于执业资格考试、医师专家组和已发布的指南中,因此基准的任务是可靠的范围界定和统一的打包,而非从头开始的临床编写。 2. (2) 将临床相关性分解为分级、多维度的评分标准,而非二值的相关/不相关标签。对于助产士而言,一个提到药物名称的分块和一个提供剂量、给药途径和阈值的分块,其有用性截然不同;一个无法区分这两者的基准也无法将强检索与足够好的检索分开。 3. (3) 衡量并披露标签的局限性——范围分类器一致性、前沿模型检查以及池化完整性审计——而非将基准呈现为绝对标准。 配套系统论文使用这些基准来评估已部署的系统并报告其结果;本文记录了基准的*构建和验证*方式,系统论文将据此引用其来源。我们不在此处复现已部署系统的评估结果。mamabench 由外部问答来源汇集而成,独立于语料库;而 mamaretrieval 则与特定的语料库分块集耦合(§3.1)。第4节坦诚地说明了每个基准能证明和不能证明的内容;数据集和构建代码链接在标题脚注中。 ## 2. mamabench:一个范围过滤的问答基准 mamabench 评估模型在回答助产士提出的问题方面的表现——这些问题涵盖孕产妇、新生儿、儿童及生殖健康——格式从选择题到自由文本的临床场景。我们通过从七个现有、专家编写的来源中汇集此类问题,并将每个问题筛选到该范围内来构建它。这带来了三个构建问题:将来源汇集成一个可评分的模式并进行规范化,可靠地定义和应用范围,以及为消费者提供一种方法来信任对开放式条目进行评分的 LLM 评判器。我们逐一处理这些问题。 ### 2.1. 来源汇集 第一个决策是汇集而非编写:从头开始编写和验证孕产妇健康问题需要临床医生,而这七个来源已经带有专家策划——医疗执照委员会、泛非洲医师专家组、肯尼亚临床医生以及 OpenAI 的医生注释者——因此基准的贡献在于范围界定和统一打包,而非从头开始的临床编写。每个来源通过专用的适配器规范化为一个标准模式,并归入三个赛道之一(表1): - • 选择题(23,241 个条目),用于临床知识的广度:MedMCQA (Pal et al., 2022) 的妇产科和儿科子集,MedQA-USMLE (Jin et al., 2021) 范围内部分,以及 AfriMed-QA (Nimo et al., 2025) 的选择题。该赛道服务于广度;下面的开放式赛道承担主要任务。 - • 简答题(369 个条目),最接近部署场景:312 个由护士编写的初级保健病例 (Mwaniki et al., 2025),AfriMed-QA (Nimo et al., 2025) 的简答题,以及一小部分旨在暴露模型错误的专家精心设计条目 (The Lumos AI Labs, 2025)。 - • 评分标准型(2,339 个条目):HealthBench (Arora et al., 2025) 范围内部分,其条目根据医生编写的评分标准标准而非单一的标准答案进行评分。 **表 1.** mamabench 的七个来源,按赛道划分。*产出率*是来源上游池中被我们的范围分类器(§2.2)保留为范围内部分的份额;破折号标记那些到达时已经限定到该领域的来源——MedMCQA 和 AfriMed-QA 根据其学科或专业标签,Women's Health Benchmark 通过专家编写——因此完全跳过分类器。 | 赛道 | 来源 | 条目数 | 产出率 | | :--- | :--- | :--- | :--- | | 选择题 | MedMCQA (妇产科及儿科) | 18,508 | – | | | MedQA-USMLE | 4,199 | 29.2% | | | AfriMed-QA | 534 | – | | 简答题 | 肯尼亚临床病例集 | 312 | 61.5% | | | AfriMed-QA (简答题) | 37 | – | | | 女性健康基准 | 20 | – | | 评分标准型 | HealthBench (oss_eval) | 1,209 | 24.2% | | | HealthBench (consensus) | 872 | 23.8% | | | HealthBench (hard) | 258 | 25.9% | | **总计** | | **25,949** | | 规范化大多是机械性的,但有一个来源需要更多处理:AfriMed-QA 选择题条目带有其他来源所没有的质量问题,我们在*可评分性*上划定界限。选择题条目通过答案字母进行评分,我们只丢弃那些评分无法表示的内容:有多个正确答案的条目(单个答案索引无法编码它们),以及正确答案文本在不同选项下重复的条目——如果同一选项文本出现在两个位置,模型可能选择正确的文本,但因报告了重复的字母而被判定错误。不影响评分的表面问题(嵌入的选项字母前缀、非 ASCII 排版、简短题干)保持不变,并记录在清单中。原则是基准可以拒绝它无法评分的条目,但绝不能改变条目的含义。 ### 2.2. 使用 LLM 分类器定义范围 核心构建决策是如何判断一个条目是否在范围内。我们将范围定义为四个正面类别——孕产妇健康、新生儿健康、儿童健康以及性与生殖健康(SRH)——加上“无”,并且我们根据每个条目的*主要临床概念(而非患者的人口学特征)*进行分类。一个关于处理恰好怀孕患者的手腕骨折的问题属于“无”——骨折是概念,怀孕是偶然的——而产后抑郁属于“孕产妇健康”,因为产后的背景*就是*概念。分类器是 Qwen3.6-27B-FP8²²²模型卡:https://huggingface.co/Qwen/Qwen3.6-27B-FP8。,在温度设为 0 且启用推理的情况下运行;它对每个候选条目应用此规则,并发出结构化的判断,同时保留其推理以供审计。 信任 LLM 来划定范围边界需要证据,我们提供两项检查。首先,**跨模型一致性**:使用更大的 Qwen3.5-397B-A17B-FP8³³³模型卡:https://huggingface.co/Qwen/Qwen3.5-397B-A17B-FP8。——来自同一系列但更强的模型,因此这更检查自我一致性而非独立性——对 HealthBench“oss_eval”条目重新分类,在 4,988 个共同分类的条目上,27B 模型与其在 98.1% 的条目上一致,每个类别的计数差异低于 1%;27B 模型未能收敛的少数条目在 397B 模型下均为“无”,因此无论如何都会被过滤掉,对范围内计数的净影响为零。其次,**与先前标签的一致性**:肯尼亚病例集附带了它们自己的分类器标签,我们的标签与其在 86.8% 的条目上一致,分歧主要源于我们的规则故意更严格——拒绝那些仅因患者为女性(而非临床概念)暗示妇产科范围的条目。表1中按来源列出的产出率本身就是一个有用的信号。肯尼亚初级保健病例集中有 61.5% 在范围内,而通用基准则为 24–29%:孕产妇健康来源恰好集中在部署所在的领域,而通用集则贡献了较小、经过范围过滤的部分。 ### 2.3. 从 HealthBench 重新限定范围的评判器校准集 评分标准型赛道由 LLM 评判器评分,这自然引发了一个问题:评判器是否可靠?与其为我们自己的评判器一次性回答这个问题,我们提供了为*任何*评判器回答该问题的手段:一个包含 6,853 个(提示、响应、标准)三元组的校准辅助文件,并附有医生标注的“符合/不符合”标签。我们需要精确说明来源,因为很容易过度声明。*我们并未生成这些标签。*它们是 HealthBench 为审查评分标准评判器而发布的医生注释——其元评估集 (Arora et al., 2025);我们唯一的角色是将该集重新限定到本领域——保留那些提示被范围分类器(§2.2)归入四个正面类别(儿童健康 3,239,孕产妇健康 2,284,性与生殖健康 942,新生儿健康 388,共 872 个提示)的三元组——并将其打包为一个即用型校准文件,与基准一同提供。消费者在这些三元组上运行候选评判器,将其标签与医生的标签进行比较,然后在评分基准之前决定是否信任它;配套系统论文正是通过这种方式选择其评分标准评判器的 (Ren Yi, 2026)。一个注意事项:这 872 个提示*就是* HealthBench-consensus 评分标准赛道的提示——HealthBench 正是在同一集上收集了辅助文件中医生标签——因此在此处校准评判器,然后对共识赛道进行评分会重复使用相同的提示;在辅助文件上校准,但阅读共识赛道分数时要考虑到这种重叠。 ## 3. mamaretrieval:一个分块级相关性基准 mamaretrieval 评估检索器在临床查询中找到回答问题的指南段落方面的表现,粒度是 RAG 系统实际检索的分块大小。构建它意味着选择要检索的内容(语料库)、要问什么查询、如何标记(查询,分块)对的相关性,以及如何使这些标签在大规模上保持可信。我们从语料库开始,然后依次讨论查询构建、相关性评分标准、池化和评判器可靠性。 ### 3.1. 指南语料库 mamaretrieval 构建在与部署系统检索的相同孕产妇健康指南语料库之上,配套系统论文 (Ren Yi, 2026) 对其进行了全面描述——包括其来源、构建和打包。我们在此只给出基准所依赖的内容:语料库的规模、其来源质量等级,以及使基准与其语料库成为一件工件的版本耦合。 #### 规模与来源。 语料库包(v0.2.0)包含 63,650 个识感知分块,来自 87 份文档,涵盖国际临床指南(WHO、NICE、MSF、Hesperian 助产参考文献以及 FIGO/EmONC 材料)、国家和地方协议(坦桑尼亚和桑给巴尔卫生部指南)以及标准产科和助产参考教材。每个分块都带有标准头部,记录其来源、页码和稳定的分块标识符。 #### 来源质量等级。 来源按临床深度及与桑给巴尔妇产科和助产范围的关联性被评定为质量等级(从*非常高*到*低-中*)。查询构建(下文)使用这些等级作为采样权重,从临床最丰富的来源中按比例抽取更多内容。 #### 版本耦合。 分块标识符是内容
相似文章
当病例罕见时:面向非指南临床问答的检索基准
介绍 OGCaReBench,这是一个自由形式的检索基准,用于评估 LLM 在需要超越标准指南推理的临床问题上的表现。实验表明,即使是最好的模型也仅能达到 56% 的准确率,但检索增强将性能提升至 82%。
MMed-Bench-IR:一个用于多语言医学信息检索的异构基准
MMed-Bench-IR是一个跨六种语言的多语言医学信息检索异构基准,评估跨语言对齐、概念区分和证据检索。它揭示了非英语查询的严重性能下降,凸显了现有仅英语评估的不足。
EHRBench:用于大语言模型临床决策的自动化可靠电子健康记录基准
EHRBench是一个自动化且可靠的基准测试,利用真实电子健康记录评估大语言模型在临床决策任务上的表现,涵盖诊断、治疗和预后任务,包含近100万个问答条目。
当检索无济于事:一项大规模生物医学 RAG 研究
这项大规模研究涵盖 5 个模型(7B–72B)、10 个生物医学问答数据集、4 种检索方法和 4 个语料库,发现在生物医学问答任务中,RAG 相比无检索基线仅带来微小且不稳定的提升(1–2 个百分点)。研究得出结论:主要瓶颈并非检索质量,而是模型有效利用检索证据的能力有限。
ClinicalBench:对 MIMIC-IV 跨入院临床问答中基于断言感知的检索进行压力测试
本文介绍了 ClinicalBench 和 EpiKG 系统,评估了针对 MIMIC-IV 数据在多个人工智能大语言模型(LLM)上的临床问答中基于断言感知的检索能力。研究证明,在检索过程中处理否定和时态信息,相比标准基线能显著提升性能。