MIRA-Ev:临床考试中细粒度证据检测与关系推理的基准

arXiv cs.CL 论文

摘要

介绍MIRA-Ev,这是一个基于西班牙MIR执业资格考试案例构建的临床论据挖掘基准,由专家标注了跨度级别的论据、主张以及支持/反对关系,并提供西班牙语、英语和巴斯克语版本。该基准通过三级任务层次结构评估证据句子检索、论据成分提取和关系分类,弥补了临床自然语言处理中多选题问答基准的局限性。

arXiv:2607.19201v1 公告类型:新发布 摘要:临床自然语言处理评估仍由多选题问答(MCQA)主导,该方法仅评判最终答案的正确性,无法检测模型在得出正确诊断时是否依据不相关、缺失或矛盾的证据。我们提出MIRA-Ev,这是一个基于西班牙Médico Interno Residente(MIR)执业资格考试案例构建的临床论据挖掘基准,由临床专家重新标注了跨度级别的论据、主张以及有向的支持/反对关系,并同步发布西班牙语(原生)、英语和巴斯克语版本,其中巴斯克语版本是首个临床论证资源。MIRA-Ev将评估组织为三级任务层次结构:证据句子检索、论据成分提取和关系分类。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:25

# 临床考试中细粒度证据检测与关系推理的基准

来源:https://arxiv.org/html/2607.19201  
Irune Urroz García、Aitziber Atutxa、Ander Barrena  
HiTZ中心,巴斯克大学(EHU)  
\{iker\.delaiglesia, aitziber\.atucha, ander\.barrena\}@ehu\.eus  

Johanna Ramirez\-Romero、Jose Maria Villa\-Gonzalez  
克鲁塞斯大学医院  
\{johanna\.ramirezromero, josemaria\.villagonzalez\}@osakidetza\.eus  

###### 摘要

临床NLP评估仍以多项选择题回答(MCQA)为主,仅评判最终答案的正确性,无法检测模型在得出正确诊断时是否依据无关、缺失或矛盾的证据。我们提出MIRA-Ev,一个基于西班牙语Médico Interno Residente(MIR)执业资格考试病例的临床论据挖掘基准,由临床专家重新标注了跨度级别的论据、主张及有向支持/反对关系,并同步发布西班牙语(原始语言)、英语和巴斯克语版本——这是首个巴斯克语临床论证资源。MIRA-Ev将评估组织为三级任务层次:证据句子检索、论证成分抽取和关系分类。

rmTeXGyreTermesX

MIRA–Ev:用于细粒度证据检测与关系推理的临床考试基准

Iker De la Iglesia、Irune Urroz García、Aitziber Atutxa、Ander Barrena  
HiTZ中心,巴斯克大学(EHU)  
\{iker\.delaiglesia, aitziber\.atucha, ander\.barrena\}@ehu\.eus  

Johanna Ramirez\-Romero、Jose Maria Villa\-Gonzalez  
克鲁塞斯大学医院  
\{johanna\.ramirezromero, josemaria\.villagonzalez\}@osakidetza\.eus  

## 1 引言

在现代医疗中,人工智能快速融入诊断支持加剧了一个长期存在的矛盾:随着预测性能的提升,产生这些预测的系统的内部透明度并未同步跟进。在高风险的临床环境中,这种“黑箱”特性并非次要关切;可解释性是临床信任、责任归属和安全部署的先决条件。临床NLP越来越关注循证医学(EBM)(Goenaga et al., 2024 (https://arxiv.org/html/2607.19201#bib.bib2); Yeginbergen and Agerri, 2024 (https://arxiv.org/html/2607.19201#bib.bib22)),即“审慎、明确且明智地运用当前最佳证据”(Sackett et al., 1996 (https://arxiv.org/html/2607.19201#bib.bib1)),将其作为模型推理应遵循的规范标准,并关注临床论据挖掘(AM)作为验证模型推理是否符合该标准的正式机制。通过提取和结构化临床决策背后的论据和主张,AM允许评估模型不仅基于其得出的结论,更基于其推理过程。

得出正确结论与正确推理之间的区别在当前临床语言模型的评估方式中几乎不可见。主流范式仍是多项选择题回答(MCQA):MedQA和MedMCQA等基准仅根据最终答案的正确性对模型打分。近期研究表明,该范式正接近饱和,且对临床能力的反映非常有限:领域适应的临床LLM在这些基准上往往无法超越通用模型,而比较性评估越来越多地质疑MCQA表现是否反映了真实的诊断或预测能力。一个模型可以选择正确答案,但其选择可能基于无关、缺失或甚至矛盾的证据,而当前基准完全无法检测这种失败模式,因为它们从不检验推理轨迹,只关注输出。

论据挖掘提供了一种成熟的范式来弥补这一差距,但其在临床文本中的应用相对于说服性论文等通用领域仍然稀少,而在非英语临床文本中的应用更是少之又少。这种稀缺并非偶然。临床NLP资源开发面临一个众所周知的“双重瓶颈”:数据稀缺加上隐私约束,以及被饱和且以英语为中心的MCQA主导的评估危机。对于在临床NLP资源版图中同时属于全球和地方性少数的语言而言,这种瓶颈尤为严峻。西班牙语虽为世界大语言,但在专门的生物医学资源中仍相对属于少数;而巴斯克语无论在何种标准下都属于极度低资源语言。

为弥补这一空白,我们提出MIRA-Ev,一个基于西班牙语Médico Interno Residente(MIR)医疗执业资格考试的临床推理基准,该基准重新标注了细粒度、跨度级别的论证结构,并以并行西班牙语(原始语言)、英语和巴斯克语版本发布。每个MIR病例将鉴别诊断建模为论证结构:临床场景(患者病史、症状、检查结果和实验室检验结果)提供了分散的医学证据(前提),这些证据支持或反对一组相互竞争的诊断假设(主张),通常由候选答案选项实例化。关键是,这种映射并非固定不变:在部分病例中,答案选项本身充当前提,而其所涉及的主张则被嵌入在病例或问题题干中,与其他证据并列。我们刻意保留而非规范化这种反转,因为它允许测试系统是否从内容和语境推断论证角色,而非依赖“选项即主张”的位置启发式,我们预计许多模型(尤其是未微调的LLM)会隐含地(且错误地)依赖这种启发式。

构建和评估这一资源揭示了三个计算瓶颈,我们将它们定义为临床论据挖掘作为一个独立任务系列的特征,区别于其说服性文本的起源:

1. **细粒度的子句级跨度抽取**。MIRA-Ev中约20%的证据跨度是子句级片段,由标点或对比连词界定,而非句子边界,标准句子级分割器无法恢复,从而在严格边界匹配评估下造成硬性性能上限。
2. **级联流水线错误**。任务被结构化为层次化流水线:句子相关性、跨度抽取和有向关系分类,其中关系检测取决于上游边界的正确性。
3. **论证角色歧义**。由于主张/前提映射不固定于句法位置(病例 vs. 选项),模型不能依赖位置捷径,而必须从内容推断论证功能,我们可以通过反转映射子集直接探测这种能力。

我们使用领域特定的西班牙语/巴斯克语双语编码器EriBERTa(la Iglesia et al., 2025b (https://arxiv.org/html/2607.19201#bib.bib20))以及一系列医学预训练和通用生成式LLM来评估该基准,建立了任务所有三个层级以及跨语言的实证边界。

贡献:

- \(i\) MIRA-Ev,一个基于MIR考试病例、由临床专家在词级跨度粒度上重新标注的临床论据挖掘资源,以并行西班牙语/英语/巴斯克语版本发布;
- \(ii\) 将MCQA来源的考试数据重新框架化为结构化证据与关系任务,将答案正确性与推理有效性解耦;
- \(iii\) 三级评估层次(句子检索、成分抽取、关系分类)及相应的严格/宽松度量;
- \(iv\) 对编码器流水线和LLM在不同层级、语言以及标准/反转论证映射上的实证基准测试;
- \(v\) 对低资源临床NLP的贡献,其中巴斯克语被明确地作为重点而非事后翻译的补充。

## 2 相关工作

### 2.1 说服性领域与医学领域的论据挖掘

论据挖掘最初是为结构良好、用户生成的文本(如说服性论文)开发的,此类文本中显式的话语标记使得主张/前提识别相对容易处理;经典系统通过序列标注(BiLSTM/CRF架构)对成分识别和有向关系进行建模(Yeginbergen et al., 2024 (https://arxiv.org/html/2607.19201#bib.bib13); García-Ferrero et al., 2022 (https://arxiv.org/html/2607.19201#bib.bib5))。将其扩展到生物医学文本代表了话语复杂性的显著增加。早期的医学论据挖掘工作针对随机对照试验摘要(如AbstRCT语料库(Mayer et al., 2021 (https://arxiv.org/html/2607.19201#bib.bib6)),源自MEDLINE(World Health Organization, 2021 (https://arxiv.org/html/2607.19201#bib.bib17))),将领域预训练Transformer与LSTM/GRU/CRF层相结合(Campillos-Llanos et al., 2021 (https://arxiv.org/html/2607.19201#bib.bib18); Zakhir-Puig et al., 2026 (https://arxiv.org/html/2607.19201#bib.bib19)),并确立了两项发现,MIRA-Ev将其继承为设计约束:领域特定的预训练对于捕捉临床术语是必要的,而跨度边界检测(而非关系分类)是主要瓶颈,因为未对齐的跨度会向下游传播错误。

### 2.2 生物医学文献中的证据抽取:PICO与EBM句子分类

另一条密切相关但不同的研究方向是从生物医学文献(而非临床病例叙事)中抽取证据结构。PICO抽取从RCT摘要中识别人群、干预、对照和结局元素,而EBM句子分类则对结构化摘要中的句子分配类别性话语角色(如背景、方法、结果)。两者均操作于单一自包含文档,产生类别性或抽取式标签,而不建模成分之间的有向论证关系。MIRA-Ev在三个维度上有所不同:\(i\) 它操作于临床病例场景与竞争性诊断假设配对,而非文献摘要;\(ii\) 它要求有向、带极性标签的关系(支持/反对)连接论据与主张,而非句子级别的类别性标签;\(iii\) 其证据跨度在子句级、词元级粒度上标注,而非句子级。因此,MIRA-Ev在精神上更接近关系论证挖掘,而非PICO风格的信息抽取,尽管在“寻找证据”的框架上存在表面相似性。

### 2.3 西班牙语和巴斯克语的临床NLP与论证语料库

非英语环境下的临床NLP长期面临资源稀缺问题,这推动了跨语言迁移作为活跃的研究方向。在西班牙语方面,近期出现了若干以论证为驱动的资源:Antidote CasiMedicos语料库(Agerri et al., 2023 (https://arxiv.org/html/2607.19201#bib.bib23))引入了带有志愿临床医生撰写的黄金解释性论证的MIR考试问题;该语料库扩展为CasiMedicos-Arg(Sviridova et al., 2024 (https://arxiv.org/html/2607.19201#bib.bib25)),一个多语言医学问答数据集,包含西班牙语、英语、法语和意大利语的黄金解释性论证结构;ClinArgES提供了带有显式主谓结构的句子级西班牙语临床论证。

MIRA-Ev建立在这一谱系之上,但同时在两个轴上与之区分:它将标注粒度从句子级论证结构转移到词元级跨度抽取并带有向关系类型化,并将语言覆盖扩展到巴斯克语,一种在临床论据挖掘方面之前没有任何粒度资源的语言。这填补了一种与西班牙语情况性质不同的资源缺口;巴斯克语临床NLP面临的不是比较性的资源不足,而是标注推理数据的近乎完全缺失,因此其纳入本身就是一项主要贡献。

### 2.4 评估危机:超越临床NLP中的多项选择题问答

越来越多的工作质疑MCQA风格的基准是否有意义地衡量了临床能力。领域适应的临床LLM在标准医学MCQA上往往无法超越通用模型(Jeong et al., 2024 (https://arxiv.org/html/2607.19201#bib.bib27); Dorfner et al., 2024 (https://arxiv.org/html/2607.19201#bib.bib28)),而比较性研究发现,尽管MCQA取得进展,传统ML模型在临床预测任务上仍可与LLM竞争(Chen et al., 2025 (https://arxiv.org/html/2607.19201#bib.bib29)),这共同表明MCQA准确率已与它所假定的代理临床能力脱钩(la Iglesia et al., 2025a (https://arxiv.org/html/2607.19201#bib.bib24))。对于少数语言而言,这种评估危机更加严重,因为本土的、专家策展的基准极为罕见,评估通常通过翻译的英语资源进行,从而引入临床表现与翻译表现之间的混淆因素(Domingo-Aldama et al., 2026 (https://arxiv.org/html/2607.19201#bib.bib30))。MIRA-Ev直接针对这一缺口:它不是另一个MCQA资源,而是评估模型答案的证据基础,独立于答案本身是否正确,并且是使用少数语言本地化构建而非通过翻译。

## 3 MIRA-Ev数据集

在本节中,我们介绍MIRA-Ev,一个用于对临床病例叙事进行细粒度证据检测和关系推理的基准。我们首先描述构成数据集的三级任务层次,然后是用于构建它的源数据和解标注过程、其在西班牙语、英语和巴斯克语上的并行多语言发布,以及最终的语料库统计。

### 3.1 任务层次

MIRA-Ev将临床推理结构化为跨三个层级的层次化级联任务序列。

#### 3.1.1 任务1:证据句子检索

一个二值句子级分类任务,从叙事上下文中分离出决策关键信息:给定一个病例,识别哪些句子包含与评估诊断选项相关的结果,相对于临床背景噪音而言。

#### 3.1.2 任务2:论证成分抽取

一个词元级抽取任务,在相关句子内恢复论证成分的精确边界,类型化为:

- • **论据**,细粒度临床观察:症状、检查结果、实验室/影像值。
- • **主张**,明确的诊断结论或假设。

默认情况下,论据由病例实例化,主张由候选选项实例化,但在部分实例中这种映射会反转:选项充当论据,相应的主张嵌入在病例/问题题干中,与其他支持或反对证据并列。系统应期望从内容和论证功能中识别成分类型,而非从位置(病例 vs. 选项)中识别。

#### 3.1.3 任务3:关系分类

成分与候选选项之间的有向关系分类:

- • **支持**,证据表明该选项正确/适当。
- • **反对**,证据矛盾、排除或否定该选项。

### 3.2 源数据与解标注

基于来自CasiMedicos的官方西班牙语MIR考试构建;移除先前的标注和临床医生解释,以获取原始病例(患者病史、现症状、临床询问,以及跨项目的4-5个选项基数混合集)。分割按医学专业和问题类型分层。

### 3.3 多语言构建

MIRA-Ev是一个西班牙语原始数据集,带有并行的英语和巴斯克语版本。

### 3.4 语料库统计

相似文章

MIRA-Math:一个面向最小信息请求与数学推理的基准测试

arXiv cs.AI

介绍MIRA-Math,这是一个基准测试,能够隔离并评估模型识别缺失原子事实、用自然语言精确请求这些事实,并将返回的信息整合到正确最终答案中的能力。该基准测试采用确定性实例生成和固定的受限响应器。

CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR

arXiv cs.AI

Introduces CliniCARE-Bench, a deployment-oriented benchmark for evaluating AI agents on clinical audit tasks over longitudinal EHR data, with 25 clinician-validated scenarios and 750 patient cases. It assesses verdict accuracy, evidence grounding, policy adherence, and calibrated abstention, finding that raw accuracy overstates investigation quality.

MEDSYN: 复杂临床病例中多证据综合的多模态大语言模型基准测试

arXiv cs.CL

MEDSYN 是一个多语言多模态基准,用于评估多模态大语言模型(MLLMs)在复杂临床病例上的表现,每个病例最多包含 7 种不同的视觉证据类型。研究表明,虽然前沿模型在鉴别诊断生成方面与人类专家相当,但所有 MLLMs 在最终诊断选择中均存在显著差距,原因是异质临床证据综合能力不足。