MedSNIP:构建与评估面向医学事实验证的片段级粒度
摘要
本文提出了 MedSNIP,一种片段级的医学事实验证方法,以及配套的人工标注基准 MedSNIP-Bench。研究证明该方法在保持临床结构和减少验证器调用方面具有改进效果。
arXiv:2609.12884v1 公告类型:新增
摘要:一项医疗声明的正确性往往不取决于声明本身,而是取决于其周围的临床结构。要正确判断一项声明,可能需要实验室参考值范围、因果或条件关联,或患者特定细节。原子级分解会破坏这些依赖关系,导致验证器面对临床不完整的声明。我们围绕片段级验证重新构建医学事实核查流程,其中按子句分组的单元能保留局部的临床结构。我们推出了 MedSNIP-Bench(一个面向片段级医学事实验证的人工标注基准)以及 MedSNIP(一个自动生成片段的流程)。MedSNIP-Bench 涵盖 276 项消费级健康和临床案例回答,被划分为 2,524 个片段,每个片段都具有通用语境和患者语境双标签,并标注了六种结构模式代码。我们在 MedSNIP-Bench 上将 MedSNIP 的表现与人工划分的片段边界进行了对比评估,随后使用它为外部语料库生成片段级单元。在 MedSNIP-Bench、HealthFC 和 MedHallu 数据集上,片段级验证保持或提升了错误类别的 F1 分数,其增益集中出现在答案足够长而易于被分割、且验证器足够强大以能利用恢复结构的情况下。其中,合并模式在因果-条件临床链上带来的提升最大。此外,该方法还能将验证器调用次数减少 24-73%,不过,只有在分解成本足够低时,这一节省才能在端到端流程中得以保留,而开源权重的分解器使得这一点得以在不损失分块保真度的前提下实现。
查看缓存全文
缓存时间: 2026/09/14 08:40
# 构建与评估医疗事实核查中的片段级细粒度基准 来源:https://arxiv.org/html/2609.12884 ## MedSNIP:构建与评估医疗事实核查中的片段级细粒度基准 Sarfraz Ahmad 机构:穆罕默德·本·扎耶德人工智能大学 Hyunjae Kim 机构:耶鲁大学 Sihyeon Park 机构:高丽大学 Junjie Liao 机构:北京师范大学 机构:INSAIT,索非亚大学“圣克利门特·奥赫里德斯基” [email protected],[email protected] 项目 (https://mbzuai-nlp.github.io/MedSNIP/) MedSNIP (https://huggingface.co/datasets/MBZUAI/MedSNIP) 代码 (https://github.com/mbzuai-nlp/MedSNIP) Qingyu Chen 机构:耶鲁大学 Preslav Nakov 机构:穆罕默德·本·扎耶德人工智能大学 Yuxia Wang 机构:INSAIT,索非亚大学“圣克利门特·奥赫里德斯基” [email protected],[email protected] 项目 (https://mbzuai-nlp.github.io/MedSNIP/) MedSNIP (https://huggingface.co/datasets/MBZUAI/MedSNIP) 代码 (https://github.com/mbzuai-nlp/MedSNIP) ###### 摘要 医疗声明的正确性往往不仅取决于声明本身,还依赖于其周围的临床结构。一个声明可能需要参考实验室范围、因果或条件关联,或患者特定细节才能被正确判断,而原子级分解会拆解这些依赖关系,导致验证器收到临床信息不完整的声明。我们围绕*片段级*验证重新构建了医疗事实核查,其中按子句分组的单元保留了局部临床结构。我们引入了MedSNIP-Bench(一个用于片段级医疗事实核查的人工标注基准)以及MedSNIP(一个自动生成片段的流水线)。MedSNIP-Bench覆盖276条消费者健康与临床情景类回复,被分割为2524个片段,每个片段具有“通用”与“患者情境”双重标签以及六种结构模式代码。MedSNIP首先在MedSNIP-Bench上对照人工片段边界进行评估,随后用于为外部语料库生成片段级单元。在MedSNIP-Bench、HealthFC和MedHallu上,片段级验证保持或提升了错误类F1值,其收益集中于答案足够长以致可能被拆分、且验证器足够强大以利用恢复结构的场景。其中,因果-条件临床链的合并模式增益最为显著。此外,片段级验证将验证器调用次数减少了24%–73%,但该节省仅在分解成本较低时才能端到端保持,而开源分解器可在不损失分块保真度的前提下实现低成本分解。 ## 1 引言 大语言模型(LLMs)正日益用于回答来自患者、消费者和临床医生的医学问题(Singhal等人,2023 (https://arxiv.org/html/2609.12884#bib.bib22);Singhal等人,2025 (https://arxiv.org/html/2609.12884#bib.bib23);Manes等人,2024 (https://arxiv.org/html/2609.12884#bib.bib18);Liu等人,2025 (https://arxiv.org/html/2609.12884#bib.bib16);Wang和Zhang,2024 (https://arxiv.org/html/2609.12884#bib.bib25))。一个看似流畅但缺乏依据的建议可能会影响患者的治疗决策、误导下游系统,并在临床推理中传播(Zhu等人,2025 (https://arxiv.org/html/2609.12884#bib.bib32))。因此,自动化事实核查是医疗大语言模型的安全要求,而非便捷的评估手段。 目前,大多数事实核查流水线源于FActScore(Min等人,2023 (https://arxiv.org/html/2609.12884#bib.bib19))及其后续工作。它们将生成内容拆分为最小的独立*原子声明*,独立验证每个声明,然后聚合判定结果(Chern等人,2025 (https://arxiv.org/html/2609.12884#bib.bib3);Wei等人,2024 (https://arxiv.org/html/2609.12884#bib.bib29);Dhuliawala等人,2024 (https://arxiv.org/html/2609.12884#bib.bib4);Iqbal等人,2024 (https://arxiv.org/html/2609.12884#bib.bib12))。当每个声明可被独立判断时,这种原子级设计是自然的。然而,医疗回答常违背此假设。例如,实验室结果解读可能需要同时查看测量值和参考范围;诊断可能需要一组发现模式而非孤立发现;某个建议可能普遍正确,但对特定患者而言却是错误的。在这些情况下,原子化会将一个具有临床意义的判断拆解为缺乏验证所需信息的片段。这促使我们设计一种更粗粒度的验证单元以保留这些依赖关系。我们称此单元为*片段*,即一组在临床上有意义且相互关联的子句群,它比完整回答更小,但比原子更粗。它将验证临床判断所需的信息组合在一起,例如发现及其解读、实验室值及其参考范围,或诊断及其注意事项。图1(https://arxiv.org/html/2609.12884#S1.F1)通过一个临床情景回复示例说明了这一点,其中一个判断被拆分为三到四个原子。这促使我们将细粒度选择视为医疗事实核查中的核心设计要素,而非预处理步骤。 图1:MedSNIP-Bench中的示例,展示原子化如何拆解临床连贯的判断。每列展示一个临床情景回复中的一个判断。片段级分解将关联的证据、解读和注意事项保留为一个可验证单元,而原子级分解则将同一判断拆分为三到四个独立声明。 基于这些观察,我们围绕*片段级验证*重构了医疗事实核查。我们不是将回复分解为原子声明或整体评估整个答案,而是将语义和临床上相关的子句分组为连贯的片段,以保留验证临床判断所需的上下文。每个片段都标注了通用医疗正确性和患者特定正确性,以捕获那些在医学上普遍合理但对特定患者情境不安全的错误。 现有的医疗事实核查资源并未评估此框架。HealthFC提供专家标注的消费者健康声明,MedHallu提供基于PubMedQA的幻觉基准,但两者都评估近原子级声明而非临床结构化单元(Vladika等人,2024 (https://arxiv.org/html/2609.12884#bib.bib24);Pandit等人,2025 (https://arxiv.org/html/2609.12884#bib.bib21))。领域定制的分解器和验证器诊断同样停留在原子级范式内(Huang等人,2026 (https://arxiv.org/html/2609.12884#bib.bib10);He等人,2026 (https://arxiv.org/html/2609.12884#bib.bib9))。 为填补此空白,我们引入了MedSNIP-Bench(一个人工标注的片段级医疗事实核查基准)以及MedSNIP(一个自动生成片段的流水线)。本文的主要贡献包括: - • 围绕片段级验证重构医疗事实核查,将相关子句分组并作为保留相关上下文的临床连贯单元进行检查。 - • MedSNIP-Bench,包含276条消费者健康与临床情景回复、2524个由人工标注的片段边界、通用与患者情境双重标签以及六种结构模式代码。 - • MedSNIP,一个自动生成片段的流水线,在MedSNIP-Bench上对照人工片段进行评估,并用于为HealthFC和MedHallu等外部语料库生成片段级单元。 - • 一项跨模型、跨数据集的评估,全程使用配对Bootstrap置信区间,并辅以按模式分析,揭示片段级验证在何种情况下有效。 ## 2 相关工作 ##### 原子事实核查:FActScore为长文本真实性评估建立了一个通用范式,即将生成内容分解为原子声明,每个声明根据证据进行检查(Min等人,2023 (https://arxiv.org/html/2609.12884#bib.bib19))。后续系统采用声明级验证流水线(Chern等人,2025 (https://arxiv.org/html/2609.12884#bib.bib3);Wei等人,2024 (https://arxiv.org/html/2609.12884#bib.bib29);Gao等人,2023 (https://arxiv.org/html/2609.12884#bib.bib5);Iqbal等人,2024 (https://arxiv.org/html/2609.12884#bib.bib12);Zerong等人,2025 (https://arxiv.org/html/2609.12884#bib.bib31);Wang等人,2025 (https://arxiv.org/html/2609.12884#bib.bib26);Wang等人,2024 (https://arxiv.org/html/2609.12884#bib.bib27))。近期研究质疑最小的声明是否总是最佳的验证单元。Wanner等人(2024)(https://arxiv.org/html/2609.12884#bib.bib28)表明验证器的准确性取决于分解的粒度,而Lu等人(2025)(https://arxiv.org/html/2609.12884#bib.bib17)学习了一种验证器偏好的原子化策略,优于默认原子化。受此启发,我们采用更简单的方法,证明一个更粗的、按子句分组的单元是足够、更便宜且更符合医疗推理的。 ##### 医疗事实核查:医疗真实性评估涵盖消费者健康和临床问答场景。HealthFC提供带有摘要的专家标注消费者健康声明(Vladika等人,2024 (https://arxiv.org/html/2609.12884#bib.bib24)),而MedHallu将PubMedQA扩展为幻觉检测基准,包含配对的真实答案和对抗性扰动答案(Pandit等人,2025 (https://arxiv.org/html/2609.12884#bib.bib21))。MedScore将FActScore式分解应用于自由形式的医疗答案,并表明领域定制的原子化器比通用原子化器产生更有效的声明(Huang等人,2026 (https://arxiv.org/html/2609.12884#bib.bib10))。MedFact识别出一种“过度批评”失效模式,即更强的推理验证器错误地将正确的医疗文本标记为错误(He等人,2026 (https://arxiv.org/html/2609.12884#bib.bib9))。Kim等人(2025)(https://arxiv.org/html/2609.12884#bib.bib14)表明检索仅覆盖了临床医生指出的必要信息的一小部分,且检索增强生成(RAG)可能降低真实性。Gunjal和Durrett(2024)(https://arxiv.org/html/2609.12884#bib.bib8)通过去语境化使原子声明可解释,这与分组方法互补而非替代。将“*A because B*”重写为单独声明可能会遗漏每个部分看似合理但整体关联不成立的错误。 现有方法改进了声明级医疗事实核查,但缺乏片段结构以及通用与患者情境双重标签。我们引入了MedSNIP-Bench,据我们所知,这是首个保留临床声明及其上下文的人工标注片段级医疗事实核查数据集。我们的结果支持片段级验证,而非仅依赖原子化声明。 ## 3 MedSNIP-Bench MedSNIP-Bench基于Kim等人(2025)(https://arxiv.org/html/2609.12884#bib.bib14)发布的基准构建,该基准将K-QA中的100个消费者健康查询(Manes等人,2024 (https://arxiv.org/html/2609.12884#bib.bib18))与MedBullets中的100个USMLE风格的临床情景问题(Chen等人,2025 (https://arxiv.org/html/2609.12884#bib.bib2))配对,并对原子声明带有专家真假标签。我们使用包含5755个专家标注原子声明的276条数据,根据原始查询的单词长度阈值将其划分为140条消费者健康类和136条临床情景类条目。原始语料库在查询长度上呈双峰分布,因此划分明确(附录A.1 (https://arxiv.org/html/2609.12884#A1.SS1))。 原子级二元真实性标签(即真或假)来自继承自Kim等人(2025)(https://arxiv.org/html/2609.12884#bib.bib14)的医生标注,而MedSNIP-Bench将这些原子分组为有意义的临床片段,并提供相应的片段级标注。MedSNIP-Bench中的每个片段边界、模式代码和正确性标签均由人工分配。 ##### 片段与模式分类:原子声明层对于医疗内容通常过于细粒度,因为临床判断可能依赖于相关子句。为保留这些依赖关系,我们将语料库重新分割为*片段*——即按子句分组的可验证单元,旨在保留共享实体、临床框架以及因果或条件关系。对原始基准的分析表明,片段边界通常围绕六种结构模式出现。我们通过原子声明验证基线的错误分析识别出这些模式,其中反复出现的验证失败聚集在相同的结构案例中。模式A-C(如图1 (https://arxiv.org/html/2609.12884#S1.F1)所示)是合并模式,即多个原子应作为单个片段一起验证;而模式D-F是保留原子模式,其中原子仍是适当的验证单元。六种结构模式总结如下: - • 模式A:用于单个主题的属性枚举(特征、原因或因素,仅作为集合时才有意义) - • 模式B:用于共享证据的因果或条件链(临床推理,包括诊断逻辑、药物效应链和基于阈值的建议) - • 模式C:用于结论及其支撑前提(诊断或建议的可验证性依赖于刚陈述的支持性发现)。 - • 模式D:用于独立的单点事实或实验室解读,其可验证性不依赖于周围子句 - • 模式E:用于真正的话题转换,合并会混淆不同主题 - • 模式F:用于关于同一主体的不同事实,它们不共同支持单一判断,包括被真实原子包围的孤立错误原子(一种原子化将错误声明与真实上下文隔离的情况)。 | 数据集子集/划分 | 条目数 | 单元数 | 类型 | 通用错误率% | 情境错误率% | 标签 | 模式计数 | A | B | C | D | E | F | |----------------|--------|--------|------|------------|------------|------|----------|---|---|---|---|---|---| | **MedSNIP-Bench统计** | | | | | | | | | | | | | | | 父语料库 | 276 | 5,755 | 原子 | - | - | - | - | - | - | - | - | - | - | | 消费者 | 140 | 1,091 | 片段 | 12.4 | 9.2 | 双重 | 634 | 101 | 79 | 194 | 107 | 30 | 13 | | 情景 | 136 | 1,433 | 片段 | 14.6 | 11.4 | 双重 | 374 | 124 | 24 | 24 | 23 | 29 | 241 | | 训练集 | 180 | 1,599 | 片段 | 13.6 | 10.5 | 双重 | 640 | 143 | 209 | 385 | 261 | 96 | 46 | | 验证集 | 51 | 494 | 片段 | 13.8 | 10.7 | 双重 | 187 | 44 | 58 | 126 | 106 | 9 | 69 | | 测试集 | 45 | 431 | 片段 | 13.7 | 10.0 | 双重 | 181 | 38 | 54 | 106 | 34 | 9 | 49 | | **总计** | **276** | **2,524** | **片段** | **13.6** | **10.5** | **双重** | **1008** | **225** | **321** | **617** | **393** | **141** | **349** | | **外部数据集** | | | | | | | | | | | | | | | HealthFC原子 | 750 | 1,076 | 原子 | - | - | - | - | - | - | - | - | - | - | | 片段(模式1) | 750 | 821 | 片段 | - | - | 单一 | - | - | - | - | - | - | - | | 片段(模式2) | 750 | 761 | 片段 | - | - | 单一 | - | - | - | - | - | - | - | | MedHallu原子 | 2,000 | 3,798 | 原子 | - | - | - | - | - | - | - | - | - | - | | 片段(模式1) | 2,000 | 2,636 | 片段 | - | - | 单一 | - | - | - | - | - | - | - | | 片段(模式2) | 2,000 | 2,586 | 片段 | - | - | 单一 | - | - | - | - | - | - | - | 表1:MedSNIP-Bench和外部数据集统计。父语料库仅供参考。%F in-general和%F in-context是错误标签率,A-F是结构模式计数。对于外部数据集,报告了MedSNIP两种模式及其共享的原子基线(第4.1节 (https://arxiv.org/html/2609.12884#S4.SS1))。HealthFC计数遵循问题到命题的转换。破折号表示字段不可用或不适用。 ##### 双重正确性标签:每个片段接受两次正确性判断: - *(i)通用*:指该片段作为一般医疗陈述是否正确。 - *(ii)患者情境*:指它对特定患者或查询是否正确。 此双重方案捕获了那些普遍真实但在情境中错误的情况,例如在普通医学中合理但对当前案例不恰当的建议。这种区别在MedSNIP-Bench中实际存在,有124个片段(占4.9%)的通用标签和情境标签存在分歧。这些案例集中于临床情景条目,与情境错误在患者环境中尤为相关的情况一致。
相似文章
从片段到语义:重新思考多语言事实核查的证据粒度
本文介绍了SEEK,一个用于多语言事实核查中语义证据提取的框架,该框架从完整文章中构建连贯的证据块,并使用LoRA微调多语言大语言模型,在宏观F1分数上相比基线提升了高达20%。
AtomiMed:基于层次化原子事实核查的通用临床感知医学报告评估框架
AtomiMed 提出了一种层次化原子事实核查框架,用于评估医学报告生成。它将临床叙述分解为原子事实,并采用智能体交叉验证,以超越传统指标提升准确度评估。
用于生物医学声明验证的小型LLM:经济高效的微调、结构化数据集捷径与跨域泛化
使用QLoRA对小型LLM(3B-7B)进行生物医学声明验证的微调,以44.5倍更低的成本实现了比GPT-4o和GPT-5更高的F1分数,并揭示了SciFact中的一个结构伪影。该研究表明,在结构合理的数据上进行训练可实现稳健的跨域迁移。
MedicalBench:评估大型语言模型以改进医学概念提取
MedicalBench是一个新的基准测试,用于评估大型语言模型从电子健康记录中提取医学概念的能力,重点关注隐含推理和证据支撑。它包含823个专家标注的示例,并显示当前模型表现一般,突显了提取隐含表述的医学概念的难度。
CoMedBench:多源合成医学数据保真度与下游效用的基准
CoMedBench 是一个可复现的基准测试,用于评估跨37个数据集-任务组合的合成医疗数据生成器,结果表明合成训练数据在表格型任务上保留了大部分下游信号,但时间序列ICU任务仍然对生成器敏感。