BioDivergence:面向生物医学摘要中隐藏上下文矛盾的基准与评估框架
摘要
介绍BioDivergence,一个用于检测生物医学摘要中上下文条件矛盾的基准与评估框架,包含六类冲突分类法和一个由11,865个声明对构成的银标准数据集。
arXiv:2606.11208v1 公告类型:新
摘要:生物医学研究中的发现经常看似矛盾,但这些差异大多是依赖于上下文的,而非真正的矛盾。队列、地理、检测方案、疾病亚型和临床设置的变化可能使两项声明在局部范围内均有效。现有的NLI和科学声明验证基准将这些情况简化为蕴含、矛盾或中性,未能捕捉到差异背后的上下文结构。为解决这一问题,我们提出了BioDivergence,一个评估框架,包含六类冲突分类法、13轴差异本体论,以及每个声明对的四个结构化输出:冲突类型、差异轴、主要混杂因素和调和解释。我们发布了BioDivergence-Silver-v1.0,一个跨五个生物医学领域的11,865个声明对的文章分离银标准基准,同时提供一个经过去重的旧版变体用于比较。结果显示两个变体之间的排名差异显著,微调参考模型在文章分离设置下下降了约12个百分点,而Mistral-7B-Instruct-v0.3在包含842个样本的主测试集上达到了0.5523的准确率和0.3894的上下文F1值。BioDivergence提供了一种更忠实的方式来区分上下文差异与直接矛盾,并将文章级别的记忆与真正的任务学习分开。
查看缓存全文
缓存时间: 2026/06/11 13:35
# BioDivergence:生物医学摘要中隐藏语境矛盾的基准与评估框架
来源:https://arxiv.org/html/2606.11208
Elias Hossain¹, Sanjeda Sara Jennifer¹, Sabera Akter Bushra², Niloofar Yousefi¹
¹中佛罗里达大学工程与计算机科学学院
²中佛罗里达大学伯内特生物医学科学学院
\{mdelias.hossain, niloofar.yousefi\}@ucf.edu
###### 摘要
生物医学发现常在不同研究间看似矛盾,但许多此类表面分歧并非真正的矛盾:队列、地域、检测方案、疾病亚型或临床环境的差异,可使两种说法在各自语境下均成立。现有的自然语言推理和科学主张验证基准测试两个陈述之间是蕴含、矛盾还是中立关系,但均未测试模型能否恢复解释这种语境条件性分歧的**语境结构**。将这种分歧简单归为扁平化的矛盾标签,会夸大文献中的不一致性,并掩盖下游生物医学自然语言处理系统所需的能力。
我们引入 **BioDivergence**,一个基于六类冲突分类法、13轴分歧本体论以及每对主张四个主要结构化目标(冲突类型、分歧轴、主导混杂因素、调和解释)构建的评估框架。第五个范围受限的输出——主张级证据跨度提取——作为v1.0版本在“主张原词”银标规则下的发布时校准项包含在内,而非作为基础性验证基准。我们发布 **BioDivergence-Silver-v1.0**,一个跨五个生物医学领域的11,865对主张(10,183 / 840 / 842)的文章级不相交银标基准,各划分间无文章、主张或主张对重叠;同时保留一个旧版的按对去重变体,仅用于向后可比性。微调与零样本基线在这两个变体上的上下文矛盾F1值排名存在质的差异:在文章级不相交主版本中,微调参考模型相比旧版按对封装版本下降约12个点;在完整的842例主测试评估中,使用Mistral-7B-Instruct-v0.3达到0.5523准确率和0.3894上下文F1值,且无文章级数据泄漏。v1.0可靠地支撑两个冲突类别和九个轴(共十三个);其余模式槽为保持本体论稳定性而保留。BioDivergence提供了一种评估视角,将语境分歧与直接矛盾区分开来,并将文章级记忆化与任务学习分离。
## 1 引言
生物医学发现常在不同研究间看似矛盾,其中一些表面分歧反映的是隐含的语境差异,而非真正的矛盾 [Sosa and Altman (2022)](https://arxiv.org/html/2606.11208#bib.bib8)。两篇摘要可能报道不相容的结论,但两个主张在**不同条件下仍可局部有效**:队列、监测期、检测方案、疾病亚型或临床环境。将这种语境条件性分歧与直接不相容区分开来并非风格上的考量。将两者合并为一个单一的“矛盾”标签,会夸大文献中的不一致性,曲解科学证据的结构,并掩盖下游生物医学自然语言处理系统所需的能力。
#### 现有基准的不足。
现代自然语言推理和主张验证基准(FEVER [Thorne et al. (2018)](https://arxiv.org/html/2606.11208#bib.bib10)、VitaminC [Schuster et al. (2021)](https://arxiv.org/html/2606.11208#bib.bib7)、SciFact [Wadden et al. (2020)](https://arxiv.org/html/2606.11208#bib.bib11))要求判断两个陈述是蕴含、矛盾还是中立,以及证据段落是否支持主张。近期的知识冲突基准(ConflictBank [Su et al. (2024)](https://arxiv.org/html/2606.11208#bib.bib9)、WikiContradict [Hou et al. (2024)](https://arxiv.org/html/2606.11208#bib.bib4)、HealthContradict [Zhang et al. (2025)](https://arxiv.org/html/2606.11208#bib.bib15))将范围扩展至大语言模型在来源不一致时的行为。但没有任何一个基准评估模型能否恢复**为何**两项发现存在分歧——当分歧源于底层研究间隐藏的语境差异时。
*激励示例。* 主张A报告,在希腊ICU中,粘菌素MIC折点2 mg/L能正确识别敏感鲍曼不动杆菌分离株;主张B报告,在同一折点下,泰国监测研究中30%的耐粘菌素鲍曼不动杆菌分离株被误分类。标准自然语言推理系统会将这对主张标注为矛盾。而有生物医学价值的评估应能恢复出:分歧由地域、菌株组成和检测使用方法解释,并奖励能命名这些轴而非仅翻转三元标签的模型。
#### BioDivergence 增加了什么。
我们引入 **BioDivergence**,一个用于生物医学摘要中隐藏语境矛盾分析的评估框架。它将矛盾分析视为一个结构化的多输出问题:对于每一对主张,模型必须恢复冲突类型(六类分类法)、分歧轴(13轴本体论)、主导混杂因素以及一个调和解释。这四个输出是我们的**主要评估目标**。第五个范围受限的输出——主张级证据跨度提取——包含在v1.0中,作为在主张原词银标注释规则下的发布时校准项,而非成熟的基础验证基准。构建流水线处理了202,180篇归一化摘要,提取了527,907个主张,并在五个生物医学领域挖掘了50,000对候选主张。发布采用**文章级不相交**划分,训练集、开发集和测试集之间无文章、主张或主张对重叠,这改变了相较于其他矛盾基准隐含使用的按对封装的模型排名(§7)。实验上,零样本大语言模型在粗粒度冲突分类和调和生成上领先;完整的非Qwen主测试运行提供了所有842个测试示例的注释器族无关检查;而词汇和检索基线在v1.0证据跨度提取上因主张原词规则的构造而占优。
#### 贡献。
我们的贡献有四个方面。**第一**,我们正式提出了**语境矛盾分析**任务——恢复**为何**两个生物医学主张存在分歧,而非仅判断是否分歧——填补了扁平化自然语言推理、主张验证和知识冲突基准留下的空白。**第二**,我们引入了一个六类冲突分类法(v1.0中可靠填充两个类别,其余四个为保持本体论稳定性而保留)和一个13轴分歧本体论(九个主类,四个暂定类),同时提出了一项四主加一限的任务规范,涵盖冲突类型、分歧轴、主导混杂因素和调和解释;主张级证据跨度提取作为v1.0发布时在主张原词规则下的校准项包含在内。**第三**,我们发布了 **BioDivergence-Silver-v1.0**,一个文章级不相交银标基准,附有显式的泄漏审计和非Qwen注释器族敏感性分析;同一标注池的旧版按对变体仅保留用于向后可比性。**最后**,我们展示了文章级不相交评估改变了上下文矛盾上的模型排名,将文章记忆化与语境推理学习以传统按对封装无法做到的方式分离开来;完整的842例主测试Mistral评估进一步证实主划分支持注释器族无关评分,无需依赖子样本,从而将BioDivergence确立为一个评估视角而非单一数据集。
#### 为何 BioDivergence 改变评估结论。
扁平化的矛盾标签无法区分直接不相容与语境条件性分歧,因此一个擅长粗粒度矛盾的模型仍可能在**为何**两个发现存在分歧上出错;BioDivergence的分歧轴和主导混杂因素监督暴露了这种区别。由于一篇生物医学摘要通常会产生许多主张对,按对去重会引入较大的文章级重叠,由此产生的排名在文章级不相交评估下会发生偏移。因此,BioDivergence改变了一个人能从基准分数中对语境推理能力做出的诚实结论。
## 2 相关工作
基于文本证据的主张验证已在FEVER [Thorne et al. (2018)](https://arxiv.org/html/2606.11208#bib.bib10) 和 VITAMINC [Schuster et al. (2021)](https://arxiv.org/html/2606.11208#bib.bib7)(维基百科)以及SciFact [Wadden et al. (2020)](https://arxiv.org/html/2606.11208#bib.bib11), 2022) 和 Evidence Inference [DeYoung et al. (2020)](https://arxiv.org/html/2606.11208#bib.bib3)(科学和临床文本)中得到研究;[Sosa and Altman (2022)](https://arxiv.org/html/2606.11208#bib.bib8) 强调缺失语境和矛盾限制了生物医学知识图谱推理。近期关于大语言模型中知识冲突的工作(ClashEval [Wu et al. (2024)](https://arxiv.org/html/2606.11208#bib.bib14), ConflictBank [Su et al. (2024)](https://arxiv.org/html/2606.11208#bib.bib9), WikiContradict [Hou et al. (2024)](https://arxiv.org/html/2606.11208#bib.bib4), HealthContradict [Zhang et al. (2025)](https://arxiv.org/html/2606.11208#bib.bib15))表明模型在表示或协调竞争证据上存在困难。并行的工作涉及交互式澄清(MEDIQ [Li et al. (2024)](https://arxiv.org/html/2606.11208#bib.bib5))和可解释临床推理(DiReCT [Wang et al. (2024)](https://arxiv.org/html/2606.11208#bib.bib13));[Ru et al. (2024)](https://arxiv.org/html/2606.11208#bib.bib6); [Bean et al. (2025)](https://arxiv.org/html/2606.11208#bib.bib2); [Anonymous (2024)](https://arxiv.org/html/2606.11208#bib.bib1) 对检索增强生成和真实性评估提出了构念效度和度量方面的担忧。
#### BioDivergence 的独特之处。
现有基准要么将矛盾视为二元或三元标签(SciFact, VitaminC, FEVER),要么用粗粒度冲突类别评估大语言模型在知识冲突下的行为(ConflictBank, WikiContradict, HealthContradict),要么聚焦于单文档临床推理(Evidence Inference, DiReCT)。BioDivergence 在四个维度上有所不同:(i) 六类分类法将直接矛盾与语境矛盾分开,并保留欠明确和有争议的案例而非简单合并;(ii) 13轴本体论监督**为何**两个主张存在分歧;(iii) 每个示例有五个结构化输出而非单个标签;(iv) 一个针对生物医学摘要的构建流水线,包含每个领域的控制、显式泄漏审计、文章级不相交主发布版本以及用于向后可比性的旧版按对变体。我们并不声称 v1.0 达到了 SciFact 等专家策划基准的标注质量;而是将 BioDivergence-Silver 定位为一个结构化、大规模银标基准,暴露了以往工作未评估的多组件推理任务。
## 3 任务形式化
给定一对主张 \(c_a, c_b\) 及其源摘要 \(d_a, d_b\),BioDivergence 定义了四个**主要**评估目标和一个**范围受限**的输出。
#### 主要评估目标(任务1–4)。
(1) **冲突类型** \(y \in \mathcal{Y}\),来自六类分类法;(2) **分歧轴** \(A \subseteq \mathcal{A}\),来自13轴本体论;(3) **主导混杂因素** \(d \in A\),当某一轴最具解释力时;(4) **调和解释** \(r\),描述主张如何共存或为何其张力仍未解决。本文中的绝对基准级主张均基于文章级不相交主划分上的这四个输出。
#### 范围受限的输出(任务5,v1.0)。
(5) **证据跨度** \(E_a, E_b\),证明结构化预测的合理性。由于v1.0银标注释器从主张文本中逐字复制跨度(附录I),任务5衡量的是主张级子串检索而非摘要级基础验证,并在第7节中作为银标流水线的发布时校准项报告,而非作为基础验证能力基准。
## 4 BioDivergence 本体论
BioDivergence 结合了一个**冲突分类法**与一个**语境分歧本体论**。六类分类法区分直接矛盾、语境矛盾、欠明确表面矛盾、证据不足、未解决的科学争议以及无冲突。13轴分歧本体论捕捉生物医学发现可能看似不一致的语境维度:人群、地域、时间段、检测方案、研究设计、干预措施、疾病亚型、分子背景、临床环境、样本来源、终点定义、生物菌株以及一个未知潜在因素槽。它们共同为**为何**两个主张存在分歧提供了结构化监督,而非一个单一的未分化标签;完整定义见附录E.1。
## 5 基准构建
BioDivergence 通过一个六阶段流水线构建:语料收集、归一化、主张提取、候选对挖掘、结构化银标标注以及基准打包。标签由模式约束的注释流水线生成,而非完全专家裁定。
### 5.1 数据构建
我们从PubMed和Europe PMC跨五个领域(抗菌素耐药性、肿瘤学、传染病、基因组学以及临床试验/流行病学)收集生物医学摘要,经过清洗、归一化和层次化去重后得到 **202,180 篇独特摘要**(附录F)。一个基于规则的主张提取器从139,792篇摘要中产生 **527,907 个科学主张**(摘要级产出率69.1%;每篇摘要2.61个主张;附录H)。在每个领域内,通过使用句子嵌入检索语义相似的主张并结合分歧敏感信号(极性反转、否定、实体不匹配、语境冲突线索)进行排序来挖掘候选对;我们将每个领域的上限设为10,000对,以获得均衡的 **50,000 对**候选池(附录G)。候选对随后被银标标注并组装成同一池的两个兄弟划分:**主版本** BioDivergence-Silver-v1.0(文章级不相交;11,865对,10,183 / 840 / 842)以及一个**旧版 v1.0-pairlevel** 变体(仅按对去重;12,500对,8,750 / 1,250 / 2,500),后者保留用于向后可比性。在两个变体中,开发集和测试集仅包含大语言模型重新标注的示例;训练集则结合剩余的大语言模型重新标注示例与启发式补充(置信度 \(\geq 0.45\))以满足每个领域的目标。
#### 划分设计:主版本文章级不相交,旧版按对。
在主版本发布中,由任何共享主张对连接的文章组件完整保留在一个划分内,且 `pair_id` 重复项优先选择大语言模型标注的副本,从而在不同划分间实现零文章、零主张、零主张对重叠。文章级不相交被优先考虑,因为一篇摘要可以生成许多主张对,文章重叠会使模型通过摘要级记忆化而非语境矛盾学习获得高分。旧版按对变体仅保留用于与我们更广泛的基线套件进行向后可比性。相似文章
面向Reddit生物伦理争议中立场检测的上下文感知数据集
介绍了BioStance,这是一个包含39,600个已标注的Reddit帖子和评论对的上下文感知数据集,用于生物伦理争议中的立场检测,涵盖生物伦理辩论三个维度的六个目标。
多样性并非歧义:面向开放域问答的准确高效歧义检测
本文提出了Archive,一个用于开放域问答中歧义检测的框架,利用逻辑冲突区分歧义与答案多样性,并引入了包含4,703个查询的基准QuireQA。实验表明,Archive将F1最高提升21.6%,同时比竞争对手快16倍。
Divide-Prompt-Refine:一种无需训练、结构感知的生物医学摘要生成框架
DPR-BAG 是一种无需训练、零样本的框架,通过将全文分解为修辞层面、使用 LLM 对每个层面进行摘要并精炼以提高连贯性,从而生成连贯的生物医学摘要,在保持事实一致性的同时,新颖性优于基线方法。
CoMedBench:多源合成医学数据保真度与下游效用的基准
CoMedBench 是一个可复现的基准测试,用于评估跨37个数据集-任务组合的合成医疗数据生成器,结果表明合成训练数据在表格型任务上保留了大部分下游信号,但时间序列ICU任务仍然对生成器敏感。
上下文-参数冲突的三种机制:预测框架与实证验证
本文提出了一个三机制框架,以解决大型语言模型(LLM)在处理训练知识与新文档之间冲突时出现的实证矛盾,并在五大主流模型上进行了验证。该框架区分了参数强度与参数唯一性,并展示了任务框架和证据连贯性如何显著影响模型行为。