评估设计制约专家与自动MeSH差距:在Cohen基准上对词袋模型和BiomedBERT的受控比较

arXiv cs.CL 论文

摘要

本文比较了专家分配和自动分配的MeSH术语作为系统综述筛选分类器特征的效果,表明评估设计显著影响测量的性能差距,规范设计显示较大差距,而在替代设计下差距减小。

arXiv:2607.21685v1 公告类型:新 摘要:系统综述始于有人阅读数千篇摘要以找出少数相关文献,分类器用于优先排序这些阅读。其输入通常通过医学主题词表(MeSH)增强,这些词表由专家索引员在发表后数周或数月分配,或由自动工具即时分配。据我们所知,这两者尚未直接作为分类器特征进行比较,且以往研究未曾提问比较结果是否依赖于分类器的评估方式。使用Cohen等人(2006)关于三个主题的药物分类基准,我们描述了一个词袋逻辑回归分类器(七次重跑)和BiomedBERT(五个随机种子),然后考察在替代设计下他汀类药物的结果如何变化。在规范的5折全语料库设计下,词袋模型在Statins上的专家vs自动差距为+0.096 WSS@95%。将语料库大小与较小主题(n = 803)匹配时,差距降至+0.033(95%自举置信区间包含零),在全规模下进行10折交叉验证时降至+0.021(置信区间勉强排除零)。在规范评估下,BiomedBERT给出+0.020,处于词袋模型10折结果的采样噪声范围内。功效分析表明,在阿片类药物或ADHD方差下,他汀类药物大小的效应无法被检测到,因此这些零结果受到设计限制而非信息性。表示不对称仍然存在:当附加专家MeSH术语时,15.1%的Statins输入超过BiomedBERT的512词元限制,因此截断可能导致较小的transformer差距,尽管在此无法与训练量区分。在使用transformer或10折词袋模型的筛选流程中,测试主题上的差距约为0.02 WSS@95%,置信区间至少在一端跨越零。更广泛地说,关于特征来源的基准结论在评估设计的合理改变下可能发生显著变化。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:38

# 评估设计条件影响专家与自动MeSH差距:对Cohen基准上词袋与BiomedBERT的受控比较
来源:https://arxiv.org/html/2607.21685
###### 摘要

系统评价的第一步,是有人阅读数千条摘要,从中找出少数相关文献,而分类器则用于对此阅读过程进行优先级排序。分类器的输入通常由医学主题词表(MeSH)增强,这些MeSH词可能是专家索引员在发表后数周或数月分配的,也可能是通过自动工具立即生成的。据我们所知,这两种MeSH此前并未直接被作为分类器特征进行比较,也没有任何先前的研究探讨这种比较的结果是否取决于分类器的评估方式。我们利用Cohen等人(2006 (https://arxiv.org/html/2607.21685#bib.bib1))关于三个主题的药物类别基准,描述了一个词袋逻辑回归分类器(七次重复)和BiomedBERT(五个随机种子)的表现,然后考察在替代评估设计下Statins主题的结果如何变化。在经典的5折全语料评估设计下,Statins主题上词袋分类器的专家-自动MeSH差距为\+0.096 WSS@95%。分层子抽样至匹配语料规模(n=803)将该差距缩小至\+0.033(95% bootstrap置信区间包含零);在满语料规模下进行10折交叉验证则将其缩小至\+0.021(置信区间窄幅排除零)。BiomedBERT在经典评估下得到的差距为\+0.020,处于词袋分类器10折结果的抽样噪声范围内。一项实证功效分析表明,在Opioids或ADHD主题每折方差水平下,一个Statins规模大小的效应可能无法在当前每主题折数下检测到(Opioids的最小可检测效应MDE=0.189,ADHD的MDE=0.286),因此跨主题的零结果反映的是设计限制而非信息缺失。在所测试的设计中,经典设计最能清晰地检测出差距,而差距在增加每折训练量的设计下会缩小。一种表征不对称性仍然存在:Statins输入中有15.1%在专家MeSH模式下超过了BiomedBERT的512令牌上限,截断操作会优先移除附加上去的MeSH词。这可能是Transformer差距较小的一个贡献因素,但如果没有无截断的比较,无法将其与训练量效应区分开来。对于使用Transformer分类器或10折词袋的筛选管道而言,在所测试的主题上观测到的专家-自动MeSH差距大约为0.02 WSS@95%,置信区间至少在一边包含零。更广泛地说,关于特征来源的基准结论可能会在评估设计的合理变化下发生实质性改变。

## 1. 引言

系统评价负责汇集与某一临床问题相关的已发表证据。筛查审阅者需要阅读数千条标题和摘要,以找出与评价相关的少数文献;这项工作昂贵且耗时,自动化筛选工具至少在Cohen等人(2006 (https://arxiv.org/html/2607.21685#bib.bib1))的工作中就已经开始被研究。他们的药物类别基准建立了一个包含15个主题的测试平台,并提出了一个评估指标——95%召回率下的抽样节省工作量(WSS@95%),该领域至今仍在沿用。筛选分类器的标准输入表示形式是文章的标题和摘要,通常还会附加来自美国国家医学图书馆受控词汇表的MeSH词。这种增强方式能够捕捉摘要中未明确说明的主题信息,例如即使标题中未出现具体药物名称,也能表明文章是关于某类药物。

MeSH词通过两种机制生成。美国国家医学图书馆的专业索引员根据文章的全部内容为每条PubMed收录的文章分配MeSH词;这些专家标注是规范的参考标准。自动工具则通过字符串匹配、概念链接或基于模型的预测来机械地分配MeSH词。这两种标注源作为分类器特征是否可互换具有实际意义:专家标注在发表后延迟数周或数月,而机械分配则是即时的,可以应用于尚未有专家索引的预印本或近期发表的文章。如果两者在下游分类器性能上相当,那么机械分配就是一种可行的替代方案。如果不同,那么系统评价筛选就会受限于标注的延迟性,从而限制对近期文献的覆盖范围。

据我们所知,此前没有研究在保持MeSH词汇表不变的情况下单独考察标注机制。现有工作将专家MeSH视为真实标准,并将自动MeSH预测视为一个独立的算法问题(Mao and Lu 2017 (https://arxiv.org/html/2607.21685#bib.bib4);Jin and Szolovits 2018 (https://arxiv.org/html/2607.21685#bib.bib5))。那些通过MeSH特征增强分类器输入的研究通常使用专家分配的版本,而没有改变分配机制(Cohen 2008 (https://arxiv.org/html/2607.21685#bib.bib2);Matwin等人 2010 (https://arxiv.org/html/2607.21685#bib.bib3))。最接近的类比是关于更广泛的特征:Scott和Matwin (1999 (https://arxiv.org/html/2607.21685#bib.bib6))比较了短语、同义词和上位词作为路透文本分类的特征。与评估设计的交互作用则从未被提出过;经典的5折交叉验证(在原始主题规模下)在整个文献中被视为一种方法论的默认设置,而非一个实验变量。

本文通过一个在三个Cohen主题上的受控实验来探讨这两个问题,保持MeSH词汇表不变,仅改变分配机制。两个分类器家族作为测试平台:词袋逻辑回归分类器和BiomedBERT(原PubMedBERT,Gu等人 2021 (https://arxiv.org/html/2607.21685#bib.bib7)),后者是一个领域预训练的上下文Transformer。我们将每个主题-分类器组合表征为一个分布——词袋七次重复,BiomedBERT五个种子——并辅以两个关于Statins结果的稳健性分析(子抽样至匹配语料规模;满语料规模下的10折交叉验证)以及一个关于每主题方差的实证功效分析。

我们的研究问题和配对假设如下:

- •RQ1 / H1:在保持词汇表和分类器不变的情况下,机械MeSH分配作为分类器特征产生的WSS@95%是否与专家MeSH相当?H1:在经典设计下,专家MeSH在Statins上产生正的领先优势,复制先前的工作。
- •RQ2 / H2:答案是否取决于分类器?H2:相对于词袋,BiomedBERT在Statins上缩小了专家-自动差距。
- •RQ3 / H3:答案是否取决于评估设计?H3:Statins的专家-自动差距大小取决于每折训练量和每主题语料规模。

在经典设计下,预期的Statins优势出现;BiomedBERT使其衰减,而词袋的优势本身在两种稳健性分析下都缩小到BiomedBERT结果抽样噪声范围内的程度。我们不判定Transformer效应是否在架构上与设计敏感性效应不同;数据与一个共同的训练量机制(影响两者)是一致的。Opioids和ADHD上的跨主题零结果是设计受限的:这些主题上的经验MDE超过了Statins效应大小,因此它们不能揭示潜在机制。

我们做出三项贡献。

- •对广泛引用的筛选发现的设计依赖表征。我们展示了在Cohen基准上的Statins专家-自动MeSH差距,在匹配语料规模子抽样下衰减大约三倍,在10折交叉验证下衰减大约五倍,将经典设计下的幅度分解为不同的语料规模和每折训练量组成部分。
- •注释机制的受控跨分类器比较。在保持词汇表和评估不变的情况下,我们在三个Cohen药物类别主题上比较了词袋和BiomedBERT,通过七次重复和五次种子多重运行协议,将每个主题-分类器组合视为分布而非点估计,并归档了每折值。
- •对跨主题零结果的功效分析边界。Opioids和ADHD每折方差下的经验MDE超过了Statins效应大小,因此跨主题零结果不能区分是机制效应缺失还是检测效力缺失。我们将此作为设计限制而非实质性发现报告。

## 2. 相关工作

Cohen等人 (2006 (https://arxiv.org/html/2607.21685#bib.bib1)) 引入了包含15个系统评价主题的药物类别基准,并报告了一个采用二值词袋特征的投票感知器分类器的WSS@95%值。他们的跨主题平均值约为18.5%,有四个主题的WSS@95%低于5%。后续工作继续使用这一基准。Cohen (2008 (https://arxiv.org/html/2607.21685#bib.bib2)) 报告了使用n-gram特征和MeSH词的基于SVM的结果,采用AUC而非WSS@95%。Matwin等人 (2010 (https://arxiv.org/html/2607.21685#bib.bib3)) 使用了因子化互补朴素贝叶斯,并在几个主题上报告了WSS@95%的改进。在这一系列工作中,MeSH增强作为特征源出现,但它的分配机制被视为固定不变,而5折交叉验证(在原始主题规模下)则被视为方法论的默认设置,而非实验变量。

最近的筛选工作已经转向Transformer和大语言模型分类器,报告GPT类系统在系统评价任务上的性能通常超过早期的统计基线(Guo等人 2024 (https://arxiv.org/html/2607.21685#bib.bib10);Alshami等人 2023 (https://arxiv.org/html/2607.21685#bib.bib11);Wang等人 2024 (https://arxiv.org/html/2607.21685#bib.bib12))。这一转变给任何使用更简单分类器的新工作带来了定位问题:既然最先进的技术已经向前发展,为什么还要研究词袋?我们的回答是,将词袋视为一种受控的测试平台,用于隔离机制,而非作为筛选实践中的竞争系统。我们研究的机制问题独立于当前哪种分类器表现最佳,因为该问题涉及的是两种标注源作为输入是否可互换,而非哪种输入管道能产生最高的整体筛选性能。

生物医学NLP基准在标签变异下的可靠性最近受到了关注(Plank 2022 (https://arxiv.org/html/2607.21685#bib.bib13));本文将这一关注扩展到评估设计变异。我们展示了一个广泛引用的基准结果在经典评估的某些扰动下是稳定的,而在其他扰动下则不稳定,并且这种不稳定性一直不可见,因为该领域一直将经典设计保留为默认设置。

基于MeSH的特征增强作为本体驱动特征工程的一个实例,出现在更广泛的文本分类文献中。词汇语义学中的符号学与名称学区分(Baldinger 1980 (https://arxiv.org/html/2607.21685#bib.bib16);Geeraerts 2010 (https://arxiv.org/html/2607.21685#bib.bib17)),源于索绪尔(1959 (https://arxiv.org/html/2607.21685#bib.bib18)),描述了词汇访问的两个方向,而分布语义学(Harris 1954 (https://arxiv.org/html/2607.21685#bib.bib19);Sahlgren 2008 (https://arxiv.org/html/2607.21685#bib.bib20);Lenci 2018 (https://arxiv.org/html/2607.21685#bib.bib21))为词袋方法提供了理论基础。这种区分是否映射到机械与专家对比上,是经典设计Statins发现的一种解释框架;由于本实验未对其进行检验,我们将其推迟到第5.2节 (https://arxiv.org/html/2607.21685#S5.SS2)讨论。

生物医学Transformer模型(Gu等人 2021 (https://arxiv.org/html/2607.21685#bib.bib7);Lee等人 2020 (https://arxiv.org/html/2607.21685#bib.bib8);Yasunaga等人 2022 (https://arxiv.org/html/2607.21685#bib.bib9))在PubMed摘要上进行了预训练,并在包括BLURB套件在内的生物医学NLP基准上取得了最先进的结果。我们使用BiomedBERT(而非BioBERT、BioLinkBERT或ClinicalBERT),因为BLURB基准测试显示BiomedBERT-base在相同参数规模下优于其他选择(Gu等人 2021 (https://arxiv.org/html/2607.21685#bib.bib7)),而且我们的比较并非旨在确定最强的筛选架构;我们需要一个领域预训练的上下文Transformer,且微调成本可控。它们用于系统评价筛选的研究不如用于生物医学问答或命名实体识别那样充分。我们使用BiomedBERT作为一座桥梁,从受控的词袋实验过渡到更接近当前筛选实践的表示。

## 3. 方法

### 3.1 基准和主题选择

我们使用Cohen等人(2006 (https://arxiv.org/html/2607.21685#bib.bib1))基准中的三个药物类别主题:Statins、Opioids和ADHD。该基准提供了来自已完成系统评价的PubMed标识符和纳入标签。文章文本和MeSH词通过NCBI Entrez API获取,并在本地缓存以确保可复现性。表1 (https://arxiv.org/html/2607.21685#S3.T1) 总结了各主题的特征。

**表1:本研究使用的Cohen药物类别主题。**  
三个主题的纳入率不同,涉及的临床领域也不同(心血管、镇痛、行为)。Statins主题在筛选文献中研究最多,并已被几篇后续论文用作主要参考。Opioids和ADHD在语料规模和纳入率上都与Statins不同,在先前工作已证明影响分类器性能的维度上提供了跨主题变异(Cohen 2008 (https://arxiv.org/html/2607.21685#bib.bib2);Matwin等人 2010 (https://arxiv.org/html/2607.21685#bib.bib3))。Cohen基准结构为每个主题分配了其原始规模,文献中一直保留这一惯例;我们在主要比较中遵循它,并在稳健性分析(第3.6节 (https://arxiv.org/html/2607.21685#S3.SS6))中明确放宽它。

### 3.2 文本模式

每篇文章以四种替代输入形式表示:

1. **abstract**:仅摘要文本。
2. **title_abstract**:文章标题与摘要拼接。
3. **title_abstract_mesh**:标题加摘要加专家分配的MeSH词(来自PubMed索引器),以空格分隔的令牌形式拼接。
4. **auto_mesh**:摘要加机械分配的MeSH词,其中分配使用不区分大小写的子串匹配,将MeSH词头与一个主题级词汇表进行匹配,该词汇表由该主题缓存记录中观察到的所有MeSH词的并集构建而成。

模式1和2建立了没有MeSH增强的基线性能。模式3和4实现了核心操作:两者都用MeSH词汇表增强了文本,但模式3使用专家分配,模式4使用机械分配。模式4中的MeSH词汇表是基于主题特定缓存构建的,而非完整的MeSH词库,这种构建方式使比较变得公平。两种模式都从相同的可用MeSH词集合中提取,但分配机制不同。

### 3.3 分类器

词袋管道...

相似文章

生物医学二分类中不平衡处理方法的系统评估

arXiv cs.LG

本文系统评估了五种不平衡处理方法(RUS、ROS、SMOTE、重加权、直接F1优化)在三个生物医学数据集(表格、文本、图像)上使用不同复杂度模型的效果。结果表明,收益取决于模型复杂度和数据模态,其中ROS、重加权和直接F1优化对非结构化数据上的复杂模型有效。

GENEB:为何基因组模型难以相互比较

arXiv cs.CL

GENEB 是一个大规模诊断基准,在统一的探测协议下,跨 13 个功能类别的 100 项任务对 40 个基因组基础模型进行评估。研究结果揭示了综合排行榜的不稳定性,以及架构匹配度往往比模型规模更具决定性影响。该工作旨在解决基因组机器学习领域评估体系碎片化的问题,类似于 MTEB 在 NLP 领域所做的工作。

AutoMedBench:迈向基于智能体AI模型的医学自动研究

Hugging Face Daily Papers

AutoMedBench是一个面向自主医学AI研究工作流的基准测试,评估智能体在五个阶段中处理多种医学影像任务的表现。阶段级评分显示,验证阶段最弱,凸显了智能体工作流中可靠验证的必要性。