用于LLM辅助系统综述筛选的辅助不确定性信号:一项跨八项Cohen药物类别综述的基准研究

arXiv cs.CL 论文

摘要

本文对基于BERT+GCN分类器的辅助不确定性信号进行基准测试,以提高LLM辅助系统综述筛选的效率。研究表明,针对性地仅路由MAYBE结果可在接近基线的成本下实现效率最大化。

arXiv:2608.14551v1 公告类型:新增 摘要:大语言模型(LLMs)越来越多地被用于系统综述的标题摘要筛选,但其决策缺乏校准后的不确定性。我们证明,一个辅助的BERT+GCN分类器可以提供结构化的不确定性信号,从而提高LLM筛选效率,并且我们确定了能使效益成本比最大化的提示传递策略。 我们在Cohen (2006)基准的八个药物类别数据集上评估了五种LLM提示传递条件,使用了3个种子 × 5折分层交叉验证(共600个折级结果)。一个按折训练的BERT+GCN模型通过两个谱检验(代数根和分类悖论)将每篇测试论文分类为INCLUDE、EXCLUDE或MAYBE。条件在信息内容(无/标签/完整分数)、选择性(所有论文 vs. 仅MAYBE)和时机(主动 vs. 反应式两轮)上有所不同。针对gpt-4.1-mini在三个数据集上进行的跨模型试点测试了跨代迁移能力。 三个发现:(i)完整上下文传递在F1值(+0.011,配对Wilcoxon检验p=0.008)和WSS@95(+0.050,p=0.039)上带来显著增益,token成本溢价为1.28倍,同时保持了召回率。(ii)仅MAYBE路由是帕累托最优的:在仅1.05倍基线成本(仅为完整上下文开销的六分之一)下,实现了最高平均召回率(0.92)和AUC-ROC(0.54)。(iii)两轮设计将22.2% ± 8.8%的记录升级处理,但从未修改其决定(所有数据集和折的翻转率为0%),这为当前指令微调LLM无法进行自我分流提供了决定性证据。跨模型试点显示,两代LLM的召回率提升幅度相同,均为+0.8%。一项针对20,796个观察结果的逐篇论文消融研究表明,双悖论检验实际上可简化为单行logit间隔标准。我们发布了完整流程;从缓存的LLM响应重播600次实验耗时不到一小时。
查看原文
查看缓存全文

缓存时间: 2026/08/18 09:42

# 辅助不确定性信号用于大语言模型辅助的系统评价筛选:基于八项Cohen药物类别评价的基准测试
来源:https://arxiv.org/html/2608.14551
Arya Rahgozar<sup>1,2</sup> Pouria Mortezaagha<sup>1,2</sup>
<sup>1</sup>渥太华大学,加拿大渥太华 <sup>2</sup>渥太华医院研究所,加拿大渥太华
[email protected], [email protected]

###### 摘要

**背景.** 大语言模型(LLMs)在系统评价的标题-摘要筛选中应用日益广泛,但其决策缺乏校准的不确定性,使评价者无法通过有原则的方式将模糊文献转交给人工处理。我们证明,一个辅助的BERT+GCN分类器能够提供结构化的不确定性信号,从而显著提高LLM筛选效率,并确定了最大化效益成本比的提示交付策略。

**方法.** 我们使用3个种子×5层分层交叉验证(共600个折级结果),在Cohen(2006)基准集合的8个药物类别数据集上评估了五种LLM提示交付条件。每折训练一个混合BERT+GCN模型,并通过两种频谱测试(代数根测试和分类悖论测试)将每篇测试文献分类为INCLUDE、EXCLUDE或MAYBE。五种条件为:(i)基线(仅标题+摘要),(ii)全频谱上下文(所有文献的标签+分数),(iii)仅决策(所有文献的分类标签),(iv)*仅MAYBE*(仅当BERT+GCN将文献标记为不确定时附加频谱上下文),以及(v)两轮流程(仅当LLM首轮回复包含模糊语言时附加频谱上下文)。一项针对早期模型(gpt-4.1-minion,三个数据集)的预注册跨模型试点测试了频谱收益是否能在不同LLM代际间迁移。

**结果.** 三项发现为实践提供了指导:(i)全上下文交付使F1值(Δ=+0.011,配对Wilcoxon检验 p=0.008)和95%召回率下的工作节省量(WSS@95)(Δ=+0.050,p=0.039)相对于基线获得统计显著提升,同时token成本溢价为1.28倍,并保持召回率(所有条件 p≥0.12)。(ii)*仅MAYBE路由是帕累托最优配置*:其平均召回率最高(0.92,所有条件中最佳),平均AUC-ROC最高(0.54),仅需基线成本的1.05倍——仅为全上下文交付API开销的六分之一。(iii)两轮设计对22.2%±8.8%的记录进行了升级,但*从未*修改其初始决策(所有数据集和折中翻转率为0%),这为当前经过指令调优的LLM无法进行自我分流提供了决定性经验证据——一个排除整类流程设计的明确阴性结果。跨模型试点显示,两代LLM均获得相同的+0.8%召回率提升,强化了BERT+GCN信号作为稳定、模型无关辅助分类器的解释,其收益*不会*随着基础LLM能力的增强而消失。作为方法论的副产品,对20,796个观察值的逐文献消融研究表明,双重悖论测试在该基准上可简化为一行逻辑间隔标准,方便了任何从业者的重新实现。

**结论.** 当将其输出提供给LLM筛选器时,辅助的BERT+GCN不确定性分类器能带来可测量的F1和WSS@95收益,而*针对性的*仅MAYBE路由能以接近基线的API成本捕获这些收益。我们还贡献了一个可复现的600次运行基准、一个终结两轮LLM自我分流设计的明确阴性结果,以及一个可从缓存的LLM响应中在不到一小时内重放的公开发布流程。所有代码、提示、数据集和原始折级结果均已公开发布。

**关键词:** 系统评价,文献筛选,大语言模型,不确定性量化,BERT+GCN,抽样节省工作量,定向提示,成本高效筛选,TRIPOD-LLM,可复现AI

## 1 引言

系统评价是医疗保健领域证据综合的金标准,然而筛选阶段——仅根据标题和摘要决定哪些文献值得全文评审——仍然是一个主要瓶颈。一项评价可能需要筛选数千至数万条记录,消耗数百小时的专家时间(Higgins等人,2019)。

大语言模型(LLMs)最近作为自动化筛选器显示出潜力(Guo等人,2024;Wang等人,2024),在基准数据集上取得了有竞争力的召回率。然而,LLM的决策没有校准的置信度:一个用模糊语言说“包含”(“这可能相关”)的模型,在后续行动上与一个确定的模型无法区分。这种结构化不确定性的缺失导致了两个实际问题:(1)评价者难以轻松识别哪些LLM决策需要人工验证;(2)当LLM自身的评估模糊时,它没有机制请求额外证据。

我们通过提供LLM*结构化不确定性上下文*来解决这些局限性,该上下文源自一个专门为本研究实施的BERT+GCN频谱分析流程。该流程将每篇文献预分类为INCLUDE、EXCLUDE或MAYBE,其中MAYBE标签通过两个互补测试检测到的分类器不确定性:

1. 1. **代数根测试**:模型包含与排除logits之间的差距低于阈值 ∥P(Include)−P(Exclude)∥<ε,表明分类器本身不确定。
2. 2. **分类悖论测试**:BERT(内容)和GCN(关系)嵌入之间的余弦相似度较低,表明文献的文本内容与其引文/相似邻域对其相关性的判断不一致。

我们研究了五种实验条件,它们为LLM提供的频谱上下文的量和类型不同:

1. 1. **基线**:仅标题和摘要——无频谱信息。
2. 2. **全频谱**:标题、摘要和所有频谱分数(置信度差距、模型置信度、悖论类型)。
3. 3. **仅决策**:标题、摘要和频谱标签(INCLUDE/EXCLUDE/MAYBE),无数值分数。
4. 4. **仅MAYBE**:对分类为MAYBE的文献提供完整频谱上下文;对其他所有文献使用基线提示。
5. 5. **两轮流程**:首先使用基线提示;如果LLM表现出不确定性(低置信度或模糊语言),第二轮提供频谱上下文。

这五种条件沿三个维度进行了系统性消融:*信息内容*(无上下文→仅标签→完整分数),*选择性*(所有文献 vs. 仅MAYBE),以及*时机*(主动 vs. 反应性两轮)。

#### 贡献.

本文提供了关于*如何*使用辅助BERT+GCN不确定性分类器作为LLM辅助筛选工具的实用、可复现的评估,具体贡献包括五点:

- **帕累托最优交付策略**。我们确定*仅MAYBE路由*是成本敏感部署的推荐配置:它在仅1.05倍基线API成本下,达到了所有条件中最高的平均召回率(0.92)和AUC-ROC(0.54),以全上下文交付六分之一的开销捕获了频谱收益。
- **量化全频谱上下文的收益**。我们报告了当向LLM提供完整频谱分数时,F1(+0.011,配对Wilcoxon检验 p=0.008)和WSS@95(+0.050,p=0.039)的统计显著改善,同时伴随着明确的1.28倍成本溢价。
- **反对两轮LLM自我分流的决定性证据**。两轮设计对22%的文献进行升级,但在所有数据集、种子和折中翻转了0.0%的决策。这一明确的阴性结果排除了一类架构,并节省了从业者重新发现该局限性的成本。
- **跨代际可迁移性**。一项试点比较发现,早期一代和当前一代LLM均获得相同的+0.8%召回率提升,支持BERT+GCN信号作为一个稳定的、与模型无关的辅助分类器,其收益*不会*随着基础LLM能力的增长而消失。
- **可复现的开放实现**。我们发布了BERT+GCN流程、所有提示模板、一个具有磁盘支持的LLM响应缓存和折级恢复功能的实验运行器、一个能生成本文精确表格的确定性分析器,以及一个包含130个测试的套件(采用宽松许可证)。完整的600次运行实验可以从缓存响应中在不到一小时内重放。

## 2 相关工作

### 2.1 用于系统评价筛选的LLMs

近期工作探索了GPT-4、Claude和开源LLMs用于标题-摘要筛选(Guo等人,2024;Wang等人,2024;Alshami等人,2023;Tran等人,2024)。这些研究证明了有竞争力的召回率,但通常报告低特异性,并且缺乏有原则的不确定性处理。Khraisha等人(2024)提供了LLM筛选的系统性评估,发现提示工程显著影响性能;Tran等人(2024)报告的敏感性/特异性范围与我们的基线重叠(在Cohen风格基准上召回率约为0.91)。主动学习筛选器如ASReview(van de Schoot等人,2021)以及Ferdinands等人(2023)的扩展评估提供了一个互补的、非LLM基线。我们的工作不同之处在于,我们为LLM提供了一个来自专用分类器的*外部*不确定性信号,并确定了交付该信号的成本最优方式。

### 2.2 LLMs中的不确定性量化

LLM置信度的校准研究通过语言化不确定性(Xiong等人,2024)、token级概率(Kadavath等人,2022)和集成方法(Lakshminarayanan等人,2017)进行。大多数方法需要对模型内部进行白盒访问。我们采取了一种互补的方法:我们不是估计LLM自身的不确定性,而是向其提供来自独立的、专用分类模型的不确定性估计。

### 2.3 工具增强的LLMs

工具增强的LLMs(Schick等人,2023;Qin等人,2023)利用外部工具来弥补语言模型本身的局限性。检索增强生成(RAG)提供事实依据(Lewis等人,2020),而思维链提示(Wei等人,2022)鼓励结构化推理。我们的频谱上下文可以被视为一种专门工具,为LLM提供了来自领域特定模型的结构化“第二意见”。

### 2.4 用于文本分类的频谱方法

频谱图分析已通过图神经网络应用于文本分类(Kipf和Welling,2017;Yao等人,2019),包括BERT+GCN混合架构(Lin等人,2021)。利用频谱间隙检测分类模糊性借鉴了代数图论(Chung,1997)。本文的贡献不是提出新的频谱方法,而是实证评估*如何部署*此类分类器作为LLM筛选器的辅助信号,重点是替代提示交付策略的效益成本权衡。

## 3 背景:频谱悖论检测

本节概述生成用作LLM上下文的不确定性信号的BERT+GCN频谱分析流程。完整实现(包括训练脚本、配置文件和第6.6节中使用的分类器消融)随本文发布(参见数据和材料可用性)。

### 3.1 BERT+GCN架构

每篇文献由其标题和摘要的BERT嵌入(使用PubMedBERT;Gu等人,2021)以及在k近邻相似度图(可选引文边)上学习到的GCN嵌入表示。该架构使用关系图卷积(RGCNConv;Schlichtkrull等人,2018)为相似度和引文边类型学习单独的权重矩阵。模型以半监督方式训练:MAYBE和未标记的文献参与消息传递,但被排除在损失函数之外。

### 3.2 代数根测试

设 z ∈ ℝ² 为某篇文献的输出logits,p = softmax(z)。定义*迹比* τ = ∥p<sub>include</sub> − p<sub>exclude</sub>∥。当 τ < ε(默认 ε=0.15)时,文献被标记为代数模糊,意味着分类器无法自信地区分包含和排除。

### 3.3 分类悖论测试

设 **b** 和 **g** 分别为BERT和GCN嵌入。当余弦相似度 cos(**b**, **g**) < δ(默认 δ=0.0)时,检测到分类悖论,表明文献的文本内容与其关系上下文(相似度/引文图中的邻域)编码了矛盾的信号。

### 3.4 三态分类

频谱引擎将每篇文献分配到以下三种状态之一:

- **INCLUDE**:对相关性有高度置信度(未检测到悖论)。
- **EXCLUDE**:对非相关性有高度置信度(未检测到悖论)。
- **MAYBE**:一个或多个悖论测试被触发——该文献需要进一步审查。

## 4 方法

图1展示了整体流程。BERT+GCN模型针对每个(数据集,种子,折)划分进行训练,生成频谱分类结果。然后根据五种条件之一将其注入LLM提示中。

请参阅标题图1:流程概述。文献通过冻结的PubMedBERT嵌入和在kNN相似度图上的2层RGCNConv进行编码。频谱引擎应用两种互补的不确定性测试(代数根测试和分类悖论测试)将每篇文献分类为INCLUDE、EXCLUDE或MAYBE。一个与条件相关的交付策略决定了哪些频谱信息(如果有的话)被注入LLM提示。五种条件沿三个维度变化:信息内容(无、仅标签、完整分数)、选择性(所有文献 vs. 仅MAYBE)和时机(主动 vs. 反应性两轮)。LLM筛选器产生带有置信度和推理的二元决策。

### 4.1 实验条件

我们评估了五种为LLM筛选器提供不同频谱上下文的条件。表1总结了这些条件。

表1:五种实验条件的总结。“频谱上下文”表示来自BERT+GCN流程的哪些信息被包含在LLM提示中。

相似文章

不确定性引导的LLM语义增强用于异质性治疗效果估计

arXiv cs.LG

本文提出CURL,一种即插即用适配器,利用估计器不确定性分配预训练LLM的语义能力,以改进异质性治疗效果(CATE)估计。它引入两种角色调节的提示,构建面向分配和异质性的表示,在四个基准上提升了十个宿主学习器的性能。