用于LLM辅助系统综述筛选的辅助不确定性信号:一项跨八项Cohen药物类别综述的基准研究
摘要
本文对基于BERT+GCN分类器的辅助不确定性信号进行基准测试,以提高LLM辅助系统综述筛选的效率。研究表明,针对性地仅路由MAYBE结果可在接近基线的成本下实现效率最大化。
arXiv:2608.14551v1 公告类型:新增
摘要:大语言模型(LLMs)越来越多地被用于系统综述的标题摘要筛选,但其决策缺乏校准后的不确定性。我们证明,一个辅助的BERT+GCN分类器可以提供结构化的不确定性信号,从而提高LLM筛选效率,并且我们确定了能使效益成本比最大化的提示传递策略。
我们在Cohen (2006)基准的八个药物类别数据集上评估了五种LLM提示传递条件,使用了3个种子 × 5折分层交叉验证(共600个折级结果)。一个按折训练的BERT+GCN模型通过两个谱检验(代数根和分类悖论)将每篇测试论文分类为INCLUDE、EXCLUDE或MAYBE。条件在信息内容(无/标签/完整分数)、选择性(所有论文 vs. 仅MAYBE)和时机(主动 vs. 反应式两轮)上有所不同。针对gpt-4.1-mini在三个数据集上进行的跨模型试点测试了跨代迁移能力。
三个发现:(i)完整上下文传递在F1值(+0.011,配对Wilcoxon检验p=0.008)和WSS@95(+0.050,p=0.039)上带来显著增益,token成本溢价为1.28倍,同时保持了召回率。(ii)仅MAYBE路由是帕累托最优的:在仅1.05倍基线成本(仅为完整上下文开销的六分之一)下,实现了最高平均召回率(0.92)和AUC-ROC(0.54)。(iii)两轮设计将22.2% ± 8.8%的记录升级处理,但从未修改其决定(所有数据集和折的翻转率为0%),这为当前指令微调LLM无法进行自我分流提供了决定性证据。跨模型试点显示,两代LLM的召回率提升幅度相同,均为+0.8%。一项针对20,796个观察结果的逐篇论文消融研究表明,双悖论检验实际上可简化为单行logit间隔标准。我们发布了完整流程;从缓存的LLM响应重播600次实验耗时不到一小时。
查看缓存全文
缓存时间: 2026/08/18 09:42
# 辅助不确定性信号用于大语言模型辅助的系统评价筛选:基于八项Cohen药物类别评价的基准测试 来源:https://arxiv.org/html/2608.14551 Arya Rahgozar<sup>1,2</sup> Pouria Mortezaagha<sup>1,2</sup> <sup>1</sup>渥太华大学,加拿大渥太华 <sup>2</sup>渥太华医院研究所,加拿大渥太华 [email protected], [email protected] ###### 摘要 **背景.** 大语言模型(LLMs)在系统评价的标题-摘要筛选中应用日益广泛,但其决策缺乏校准的不确定性,使评价者无法通过有原则的方式将模糊文献转交给人工处理。我们证明,一个辅助的BERT+GCN分类器能够提供结构化的不确定性信号,从而显著提高LLM筛选效率,并确定了最大化效益成本比的提示交付策略。 **方法.** 我们使用3个种子×5层分层交叉验证(共600个折级结果),在Cohen(2006)基准集合的8个药物类别数据集上评估了五种LLM提示交付条件。每折训练一个混合BERT+GCN模型,并通过两种频谱测试(代数根测试和分类悖论测试)将每篇测试文献分类为INCLUDE、EXCLUDE或MAYBE。五种条件为:(i)基线(仅标题+摘要),(ii)全频谱上下文(所有文献的标签+分数),(iii)仅决策(所有文献的分类标签),(iv)*仅MAYBE*(仅当BERT+GCN将文献标记为不确定时附加频谱上下文),以及(v)两轮流程(仅当LLM首轮回复包含模糊语言时附加频谱上下文)。一项针对早期模型(gpt-4.1-minion,三个数据集)的预注册跨模型试点测试了频谱收益是否能在不同LLM代际间迁移。 **结果.** 三项发现为实践提供了指导:(i)全上下文交付使F1值(Δ=+0.011,配对Wilcoxon检验 p=0.008)和95%召回率下的工作节省量(WSS@95)(Δ=+0.050,p=0.039)相对于基线获得统计显著提升,同时token成本溢价为1.28倍,并保持召回率(所有条件 p≥0.12)。(ii)*仅MAYBE路由是帕累托最优配置*:其平均召回率最高(0.92,所有条件中最佳),平均AUC-ROC最高(0.54),仅需基线成本的1.05倍——仅为全上下文交付API开销的六分之一。(iii)两轮设计对22.2%±8.8%的记录进行了升级,但*从未*修改其初始决策(所有数据集和折中翻转率为0%),这为当前经过指令调优的LLM无法进行自我分流提供了决定性经验证据——一个排除整类流程设计的明确阴性结果。跨模型试点显示,两代LLM均获得相同的+0.8%召回率提升,强化了BERT+GCN信号作为稳定、模型无关辅助分类器的解释,其收益*不会*随着基础LLM能力的增强而消失。作为方法论的副产品,对20,796个观察值的逐文献消融研究表明,双重悖论测试在该基准上可简化为一行逻辑间隔标准,方便了任何从业者的重新实现。 **结论.** 当将其输出提供给LLM筛选器时,辅助的BERT+GCN不确定性分类器能带来可测量的F1和WSS@95收益,而*针对性的*仅MAYBE路由能以接近基线的API成本捕获这些收益。我们还贡献了一个可复现的600次运行基准、一个终结两轮LLM自我分流设计的明确阴性结果,以及一个可从缓存的LLM响应中在不到一小时内重放的公开发布流程。所有代码、提示、数据集和原始折级结果均已公开发布。 **关键词:** 系统评价,文献筛选,大语言模型,不确定性量化,BERT+GCN,抽样节省工作量,定向提示,成本高效筛选,TRIPOD-LLM,可复现AI ## 1 引言 系统评价是医疗保健领域证据综合的金标准,然而筛选阶段——仅根据标题和摘要决定哪些文献值得全文评审——仍然是一个主要瓶颈。一项评价可能需要筛选数千至数万条记录,消耗数百小时的专家时间(Higgins等人,2019)。 大语言模型(LLMs)最近作为自动化筛选器显示出潜力(Guo等人,2024;Wang等人,2024),在基准数据集上取得了有竞争力的召回率。然而,LLM的决策没有校准的置信度:一个用模糊语言说“包含”(“这可能相关”)的模型,在后续行动上与一个确定的模型无法区分。这种结构化不确定性的缺失导致了两个实际问题:(1)评价者难以轻松识别哪些LLM决策需要人工验证;(2)当LLM自身的评估模糊时,它没有机制请求额外证据。 我们通过提供LLM*结构化不确定性上下文*来解决这些局限性,该上下文源自一个专门为本研究实施的BERT+GCN频谱分析流程。该流程将每篇文献预分类为INCLUDE、EXCLUDE或MAYBE,其中MAYBE标签通过两个互补测试检测到的分类器不确定性: 1. 1. **代数根测试**:模型包含与排除logits之间的差距低于阈值 ∥P(Include)−P(Exclude)∥<ε,表明分类器本身不确定。 2. 2. **分类悖论测试**:BERT(内容)和GCN(关系)嵌入之间的余弦相似度较低,表明文献的文本内容与其引文/相似邻域对其相关性的判断不一致。 我们研究了五种实验条件,它们为LLM提供的频谱上下文的量和类型不同: 1. 1. **基线**:仅标题和摘要——无频谱信息。 2. 2. **全频谱**:标题、摘要和所有频谱分数(置信度差距、模型置信度、悖论类型)。 3. 3. **仅决策**:标题、摘要和频谱标签(INCLUDE/EXCLUDE/MAYBE),无数值分数。 4. 4. **仅MAYBE**:对分类为MAYBE的文献提供完整频谱上下文;对其他所有文献使用基线提示。 5. 5. **两轮流程**:首先使用基线提示;如果LLM表现出不确定性(低置信度或模糊语言),第二轮提供频谱上下文。 这五种条件沿三个维度进行了系统性消融:*信息内容*(无上下文→仅标签→完整分数),*选择性*(所有文献 vs. 仅MAYBE),以及*时机*(主动 vs. 反应性两轮)。 #### 贡献. 本文提供了关于*如何*使用辅助BERT+GCN不确定性分类器作为LLM辅助筛选工具的实用、可复现的评估,具体贡献包括五点: - **帕累托最优交付策略**。我们确定*仅MAYBE路由*是成本敏感部署的推荐配置:它在仅1.05倍基线API成本下,达到了所有条件中最高的平均召回率(0.92)和AUC-ROC(0.54),以全上下文交付六分之一的开销捕获了频谱收益。 - **量化全频谱上下文的收益**。我们报告了当向LLM提供完整频谱分数时,F1(+0.011,配对Wilcoxon检验 p=0.008)和WSS@95(+0.050,p=0.039)的统计显著改善,同时伴随着明确的1.28倍成本溢价。 - **反对两轮LLM自我分流的决定性证据**。两轮设计对22%的文献进行升级,但在所有数据集、种子和折中翻转了0.0%的决策。这一明确的阴性结果排除了一类架构,并节省了从业者重新发现该局限性的成本。 - **跨代际可迁移性**。一项试点比较发现,早期一代和当前一代LLM均获得相同的+0.8%召回率提升,支持BERT+GCN信号作为一个稳定的、与模型无关的辅助分类器,其收益*不会*随着基础LLM能力的增长而消失。 - **可复现的开放实现**。我们发布了BERT+GCN流程、所有提示模板、一个具有磁盘支持的LLM响应缓存和折级恢复功能的实验运行器、一个能生成本文精确表格的确定性分析器,以及一个包含130个测试的套件(采用宽松许可证)。完整的600次运行实验可以从缓存响应中在不到一小时内重放。 ## 2 相关工作 ### 2.1 用于系统评价筛选的LLMs 近期工作探索了GPT-4、Claude和开源LLMs用于标题-摘要筛选(Guo等人,2024;Wang等人,2024;Alshami等人,2023;Tran等人,2024)。这些研究证明了有竞争力的召回率,但通常报告低特异性,并且缺乏有原则的不确定性处理。Khraisha等人(2024)提供了LLM筛选的系统性评估,发现提示工程显著影响性能;Tran等人(2024)报告的敏感性/特异性范围与我们的基线重叠(在Cohen风格基准上召回率约为0.91)。主动学习筛选器如ASReview(van de Schoot等人,2021)以及Ferdinands等人(2023)的扩展评估提供了一个互补的、非LLM基线。我们的工作不同之处在于,我们为LLM提供了一个来自专用分类器的*外部*不确定性信号,并确定了交付该信号的成本最优方式。 ### 2.2 LLMs中的不确定性量化 LLM置信度的校准研究通过语言化不确定性(Xiong等人,2024)、token级概率(Kadavath等人,2022)和集成方法(Lakshminarayanan等人,2017)进行。大多数方法需要对模型内部进行白盒访问。我们采取了一种互补的方法:我们不是估计LLM自身的不确定性,而是向其提供来自独立的、专用分类模型的不确定性估计。 ### 2.3 工具增强的LLMs 工具增强的LLMs(Schick等人,2023;Qin等人,2023)利用外部工具来弥补语言模型本身的局限性。检索增强生成(RAG)提供事实依据(Lewis等人,2020),而思维链提示(Wei等人,2022)鼓励结构化推理。我们的频谱上下文可以被视为一种专门工具,为LLM提供了来自领域特定模型的结构化“第二意见”。 ### 2.4 用于文本分类的频谱方法 频谱图分析已通过图神经网络应用于文本分类(Kipf和Welling,2017;Yao等人,2019),包括BERT+GCN混合架构(Lin等人,2021)。利用频谱间隙检测分类模糊性借鉴了代数图论(Chung,1997)。本文的贡献不是提出新的频谱方法,而是实证评估*如何部署*此类分类器作为LLM筛选器的辅助信号,重点是替代提示交付策略的效益成本权衡。 ## 3 背景:频谱悖论检测 本节概述生成用作LLM上下文的不确定性信号的BERT+GCN频谱分析流程。完整实现(包括训练脚本、配置文件和第6.6节中使用的分类器消融)随本文发布(参见数据和材料可用性)。 ### 3.1 BERT+GCN架构 每篇文献由其标题和摘要的BERT嵌入(使用PubMedBERT;Gu等人,2021)以及在k近邻相似度图(可选引文边)上学习到的GCN嵌入表示。该架构使用关系图卷积(RGCNConv;Schlichtkrull等人,2018)为相似度和引文边类型学习单独的权重矩阵。模型以半监督方式训练:MAYBE和未标记的文献参与消息传递,但被排除在损失函数之外。 ### 3.2 代数根测试 设 z ∈ ℝ² 为某篇文献的输出logits,p = softmax(z)。定义*迹比* τ = ∥p<sub>include</sub> − p<sub>exclude</sub>∥。当 τ < ε(默认 ε=0.15)时,文献被标记为代数模糊,意味着分类器无法自信地区分包含和排除。 ### 3.3 分类悖论测试 设 **b** 和 **g** 分别为BERT和GCN嵌入。当余弦相似度 cos(**b**, **g**) < δ(默认 δ=0.0)时,检测到分类悖论,表明文献的文本内容与其关系上下文(相似度/引文图中的邻域)编码了矛盾的信号。 ### 3.4 三态分类 频谱引擎将每篇文献分配到以下三种状态之一: - **INCLUDE**:对相关性有高度置信度(未检测到悖论)。 - **EXCLUDE**:对非相关性有高度置信度(未检测到悖论)。 - **MAYBE**:一个或多个悖论测试被触发——该文献需要进一步审查。 ## 4 方法 图1展示了整体流程。BERT+GCN模型针对每个(数据集,种子,折)划分进行训练,生成频谱分类结果。然后根据五种条件之一将其注入LLM提示中。 请参阅标题图1:流程概述。文献通过冻结的PubMedBERT嵌入和在kNN相似度图上的2层RGCNConv进行编码。频谱引擎应用两种互补的不确定性测试(代数根测试和分类悖论测试)将每篇文献分类为INCLUDE、EXCLUDE或MAYBE。一个与条件相关的交付策略决定了哪些频谱信息(如果有的话)被注入LLM提示。五种条件沿三个维度变化:信息内容(无、仅标签、完整分数)、选择性(所有文献 vs. 仅MAYBE)和时机(主动 vs. 反应性两轮)。LLM筛选器产生带有置信度和推理的二元决策。 ### 4.1 实验条件 我们评估了五种为LLM筛选器提供不同频谱上下文的条件。表1总结了这些条件。 表1:五种实验条件的总结。“频谱上下文”表示来自BERT+GCN流程的哪些信息被包含在LLM提示中。
相似文章
当证据冲突时:检索增强生物医学问答中的不确定性与顺序效应
本文在冲突证据条件下评估了六个开放权重的大语言模型在生物医学问答中的表现,揭示了准确率下降和预测翻转,并提出了一个冲突感知的弃权评分,提高了选择性准确率。
不确定性引导的LLM语义增强用于异质性治疗效果估计
本文提出CURL,一种即插即用适配器,利用估计器不确定性分配预训练LLM的语义能力,以改进异质性治疗效果(CATE)估计。它引入两种角色调节的提示,构建面向分配和异质性的表示,在四个基准上提升了十个宿主学习器的性能。
TriageRA-CCF:面向自适应秩预算的源端临床置信度与覆盖信号(用于医学大语言模型)
本文提出TriageRA-CCF,一种用于医学问答中LoRA自适应秩预算的方法。它利用源端信号(基座模型置信度、临床覆盖、反事实代理)动态选择秩预算,在Qwen3-8B和Llama3.1-8B上取得了适度的准确率提升。
评估设计制约专家与自动MeSH差距:在Cohen基准上对词袋模型和BiomedBERT的受控比较
本文比较了专家分配和自动分配的MeSH术语作为系统综述筛选分类器特征的效果,表明评估设计显著影响测量的性能差距,规范设计显示较大差距,而在替代设计下差距减小。
可能还是确定?评估临床文本中诊断不确定性保持能力的基准
本文介绍了一个包含1,200份临床文档和9,184条不确定性标注的基准,用于评估LLMs是否能在临床文本中保持诊断不确定性,结果发现LLMs常常无法保留原始不确定性线索,且在细微区别上表现不佳。