在系统综述中基于LLM的筛选中的类别不平衡和批量效应
摘要
本研究探讨了类别不平衡和批处理如何影响系统综述中基于LLM的筛选,揭示了批处理显著改变了决策行为,而流行率元数据的影响微乎其微。
arXiv:2608.14737v1 公告类型:新
摘要:本研究分析了LLMs在不平衡二分类中的应用,以系统综述中的研究筛选作为应用领域。在五个综述中进行实验,比较个体和批处理方式,有无流行率元数据。结果表明,流行率元数据的影响有限,没有证据表明它能提高性能。相比之下,批处理产生了较大的行为变化,这些变化根据类别的流行率而变化。聚合分析和项目级分析并不总是吻合。因此,批处理不仅应在成本方面进行评估,还应考虑其对决策行为的影响。
查看缓存全文
缓存时间: 2026/08/18 09:50
# 基于大语言模型的系统评价筛选中的类别不平衡与批处理效应 来源:https://arxiv.org/html/2608.14737 ###### 摘要 本研究分析了大语言模型在失衡二元分类任务中的表现,以系统评价中的研究筛选作为应用领域。实验在五篇系统评价中进行,比较了单独处理与批处理模式,以及是否提供患病率元数据的效果。结果表明,患病率元数据的影响有限,没有证据表明它能改善性能。相比之下,批处理引发了更大的行为变化,且这种变化随类别患病率而异。聚合分析与逐项分析的结果并不总是一致。因此,评估批处理时不仅要考虑成本,还应考虑其对决策行为的影响。 本文为作者版本,已被ENIAC 2026(巴西计算机科学会议(BRACIS 2026)的一部分,即国家人工智能与计算智能会议)接收。最终版本将由巴西计算机学会(SBC)在会议论文集中出版。 ## 1引言 系统文献综述(SLRs)已成为软件工程领域的一项核心实践[11 (https://arxiv.org/html/2608.14737#bib.bib1)]。随着出版物数量的增长[2 (https://arxiv.org/html/2608.14737#bib.bib2)],标题和摘要筛选阶段的成本越来越高,需要对数百到数千条记录进行分类[3 (https://arxiv.org/html/2608.14737#bib.bib3)]。大语言模型(LLMs)已被探索用于辅助这项任务[8 (https://arxiv.org/html/2608.14737#bib.bib4),22 (https://arxiv.org/html/2608.14737#bib.bib5),9 (https://arxiv.org/html/2608.14737#bib.bib6)],在整体性能上显示出有希望的结果,但对于其在操作性筛选特征下的决策行为,理解仍然有限。 其中两个特征在方法论上至关重要。首先是类别不平衡:在大多数筛选过程中,只有少部分记录被纳入,这使得传统指标具有误导性,并将优化点转向最小化假阴性[6 (https://arxiv.org/html/2608.14737#bib.bib7)]。其次是处理模式:大语言模型可以在每次调用中接收一个研究(单独处理)或多个研究(批处理),后者可以降低成本[19 (https://arxiv.org/html/2608.14737#bib.bib9)],但可能引发候选研究之间的隐式比较、配额效应或对批处理中位置的敏感性[15 (https://arxiv.org/html/2608.14737#bib.bib10)]。 近期文献主要集中在模型和提示的比较上,通常采用单独处理模式,且未分离上下文元数据的影响[16 (https://arxiv.org/html/2608.14737#bib.bib8),22 (https://arxiv.org/html/2608.14737#bib.bib5)]。目前尚不清楚,在提示中告知筛选元数据(如预期患病率)是否会改变大语言模型纳入或排除研究的倾向,以及处理模式是否具有类似的效果。 本研究通过2×\times2的析因设计来填补这一空白:提示中是否包含筛选元数据,以及处理模式(单独或批处理)。我们从SESR-Eval[9 (https://arxiv.org/html/2608.14737#bib.bib6)]中选择了五篇系统评价,其患病率范围从2.9%到53.0%,并评估了两个模型:Llama-3.3-70B-Instruct-Turbo[17 (https://arxiv.org/html/2608.14737#bib.bib11)]和GPT-5-mini[18 (https://arxiv.org/html/2608.14737#bib.bib12)]。 贡献包括:(a)证据表明,在提示中告知患病率元数据效果有限,而批处理在不同评价中具有更大且更多变的行为效应;(b)观察到聚合分析与逐项分析可能产生分歧;(c)对在筛选中负责任地使用大语言模型的启示,表明文章呈现给模型的方式比基于提示的校准更为重要。 ## 2相关工作 大语言模型应用于标题和摘要筛选已在系统评价中得到研究,包括软件工程领域。Syriani等人[22 (https://arxiv.org/html/2608.14737#bib.bib5)]在此背景下评估了ChatGPT,并观察到不同评价之间的显著差异。Huotala等人[9 (https://arxiv.org/html/2608.14737#bib.bib6)]提出了SESR-Eval,这是一个包含来自24篇二级评价的34,528篇标注原始研究的基准,显示评价之间的差异可能超过模型之间的差异。在一篇方法论综述中,Madeyski和Kitchenham[16 (https://arxiv.org/html/2608.14737#bib.bib8)]强调了在评估用于筛选的大语言模型时反复出现的局限性,包括对适合失衡场景的指标使用不足。 另一条研究路线探讨提示公式化和校准机制如何影响大语言模型性能。Wang等人[26 (https://arxiv.org/html/2608.14737#bib.bib13)]在零样本设置中评估大语言模型,并提出了基于目标召回率的校准方法,而Huotala等人[10 (https://arxiv.org/html/2608.14737#bib.bib14)]比较了零样本、单样本和少样本配置。这些研究表明,指令、示例和阈值可以改变性能,但并未直接分离上下文筛选元数据(如告知的患病率)对模型决策倾向的影响。 批处理主要被视为一种效率策略。Cheng等人[4 (https://arxiv.org/html/2608.14737#bib.bib15)]和Pipal等人[19 (https://arxiv.org/html/2608.14737#bib.bib9)]表明,批处理提示在保持性能接近单独处理的同时,减少了token消耗、时间和成本。然而,增加上下文可能会改变模型行为。Liu等人[15 (https://arxiv.org/html/2608.14737#bib.bib10)]记录了“中间丢失”现象,即性能根据信息在上下文中的位置而变化。Fagerberg等人[5 (https://arxiv.org/html/2608.14737#bib.bib25)]表明,GPT-5-mini的整体敏感性在批处理大小约为150–200之前保持稳定,之后急剧下降。因此,批处理应被视为一种实验条件进行分析,而不仅仅是成本优化。 最后,评估大语言模型在筛选中的表现必须考虑类别不平衡,因为“纳入”通常是少数类,基于准确率的指标可能具有误导性。Madeyski和Kitchenham[16 (https://arxiv.org/html/2608.14737#bib.bib8)]讨论了传统指标与对非对称成本更敏感的指标之间的差异。Hida和Do Nascimento[6 (https://arxiv.org/html/2608.14737#bib.bib7)]讨论了用于失衡分类的稳健指标,而Hida等人[8 (https://arxiv.org/html/2608.14737#bib.bib4)]表明,同一模型多次执行之间的差异性可能与模型间的差异相当,建议使用更稳定的协议指标以及与假阴性成本一致的度量,如F2分数。 尽管文献在基准、提示、批处理和指标方面取得了进展,但仍然存在三个差距:批处理通常被视为效率技术,而非行为因素;提示很少纳入上下文筛选元数据;评估往往强调聚合指标,而没有检查决策的逐项变化。本研究通过受控实验设计来研究这些差距。 ## 3方法论 本受控实验评估了筛选元数据和处理模式如何影响大语言模型在涉及科学研究的二元分类任务中的行为。每个候选研究根据其标题、摘要和相应二级评价的资格标准被分类为“排除”或“纳入”。图1 (https://arxiv.org/html/2608.14737#S3.F1)总结了整个分析工作流程。 分析由四个研究问题指导: - •RQ1)筛选元数据是否会改变大语言模型将研究分类为“纳入”的倾向? - •RQ2)与单独处理相比,批处理是否会改变决策? - •RQ3)有或无元数据的批处理如何影响假阴性和决策变化的方向? - •RQ4)不同模型家族之间的观察效果是否一致? 参见图注图1:本研究中的分析工作流程。### 3.1实验设计 实验设计遵循2×\times2的析因结构,组合了两个因素:提示中是否包含筛选元数据,以及处理模式(单独或批处理)。元数据包含一个句子,告知该评价中“纳入”类别的真实(Oracle)估计纳入率,作为类别不平衡的上下文。四种条件为:A)单独处理,无元数据;B)单独处理,有元数据;C)批处理,无元数据;D)批处理,有元数据。 ### 3.2数据集、模型和数据准备 我们使用了SESR-Eval[9 (https://arxiv.org/html/2608.14737#bib.bib6)],这是一个从软件工程二级研究构建的标题-摘要筛选数据集。之所以选择它,是因为它提供了参考标签和涵盖不同“纳入”类别患病率水平的评价,允许观察模型在不同失衡程度下的行为。 选择了五篇二级评价,以覆盖不同的正类患病率值,从高度失衡到几乎平衡。缺乏两类记录、记录数少或资格标准不足的评价被排除。表1 (https://arxiv.org/html/2608.14737#S3.T1)展示了所使用评价的特征。 表1:选定的SESR-Eval评价特征。注:N代表数据准备后用于分析的研究数量。 分析单元是候选研究。每个实例包含研究标识符、标题、摘要、参考标签及其所属的二级研究。原始标签被二值化为0(排除)和1(纳入),大语言模型的决策采用相同的编码。 评估了两个模型:Llama-3.3-70B-Instruct-Turbo[17 (https://arxiv.org/html/2608.14737#bib.bib11)](通过Together AI API[24 (https://arxiv.org/html/2608.14737#bib.bib26)]访问)和gpt-5-mini-2025-08-07[18 (https://arxiv.org/html/2608.14737#bib.bib12)](通过OpenAI API访问)。实验在2026年3月至5月间执行。两个模型使用了相同的元素、条件和提示模板。调用执行时温度为0;监控了无效或格式不符的响应,最终集中没有无效决策。模型之间的比较被视为稳健性分析,而非性能竞争排名。 ### 3.3提示与场景执行 提示用英文编写,遵循数据集标题、摘要和标准的语言(在构件包[7 (https://arxiv.org/html/2608.14737#bib.bib24)]中提供)。所有条件遵循一个通用结构,包含任务定义、资格标准、筛选说明和候选研究数据。要求输出为JSON格式,包含研究标识符和二元决策,以减少解析歧义并实现程序化验证。在批处理条件(C和D)中,研究被随机打乱(使用固定种子),分成每批20个,C和D条件使用相同的批处理组成和顺序;每个批处理返回每个研究的一个决策。此大小仍在保持大语言模型在筛选任务中性能稳定的范围内[5 (https://arxiv.org/html/2608.14737#bib.bib25)]。所有四种条件和两个模型提供商的准确提示模板在构件包[7 (https://arxiv.org/html/2608.14737#bib.bib24)]附带的补充材料中复制。 ### 3.4指标、分析比较和不确定性 采用F2分数是因为它赋予召回率更大的权重,这适用于筛选场景,其中假阴性比假阳性更关键[8 (https://arxiv.org/html/2608.14737#bib.bib4)]。假阴性率代表丢失相关研究的风险,而Gwet's AC1[25 (https://arxiv.org/html/2608.14737#bib.bib23),8 (https://arxiv.org/html/2608.14737#bib.bib4)]被用作一致性指标,因其在极端患病率场景下的稳定性。由于一致性系数的普遍解释阈值取决于上下文,AC1值主要在不同评价、模型和实验条件之间进行比较解释,而非作为绝对质量类别。这一选择在失衡筛选设置中尤为重要,因为一致性系数可能受患病率和边际分布的影响。 除了聚合指标,还计算了逐项指标。决策翻转率(DFR)定义为两个条件之间决策改变的研究比例,受决策翻转和预测变化指标的启发[13 (https://arxiv.org/html/2608.14737#bib.bib21)]。净偏移定义为从“排除”到“纳入”的变化与从“纳入”到“排除”的变化之间的净差值,指示某个条件是使模型更包容还是更严格。 比较A↔\\leftrightarrowB和C↔\\leftrightarrowD分别评估了元数据在单独和批处理模式下的效果;A↔\\leftrightarrowC和B↔\\leftrightarrowD评估了在无元数据和有元数据情况下批处理的效果。还使用了McNemar精确检验以及文章级别的改善或恶化分析。对F2分数和DFR的差异计算了配对bootstrap[1 (https://arxiv.org/html/2608.14737#bib.bib22)]置信区间,保留了被比较条件中研究之间的对应关系。这些程序假设独立性;共享提示的批处理决策可能相关,因此批处理比较中的不确定性可能被低估。 ### 3.5可重复性 研究构件,包括数据表、用于准备数据、处理大语言模型输出和重建分析、表格和图表的Jupyter笔记本,以及包含所有四种条件准确提示模板的补充文档,可在Zenodo记录中获取 (https://doi.org/10.5281/zenodo.20414963)(DOI: 10.5281/zenodo.20414963)。 ## 4结果与讨论 本节探讨批处理和筛选元数据如何影响大语言模型的决策行为。分析结合了三个证据来源:与参考标签的一致性、逐项变化以及对性能的聚合影响。 ### 4.1一致性概述 图2 (https://arxiv.org/html/2608.14737#S4.F2)展示了使用Gwet's AC1衡量的大语言模型决策与参考标签之间的一致性概况。最明显的模式是,在几乎所有评价和条件下,GPT-5-mini表现出比Llama-3.3-70B-Instruct-Turbo更高且更稳定的一致性。在Llama模型中,批处理条件降低了诸如rsl_0和rsl_3等评价的一致性,表明研究的呈现模式可以改变大语言模型决策与参考标签之间的一致性。在GPT-5-mini中,条件之间的差异较小,尽管几乎平衡的评价(rsl_4)也表现出最低的AC1值。 参见图注图2:按系统评价、实验条件和模型划分的Gwet's AC1。这一初步解读很重要,原因有二。首先,评价之间的一致性差异大于同一评价内某些条件之间的差异,表明二级评价的本质比处理模式或元数据的影响更大。
相似文章
三个人告诉我,我的LLM简历筛选研究测量了错误的东西。他们是对的。以下是数据。
在面临方法论批评后,作者对LLM简历筛选研究进行了广泛的实验,揭示了初始偏差测量很大程度上源于噪声,并且提示设计、包装器选择等因素显著影响评分。
差分隐私如何影响大语言模型中的社会偏见?一项系统性评估
本文对差分隐私如何影响大语言模型中的社会偏见进行了系统性评估,研究发现虽然差分隐私降低了句子评分任务中的偏见,但这一效果并不能推广到所有任务。
用于LLM辅助系统综述筛选的辅助不确定性信号:一项跨八项Cohen药物类别综述的基准研究
本文对基于BERT+GCN分类器的辅助不确定性信号进行基准测试,以提高LLM辅助系统综述筛选的效率。研究表明,针对性地仅路由MAYBE结果可在接近基线的成本下实现效率最大化。
我分析了25,500次LLM简历筛选来测量招聘偏见,结果令人警醒。
一项分析10个模型共25,500次LLM简历评估的研究发现,由“沉默偏见”驱动的偏见率高达45%,模型会编造听起来专业的借口来惩罚候选人。研究强调了公平性和稳定性的巨大差异,其中Claude、Mistral-Large和Llama 4最为稳定,而Qwen和较早期的Gemini模型则波动较大。
审计多模态LLM评分器:临床序数评分中的中央趋势偏差
本文研究了用于临床序数评分(画钟测试)的多模态LLM中的中央趋势偏差。研究发现,LLM将预测结果向量表中间压缩,对关键极端值造成不成比例的影响。该研究将LLM作为裁判的偏差文献扩展到临床评估领域,强调在部署前需要进行校准感知评估。