分类器性能不确定性估计及其在大语言模型与嵌套数据中的应用

arXiv cs.AI 论文

摘要

本文评估了社会科学文本分类典型条件下分类器性能指标的置信区间方法,为使用大语言模型时准确估计召回率、精确率等指标的区间提供了指导。

arXiv:2606.26422v1 Announce Type: new 摘要:研究人员越来越多地使用文本分类——监督模型或大语言模型——从自然语言中测量构念,并提供召回率、精确率等指标作为其有效性的证据。然而,尽管这些指标是点估计,会受到抽样变异的影响,但不确定性度量并未与其一致地报告。此外,即使报告了这些度量,当相关标注数据集较小或性能较高时,通常使用的估计方法并不合适。为了改进和提升该领域的置信区间报告质量,本文在社会科学文本分类的典型条件下(样本量小到中等、构念出现频率低、文本嵌套于个体内部)评估了性能指标的置信区间方法。在模拟中,默认方法(如Wald区间和基本百分位Bootstrap)精度最低,覆盖率有时远低于名义上的95%水平。使用Agresti-Coull、Wilson、Clopper-Pearson以及一种新颖的伪计数正则化Bootstrap(特别适用于F1计算)可以提高精度。当文本嵌套于个体内部时,我们证明必须同时对有效N和适当的自由度进行调整,才能生成准确的分析区间。在Bootstrap区间中,当个体生成中等数量文本时,分层Bootstrap比聚类Bootstrap更准确;但当个体仅生成少量文本时,分层Bootstrap过于保守。通过向该领域提供适当的区间估计指导,我们旨在提高机器学习应用的透明度,并鼓励在设计阶段更加关注验证样本量。
查看原文
查看缓存全文

缓存时间: 2026/06/26 05:12

# 评估分类器性能的不确定性:在大语言模型与嵌套数据中的应用  
来源:https://arxiv.org/html/2606.26422  
Kylie Anglin博士  
Kylie Anglin为通讯作者,联系方式:邮箱:Kylie\.Anglin@uconn\.edu;电话:860-486-0181。  
康涅狄格大学教育学院教育心理学系  

###### 摘要  

研究人员越来越多地使用文本分类(监督模型或大语言模型)从自然语言中度量构念,并以召回率和精确率等指标作为其效度的证据。然而,尽管这些指标是受抽样变异影响的点估计,但不确定性度量却未能一致地伴随报告。此外,即便报告了不确定性,其估计方法往往不适用于相关标注数据集较小或性能较高的情况。为提升并改进该领域置信区间报告的质量,本文评估了在社会科学文本分类的典型条件下(小到中等样本量、罕有构念、个体内文本嵌套)性能指标的置信区间方法。模拟结果显示,默认方法(如Wald区间和基本百分位自助法)的准确性最低,其覆盖率有时远低于名义上的95%水平。使用Agresti-Coull、Wilson、Clopper-Pearson以及一种新颖的伪计数正则化自助法(尤其适用于F1的计算)可提高准确性。当文本嵌套于个体内时,我们证明需要同时调整有效样本量N和适当的自由度,才能生成准确的分析区间。在自助法区间中,当个体生成中等数量文本时,分层自助法比聚类自助法更准确,但当个体只生成少量文本时则过于保守。通过为学界提供关于适当地估计区间的指导,我们旨在提高机器学习应用的透明度,并鼓励在设计阶段更加关注验证样本量。

## 引言  

文本分类——无论是通过训练监督机器学习模型还是使用预训练的大语言模型(LLM)自动将文本归入类别——使研究人员能够以相对较低的成本从自然语言数据中大规模提取度量指标。然而,由此产生的分类几乎不可避免地伴随误差;一部分文本很可能被分入人类专家不会同意的类别。为评估这种误差的程度,研究人员通常会报告在手工分类文本样本中估计的评估指标(如精确率和召回率)[undefaw (https://arxiv.org/html/2606.26422#biba.bibx13),undefaad (https://arxiv.org/html/2606.26422#biba.bibx20)]。这些指标向读者以及潜在的下游用户提供关于机器分类与专家分类之间一致程度的信息[undefal (https://arxiv.org/html/2606.26422#biba.bibx2)],以及误差的频率和类型[undefaam (https://arxiv.org/html/2606.26422#biba.bibx29)]。因此,特定性能指标的大小对于评估结果应被信任的程度至关重要:虽然我们可能信任召回率为0.90(识别出90%感兴趣的概念实例)的分类器得出的结论,但我们对仅识别出75%实例的分类器的信心就会降低。此外,虽然报告的召回率0.90(或0.80、0.70等,取决于应用)可能被认为足以使用该分类器,但某些更低的值则不行。指标的大小很重要。

然而,报告的性能指标仅仅是点估计——是某个真实总体参数的*近似值*,如果我们能获得机器-人类分类对的无限样本,就能得到该参数。由于随机性,我们的假设分类器在随机的手工标注文本样本中可能估计出0.90的召回率,但若我们评估所有文本的总体,真实召回率可能低得多(或高得多)。这种统计不确定性正是研究人员在报告治疗效应估计及其他关键结果时,同时报告标准误和/或置信区间的原因。这也是研究人员在计划随机实验时进行先验功效分析的原因[undefao (https://arxiv.org/html/2606.26422#biba.bibx5),undefaab (https://arxiv.org/html/2606.26422#biba.bibx18)];他们希望确保样本量足够大,以可靠地识别效应。然而,在社会科学(包括心理学)中,对性能指标统计不确定性的考虑仍然有限。在一项非正式的PsycINFO检索中,针对使用大语言模型并报告性能指标的同行评审文章(使用检索词“AB (large language model) AND (precision AND recall)”和“AB (large language model) AND (F1)”),不到一半的识别文章报告了这些指标的任何不确定性度量(置信区间或标准误)。此外,在报告了指标置信区间的地方,其计算方法通常不准确,尤其是对于高比例(如使用基于LLM的分类器时很可能遇到的情况)和/或嵌套数据(例如,同一作者生成多篇文本)。本文评估了估计和报告性能指标不确定性的最佳实践。在此过程中,我们解决文本分类中经常出现的三个挑战:有效样本量小(由于罕有构念或招募困难)、性能指标接近1(由于LLM的能力)以及非独立性(由于文本嵌套于作者、参与者或文档中)。我们通过模拟评估了在文本分类典型条件下的区间覆盖率和宽度,为置信区间报告提供实用建议。

## 1 分类器性能与效度  

文本分类可被视为一个测量问题:存在某种真实的但潜在的构念,它体现在文本中,我们希望分类器能够识别它[undefap (https://arxiv.org/html/2606.26422#biba.bibx6),undefaas (https://arxiv.org/html/2606.26422#biba.bibx35)]。因此,分类器的效度取决于分类在多大程度上反映了感兴趣的构念。通常,通过将专家的人工分类与机器分类进行比较来评估这一点,假设人工分类与构念高度一致[undefaw (https://arxiv.org/html/2606.26422#biba.bibx13)]。性能指标提供了对这种一致性的估计。

### 1.1 性能指标  

#### 1.1.1 类别 k=2  

文本通常被分为两类:正类或负类,其中正类标签通常表示偏离基线[undefaao (https://arxiv.org/html/2606.26422#biba.bibx31)]。评估二分类器的目标是评估正类和负类分类中的错误模式。因此,指标通常是真正例(TP)、假正例(FP)、真负例(TN)和假负例(FN)数量的函数。混淆矩阵(如表1所示)报告了这些计数或比例。

表1:混淆矩阵设置  
注意:TP = 真正例,FN = 假负例,FP = 假正例,TN = 真负例。

混淆矩阵中各数量之间的关系通过一个或多个指标来总结:准确率(正确分类文本的比例)、召回率(模型识别出的正例比例)、精确率(被模型识别为正例的情况下,实际为正例的概率)以及特异度(模型识别出的负例比例),正式定义如下:

Accuracy = (TP + TN) / (TP + FP + FN + TN)  
Recall = TP / (TP + FN)  
Precision = TP / (TP + FP)  
Specificity = TN / (TN + FP)

单独呈现其中任何一个都存在缺陷[undefaaf (https://arxiv.org/html/2606.26422#biba.bibx22)]。在类别不平衡的情况下,准确率是不合适的,因为即使从未或很少识别出感兴趣的类别,也可能获得很高的准确率值。同时报告召回率和精确率解决了这个问题,它提供了关于正例被识别比例以及模型识别为正例的案例中实际为正例比例的信息。尽管如此,精确率和召回率没有提供任何关于识别出的真负例比例的信息,这一点由特异度来解决。

如上定义,每个指标都假设有一个真实的分类(可能由人类提供)。然而,承认即使专家之间也存在合理分歧[undefaar (https://arxiv.org/html/2606.26422#biba.bibx34)]、人类错误的可能性以及LLM令人印象深刻的能力[undefau (https://arxiv.org/html/2606.26422#biba.bibx11)],评估LLM分类的研究人员可能更倾向于在出现分歧时,不将人类分类视为决定性的真理。(在监督学习中情况不太如此,因为模型旨在直接复制人类分类,因此要求将人类分类视为黄金标准。)即使分析人员对分歧情况下哪个分类正确持不可知论态度,衡量分歧仍然是验证的一个重要方面,类似于衡量人类之间的一致性[undefax (https://arxiv.org/html/2606.26422#biba.bibx14)]。这种情况下,分析人员可能会报告百分比一致性(其缺陷与准确率相同),或者召回率和特异度的对应指标:正类一致性百分比(PPA)和负类一致性百分比(PNA;[undefaz (https://arxiv.org/html/2606.26422#biba.bibx16)]),使用下面表2中的分歧矩阵定义为:

PPA = 2a / (2a + b + c)  且   PNA = 2d / (2d + b + c)

表2:分歧矩阵

#### 1.1.2 类别 k ≥ 3  

当文本分类用于将文本划分为超过两个可能类别时,每个类别k都关联其自己的混淆/分歧矩阵。因此,上述指标的定义保持不变,并且可以为每个类别进行计算。然而,要跨类别聚合,我们可以取平均值,要么对每个类别赋予相同权重(宏观平均,例如生成宏观召回率),要么按类别中的文本数量加权(微观平均,例如生成微观召回率)。后者更能代表样本(因为每篇文本权重相等),但很容易被大类别主导[undefaao (https://arxiv.org/html/2606.26422#biba.bibx31)]。

#### 1.1.3 汇总指标  

全面评估文本分类器需要理解正类或负类中多种类型的错误或分歧(并且在相关时,在多个类别内)。然而,单一的汇总指标简化了分类器之间(或超参数、文本表示、提示词等之间)的选择。诸如F1、受试者工作特征曲线下面积(ROC-AUC)和Cohen’s Kappa(κ)等指标很好地发挥了这一功能。F1定义为精确率和召回率的调和平均数,正式表示为:

F1 = 2 × Precision × Recall / (Precision + Recall)

这使得分析人员能够比较多个分类器,其中一些可能精确率高于召回率,反之亦然。ROC-AUC适用于使用输出概率的分类器,它提供了随机选择一个正例和一个负例时,模型将正例排在负例之前的概率[undefaak (https://arxiv.org/html/2606.26422#biba.bibx27)]。Cohen’s Kappa(κ)= (Agreement - p_e) / (1 - p_e),其中 p_e = ((a+b)(a+c) + (c+d)(b+d)) / (a+b+c+d)^2,提供了一种超越随机预期(p_e)的一致性度量。与PPA和PNA一样,κ对于“真理”是不可知论的;无论是机器还是人类都可以被视为“真理”,指标也会相同。虽然汇总指标特别适用于超参数的自动经验选择(因为它们提供了单个优化指标),但它们在直接说明模型使用时的错误行为方面信息较少[undefav (https://arxiv.org/html/2606.26422#biba.bibx12),undefaam (https://arxiv.org/html/2606.26422#biba.bibx29)]。例如,仅报告F1分数可能掩盖模型具有高精确率但低召回率(或反之亦然)的事实,这一特性会影响其有用程度,并影响对其分类的适当解释。

## 2 独立数据的置信区间  

报告的性能指标是在给定样本情况下,对分类器可能应用于的所有文本总体中未知真实性能率的最佳估计。由于抽样变异性,估计的性能会受到随机误差的影响,并且会因样本而异。置信区间提供了一个真实性能率可能落入的值范围。不幸的是,在许多社会科学期刊中,性能指标最多只是不一致地伴随着不确定性度量[undefal (https://arxiv.org/html/2606.26422#biba.bibx2)]。未能报告标准误或置信区间,相当于将模型性能视为已知,例如,我们确信分类器能识别出85%的构念实例。然而,性能总是在文本样本上评估的,相应的置信区间宽度取决于文本数量、分类器性能和类别流行率。不幸的是,置信区间宽度也取决于估计方法,某些估计方法会产生更窄但不准确的区间,而其他方法则产生更宽但可靠的区间。目标当然是获得准确反映不确定性的区间——例如,使得在重复样本中,95%置信区间约在95%的情况下包含真实指标——同时尽可能保持窄区间。我们下面定义几种区间计算方法。

### 2.1 分析区间  

我们从二项比例置信区间的教科书定义开始,即Wald置信区间,有时称为正态近似[undefaap (https://arxiv.org/html/2606.26422#biba.bibx32)]。设X表示样本量n(试验次数;例如,总文本数)中的实例数(二项术语中的“成功”)。然后设p̂ = X/n 表示样本比例。利用样本比例的渐近正态性,p的100(1-α)%置信区间为:

p̂ ± z_{α/2} √(p̂(1-p̂)/n)

相似文章

一种更优的识别大语言模型过度自信的方法

MIT News — Artificial Intelligence

MIT研究人员开发了一种新方法,通过衡量相似模型间的跨模型分歧来识别过度自信的LLM,而非仅依赖自洽性指标。该方法能更好地捕捉认知不确定性,并在高风险应用中更准确地识别出不可靠的预测。