利用成对查询改进二分类中的选择性分类

arXiv cs.LG 论文

摘要

本文提出使用成对查询来改进二分类中的选择性分类,特别是在置信度估计不一致的情况下(如大语言模型的上下文学习)。理论条件及在合成和真实数据集上的实验表明,基于成对查询的算法比原始置信度估计能实现更好的准确率-成本权衡。

arXiv:2605.30615v1 公告类型:新 摘要:在选择性分类中,模型对置信度高的数据样本预测标签,而对不自信的样本放弃预测。被拒绝的样本通常由专家标注,成本高昂。当模型在未拒绝样本上具有低错误率时,专家预算能得到最佳利用。然而,模型的置信度估计可能与其预测不一致,这可能导致未拒绝样本上的高错误率。这种情况在LLM的上下文二分类中很容易发生。为解决此问题,我们提出向同一模型额外发出成对查询。这些成对查询能够检测高错误样本,并可被整合到选择性分类技术中,以降低未拒绝样本的错误率。理论上,我们建立了使用成对查询的简单算法优于不一致置信度估计的条件。我们通过1个合成数据集和4个基于上下文学习的真实二分类数据集的大量实验支持这一见解。在所有案例中,我们都表明,使用成对查询的算法比仅使用原始置信度估计(例如LLM的下一个词元logits)获得了更好的准确率-成本权衡。
查看原文
查看缓存全文

缓存时间: 2026/06/01 09:29

# 利用成对查询改进二元分类的选择性分类

**来源:** https://arxiv.org/html/2605.30615

\[1\]\\fnmHarsh\\surVardhanhttps://orcid.org/https://orcid.org/0000-0002-4656-3162\[1\]\\orgdivCSE,\\orgnameUCSD,\\orgaddress\\street9500 Gilman Drive,\\cityLa Jolla,\\postcode92092,\\stateCA,\\countryUSA

\[2\]\\orgnameAdobe Research,\\orgaddress\\street345 Park Ave,\\citySan Jose,\\postcode95110,\\stateCA,\\countryUSA

\[3\]\\orgnameAdobe Research,\\orgaddress\\streetMarathahalli,\\cityBengaluru,\\postcode560087,\\stateKarnataka,\\countryIndia

\[4\]\\orgdivHDSI,\\orgnameUCSD,\\orgaddress\\street9500 Gilman Drive,\\cityLa Jolla,\\postcode92092,\\stateCA,\\countryUSA

###### 摘要

在选择性分类中,模型对其有信心的数据样本预测标签,而对没有信心的样本则拒绝预测。被拒绝的样本通常由专家标注,成本高昂。当模型在未拒绝样本上的错误率较低时,专家的预算才能得到最佳利用。然而,模型置信度的估计可能与模型的预测不一致,这可能导致未拒绝样本上出现高错误率。这种情况在 LLM 的上下文内二元分类中很容易发生。为了解决这个问题,我们提出向同一模型进行额外的成对查询。这些成对查询可以检测高错误样本,并整合到选择性分类技术中,以降低未拒绝样本上的错误率。从理论上讲,我们建立了使用成对查询的简单算法优于不一致置信度估计的条件。我们通过对 1 个合成数据集和 4 个基于上下文内学习的真实二元分类数据集进行大量实验来支持这一见解。在所有案例中,我们证明,使用成对查询的算法比仅使用原始置信度估计(例如,LLM 的下一个 token logits)能够获得更好的精度-成本权衡。

###### 关键词: 选择性分类、成对查询、学习理论、上下文内学习

## 1 引言

在选择性分类中 [chow70, el-yaniv10a],分类器被增加一个拒绝函数,使得它仅对未被拒绝的数据点预测标签。选择性分类有两个互补的目标:1)拒绝一小部分样本(高覆盖率),2)在未被拒绝的样本上获得低错误率(低选择性风险)。平衡这两个目标排除了要么全部拒绝要么全部拒绝的平凡拒绝函数。如果拒绝固定比例的数据点,最好的选择性分类算法应该获得尽可能小的选择性风险。这需要识别分类器出错的样本。在没有真实标签的情况下,这些样本无法被识别。然而,一个可行的方法是拒绝那些分类器对其预测没有信心的数据点。这种方法已被广泛采用,例如,使用 softmax 置信度 [geifman17],或使用集成预测的不确定性 [pmlr-v48-gal16]。这种高置信度或低不确定性的预测在医疗保健 [CRAIG202366]、公平性 [justice, fairness] 和金融 [DASTILE2020106263] 中也是期望的。

如果置信度的度量与预测标签不相关,那么基于置信度的选择性分类就会失败。我们发现,在最近一个新兴的研究领域——使用大型语言模型 (LLM) 的上下文内学习 (ICL) 中,情况往往如此(见图 1 (https://arxiv.org/html/2605.30615#S1.F1.7))。考虑使用 ICL 在 LLM [liu2024surveynl2sqllargelanguage, numbersstation2023NSText2SQL, yu-etal-2018-spider] 上验证自然语言到 SQL (NL2SQL) 输出正确性的任务。

**图 1 说明:** 验证 NL2SQL 正确性时,来自下一个 token logits 的置信度与 ICL 标注函数的绝对差异分布,其中 NL2SQL 来自 Bird 数据集 [li2024can],ICL 标签和下一个 token logits 来自 Gemma3 4B Instruct。p 值为 5% 的阈值是基于置信度和 ICL 标注函数接近的假设,在 50 个随机种子上的平均值。

在 NL2SQL 中,每个数据点包含一个元组:一个针对数据库的自然语言问题以及该数据库上对应的 SQL。如果 SQL 可以回答自然语言问题,则标签为 1,否则为 0。NL2SQL 是 LLM 在商业应用中的一个重要用例 [liu2024surveynl2sqllargelanguage, numbersstation2023NSText2SQL, zhang2023llmaaa]。通过对 LLM 使用带上下文内学习的选择性分类,我们可以拒绝分类器对其预测最不自信的 NL2SQL 对,并将它们委托给昂贵的人工标注员。在这种情况下,一个自然的置信度度量是分类器对预测标签的下一个 token logits [geifman17]。注意,验证正确性是一个二元分类问题,因此对于任何 (NL, SQL) 对,来自上下文内学习的 ICL 标注函数的置信度和偏差都在 [0,1] 内。在图 1 (https://arxiv.org/html/2605.30615#S1.F1.7) 中,我们绘制了 NL2SQL 数据集 [li2024can] 中这两个函数之间绝对差异的分布。该分布在接近 0.5 的值处有重尾,意味着它们之间的相关性非常低。在图 1 中,我们看到当置信度和 ICL 标注偏差相差 0.5 时出现峰值。在这种情况下,选择性分类将通过发送预测标签已经正确的数据点来浪费昂贵的人工标注。

我们在本文中解决这个问题:当置信度函数与分类器的实际标注函数不同时的选择性分类。现有关于选择性分类的研究 [el-yaniv10a, geifman17, pugnana2024deepneuralnetworkbenchmarks] 尚未探索这个问题,但它们的重点一直是更简单的校准分类器,而不是 ICL。此外,由于分类器的规模巨大(对于 LLM 来说可能有数十亿参数 [llama3modelcard]),训练或重新训练模型可能是不可能的,尽管高效微调是可能的。或者,前一个示例中生成的输出可能来自对使用方式有限制条件的闭源模型。例如,OpenAI 的模型 [openai2024gpt4] 禁止将其生成的输出用于任何训练步骤。因此,我们需要不需要任何训练的选择性分类方法。

如果我们不能训练,现有的一些技术,无论是在理论 [el-yaniv10a, el-yaniv12a] 还是实践 [pugnana2024deepneuralnetworkbenchmarks] 中使用的,包括“学习拒绝”框架 [corbiere19, pmlr-v97-geifman19a, cortes],都无法应用。除此之外,ICL 只使用少量标记样本,这使较新的模型无关方法 [pmlr-v206-pugnana23a] 失效。

我们提出一个规避上述所有问题的解决方案:成对查询。在二元分类中,成对查询对应于向模型发送两个未标记的数据点,并询问它们的标签中哪一个更接近标签 1。对于 NL2SQL 示例,标签 1 对应正确性,它将转化为询问两个自然语言问题和相应 SQL 对中哪一个更正确。这个成对信息直接由模型提供,并且结果证明它比不可靠的置信度值更准确。这直观地激发了使用成对查询的选择性分类。此外,1) 成对查询比专家标注便宜,2) 多个模型适用于成对查询,尤其是我们为 NL2SQL 案例讨论的 LLM 分类器,以及 3) 在某些语言任务上,LLM 在成对查询上的准确率高于直接标签 [qin-etal-2024-large]。

本文的目标是理解成对查询是否能够改进选择性分类,使其优于对不可靠置信度估计进行阈值处理。我们对此给出肯定回答。

### 1.1 贡献

我们的主要贡献如下。

1. **基于成对查询的选择性分类:** 对于二元分类,我们提出了 5 种不同的选择性分类算法(PairSel-Middle、PairSel-Max-Entropy、PairSel-Max-Presence、PairSel-Max-Displacement、PairSel-kNN),这些算法不需要重新训练,并使用基于成对查询的排序子程序。其中,只有 PairSel-kNN 需要关于数据点特征空间的距离度量。

2. **理论改进:** 在关于模型预测的温和假设下(第 4 节中的假设 3 (https://arxiv.org/html/2605.30615#Thmtheorem3)),该假设满足线性、广义线性以及 NTK 机制下的神经网络模型 [jacot_gabriel_hongler_2018],我们推导了必要的理论条件,在这些条件下,最简单的成对算法 Pair-Middle 对于球形特征(定理 4 (https://arxiv.org/html/2605.30615#Thmtheorem4))和高斯特征(定理 5 (https://arxiv.org/html/2605.30615#Thmtheorem5))优于简单的置信度阈值方法。

3. **实证性能:** 我们考虑了 3 个任务来测试我们的技术:i) 匹配我们理论的线性分类器合成数据集,ii) NL2SQL 验证(Spider [yu-etal-2018-spider] 和 Bird [li2024can]),iii) BoolQ [clark2019boolq] 和 VisOnlyQA(视觉)[kamoi2025visonlyqa] 数据集上的二元问答。对于除合成数据集外的所有数据集,我们使用多个参数小于 10B 的开源 LLM 作为分类器。我们展示了,对于大多数覆盖率值(见图 3 (https://arxiv.org/html/2605.30615#S5.F3) 和表 1 (https://arxiv.org/html/2605.30615#S5.T1))或标注成本(见图 6 (https://arxiv.org/html/2605.30615#A1.F6)),我们的成对算法相比 3 个不使用训练的基线(对下一个 token logits 进行置信度阈值处理、使用基础模型对指令模型的置信度、以及后处理置信度校准 [han2023prototypical])获得了更好的性能。特别是,从表 1 可以看出,最佳成对方法的总准确率至少比原始基线(对应于下一个 token logits)高 8%(合成、Bird 和 BoolQ),而后处理校准并不总是优于原始基线(表中的合成和 VisOnlyQA),基础模型也不总是可用(VisOnlyQA 和 Llama3 SQLCoder)。

### 1.2 相关工作

##### 选择性分类

[chow70] 最初将选择性分类作为一个理论范式引入。随后的工作 [grandvalet_08, bartlett08a] 侧重于通过拒绝具有小间隔的数据点来获得 SVM 的拒绝规则。[el-yaniv10a] 和 [wiener11] 在选择性分类方面取得了基础性的理论进展,但他们提出的选择性分类算法在实践中并不高效。这种低效源于算法中的子程序需要在所有可能权重的空间中进行穷举搜索。最近一系列关注选择性分类实际应用的工作利用了模型预测中不同的不确定性度量。[geifman17] 利用 softmax 置信度,而 [pmlr-v48-gal16] 使用贝叶斯神经网络通过 MC dropout 得到的不确定性作为拒绝函数。其他不确定性估计公式,例如使用模型集成,也已用于创建拒绝函数 [lakshminaryanan17]。虽然这些在实践中有效,但除了贝叶斯情况外,只有少数具体的理论结果 [pmlr-v206-pugnana23a, ding_ensembles] 可用。一些工作旨在从数据中学习这个拒绝函数 [Cortes2023TheoryAA, corbiere19, pmlr-v97-geifman19a],通过将拒绝率作为一个额外类别,或加入额外层来预测置信度分数。这些属于“学习拒绝/弃权”框架。[pugnana2024deepneuralnetworkbenchmarks] 提供了深度学习模型上多种选择性分类方法的全面基准,表明 softmax 置信度和基于集成的技术在大多数指标上优于大多数基线。请注意,除了贝叶斯情况外,上述方法都无法在我们的设置中使用,因为缺乏模型训练。[ding_ensembles] 需要一个多样化的验证器集成,我们不具备,并且很难从单个验证器模拟出来。此外,[pmlr-v206-pugnana23a, 算法 1, 2] 的模型无关方法需要大量标记数据才能运行,我们不具备这些数据,因为我们只使用少量(例如 20 个)样本作为上下文内示例,这不到我们最小数据集大小的 0.6%。此外,[vishwakarma] 提出了一种基于置信度阈值的自动标注程序,优于迭代选择性分类,但它需要训练。

另一个相关领域是半监督学习 (SSL) [vanEngelen2019],其中结合了人工标注和未标注的特征,目标是准确标注未标注的特征。然而,SSL 也需要训练,并且我们的设置中没有标记数据点。因此,SSL 技术不能直接应用于我们的问题。然而,SSL 的某些子程序,特别是标签传播 [vanEngelen2019],仍然可以用于传播来自分类器标签的信息。我们在第 3 节 (https://arxiv.org/html/2605.30615#S3) 的其中一个算法中使用了这一点。

##### 主动学习与选择性分类

与选择性分类密切相关的一个问题是主动学习。与选择性分类类似,在主动学习中,我们也有一个未标注的特征数据集,需要选择最好的特征送去进行人工标注。然而,与选择性分类相反,人工标注后的目标是使用这些标记数据点学习一个新的分类器。此外,在主动学习中,这个“选择最佳未标注数据点、人工标注、随后重新训练分类器”的循环会重复多次,直到达到人工标签的预算或分类器的期望准确率。因此,选择性分类是主动学习单个步骤的无训练版本 [el-yaniv12a]。[el-yaniv12a, gelbart2019] 展示了理论上最优的主动学习与选择性分类之间的强理论联系。[Hanneke2014TheoryOD] 提供了理论上最优的主动学习算法的全面概述,[ren_survey_2021] 提供了基于深度学习的主动学习算法概述,[zhang-etal-2022-survey] 涵盖了主动学习在 NLP 中的最新应用。关于聚焦于 LLM 的主动学习的最相关综述由 [xia-etal-2025-selection] 提供。

由于它们的相似性,人们可能希望将主动学习的技术调整到选择性分类。注意,主动学习需要训练,这在我们的 LLM 作为分类器的情况下计算成本高昂,因此排除了所有主动学习技术,包括成本敏感的变体 [ijcai2017p261, Settles2008ActiveLW]。然而,我们可以调整用于选择样本进行人工标注的主动学习技术。根据 [xia-etal-2025-selection, 第 3.2 节],选择最具信息量样本的最新技术使用 LLM logits,或要求 LLM 手动对样本的难度进行排序,或使用预测标签的一致性。

相似文章

基于成对比较的最优Top-$k$识别

arXiv cs.LG

本文研究了基于噪声成对比较的固定置信度top-k识别问题,并开发了一种渐近最优算法,该算法最小化期望比较次数。

受偏好并非更安全:成对偏好作为临床安全性的代理指标并不可靠

arXiv cs.CL

本文评估了临床医生的成对偏好能否可靠反映大语言模型(LLM)的临床安全性,使用了来自超过736名临床医生对13个模型的26,804条判断。研究发现,偏好排名与安全关键失败的相关性较弱,并提出了一种经临床调整的排名,能更好地纳入基于评分标准的安全性信号。

LLM置信度估计的不同方法基准测试

Reddit r/artificial

本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。