基于基础模型先验的主动学习:类别不平衡下的高效学习
摘要
本文提出了一种新颖的主动学习框架,利用基础模型先验来同时解决类别不平衡和标签噪声问题,在图像和文本领域相比基线方法节省了超过50%的标注成本。
arXiv:2606.07630v1 Announce Type: new
在图像和文本领域,真实世界的数据集通常具有倾斜的类别分布和噪声标注,这会共同降低模型性能,尤其是在少数类别上。在现有的解决方案中,主动学习通过选择性查询最具信息量和平衡的样本进行标注,提供了一种有效且高效的范式。我们提出了一种创新的主动学习框架,能够缓解类别不平衡并选择最具信息量的样本进行标注。利用基础模型先验,我们的算法实现了基础模型和小模型之间的不平衡感知协同决策,以应对不同领域中的噪声和不平衡标签。我们首次系统地研究了在标签噪声和类别不平衡双重挑战下的主动学习,涵盖图像和文本领域。在不平衡数据集上的大量实验表明,我们的方法相比最佳主动学习基线实现了显著的标注节省——超过50%,同时保持了性能和鲁棒性,对标签噪声具有鲁棒性。
查看缓存全文
缓存时间: 2026/06/09 08:52
# 基于基础模型先验的主动学习:类别不平衡下的高效学习
来源:https://arxiv.org/html/2606.07630
Meiqing Li² meiqingl@andrew\.cmu\.edu
Qi Zhang³ qzhang9@wpi\.edu
Yinglun Zhu¹,† yzhu@ucr\.edu
¹加州大学河滨分校
²卡内基梅隆大学
³伍斯特理工学院
###### 摘要
跨图像和文本领域的现实数据集通常具有偏斜的类别分布和噪声标注,这共同降低了模型性能,尤其是对少数类的影响。在现有解决方案中,主动学习通过选择性查询信息量最大且最平衡的样本进行标注,提供了一种高效且有效的范式。我们提出了一种创新的主动学习框架,该框架能够缓解类别不平衡,并选择信息量最大的样本进行标注。利用基础模型先验,我们的算法实现了基础模型与小模型之间对不平衡感知的共同决策,以处理跨不同领域的噪声和不平衡标签。我们首次系统性地研究了在标签噪声和类别不平衡双重挑战下的主动学习,涵盖图像和文本领域。在不平衡数据集上的大量实验表明,我们的方法相比最佳主动学习基线实现了超过50%的标注成本节省,同时保持了性能和对标签噪声的鲁棒性。
††脚注:†通讯作者。
## 1 引言
现代深度学习模型在广泛应用中表现出强大性能,但通常依赖于大量标注的训练数据。主动学习(settles2009active)旨在通过顺序地、选择性地查询信息量最大的样本进行标注,从而降低标注成本。尽管取得了成功(gal2017deep;sener2017active;ash2019deep;zhang2023labelbench),但在实际环境中应用主动学习引入了额外挑战,最显著的是类别不平衡和标签噪声。
在不平衡数据分布下,简单地分配标注预算通常会导致对多数类的过采样,导致少数类的标注样本不足,限制了有效的模型训练。为了解决这个问题,最近一系列工作提出了主动学习策略,在样本选择过程中促进类别平衡或改善少数类的覆盖(aggarwal2020active;zhang2022galaxy;nuggehalliimproved)。在大规模标注场景中,这些困难常常与标签噪声(khosla2022neural)叠加,后者是标注者疲劳和感知不一致性引起的常见问题。
基础模型的最新进展,包括语言模型(achiam2023gpt;touvron2023llama;liu2024deepseek)和视觉模型(radford2021learning;zhai2023sigmoid),为提高数据效率提供了新的机遇。由于其丰富的先验知识,基础模型即使在低资源或不平衡设置下也能为标注和数据选择提供信息丰富的信号。最近的几项研究将主动学习与基础模型相结合(bhatt2024experimental;xia2025selection;gupte2024revisiting;zhang2025towards),使用标准的主动学习准则或基础模型驱动的查询策略来指导模型训练。然而,据我们所知,在同时存在类别不平衡和标签噪声的情况下,基于基础模型的主动学习尚未得到系统研究。
在本文中,我们提出了一种新颖的基于基础模型的主动学习算法,用于处理图像和文本领域中的类别不平衡和标签噪声。具体来说,我们首先从基础模型获得预测,以此提取其编码的知识,这些知识作为先验信息指导后续步骤,而非概率推断意义上的贝叶斯先验。然后,受hinton1999;hinton2002training引入的专家乘积(PoE)启发,我们在我们的设置中构建了组合概率作为PoE,以实现联合决策,其中我们整合了类别不平衡感知,以应对不平衡数据带来的挑战。接着我们提出了一种不平衡感知的熵过滤方法,使我们能够获得一个带有伪标签的干净集和一个带有真实标签的噪声集(其中部分样本有真标签)。这可以利用基础模型和主动学习的互补优势,同时专门处理来自伪标签的噪声。在最后阶段,通过联合利用基础模型的指导和主动学习获得的精选数据,对小模型进行微调。整个过程隐式缓解了Oracle标签噪声的影响,正如我们的实验结果所证明的。
##### 我们的贡献。
我们的主要贡献如下:
- •据我们所知,我们是首个解决文本领域中不平衡与标签噪声共存这一非平凡且普遍存在场景的工作之一。
- •我们提出了一种新颖的主动学习算法,利用基础模型的先验信息,通过与小型模型的联合决策来指导主动学习,同时明确考虑类别不平衡。
- •我们在21个数据集设置上进行了实验,涵盖图像和文本领域。我们的方法持续优于现有基线,相比最佳算法节省了超过50%的标注成本。
##### 论文组织。
本文其余部分组织如下。第2节(https://arxiv.org/html/2606.07630#S2)介绍了我们的问题形式化并给出了算法。在第3节(https://arxiv.org/html/2606.07630#S3)中,我们进行了大量实验验证我们方法的有效性,并提供了进一步的分析。第4节(https://arxiv.org/html/2606.07630#S4)对本文进行了总结。相关工作、实现细节和补充实验见附录。
## 2 方法
参考图注图1:我们框架的概述。该框架包含三个主要阶段:先验标注、基于不平衡感知的不确定性采样和小模型训练,详见第2节(https://arxiv.org/html/2606.07630#S2)。给定未标注池,第一阶段生成基础模型和小模型的预测概率,同时从基础模型的预测中导出伪标签。在第二阶段,基于专家乘积(PoE)的不平衡感知熵(不确定性)构建干净集和噪声集。然后通过不确定性采样生成标注集。最后,训练小模型以指导下一轮迭代。算法1 PriorAL:基于基础模型先验的类别不平衡主动学习
0:预训练基础模型 \(M_L\),小模型 \(f\),人工标注Oracle \(O\),每轮人工标注预算 \(B\),不平衡数据集 \(\mathcal{D}\),以及百分比 \(\rho\)。
1:初始化标注池 \(\mathcal{D}_L^1 \leftarrow M\) 个从 \(\mathcal{D}\) 中均匀随机抽取的样本及其查询标签,未标注池 \(\mathcal{D}_U^1 = \mathcal{D} \setminus \mathcal{D}_L^1\)。
2:用 \(\mathcal{D}_L^1\) 训练小模型 \(f\),得到 \(f_0\)。
3:对于 \(t = 1,2,\dots, T\) 执行:
4:第一阶段:先验标注。
5:使用基础模型 \(M_L\) 为未标注池中的每个数据点 \(x \in \mathcal{D}_U^t\) 生成预测概率 \(p_L(x,y=i)\),并据此推导出伪标签 \(\macc@depth\char1\macc@set@skewchar\macc@nested@a 111{y}\)。
6:我们使用上一轮迭代的小模型 \(f_{t-1}\) 获得概率 \(p_f(x,y=i)\)。
7:第二阶段:不平衡感知的不确定性采样。
8:计算专家乘积 \(p'(x,y=i) = p_f(x,y=i) \cdot p_L(x,y=i)\) 并归一化新概率 \(\macc@depth\char1\macc@set@skewchar\macc@nested@a 111{p}(x,y=i) = \frac{p'(x,y=i)}{\sum_j p'(x,y=j)}\)。
9:计算所有 \(x \in \mathcal{D}_U^t\) 的不平衡感知提升熵:
\[
H_b(x) = -\sum_i (\bar{p}(x,y=i) \log \bar{p}(x,y=i) \cdot \frac{w_{\bar{y}(x)}}{w_{\max}}),
\]
其中 \(\macc@depth\char1\macc@set@skewchar\macc@nested@a 111{y}(x) = \arg\max_i p_L(x,y=i)\),\(w_i = |\{x \in \mathcal{D}_U^t : \macc@depth\char1\macc@set@skewchar\macc@nested@a 111{y}(x)=i\}|\),且 \(w_{\max} = \max_i w_i\)。
10:将噪声集 \(\mathcal{D}_N\) 设置为 \(\mathcal{D}_U^t\) 中 \(H_b(x)\) 最大的前 \(\rho|\mathcal{D}_U^t|\) 个元素(如式(6)),干净集 \(\mathcal{D}_C\) 如式(7)。
11:我们使用上一轮迭代的小模型 \(f_{t-1}\) 获得每个 \(x \in \mathcal{D}_N\) 的概率 \(p_f(x,y=i)\)。计算不确定性得分 \(U_f(x) = -\sum_i p_f(x,y=i) \log p_f(x,y=i)\)。
12:要求标注Oracle \(O\) 标注 \(\mathcal{D}_N\) 中具有最大不确定性得分 \(U_f(x)\) 的前 \(B\) 个样本,表示最高不确定性。
13:将这 \(B\) 个数据点记为 \(\mathcal{D}_t\),并更新 \(\mathcal{D}_L^{t+1} = \mathcal{D}_L^t \cup \mathcal{D}_t\) 和 \(\mathcal{D}_U^{t+1} = \mathcal{D}_U^t \setminus \mathcal{D}_t\)。
14:第三阶段:小模型训练。
15:用 \(\mathcal{D}_C \cup \mathcal{D}_L^{t+1}\) 中的数据点训练 \(f_{t-1}\),得到 \(f_t\)。
在本节中,首先在第2.1节(https://arxiv.org/html/2606.07630#S2.SS1)介绍所提出方法的背景,然后我们给出方法,该方法包括三个主要阶段:先验标注(第2.2节(https://arxiv.org/html/2606.07630#S2.SS2));不平衡感知的不确定性采样和小模型训练(第2.3节(https://arxiv.org/html/2606.07630#S2.SS3)),如图1(https://arxiv.org/html/2606.07630#S2.F1)所示。算法的详细描述见算法1(https://arxiv.org/html/2606.07630#alg1)。
### 2.1 预备知识
我们研究适用于文本和图像领域的基于池的主动学习问题。给定数据集 \(\mathcal{D}\),初始未标注池记为 \(\mathcal{D}_U = \mathcal{D}\),其中 \(\mathcal{D}_U = \{x_1, x_2, ..., x_N\}\),使用两个领域的统一表示法。它们的标签 \(Y = \{y_1, y_2, ..., y_N\}\) 初始未知。在这项工作中,我们研究多类分类问题,其中相应的真实标签 \(y\) 属于标签空间 \(\mathcal{Y} := [K]\),包含 \(K\) 个类别。此外,我们将不平衡比率定义为 \(\gamma = \frac{\min_{k\in[K]} N_k}{\max_{k'\in[K]} N_{k'}}\),其中 \(N_k\) 表示 \(\mathcal{D}_U\) 中第 \(k\) 类的样本数。
主动学习算法执行 \(T\) 轮迭代。在第 \(t\) 轮迭代中,算法获得标注池和未标注池,分别为 \(\mathcal{D}_L^t\) 和 \(\mathcal{D}_U^t\),其中 \(\mathcal{D}_L^t \cup \mathcal{D}_U^t = \mathcal{D}\) 且 \(\mathcal{D}_L^t \cap \mathcal{D}_U^t = \emptyset\)。然后主动学习方法从未标注池中选择 \(B\) 个样本 \(\mathcal{D}^t \subseteq \mathcal{D}_U^t\),并从 Oracle \(O\) 查询其对应的标签。然后更新标注池和未标注池:\(\mathcal{D}_L^{t+1} \leftarrow \mathcal{D}_L^t \cup \mathcal{D}^t\),\(\mathcal{D}_U^{t+1} \leftarrow \mathcal{D}_U^t \setminus \mathcal{D}^t\)。基于新的标注池 \(\mathcal{D}_L^{t+1}\) 和相应标签,训练模型 \(f_t\) 以指导下一轮的选择。整个主动学习算法旨在以尽可能少的标注成本实现高精度。
### 2.2 先验标注
先验标注旨在分别从基础模型和小模型中提取预测输出。具体来说,两个模型为未标注池 \(\mathcal{D}_U\) 生成预测概率,并且从基础模型预测中导出的伪标签——连同这些概率——被传递到下一阶段。关键见解是,基础模型和小模型的决策共同影响后续的数据选择过程。
首先,基础模型为未标注池中的每个样本生成概率 \(p_L(x,y=i)\),\(\forall i\in[K]\)。基于基础模型的预测概率,相应的伪标签获得如下:
\[
\macc@depth\char1\macc@set@skewchar\macc@nested@a 111{y} = \arg\max_{i\in[K]} p_L(x,y=i). \tag{1}
\]
由于两个模型的预测都用于后续过程,因此在生成伪标签后保留基础模型的概率 \(p_L\)。然后我们以与基础模型类似的方式获得来自上一轮迭代的小模型预测 \(p_f(x,y=i)\)。两个模型的预测概率 \(p_L\) 和 \(p_f\),以及从基础模型导出的伪标签 \(\macc@depth\char1\macc@set@skewchar\macc@nested@a 111{y}\),被传递到下一阶段。
### 2.3 用于小模型训练的不平衡感知不确定性采样
在训练小模型之前,我们执行第二阶段,如图1(https://arxiv.org/html/2606.07630#S2.F1)所示,该阶段通过结合基于PoE的不平衡感知熵过滤和基于不确定性的采样,构建训练池——包括标注池和一个干净集。
##### 专家乘积(PoE)。
为了执行不平衡感知熵过滤,我们首先需要构建PoE。受先前工作hinton1999;hinton2002training通过相乘不同模型的概率以满足不同约束的启发,我们在工作中将 \(\macc@depth\char1\macc@set@skewchar\macc@nested@a 111{p}\) 定义为PoE,以使基础模型和小模型的决策共同影响后续的数据选择过程,计算如下:
\[
\bar{p}(x,y=i) = \frac{p_f(x,y=i) \cdot p_L(x,y=i)}{\sum_j p_f(x,y=j) \cdot p_L(x,y=j)}. \tag{2}
\]
其中 \(p_f\) 是小模型的概率,\(p_L\) 是预训练基础模型的概率。PoE共同考虑了预训练先验和小模型的能力。
##### 不平衡感知熵过滤。
在考虑类别相似文章
面向类别不平衡的模型无关元学习适应方法
孟菲斯大学研究团队提出 HAMR——一种模型无关的元学习框架,通过双层优化与邻域感知重采样,在六个不平衡 NLP 数据集上自适应地为困难样本与少数类重新赋权。
论大语言模型适应性的局限:模型内化先验对标注任务性能的影响
本文研究了LLM的内化先验如何影响零样本标注性能,发现近三分之二的错误抵抗基于提示的修正,并引入了定义特定熟悉度(DSF)作为比记忆化指标更好的预测因子。
AHEAD: 通过可解释的跨标注者建模推进多类标签聚合
本文提出了AHEAD,一种用于多类标签聚合的跨标注者学习框架,该框架使用图神经网络对标注者可靠性进行建模,在涵盖NLP、CV、视频和音频的10个真实世界数据集上实现了显著的准确性提升。
检测不可检测之异常:通过主动学习增强无监督时间序列异常检测
提出一种新框架,结合主动学习、掩码重构与极小极大策略,以改进无监督时间序列异常检测。在28个测试案例中,相较于基线模型,AUC提升12.39%。
NumLeak: 公开数值基准作为基础模型中的潜在标签
本文介绍了NumLeak框架,用于检测基础模型在预训练中记忆公开数值基准而非展示样本外技能的情况,并表明顶级LLM能高保真地回忆起如Fama-French回报率等值,提出了一种简单的系统提示防御方法。