AHEAD: 通过可解释的跨标注者建模推进多类标签聚合
摘要
本文提出了AHEAD,一种用于多类标签聚合的跨标注者学习框架,该框架使用图神经网络对标注者可靠性进行建模,在涵盖NLP、CV、视频和音频的10个真实世界数据集上实现了显著的准确性提升。
arXiv:2607.18465v1 公告类型:新
摘要:众包标注为自然语言处理、计算机视觉和视频等领域的标注数据提供了宝贵来源。标签聚合旨在从有噪声和偏差的标注中推断出潜在的真实标签,关键在于估计标注者的可靠性。尽管取得了有希望的进展,现有方法仍面临一个实际瓶颈:大多数个体标注者只标记一小部分任务,使得准确的标注者估计非常困难。在本文中,我们专注于更具挑战性的多类标签聚合,并提出AHEAD(跨标注者学习与高置信度标注者引导的标签聚合),一种利用种群级数据推进标注者可靠性估计的跨标注者学习框架。具体而言,AHEAD首先通过图神经网络学习高维跨标注者上下文,通过聚合个体级标注者特征与上下文信息,获得多视角、互补的标注者嵌入。然后将这些嵌入解码为可解释的标注者特定混淆矩阵,以拟合观察到的标签。我们制定了一个包含高置信度标注者的复合目标,以缓解先前模型面临的无监督训练问题。在涵盖NLP、CV、视频和音频的10个真实世界数据集上的实验表明,AHEAD显著提高了标签准确性,平均准确率从68.75%提升至73.23%,最佳情况提升高达14.9%。同时,在最大数据集上的可扩展性实验进一步证明了我们方法的整体优越性。
查看缓存全文
缓存时间: 2026/07/22 08:21
# AHEAD:面向多类标签聚合的可解释跨标注员建模 来源:https://arxiv.org/html/2607.18465 Ju Chen¹, Sijia Xu², Jun Feng¹, Zhiqiang Gao³, Zhengyi Yang⁴,\* ###### 摘要 众包标注为自然语言处理、计算机视觉和视频等多个领域提供了有价值的标注数据。标签聚合旨在从含噪且有偏的标注中推断潜在的真实标签,其关键在于标注员可靠性估计。尽管已取得令人鼓舞的进展,现有方法仍面临一个现实世界瓶颈:大多数个体标注员只标注一小部分任务,使得准确的标注员估计极为困难。本文聚焦于更具挑战性的多类标签聚合问题,提出AHEAD(跨标注员学习与高置信度标注员引导的标签聚合),一种利用群体级数据推进标注员可靠性估计的跨标注员学习框架。具体而言,AHEAD首先通过图神经网络学习高维跨标注员上下文,通过聚合个体级标注特征与上下文信息得到多视角、互补的标注员嵌入。然后将这些嵌入解码为可解释的标注员特定混淆矩阵,以拟合观测标签。我们构建了一个包含高置信度标注员的复合目标函数,以缓解先前模型面临的无监督训练问题。在涵盖NLP、CV、视频和音频的10个真实世界数据集上的实验表明,AHEAD显著提升了标签准确率,将平均准确率从68.75%提高到73.23%,最佳情况下提升高达14.9%。同时,在最大数据集上的可扩展性实验进一步证明了我们方法的整体优越性。 ## I、引言 通过利用群体智慧,众包标注持续向自然语言处理、计算机视觉和视频[28 (https://arxiv.org/html/2607.18465#bib.bib47),34 (https://arxiv.org/html/2607.18465#bib.bib46),9 (https://arxiv.org/html/2607.18465#bib.bib45),39 (https://arxiv.org/html/2607.18465#bib.bib54)]等领域注入大量有价值的标注数据,既拓展了数据广度也加深了知识深度[55 (https://arxiv.org/html/2607.18465#bib.bib52),36 (https://arxiv.org/html/2607.18465#bib.bib58),50 (https://arxiv.org/html/2607.18465#bib.bib55)]。同时,它已成为评估和事实核查大语言模型不可或缺的手段[35 (https://arxiv.org/html/2607.18465#bib.bib2),22 (https://arxiv.org/html/2607.18465#bib.bib1),11 (https://arxiv.org/html/2607.18465#bib.bib56),14 (https://arxiv.org/html/2607.18465#bib.bib57)]。考虑到不同标注员可靠性各异[5 (https://arxiv.org/html/2607.18465#bib.bib53)],众包平台通常将每个任务分配给多个标注员,并应用标签聚合来推断潜在的真实标签(真值)[21 (https://arxiv.org/html/2607.18465#bib.bib49),56 (https://arxiv.org/html/2607.18465#bib.bib48)]。多数投票法(MV)将大多数标注员提供的标签视为真值,是最朴素的方法,但由于未能考虑标注员可靠性而易产生偏差[15 (https://arxiv.org/html/2607.18465#bib.bib32)]。因此,一系列精细方法应运而生,共同推断标注员可靠性和潜在真值。本文聚焦于**多类标签聚合**,由于类间混淆复杂且标注噪声多样,该问题比二分类情形更为普遍且更具挑战性[8 (https://arxiv.org/html/2607.18465#bib.bib39),47 (https://arxiv.org/html/2607.18465#bib.bib40),54 (https://arxiv.org/html/2607.18465#bib.bib65)]。 根据对标注员建模方式的不同,现有方法可分为**基于单参数**[57 (https://arxiv.org/html/2607.18465#bib.bib51),23 (https://arxiv.org/html/2607.18465#bib.bib12),24 (https://arxiv.org/html/2607.18465#bib.bib50),27 (https://arxiv.org/html/2607.18465#bib.bib5)]、**基于混淆矩阵**[10 (https://arxiv.org/html/2607.18465#bib.bib6),20 (https://arxiv.org/html/2607.18465#bib.bib7),53 (https://arxiv.org/html/2607.18465#bib.bib24),51 (https://arxiv.org/html/2607.18465#bib.bib21),6 (https://arxiv.org/html/2607.18465#bib.bib4)]和**基于表示学习**[49 (https://arxiv.org/html/2607.18465#bib.bib36),31 (https://arxiv.org/html/2607.18465#bib.bib44),44 (https://arxiv.org/html/2607.18465#bib.bib8),45 (https://arxiv.org/html/2607.18465#bib.bib14),30 (https://arxiv.org/html/2607.18465#bib.bib34),29 (https://arxiv.org/html/2607.18465#bib.bib35)]方法。基于单参数的方法[43 (https://arxiv.org/html/2607.18465#bib.bib11),23 (https://arxiv.org/html/2607.18465#bib.bib12),27 (https://arxiv.org/html/2607.18465#bib.bib5),4 (https://arxiv.org/html/2607.18465#bib.bib10)]通过一个跨所有类共享的标量准确率来建模标注员可靠性,对不同类别施加了很强的同质性假设。因此,基于混淆矩阵和基于表示学习的方法因其对标注员的广泛刻画而目前占主导地位。 基于混淆矩阵的方法为每个标注员建模一个混淆矩阵,在理论上能很好地捕捉标签生成过程[27 (https://arxiv.org/html/2607.18465#bib.bib5)]。DS模型[10 (https://arxiv.org/html/2607.18465#bib.bib6)]首次引入标注员特定的混淆矩阵来刻画标注员可靠性。后续扩展引入了更具表达力的先验:IBCC[20 (https://arxiv.org/html/2607.18465#bib.bib7)]采用狄利克雷先验作用于混淆矩阵,FGBCC[6 (https://arxiv.org/html/2607.18465#bib.bib4)]提出了Softmax-高斯先验,EBCC[26 (https://arxiv.org/html/2607.18465#bib.bib3)]进一步扩展IBCC[20 (https://arxiv.org/html/2607.18465#bib.bib7)],将具有相同真值的任务划分为子类型。最近,Zhang等人[51 (https://arxiv.org/html/2607.18465#bib.bib21)]提出了一个耦合方法来联合细化混淆矩阵。 参见图注(a) 参见图注(b) 图1:(a) MS数据集中具有中位数标注数量的标注员的平均类级标注计数。(b) 在MS数据集上学到的跨标注员相关性,其中\(w_i\)表示第\(i\)个标注员。 得益于学习复杂多维嵌入的能力,基于表示学习的方法近年来大量涌现。Wu等人[45 (https://arxiv.org/html/2607.18465#bib.bib14)]提出了一种层次图自编码器,在任务-标注员图中建模多视图交互,并辅以一个迭代细化节点嵌入和标注员可靠性的初始化策略。Liu等人[30 (https://arxiv.org/html/2607.18465#bib.bib34)]在标注员-任务二分图上应用图对比学习,通过边扰动生成增广视图以促进视图不变性。最近,Liu等人[29 (https://arxiv.org/html/2607.18465#bib.bib35)]在一系列模拟标注场景上预训练一个二分图神经网络,以学习多样的标注模式,并在无需数据集特定训练的情况下跨数据集泛化。 尽管基于混淆矩阵和基于表示学习的方法理论基础扎实且表达力强,但它们面临一个基本的现实世界瓶颈:**大多数个体标注员只标注一小部分任务**,这是现实应用中的普遍现象[18 (https://arxiv.org/html/2607.18465#bib.bib17),51 (https://arxiv.org/html/2607.18465#bib.bib21)],使得准确的标注员估计极为困难。例如,图1 (https://arxiv.org/html/2607.18465#S1.F1)(a)展示了真实世界数据集MS[37 (https://arxiv.org/html/2607.18465#bib.bib59)]中具有中位数标注数量的标注员的平均类级标注计数,揭示了整体标注量的严重数据稀疏性,而**类级稀疏性和不平衡性**更为突出,因为大多数标注员对许多类别只覆盖了少量样本。此外,当前方法主要建立在低密度的标注员-任务拓扑上,使得推断不可靠。与此相反,我们认为跨标注员相关性更稠密,并揭示了多视角、互补的标注员可靠性。例如,图1 (https://arxiv.org/html/2607.18465#S1.F1)(b)展示了我们从MS学到的稠密跨标注员相关性,颜色条表示相关程度。这些相关性为我们提供了群体级信息,从而推导出个体标注员的多视角、互补评估。 为此,本文旨在实现稀疏数据下的准确多类标签聚合。直觉上,混淆矩阵提供了对标签生成过程可解释且理论基础扎实的刻画[27 (https://arxiv.org/html/2607.18465#bib.bib5)],而表示学习擅长捕捉难以显式建模的潜在非线性相关性。因此,我们首先提出采用表示学习来建模高维跨标注员相关性,并从群体中推导多视角、互补的标注员嵌入。然后,我们将这些嵌入解码为可解释的、标注员特定的混淆矩阵,以拟合观测标签。通过利用群体数据,我们推进了标注员可靠性估计。由于我们在没有真值监督的情况下运行,需要解决两个关键问题: - **学习表达力强的标注员嵌入,并映射到有效的混淆矩阵**。以原理性的方式推导多视角、互补的标注员嵌入,并将其投影到有效的标注员混淆矩阵中,并非易事。 - **建立鲁棒的优化目标**。先前方法通常依赖于多数投票(MV)派生的伪标签进行模型训练。然而,MV派生的标签噪声众所周知,直接在此类信号上训练会损害性能。 基于上述见解,我们提出**AHEAD**(跨标注员学习与高置信度标注员引导的标签聚合)。具体而言: (1) 针对第一个问题,AHEAD明确对其上下文拓扑上的**高维跨标注员学习**进行建模,并通过图神经网络聚合个体级标注特征与其上下文信息,学习多视角、互补的标注员嵌入。然后,这些嵌入被解码为**可解释的标注员特定混淆矩阵**,以拟合观测标签。我们通过使用解码后的混淆矩阵引入负对数似然损失,最大化观测的似然,确保表达力强的标注员嵌入以及有效且统计上合理的标注员混淆矩阵。 (2) 针对第二个问题,我们构建了一个复合目标函数,整合了**似然最大化**、**结构正则化**和**方向引导**。具体地,我们将任务数量位于前一定百分比的标注员识别为高置信度标注员,并通过最小化预测混淆矩阵与经验混淆矩阵之间的差异,将其经验混淆矩阵作为关键的监督信号。这一机制的动机来自大数定律[13 (https://arxiv.org/html/2607.18465#bib.bib60)],该定律表明随着样本量增大,经验估计会越来越准确。因此,尽管多数投票(MV)可能有噪声,但高置信度标注员的经验混淆矩阵在统计上是可信的,从而缓解了先前模型面临的无监督训练问题。 在涵盖五个领域的10个真实世界数据集上的广泛实验证明了AHEAD的有效性和效率,在最大数据集上的可扩展性实验展示了我们方法的全面优越性。 总结而言,本文的贡献如下: - 我们提出跨标注员学习,通过利用群体级数据推进个体标注员可靠性估计,并将其与可解释的混淆矩阵统一起来以拟合观测标签,显著提高了多类标签聚合的准确率。 - 我们识别出高置信度标注员,并构建了一个包含似然最大化、结构正则化和方向引导的复合目标函数,以缓解先前模型面临的无监督训练问题。 - 在涵盖NLP、CV、视频和音频的10个真实世界数据集上的广泛实验表明,我们在最佳情况下实现了14.9%的准确率提升,并将平均准确率从68.75%提高到73.23%。在最大数据集上的实验证实了我们方法的可扩展性。 ## II、相关工作 本文聚焦于仅从(任务,标注员,标签)三元组中推断真值和标注员可靠性的众包标签聚合。值得注意的是,对于具有丰富任务特征的场景[41 (https://arxiv.org/html/2607.18465#bib.bib61),25 (https://arxiv.org/html/2607.18465#bib.bib62),19 (https://arxiv.org/html/2607.18465#bib.bib63),40 (https://arxiv.org/html/2607.18465#bib.bib64),52 (https://arxiv.org/html/2607.18465#bib.bib41)]或移动众包中标注员在特定环境中通过移动设备执行感知任务[46 (https://arxiv.org/html/2607.18465#bib.bib66),2 (https://arxiv.org/html/2607.18465#bib.bib67),32 (https://arxiv.org/html/2607.18465#bib.bib43)]也有相关工作,但这些不在我们详细讨论的范围内。 根据对标注员建模方式的不同,现有研究可分为基于单参数[12 (https://arxiv.org/html/2607.18465#bib.bib16),3 (https://arxiv.org/html/2607.18465#bib.bib15),27 (https://arxiv.org/html/2607.18465#bib.bib5),4 (https://arxiv.org/html/2607.18465#bib.bib10)]、基于混淆矩阵[20 (https://arxiv.org/html/2607.18465#bib.bib7),26 (https://arxiv.org/html/2607.18465#bib.bib3),38 (https://arxiv.org/html/2607.18465#bib.bib13),51 (https://arxiv.org/html/2607.18465#bib.bib21),6 (https://arxiv.org/html/2607.18465#bib.bib4)]和基于表示学习[49 (https://arxiv.org/html/2607.18465#bib.bib36),33 (https://arxiv.org/html/2607.18465#bib.bib38),44 (https://arxiv.org/html/2607.18465#bib.bib8),45 (https://arxiv.org/html/2607.18465#bib.bib14),30 (https://arxiv.org/html/2607.18465#bib.bib34)]方法。 ### II-A、基于单参数的方法 基于单参数的方法假设每个标注员在所有类别上保持一个标量准确率。GLAD模型[43 (https://arxiv.org/html/2607.18465#bib.bib11)]引入任务难度和标注员可靠性来刻画每个标签为真的对数几率,并使用期望最大化框架推断参数。CATD模型[23 (https://arxiv.org/html/2607.18465#bib.bib12)]将标注员误差建模为正态分布,并构建一个目标函数以最小化误差方差的加权和,标注员可靠性通过方差置信区间上界进行更新。Aydin等人[1 (https://arxiv.org/html/2607.18465#bib.bib33)]也最小化标注员误差的加权和,约束标注员可靠性非负且和为1,并使用块坐标下降技术进行推断。Bonald和Combes[3 (https://arxiv.org/html/2607.18465#bib.bib15)]推导了极小化极大估计误差的下界,并提出三角形标注员估计以确保非渐近性能。BWA[27 (https://arxiv.org/html/2607.18465#bib.bib5)]...(注意:原文在此处截断,但根据上下文,后续内容应继续翻译,但当前用户消息提供的原文到此为止。我们将完整翻译用户提供的所有原文。)
相似文章
用于Forward-Forward学习的自适应多尺度优度聚合
提出了自适应多尺度优度聚合(AMSGA),这是Forward-Forward算法的一个扩展,通过多尺度优度聚合、自适应难负样本挖掘和层相关阈值,提高了稳定性、鲁棒性和泛化能力,在MNIST和Fashion-MNIST上实现了适度的准确率提升。
Ghost Annotator:通过共形预测探索内容审核中人类标签变化的框架
Ghost Annotator框架结合了共形预测与协同过滤,对内容审核中的LLM行为与人类标签变化进行建模,揭示了大型模型中存在的结构性人口统计偏见。
AGOP 作为解释:从特征学习到图像分类器中的逐样本归因
本文介绍了 AGOP-Weighted,这是一种事后归因方法,它将每个样本的梯度乘以训练分布先验,以抑制噪声并突出重要像素,并在合成和逼真的基准测试中展示了相较于现有方法的显著改进。
HIA-GAT:一种用于高速公路帧级交通冲突风险预测的异构交互感知图注意力网络
本文提出了HIA-GAT,一种双流异构图注意力网络,它结合了纵向和横向车辆交互以及冲突类型感知门控机制,用于高速公路帧级交通冲突风险预测。在NGSIM数据集上的实验表明,该方法提高了风险排序性能,尤其是横向冲突,并提供了可解释的每辆车冲突归因。
基于基础模型先验的主动学习:类别不平衡下的高效学习
本文提出了一种新颖的主动学习框架,利用基础模型先验来同时解决类别不平衡和标签噪声问题,在图像和文本领域相比基线方法节省了超过50%的标注成本。