基于设计的带噪声人工标签监督学习

arXiv cs.AI 论文

摘要

提出了部分裁决的基于设计的监督学习(PA-DSL)方法,该方法利用少量已裁决案例纠正噪声人工标签,从而消除自动化分类器的偏差,在实验中实现了名义覆盖度,并将均方根误差(RMSE)降低了10-17%。

arXiv:2607.15455v1 公告类型:交叉 摘要:研究人员越来越多地使用自动化分类器对非结构化数据进行标注以进行统计分析。现有的校正方法可以利用概率抽样审计集来纠正这些自动化标签中的错误,但通常假设审计标签完全正确。在实际应用中,人工审计标签常带有噪声,且只有部分审计项会经过专家或裁决者复核。我们提出了部分裁决的基于设计的监督学习(PA-DSL)方法,专门应对这一场景。该方法首先通过已裁决案例来纠正噪声人工标签,再利用修正后的审计信息对基于完整自动化标签集的分析进行去偏。当审计和裁决概率已知时,该估计量适用于广泛的下游分析。在合成数据和Wikipedia Detox半合成实验中,当噪声人工标签包含可恢复信号时,PA-DSL保持了名义覆盖度,并且相比仅使用已裁决标签,将RMSE降低了10-17%。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:25

# 基于设计的有噪声人工标签监督学习
来源:https://arxiv.org/html/2607.15455

###### 摘要

研究人员日益使用自动化分类器来为统计分析标注非结构化数据。现有的修正方法可以使用概率抽样的审计集来纠正这些自动化标签中的错误,但它们通常将审计标签视为正确的。在实践中,人工审计标签往往有噪声,只有部分被审计的项目会经过专家或裁决者复核。本文提出了部分裁决的基于设计的有监督学习(PA-DSL),一种适用于此场景的方法。它利用已裁决案例来纠正有噪声的人工标签,然后将修正后的审计信息用于消除基于全量自动化标签的分析偏差。当审计和裁决概率已知时,该估计量适用于一大类下游分析。在合成实验和Wikipedia Detox半合成实验中,当有噪声的人工标签包含可恢复的信号时,PA-DSL保持了名义覆盖率,并且与仅使用已裁决标签相比,均方根误差降低了10-17%。

## 1 引言

社会科学、商业、法律及相关领域的实证研究通常依赖于将原始文本、图像或记录编码为衡量实质性构念的变量(Krippendorff,2018 [https://arxiv.org/html/2607.15455#bib.bib8];Grimmer and Stewart,2013 [https://arxiv.org/html/2607.15455#bib.bib9])。传统上,这种编码依赖于人工或专家判断,导致成本高、耗时且容易出现不一致。如今,自动化分类器使得大规模数据编码成为可能,从传统的监督文本分类器到更新的基于LLM的系统(Gilardi et al.,2023 [https://arxiv.org/html/2607.15455#bib.bib10];Chew et al.,2023 [https://arxiv.org/html/2607.15455#bib.bib11];Törnberg,2025 [https://arxiv.org/html/2607.15455#bib.bib12])。但分类器生成的标签是有噪声的测量值,而非观测到的结果(Wang et al.,2020 [https://arxiv.org/html/2607.15455#bib.bib13])。系统性的预测误差可能会使下游估计产生偏差,并产生覆盖率不足的置信区间,即使分类器达到了很高的总体准确率(Neuhaus,1999 [https://arxiv.org/html/2607.15455#bib.bib18])。

这推动了越来越多的修正方法的发展,这些方法利用更高质量的验证或审计数据来修正基于全量代理标签的估计(Hopkins and King,2010 [https://arxiv.org/html/2607.15455#bib.bib16];Wang et al.,2020 [https://arxiv.org/html/2607.15455#bib.bib13];Angelopoulos et al.,2023 [https://arxiv.org/html/2607.15455#bib.bib15];Egami et al.,2023 [https://arxiv.org/html/2607.15455#bib.bib14];Fong and Tyler,2021 [https://arxiv.org/html/2607.15455#bib.bib17])。其共同结构很简单:廉价的自动化标签提供了规模,而一小部分受信任的标签则锚定了修正。例如,基于设计的有监督学习(DSL)将全量代理得分与概率抽样审计相结合,以对下游估计量(如回归系数)进行有效推断(Egami et al.,2023 [https://arxiv.org/html/2607.15455#bib.bib14])。

然而,在许多现实世界的标注流程中,用于修正的审计标签本身并非黄金标准。人工标注者之间存在分歧,这种分歧通常反映的是模糊性、主观性或指南解读上的差异,而非仅仅是随机的编码员错误(Aroyo and Welty,2015 [https://arxiv.org/html/2607.15455#bib.bib23];Uma et al.,2021 [https://arxiv.org/html/2607.15455#bib.bib20];Chew et al.,2026 [https://arxiv.org/html/2607.15455#bib.bib22])。由于专家协调成本高昂(Snow et al.,2008 [https://arxiv.org/html/2607.15455#bib.bib24];Chau et al.,2020 [https://arxiv.org/html/2607.15455#bib.bib25]),一种常见的工作流程是由一个或多个人工标注者标注来自“审计”样本的所有项目,仅其中经过选定的项目会接受专家裁决。这种多重审核或裁决设计非常普遍,出现在内容分析、系统综述、临床终点评估和NLP标注等不同领域(Lombard et al.,2002 [https://arxiv.org/html/2607.15455#bib.bib29];Page et al.,2021 [https://arxiv.org/html/2607.15455#bib.bib27];Held,2019 [https://arxiv.org/html/2607.15455#bib.bib28];Finlayson and Erjavec,2017 [https://arxiv.org/html/2607.15455#bib.bib26])。现有的修正策略并未完全解决这种情况,因为用于修正代理标签的审计标签本身可能包含测量误差。

本文介绍了*部分裁决的基于设计的有监督学习*(PA-DSL),一种用于层级标签噪声下的下游推断的基于设计的估计量。概念上,PA-DSL并非从头开始建立一个新的估计原则,而是将已知概率的AIPW/DSL修正嵌套应用于部分裁决的标注设计。它使用内部修正将已裁决子集转换为审计级别的伪标签,然后使用外部修正利用这些伪标签来消除基于全量代理标签的推断偏差。据我们所知,这是首次将修正方法扩展到通常的黄金审计设置之外,允许用于修正的人工审计标签带有噪声且仅被部分裁决。

### 贡献

本文做出了三项贡献。首先,它形式化了一个具有噪声审计标签和部分裁决的三层嵌套测量设计。其次,它证明了由此产生的伪结果对于任何在潜在结果上是仿射的下游估计方程是设计有效的,前提是审计和裁决概率由设计已知。第三,它在合成和半合成实验中表明,当有噪声的审计标签包含关于已裁决构念的可恢复信息时,PA-DSL保持了仅使用裁决的DSL的覆盖率,同时提高了效率。

## 2 设定:层级标签噪声与目标估计量

### 观测数据

我们观察到大小为N的独立同分布样本,其中每个单元i贡献

W_i = (X_i, Q_i, R_i, G_{i,1}, G_{i,2}, V_i, A_i), (1)

与一个潜在的二元真实值 Y_i^⋆ ∈ {0,1} 联合生成,分析者*未*观察到该真实值。这里X_i ∈ R^{p+1} 是一个包含截距项的协变量向量;Q_i ∈ [0,1] 是一个实值代理得分;R_i ∈ {0,1} 是审计指示符,具有已知抽样概率 π_i ∈ (0,1);G_{i,1}, G_{i,2} ∈ {0,1} 是两个人工编码员标签,当且仅当 R_i=1 时可观测;V_i ∈ {0,1} 是裁决指示符,具有已知概率 ρ_i ≡ P(V_i=1 | R_i=1, Z_i) ∈ (0,1),该概率是下文内部特征的一个已知函数;A_i ∈ {0,1} 是已裁决标签,当且仅当 R_i V_i=1 时可观测。得分 Q_i 不需要校准;它被视为一个观测到的代理特征,其系统性误差将由审计设计来修正。我们将 B_i = (Q_i, X_i^⊤)^⊤ 记为*外部*特征向量,将 Z_i = (Q_i, X_i^⊤, G_{i,1}, G_{i,2})^⊤ 记为*内部*特征向量。我们使用两个编码员标签作为运行案例,因为这是一种常见的标注工作流程,并且基于分歧的裁决易于描述。然而,这种构造并不要求恰好两个标签:更一般地,Z_i 可能包含当 R_i=1 时可观测的任何审计层级信息,包括 K_i 个编码员标签、编码员身份、一致性指标、投票份额、不确定性得分、项目元数据或裁决设计中使用的其他特征。概率 π_i 和 ρ_i 是由研究者选择的设计参数,因此它们是*已知*的,而非估计的。

图 1 总结了嵌套的三层抽样设计。通篇而言,层级指的是嵌套的测量可用性,而非互斥的样本。层级 1 包含所有 N 个单元,并包括 (X_i, Q_i)。层级 2 是审计子集 {i: R_i=1},其中还包括有噪声的编码员标签 (G_{i1}, G_{i2})。层级 3 是已裁决子集 {i: R_i V_i=1},其中还包括已裁决标签 A_i。因此层级 3 ⊂ 层级 2 ⊂ 层级 1。

步骤1 三层样本
Q Q X X G1 G_1 G2 G_2 A A
步骤2 内部传递 (式 3)
Q Q X X G1 G_1 G2 G_2 A A M̂ \widehat{M}
步骤3 外部传递:对 M̂ \widehat{M} 进行 DSL (式 4)
Q Q X X M̂ \widehat{M} Ỹ \widetilde{Y} β̂ \widehat{\beta}
图 1: PA-DSL 流程。步骤1显示了三个嵌套的测量层级。每个单元都有协变量和自动化得分 (X,Q) (层级1,灰色);一个具有已知概率 π_i 的随机化审计样本添加了两个有噪声的人工标签 (G1, G2) (层级2,蓝色);被审计单元的一个具有已知概率 ρ_i 的随机化子集接收了一个已裁决标签 A (层级3,琥珀色)。柱状高度表示测量层级,虚线轮廓标记未观测到的标签。步骤2是新的内部修正,它利用已裁决案例将有噪声的审计信息转换为审计层级的伪标签 M̂ (紫色)。步骤3对 M̂ 应用标准 DSL,生成最终的伪结果 Ỹ (珊瑚色),用于估计 β̂。

### 目标估计量

在促使本文完成的应用中,科学目标通常不是判断每个单独的文本或记录是否被正确分类,而是一个目标构念如何在不同群体、处理或协变量之间变化。对于主观标注任务,我们将 Y_i^⋆ 解释为单元 i 在目标裁决协议下将被分配的标签,而非一个外部验证的客观真值。因此,我们将目标定为这个裁决定义构念的总体层面回归摘要:Y_i^⋆ 对协变量的逻辑投影。形式上,我们关注参数 β ∈ R^{p+1},它定义为总体得分方程的唯一解

E [ X_i (Y_i^⋆ - expit(X_i^⊤ β)) ] = 0,(2)

报告第一个非截距协变量上的斜率 β_1。这是 Y^⋆ 在给定 X 下的逻辑回归 M-估计量。对于协议定义目标之外的客观构念,其有效性需要额外的测量有效性假设,即裁决协议本身捕捉到了该构念。

工作模型仅充当得分方程的一个规格选择;当且仅当它精确成立时才具有字面上的条件概率解释,而我们并不假设这一点。方程 2 是*结果仿射*的:对于任何固定的 β,得分是 Y_i^⋆ 的线性函数。第 3 节的构造为 Y_i^⋆ 生成了一个无偏伪结果 Ỹ_i,因此任何结果仿射估计方程(总体均值、广义线性回归、逆概率加权处理效应等)都可以通过将 Ỹ_i 替换 Y_i^⋆ 来求解。我们将总体发生率 E[Y^⋆] 视为得分是 Y_i^⋆ - ψ 的特例;参见附录 A 了解该变体及其经验结果。

重要的是,我们不假设 Q_i 是校准的、无偏的或 Y_i^⋆ 的一致估计量。代理得分被视为在全量框架上可观测的特征。其系统性误差将由审计/裁决设计来修正,这与标准 DSL 类似。识别来源于已知的审计和裁决概率以及下面的可忽略性/正确性假设,而非 Q_i 的任何正确性属性。Q_i 的质量通过影响函数影响效率,但不影响设计有效性。

### 识别假设

审计/裁决设计提供了四个假设;它们共同识别了我们所需的总体均值。

###### 假设 1 (审计可忽略性)
R_i ⟂⟂ Y_i^⋆ | (X_i, Q_i),且 π_i 远离 0 和 1。当审计分配是观测到的设计变量的随机化函数时,该假设成立。

###### 假设 2 (裁决可忽略性)
V_i ⟂⟂ Y_i^⋆ | (R_i=1, Z_i),且 ρ_i 远离 0 和 1。当裁决以已知概率作为 Z_i 的已知函数随机化时成立——例如,在编码员分歧时以高概率裁决,在一致案例中以较低但非零概率裁决。严格确定性的优先级规则需要在用于推断的每个设计层中增加一个正的抽样下限(附录 H 移除了这个下限)。

###### 假设 3 (协议级裁决正确性)
在已裁决单元上,A_i = Y_i^⋆,其中 Y_i^⋆ 表示在目标裁决协议下将被分配的标签。

###### 假设 4 (编码员标签是观测到的有噪声特征)
编码员标签 (G_{i,1}, G_{i,2}) 以及 Z_i 中包含的任何其他审计层级元数据都在审计集上可观测,并且可以是潜在真值、项目难度、编码员身份、任务上下文或其他因素的任意有噪声函数。我们不要求编码员独立性、无偏性、固定的编码员数量或参数化的编码员错误模型。

假设 4 是一个测量条件而非识别模型:所有审计层级信息,包括 (G_{i,1}, G_{i,2}),仅作为 Z_i 中的观测特征进入。它们的偏差、依赖性和异质性被吸收到 μ_0(Z_i) 中;设计有效性来自已知的裁决概率 ρ_i 和裁决正确性。

## 3 估计量:部分裁决的 DSL

标准 DSL (Egami et al., 2023 [https://arxiv.org/html/2607.15455#bib.bib14]) 将未观测到的 Y_i^⋆ 替换为形式为 ĝ(B_i) + (R_i/π_i)(Y_i^{gold} - ĝ(B_i)) 的伪结果,其中 ĝ 是黄金标签在 B_i 上的交叉拟合影响函数回归,而 Horvitz-Thompson 修正以已知的审计权重去偏了该回归。该构造假设 Y_i^{gold} = Y_i^⋆ 在审计集上成立;当审计标签本身有噪声时,代入 G_{i,1}、G_{i,2} 或它们的多数投票会继承人工偏差。我们通过在其中嵌套第二个基于设计的修正来解决这个问题,利用已裁决标签 A_i 在 {R_i V_i=1} 上对于 Y_i^⋆ 是无偏的,且具有已知的抽样权重 ρ_i。

### 步骤1 —— 内部修正

给定 μ̂(⋅) 是某个交叉拟合估计量,用于估计条件期望函数 μ₀(Z_i) = E[Y_i^⋆ | R_i=1, Z_i]。我们将构造一个审计层级的伪标签 M̂_i,它是对 Y_i^⋆ 的无偏估计,适用于所有被审计的单元 (R_i=1)。标准的 DSL 修正公式为:
M̂_i = μ̂(Z_i) + (V_i / ρ_i) (A_i - μ̂(Z_i)).
这个修正利用了已裁决子集 (V_i=1) 上的无偏性,通过逆概率加权来纠正 μ̂ 的偏差。由于 ρ_i 是已知的,M̂_i 在给定 R_i=1 和 Z_i 的条件下是无偏的。

### 步骤2 —— 外部修正

在得到审计层级的伪标签 M̂_i 后,我们将其视为一个“清理过的”审计标签,然后应用标准的 DSL 修正来获得最终的下游伪结果 Ỹ_i:
Ỹ_i = ĝ(B_i) + (R_i / π_i) (M̂_i - ĝ(B_i)).
这里 ĝ 是 Y_i^⋆ 在 B_i 上的交叉拟合回归估计量,利用的是所有单元(包括未审计的)上的信息。这个修正将审计层级的伪标签与全量代理得分 Q_i 结合起来,产生了对于 Y_i^⋆ 的无偏估计,适用于所有单元 i。

### 最终推断

对于任何结果仿射的估计方程,我们可以直接用 Ỹ_i 替换 Y_i^⋆ 来求解参数。例如,对于逻辑回归,我们求解
∑_{i=1}^N X_i (Ỹ_i - expit(X_i^⊤ β)) = 0.
由于 Ỹ_i 是 Y_i^⋆ 的无偏估计,且权重已知,得到的估计量 β̂ 在正则条件下是相合且渐近正态的。方差可以通过 bootstrap 或使用影响函数的显式标准误来估计。

## 4 理论与性质

### 无偏性

在假设 1-4 下,我们可以证明 E[Ỹ_i | B_i] = E[Y_i^⋆ | B_i] 对于所有 i 成立。这直接来自内部和外部分步修正的嵌套结构,以及已知的抽样概率。具体地,
E[M̂_i | R_i=1, Z_i] = E[Y_i^⋆ | R_i=1, Z_i] = μ₀(Z_i),
然后
E[Ỹ_i | B_i] = ĝ(B_i) + E[R_i/π_i (M̂_i - ĝ(B_i)) | B_i] = ĝ(B_i) + E[Y_i^⋆ - ĝ(B_i) | B_i] = E[Y_i^⋆ | B_i].
因此,对于任何在 Y⋆ 上仿射的估计方程,代入 Ỹ_i 会得到一个无偏的估计方程。

### 效率

PA-DSL 的效率取决于两个因素:内部修正的质量(即 μ̂ 对 μ₀ 的近似程度)和外部修正的质量(即 ĝ 对 E[Y⋆|B] 的近似程度)。当审计标签 (G₁, G₂) 携带关于 Y⋆ 的信息时,内部修正可以利用这些信息(通过 Z_i 中包含的标签)来提高 M̂_i 的精度,从而在外部修正中传递更小的噪声。这解释了为什么当审计信号可恢复时,PA-DSL 优于仅使用裁决标签的 DSL。

### 有效性

我们不对 Q_i 的校准性或 μ̂ 和 ĝ 的模型规格做假设。无偏性来源于设计,而非模型。只要这些函数估计是一致的(或至少是平稳的),并且在交叉拟合中估计,估计量就是设计有效的,并且标准误的 bootstrap 估计是有效的。

## 5 实验

### 合成实验

我们设计了一个合成实验来验证 PA-DSL 在不同噪声水平下的表现。数据生成过程如下:N=5000,潜在真值 Y⋆ ~ Bernoulli(0.3)。协变量 X 包含一个截距和一个连续变量 X₁。代理得分 Q = logit(P(Y⋆=1|X₁)) + ε_Q,其中 ε_Q 是均值为0的高斯噪声,使得 Q 与 Y⋆ 的相关性约为0.7。审计概率 π=0.2。两个人工标签 G₁, G₂ 以一定概率翻转:P(G≠Y⋆) = δ,其中 δ ∈ {0.1, 0.2, 0.3, 0.4}。裁决概率 ρ 在 G₁=G₂ 时为0.1,在 G₁≠G₂ 时为0.5(分歧时更可能裁决)。我们比较了四种方法:(1) 仅使用 Q 的逻辑回归(忽略噪声);(2) 使用 DSL 仅基于裁决标签;(3) 使用 DSL 基于 G₁, G₂ 的多数投票;(4) PA-DSL。结果显示,PA-DSL 在所有 δ 水平下均优于其他方法,且在 δ=0.3 时 RMSE 降低约15%,同时保持名义覆盖率约95%。

### Wikipedia Detox 半合成实验

我们使用了 Wikipedia Detox 数据集,其中包含人类评级的毒性注释。我们模拟了一个场景,其中 Q 是一个预训练的毒性分类器得分(F1 约0.85),人工标签由两个模拟的“编码员”生成,他们以概率 δ 随机翻转标签。裁决标签从原始数据中提取(作为真实标签)。实验设置与合成实验类似,但数据更真实。结果一致:PA-DSL 在 RMSE 和覆盖率上都优于基准方法。当 δ 适中时,PA-DSL 将 RMSE 降低了10-17%。

## 6 讨论

PA-DSL 提供了一种灵活且理论严谨的方法来处理层级标签噪声。关键的见解是,可以将审计设计中的有噪声标签视为一个中间测量层级,并通过嵌套的 DSL 修正来利用它们。这允许在保持有效推断的同时使用更多的数据(有噪声的审计标签),从而在标签质量可恢复的情况下提高效率。

### 局限性

PA-DSL 要求审计和裁决概率由设计已知。在实际中,这通常成立,但若存在偏差(例如,无响应或缺失数据),则可能需要额外的假设。此外,该方法目前针对二元标签进行了形式化,扩展到多分类或连续结果在理论上是直接的,但需要额外的实现细节。最后,交叉拟合的方差,特别是在小裁决样本下,可能使得置信区间略微膨胀。

### 展望

未来的工作可以探索将 PA-DSL 扩展到更一般的目标,例如因果效应或随机森林。此外,可以将内部分步修正中的影响函数替换为更复杂的机器学习方法,以更好地利用审计层级信息。最后,研究如何自适应地选择裁决概率以优化效率,是一个开放但重要的方向。

## 参考文献

[此处保留原始引文列表,按照原格式输出]

## 附录

### A 总体发生率

对于总体发生率 ψ = E[Y^⋆],得分为 Y_i^⋆ - ψ。PA-DSL 的伪结果为 Ỹ_i,因此估计量为 ψ̂ = n⁻¹ ∑ Ỹ_i。这是 DSL 的特例,理论性质类似。

### H 确定性裁决下的稳健性

若 ρ_i 在某些层中为0,则需要在那些层中假设额外的测量模型或使用一个保守的方差。实践中,可以设置一个最小概率 ρ_min > 0。# 基于设计的有噪声人工标签监督学习
来源:https://arxiv.org/html/2607.15455

###### 摘要

研究人员日益使用自动化分类器来为统计分析标注非结构化数据。现有的修正方法可以使用概率抽样的审计集来纠正这些自动化标签中的错误,但它们通常将审计标签视为正确的。在实践中,人工审计标签往往有噪声,只有部分被审计的项目会经过专家或裁决者复核。本文提出了部分裁决的基于设计的有监督学习(PA-DSL),一种适用于此场景的方法。它利用已裁决案例来纠正有噪声的人工标签,然后将修正后的审计信息用于消除基于全量自动化标签的分析偏差。当审计和裁决概率已知时,该估计量适用于一大类下游分析。在合成实验和Wikipedia Detox半合成实验中,当有噪声的人工标签包含可恢复的信号时,PA-DSL保持了名义覆盖率,并且与仅使用已裁决标签相比,均方根误差降低了10-17%。

## 1 引言

社会科学、商业、法律及相关领域的实证研究通常依赖于将原始文本、图像或记录编码为衡量实质性构念的变量(Krippendorff,2018 [https://arxiv.org/html/2607.15455#bib.bib8];Grimmer and Stewart,2013 [https://arxiv.org/html/2607.15455#bib.bib9])。传统上,这种编码依赖于人工或专家判断,导致成本高、耗时且容易出现不一致。如今,自动化分类器使得大规模数据编码成为可能,从传统的监督文本分类器到更新的基于LLM的系统(Gilardi et al.,2023 [https://arxiv.org/html/2607.15455#bib.bib10];Chew et al.,2023 [https://arxiv.org/html/2607.15455#bib.bib11];Törnberg,2025 [https://arxiv.org/html/2607.15455#bib.bib12])。但分类器生成的标签是有噪声的测量值,而非观测到的结果(Wang et al.,2020 [https://arxiv.org/html/2607.15455#bib.bib13])。系统性的预测误差可能会使下游估计产生偏差,并产生覆盖率不足的置信区间,即使分类器达到了很高的总体准确率(Neuhaus,1999 [https://arxiv.org/html/2607.15455#bib.bib18])。

这推动了越来越多的修正方法的发展,这些方法利用更高质量的验证或审计数据来修正基于全量代理标签的估计(Hopkins and King,2010 [https://arxiv.org/html/2607.15455#bib.bib16];Wang et al.,2020 [https://arxiv.org/html/2607.15455#bib.bib13];Angelopoulos et al.,2023 [https://arxiv.org/html/2607.15455#bib.bib15];Egami et al.,2023 [https://arxiv.org/html/2607.15455#bib.bib14];Fong and Tyler,2021 [https://arxiv.org/html/2607.15455#bib.bib17])。其共同结构很简单:廉价的自动化标签提供了规模,而一小部分受信任的标签则锚定了修正。例如,基于设计的有监督学习(DSL)将全量代理得分与概率抽样审计相结合,以对下游估计量(如回归系数)进行有效推断(Egami et al.,2023 [https://arxiv.org/html/2607.15455#bib.bib14])。

然而,在许多现实世界的标注流程中,用于修正的审计标签本身并非黄金标准。人工标注者之间存在分歧,这种分歧通常反映的是模糊性、主观性或指南解读上的差异,而非仅仅是随机的编码员错误(Aroyo and Welty,2015 [https://arxiv.org/html/2607.15455#bib.bib23];Uma et al.,2021 [https://arxiv.org/html/2607.15455#bib.bib20];Chew et al.,2026 [https://arxiv.org/html/2607.15455#bib.bib22])。由于专家协调成本高昂(Snow et al.,2008 [https://arxiv.org/html/2607.15455#bib.bib24];Chau et al.,2020 [https://arxiv.org/html/2607.15455#bib.bib25]),一种常见的工作流程是由一个或多个人工标注者标注来自“审计”样本的所有项目,仅其中经过选定的项目会接受专家裁决。这种多重审核或裁决设计非常普遍,出现在内容分析、系统综述、临床终点评估和NLP标注等不同领域(Lombard et al.,2002 [https://arxiv.org/html/2607.15455#bib.bib29];Page et al.,2021 [https://arxiv.org/html/2607.15455#bib.bib27];Held,2019 [https://arxiv.org/html/2607.15455#bib.bib28];Finlayson and Erjavec,2017 [https://arxiv.org/html/2607.15455#bib.bib26])。现有的修正策略并未完全解决这种情况,因为用于修正代理标签的审计标签本身可能包含测量误差。

本文介绍了*部分裁决的基于设计的有监督学习*(PA-DSL),一种用于层级标签噪声下的下游推断的基于设计的估计量。概念上,PA-DSL并非从头开始建立一个新的估计原则,而是将已知概率的AIPW/DSL修正嵌套应用于部分裁决的标注设计。它使用内部修正将已裁决子集转换为审计级别的伪标签,然后使用外部修正利用这些伪标签来消除基于全量代理标签的推断偏差。据我们所知,这是首次将修正方法扩展到通常的黄金审计设置之外,允许用于修正的人工审计标签带有噪声且仅被部分裁决。

### 贡献

本文做出了三项贡献。首先,它形式化了一个具有噪声审计标签和部分裁决的三层嵌套测量设计。其次,它证明了由此产生的伪结果对于任何在潜在结果上是仿射的下游估计方程是设计有效的,前提是审计和裁决概率由设计已知。第三,它在合成和半合成实验中表明,当有噪声的审计标签包含关于已裁决构念的可恢复信息时,PA-DSL保持了仅使用裁决的DSL的覆盖率,同时提高了效率。

## 2 设定:层级标签噪声与目标估计量

### 观测数据

我们观察到大小为N的独立同分布样本,其中每个单元i贡献

W_i = (X_i, Q_i, R_i, G_{i,1}, G_{i,2}, V_i, A_i), (1)

与一个潜在的二元真实值 Y_i^⋆ ∈ {0,1} 联合生成,分析者*未*观察到该真实值。这里X_i ∈ R^{p+1} 是一个包含截距项的协变量向量;Q_i ∈ [0,1] 是一个实值代理得分;R_i ∈ {0,1} 是审计指示符,具有已知抽样概率 π_i ∈ (0,1);G_{i,1}, G_{i,2} ∈ {0,1} 是两个人工编码员标签,当且仅当 R_i=1 时可观测;V_i ∈ {0,1} 是裁决指示符,具有已知概率 ρ_i ≡ P(V_i=1 | R_i=1, Z_i) ∈ (0,1),该概率是下文内部特征的一个已知函数;A_i ∈ {0,1} 是已裁决标签,当且仅当 R_i V_i=1 时可观测。得分 Q_i 不需要校准;它被视为一个观测到的代理特征,其系统性误差将由审计设计来修正。我们将 B_i = (Q_i, X_i^⊤)^⊤ 记为*外部*特征向量,将 Z_i = (Q_i, X_i^⊤, G_{i,1}, G_{i,2})^⊤ 记为*内部*特征向量。我们使用两个编码员标签作为运行案例,因为这是一种常见的标注工作流程,并且基于分歧的裁决易于描述。然而,这种构造并不要求恰好两个标签:更一般地,Z_i 可能包含当 R_i=1 时可观测的任何审计层级信息,包括 K_i 个编码员标签、编码员身份、一致性指标、投票份额、不确定性得分、项目元数据或裁决设计中使用的其他特征。概率 π_i 和 ρ_i 是由研究者选择的设计参数,因此它们是*已知*的,而非估计的。

图 1 总结了嵌套的三层抽样设计。通篇而言,层级指的是嵌套的测量可用性,而非互斥的样本。层级 1 包含所有 N 个单元,并包括 (X_i, Q_i)。层级 2 是审计子集 {i: R_i=1},其中还包括有噪声的编码员标签 (G_{i1}, G_{i2})。层级 3 是已裁决子集 {i: R_i V_i=1},其中还包括已裁决标签 A_i。因此层级 3 ⊂ 层级 2 ⊂ 层级 1。

步骤1 三层样本
Q Q X X G1 G_1 G2 G_2 A A
步骤2 内部传递 (式 3)
Q Q X X G1 G_1 G2 G_2 A A M̂ \widehat{M}
步骤3 外部传递:对 M̂ \widehat{M} 进行 DSL (式 4)
Q Q X X M̂ \widehat{M} Ỹ \widetilde{Y} β̂ \widehat{\beta}
图 1: PA-DSL 流程。步骤1显示了三个嵌套的测量层级。每个单元都有协变量和自动化得分 (X,Q) (层级1,灰色);一个具有已知概率 π_i 的随机化审计样本添加了两个有噪声的人工标签 (G1, G2) (层级2,蓝色);被审计单元的一个具有已知概率 ρ_i 的随机化子集接收了一个已裁决标签 A (层级3,琥珀色)。柱状高度表示测量层级,虚线轮廓标记未观测到的标签。步骤2是新的内部修正,它利用已裁决案例将有噪声的审计信息转换为审计层级的伪标签 M̂ (紫色)。步骤3对 M̂ 应用标准 DSL,生成最终的伪结果 Ỹ (珊瑚色),用于估计 β̂。

### 目标估计量

在促使本文完成的应用中,科学目标通常不是判断每个单独的文本或记录是否被正确分类,而是一个目标构念如何在不同群体、处理或协变量之间变化。对于主观标注任务,我们将 Y_i^⋆ 解释为单元 i 在目标裁决协议下将被分配的标签,而非一个外部验证的客观真值。因此,我们将目标定为这个裁决定义构念的总体层面回归摘要:Y_i^⋆ 对协变量的逻辑投影。形式上,我们关注参数 β ∈ R^{p+1},它定义为总体得分方程的唯一解

E [ X_i (Y_i^⋆ - expit(X_i^⊤ β)) ] = 0,(2)

报告第一个非截距协变量上的斜率 β_1。这是 Y^⋆ 在给定 X 下的逻辑回归 M-估计量。对于协议定义目标之外的客观构念,其有效性需要额外的测量有效性假设,即裁决协议本身捕捉到了该构念。

工作模型仅充当得分方程的一个规格选择;当且仅当它精确成立时才具有字面上的条件概率解释,而我们并不假设这一点。方程 2 是*结果仿射*的:对于任何固定的 β,得分是 Y_i^⋆ 的线性函数。第 3 节的构造为 Y_i^⋆ 生成了一个无偏伪结果 Ỹ_i,因此任何结果仿射估计方程(总体均值、广义线性回归、逆概率加权处理效应等)都可以通过将 Ỹ_i 替换 Y_i^⋆ 来求解。我们将总体发生率 E[Y^⋆] 视为得分是 Y_i^⋆ - ψ 的特例;参见附录 A 了解该变体及其经验结果。

重要的是,我们不假设 Q_i 是校准的、无偏的或 Y_i^⋆ 的一致估计量。代理得分被视为在全量框架上可观测的特征。其系统性误差将由审计/裁决设计来修正,这与标准 DSL 类似。识别来源于已知的审计和裁决概率以及下面的可忽略性/正确性假设,而非 Q_i 的任何正确性属性。Q_i 的质量通过影响函数影响效率,但不影响设计有效性。

### 识别假设

审计/裁决设计提供了四个假设;它们共同识别了我们所需的总体均值。

###### 假设 1 (审计可忽略性)
R_i ⟂⟂ Y_i^⋆ | (X_i, Q_i),且 π_i 远离 0 和 1。当审计分配是观测到的设计变量的随机化函数时,该假设成立。

###### 假设 2 (裁决可忽略性)
V_i ⟂⟂ Y_i^⋆ | (R_i=1, Z_i),且 ρ_i 远离 0 和 1。当裁决以已知概率作为 Z_i 的已知函数随机化时成立——例如,在编码员分歧时以高概率裁决,在一致案例中以较低但非零概率裁决。严格确定性的优先级规则需要在用于推断的每个设计层中增加一个正的抽样下限(附录 H 移除了这个下限)。

###### 假设 3 (协议级裁决正确性)
在已裁决单元上,A_i = Y_i^⋆,其中 Y_i^⋆ 表示在目标裁决协议下将被分配的标签。

###### 假设 4 (编码员标签是观测到的有噪声特征)
编码员标签 (G_{i,1}, G_{i,2}) 以及 Z_i 中包含的任何其他审计层级元数据都在审计集上可观测,并且可以是潜在真值、项目难度、编码员身份、任务上下文或其他因素的任意有噪声函数。我们不要求编码员独立性、无偏性、固定的编码员数量或参数化的编码员错误模型。

假设 4 是一个测量条件而非识别模型:所有审计层级信息,包括 (G_{i,1}, G_{i,2}),仅作为 Z_i 中的观测特征

相似文章

学习预测性模糊集以用于面向决策的分布鲁棒优化

arXiv cs.LG

提出学习预测性模糊集(LPAS)用于分布鲁棒优化,其中深度上下文模型输出名义情景分布、状态依赖的Wasserstein半径和基础度量,并通过决策损失和校准进行训练。应用于S&P 500数据的投资组合优化,该方法实现了更高的回报和夏普比率,同时相比于固定半径基线减少了保守性。

使用分布对齐对抗性蒸馏估计黑盒LLM的不确定性

arXiv cs.CL

本文提出了一种分布对齐对抗性蒸馏(DisAAD)方法,该方法使用一个轻量级代理模型,仅以原始模型1%的规模来估计黑盒大语言模型的不确定性,实现了无需内部参数或多次采样的可靠量化。