选择塑造边界:在未选择的NLI群体中单调性与标签一致性的预注册重复研究

arXiv cs.CL 论文

摘要

这项预注册的重复研究测试了NLI中单调性对标签一致性的影响是否从选定的低一致性项推广到未选择的群体,结果发现效应反转且很小,表明早期的发现依赖于选择。

arXiv:2607.19231v1 公告类型:新 摘要:先前关于自然语言推理(NLI)中人类标签变异(HLV)的研究通常依赖于通过分歧程度选择项目的重新标注资源。早期的一项研究(arXiv:2607.15870)发现,在ChaosNLI中,包含非向上单调性算子的假设表现出较低的标签一致性(Cliff's delta = -0.284),而ChaosNLI仅限于多数标签恰好获得五分之三投票的项目。我们预注册了在ChaosNLI所来源的未选择群体——SNLI和MultiNLI开发集——中复制这一边界的实验,使用相同的算子标注器和四级有序一致性结果。注册预测失败。所有七个对比都返回正的Cliff's delta(非向上项一致性稍高,而非更低),唯一显著的验证对比与注册符号相反,且每个效应都远低于我们感兴趣的最小效应量(0.10)。稳健性检查支持这一测量:模拟的标注器误分类会缩小效应而非制造效应,并且手动重新标注审核在200个新样本上达到了四类一致性0.875。我们得出结论,早期的负边界很可能是低一致性选择条件下的结构,而非群体层面的属性,并且基于选定重新标注资源构建的HLV结构主张应明确说明其选择条件。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:25

# 未选取NLI总体中单调性与标签一致性的预注册复制研究
来源:https://arxiv.org/html/2607.19231
###### 摘要

先前关于自然语言推理(NLI)中人类标签变异(HLV)的研究,常常依赖于根据分歧程度选取项目进行重新标注的资源。一项较早的研究(Choi, 2026 (https://arxiv.org/html/2607.19231#bib.bib3))发现,在ChaosNLI中,包含非上向单调性运算符的假设显示出较低的标签一致性(Cliff's δ = −0.284),而ChaosNLI仅限于那些多数标签恰好拥有五个投票中三个的项目。我们预注册了在此边界在ChaosNLI所源自的未选取总体(SNLI和MultiNLI开发集)中的复制研究,使用了相同的运算符标注器和一个四层级序数一致性结果。注册的预测失败了。所有七个对比均返回正的Cliff's δ(非上向项目的一致性略高,而非更低),唯一具有显著性的确认性对比符号与注册相反,并且每个效应都远低于我们感兴趣的最小效应量(0.10)。稳健性检查支持该测量:模拟的标注器误分类会缩小效应而非制造效应,手动重新标注审计在一个新的200项样本上达到了0.875的四类一致性。我们得出结论,早期的负向边界很可能是一个以低一致性选取为条件的结构,而非总体层面的属性,并且基于选取的重新标注资源构建的HLV结构主张应明确说明其选取条件。

选取塑造边界:未选取NLI总体中单调性与标签一致性的预注册复制研究

Haram Choi
不来梅大学
[email protected]

## 1 引言

NLI中的人类标签变异越来越多地被视作信号而非标注噪声:每个项目多个标签反映了模型和评估应予以表征的真实解释变异(Plank, 2022 (https://arxiv.org/html/2607.19231#bib.bib9); Pavlick and Kwiatkowski, 2019 (https://arxiv.org/html/2607.19231#bib.bib8))。在这种视角主义框架下,分歧是一个测量目标,而一个自然的研究问题是,项目的语言属性是否能预测标注者对其分歧的程度。

一个候选预测因素是单调性。Choi (2026 (https://arxiv.org/html/2607.19231#bib.bib3)) 对假设句子进行了单调性运算符标注,发现在ChaosNLI中,假设包含非上向运算符(向下蕴涵或非单调触发器)的项目,其标签一致性低于纯上向项目,在100标签熵结果上的Cliff's δ为−0.284(95% CI [−0.332, −0.235])。

然而,该估计值是以一个强选取规则为条件的。ChaosNLI仅对多数标签恰好拥有五个原始SNLI/MNLI标注者标签中三个的项目进行了重新标注。单调性边界是否存在于这些项目所源自的未选取总体中,从未被测量过。本文在预注册下测量了它。我们将相同的标注器(其规则在分析前已冻结)应用于SNLI和MNLI开发集,并测试了注册的预测:非上向项目在基于原始五个标签构建的四层级序数一致性上位置更低。

注册的预测被拒绝。所有七个对比的符号均反转,且每个效应都很小:最大的δ为+0.059,远低于我们预注册的最小效应量(SESOI)0.10,并且没有置信区间达到该值。本文的贡献在于所测量的选取依赖性本身:一个存在于分歧选取资源内部的边界,在未选取总体中可能消失甚至微弱反转。

## 2 相关工作

### NLI分歧资源。

SNLI和MNLI开发集项目各有五个标签:原始编写者标签加上四个验证标签(Bowman et al., 2015 (https://arxiv.org/html/2607.19231#bib.bib1); Williams et al., 2018 (https://arxiv.org/html/2607.19231#bib.bib12));ChaosNLI对一个选定的子集用100个标签进行了重新标注(Nie et al., 2020 (https://arxiv.org/html/2607.19231#bib.bib6), 第3.1节)。视角主义文献主张直接建模由此产生的标签分布(Plank, 2022 (https://arxiv.org/html/2607.19231#bib.bib9), 第3节);另见 Pavlick and Kwiatkowski (2019 (https://arxiv.org/html/2607.19231#bib.bib8))。

### 单调性与NLI。

单调性推理是NLI中一个经典的难点所在。MacCartney (2009 (https://arxiv.org/html/2607.19231#bib.bib5), 第1.4.1节) 指出,向下蕴涵行为并不局限于明显的否定:“非上向单调结构出人意料地普遍”,涵盖了量词、条件前件、最高级以及跨多个词性的开放类触发器。MED数据集直接针对单调性推理(Yanaka et al., 2019 (https://arxiv.org/html/2607.19231#bib.bib13));我们用它来锚定标注器的错误率。

### 运算符语义本身存在争议。

对于几个运算符,单调性分类是一个活生生的语义辩论,而非查表即可得: "only" 被分析为斯特劳森向下蕴涵而非简单向下蕴涵(von Fintel, 1999 (https://arxiv.org/html/2607.19231#bib.bib11)),而 "many" 则既有基数解读也有比例解读(Rett, 2018 (https://arxiv.org/html/2607.19231#bib.bib10), 第2.1.2节);对于这种歧义,Rett 引用了 Partee (1989 (https://arxiv.org/html/2607.19231#bib.bib7)) 等人。这与第5节 (https://arxiv.org/html/2607.19231#S5) 的审计相关:我们观察到的部分标注器-人类分歧正是由于这个原因而无法化约。

## 3 方法

### 数据。

SNLI开发集(排除14个有四个验证标签的项目后,剩余9,986项)和MNLI匹配开发集(10,000项)。MNLI不匹配开发集(排除来自27个重复配对ID的54行后,剩余9,946项)作为预注册的辅助语料进行分析。所有语料每个项目携带五个标签。MED(5,382个前提-假设对)仅用于标注器验证,而ChaosNLI重叠部分(1,514个SNLI行,经过相同的四标签排除后剩余1,507个;以及1,599个MNLI匹配项)仅用于第4节 (https://arxiv.org/html/2607.19231#S4) 的桥接分析。

### 预测变量。

一个基于规则的单调性运算符标注器(v0.3,在预注册下在本研究之前已冻结;无规则更改)通过表面触发器扫描将每个假设标记为上向、下向、非单调或混合。分析对比是二元的:纯上向对比非上向。

### 结果变量。

一个基于五个验证标签的四层级序数一致性:无多数 << 3/5 << 4/5 << 5/5。主要分析包括无多数层级;将其排除是敏感性分析A。

### 统计数据。

经平局校正的Cliff's δ,伴有双尾Mann-Whitney U检验,百分位数自助法置信区间(10,000次重采样,种子20260717),对两个确认性对比(SNLI主要分析,MNLI匹配主要分析)进行Holm校正,以及预注册的SESOI为|δ| = 0.10。注册的预测是δ < 0(非上向项目一致性更低)。注册是在确认性分析运行之前,于2026-07-17写入我们工作仓库的计划文档。其时间戳是我们自己控制下的版本控制记录,而非第三方注册条目,因此我们报告该日期作为关于我们程序的陈述,而非独立证实的证据;复制仓库中的AUDIT.md以这些术语陈述了注册时间线,完整的注册与结果一致性见附录A (https://arxiv.org/html/2607.19231#A1)。

### 与先前估计值的桥接。

原本计划的在重叠部分内序数结果与ChaosNLI熵之间的相关性在算术上未定义:ChaosNLI仅选取了具有3/5众数标签的项目,因此一致性序数在整个重叠部分上是常数(方差为零)。我们公开陈述了这一点,并用层级描述性统计量(第4节 (https://arxiv.org/html/2607.19231#S4))替代了桥接。量纲提示:先前的δ是在100标签熵结果上计算的,与四层级序数上的δ值在数值上不可通约;我们仅比较符号和幅度类别。

## 4 结果

表1:所有对比。注册预测:δ < 0。SESOI:|δ| = 0.10。无置信区间达到SESOI边界。先前的区间[−0.332, −0.235]位于一个不可通约的结果量纲上,因此与之比较仅限于符号和幅度类别。### 注册预测被拒绝。

表1 (https://arxiv.org/html/2607.19231#S4.T1) 报告了所有七个对比。每个δ均为正:非上向项目在一致性序数上略高,而非更低。SNLI主要对比不显著(δ = +0.032, 95% CI [−0.011, +0.075], Holm p = 0.162)。MNLI匹配主要对比显著,但符号与注册相反(δ = +0.045, 95% CI [+0.024, +0.066], Holm p = 7.1 × 10⁻⁵)。次要的不匹配语料表现与匹配类似(δ = +0.059)。剔除无多数项目(敏感性A)以及合并SNLI与匹配(敏感性B)未改变实质。

请参阅图注
图1:表1 (https://arxiv.org/html/2607.19231#S4.T1) 的七个对比。点为经平局校正的Cliff's δ,附有百分位数自助法95%置信区间;阴影带标记预注册的SESOI,|δ| = 0.10。灰色参考行标注为*Sprint 1 (熵量纲)*,指的是较早研究的内部名称,并报告了该研究的估计值。它是在一个100标签熵结果上计算的,与本文使用的四层级序数在数值上不可通约,仅作符号和幅度比较。由analysis/fig_forest.py生成。
### 所有效应均低于SESOI。

所有|δ| < 0.10,并且没有自助法置信区间触及边界(图1 (https://arxiv.org/html/2607.19231#S4.F1))。项目层面的可区分性基本不存在:有序逻辑伪R²在SNLI中为0.000093,在匹配中为0.00084,并且区分高一致性(4/5,5/5)与低一致性项目的AUC在两个语料中均接近随机水平(SNLI 0.492,匹配 0.484)。

### 结果分辨率不能解释反转。

较早研究从每个项目100个标签读取分歧,而本文使用的序数只有五个层级,因此人们可能会问,边界未能复制是否仅仅是因为结果丢失了分辨率。通常,粗化结果会将关联向零衰减,而非反转其符号,而我们观察到的每个δ均为正,因此丢失分辨率不能制造我们报告的方向。分辨率所限制的是两个研究可以进行比较的精确程度,这也是我们将比较限制在符号和幅度类别的原因。在ChaosNLI上改变每个项目标注数量(从一个到一百个标签)的抽样子实验明确了这种依赖性(Kadasi and Singh, 2023 (https://arxiv.org/html/2607.19231#bib.bib4))。

### 复杂性混杂因素不能解释反转。

作为辅助的、非确认性的防御,我们拟合了以二元单调性预测变量为自变量的一致性序数的比例优势模型:不含协变量的M0和包含长度、解析深度和体裁协变量的M1。在匹配和不匹配语料中,单调性系数在校正后保持其符号并远离零(匹配M1: −0.202, p = 2.4 × 10⁻⁶; 不匹配M1: −0.248, p = 7.3 × 10⁻⁹;此处的负系数对应上述正的δ值,因为上向项目在一致性上位置更低)。在SNLI中,比例优势假设未通过Brant检验(Brant, 1990 (https://arxiv.org/html/2607.19231#bib.bib2)),并且多项替代模型未显示显著的类别方式单调性效应,这与SNLI的δ不显著一致。

请参阅图注
图2:每个一致性层级上非上向假设的占比,附有Wilson 95%置信区间,用于SNLI开发集和MNLI匹配开发集。该占比并未随着一致性升高而下降。由analysis/fig_bridge_shares.py生成。
### 层级式结构走向与注册方向相反。

非上向假设的占比并未随一致性层级增加而下降。在匹配语料中,它在一致同意项目中最高:无多数0.303,3/5 0.308,4/5 0.312,5/5 0.350。SNLI呈现平坦的低水平(0.045, 0.041, 0.060, 0.057)。图2 (https://arxiv.org/html/2607.19231#S4.F2) 绘制了两个语料;附录B (https://arxiv.org/html/2607.19231#A2) 给出了算术细节。

## 5 测量有效性

### 标注器误分类(第2层)。

我们锚定了MED测量中的标注器翻转率(对称误分类 542/5,382 = 0.101;上向到非上向 229/1,818 = 0.126;非上向到上向 313/3,564 = 0.088;分母从已发布的MED文件重新计算,与Yanaka et al., 2019 (https://arxiv.org/html/2607.19231#bib.bib13) 报告的类别计数相差两个项目;MED领域,非开发领域错误声明),并在一个36单元网格上模拟了标签翻转(三个语料,三个场景,锚定加固定比率,各1,000次复制)。误分类将δ向零收缩而非制造它:在MED锚定对称比率下,匹配δ平均为0.0345,在94.9%的复制中显著性保持,不匹配则在每次复制中都保持显著性。仅在极端固定比率下保持率下降,匹配在对称0.20时下降最陡(0.594),此时不匹配仍保持0.933。在所有36个单元中,模拟δ的97.5百分位数从未超过0.064,因此低于SESOI的结论从未翻转(附录C (https://arxiv.org/html/2607.19231#A3))。

### 手动审计(第3层)。

我们依据一份书面编码手册(该手册固定了判断目标:假设是否包含单调性触发器,依据语义定义而非单词列表),对一个新鲜盲选样本(200个假设,分别来自SNLI开发集50个、MNLI匹配开发集50个、以及两个ChaosNLI重叠层各50个)进行了手工标注。与标注器的四类一致性为0.875(Wilson 95% CI [0.822, 0.914]),二元一致性为0.905,Cohen's κ为0.607(四类;两个边际分布严重偏向于上向,因此κ低估了一致性,应与原始比率一同解读)。早期一轮没有编码手册时,一致性为0.135。这个差距是一个工具-规格结果而非错误:没有固定的判断目标时,人类评分者测量了一个不同的构念(前提相对蕴涵方向而非触发器存在)。我们报告了这两轮结果。

### 残留分歧的三个层面。

我们手工阅读了25个分歧项(附录D (https://arxiv.org/html/2607.19231#A4)),并将每个分歧分配到一个误差层面。这种层面编码是定性判断,非脚本输出;以下计数是近似值,是本文中唯一一组无法由脚本重新生成的数字。它们分解为(a)约10个标注器词典覆盖缺口,(b)约5个多义性和构式失败,以及(c)约

相似文章

大规模人口统计提示:更多属性如何损害LLM与人类的一致性

arXiv cs.CL

本文研究了在提示中添加人口统计属性如何影响LLM与人类在不同任务中的一致性,发现少数高信号属性能够提升对齐,但过度指定会降低对齐效果。研究使用五个开源LLM和神经元探测,表明属性信号质量和连贯性比数量更重要。

分区、提示、聚合:语言模型中的统计自一致性

Hugging Face Daily Papers

本文提出了一个框架来测试LLM估计是否在不同子群体间遵循统计自一致性(全概率定理),发现了广泛的违反以及“宏观谬误”,即细粒度估计与人类数据的一致性更好。

非洲语言NLI评估的样本量缩放

arXiv cs.CL

本文利用AfriXNLI基准测试,研究标注数据大小对16种非洲语言自然语言推理性能的影响。结果表明,缩放行为对语言敏感且通常非单调,挑战了常见的单调改进假设,并强调了需要为特定语言创建数据集以及更强的多语言策略。

隐藏的共识:人类反馈中的偏好有效性压缩

arXiv cs.CL

本文认为,标准RLHF将人类偏好标量化的做法导致多个有效解释被压缩为单一目标,从而在文化多元的社会中错误衡量对齐。通过对马来西亚数据集的分析,研究发现79%的提示词存在多个多数支持的回答,而这些回答在单一胜者聚合中被丢弃。