形式语义结构解释人类标注变异的程度有多大?:NLI中的群体级效应与项目级上限
摘要
本文利用ChaosNLI数据,衡量形式语义结构在多大程度上解释了自然语言推理(NLI)中的人类标注变异,发现了对熵的群体级效应,但存在项目级上限和空组合效应。
arXiv:2607.15870v1 Announce Type: new
摘要:自然语言推理中的人类标注变异日益被视为信号而非噪声,但形式语义结构在多大程度上解释了这种变异尚未被直接衡量。我们使用ChaosNLI的3,113个SNLI和MNLI项目进行了衡量,采用了基于规则的算子和单调性标注器(该标注器通过MED验证,编辑位置一致性为0.883,句子级摘要一致性为0.807),三个预注册分析模块,并完整报告了阴性结果。出现了三个界限。首先,群体级边界:非纯向上单调的假设显示出显著更高的标签熵(Cliff's delta = -0.284),基于秩次的检验在存在算子和长度缩减的情况下仍支持该效应,尽管有界结果敏感性检查削弱了长度防御的回归形式。其次,项目级上限:相同的形式轮廓仅解释了熵方差的3.3%至3.6%,中位数分割AUC为0.606,弱到无法识别高争议项目。第三,组合不变性:在边界两侧,针对验证错误份额和解释类型份额(VariErr、LiTEx)的三项高功效预注册对照均返回零结果。在此样本中,形式语义结构使标注者不一致的程度发生了微小变化,但未显著改变他们不一致的内容。ChaosNLI-S/M由原始一致性低的项目组成,每个声明都限于该范围。所有分析均预注册在版本控制的研究日志中,论文披露了审计追踪,包括一条修正的解释规则。
查看缓存全文
缓存时间: 2026/07/20 09:35
# 形式语义结构能解释多少人类标注变异?NLI中的群体层面效应与项目层面天花板 来源:https://arxiv.org/html/2607.15870 ###### 摘要 自然语言推理中的人类标注变异正日益被视为信号而非噪声,但形式语义结构能解释其中多少尚未被直接测量。我们基于 ChaosNLI 的 3,113 个 SNLI 和 MNLI 项目进行测量,使用一个基于规则的算子与单调性标注器(该标注器经过 MED 验证,在编辑位点一致性为 0.883,在句子层级摘要一致性为 0.807,我们的分析消耗后者)、三个预注册的分析模块,以及阴性结果的完整报告。三个边界浮现出来。首先,群体层面边界:非纯向上单调的假设显示出可靠更高的标注熵(Cliff's δ=−0.284),且基于秩的检验防御了该效应免受算子存在性和长度缩减的影响,尽管一个有界结果敏感性检查削弱了长度防御的回归形式。其次,项目层面天花板:相同的形式剖面仅能解释 3.3% 到 3.6% 的熵方差,中位数分割 AUC 达到 0.606,弱到不足以识别高分歧项目。第三,组成不变性:跨越该边界,三个高统计效力的预注册对比(关于验证误差份额和解释类型份额,VariErr、LiTEx)均返回空结果。在此样本中,形式语义结构使标注者分歧程度发生了少量偏移,但未检测到对分歧种类的改变。ChaosNLI-S/M 由选自原始低一致性的项目组成,每个结论都以该范围为前提。所有分析均在一个版本控制的研究日志中预注册,其审计轨迹(包括一条修正的解释规则)在本文中披露。 # 形式语义结构能解释多少人类标注变异?NLI中的群体层面效应与项目层面天花板 Haram Choi 不来梅大学 [email protected] ## 1 引言 自然语言推理(NLI)中的人类标注变异并非标注事故。Pavlick 和 Kwiatkowski (2019 (https://arxiv.org/html/2607.15870#bib.bib13)) 表明,文本推断判断中的分歧在增加标注密度后依然存在,且不能被简化为围绕单一真实标签的噪声。ChaosNLI (Nie 等,2020 (https://arxiv.org/html/2607.15870#bib.bib12)) 通过为每个项目收集 100 个标注,使该现象得以大规模测量,将每个项目的标签分布本身变为研究对象。日益增长的视角主义文献现在将此类变异视为需要建模和测量的信号,而非消除的对象(Plank,2022 (https://arxiv.org/html/2607.15870#bib.bib14); Uma 等,2021 (https://arxiv.org/html/2607.15870#bib.bib18))。 如果标签变异是一个测量目标,下一个问题是什么构成了它的结构。形式语义学是一个候选的结构来源。单调性、否定和量词定义了蕴涵判断在形式上受约束的环境,并且它们附带有专门的 NLI 基准(Yanaka 等,2019a (https://arxiv.org/html/2607.15870#bib.bib20),b (https://arxiv.org/html/2607.15870#bib.bib21))以及长期的模型评估传统。富含此类算子的项目是系统性分歧的天然嫌疑对象:它们的推断状态取决于范围和方向计算,而标注者可能以不同方式解决这些计算。然而,据我们所知,形式语义结构是否实际解释了 NLI 中的人类标注变异(无论是在量上还是在种类上)尚未被直接测量。本文以刻意量化的形式提出这个问题:NLI 软标签中的变异有多少与形式语义结构相关,并且跨越形式边界的分歧构成是否不同? 我们通过三个预先注册的分析模块在 ChaosNLI 上处理这个问题。一个基于规则的算子标注器(基于依存句法分析)为每个前提和假设分配否定、量词、NPI 和单调性触发剖面;该标注器在预注册的截断下与 MED 基准(Yanaka 等,2019a (https://arxiv.org/html/2607.15870#bib.bib20))的单调性类别达到 0.883 的一致性。将其应用于 ChaosNLI 的 3,113 个 SNLI 和 MNLI 项目,我们 (i) 比较跨单调性类别的标签分布熵和多数标签边距,(ii) 针对两个替代解释(仅算子存在性和句子长度/复杂度)对结果进行压力测试,以及 (iii) 在包含 498 个项目的与 VariErr(Weber-Genzel 等,2024 (https://arxiv.org/html/2607.15870#bib.bib19))和 LiTEx(Hong 等,2025 (https://arxiv.org/html/2607.15870#bib.bib6))的重叠部分上交叉验证边界,询问误差率和解释类型构成是否跨越该边界有所不同。 我们的贡献是三个测量,均以样本范围为前提:ChaosNLI-S/M 由选自原始低一致性的项目组成(恰好 3-out-of-5 多数),因此这里的效应可能相对于无限制的 NLI 数据有所衰减。首先,存在群体层面边界:单调性剖面非纯向上单调的假设显示出可靠更高的标注熵(向上类与其余类之间的 Cliff's δ=−0.284),并且这通过了预注册的针对算子存在性缩减以及长度和解析深度混杂因素的检验,尽管一个有界结果敏感性检查削弱了长度防御的回归形式(第 7 节 (https://arxiv.org/html/2607.15870#S7))。其次,该边界具有低项目层面天花板:相同的形式剖面仅能解释 3.3% 到 3.6% 的熵方差,中位数分割 AUC 达到 0.606,因此形式结构单独不能识别高分歧项目。第三,分歧的构成跨越边界不变:三个高统计效力的预注册对比(关于误差份额和解释类别份额)均返回空结果。综合来看,这些结果从上下限界定了形式语义结构在此样本中对人类标注变异的贡献:一个稳健的与分歧量的群体层面关联,但与分歧种类无检测到的关联,也没有值得依赖的项目层面预测能力。 我们强调过程透明性。本文中的每个确认性分析均在其结果计算前于版本控制的研究日志中预注册,包括结果变量、检验、多重性校正,以及一个基于统计效力的报告规则;阴性结果被完整报告。一个预注册的解释规则包含一个逻辑错误,我们在看到结果后进行了修正;第 7 节 (https://arxiv.org/html/2607.15870#S7) 披露了原始措辞、错误以及修正的时间。 ## 2 相关工作 ### 2.1 NLI中的人类标注变异 我们所基于的数据集形成一条谱系。ChaosNLI (Nie 等,2020 (https://arxiv.org/html/2607.15870#bib.bib12)) 对低一致性的 SNLI 和 MNLI 开发集项目进行了重新标注,每个项目 100 个标签。Jiang 和 de Marneffe (2022 (https://arxiv.org/html/2607.15870#bib.bib9)) 提出了 NLI 分歧来源的分类法,并将其识别框架为检测任务。LiveNLI (Jiang 等,2023 (https://arxiv.org/html/2607.15870#bib.bib10)) 增加了生态收集的解释。VariErr (Weber-Genzel 等,2024 (https://arxiv.org/html/2607.15870#bib.bib19)) 通过两轮验证设计,在 ChaosNLI-MNLI 的 500 个项目上分离了标注误差与真实变异。LiTEx (Hong 等,2025 (https://arxiv.org/html/2607.15870#bib.bib6)) 引入了针对标签内部变异的解释类型分类法,并对 VariErr 项目进行了标注;后续工作将其扩展到跨标签分歧 (Hong 等,2026 (https://arxiv.org/html/2607.15870#bib.bib7))。立场性工作主张将 NLI 歧义检测视为一级任务 (Jayaweera 和 Dorr,2025 (https://arxiv.org/html/2607.15870#bib.bib8))。我们的研究从一个不同角度消费了这条谱系:我们不提出分类法或检测器,我们测量一个独立定义的形式语义项目划分与这些资源所记录的变异之间的对齐程度。 ### 2.2 NLI中的单调性 单调性推理有专门的 NLI 基准:MED (Yanaka 等,2019a (https://arxiv.org/html/2607.15870#bib.bib20)) 提供 5,382 个项目,其金标签依赖于向上、向下或非单调环境;HELP (Yanaka 等,2019b (https://arxiv.org/html/2607.15870#bib.bib21)) 提供从单调性演算生成的训练对。这条路线评估模型对单调性的处理能力;我们将其基准反向利用,作为标注器的外部验证目标,然后将标签器的输出与人类标注变异相关联。我们的标注器通过改编之前工作中基于依存句法的分类模式(Choi,2026 (https://arxiv.org/html/2607.15870#bib.bib3))来执行算子约束下的标签分配,该之前工作在有限的依存半径内分类话语连接词,并报告了相关标注构念的 0.32 到 0.42 的人类验证 kappa。 ### 2.3 从项目特征解释分歧 与我们的问题最接近的是近期在其他任务中从项目层面特征预测或分析标注分歧的工作。Zhang 和 Çöltekin (2026 (https://arxiv.org/html/2607.15870#bib.bib22)) 预测冒犯性、仇恨和有毒语言感知中的项目层面评级方差,报告了与人类标注方差的中等相关性(在三个数据集上大约 0.3 到 0.45 的斯皮尔曼相关系数)。Maurer 等 (2026 (https://arxiv.org/html/2607.15870#bib.bib11)) 从语言项目特征和标注者特征对冒犯性评分的标注变异进行建模;在他们的回归中,许多存活的效应是语言特征(在其四个数据集中的两个上),而另外两个数据集则没有效应,他们得出结论:效应模式在不同数据集间差异很大。Abdulmumin 等 (2026 (https://arxiv.org/html/2607.15870#bib.bib1)) 发现标注速度和推文层面语言特征与情感语料库中的标注者间 kappa 没有有意义的关联,而一个过程变量(标注的时间同时性)占主导地位。因此,相邻任务的图景是混合且依赖数据集的,而非均匀地弱。对于 NLI,特别是对于形式语义特征,我们没有看到先前工作以方差解释的形式测量对标签变异的解释力;Jiang 和 de Marneffe (2022 (https://arxiv.org/html/2607.15870#bib.bib9)) 是最接近的工作,将问题框架为检测而非方差分解。那个测量正是本文填补的空白。 ## 3 数据与测量 ### 3.1 数据 我们使用 ChaosNLI (Nie 等,2020 (https://arxiv.org/html/2607.15870#bib.bib12)) 的 SNLI 和 MNLI-matched 部分:3,113 个项目(1,514 个 SNLI, 1,599 个 MNLI-m),每个项目都带有来自 100 个众包标注的关于蕴含、中立和矛盾的标签分布。我们排除了 AlphaNLI 部分,其溯因格式不支持前提-假设单调性分析。ChaosNLI-S/M 的一个范围属性支配着本文中的每个结论:Nie 等 (2020 (https://arxiv.org/html/2607.15870#bib.bib12), 第 3.1 节) 精确选择了那些原始多数标签“仅与五个单独标签中的三个一致”的开发集项目,这是一个有意选择的低一致性项目集。因此,我们的样本向高分歧方向存在范围限制,所有效应应被视为可能相对于无限制 NLI 数据有所衰减的样本内关联。对于跨数据集验证,我们使用 VariErr (Weber-Genzel 等,2024 (https://arxiv.org/html/2607.15870#bib.bib19)),其 500 个 MNLI 项目全部包含在 ChaosNLI-MNLI 中,并且其两轮设计将个体标签标记为误差或真实变异;以及 VariErr 项目的 LiTEx 标注 (Hong 等,2025 (https://arxiv.org/html/2607.15870#bib.bib6)),包含 1,799 个解释行,分为八个解释类别。ChaosNLI、VariErr 和 LiTEx 的三方重叠包含 498 个项目,全部来自 MNLI-m;有两个 VariErr 项目在 LiTEx 发布中缺失。 ChaosNLI 捆绑的 README 声明了 Creative Commons Non-Commercial 4.0 许可证,MED(第 3.3 节 (https://arxiv.org/html/2607.15870#S3.SS3))在 CC BY-SA 4.0 下发布,LiTEx 在 Apache 2.0 下发布,而 VariErr 仓库没有许可证文件。我们将所有四个数据集用于非商业研究,并且不重新分发任何数据集:复现仓库仅包含分析代码和一个从原始来源获取每个数据集(固定版本)的获取脚本。 ### 3.2 算子标注器 我们使用一个基于规则的算子剖面分析器(基于 spaCy 依存句法分析 en_core_web_trf)对每个前提和假设进行标注。标签集涵盖四个算子家族:句法否定(依存句法标记的否定词以及一个封闭的否定限定词和代词列表)、四个子类型的量词(全称、存在、基数数值、比例)、带有许可标志的负极性项(NPI),以及单调性触发词。单调性是近似的而非组合性的:一个封闭的下向蕴涵触发词库存(否定、few、little、without、全称量词的限定域、以及一个小的副词列表)和非单调触发词(比例和焦点算子,如 most、exactly 配合数词、以及 only)从触发词的依存子树投射出一个范围域,而标记层面的方向是支配性下向触发词的奇偶性,非单调支配优先。每个句子接收一个四向单调性摘要:当没有触发词时是向上,当仅存在该触发词类型时是向下或非单调,当下向和非单调触发词同时出现时是混合。该标注器故意设计为浅层,我们在限制部分列举了其排除项(词缀否定、自由选择与 NPI any、习语性 NPI、条件和疑问句环境、组合性极性传播)。 ### 3.3 针对MED的验证 我们针对 MED (Yanaka 等,2019a (https://arxiv.org/html/2607.15870#bib.bib20)) 的 5,382 个项目验证标注器,其元数据为每个项目分配一个向上、向下或非单调类别。发布文件包含 3,272 个向下、1,818 个向上、292 个非单调项目;论文表5打印了 3,270 个向下和 1,820 个向上,发布数据与发表表格之间存在两个项目的差异。我们全程使用发布文件。由于 MED 类别描述的是编辑位置的单调性而非整个句子,我们的主要指标读取标注器在编辑位点的方向:我们对齐前提和假设的标记序列,定位替换的跨度,过滤掉跨度内的触发词,并评估标注器在跨度句法头部方向。针对预注册的截断(总体 0.75,每类 0.60),当前标注器 (v0.3) 达到总体 0.883 的一致性(4,753/5,382),每类一致性分别为向上 0.874(1,589/1,818)、向下 0.882(2,887/3,272)、非单调 0.949(277/292)。一个更严格的句子层面摘要指标(一并报告以与早期标注器版本比较)达到 0.807。标注器经历了两个预注册的修订轮次(v0.1 到 v0.3);每次修订在重新测量前指定并记录,最终修订的主要代价是非单调触发词 only 的过度触发进入......
相似文章
选择塑造边界:在未选择的NLI群体中单调性与标签一致性的预注册重复研究
这项预注册的重复研究测试了NLI中单调性对标签一致性的影响是否从选定的低一致性项推广到未选择的群体,结果发现效应反转且很小,表明早期的发现依赖于选择。
同一位患者,不同的表述,不同的诊断?评估临床大语言模型的语义稳定性
本文提出了一种基于自然语言推理(NLI)的语义验证框架,用于评估临床大语言模型对保留语义的提示变化的敏感性,并引入了MVS、ΔC和WCI等度量指标。结果表明,领域专业化并不能持续提高鲁棒性,领域专用模型和通用模型的表现均参差不齐。
非洲语言NLI评估的样本量缩放
本文利用AfriXNLI基准测试,研究标注数据大小对16种非洲语言自然语言推理性能的影响。结果表明,缩放行为对语言敏感且通常非单调,挑战了常见的单调改进假设,并强调了需要为特定语言创建数据集以及更强的多语言策略。
神经坍缩是被禁止的:语言模型中的信息下限
本文认为,语言模型表示中的类内方差并非不完全的神经坍缩,而是分配的信息存储,且这种分配服从信息下限定律。在14个模型中,宏观类别结构仅承载4–12%的表示方差,而词元内上下文则占据79–91%。
SEA-NLI:以自然语言推理透视东南亚文化理解
介绍了SEA-NLI,一个基于文化的自然语言推理基准,涵盖八个东南亚国家,揭示了LLMs在特定文化知识上的低性能,尤其是在语言和科学/技术方面。结果表明,文化感知提示有所帮助,但思维链提升有限。