标签
本文利用ChaosNLI数据,衡量形式语义结构在多大程度上解释了自然语言推理(NLI)中的人类标注变异,发现了对熵的群体级效应,但存在项目级上限和空组合效应。
本文介绍了两个新的捷克语语料库Hlava Cor和Hlava AD,旨在研究共指与篇章关系中人工标注的变异性。这些语料库包含多重标注和标注者解释,实现了60-65%的标注者间一致性,并揭示了理解上的系统性差异。
Ghost Annotator框架结合了共形预测与协同过滤,对内容审核中的LLM行为与人类标签变化进行建模,揭示了大型模型中存在的结构性人口统计偏见。