层级攻击性语言检测中的级联模型与联合模型对比

arXiv cs.CL 论文

摘要

本文比较了层级攻击性语言检测中的级联模型与联合多任务模型,发现级联架构以增加参数和推理延迟为代价获得了更高的准确率,并且类别不平衡处理策略应通过消融实验进行验证。

arXiv:2607.16790v1 公告类型:新 摘要:细粒度的攻击性语言检测将标签组织成层级结构,对此存在两种建模范式:级联分解和联合多任务建模。以往的工作很少提供这两种范式在准确率、参数量和推理延迟方面的直接、受控比较,也很少验证所选的类别不平衡处理策略是否真正最优。本文提出一个三级级联检测系统,其训练策略针对每个子任务进行定制,并包含两种验证机制。首先,通过受控消融实验确定每个子任务的最佳类别不平衡处理策略。其次,训练一个带有共享编码器的联合多任务模型作为架构控制,从而在准确率、参数量和推理延迟维度上获得真实测量结果。实验表明,级联系统在官方测试集的三个子任务上分别取得了0.795、0.716和0.557的宏F1分数。消融实验揭示,仅凭不平衡程度直觉配置损失函数并非最优;根据消融结果重新配置可提升性能和稳定性。端到端级联评估显示,级联流水线中约五分之一的错误来自第一级过滤器,且无法被后续阶段纠正。与联合多任务模型相比,级联架构在所有三个子任务上均取得了更高的准确率,在最严重不平衡的子任务上宏F1提升了7.1个点,但代价是参数量增加两倍,推理延迟增加0.67倍。这些结果共同揭示了级联架构准确率优势与其部署成本之间明确、可量化的权衡关系。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:43

# 层级式与联合建模在层次化冒犯性语言检测中的对比

来源: https://arxiv.org/html/2607.16790
Ruixing Ren, Junhui Zhao, Xiaoke Sun (通讯作者: Junhui Zhao.) Ruixing Ren, Junhui Zhao 来自北京交通大学电子与信息工程学院,北京 100044,中国。Xiaoke Sun 来自国家计算机网络应急技术处理协调中心 (CNCERT/CC),北京 100029,中国。

###### 摘要

细粒度冒犯性语言检测将标签组织成层次结构,对此存在两种建模范式:级联分解和联合多任务建模。先前的工作很少对这两种范式在准确率、参数量和推理延迟方面进行直接、受控的比较,也很少验证所选的类别不平衡处理策略是否真正最优。本文提出了一个三级级联检测系统,其训练策略为每个子任务定制,并配备两种验证机制。首先,通过受控消融研究确定每个子任务的最佳类别不平衡处理策略。其次,训练一个带有共享编码器的联合多任务模型作为架构控制,从而在准确率、参数量和推理延迟等维度上获得真实测量结果。实验表明,级联系统在官方测试集的三个子任务上分别达到了0.795、0.716和0.557的宏F1分数。消融研究揭示,仅凭不平衡严重程度的直觉来配置损失函数是次优的;根据消融结果重新配置可同时提高性能和稳定性。端到端级联评估显示,级联流水线中大约五分之一的错误源自第一级过滤器,且无法被后续阶段纠正。与联合多任务模型相比,级联架构在所有三个子任务上均取得了更高的准确率,在最严重不平衡的子任务上获得了7.1个点的宏F1提升,代价是参数量增加两倍,推理延迟增加1.67倍。这些结果共同明确了级联架构在准确率优势与部署成本之间的可量化权衡。

## 引言

社交媒体平台上冒犯性内容的自动检测仍然是内容安全治理的核心技术挑战[1]。该领域的检测方法已从传统机器学习逐步发展到微调预训练语言模型(如BERT),但研究仍高度集中于英语,并且细粒度、多层次的冒犯性语言判断所获得的系统性验证明显少于粗粒度二分类[2]。与简单的二分类判断相比,细粒度检测(即同时判断内容是否冒犯、冒犯是否针对可识别实体、以及目标是个人还是群体)能够为审核员提供更具可操作性的指导[3,4]。这种细粒度标签方案自然形成层级结构,而如何为此结构选择合适的建模范式,以及如何处理层级越深越严重的类别不平衡问题,仍然是一个探索不足的工程问题。

在任务方面,Zampieri等人[5,6]引入的OLID数据集及其三级标注方案是该方向使用最广泛的基准之一,后来的多语言扩展[7]进一步证实了该标注框架的通用性。在类似的细粒度冒犯内容判断任务上,近期系统继续将集成方法与微调相结合。Ganguly等人[8]在2024年多模态仇恨言论检测任务中使用了XLM-RoBERTa结合多模型集成,在识别和目标定位两个子任务上均排名第三;Guragain等人[9]在2025年针对梵文仇恨言论检测集成了多种多语言BERT变体,并专门应用回译增强来处理类别不平衡。所有这些系统都针对单一层级设计,并未涉及层级本身的建模范式选择。

对于层级化标签结构,存在两种建模范式——这一区分由Silla和Freitas[10]的层级分类综述正式提出:局部分类器方法对应于级联分解,为每一层训练独立的分类器,前一层的预测决定样本是否进入下一层;而全局分类器方法对应于联合多任务建模,使用单一模型同时预测所有层级。Dai等人[11]针对本文相同的三级OLID任务提出了共享编码器的联合多任务方法,利用子任务间相互增强的监督,仅使用OLID数据就达到了与当年最佳系统接近的结果。Mnassri等人[12]将联合多任务学习与外部情感特征相结合,分别使用BERT和多语言BERT解决单语和跨语言环境下的冒犯内容检测,缓解了标签不平衡和稀缺问题。Saha等人[13]进一步将联合建模扩展到2025年孟加拉语仇恨言论识别任务中同时预测类型、目标和严重程度,该结构与三级OLID方案高度相似。这些工作都验证了联合建模的有效性,但联合建模与级联分解在准确率、参数量和推理延迟上的真实权衡尚未得到直接检验。

同时,层级的更深层往往样本更少且类别不平衡更严重;OLID三级方案的第二层不平衡比已达到7.5比1。类别不平衡是机器学习中长期研究的问题,Johnson和Khoshgoftaar[14]综述了深度学习中的各种补救措施,大致分为重采样训练分布(如Chawla等人[15]提出的SMOTE过采样方法)和重加权每个样本的损失贡献(如Lin等人[16]提出的Focal Loss)。前面提到的Guragain等人[9]的系统也专门为此问题设计了增强方案。然而,如何针对不同层级和不同程度的不平衡选择合适的策略,在大多数先前工作中仅凭不平衡率的直觉来决定,而非通过系统消融来验证。

这三个空白——即层级建模范式之间缺乏真正的多维比较、类别不平衡处理策略缺乏系统验证、以及层级间错误传播缺乏定量分析——共同推动了本工作。表I(第1页)在五个维度上比较了具有代表性的先前工作与本文。

**表I: 与代表性先前工作的比较**
| 工作 | 级联 | 联合比较 | 损失消融 | 端到端错误 | 参数量/延迟 |
|------|------|----------|----------|------------|--------------|
| Zampieri等人[5,6] | 层级协议 | × | × | × | × |
| Dai等人[11] | × | 仅联合模型 | × | × | × |
| Mnassri等人[12] | × | 仅联合模型 | × | × | × |
| Saha等人[13] | × | 仅联合模型 | × | × | × |
| **本文** | ✓ | ✓ | ✓ | ✓ | ✓ |

为填补这些空白,本文提出了一个三级级联冒犯性语言检测系统,其训练策略为每个子任务定制,并系统性地验证了设计选择的有效性。本文的贡献总结如下。

- **任务自适应的类别不平衡处理方案**。为每个子任务独立选择损失函数,并将Focal Loss的类别权重向量化而非留作标量;结合受控变量消融协议,纠正了仅凭不平衡严重程度直觉配置策略的做法。
- **带任务门控的联合多任务控制模型**。一个依赖于上层真实标签的门控项屏蔽无效的损失贡献,使得级联架构与联合模型在相同实验条件下可比,并在准确率、参数量和推理延迟维度上获得真实测量。
- **双层评估协议**。在现有的每任务标准评估之外,引入端到端级联评估,其中模型自身的预测逐层传播,将系统的最终错误归因到特定子任务阶段。

本文其余部分组织如下。第二节描述数据、模型架构和实验设计。第三节呈现实验结果和分析。第四节总结本文并讨论其局限性。

## 方法

### II-A 方法概述

所提出的冒犯性语言检测系统由三个协同工作的组件构成,数据流和训练流水线如图1所示。在数据层面,输入文本在OLID三级标注方案(第II-B节)下组织成三个层级依赖的子任务:判断是否冒犯、判断冒犯是否针对可识别实体、以及判断目标的类型。在模型层面,每个子任务拥有独立的分类头,该分类头接收共享主干(第II-C节)产生的语义表示,并按第II-D节所述将其映射为类别概率分布;该分布随后作为第II-E节中任务自适应损失函数的输入,驱动分类头的梯度更新,每个子任务损失函数的具体形式由第II-H节的消融协议确定。作为定量控制,第II-F节引入一个带任务门控的联合多任务模型,该模型保持其他所有设置不变,仅改变架构,从而将任何准确率差异明确归因于建模范式。第II-G节给出所有模型共享的训练细节。最后,第II-I节的双层评估协议从标准基准角度和端到端级联角度量化系统性能。

### II-B 数据与三级标签方案

本文使用OLID[5]数据集,清洗后包含13,203条英文推文,按9:1划分为训练集和验证集,分别有11,882和1,321个样本,并有一个独立的官方测试集用于最终报告,其中子任务A、B、C分别包含860、240和213个样本。该数据集遵循三级标注方案:子任务A判断是否冒犯,标签为OFF或NOT,在训练集中占比分别为33.3%和66.7%;子任务B仅对OFF样本标注,判断冒犯是否针对可识别实体,标签为TIN或UNT,占比分别为88.2%和11.8%;子任务C仅对TIN样本标注,判断目标类型,标签为IND、GRP或OTH(分别表示个人、群体或其他),占比分别为62.3%、27.3%和10.3%。三个子任务的不平衡比分别约为2:1、7.5:1和6:1,各不相同,这种差异正是本文为每个任务定制训练策略的直接动机。

### II-C 主干模型

本文使用`bert-base-uncased`[17]作为共享语义主干,将输入文本编码为固定维度的上下文表示;三个子任务的分类头独立训练。主干不参与第II-B节描述的层级决策逻辑,仅为每个分类头提供统一的语义特征;分类头结构和概率映射见第II-D节。

### II-D 级联分类头与概率计算

三个子任务共享相同的分类头结构,其输入是第II-C节所述主干产生的`[CLS]`表示 \( h \in \mathbb{R}^{768} \),输出是该子任务的类别概率分布。分类头首先应用Dropout[18]然后应用一个全连接层,将 \( h \) 映射为长度为 \( K \) 的原始分数向量 \( z \),再通过Softmax函数转换为类别概率分布 \( \mathbf{p} = [p_1, \dots, p_K] \):

\[
z = Wh + b, \qquad p_i = \frac{e^{z_i}}{\sum_{j=1}^K e^{z_j}} \tag{1}
\]

其中 \( K \) 是该子任务的类别数,子任务A和B为2,子任务C为3。该概率分布 \( \mathbf{p} \) 有两个用途。训练期间,它作为第II-E节所述损失函数的输入,衡量预测与真实值之间的偏差,并驱动模型参数的梯度更新;推理期间,取最大值的类别索引作为该子任务的预测,并在级联结构下决定是否调用下一个子任务。完整的级联推理过程见算法1,其中 \( \text{argmax}(\cdot) \) 返回概率最高的类别索引,\( M_A, M_B, M_C \) 分别表示三个子任务的训练模型。

**算法1 三级级联推理**
0: 输入文本 \( x \);子任务模型 \( M_A, M_B, M_C \)
0: 三级预测 \( (\hat{y}_A, \hat{y}_B, \hat{y}_C) \)
1: \( p_A \leftarrow M_A(x) \)

相似文章

攻击性语言检测的跨域泛化代价

arXiv cs.CL

本文提出了一个用于攻击性语言检测中跨域和跨语言泛化的诊断与优化框架,将性能下降分解为数据集效应和语言效应,并量化了多语言能力与源任务性能之间的权衡。

基于多传感器物理危害评估的大语言模型基准测试

arXiv cs.AI

该论文对五个大语言模型在多传感器物理危害评估中的表现进行了基准测试,结果发现,当多个传感器同时升高但均未达到各自安全限值时,所有被测试模型均未能发出预警信号,而在单传感器违规检测中则表现出近乎完美的准确性。