攻击性语言检测的跨域泛化代价

arXiv cs.CL 论文

摘要

本文提出了一个用于攻击性语言检测中跨域和跨语言泛化的诊断与优化框架,将性能下降分解为数据集效应和语言效应,并量化了多语言能力与源任务性能之间的权衡。

arXiv:2607.23512v1 公告类型:新 摘要:攻击性语言检测模型在跨数据集和跨语言部署时通常会遇到性能下降,但现有研究大多止于报告这一现象,缺乏将性能下降原因分解为可归因成分并量化修复代价的系统方法。本文提出了一个由三个协调技术组件构成的诊断与优化框架。首先,一种零样本迁移损失分解方法,将OLID到MLMA的性能下降分离为两个独立可测量的成分,即数据集效应和语言效应。其次,一种受控微调协议,通过比较持续微调与冷启动起点下的少样本学习曲线,量化适应效率以及对源任务的潜在损害。第三,三种结合温度采样和经验重放的联合训练策略,可在提升多语言能力与保持源任务性能之间提供可控的帕累托权衡。基于该框架的实验表明,数据集效应主导了零样本迁移损失,且其影响远超语言效应。无经验重放的少样本适应虽然数据效率高,但对源任务的损害是联合训练策略的4到9倍,且其损害幅度高度不稳定。三种联合训练策略以3.2到4.1个百分点的源任务性能为代价,换取了8.1到42.6个百分点的多语言能力提升,形成了清晰可控的帕累托权衡。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:29

# 攻击性语言检测的跨域泛化代价

来源:https://arxiv.org/html/2607.23512

**任瑞星,赵军辉,孙晓珂,李秋萍**
任瑞星、赵军辉与北京交通大学电子信息工程学院,北京100044,中国。
(电子邮箱: [email protected]; [email protected])
孙晓珂、李秋萍与国家计算机网络应急技术处理协调中心(CNCERT/CC),北京100029,中国。
(电子邮箱: [email protected]; [email protected])

###### 摘要

攻击性语言检测模型在跨数据集和跨语言部署时通常会出现性能下降,然而现有研究大多止步于报告这一现象,缺乏系统的方法论来将性能下降的原因分解为可归因的组成部分,并量化修复成本。本文提出一个由三个协调技术组件组成的诊断与优化框架。首先,一个零样本迁移损失分解方法,将从OLID到MLMA的性能下降分解为两个独立可测量的组件,即数据集效应和语言效应。其次,一个受控微调协议,通过比较在持续微调和冷启动起点下的少样本学习曲线,同时量化适应效率和对源任务的隐藏损害。第三,三种结合温度采样和经验回放的联合训练策略,在提升多语言能力和保持源任务性能之间提供可控的帕累托权衡。基于该框架的实验表明,数据集效应主导了零样本迁移损失,并显著超过语言效应。没有回放机制的少样本适应尽管数据高效,但对源任务造成的损害是联合训练策略的4到9倍,且损害幅度高度不稳定。三种联合训练策略以3.2到4.1个百分点的源任务性能为代价,换取8.1到42.6个百分点的多语言能力增益,形成清晰且可控的帕累托权衡。四个方法学上不同的实验汇聚到同一结论:控制跨语言泛化的主导因素是目标语言数据本身的类别平衡性,而非语言之间的类型学距离。相关代码可在 https://github.com/renruixing/The-Cross-Domain-Generalization-Cost-of-Offensive-Language-Detection 找到。

## I. 引言

社交媒体的全球传播使得自动检测攻击性语言、仇恨言论及相关有害内容成为内容安全治理的核心技术组成部分[1, 2]。然而在实际部署中,检测模型很少只遇到与其训练数据分布和语言相同的输入[3]。内容审核系统通常需要同时服务多个语言社区,并覆盖来自不同平台的用户生成内容,而可用于训练的高质量标注数据往往集中在单个数据集和单种语言中。模型一旦迁移到新的数据源或新的语言,其可靠程度直接决定了系统能否真正投入实用。

这种部署差距在攻击性语言检测文献中已有一定研究,但现有工作分为三个相对独立且很少交叉的脉络。第一条脉络关注跨数据集泛化。Swamy等人[4]在四个英文攻击性语言数据集上进行交叉评估,报告宏F1下降幅度从2到30个百分点不等,跨度很大。Nejadgholi和Kiritchenko[5]将这种下降归因于两个原因:主题偏差,指不同数据集在采集渠道和主题分布上的系统性差异;以及任务定义偏差,指攻击性内容的操作定义本身在不同数据集之间存在差异。Yin和Zubiaga[6]的系统综述进一步指出,大多数工作集中在报告现象,对性能差距是否可以修复的考察相对较少。

第二条脉络关注跨语言迁移本身。多语言BERT(mBERT)[7]通常被认为其零样本跨语言迁移能力来自共享子词词汇表和相似句法结构,而非来自显式的跨语言对齐监督[8]。Nozza[9]在英语、意大利语和西班牙语上进行了零样本仇恨言论迁移实验,发现模型会将目标语言的禁忌词误分类为仇恨信号,表明零样本迁移不能直接使用,需要精心设计。Pamungkas等人[10]尝试通过结合多语言词汇知识注入的联合学习方法缓解此问题,但未讨论该方法对源语言任务(英语)性能的影响。

第三条脉络与前两条很少交叉。Conneau等人[11]在XLM-R研究中引入了多语言诅咒的概念,指出当模型参数容量固定时,覆盖更多语言会稀释分配给任何单一语言的有效表示容量;然而这种代价从未在具体任务(如攻击性语言检测)上被直接测量。Röttger等人[12]在五种非英语语言上系统研究了将攻击性语言检测扩展到低资源语言所需的目标语言微调数据量,发现少量目标语言数据足以达到强性能,且增益随数据增加呈指数衰减;但该研究未考察这一微调过程对源语言任务(英语)性能的影响。这一方向的工作仍在继续;Ghorbanpour等人[13]提出通过跨语言最近邻检索来增强少量目标语言标注数据,同样未涉及源语言性能的代价。灾难性遗忘本身最早由French[14]系统阐述,De Lange等人[15]的持续学习综述进一步表明,基于经验回放的方法可以减轻模型在新分布上继续训练时对原始任务造成的损害;但该机制此前未被引入攻击性语言检测的跨语言训练场景。

跨数据集泛化研究追问性能下降应归因于什么;跨语言迁移和联合训练研究追问修复是否有效以及代价如何;但三个脉络都没有提供同时考察这两个问题的框架。跨数据集泛化研究提供了归因概念但缺乏量化分解方法;跨语言迁移研究报告了零样本失败但未系统考察少样本修复的收益和代价;多语言诅咒和经验回放都有理论支持但从未在同一实验设计中被直接量化和比较。表I将本文与代表性前期工作在六个维度上进行了比较。

表I:与代表性前期工作的比较

| 工作 | 跨数据集 | 跨语言 | 效应分解 | 少样本可恢复性 | 遗忘量化 | 联合训练比较 |
|------|----------|--------|----------|----------------|----------|----------------|
| Swamy等人[4] | ✓ | × | × | × | × | × |
| Nejadgholi & Kiritchenko[5] | ✓ | × | 概念性 | × | × | × |
| Nozza[9] | × | ✓ | × | × | × | × |
| Röttger等人[12] | × | ✓ | × | 数据量分析 | × | × |
| Pamungkas等人[10] | × | ✓ | × | × | × | 知识注入 ✓ |
| **本文** | ✓ | ✓ | ✓ | ✓ | ✓ | 三种策略 ✓ |

在转向所提出的框架之前,有必要回应一个由基于提示的大语言模型(LLM)近期进展引发的问题:简单地提示LLM是否能绕过上述差距?证据表明并非如此。Plaza-del-Arco等人[16]显示,使用LLM进行零样本提示在某些仇恨言论基准上可以达到与微调模型相当的性能,后续研究已将此方向扩展到多语言和低资源场景[17]。然而,Edwards和Camacho-Collados[18]在16个文本分类数据集上的大规模评估发现,微调的掩码语言模型在大多数任务上仍优于少样本提示的生成式模型,而Fasching和Lelkes[19]记录了基于LLM的系统之间审核决策存在显著不一致,两者都无法提供本文所针对的数据集与语言分解或适应成本量化。基于LLM的审核还意味着每个输入更高的推理成本,这对于必须对每个传入帖子进行评分的管道是一个重大障碍。因此,紧凑的微调编码器仍然是部署相关的范式,下面的框架即在该范式内开发。

为弥补这一差距,本文提出一个集诊断、适应和优化于一体的综合框架,以在英文攻击性语言数据集OLID[20]上训练的三级级联检测模型为基础,系统地表征并减轻其在覆盖英语、法语和阿拉伯语的多语言仇恨言论数据集MLMA[21]上的跨数据集和跨语言泛化损失。本文的主要贡献总结如下:

* •一种诊断性实验设计,通过控制语言变量,将零样本迁移性能损失分解为数据集效应分量和语言效应分量,而非仅仅报告聚合的性能下降。
* •通过对比在已训练模型上以持续微调起点和在原始预训练模型上以冷启动起点进行少样本学习曲线,本文揭示出少样本适应在提升目标域性能的同时,对源任务性能造成的隐藏损害远大于联合训练方法,且该损害高度不稳定。
* •通过比较三种语言联合训练策略,本文首次通过直接受控实验量化了多语言诅咒在攻击性语言检测任务上的具体代价,并为面向实际部署的策略选择提供了依据。

本文其余部分组织如下:第二部分(II节)描述数据集、基线模型及三个实验的设计;第三部分(III节)呈现实验结果与分析;第四部分(IV节)总结本文。

## II. 方法

### II-A 方法概述

本文的实验设计围绕一个共同的起点展开:在英文OLID数据上训练的基线级联模型,其训练细节在II-C节中给出;随后从三个互补角度考察该模型在多语言MLMA数据上的行为。第一个角度是II-D节的诊断,仅利用基线模型的零样本评估结果,将性能损失分解为数据集效应分量和语言效应分量,回答损失来自何处的问题。第二个角度是II-E节的适应,在诊断结果基础上,通过对比持续微调起点和冷启动起点下的学习曲线,追问能否用少量目标语言数据修复损失及其代价。第三个角度是II-F节的优化,跳出少样本设置,利用完整候选池训练三种联合策略,追问如果不是仅仅修补损失,而是积极获取可用的多语言能力,该如何训练,代价如何。三个角度共享II-B节所述的数据划分和II-G节所述的评估指标,使得诊断、适应和优化实验的结果可以放在同一张表中直接比较,这也是III-E节交叉验证的前提。

### II-B 数据集与标签映射

本文使用两个真实公开数据集。OLID[20]是一个英文攻击性语言数据集,清洗后包含13,203个示例,采用三级标注方案:子任务A判断内容是否具有攻击性,标签为OFF或NOT;子任务B判断攻击是否针对可识别目标,标签为TIN或UNT;子任务C判断目标类型,标签为IND、GRP或OTH,分别对应个人、群体和其他。本文按9:1分层抽样划分训练集和验证集;官方测试集用于最终报告,其中子任务A包含860个示例,子任务C包含213个示例。

MLMA[21]是一个覆盖英语、法语和阿拉伯语的仇恨言论数据集,清洗后分别包含5,586、4,006和3,350个示例。原始标注字段包括敌意类型字段sentiment,其值是来自normal、offensive、abusive、hateful、disrespectful和fearful的多标签组合;以及目标群体字段group,其值包括individual、other和特定群体名称。由于MLMA的标注方案与OLID的三级方案不完全对齐,本文仅进行以下映射:

* •子任务A:将sentiment字段拆分为标签集;若该集等于单元素normal则映射为NOT,否则映射为OFF。

相似文章

语言模型中跨语言泛化的体外研究

arXiv cs.CL

本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。

基于双阈值难例挖掘的跨平台中文攻击性评论检测

arXiv cs.CL

本文提出了一种用于跨平台中文攻击性评论检测的双阈值难例挖掘策略,以解决因领域偏移导致的性能下降问题。该方法在COLD数据集上微调RoBERTa模型,并利用极少数标记数据将其适应于四个中文社交媒体平台。

多语言语言模型中有毒内容检测与缓解策略综述

arXiv cs.CL

本综述综合了关于多语言大语言模型中有毒内容检测与去毒化研究,梳理了威胁模型、任务形式、检测方法和缓解策略,同时指出了持续存在的挑战,如语言覆盖不均衡以及危害定义的文化依赖性。