ShriNep@EEUCA 2026: RAKSHAK——基于理由蒸馏与Jigsaw增强训练的多任务DeBERTa毒性意图分类系统

arXiv cs.CL 论文

摘要

本文提出了RAKSHAK,一种结合了理由蒸馏和Jigsaw增强训练的多任务DeBERTa-v3框架,用于对《坦克世界》聊天话语中的毒性意图进行分类,在EEUCA 2026的GameTox共享任务中获得第七名。

arXiv:2607.20450v1 公告类型:新论文 摘要:本文介绍了针对ACL 2026的EEUCA研讨会上GameTox共享任务的两个系统,该任务要求将《坦克世界》聊天话语分类为六种细粒度的毒性意图类别(标签0-5)。严重的类别不平衡、特定领域的多语言俚语以及稀有类别(如威胁(标签4,60个样本)和极端主义(标签5,24个样本))数据极度匮乏,使得这一分类问题极具挑战性。我们的主要提交系统RAKSHAK(梵语意为“保护者”)是一个基于DeBERTa-v3-base(He等人,2022)的多任务框架,结合了来自Qwen2.5-14B(An等人,2024)的理由蒸馏、监督对比损失和专用的稀有类别二元分类头。RAKSHAK的训练数据通过来自Jigsaw毒性评论数据集(映射到标签1-4的16,225个样本)的跨领域迁移以及100个LLM生成的极端主义样本(标签5)进行增强。我们的辅助系统(M1)在原始GameTox数据加上相同的100个极端主义样本上使用Focal Loss微调DeBERTa-v3-base,未使用Jigsaw迁移。RAKSHAK在官方测试集上取得了0.5883的宏F1分数,在35个参赛队伍中排名第7,而M1的宏F1分数为0.5252。比较有/无Jigsaw数据的M1消融实验表明,跨领域迁移贡献了+2.6个F1点,而RAKSHAK的多任务架构进一步贡献了+3.7个点。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:16

# ShriNep@EEUCA 2026: RAKSHAK——基于理由蒸馏与拼图增强训练的多任务DeBERTa有害意图分类系统
来源:https://arxiv.org/html/2607.20450
Binayak Karki¹ https://orcid.org/0009-0001-2386-0578
Aryan Kafle² https://orcid.org/0009-0007-2251-2671
Pingala Ghimire³ https://orcid.org/0009-0008-6183-9834
¹尼泊尔Mechi Multiple Campus
²美国北肯塔基大学
³尼泊尔喜马拉雅工程学院
[email protected], [email protected], [email protected]

###### 摘要

本文为ACL 2026 EEUCA研讨会上的GameTox共享任务提交了两个系统,该任务要求将《坦克世界》游戏聊天中的话语分类为六种细粒度有害意图类别(标签0-5)。严重的类别不平衡、特定领域的多语言俚语,以及罕见类别(如威胁,标签4,60个样本;极端主义,标签5,24个样本)的数据极为稀缺,使得该分类问题极具挑战性。我们的主要提交系统RAKSHAK(rakṣaka,梵语中“保护者”之意)是一个多任务DeBERTa-v3-base(He等人,2022)框架,结合了来自Qwen2.5-14B(An等人,2024)的理由蒸馏、监督对比损失以及专用的罕见类别二分类头。RAKSHAK的训练数据通过跨领域迁移(来自Jigsaw有害评论数据集,映射到标签1-4的16,225个样本)和100个LLM生成的极端主义样本(针对标签5)进行了增强。我们的辅助系统(M1)在原始GameTox数据加上同样的100个极端主义样本上,使用Focal Loss微调DeBERTa-v3-base,未使用Jigsaw迁移。RAKSHAK在官方测试集上取得了0.5883的宏F1分数,在35支参赛队伍中排名第7,而M1取得了0.5252的宏F1分数。比较M1是否使用Jigsaw数据的消融实验表明,跨领域迁移贡献了+2.6 F1分,而RAKSHAK的多任务架构进一步贡献了+3.7分。

ShriNep@EEUCA 2026: RAKSHAK——基于理由蒸馏与拼图增强训练的多任务DeBERTa有害意图分类系统

Binayak Karki¹ https://orcid.org/0009-0001-2386-0578
Aryan Kafle² https://orcid.org/0009-0007-2251-2671
Pingala Ghimire³ https://orcid.org/0009-0008-6183-9834
¹尼泊尔Mechi Multiple Campus
²美国北肯塔基大学
³尼泊尔喜马拉雅工程学院
[email protected], [email protected], [email protected]

## 1 引言

多人在线游戏依赖游戏内聊天进行协作,但这些频道也承载着从脏话到极端主义内容的有害信息(Parihar等人,2021)。自动审核对玩家安全至关重要,但游戏聊天嘈杂、多语言,且严重偏向非有害消息,使得可靠分类难以实现(Thapa等人,2025)。

EEUCA 2026的GameTox共享任务(Hürriyetoğlu等人,2026;Thapa等人,2026)基于约53,000条《坦克世界》话语(标注为六种意图标签0-5,从非有害到极端主义)来评估这一挑战。系统按宏F1进行排名,强调在所有类别上的表现,包括训练样本极少的类别。

先前关于有害性检测的工作主要集中在社交媒体(Waseem和Hovy,2016;Davidson等人,2017),并且难以迁移到游戏语言,因为游戏语言中普遍存在行话、混淆和语码混合。像Jigsaw数据集(Jigsaw和Google,2018)这样的大规模标注工作展示了跨领域数据的价值,但社交媒体的语域与游戏聊天截然不同。在建模方面,来自大型LLM的知识蒸馏(Hinton等人,2015;Hsieh等人,2023;Magister等人,2023)、用于类别不平衡的Focal Loss(Lin等人,2017)以及监督对比学习(Khosla等人,2020)都显示出前景;思维链理由(Wei等人,2022)进一步表明,结构化的教师解释可以传递标签本身无法传递的推理。

我们在两个系统中运用这些技术:RAKSHAK(主要),一个多任务DeBERTa-v3-base框架,结合了来自Qwen2.5-14B的理由蒸馏、监督对比损失、罕见类别二分类头,以及通过Jigsaw迁移和LLM生成的极端主义样本进行的两阶段增强;以及M1(辅助),一个在较小增强集上使用Focal Loss微调的DeBERTa-v3-base模型。在游戏之外,LLM现在被用于错误分类会带来实际后果的环境中,从临床诊断(Yan等人,2025)到博物馆访客辅助(Guragain等人,2025b),使得可靠的内容审核成为远超本领域的一个关切。

## 2 相关工作

##### 有害性检测。

早期在线有害性检测的方法依赖于特征工程分类器(Waseem和Hovy,2016;Davidson等人,2017),而最近的工作转向在精心策划的数据集上微调预训练语言模型。结合多种多语言BERT模型的集成方法在仇恨言论检测的共享任务基准上显示出强劲结果,数据增强和类别不平衡处理是性能的关键贡献因素(Guragain等人,2025a)。大多数现有研究针对社交媒体平台,较少有研究解决游戏环境的独特挑战,其中语言被严重混淆、多语言且充满领域特定的行话(Parihar等人,2021)。GameTox数据集(Naseem等人,2025)是首批专门针对游戏聊天有害性的大规模资源之一。

##### 知识蒸馏和理由增强。

Hinton等人(2015)通过教师与学生模型之间的软logit匹配引入了知识蒸馏。最近,Hsieh等人(2023)提出了逐步蒸馏,其中大型教师生成自然语言理由,在训练学生时与输入拼接,使小型模型以更少的数据超越大型模型。Magister等人(2023)和Li等人(2023)展示了类似的理由蒸馏方法,用于向小型语言模型教授推理。我们的RAKSHAK框架遵循这一范式,使用Qwen2.5-14B(An等人,2024)作为教师,为DeBERTa-v3-base(He等人,2022)学生生成结构化理由。

##### 文本分类的对比学习。

监督对比损失(Khosla等人,2020)已被证明可以通过将同类嵌入拉近,同时将不同类嵌入推开,来提高表示质量。这在类别不平衡下特别有利,因为罕见类别样本通过显式的成对比较获得更强的梯度信号,而不是仅仅依赖与多数类别的交叉熵。

##### 不平衡分类的损失重加权。

Focal Loss(Lin等人,2017)最初为物体检测提出,通过降低易于分类样本的权重,将训练聚焦于难例。它此后被广泛用于不平衡文本分类任务,包括有害性检测,其中占主导地位的非有害类别可能会压倒标准的交叉熵训练。

## 3 背景与任务描述

### 3.1 任务设置

该共享任务在ACL 2026的第9届事件抽取与理解:挑战与应用研讨会(EEUCA)(Hürriyetoğlu等人,2026)中组织,属于CHiPSAL轨道。任务聚焦于《坦克世界》游戏内聊天话语的意图分类,玩家群体为全球分布的多语言用户。

给定游戏聊天中的一条话语u,系统必须预测一个意图标签y∈{0,1,2,3,4,5},如表1所定义。

表1:EEUCA 2026共享任务的有害性标签分类(Thapa等人,2026;Naseem等人,2025)。

### 3.2 数据集

GameTox数据集(Naseem等人,2025)包含来自《坦克世界》游戏内聊天日志的约53,000条话语,分为训练、验证和测试集,其中训练集有42,959个样本。标注模式改编自CrisisHateMM框架(Bhandari等人,2023)。该数据集表现出极端的类别不平衡:标签0(非有害)占训练数据的80%以上,而标签5(极端主义)仅有24个样本,标签4(威胁)有60个。语料库是多语言的,包含主要是英语的话语,以及波兰语、俄语、德语、法语和其他反映全球玩家群体的语言。

## 4 系统描述

### 4.1 数据增强

我们采用两种数据增强策略,针对代表性不足的有害类别,遵循更广泛的观察:在仇恨言论共享任务中,增强对于罕见类别性能至关重要(Guragain等人,2025a)。两种策略都用于RAKSHAK;M1仅使用LLM生成的极端主义样本(第4.1.2节)。

#### 4.1.1 从Jigsaw进行跨领域迁移

为了丰富RAKSHAK稀缺的领域内有毒样本,我们整合了Jigsaw有害评论分类数据集(Jigsaw和Google,2018)的数据,将其多标签有害性标注映射到GameTox意图分类,如表2所示。为了验证映射,我们从每个Jigsaw类别中抽取了10个示例,并独立提示两个LLM(Gemini 1.5 Pro和Grok)分配GameTox标签;两个模型对所有类别的映射结果一致。Jigsaw数据集还包含一个大的非有害类别,自然映射到GameTox标签0;然而,我们排除了这些样本,因为标签0已经严重过度代表。对于标签5(极端主义),没有合适的Jigsaw类别。对于具有多个活跃Jigsaw标签的样本,我们分配最严重的GameTox标签(例如,同时被标记为“obscene”和“threat”的样本映射到标签4)。经过映射和去重后,我们获得了跨标签1-4的16,225个额外样本。

表2:从Jigsaw标签到GameTox类别的映射(见表1)。非有害样本被排除。没有Jigsaw类别映射到极端主义。

| Jigsaw标签 | GameTox | 样本数 |
|------------|---------|--------|
| toxic, obscene, insult | 标签1 | 6,500 |
| other_offensive | 标签2 | 7,940 |
| severe_toxic, identity_hate | 标签3 | 1,307 |
| threat | 标签4 | 478 |
| non-toxic | 标签0 | 排除 |
| (无映射) | 标签5 | — |

#### 4.1.2 LLM生成的极端主义样本

标签5(极端主义)没有Jigsaw对应类别,仅剩24个领域内训练样本。我们通过一个四步流水线生成100个合成极端主义样本:

1. 关键词挖掘:从现有的标签5训练样本中提取与极端主义相关的关键词(侮辱性词汇、政治参考、激进化术语)。
2. 关键词扩展:使用Grok生成形态变体、混淆拼写和语义相关术语,扩展种子关键词列表。
3. 句子生成:提示Qwen2.5-14B(An等人,2024),提供描述GameTox共享任务和Naseem等人(2025)对极端主义定义的任务特定指令。为了绕过安全过滤器,极端主义关键词在提示中被替换为占位符标记(例如[WORD1], [WORD2]),Qwen生成包含这些占位符的句子框架。Qwen2.5-14B被选为能够在我们的计算约束下通过Ollama本地服务的最强开放权重模型,支持无需依赖闭源API的可复现性。提示模板见附录A。
4. 关键词注入:将生成的句子中的占位符标记替换为步骤1和2中的真实极端主义关键词。

该流水线解决了在研究目的下生成有害内容时的数据稀缺和LLM安全拒绝的双重挑战。M1和RAKSHAK都使用了这100个极端主义样本。我们注意到,这些样本并未经过与官方测试集的精确字符串重叠验证;这在我们的局限性中予以承认。

表3总结了每个系统的训练数据组成。

表3:训练数据组成。M1使用原始GameTox数据加上100个LLM生成的极端主义样本。RAKSHAK额外整合了跨标签1-4的16,225个Jigsaw迁移样本。

### 4.2 M1:带Focal Loss的DeBERTa-v3-base

我们的辅助系统在原始GameTox训练数据加上100个LLM生成的极端主义样本(第4.1.2节)上,微调DeBERTa-v3-base(He等人,2022)作为单阶段六类意图分类器。分类头是一个线性层,基于[CLS]表示产生6类logits,使用Focal Loss(Lin等人,2017)(γ=2.0)进行训练,以降低易于分类的多数类别样本的权重,并将梯度更新导向难例、少数类别样本。模型训练5个epoch,学习率2e-5,批量大小32,梯度裁剪1.0。模型选择基于在90/10训练-验证分割(种子=42)上的最佳验证宏F1。推理时,模型在一次前向传递中直接预测所有六个标签。

### 4.3 RAKSHAK:多任务理由蒸馏框架

RAKSHAK是我们的主要系统。它将DeBERTa-v3-base骨干扩展为多任务学习框架,通过三种机制解决类别不平衡:(1) 来自教师LLM的理由增强知识蒸馏,遵循Hsieh等人(2023)的“蒸馏然后训练”范式;(2) 专用的罕见类别二分类器;(3) 在共享嵌入空间上的监督对比损失(Khosla等人,2020)。与M1不同,RAKSHAK在完整增强数据集上进行训练,包括Jigsaw迁移的样本。

相似文章