ShriNep@EEUCA 2026: RAKSHAK——基于理由蒸馏与Jigsaw增强训练的多任务DeBERTa毒性意图分类系统
摘要
本文提出了RAKSHAK,一种结合了理由蒸馏和Jigsaw增强训练的多任务DeBERTa-v3框架,用于对《坦克世界》聊天话语中的毒性意图进行分类,在EEUCA 2026的GameTox共享任务中获得第七名。
arXiv:2607.20450v1 公告类型:新论文
摘要:本文介绍了针对ACL 2026的EEUCA研讨会上GameTox共享任务的两个系统,该任务要求将《坦克世界》聊天话语分类为六种细粒度的毒性意图类别(标签0-5)。严重的类别不平衡、特定领域的多语言俚语以及稀有类别(如威胁(标签4,60个样本)和极端主义(标签5,24个样本))数据极度匮乏,使得这一分类问题极具挑战性。我们的主要提交系统RAKSHAK(梵语意为“保护者”)是一个基于DeBERTa-v3-base(He等人,2022)的多任务框架,结合了来自Qwen2.5-14B(An等人,2024)的理由蒸馏、监督对比损失和专用的稀有类别二元分类头。RAKSHAK的训练数据通过来自Jigsaw毒性评论数据集(映射到标签1-4的16,225个样本)的跨领域迁移以及100个LLM生成的极端主义样本(标签5)进行增强。我们的辅助系统(M1)在原始GameTox数据加上相同的100个极端主义样本上使用Focal Loss微调DeBERTa-v3-base,未使用Jigsaw迁移。RAKSHAK在官方测试集上取得了0.5883的宏F1分数,在35个参赛队伍中排名第7,而M1的宏F1分数为0.5252。比较有/无Jigsaw数据的M1消融实验表明,跨领域迁移贡献了+2.6个F1点,而RAKSHAK的多任务架构进一步贡献了+3.7个点。
查看缓存全文
缓存时间: 2026/07/24 05:16
# ShriNep@EEUCA 2026: RAKSHAK——基于理由蒸馏与拼图增强训练的多任务DeBERTa有害意图分类系统 来源:https://arxiv.org/html/2607.20450 Binayak Karki¹ https://orcid.org/0009-0001-2386-0578 Aryan Kafle² https://orcid.org/0009-0007-2251-2671 Pingala Ghimire³ https://orcid.org/0009-0008-6183-9834 ¹尼泊尔Mechi Multiple Campus ²美国北肯塔基大学 ³尼泊尔喜马拉雅工程学院 [email protected], [email protected], [email protected] ###### 摘要 本文为ACL 2026 EEUCA研讨会上的GameTox共享任务提交了两个系统,该任务要求将《坦克世界》游戏聊天中的话语分类为六种细粒度有害意图类别(标签0-5)。严重的类别不平衡、特定领域的多语言俚语,以及罕见类别(如威胁,标签4,60个样本;极端主义,标签5,24个样本)的数据极为稀缺,使得该分类问题极具挑战性。我们的主要提交系统RAKSHAK(rakṣaka,梵语中“保护者”之意)是一个多任务DeBERTa-v3-base(He等人,2022)框架,结合了来自Qwen2.5-14B(An等人,2024)的理由蒸馏、监督对比损失以及专用的罕见类别二分类头。RAKSHAK的训练数据通过跨领域迁移(来自Jigsaw有害评论数据集,映射到标签1-4的16,225个样本)和100个LLM生成的极端主义样本(针对标签5)进行了增强。我们的辅助系统(M1)在原始GameTox数据加上同样的100个极端主义样本上,使用Focal Loss微调DeBERTa-v3-base,未使用Jigsaw迁移。RAKSHAK在官方测试集上取得了0.5883的宏F1分数,在35支参赛队伍中排名第7,而M1取得了0.5252的宏F1分数。比较M1是否使用Jigsaw数据的消融实验表明,跨领域迁移贡献了+2.6 F1分,而RAKSHAK的多任务架构进一步贡献了+3.7分。 ShriNep@EEUCA 2026: RAKSHAK——基于理由蒸馏与拼图增强训练的多任务DeBERTa有害意图分类系统 Binayak Karki¹ https://orcid.org/0009-0001-2386-0578 Aryan Kafle² https://orcid.org/0009-0007-2251-2671 Pingala Ghimire³ https://orcid.org/0009-0008-6183-9834 ¹尼泊尔Mechi Multiple Campus ²美国北肯塔基大学 ³尼泊尔喜马拉雅工程学院 [email protected], [email protected], [email protected] ## 1 引言 多人在线游戏依赖游戏内聊天进行协作,但这些频道也承载着从脏话到极端主义内容的有害信息(Parihar等人,2021)。自动审核对玩家安全至关重要,但游戏聊天嘈杂、多语言,且严重偏向非有害消息,使得可靠分类难以实现(Thapa等人,2025)。 EEUCA 2026的GameTox共享任务(Hürriyetoğlu等人,2026;Thapa等人,2026)基于约53,000条《坦克世界》话语(标注为六种意图标签0-5,从非有害到极端主义)来评估这一挑战。系统按宏F1进行排名,强调在所有类别上的表现,包括训练样本极少的类别。 先前关于有害性检测的工作主要集中在社交媒体(Waseem和Hovy,2016;Davidson等人,2017),并且难以迁移到游戏语言,因为游戏语言中普遍存在行话、混淆和语码混合。像Jigsaw数据集(Jigsaw和Google,2018)这样的大规模标注工作展示了跨领域数据的价值,但社交媒体的语域与游戏聊天截然不同。在建模方面,来自大型LLM的知识蒸馏(Hinton等人,2015;Hsieh等人,2023;Magister等人,2023)、用于类别不平衡的Focal Loss(Lin等人,2017)以及监督对比学习(Khosla等人,2020)都显示出前景;思维链理由(Wei等人,2022)进一步表明,结构化的教师解释可以传递标签本身无法传递的推理。 我们在两个系统中运用这些技术:RAKSHAK(主要),一个多任务DeBERTa-v3-base框架,结合了来自Qwen2.5-14B的理由蒸馏、监督对比损失、罕见类别二分类头,以及通过Jigsaw迁移和LLM生成的极端主义样本进行的两阶段增强;以及M1(辅助),一个在较小增强集上使用Focal Loss微调的DeBERTa-v3-base模型。在游戏之外,LLM现在被用于错误分类会带来实际后果的环境中,从临床诊断(Yan等人,2025)到博物馆访客辅助(Guragain等人,2025b),使得可靠的内容审核成为远超本领域的一个关切。 ## 2 相关工作 ##### 有害性检测。 早期在线有害性检测的方法依赖于特征工程分类器(Waseem和Hovy,2016;Davidson等人,2017),而最近的工作转向在精心策划的数据集上微调预训练语言模型。结合多种多语言BERT模型的集成方法在仇恨言论检测的共享任务基准上显示出强劲结果,数据增强和类别不平衡处理是性能的关键贡献因素(Guragain等人,2025a)。大多数现有研究针对社交媒体平台,较少有研究解决游戏环境的独特挑战,其中语言被严重混淆、多语言且充满领域特定的行话(Parihar等人,2021)。GameTox数据集(Naseem等人,2025)是首批专门针对游戏聊天有害性的大规模资源之一。 ##### 知识蒸馏和理由增强。 Hinton等人(2015)通过教师与学生模型之间的软logit匹配引入了知识蒸馏。最近,Hsieh等人(2023)提出了逐步蒸馏,其中大型教师生成自然语言理由,在训练学生时与输入拼接,使小型模型以更少的数据超越大型模型。Magister等人(2023)和Li等人(2023)展示了类似的理由蒸馏方法,用于向小型语言模型教授推理。我们的RAKSHAK框架遵循这一范式,使用Qwen2.5-14B(An等人,2024)作为教师,为DeBERTa-v3-base(He等人,2022)学生生成结构化理由。 ##### 文本分类的对比学习。 监督对比损失(Khosla等人,2020)已被证明可以通过将同类嵌入拉近,同时将不同类嵌入推开,来提高表示质量。这在类别不平衡下特别有利,因为罕见类别样本通过显式的成对比较获得更强的梯度信号,而不是仅仅依赖与多数类别的交叉熵。 ##### 不平衡分类的损失重加权。 Focal Loss(Lin等人,2017)最初为物体检测提出,通过降低易于分类样本的权重,将训练聚焦于难例。它此后被广泛用于不平衡文本分类任务,包括有害性检测,其中占主导地位的非有害类别可能会压倒标准的交叉熵训练。 ## 3 背景与任务描述 ### 3.1 任务设置 该共享任务在ACL 2026的第9届事件抽取与理解:挑战与应用研讨会(EEUCA)(Hürriyetoğlu等人,2026)中组织,属于CHiPSAL轨道。任务聚焦于《坦克世界》游戏内聊天话语的意图分类,玩家群体为全球分布的多语言用户。 给定游戏聊天中的一条话语u,系统必须预测一个意图标签y∈{0,1,2,3,4,5},如表1所定义。 表1:EEUCA 2026共享任务的有害性标签分类(Thapa等人,2026;Naseem等人,2025)。 ### 3.2 数据集 GameTox数据集(Naseem等人,2025)包含来自《坦克世界》游戏内聊天日志的约53,000条话语,分为训练、验证和测试集,其中训练集有42,959个样本。标注模式改编自CrisisHateMM框架(Bhandari等人,2023)。该数据集表现出极端的类别不平衡:标签0(非有害)占训练数据的80%以上,而标签5(极端主义)仅有24个样本,标签4(威胁)有60个。语料库是多语言的,包含主要是英语的话语,以及波兰语、俄语、德语、法语和其他反映全球玩家群体的语言。 ## 4 系统描述 ### 4.1 数据增强 我们采用两种数据增强策略,针对代表性不足的有害类别,遵循更广泛的观察:在仇恨言论共享任务中,增强对于罕见类别性能至关重要(Guragain等人,2025a)。两种策略都用于RAKSHAK;M1仅使用LLM生成的极端主义样本(第4.1.2节)。 #### 4.1.1 从Jigsaw进行跨领域迁移 为了丰富RAKSHAK稀缺的领域内有毒样本,我们整合了Jigsaw有害评论分类数据集(Jigsaw和Google,2018)的数据,将其多标签有害性标注映射到GameTox意图分类,如表2所示。为了验证映射,我们从每个Jigsaw类别中抽取了10个示例,并独立提示两个LLM(Gemini 1.5 Pro和Grok)分配GameTox标签;两个模型对所有类别的映射结果一致。Jigsaw数据集还包含一个大的非有害类别,自然映射到GameTox标签0;然而,我们排除了这些样本,因为标签0已经严重过度代表。对于标签5(极端主义),没有合适的Jigsaw类别。对于具有多个活跃Jigsaw标签的样本,我们分配最严重的GameTox标签(例如,同时被标记为“obscene”和“threat”的样本映射到标签4)。经过映射和去重后,我们获得了跨标签1-4的16,225个额外样本。 表2:从Jigsaw标签到GameTox类别的映射(见表1)。非有害样本被排除。没有Jigsaw类别映射到极端主义。 | Jigsaw标签 | GameTox | 样本数 | |------------|---------|--------| | toxic, obscene, insult | 标签1 | 6,500 | | other_offensive | 标签2 | 7,940 | | severe_toxic, identity_hate | 标签3 | 1,307 | | threat | 标签4 | 478 | | non-toxic | 标签0 | 排除 | | (无映射) | 标签5 | — | #### 4.1.2 LLM生成的极端主义样本 标签5(极端主义)没有Jigsaw对应类别,仅剩24个领域内训练样本。我们通过一个四步流水线生成100个合成极端主义样本: 1. 关键词挖掘:从现有的标签5训练样本中提取与极端主义相关的关键词(侮辱性词汇、政治参考、激进化术语)。 2. 关键词扩展:使用Grok生成形态变体、混淆拼写和语义相关术语,扩展种子关键词列表。 3. 句子生成:提示Qwen2.5-14B(An等人,2024),提供描述GameTox共享任务和Naseem等人(2025)对极端主义定义的任务特定指令。为了绕过安全过滤器,极端主义关键词在提示中被替换为占位符标记(例如[WORD1], [WORD2]),Qwen生成包含这些占位符的句子框架。Qwen2.5-14B被选为能够在我们的计算约束下通过Ollama本地服务的最强开放权重模型,支持无需依赖闭源API的可复现性。提示模板见附录A。 4. 关键词注入:将生成的句子中的占位符标记替换为步骤1和2中的真实极端主义关键词。 该流水线解决了在研究目的下生成有害内容时的数据稀缺和LLM安全拒绝的双重挑战。M1和RAKSHAK都使用了这100个极端主义样本。我们注意到,这些样本并未经过与官方测试集的精确字符串重叠验证;这在我们的局限性中予以承认。 表3总结了每个系统的训练数据组成。 表3:训练数据组成。M1使用原始GameTox数据加上100个LLM生成的极端主义样本。RAKSHAK额外整合了跨标签1-4的16,225个Jigsaw迁移样本。 ### 4.2 M1:带Focal Loss的DeBERTa-v3-base 我们的辅助系统在原始GameTox训练数据加上100个LLM生成的极端主义样本(第4.1.2节)上,微调DeBERTa-v3-base(He等人,2022)作为单阶段六类意图分类器。分类头是一个线性层,基于[CLS]表示产生6类logits,使用Focal Loss(Lin等人,2017)(γ=2.0)进行训练,以降低易于分类的多数类别样本的权重,并将梯度更新导向难例、少数类别样本。模型训练5个epoch,学习率2e-5,批量大小32,梯度裁剪1.0。模型选择基于在90/10训练-验证分割(种子=42)上的最佳验证宏F1。推理时,模型在一次前向传递中直接预测所有六个标签。 ### 4.3 RAKSHAK:多任务理由蒸馏框架 RAKSHAK是我们的主要系统。它将DeBERTa-v3-base骨干扩展为多任务学习框架,通过三种机制解决类别不平衡:(1) 来自教师LLM的理由增强知识蒸馏,遵循Hsieh等人(2023)的“蒸馏然后训练”范式;(2) 专用的罕见类别二分类器;(3) 在共享嵌入空间上的监督对比损失(Khosla等人,2020)。与M1不同,RAKSHAK在完整增强数据集上进行训练,包括Jigsaw迁移的样本。
相似文章
PSK@EEUCA 2026:利用合成数据增强微调大型语言模型以检测游戏聊天中的多类毒性
本文介绍了一个用于 EEUCA 2026 游戏聊天毒性检测共享任务的系统,该系统通过结合合成数据增强微调 Llama 3.1 8B 模型,获得了第四名。文章重点阐述了一种“验证陷阱”现象:由于数据分布偏移,较高的验证分数与测试集表现并不相关。
thaulab@EEUCA 2026: 谁对谁说了什么?一种目标感知的神经符号流水线用于游戏毒性检测
本文提出了一种三阶段神经符号流水线用于游戏毒性检测,结合了Transformer集成与基于规则的调解,在EEUCA 2026共享任务中取得了最高准确率。
ToxiREX:上下文中有毒推理的数据集
ToxiREX 是一个新的多语言 Reddit 评论数据集,采用有毒推理模式对隐性毒性进行标注,涵盖六种语言和多个事件。
Duluth 在 SemEval-2026 任务 6:用 LLM 增强数据揭开政治避答面纱的 DeBERTa 方法
明尼苏达大学德卢斯分校团队利用 Gemini 3 与 Claude Sonnet 4.5 生成的合成数据增强 DeBERTa-V3-base,对政治问题避答进行分类,在 SemEval-2026 任务 6 中排名第 8。
PAN 2026的DACTYL团队:贝叶斯数据混合与经验X风险最小化在AI文本检测中的应用
本文介绍了使用贝叶斯数据混合和经验X风险最小化检测AI生成文本的方法,通过ModernBERT-large和MCGrad分类器在OOD检测上取得了高性能。