thaulab@EEUCA 2026: 谁对谁说了什么?一种目标感知的神经符号流水线用于游戏毒性检测
摘要
本文提出了一种三阶段神经符号流水线用于游戏毒性检测,结合了Transformer集成与基于规则的调解,在EEUCA 2026共享任务中取得了最高准确率。
arXiv:2607.20447v1 Announce Type: new
Abstract: 本文描述了我们在EEUCA 2026游戏聊天毒性分类共享任务中的系统。我们实现了一个三阶段流水线,结合了两个紧凑型Transformer的集成(DeBERTa-v3-base,184M;XLM-RoBERTa-base,278M)和一个语言信息中介(LIM),该中介通过基于语料库的词汇规范化、类别条件单字评分、多语言脏话检测以及基于言语行为理论的施事目标分析来解决模型间的分歧。LIM特别针对少数类(仇恨与骚扰、威胁和极端主义),这些是现实游戏审核中最关键的安全类别。为了解决极端的类别不平衡问题(非毒性与极端主义比例为1,450:1),我们引入了一种仅使用提供的训练数据的两阶段数据增强策略。我们的系统在官方测试集上取得了Macro F1为0.6441、准确率为0.9062的成绩,在所有队伍中Macro F1排名第三,准确率排名第一。所提出的流水线具有领域可移植性:适应其他游戏平台只需替换游戏特定的实体词表。代码公开在 https://github.com/Anmol2059/thaulab_EEUCA。
查看缓存全文
缓存时间: 2026/07/24 05:16
# thaulab@EEUCA 2026:谁对谁说了什么?一种面向目标的神经符号流水线用于游戏聊天毒性检测
来源:https://arxiv.org/html/2607.20447
Anmol Guragainhttps://orcid.org/0009-0009-8491-8663∗, Marcos Estecha Garitagoitia, Luis Fernando D’Haro Enríquez, Ricardo Córdoba 马德里理工大学电信工程学院,马德里,西班牙 ∗anmol\.g@upm\.es\(通讯作者\)
###### 摘要
本文描述了我们在EEUCA 2026共享任务中用于游戏聊天毒性分类的系统。我们实现了一个三阶段流水线,将两个紧凑型Transformer的集成(DeBERTa-v3-base,184M;XLM-RoBERTa-base,278M)与一个语言学信息中介器(LIM)相结合,该中介器通过语料库支持的词汇规范化、类别条件一元评分、多语言脏话检测以及基于言语行为理论的施动者目标分析来解决模型间的不一致。LIM特别针对少数类别(仇恨与骚扰、威胁和极端主义),这些是现实游戏审核中最关键的类别。为了解决极端的类别不平衡问题(非毒性与极端主义比例为1,450:1),我们引入了一种仅使用提供的训练数据的两阶段数据增强策略。我们的系统在官方测试集上达到了0.6441的Macro F1和0.9062的准确率,在所有队伍中Macro F1排名第3,准确率排名第1。所提出的流水线具有领域可移植性:适应其他游戏平台只需替换游戏特定的实体词典。代码公开在https://github.com/Anmol2059/thaulab_EEUCA。
### 1 引言
在线游戏平台每天承载着数百万的实时文本交互,这些环境中的有毒行为已被证实与网络欺凌、心理伤害和玩家流失等严重后果相关。最近一项涵盖64项研究的系统综述证实,多人在线游戏中的网络欺凌与焦虑、抑郁和社交退缩有关,并且实证证据表明,有毒行为在同队玩家中会像病毒一样传播,若未被检测到,其影响范围会进一步扩大。
EEUCA 2026游戏毒性共享任务引入了一个六类分类基准,该基准源自《坦克世界》聊天记录,并按照有方向/无方向的仇恨言论框架进行标注。该数据集带来了三个关键挑战:极端类别不平衡(81.0%非毒性 vs. 0.06%极端主义)、涵盖10多种语言的多语言内容,以及领域特定的词汇歧义,其中暴力词汇(如“kill”、“destroy”)具有非暴力的言外之力。
我们实现了一个三阶段系统,结合了神经集成分类与基于规则的语言学信息中介器(LIM),遵循了逻辑规则为神经仇恨言论分类器提供互补信号的证据。我们的贡献包括:(1)一种两阶段增强策略(混淆对驱动和对比边界生成),仅使用提供的数据就相对提升了Macro F1 9.7%;(2)一个基于言语行为理论的LIM模块,通过四个可解释的、基于语料库的组件解决集成分歧;(3)实证证据表明,即使是多语言Transformer在特定领域的非拉丁语脏话(22.6%的仇恨与骚扰包含西里尔字母)上仍存在残留盲点;以及(4)证明通用毒性模型在游戏领域表现灾难性失败,表明游戏聊天是一种独特的语言注册,需要特定领域的处理。
##### 相关工作。
最近的游戏毒性NLP方法包括针对DOTA 2和《使命召唤》的RoBERTa领域自适应预训练(结合比赛元数据),以及结合大语言模型生成嵌入与轻量级分类器的Twitch审核混合架构。在仇恨言论检测的类别不平衡问题上,Zhang等人表明焦点损失函数能持续获得最佳性能,这启发了我们的损失函数选择。基于大语言模型的数据增强已被证明对仇恨言论少数类别有效,支持了我们的两阶段增强策略。GameTox数据集还提供了意图和槽填充标注,但这些标签未在共享任务中发布,限制了参与者只能使用六类毒性模式。标注分歧是仇恨言论分类中公认的挑战;我们在附录D中量化了其在该数据集中的程度。
### 2 任务、数据集与增强
该共享任务要求将《坦克世界》聊天内容分为六类:非毒性、侮辱、其他攻击性、仇恨与骚扰、威胁和极端主义,并使用Macro F1进行评估。表1显示了类别分布;该数据集包含42,959个训练样本、5,367个验证样本和5,375个测试样本,存在极端不平衡(非毒性与极端主义的比例为1,450:1)。消息非常短(中位数2–4个令牌),6.9%包含西里尔字母,在仇恨与骚扰中这一比例上升至22.6%。
#### 2.1 两阶段增强
我们使用两阶段策略在不借助外部数据的情况下增强少数类别(图1;提示模板见附录C)。
阶段A使用种子模型(M0,在原始数据上训练的DeBERTa-v3-base)来识别混淆类别对:对于每个验证样本,我们记录M0中概率最高的两个类别,当第二高概率超过0.15(经验设定)时,将该对标记为混淆边界,表明模型在这两个类别之间存在非平凡的置信度不确定。该阈值是根据在候选值{0.10, 0.15, 0.20, 0.25}上评估的验证集Macro F1选定的;0.15在最大化少数类别召回率的同时避免了向增强池中引入过多噪声,因为较低的值会产生近乎重复的混淆对,而较高的值则会遗漏有意义的边界案例。然后Claude Opus 4.6生成针对这些混淆边界的合成样本。这为其他攻击性、仇恨与骚扰以及威胁提供了增强样本。
阶段B针对极端主义(n=24)和补充威胁(n=60),这两个类别过于稀少,无法进行混淆对分析。我们应用对比边界增强:(1)使用P(c|w)(即包含词w且属于类别c的训练消息的比例,与LIM一元评分中使用的统计量相同)挖掘类别判别性令牌,频率比≥5x;(2)生成跨语言变体并还原leet语(例如,naz1 → nazi);(3)通过限制在挖掘出的判别性词汇中的TF-IDF子空间的余弦相似度,验证生成的样本在有效相似度范围内接近真实训练数据。
表1显示了结果:631个合成样本,相对M0提升了Macro F1 9.7%。
参照图1:两阶段增强。阶段A:混淆对驱动。阶段B:对比边界与词汇分析。
表1:增强前后训练集类别分布。
### 3 系统架构
我们的系统是一个三阶段流水线(图2);所有模型的超参数见附录A。
参照图2:系统流水线。M1(DeBERTa)和M2(XLM-R)产生预测;一致(约94%)被接受,不一致(约6%)由LIM优化。
#### 3.1 阶段1:模型探索与选择
我们探索了四个基础尺寸的Transformer,全部使用焦点损失进行训练。表2总结了结果。我们选择M1(DeBERTa-v3-base,184M,增强训练后F1最高)和M2(XLM-RoBERTa,278M,互补的多语言覆盖)用于集成。M3(BERT-base,110M)作为开发基线。M4(toxic-bert,110M,冻结主干+MLP)仅达到0.3154的Macro F1,尽管进行了毒性特定的预训练,这表明通用领域的毒性表示无法迁移到游戏上下文,其中暴力词汇通常是非毒性的,多语言俚语普遍存在。LIM的领域特定语言规则正是为了解决这个问题而设计的。
表2:单个模型结果。M0/M1共享DeBERTa架构(种子 vs. 增强)。M1和M2组成最终集成。
#### 3.2 阶段2:基于一致的融合
当M1和M2一致时(约94%),我们接受共识。对于约6%的不一致,我们采用具有较高softmax概率的预测作为初始估计,并将其路由到LIM。
#### 3.3 阶段3:语言学信息中介器
LIM通过四个顺序组件优化不一致预测。它结合了神经和符号处理:集成捕获分布语义,而LIM编码神经模型无法从有限的少数类别数据中可靠学习的领域特定语言事实。每个LIM决策都可追溯到特定规则和语料库统计量,使其可审计。
##### 3.3.1 语料库支持的词汇规范化
我们对测试消息进行规范化(小写、去除标点、折叠表情延长:“hahaha”→“haha”),并对训练+验证集进行精确匹配查找。出现次数≥2且多数一致性≥60%的匹配采用多数标签。这些保守阈值直接反映了附录D中量化的标注噪声。
##### 3.3.2 类别条件一元评分
受Naseem等人令牌级分析的启发,我们为训练词汇表中的每个词w计算P(c|w) = n(w,c) / n(w),其中c是类别标签,n(w,c)是包含词w且属于类别c的消息数量,n(w)是总计数,实际上是一元朴素贝叶斯估计。超过精确度阈值P(c|w) ≥ 0.80且具有足够支持(n(w) ≥ 5)的词作为高置信度少数类别指示符。例如,基于身份的侮辱性词汇一致映射到H&H(P=1.00),而“kys”映射到威胁,leet语变体如“naz1”映射到极端主义。覆盖仅应用于安全关键类别(3–5:H&H、威胁、极端主义),优先考虑精确度以避免误升级。
##### 3.3.3 多语言脏话检测
虽然M2(XLM-RoBERTa)处理多语言分词,但我们的验证分析发现,M1和M2仍然错误分类特定领域的非拉丁语脏话,特别是即使在XLM-R的100语言预训练中也罕见的词语。我们将相同的统计应用于非拉丁语令牌,标记P(有毒|w) = 1 - P(非毒性|w) ≥ 0.80但两个模型都预测为非毒性的词。这产生了一个按语系组织的经验验证的多语言词典:东斯拉夫语(俄语、乌克兰语)、西斯拉夫语(波兰语、捷克语)和其他(土耳其语、匈牙利语、德语)。重新分类遵循目标性:针对玩家→侮辱;针对游戏→其他攻击性。
##### 3.3.4 施动者目标与语用优化
借鉴言语行为理论,我们将目标函数τ(m)形式化。令T表示由前述LIM组件(一元评分和多语言检测)标记为有毒的令牌集合。对于包含有毒令牌t ∈ T的消息m:
τ(m) =
- Other-dir(若存在p ∈ P₂: p ≺ t)
- Self-dir(若存在p ∈ P₁: p ≺ t)
- Entity-dir(若存在e ∈ E: e ≺ t)
- Untargeted(否则)
其中P₂/P₁是第二/第一人称代词集合(英语和俄语),E是游戏特定实体(GSE)词典,涵盖载具(400多种坦克)、机制(*rng*, *arty*, *cap*)、地图位置(*Himmelsdorf*, *hill*, *banana*)和游戏角色(*light*, *heavy*, *TD*),并且≺表示消息中的线性顺序。表3将目标类型映射到标签。
表3:目标函数τ(m)。E = GSE词典。基于言语行为理论。
该组件还应用了审查文本恢复([GSE]+[***] → 非毒性)和隐式词义消歧:“kill that Tiger”(GSE → 非毒性)vs. “kill yourself”(人 → 威胁)。
### 4 结果与讨论
[原文在此处中断,翻译至"4 Results and Dis"结束。]相似文章
PSK@EEUCA 2026:利用合成数据增强微调大型语言模型以检测游戏聊天中的多类毒性
本文介绍了一个用于 EEUCA 2026 游戏聊天毒性检测共享任务的系统,该系统通过结合合成数据增强微调 Llama 3.1 8B 模型,获得了第四名。文章重点阐述了一种“验证陷阱”现象:由于数据分布偏移,较高的验证分数与测试集表现并不相关。
ShriNep@EEUCA 2026: RAKSHAK——基于理由蒸馏与Jigsaw增强训练的多任务DeBERTa毒性意图分类系统
本文提出了RAKSHAK,一种结合了理由蒸馏和Jigsaw增强训练的多任务DeBERTa-v3框架,用于对《坦克世界》聊天话语中的毒性意图进行分类,在EEUCA 2026的GameTox共享任务中获得第七名。
多语言与代码混合滥用检测中毒性信号的条件可靠性
本文介绍了ToxGate,一种信任融合头,它将外部毒性信号在编码器表示上进行条件化,以改进多语言和代码混合的滥用检测,在多个数据集和编码器的高风险审核切片中展示了增益。
Twitch聊天中的毒性:基于LLM的跨游戏社区分析
本文使用预训练LLM进行零样本分类,分析了约2000万条Twitch聊天信息,涵盖七种游戏类型,发现2.4%的消息具有毒性,其中MOBA游戏的毒性率最高(3.2%),体育游戏最低(2%)。研究还发现,同一类型内不同游戏之间的毒性分布存在显著差异。
更难防御:面向中文的通过隐式增强与混淆重写实现的毒性攻击
本文提出了CITA框架,用于生成中文隐式毒性攻击,以评估和改进大语言模型的毒性检测器,在测试模型上实现了较高的攻击成功率。