多语言与代码混合滥用检测中毒性信号的条件可靠性

arXiv cs.CL 论文

摘要

本文介绍了ToxGate,一种信任融合头,它将外部毒性信号在编码器表示上进行条件化,以改进多语言和代码混合的滥用检测,在多个数据集和编码器的高风险审核切片中展示了增益。

arXiv:2607.15861v1 公告类型:新 摘要:审核系统越来越依赖外部毒性工具,但这些工具在代码混合、音译、俚语和语言不匹配的情况下不可靠。我们研究了印度多语言和代码混合短文本中毒性先验的\emph{条件可靠性}:英语毒性、Indic滥用和基于规则的严重性线索可能是有用的证据,但仅在某些语言和滥用严重性上下文中有效。我们提出了ToxGate,一种信任融合头,它在将每个辅助信号添加到预测状态之前,将其在编码器表示上进行条件化。跨三个短文本滥用数据集、四个Transformer编码器和每个设置五个种子的实验,ToxGate在12个域内设置中的10个和8个迁移设置中的7个中优于匹配的普通编码器。最大且最可解释的增益出现在高风险审核切片中,包括显式辱骂、暴力威胁和跨数据集迁移。更广泛的教训是,审核系统应将外部毒性工具和先验视为条件证据,而不是固定特征或地面真相;在聚焦消融中,源特定门控在迁移、严重滥用切片和高风险分类中给出了最强结果。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:35

# 多语言与代码混合滥用检测中毒性信号的条件可靠性
来源:https://arxiv.org/html/2607.15861
11institutetext:先进计算发展中心,海得拉巴,印度
11email:\{indravenik, srohan, arnabm, harmeshr \}@cdac\.inRohan SinghArnab Mallick通讯作者Harmesh Rana

###### 摘要

审核系统日益依赖外部毒性检测工具,但这些工具在代码混合、音译、俚语和语言不匹配场景下并不可靠。本研究探讨了印度多语言及代码混合短文本中毒性先验的*条件可靠性*:英语毒性、印地语(Indic)滥用以及基于规则的严重性线索可作为有用证据,但仅限特定语言和滥用严重性语境。我们提出 ToxGate,一种信任融合头(trust-fusion head),它将每个辅助信号根据编码器表示进行条件化处理,再将其加入预测状态。在三个短文本滥用数据集、四种 Transformer 编码器以及每种设置五个随机种子的实验中,ToxGate 在 12 个域内设置中提升了 10 个,在 8 个迁移设置中提升了 7 个。最大且最可解释的提升出现在高风险审核切片中,包括明确侮辱、暴力威胁以及跨数据集迁移。更广泛的启示是:审核系统应将外部毒性检测工具和先验视为条件性证据,而非固定特征或真实标签,在有针对性的消融实验中,源特定门控在迁移、严重滥用切片和高风险分流中效果最强。

## 1 引言

在线平台承载着多语言和代码混合的帖子,这些帖子混合了文字、拼写变体、俚语、讽刺和音译。印地语—英语(Hinglish)滥用检测是一个典型例子:印地语—英语帖子可能混合英语粗话、罗马化印地语侮辱以及社区特定嘲讽,这给单语编码器和现成毒性检测工具都带来了压力\[21 (https://arxiv.org/html/2607.15861#bib.bib5),17 (https://arxiv.org/html/2607.15861#bib.bib7),2 (https://arxiv.org/html/2607.15861#bib.bib8)\]。一种常见的工程做法是将外部毒性分数(例如 Detoxify 或 Perspective API 的输出)附加到上下文编码器上\[9 (https://arxiv.org/html/2607.15861#bib.bib10),14 (https://arxiv.org/html/2607.15861#bib.bib11),4 (https://arxiv.org/html/2607.15861#bib.bib12)\]。这可能有帮助,但假设外部分数是均匀可信的。

我们认为核心应用问题是*条件可靠性*。毒性先验对明确的英语粗话可能可靠,对罗马化印地语滥用则不完全,对严重威胁有用,但对良性俚语可能产生误导。简单拼接将每个分数视为在所有上下文中同等有用,这对于必须处理冲突证据并将不确定案例转交人工审核的审核管道来说并不合适。因此,我们的问题既明确又可检验:当辅助毒性信号的贡献取决于文本上下文时,它们能否发挥更大作用?

我们通过 ToxGate 来回答这个问题,ToxGate 是一种源感知门控融合头(source-aware gated fusion head)。ToxGate 分别投影 Detoxify、Indic 滥用语言和基于规则的严重性源,然后为每个源学习一个上下文条件化门控,再将其与编码器表示融合。贡献不在于新的门控原语,而在于有针对性地形式化外部毒性检测工具何时应被信任——这是先前静态融合工作未解决的问题。

我们的贡献如下:

- • 我们将外部毒性检测工具视为多语言审核的条件性证据,而非真实标签或均匀可信的特征。
- • 我们引入 ToxGate,一种针对英语毒性、Indic 滥用和基于规则严重性先验的源特定信任融合头。
- • 我们在三个数据集、四个编码器、五个随机种子、域内测试、跨数据集迁移、破坏性分析、切片分析、bootstrap 置信区间以及轻量级审核分流模拟上进行了评估。
- • 我们展示了最大提升集中在审核风险最高的地方:明确侮辱、暴力威胁以及相关代码混合数据集之间的迁移。

## 2 相关工作

滥用语言检测长期以来结合了词汇、社会和神经信号。代码混合场景使问题更难,因为说话者在单个帖子中混合文字、音译、俚语和社区特定侮辱。早期的印地语—英语工作使用手工特征和经典分类器\[2 (https://arxiv.org/html/2607.15861#bib.bib8),17 (https://arxiv.org/html/2607.15861#bib.bib7)\],后来的系统转向多语言 Transformer 和共享任务式基准\[16 (https://arxiv.org/html/2607.15861#bib.bib24)\]。我们的工作建立在此方向之上,但提出了一个更狭窄的可靠性问题:不是代码混合滥用能否被分类,而是外部毒性先验何时应被信任。

辅助信号在审核系统中很常见。社交上下文特征曾被拼接在上下文嵌入中用于滥用语言检测\[22 (https://arxiv.org/html/2607.15861#bib.bib15)\],而 Detoxify 和 Perspective API 提供了毒性、侮辱、威胁和身份攻击分数,可作为密集词汇先验\[9 (https://arxiv.org/html/2607.15861#bib.bib10),14 (https://arxiv.org/html/2607.15861#bib.bib11)\]。QBERTOX 类似地使用 Detoxify 衍生特征增强了基于 BERT 的印地语—英语分类器\[4 (https://arxiv.org/html/2607.15861#bib.bib12)\]。这些工作中主要的集成策略是静态特征拼接。该策略简单,但假设辅助来源对英语粗话、罗马化印地语滥用、暴力威胁和良性俚语都以相同方式有用。先前关于毒性模型偏差和校准的工作表明了这种假设在源模型训练分布之外的风险\[3 (https://arxiv.org/html/2607.15861#bib.bib16),13 (https://arxiv.org/html/2607.15861#bib.bib17)\]。

门控融合在多模态和多语言学习中已得到充分研究\[1 (https://arxiv.org/html/2607.15861#bib.bib18),12 (https://arxiv.org/html/2607.15861#bib.bib19),18 (https://arxiv.org/html/2607.15861#bib.bib21)\]。这些方法学习何时组合模态、特征或适配器,而不是始终平等使用每个信号。源感知门控在此处被用作一种原则性机制,用于解决现有融合架构未直接涉及的信任与安全问题:当外部毒性工具在语言不匹配时虽有信息量但不可靠,审核模型能否学习基于文本上下文的每个源的信任度?这一区别至关重要,因为我们的辅助源是冻结的、异构的且不完美的:一个英语毒性模型、一个 Indic 滥用先验以及一个基于规则的严重性启发式。

因此,最接近的先前系统构成了本文的基线。Plain 编码器测试文本表示本身是否足够。Concat 测试标准的静态融合假设,MLP 测试通用非线性融合是否足够,SharedGate 和 ScalarGate 测试门控本身是否能解释提升。ToxGate 旨在测试剩余假设:当每个毒性先验在不同语言和严重性上下文中具有不同的可靠性分布时,源特定条件融合是有用的。

## 3 方法

### 3.1 任务与辅助先验

给定一个帖子xx,我们预测其是否具有滥用性 \(y=1y=1\) 或非滥用性 \(y=0y=0\)。每个示例包含文本和三个辅助先验:

tdetox\\displaystyle t\_\{\\mathrm\{detox\}\}∈\[0,1\]6,\\displaystyle\\in\[0,1\]^\{6\},tindic\\displaystyle t\_\{\\mathrm\{indic\}\}∈\[0,1\],\\displaystyle\\in\[0,1\],trule\\displaystyle t\_\{\\mathrm\{rule\}\}∈\[0,1\]\.\\displaystyle\\in\[0,1\]\.\(1\)Detoxify 向量包含毒性、严重毒性、猥亵、威胁、侮辱和身份攻击分数\[9 (https://arxiv.org/html/2607.15861#bib.bib10)\]。Indic 分数来自一个冻结的公共代码混合 MuRIL 滥用语言检查点。规则分数由确定性词典与模式匹配器在四个固定组上计算得出:暴力威胁表达、性暴力引用、明确的第二人称或群体针对模式以及极端侮辱词典。每个组贡献一个二元指示器 \(rk\(x\)r\_\{k\}\(x\)\),我们设置

trule\(x\)=min⁡\(1,14∑k=14rk\(x\)\)\.t\_\{\\mathrm\{rule\}\}\(x\)=\\min\\left\(1,\\frac\{1\}\{4\}\\sum\_\{k=1\}^\{4\}r\_\{k\}\(x\)\\right\)\).规则列表在训练前固定,仅用作辅助特征;它从不定义或修改真实标签。

文本编码器E\\mathcal\{E\}为 BERT、mBERT、MuRIL 或 XLM-R\[7 (https://arxiv.org/html/2607.15861#bib.bib1),19 (https://arxiv.org/html/2607.15861#bib.bib37),11 (https://arxiv.org/html/2607.15861#bib.bib38),5 (https://arxiv.org/html/2607.15861#bib.bib36)\]。我们使用最后一层的 CLS 状态加上一个简单的显著标记池化项,得到htext∈Rdh\_\{\\mathrm\{text\}\}\\in\\mathbb\{R\}^\{d\}\。

Indic 辅助分数来自冻结的公共检查点 Hate-speech-CNERG/indic-abusive-allInOne-MuRIL (https://huggingface.co/Hate-speech-CNERG/indic-abusive-allInOne-MuRIL),这是一个基于 MuRIL 的滥用语言分类器,与 Das 等人\[6 (https://arxiv.org/html/2607.15861#bib.bib9)\] 的 Hate-ALERT / Indic 滥用语言资源相关。我们仅将其用作冻结的特征提取器:其输出从不用于构建标签、调整划分或定义评估目标。由于公共模型文档未提供足够信息以排除与公共滥用语言数据集的所有上游重叠,我们不声称正式的无重叠保证;相反,我们报告 No-Indic 和 Rule-only 消融实验,以测试结论是否依赖于该源。

### 3.2 基线

我们比较了匹配的纯编码器和三种融合族。Plain 仅使用htexth\_\{\\mathrm\{text\}\}。Concat 将原始辅助向量tt附加到htexth\_\{\\mathrm\{text\}\}。MLP 通过一个非线性头投影tt后再融合。SharedGate 首先将所有辅助分数投影为一个表示u=φ\(t\)u=\\phi\(t\),然后使用一个上下文门控,

g=σ\(Wg\[htext;u\]\+bg\),hshared=htext\+g⊙u\.g=\\sigma\(W\_\{g\}\[h\_\{\\mathrm\{text\}\};u\]\+b\_\{g\}\),\\qquad h\_\{\\mathrm\{shared\}\}=h\_\{\\mathrm\{text\}\}\+g\\odot u\.\(2\)SharedGate 将通用门控与源特定门控分开。我们还评估了标量 ToxGate 变体(每个源一个门控)以及源过滤的 ToxGate 变体(移除 Indic 先验或所有已学习的外部辅助模型)。

### 3.3 ToxGate

ToxGate 分别处理每个辅助源s∈\{detox,indic,rule\}s\\in\\\{\\mathrm\{detox\},\\mathrm\{indic\},\\mathrm\{rule\}\\\}。对于源特征tst\_\{s\},我们计算

us=ReLU\(LN\(Wp\(s\)ts\+bp\(s\)\)\),u\_\{s\}=\\mathrm\{ReLU\}\(\\mathrm\{LN\}\(W\_\{p\}^\{\(s\)\}t\_\{s\}\+b\_\{p\}^\{\(s\)\}\)\),\(3\)然后学习一个上下文条件化信任门控,

gs=σ\(Wg\(s\)\[htext;us\]\+bg\(s\)\)\.g\_\{s\}=\\sigma\(W\_\{g\}^\{\(s\)\}\[h\_\{\\mathrm\{text\}\};u\_\{s\}\]\+b\_\{g\}^\{\(s\)\}\)\.\(4\)融合表示为

hfused=htext\+∑sgs⊙us,h\_\{\\mathrm\{fused\}\}=h\_\{\\mathrm\{text\}\}\+\\sum\_\{s\}g\_\{s\}\\odot u\_\{s\},\(5\)后接一个线性分类器。如果某个源对当前示例不可靠,对应的门控可以抑制它;如果所有源都较弱,残差形式会回退到纯编码器表示。

## 4 实验设计

我们评估了三个短文本滥用语言数据集。BullyExplain\[15 (https://arxiv.org/html/2607.15861#bib.bib39)\]是我们的主要印地语—英语网络欺凌基准。Hinglish Headlines\[20 (https://arxiv.org/html/2607.15861#bib.bib14)\]提供了第二个印地语—英语代码混合场景。Indo-HateSpeech\[10 (https://arxiv.org/html/2607.15861#bib.bib13)\]测试融合结论是否在印地语—英语之外依然成立。我们的实证范围是印度多语言和代码混合审核,而非通用语言覆盖。我们将所有数据集映射为二元滥用/非滥用标签,并使用固定的分层 70/10/20 训练/验证/测试划分。

表1:数据集摘要。阳性率是在将每个数据集映射为二元滥用/非滥用标签后计算的。所有模型训练最多 10 个 epoch,基于验证宏 F1 早停,批次大小 16,最大长度 128,AdamW 优化器,dropout 0.3,梯度裁剪 1.0,五个随机种子(42, 123, 456, 789, 1024)。我们报告测试宏 F1 作为主要指标,期望校准误差(ECE)作为校准诊断\[8 (https://arxiv.org/html/2607.15861#bib.bib34)\]。除了干净测试,我们还进行了两个印地语—英语数据集之间的跨数据集迁移、辅助源破坏、切片分析、定性诊断、基于保存预测的配对 bootstrap 置信区间以及高风险分流模拟。

## 5 结果

### 5.1 匹配的域内性能

表2 (https://arxiv.org/html/2607.15861#S5.T2)报告了主要的匹配比较:纯编码器与使用相同骨干网络的 ToxGate 对比。ToxGate 在 12 个设置中提升了 10 个的宏 F1。最大提升出现在 MuRIL 在 BullyExplain 上(+0.010)、MuRIL 在 Hinglish Headlines 上(+0.009)、BERT 在 BullyExplain 上(+0.007)以及 mBERT 在 Hinglish Headlines 上(+0.007)。两个例外是 XLM-R 在 BullyExplain 上和 mBERT 在 Indo-HateSpeech 上,其中纯编码器仍然略强。提升在各编码器间一致,且集中在审核最相关的诊断设置——明确侮辱、暴力威胁和跨数据集迁移——而非均匀分布于所有示例。

表2:匹配的域内基准。值为五个种子上的测试宏 F1 均值,ECE 为测试 ECE 均值。
### 5.2 模型家族与消融

表3 (https://arxiv.org/html/2607.15861#S5.T3)给出了更广泛的模型家族视图。ToxGate 在完整比较套件中具有最佳的平均宏 F1 和最低的 ECE。MLP 行作为一个压力测试很有用:非线性融合头可以拟合辅助分数,但在本次运行中校准较差,并在下方的聚焦迁移和高风险比较中失利。

表3:模型家族汇总,平均所有数据集—编码器设置。表4 (https://arxiv.org/html/2607.15861#S5.T4)完成了信任融合阶梯。SharedGate 和 ScalarGate 平均具有竞争力,但完整的源特定 ToxGate 具有最佳的平均宏 F1。移除 Indic 源或所有已学习的外部辅助模型会降低性能,同时保留部分融合收益,因此效果并非仅由外部 Indic 检查点解释。

表4:消融实验汇总,平均数据集—编码器设置。值为五个种子上的测试宏 F1 均值和 ECE 均值。
### 5.3 迁移、切片与 Bootstrap 置信

迁移是最清晰的压力测试。表5 (https://arxiv.org/html/2607.15861#S5.T5)报告了每个编码器的两个印地语—英语迁移方向。ToxGate 在 8 个迁移设置中提升了 7 个,唯一的损失是 XLM-R 在 Hinglish Headlines→\\rightarrowBullyExplain 上。最大提升是 MuRIL 在 BullyExplain→\\rightarrowHinglish Headlines 上(+0.286)。平均所有行,迁移宏 F1 从 0.565 增加到 0.632。

表5:两个印地语—英语数据集之间的跨数据集迁移。Δ\\Delta是 ToxGate 减去 Plain。表6:对与信任感知声明最相关的设置进行的聚焦比较。值为宏 F1,高风险分流精度除外。表6 (https://arxiv.org/html/2607.15861#S5.T6)强化了实证主张。ToxGate 在域内均值、迁移均值、明确侮辱、暴力威胁和高风险精度上最强,包括将通用门控与源特定门控分离开来的比较。

相似文章

多语言语言模型中有毒内容检测与缓解策略综述

arXiv cs.CL

本综述综合了关于多语言大语言模型中有毒内容检测与去毒化研究,梳理了威胁模型、任务形式、检测方法和缓解策略,同时指出了持续存在的挑战,如语言覆盖不均衡以及危害定义的文化依赖性。