YEZE 参加 SemEval-2026 任务 9:通过异构集成检测多语言、多文化和多事件的网络极化
摘要
本文介绍了用于 SemEval-2026 任务 9 的 YEZE 系统,该系统利用 XLM-RoBERTa 和 mDeBERTa 模型的异构集成,检测 22 种语言中的网络极化现象。
查看缓存全文
缓存时间: 2026/05/08 07:26
# YEZE 参加 SemEval-2026 任务 9:通过异构集成检测多语言、多元文化和多事件的在线极化
来源:https://arxiv.org/html/2605.06231
###### 摘要
本文介绍了我们针对 SemEval-2026 任务 9:检测多语言、多元文化和多事件在线极化的系统,该系统通过三个子任务在 22 种语言中识别极化的社交媒体内容:二元检测、目标分类和表现形式识别。我们提出了一种多语言预训练模型的异构集成方案,结合了 XLM-RoBERTa-large 和 mDeBERTa-v3-base。我们研究了多任务学习、基于翻译的数据增强和类别权重等技术,以在严重的标签不平衡下提高分类性能。我们的研究结果表明,独立的任务建模结合类别权重更为有效。
YEZE 参加 SemEval-2026 任务 9:通过异构集成检测多语言、多元文化和多事件的在线极化
Guo Fengze Chang Yue 蒂宾根大学 {fengze.guo, yue.chang}@student.uni-tuebingen.de
## 1 引言
社交媒体平台扩大了全球公众的沟通范围,但也加剧了跨越语言和文化界限的在线极化 Howard (2019)。极化内容不仅在目标和立场方面有所不同,其语言表现形式也各不相同,这使得自动识别对于大规模分析社会动态以及协助下游的内容审核和政策研究至关重要。
本文介绍了我们针对 SemEval-2026 任务 9 Naseem et al. (2026a) 的系统,这是一个致力于识别多语言社交媒体中在线极化的共享任务。^1^ 该共享任务包含三个子任务:(1) 二元分类,以确定帖子是否极化;(2) 极化目标类型的多标签分类;以及 (3) 表现形式类别的多标签识别。官方数据集 Naseem et al. (2026b) 包含 22 种语言的社交媒体帖子:阿姆哈拉语、阿拉伯语、孟加拉语、缅甸语、中文、英语、德语、豪萨语、印地语、意大利语、高棉语、尼泊尔语、奥迪亚语、波斯语、波兰语、旁遮普语、俄语、西班牙语、斯瓦希里语、泰卢固语、土耳其语和乌尔都语。子任务 1 和 2 涵盖所有 22 种语言,而子任务 3 排除了意大利语、波兰语、俄语和缅甸语。详细的输入/输出模式和语言覆盖范围见附录 A 和 B。所有子任务均使用宏平均 F1 分数(Macro-F1)进行评估。
我们的系统覆盖了所有子任务,将每个子任务建模为独立的问题。我们的最终系统结合了两个互补的多语言编码器(XLM-RoBERTa-large Conneau et al. (2020) 和 mDeBERTa-v3-base He et al. (2023)),在开发集上优化的加权集成。对于多标签子任务,我们使用二元相关性(Binary Relevance)结合加权二元交叉熵,以减轻严重的标签不平衡问题。
该任务为多语言建模带来了若干挑战。我们观察到标签分布存在显著的跨语言差异,子任务 1 中存在强烈的先验偏移,而子任务 2 和 3 中稀疏性明显,这使得在 Macro-F1 指标下,少数类标签的学习和校准成为核心问题。我们的实验还表明,当稀疏的细粒度标签与主导的二元目标竞争时,共享的多任务训练可能会引入负迁移,使得细粒度预测比粗粒度二元检测更不稳定。综上所述,这些观察结果表明,细粒度标签稀疏性、跨任务不一致性和负迁移仍然是主要瓶颈,尤其是在表现形式预测方面。
在官方评估中,我们在子任务 1、2 和 3 中分别在 11/22、16/22 和 17/18 种语言中进入前十。详细的各语言排名见附录 C。
## 2 背景
在线极化是一种复杂的社会技术现象。除了“信息茧房”内的算法放大效应 Build Up (2025),社交网络结构往往助长回声室效应,其中双极话语成本高昂且罕见 Garimella et al. (2018)。关键的是,研究表明,仅仅接触对立观点反而可能加剧极化 Bail et al. (2018),凸显了数字裂痕的根深蒂固性。这些分歧带来了严重的线下后果,例如加剧种族动员以及在冲突边缘化弱势群体声音 Ali et al. (2025)。在自然语言处理(NLP)领域,早期工作主要集中于识别仇恨言论和冒犯性内容的预测特征 Waseem and Hovy (2016); Davidson et al. (2017)。最近的框架如 HateCheck Röttger et al. (2021) 引入了功能测试,以评估模型对否定和反话语等复杂语言现象的鲁棒性。
最近的基准测试 Naseem et al. (2026b) 表明,虽然二元检测相对成熟,但细粒度的目标和表现形式预测仍然具有更大的挑战性。此外,研究表明,对于这些细粒度标签,基于大语言模型(LLM)的方法不如专门的监督模型可靠。受这些局限性的启发,我们专注于基于多语言编码器的监督模型,这些模型在低资源和不平衡设置下提供稳定和可控的优化。
此类模型通常基于 Transformer 架构 Vaswani et al. (2017),其中预训练变体如 BERT Devlin et al. (2019) 为下游分类任务提供了强大的上下文表示。
在这一范式下,一种常见的策略是使用多任务学习(MTL)Caruana (1997) 联合建模相关目标。然而,以往的研究表明,当标签分布高度不平衡或异质时,MTL 可能会遭受负迁移和任务干扰 Yu et al. (2020)。相比之下,我们采用独立的任务建模结合集成学习,这在严重的标签稀疏性下被证明更加鲁棒。
## 3 系统概述
我们的系统旨在应对 22 种语言下严重标签不平衡的多语言极化建模。我们遵循三个核心设计原则:(i) 每个子任务专业化,以确保每个单独任务的高准确性;(ii) 感知不平衡的优化,以解决多标签子任务中的类别不平衡问题;以及 (iii) 异构集成,以增强跨语言和事件的鲁棒性。
### 3.1 模型架构
我们将三个子任务视为独立的分类问题,分别为每个子任务训练单独的模型。我们的架构利用两个互补的多语言编码器,以在各种语言和子任务上最大化性能:
#### XLM-RoBERTa-large。
我们选择 XLM-RoBERTa-large(XLM-R)作为主要骨干,因为它是强大的多语言编码器,具有广泛的跨语言覆盖范围,并且在以往的工作中表现出稳定的迁移性能 Conneau et al. (2020)。
#### mDeBERTa-v3-base。
我们还采用了 mDeBERTa-v3-base(mDeBERTa),它使用解耦注意力分别编码内容和相对位置 He et al. (2023)。
这两个编码器共同提供了互补的表示空间和标记化行为,然后通过集成组合,以提高在不同语言和任务间的鲁棒性。
### 3.2 感知不平衡的优化
如图 1 所示,极化率在不同语言间差异巨大,表明存在强烈的跨语言先验偏移。这促使我们使用感知不平衡的优化,特别是对于稀疏性更为严重的多标签子任务。
图 1:合并的训练+开发集中子任务 1 各语言的正样本率。对于子任务 2 和 3,我们采用二元相关性(Binary Relevance, BR)公式 Read et al. (2009),其中多标签预测被分解为独立的二元分类任务。这允许将每个标签视为一个单独的问题,对每个 logits 应用 sigmoid 激活以产生独立的概率:
$$
\hat{y}_c = P(c=1|x) = \sigma(z_c) \in [0, 1]
$$
为了处理严重的类别不平衡,我们使用加权二元交叉熵(WBCE)损失,这是成本敏感和不平衡学习中的一种常见方法 Elkan (2001); He and Garcia (2009),其中每个类别的权重与其在训练数据中出现的频率成反比:
$$
\begin{split}
\mathcal{L}(y_c, \hat{y}_c) = -[&w_c \cdot y_c \log(\hat{y}_c) + \\
&(1-y_c) \log(1-\hat{y}_c)],
\end{split}
$$
其中权重 $w_c$ 计算为:
$$
w_c = \frac{N_{\text{neg},c}}{\max(N_{\text{pos},c}, 1)}.
$$
这里,$N_{\text{neg},c}$ 和 $N_{\text{pos},c}$ 分别代表每个标签的负样本和正样本数量。
我们还评估了 WBCE 相对于其他损失函数的有效性;详细比较见第 5.3 节。
### 3.3 异构集成策略
对于我们的最终提交,我们使用加权概率平均来集成两个骨干网络。对于每个标签 $c$ 和输入帖子 $x$,集成的后验概率为:
$$
\begin{split}
\bar{P}(c=1|x) = &\alpha \, P_{\text{XLM-R}}(c=1|x) + \\
&(1-\alpha) \, P_{\text{mDeBERTa}}(c=1|x),
\end{split}
$$
其中 $\alpha$ 在开发集上选择以最大化 Macro-F1(我们使用 $\alpha=0.7$)。
### 3.4 流程摘要
我们的训练和推理流程如下:
1. (i) 分别为每个子任务微调 XLM-R 和 mDeBERTa,
2. (ii) 在开发集上调优集成权重 $\alpha$,
3. (iii) 通过加权集成和全局阈值 $\tau=0.5$ 生成测试预测。
实验细节见第 4 节。
### 3.5 系统变体
我们评估了:
1. (a) 单骨干模型(XLM-R 或 mDeBERTa),
2. (b) 具有共享 XLM-R 编码器和任务特定头部的 MTL 变体,
3. (c) 具有独立每子任务训练的异构集成(已提交)。
表 1:子任务 1-3 各语言的官方 Macro-F1 结果。Ensem 是我们最终提交的结果;mDeB 表示 mDeBERTa-v3-base。蓝色表示集成并列或获得最佳分数,橙色表示最佳非集成模型获得的分数严格高于集成模型。
## 4 实验设置
### 4.1 数据与划分
我们仅限制使用提供的任务数据进行训练,不使用外部词典。官方数据集 Naseem et al. (2026b) 提供训练、开发和测试划分。
#### 开发阶段。
我们使用官方训练集内部 85/15 的划分进行模型选择。对于子任务 1,应用标准分层抽样;对于子任务 2 和 3,我们使用迭代分层 Sechidis et al. (2011) 以在极端稀疏性下保留稀有标签的共同出现。
#### 测试阶段。
在发布开发标签后,我们利用官方开发集作为留出的验证集进行最终超参数调优。最终系统在官方训练集和开发集的并集上重新训练,以生成隐藏测试集的预测。
### 4.2 评估指标
所有子任务均使用 Macro-F1 进行评估:
$$
\text{Macro-F1} = \frac{1}{|L|} \sum_{l \in L} F1_l
$$
对于子任务 2 和 3,$F1_l$ 对每个标签独立计算然后取平均(标签级宏平均),这强调了稀有类别。
### 4.3 实现细节
#### 预处理。
我们应用了最小预处理:删除缺少或为空文本的行,同时保留表情符号以保留情感线索。除了共享任务标准化(例如,URL 替换为 [URL])外,未执行特定任务的归一化。标记化使用默认标记器,进行截断和动态填充,最大序列长度为 256。
#### 训练设置。
实验在 NVIDIA A100 GPU 上使用 PyTorch 和 Hugging Face Transformers(bf16/tf32)进行。模型使用 AdamW 和线性调度器(预热比例 0.1)进行微调,权重衰减设置为 0。在内部验证集上,我们使用耐心值为 2 的早停机制。XLM-R 的学习率为 $1 \times 10^{-5}$(4 个 epoch,批量大小 32),mDeBERTa 的学习率为 $2 \times 10^{-5}$(5 个 epoch,批量大小 64)。额外的实现细节见附录 D。
#### 阈值与集成。
对于多标签设置,使用加权二元交叉熵,正权重从标签频率计算得出。由于性能下降,未采用每标签阈值调优,因此使用全局阈值 $\tau=0.5$。集成系数 $\alpha$ 经过网格搜索后设置为 0.7。
## 5 结果与讨论
图 2:合并的训练+开发集的数据不平衡分析。(a) 任务级偏差(语言 × 任务)。(b) 子任务 3 标签不平衡(语言 × 标签)。
### 5.1 官方评估结果
表 3.5 报告了所有子任务各语言的官方测试 Macro-F1。我们在所有子任务中使用集成作为最终提交,以保持单一一致的流程。在子任务 2 中,它在阿姆哈拉语(第 4 名)、乌尔都语(第 5 名)、奥迪亚语(第 5 名)和波兰语(第 5 名)中进入前五。在子任务 3 中,它在阿姆哈拉语(第 4 名)、阿拉伯语(第 3 名)、英语(第 5 名)、高棉语(第 5 名)、西班牙语(第 4 名)和乌尔都语(第 3 名)中排名前五。
### 5.2 数据不平衡与跨语言条件
图 2 总结了跨子任务和语言的训练+开发标签分布。图 2(a) 显示子任务 1 中存在强烈的跨语言先验偏移(10.75%/49.45%/90.79% 最小/中位/最大极化率)以及跨子任务的整体偏差。如图 2(b) 所示,*Vilification*(侮辱)和 *Stereotype*(刻板印象)比其他表现形式标签更频繁。总体而言,困难源于稀疏性与跨语言异质性的相互作用 Hu et al. (2020)。尽管存在部分语系内一致性 Pires et al. (2019)...相似文章
极化检测:结合AfroXLMR-Social与DeBERTa的低资源与高资源环境混合方法
本文提出了一种混合方法,用于检测英语和豪萨语中的在线极化现象。在英语中使用DeBERTa,在豪萨语及细粒度子任务中使用AfroXLMR-Social,并结合LoRA和数据增强以应对计算和数据限制。
基于Transformer模型的多语言极化检测:类别加权与阈值调优
本文介绍了用于SemEval-2026任务9(多语言极化检测)的系统,使用RoBERTa处理英语、AfroXLMR处理斯瓦希里语,采用类别加权损失和阈值调优,在二元和多标签子任务上取得了有竞争力的F1分数。
DFKI-MLT在SemEval-2026任务7中:引导多语言模型走向文化知识
本文介绍了用于SemEval-2026任务7(文化意识)的DFKI-MLT系统,该系统利用来自平行FLORES数据的语言向量,对多语言大语言模型应用激活引导。该系统在多项选择题(MCQ)赛道中达到86.96%的准确率,在17支队伍中排名第7,事后分析表明,提升效果对层敏感,且在不同语言-区域对之间存在差异。
RaguTeam参加SemEval-2026任务8:在法官协调的大语言模型集成中使用Meno及其伙伴进行忠实的多轮响应生成
本文介绍了SemEval-2026任务8生成子任务的获胜系统。该系统采用由七个大语言模型组成的异构集成,结合双重提示策略,并使用GPT-4o-mini作为裁判来挑选最佳响应。该系统以0.7827的条件调和平均数获得第一名,优于所有基线模型,证明了模型多样性的价值。
UOL@IDEM在BEA 2026共享任务1中的提交:融合神经与丰富特征建模的L1感知词汇难度预测
本文描述了UOL@IDEM在BEA 2026 L1感知词汇难度预测共享任务中的封闭赛道提交方案,结合多语言上下文表示与工程化特征。该系统在西班牙语、德语和中文上取得了有竞争力的RMSE分数,其中词频是最稳定的预测因子。