极化检测:结合AfroXLMR-Social与DeBERTa的低资源与高资源环境混合方法
摘要
本文提出了一种混合方法,用于检测英语和豪萨语中的在线极化现象。在英语中使用DeBERTa,在豪萨语及细粒度子任务中使用AfroXLMR-Social,并结合LoRA和数据增强以应对计算和数据限制。
查看缓存全文
缓存时间: 2026/07/14 04:21
# 极化检测:面向低资源与高资源场景的 AfroXLMR-Social 与 DeBERTa 混合方法 来源:https://arxiv.org/html/2607.10312 ###### 摘要 在线极化的迅速蔓延威胁着社会凝聚力,这要求开发能够在不同语言环境中有效运行的稳健自动化检测系统。本文介绍我们针对 POLAR 2026 共享任务的系统描述,重点是在英语和豪萨语中检测并表征极化话语。我们提出一种混合建模策略:对于英语二分类检测,我们利用单语模型 DeBERTa 的优势;对于豪萨语以及所有细粒度子任务(类型与表现),我们使用 AfroXLMR-Social。这种领域适应的多语言模型对于捕捉社交媒体文本中极化的细微差别至关重要。为了进一步解决计算资源受限和数据稀缺的问题,我们实现了低秩适应(LoRA)以及通过 nlpaug 进行的文本数据增强。我们在所有三个子任务上都取得了有竞争力的结果,表明针对具体子任务需求定制的模型选择能够在性能上实现最佳平衡。https://github.com/mohdasaid/NLP-LLM/blob/main/Polarization.ipynb 极化检测:面向低资源与高资源场景的 AfroXLMR-Social 与 DeBERTa 混合方法 Muhammad Abdullahi Said 非洲数学科学研究所 (AIMS) [email protected] ## 1 引言 在线极化——即公众舆论尖锐地分裂为对立派系,并伴随敌意与缺乏同理心——已成为数字话语中普遍存在的问题。POLAR 2026 共享任务旨在评估自然语言处理(NLP)系统在多种语言和文化中检测这一现象的能力 (Naseem et al., 2025 (https://arxiv.org/html/2607.10312#bib.bib5))。 检测极化超越了传统的情感分析。它需要捕捉微妙的修辞策略,如“我们 vs. 他们”的框架化、无效化以及非人化。这种复杂性在低资源语言(如豪萨语)中更为严重,因为这类语言的标注数据稀缺,且标准的多语言模型通常缺乏对方言变体的充分接触。 在这项工作中,我们提出了一种策略性的混合训练流水线。我们的主要贡献如下: 1. 1. 任务特定的模型选择:我们发现,虽然英语的二分类检测(子任务1)受益于专门的单语模型,但两种语言的细粒度任务(子任务2和3)则需要 AfroXLMR-Social (Belay et al., 2025 (https://arxiv.org/html/2607.10312#bib.bib2)) 所提供的强大社交媒体理解能力。 2. 2. 领域适应有效性:我们证明了 AfroXLMR-Social——一个在非洲社交媒体内容上继续预训练的模型——对于豪萨语子任务不可或缺,其性能显著优于通用多语言基线。 3. 3. 参数效率与增强:我们采用 LoRA(低秩适应)(Hu et al., 2021 (https://arxiv.org/html/2607.10312#bib.bib3)) 在消费级硬件上进行高效微调,并使用 nlpaug (Ma, 2019 (https://arxiv.org/html/2607.10312#bib.bib4)) 生成合成样本,以解决表现标签中严重的类别不平衡问题。 ## 2 相关工作 ### 2.1 极化检测 早期的计算极化方法依赖于网络拓扑结构,从转发或关注者图中推断意识形态立场。然而,基于内容的 Transformer 方法近年来逐渐受到关注。研究表明,诸如 BERT 和 RoBERTa 之类的模型能够检测立场和毒性,这些都是极化的代理指标。POLAR 基准的进步在于将极化明确分类为类型(政治、宗教)和修辞表现。 ### 2.2 面向非洲 NLP 的多语言模型 像 mBERT 和 XLM-R 这样的巨大多语言模型在非洲语言上往往表现不佳,原因是“多语言诅咒”——模型容量被过多语言稀释。AfroXLMR-Social (Belay et al., 2025 (https://arxiv.org/html/2607.10312#bib.bib2)) 建立在原始 AfroXLMR (Alabi et al., 2022 (https://arxiv.org/html/2607.10312#bib.bib1)) 的成功基础上,通过引入在社交媒体语料上的“领域自适应预训练”(DAPT)而进一步发展。这种适应对豪萨语至关重要,因为它使模型的内部表示与 POLAR 数据集中包含噪音、非正式和代码混合的文本风格对齐。 ### 2.3 高效微调 随着模型规模的增大,全参数微调变得过于昂贵。像 Adapter 和 LoRA 这样的参数高效微调(PEFT)方法已成为标准解决方案。特别地,LoRA 已被证明在低数据场景下能够匹配甚至超越全参数微调的性能,因为它降低了灾难性遗忘的风险。通过冻结预训练主干,我们得以保留在广泛 DAPT 阶段获取的语言知识。 ## 3 任务描述 我们处理组织者提供的三个层次化子任务: 1. 1. 子任务1(检测):一个二分类任务,判断文本 \(x\) 是否包含极化内容 \(y \in \{0,1\}\)。 2. 2. 子任务2(类型):一个多标签分类任务,识别极化的主题。标签包括:政治、宗教、种族/民族、性别/性身份,以及其他。 3. 3. 子任务3(表现):一个多标签任务,识别用于表达极化的修辞手段。标签包括:丑化、刻板印象、非人化、极端语言、缺乏同理心,以及无效化。 ## 4 方法论 ### 4.1 模型架构策略 #### 4.1.1 英语子任务1:DeBERTa 对于英语的二分类检测任务,我们使用了 DeBERTa-v3-base。DeBERTa 通过解耦注意力机制和增强型掩码解码器改进了 BERT 和 RoBERTa,使其在处理标准语法占主导的高资源语言中的细微分类任务时非常有效。 #### 4.1.2 豪萨语与子任务2/3:AfroXLMR-Social 对于所有豪萨语任务以及英语的细粒度任务(类型与表现),我们采用了 AfroXLMR-Social。子任务2和3的复杂性要求模型理解语言的社会背景——俚语、标签和非正式措辞——这正是该领域适应检查点的核心优势。 ### 4.2 低秩适应(LoRA) 为了高效地适应这些模型,我们冻结了预训练主干,并将可训练的低秩矩阵 \(A,B\) 注入到查询(\(Q\))和值(\(V\))注意力投影中。 \(h=W_0x+\frac{\alpha}{r}BAx\) \hfill (1) 我们使用秩 \(r=8\) 和缩放因子 \(\alpha=16\)。这种方法使我们能够为每个子任务微调不同的模型,而不会超出 GPU 内存限制。 ### 4.3 数据增强 我们使用 nlpaug (Ma, 2019 (https://arxiv.org/html/2607.10312#bib.bib4)) 来稳健地处理类别不平衡。 - • 同义词替换:我们将最多 10% 的单词替换为 WordNet 中的同义词。 - • 随机插入:我们插入上下文相关的单词以改变句子结构。 这对于子任务3至关重要,因为像“非人化”这样的类别只有很少的正样本。 ### 4.4 训练策略 #### 4.4.1 损失函数 对于子任务1,我们最小化二元交叉熵(BCE)。对于子任务2和3,我们使用 BCEWithLogitsLoss,它对每个类别的 logit 独立应用 sigmoid 激活: \(\mathcal{L}=-\frac{1}{C}\sum_{c=1}^{C}[y_c\log(\sigma(z_c))+(1-y_c)\log(1-\sigma(z_c))]\) \hfill (2) #### 4.4.2 动态学习率 我们在前 10% 的训练步骤中实现线性预热,随后进行余弦衰减。这个调度对于稳定 DeBERTa 模型的训练至关重要,因为该模型对初始化非常敏感。 ## 5 实验设置 ### 5.1 数据与预处理 数据以 CSV 格式提供。我们通过移除 URL 工件来清洗文本,但保留 emoji 和标签,因为它们是社交媒体中情感的强烈指标。我们使用 XLM-R 分词器,最大序列长度为 128。 ### 5.2 K 折交叉验证 我们采用了 5 折交叉验证。对于每种语言,训练数据被分成 5 个分层折。我们训练了 5 个独立的模型,每个模型使用 4 折进行训练,1 折进行验证。最终的测试预测通过 5 个模型的软投票集成生成。 ### 5.3 超参数 表格 1 (https://arxiv.org/html/2607.10312#S5.T1) 详细列出了所使用的配置。 表格 1:英语和豪萨语的超参数。 ## 6 结果 ### 6.1 子任务1:极化检测 表格 2 (https://arxiv.org/html/2607.10312#S6.T2) 展示了检测结果。对于英语,切换为 DeBERTa 相比我们初始的多语言基线在 F1 分数上取得了显著提升。对于豪萨语,AfroXLMR-Social 仍然更优。 表格 2:子任务1 结果(验证集平均)。 ### 6.2 子任务2和3:细粒度任务 表格 3 (https://arxiv.org/html/2607.10312#S6.T3) 和 4 (https://arxiv.org/html/2607.10312#S6.T4) 总结了多标签结果。AfroXLMR-Social 在两种语言上的表现都非常出色。其在社交媒体数据上的预训练可能使其能够更好地识别修辞“表现”(子任务3),因为这类表现在往由非正式的社会线索而非正式词汇来体现。 表格 3:使用 AfroXLMR-Social 的子任务2(类型)。 表格 4:使用 AfroXLMR-Social 的子任务3(表现)。 ## 7 讨论 ### 7.1 AfroXLMR-Social 的主导地位 我们实验的一个关键发现是 AfroXLMR-Social 在复杂任务(2和3)中的稳健性。即使在单语模型通常占主导的英语中,AfroXLMR-Social 在确定极化的类型和表现方面也提供了有竞争力和稳定的结果。我们假设这是因为“社会”预训练使模型暴露于这些子任务旨在分类的那种有毒和极化的话语模式,无论语言是什么。 ### 7.2 数据增强的挑战 虽然 nlpaug 提高了少数类别的召回率,但偶尔也会引入语义漂移。例如,将政治帖子中的“regime”替换为“government”可能会微妙地改变极化语气(从负面变为中性)。未来的工作应探索基于嵌入的增强(基于 BERT 的插入),以更好地保持语义一致性。 ## 8 结论 我们的系统表明,将领域适应的多语言主干与高效微调(LoRA)相结合,是低资源语言场景中极化检测的一种非常有效的策略。 ## 参考文献 - Alabi et al. (2022) Jesujoba O Alabi, David I Adelani, Marius Mosbach, and Dietrich Klakow. 2022. Adapting pre-trained language models to african languages via multilingual adaptive fine-tuning. In *Proceedings of COLING*, pages 4336–4349. - Belay et al. (2025) Tadesse Destaw Belay, Israel Abebe Azime, and Ibrahim Said Ahmad. 2025. Afroxlmr-social: Adapting pre-trained language models for african languages social media text. *arXiv preprint arXiv:2503.18247*. - Hu et al. (2021) Edward J Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen. 2021. Lora: Low-rank adaptation of large language models. *arXiv preprint arXiv:2106.09685*. - Ma (2019) Edward Ma. 2019. Nlp augmentation (https://pypi.org/project/nlpaug/). *PyPI*. - Naseem et al. (2025) Usman Naseem, Juan Ren, Saba Anwar, and Sarah Kohail. 2025. Polar: A benchmark for multilingual, multicultural, and multi-event online polarization. *arXiv preprint arXiv:2505.20624*. ## 附录 A:详细实验设置 ### A.1 硬件与计算 所有模型均在单一 NVIDIA T4 GPU(16GB 显存)上使用 Google Colab 环境进行训练。每个折的平均训练时间约为豪萨语 20 分钟,英语 15 分钟。 ### A.2 数据增强细节 在 nlpaug 实现中,我们使用了 SynonymAug 和 RandomWordAug 类。 - • 同义词增强:`aug_p=0.1`(增强一个 token 的概率)。 - • 停用词:我们使用 NLTK 停用词列表,以防止增强结构上重要的词。 ### A.3 标签分布 POLAR 数据集表现出显著的类别不平衡。在子任务3中,像“非人化”这样的类别明显比“丑化”更罕见。我们考虑了加权损失函数,但在初步试验中,增强策略被证明更为有效。
相似文章
基于Transformer模型的多语言极化检测:类别加权与阈值调优
本文介绍了用于SemEval-2026任务9(多语言极化检测)的系统,使用RoBERTa处理英语、AfroXLMR处理斯瓦希里语,采用类别加权损失和阈值调优,在二元和多标签子任务上取得了有竞争力的F1分数。
YEZE 参加 SemEval-2026 任务 9:通过异构集成检测多语言、多文化和多事件的网络极化
本文介绍了用于 SemEval-2026 任务 9 的 YEZE 系统,该系统利用 XLM-RoBERTa 和 mDeBERTa 模型的异构集成,检测 22 种语言中的网络极化现象。
面向低资源阿尔及利亚方言的端到端混合谣言检测框架
本文提出了一种面向低资源阿尔及利亚方言社交媒体内容的端到端混合谣言检测框架,通过结合Transformer嵌入和经典分类器,达到了0.84的F1分数。
默认极化:LLM 内容策展中的推荐偏差审计
本文对 OpenAI、Anthropic 和 Google 的基于 LLM 的内容策展推荐偏差进行了大规模审计,使用了来自 Twitter/X、Bluesky 和 Reddit 数据的 540,000 次模拟选择。研究发现 LLM 系统性地放大极化现象,在毒性处理方面表现出不同的权衡,并显示出显著的政治倾向偏差,倾向于左倾作者,尽管数据集中右倾作者占多数。
CBRS:基于双语数据集与双层过滤的多平台社交流认知血液请求系统
孟加拉国工程技术大学的研究人员提出了CBRS,一个多平台框架,采用双层架构并利用包含1.1万条孟加拉语和英语双语解析血液请求消息的新数据集,对社交媒体中的血液捐赠请求进行过滤和解析。其LoRA微调的Llama-3.2-3B模型实现了99%的过滤准确率和92%的零样本解析准确率,在减少35倍令牌使用量的同时,优于GPT-4o-mini等其他大语言模型。