面向低资源阿尔及利亚方言的端到端混合谣言检测框架
摘要
本文提出了一种面向低资源阿尔及利亚方言社交媒体内容的端到端混合谣言检测框架,通过结合Transformer嵌入和经典分类器,达到了0.84的F1分数。
arXiv:2606.13411v1 公告类型: 新
摘要: 社交媒体的快速增长加剧了谣言的传播。在阿尔及利亚语境下,这一问题更具挑战性,原因在于方言内容的非正式性和语码混合性质、注释资源的稀缺性,以及标准阿拉伯语自然语言处理工具对方言文本的有限有效性。
本文提出了一种面向阿尔及利亚方言社交媒体内容的端到端混合谣言检测框架。我们结合真实社交媒体帖子、合成数据和FASSILA语料库构建了领域特定的注释数据集,并采用基于相似度的注释过程进行自动标注。同时引入音译流水线,生成阿拉伯文字和Arabizi的并行数据集。
我们评估了多种方法,包括经典机器学习、深度学习、Transformer以及混合模型。实验结果表明,结合Transformer嵌入与经典分类器的混合方法性能最佳,达到了0.84的F1分数。我们还发现,领域特定预训练比模型大小更重要,基于社交媒体训练的模型优于在正式阿拉伯语语料库上训练的更大模型。
这些结果证明了在低资源阿尔及利亚方言环境下进行谣言检测的可行性。
查看缓存全文
缓存时间: 2026/06/12 08:52
# 面向低资源阿尔及利亚方言的端到端混合谣言检测框架
Source: https://arxiv.org/html/2606.13411
###### 摘要
社交媒体的快速增长加剧了谣言的传播。在阿尔及利亚语境下,这一问题更具挑战性,原因是方言内容的非正式性和语码转换特性、标注资源稀缺,以及标准阿拉伯语自然语言处理工具在方言文本上的效果有限。
本文提出了一种面向阿尔及利亚方言社交媒体内容的端到端谣言检测混合框架。我们通过结合真实社交媒体帖子、合成数据和 FASSILA 语料库,并基于相似性标注流程实现自动标签,构建了一个领域专用的标注数据集。同时引入了一种转写管道,以生成阿拉伯文和阿拉伯语拉丁转写(Arabizi)的双语并行数据集。
我们评估了多种方法,包括经典机器学习、深度学习、Transformer 和混合模型。实验结果表明,结合 Transformer 嵌入与经典分类器的混合方法性能最佳,F1 分数达到 0.84。我们还发现,领域特定的预训练比模型规模更重要,基于社交媒体训练的模型在性能上优于在正式阿拉伯语语料库上训练的更大模型。
这些结果证明了在低资源阿尔及利亚方言场景下进行谣言检测的可行性。
*关键词*谣言检测⋅阿尔及利亚方言⋅阿拉伯语拉丁转写⋅自然语言处理⋅Transformer
## 1 引言
社交媒体平台已成为数字时代信息传播的主要基础设施。每秒都有海量用户生成内容在 Facebook、YouTube、Instagram 等平台上产生和分享,使得信息以前所未有的速度和范围传播。虽然这种连接性改变了沟通和信息获取方式,但也加剧了未经核实的主张、错误信息和谣言的扩散,这些内容在事实纠正之前就能迅速影响公众认知。
在此背景下,谣言传播已成为公共服务、金融和电信等多个领域的关键挑战。尤其是电信行业对此类现象高度敏感,因为关于网络中断、服务质量下降、定价政策或订阅优惠的虚假声明可能迅速升级,导致客户不满、信任丧失,并长期损害品牌声誉。社交媒体的病毒式传播进一步加剧了这种效应,因此早期自动检测谣言成为公司现代数字监控系统的必要需求。
然而,在现实环境中检测谣言远非易事,尤其是在低资源语言环境中。阿尔及利亚的语言景观因独特的语言和社会文化特征而呈现出特别复杂的情况。用户生成内容主要以阿尔及利亚方言(Darja)书写,这是一种缺乏标准化语法和拼写规则的非正式口语变体。这种方言本质上具有异质性,不断受到区域差异以及阿拉伯语、法语和塔马齐特语之间频繁语码转换的影响。此外,大量在线交流使用阿拉伯语拉丁转写(Arabizi),这是一种用非标准拉丁字母表示阿拉伯语发音的形式,常混有数字和非正式缩写。
这些语言特性给自然语言处理(NLP)系统带来了重大挑战。大多数现有工具是为现代标准阿拉伯语(MSA)设计的,而 MSA 在结构和词汇上均与方言用法不同。因此,它们在处理阿尔及利亚方言内容时性能显著下降。缺乏大规模标注数据集,加上阿拉伯语拉丁转写和方言文本缺乏标准化的预处理管道,进一步限制了该领域的发展。
谣言检测在 NLP 文献中已被广泛研究,尤其是英语等高资源语言。早期工作依赖于基于手工特征的经典机器学习方法 [Castillo 等, 2011](https://arxiv.org/html/2606.13411#bib.bib10);[Qazvinian 等, 2011](https://arxiv.org/html/2606.13411#bib.bib11);[Zubiaga 等, 2017](https://arxiv.org/html/2606.13411#bib.bib12);随后是采用序列模型的深度学习方法 [Ma 等, 2016](https://arxiv.org/html/2606.13411#bib.bib13);以及最近捕捉上下文依赖关系的基于 Transformer 的架构 [Devlin 等, 2019](https://arxiv.org/html/2606.13411#bib.bib14);[Zhou 和 Zafarani, 2020](https://arxiv.org/html/2606.13411#bib.bib15)。在阿拉伯语 NLP 中,研究已逐渐扩展到现代标准阿拉伯语,并在较小程度上涉及某些地区方言 [Abdalla 等, 2020](https://arxiv.org/html/2606.13411#bib.bib16);[Boukil 等, 2021](https://arxiv.org/html/2606.13411#bib.bib17)。然而,大多数现有研究仍集中于正式或半正式文本来源,相对较少涉及高度非正式、语码转换的方言数据 [Alshalan 等, 2020](https://arxiv.org/html/2606.13411#bib.bib18)。尤其是阿尔及利亚方言在领域特定应用(如电信监控)中仍较少被探索。仅有少数研究人员对阿尔及利亚方言中的谣言检测问题感兴趣 [Zakaria 等, 2023](https://arxiv.org/html/2606.13411#bib.bib4);[Abdedaiem 等, 2024](https://arxiv.org/html/2606.13411#bib.bib3)。
这一差距凸显了对专用数据集、稳健预处理策略以及能够处理多语言、噪声和非标准社交媒体文本的自适应建模方法的需求。受此挑战驱动,本研究聚焦于开发面向阿尔及利亚方言内容的自动谣言检测框架。目标是探索不同建模范式(包括经典机器学习、深度学习、基于 Transformer 的模型和混合架构)在低资源且语言复杂的条件下如何表现。
本文其余部分组织如下:第 2 节回顾阿拉伯语和阿尔及利亚方言语境下谣言检测的相关工作,第 3 节介绍所开发方法的详细内容,第 4 节详述进行的实验和得到的结果,第 5 节进行详细讨论和分析,第 6 节总结全文。
## 2 相关工作
近年来,阿拉伯语谣言和虚假新闻检测的研究显著发展,涵盖了经典机器学习、深度学习和基于 Transformer 的方法。在本节中,我们按语言覆盖范围回顾最相关的贡献:现代标准阿拉伯语、其他阿拉伯方言以及专门针对阿尔及利亚方言的研究。表 1 总结了所回顾的研究。
### 2.1 现代标准阿拉伯语与混合阿拉伯语设置
[Zubiaga 等, 2018](https://arxiv.org/html/2606.13411#bib.bib1) 提供了使用序列和神经架构进行上下文谣言检测的基础性工作,为后来对阿拉伯方言设置的改编提供了启发。
阿拉伯语虚假新闻和谣言检测的早期工作主要集中于现代标准阿拉伯语和混合阿拉伯语数据集。[Alkair 等, 2019](https://arxiv.org/html/2606.13411#bib.bib9) 引入了最早的数据集之一,结合了 MSA 与少量方言内容,包括从新闻和讽刺来源收集的阿尔及利亚和埃及文本。他们使用 TF-IDF 特征评估了 SVM、朴素贝叶斯和逻辑回归等经典分类器,SVM 取得了竞争性表现(94%–96% 准确率)。然而,该数据集仍主要面向 MSA,未能反映社交媒体方言用法的复杂性。
[Hocini 和 Smaili, 2024](https://arxiv.org/html/2606.13411#bib.bib8) 提出了一个多语言虚假新闻数据集(BOUTEF),涵盖 MSA、阿尔及利亚方言、突尼斯方言以及语码转换文本。使用基于关键词的 TF-IDF 表示和经典模型,他们通过 MLP 获得了高达 82.3% 的准确率。尽管具有多语言特性,但对预定义关键词列表的依赖限制了上下文表示能力。
[Bahurmuz 等, 2022](https://arxiv.org/html/2606.13411#bib.bib7) 进行了一项大规模研究,结合了 MSA 和方言推文及新闻数据。他们的结果表明,MARBERT 显著优于 AraBERT 和其他模型,突显了在社交媒体谣言检测中方言预训练的重要性。
### 2.2 阿尔及利亚方言专门方法
近期研究已将谣言检测扩展到阿拉伯方言和语码转换内容。[Righi 等, 2022](https://arxiv.org/html/2606.13411#bib.bib6) 使用 AraBERT、mBERT 和 XLM-R 研究了阿尔及利亚 YouTube 评论中的立场分类。AraBERT 取得了最佳性能(宏平均 F1 = 0.53),表明尽管是在 MSA 上训练的,仍能很好地适应方言数据。
阿尔及利亚方言仍是谣言检测中探索最少的语言之一。[Bousri 等, 2022](https://arxiv.org/html/2606.13411#bib.bib5) 引入了一个用于阿尔及利亚阿拉伯语拉丁转写谣言检测的深度学习框架,使用在事件和立场层面标注的 YouTube 评论。他们将 Word2Vec、ELMo 和 TF-IDF 表示与增强注意力机制的 LSTM 和 GRU 模型相结合,F1 分数达到 73%。他们还表明,立场和关联特征能显著提高性能,尤其是在低资源场景下。
[Zakaria 等, 2023](https://arxiv.org/html/2606.13411#bib.bib4) 使用结构化特征工程聚焦于阿尔及利亚阿拉伯语拉丁转写。他们引入了基于词汇、立场和情感的 TF-IDF 表示,并证明立场信息比情感对谣言检测更具辨别力。他们的发现支持了辅助语言信号(如 SDQC 式标注)的重要性。
[Abdedaiem 等, 2024](https://arxiv.org/html/2606.13411#bib.bib3) 引入了 FASSILA,一个用于阿尔及利亚方言虚假新闻和情感分析的基准数据集。他们评估了 AraBERT、MARBERT 和 DziriBERT 等 Transformer 模型。MARBERT 在虚假新闻检测上取得了最佳性能,证实大规模方言预训练比方言专用但更小的语料库更有效。
[Hamadouche 等, 2024](https://arxiv.org/html/2606.13411#bib.bib2) 提出了一种混合集成方法,结合基于 TF-IDF 的经典模型与微调的 Arabic-BERT,取得了 97.72% 的准确率。然而,他们的阿尔及利亚子集源于翻译后的 MSA 内容,限制了其对原生方言应用的现实性。
### 2.3 讨论与总结
纵观文献,出现了一些一致的趋势。基于 Transformer 的模型通常优于经典和深度学习方法,尤其是在社交媒体或方言数据上预训练时。MARBERT 仍然是阿拉伯方言最稳健的模型,通常优于在更小方言语料库上训练的模型。
然而,仍然存在重要局限性。大多数现有研究集中于 MSA 或混合阿拉伯语,而阿尔及利亚方言——尤其是阿拉伯语拉丁转写形式——仍较少被探索。数据集规模普遍较小,限制了深度学习方法的有效性。此外,许多研究依赖于精心策划或翻译的数据集,而非自然发生的社交媒体内容,降低了其效度。
这些局限性突显了对专门数据集和针对阿尔及利亚方言社交媒体内容量身定制的稳健框架的需求,这也是本研究的核心。
引用 | 方言 | 来源 | 规模 | 类别 | 分类器 | 结果
--- | --- | --- | --- | --- | --- | ---
Alkair 等 (2019) [9] | MSA + 方言 | 网络 | 4,079 | 真实/虚假 | SVM | 准确率: 94%–96%
Zakaria 等 (2023) [4] | 阿尔及利亚 | YouTube | 11,822 | 谣言/非谣言 | SVM + 立场 | 未报告
Hocini 和 Smaili (2024) [8] | 混合 | BOUTEF | 3,666 | 虚假/虚假评论/非虚假 | MLP | 准确率: 82.3%
Bousri 等 (2022) [5] | 阿尔及利亚 | YouTube | 9,500 | 谣言/非谣言 | Word2Vec + LSTM | F1: 73%
Abdedaiem 等 (2024) [3] | 阿尔及利亚 | YT / FB / GPT-4 | 10,087 | 真实/虚假 | MARBERT | 虚假新闻检测最佳
Hamadouche 等 (2024) [2] | 阿拉伯语 + 方言 | 新闻 | 3,563 | 真实/虚假 | AraBERT + 集成 | 准确率: 97.72%, F1: 98%
Righi 等 (2022) [6] | 阿尔及利亚 | YouTube | 3,147 | 支持/否认/询问/评论 | AraBERT | F1: 0.53
Bahurmuz 等 (2022) [7] | MSA + 方言 | Twitter / 新闻 | 36,308 | 谣言/非谣言 | MARBERT | 准确率: 0.97, F1: 97%
表 1:阿拉伯语和阿尔及利亚方言谣言与虚假新闻检测相关工作摘要
## 3 我们提出的方法
所提出的框架被设计为一个顺序的多阶段管道,包含三个主要模块:(i) 数据摄取与自动标注,(ii) 语言预处理与脚本转写,以及 (iii) 特征嵌入与模型训练。整体架构如图 1 所示。
### 3.1 系统概述
所提出框架的目标是对阿尔及利亚方言电信相关文本进行自动谣言检测。该系统整合了异构数据源,构建了基于语义相似性的弱监督标注机制,并通过基于 Transformer 的模型利用特定脚本的表示学习。
参见图例
图 1:完整框架架构
### 3.2 模块 1:数据摄取与自动标注
#### 3.2.1 数据来源
由于缺乏公开可用的阿尔及利亚方言电信领域谣言数据集,我们从三个互补来源构建了一个定制数据集:
- **来源 A:收集的电信消息**——从阿尔及利亚社交媒体平台(主要是 Facebook)提取的未标注用户生成内容,涵盖网络中断、计费和服务质量等主题。还从经过验证的 Facebook 页面和官方网站收集了其他声明,作为事实参考。
- **来源 B:合成消息**——使用 Google Gemini 人工生成的电信消息,以缓解数据稀缺问题。提示强制使用阿尔及利亚方言语言使用,并控制谣言/非谣言语义。
- **来源 C:FASSILA 语料库** ([Abdedaiem 等, 2024](https://arxiv.org/html/2606.13411#bib.bib3))——一个预先标注的阿尔及利亚方言数据集 [31],原始标注用于真实性。标签被重新映射为二元方案(谣言/非谣言),并直接整合到最终数据集中。
#### 3.2.2 自动标注引擎
由于来源 A 和 B 未标注,我们引入了基于与官方电信收集声明的语义相似性的自动标注机制。
每条消息首先使用大型语言模型从阿尔及利亚方言翻译为现代标准阿拉伯语,以实现可靠的语义对齐。设 $M = \{m_j\}_{j=1}^k$ 表示翻译后的消息,$F = \{f_i\}_{i=1}^n$ 表示官方事实,每个事实关联一个有效区间 $[t_i^{start}, t_i^{end}]$。
为确保时间一致性,仅考虑在消息发布日期 $d_j$ 时有效的事实:
$$F(j) = \{f_i \in F \mid t_i^{start} \leq d_j \leq t_i^{end}\}.$$相似文章
Dziri Voicebot:面向阿尔及利亚方言的端到端低资源语音对话系统
本文提出了一种模块化的端到端语音对话系统,适用于低资源的阿尔及利亚方言,集成了ASR、NLU、RAG和TTS,并使用了专用数据集和微调模型。
极化检测:结合AfroXLMR-Social与DeBERTa的低资源与高资源环境混合方法
本文提出了一种混合方法,用于检测英语和豪萨语中的在线极化现象。在英语中使用DeBERTa,在豪萨语及细粒度子任务中使用AfroXLMR-Social,并结合LoRA和数据增强以应对计算和数据限制。
面向低资源口语方言的线性语义分割
本文引入了一个针对低资源阿拉伯语方言的语义分割基准,并提出了一种模型,该模型在会话式语音上的性能优于标准基线模型。
BOUTEF:北非假新闻的多语言语料库——语言作为武器
本文介绍了BOUTEF,一个用于研究阿尔及利亚和突尼斯假新闻的大规模多语言语料库,涵盖阿拉伯方言、Arabizi、法语、英语及语码转换。该语料库包含对语言策略和互动动态的实证分析。
基于迁移学习与数据增强的低资源汉语方言辨识
本文提出了一种新颖的框架(CDDTLDA),利用迁移学习和数据增强技术,在低资源条件下提升汉语方言辨识能力,并在两个基准语料库上取得了最先进的结果。