BanglaMamba:探索用于孟加拉语假新闻检测的状态空间模型
摘要
本文探讨了基于Mamba的状态空间模型用于孟加拉语假新闻检测,并与Transformer模型如BanglaBERT进行比较。研究表明,Mamba在资源受限环境中提供了具有竞争力的性能和更高的效率。
arXiv:2608.25190v1 公告类型:新
摘要:假新闻检测已成为自然语言处理(NLP)的一项重要任务,这是由于在线新闻平台和社交媒体的快速传播误导信息所致。虽然基于Transformer的模型如BanglaBERT在孟加拉语文本分类中表现出色,但其二次计算复杂度使其在资源受限环境中处理长文档时不太合适。本文研究了基于Mamba的状态空间模型(SSMs)作为孟加拉语假新闻检测的高效替代方案。我们提出了BanglaMamba,并将其与预训练的BanglaBERT和从头训练的类似配置的BERT模型进行比较。实验结果显示,BanglaBERT达到了最高的Macro-F1分数(0.9260),而BanglaMamba(0.9029)尽管使用了不同的架构,但其性能与从头训练的CustomBERT(0.9057)相当。同时,BanglaMamba实现了大约2.2倍更高的推理吞吐量和49%更低的推理峰值GPU内存使用率,相比基于BERT的模型。跨数据集评估显示,BanglaBERT在外部数据集上泛化更好,突出了大规模预训练的重要性。这些发现表明,基于Mamba的状态空间模型可以为孟加拉语假新闻检测提供一种竞争性和计算高效的替代方案,替代基于Transformer的架构,特别是在资源受限的环境中。
查看缓存全文
缓存时间: 2026/08/27 09:16
# BanglaMamba:探索用于孟加拉语虚假新闻检测的状态空间模型 来源:https://arxiv.org/html/2608.25190 M\. K\. Khalidi Siam所属机构:计算机科学与工程系所属机构:BRAC大学所属机构:孟加拉国达卡电子邮件:[mailto:](mailto:)[mk\.khalidi\.siam@g\.bracu\.ac\.bd](mailto:[email protected]) ###### 摘要 由于虚假信息通过在线新闻平台和社交媒体迅速传播,虚假新闻检测已成为一项重要的自然语言处理任务。虽然基于Transformer的模型如孟加拉语BERT在孟加拉语文本分类上表现出色,但其二次方计算复杂性使其在资源受限环境下处理长文档时不太适用。本文研究了基于Mamba的状态空间模型作为孟加拉语虚假新闻检测的高效替代方案。我们提出了BanglaMamba模型,并将其与预训练的孟加拉语BERT以及一个从零开始训练、配置相似的BERT模型进行比较。实验结果表明,孟加拉语BERT达到了最高的宏F1分数(0.9260),而BanglaMamba(0.9029)尽管使用了不同的架构,但其性能与从零开始训练的CustomBERT(0.9057)相当。同时,BanglaMamba实现了约2.2倍于BERT模型的推理吞吐量,并将推理峰值GPU内存使用量降低了49%。跨数据集评估显示,孟加拉语BERT对外部数据集的泛化能力更强,突显了大规模预训练的重要性。这些发现表明,基于Mamba的状态空间模型可以为孟加拉语虚假新闻检测提供一个在计算效率上具有竞争力的、可替代Transformer架构的方案,特别是在资源受限的环境中。 ## 1 引言 虚假新闻已成为数字信息时代的主要挑战,误导性信息通过在线新闻门户和社交媒体迅速传播。虚假信息的广泛传播会影响公众舆论,并削弱对可信新闻来源的信任,使得自动虚假新闻检测成为自然语言处理中一个重要的研究问题。 近年来,基于Transformer的模型如BERT通过学习超越传统机器学习和常规深度学习方法的上下文表示,显著改进了虚假新闻检测。对于孟加拉语NLP,孟加拉语BERT已成为用于文本分类任务的强大预训练语言模型。 尽管有效,基于Transformer的模型有其重要的局限性。自注意力机制在输入长度方面具有二次方的时间和内存复杂性,导致对更长序列的计算成本和GPU内存消耗增加。 状态空间模型的最新进展,特别是Mamba架构,提供了一种通过随序列长度线性扩展来实现高效长序列建模的替代方法,同时保持了具有竞争力的序列建模性能。然而,SSMs在孟加拉语虚假新闻检测中的应用在很大程度上尚未被探索。此外,现有研究尚未系统地比较基于Transformer和基于SSMs的模型在分类性能和计算效率方面的表现。 为解决这些差距,本文研究了一种基于Mamba的状态空间模型(称为BanglaMamba)用于孟加拉语虚假新闻检测,并将其与预训练的孟加拉语BERT以及一个从零开始训练、配置相似的Transformer模型进行比较。本工作的主要贡献如下: - •据我们所知,这是第一项研究基于Mamba的状态空间模型用于孟加拉语虚假新闻检测的工作。 - •我们系统地比较了BanglaMamba与孟加拉语BERT以及一个配置相似的CustomBERT在分类性能和计算效率方面的表现,包括GPU内存使用、推理延迟和吞吐量,同时使用从零开始训练的Transformer基线来区分架构效应与语言预训练的益处。 - •我们在一个外部的孟加拉语虚假新闻数据集上评估了所有三个模型的领域外泛化能力,以检验它们在数据分布偏移下的鲁棒性。 ## 2 相关工作 虚假新闻检测已使用传统的机器学习、深度学习,以及最近基于Transformer的架构在不同语言中进行了广泛研究。早期研究主要依赖于统计机器学习模型,之后逐渐过渡到上下文语言模型。 对于孟加拉语虚假新闻检测,Khatun和Khan构造了一个包含虚假和真实孟加拉语新闻标题的数据集,并评估了几种机器学习算法以及基于Transformer的模型。他们的结果表明,孟加拉语BERT持续优于所有评估的机器学习方法,证明了上下文语言表示的有效性。 后续研究探索了深度学习架构。Habiba等人比较了孟加拉语ELECTRA与一个定制的深度CNN,并报告说CNN略优于Transformer模型。类似地,Rasel等人评估了机器学习、深度学习和基于Transformer的方法用于孟加拉语虚假新闻检测,发现CNN实现了最高的分类性能,超过孟加拉语BERT约1%。尽管如此,孟加拉语BERT仍然具有高度竞争力,表明基于Transformer模型的有效性。 最近的研究强调了Transformer优越的泛化能力。Dell’Oglio等人在十个英语虚假新闻数据集上比较了机器学习、深度学习、基于Transformer的模型和大型语言模型。虽然逻辑回归和支持向量机在较小的数据集上表现具有竞争力,但CNN和双向长短期记忆网络表现出不一致的性能且更容易过拟合。微调的Transformer模型在分类准确性和跨领域泛化之间取得了最佳平衡。Tabassum等人在马拉雅拉姆语虚假新闻检测中报告了类似的发现。此外,Chowdhury等人表明,结合数据增强与Transformer微调显著提高了孟加拉语虚假新闻检测性能。 早期的孟加拉语虚假新闻检测研究在很大程度上依赖于手工制作或浅层特征提取技术。传统的机器学习方法通常使用词袋模型、TF-IDF和词干提取,而深度学习模型通常使用静态Word2Vec嵌入。尽管计算效率高,但这些方法无法有效捕捉上下文意义、长距离语义依赖或词序。相比之下,基于Transformer的模型使用子词分词和自注意力自动学习上下文嵌入。它们的分层表示在不同层捕捉词汇、句法和语义信息,使Transformer成为现代孟加拉语NLP的主流范式。 然而,Transformer的自注意力机制在序列长度方面具有二次方的时间和内存复杂性,使得Transformer在处理长文档时计算成本高昂。状态空间模型已成为高效长序列建模的替代方案,结构化状态空间展示了捕捉长距离依赖关系的能力,同时保持了良好的计算效率。在此基础上,Mamba引入了一种选择性状态空间机制,实现了依赖于输入的信息传播,并在序列长度上实现线性扩展,同时在长序列上保持了具有竞争力的性能。据我们所知,没有已发表的研究调查过SSMs用于孟加拉语虚假新闻检测。此外,现有研究尚未系统地比较SSMs与孟加拉语BERT在分类性能和计算效率方面的表现。 ## 3 方法论 ### 3.1 问题形式化 本研究将孟加拉语虚假新闻检测视为一个二元文本分类问题。给定一篇由标题和正文组成的新闻文章,目标是将该文章分类为真实(标签 = 1)或虚假(标签 = 0)。形式上,分类器学习一个映射函数 f:X→\{0,1\},f\\colon X\\rightarrow\\\{0,1\\\}, 其中 X 表示已分词的孟加拉语文本序列空间。 评估了两种神经架构和一个参考基线: - •BanglaBERT,一个预训练的Transformer编码器,作为主要基线。 - •CustomBERT,一个配置与孟加拉语BERT相当但完全从零开始训练的Transformer模型,提供了在没有大规模预训练情况下的公平的架构级比较。 - •BanglaMamba,一个完全从零开始训练的基于Mamba的状态空间模型。 本研究通过比较Mamba状态空间模型架构的分类性能与预训练的Transformer基线(BanglaBERT)以及一个架构可比的从零开始训练的Transformer(CustomBERT),来探究该架构用于孟加拉语虚假新闻检测的能力。这种比较使得在减少大规模语言预训练影响的同时,能够分析模型架构的影响。 ### 3.2 数据集与预处理 #### 3.2.1 数据集 所有实验均使用BanFakeNews-2.0数据集进行,这是一个公开的孟加拉语虚假新闻语料库,包含标注为虚假(0)或真实(1)的新闻文章。每个样本包含一个新闻标题及其对应的文章正文。为评估领域外泛化能力,我们额外使用了BanglaFakeNews2025数据集作为外部评估数据集。两个数据集都经过相同的预处理程序以确保一致性。预处理后,BanFakeNews-2.0包含58,001个样本,其中16.5%标注为虚假,83.5%为真实;而外部的BanglaFakeNews2025测试集包含3,979个样本,其中49.9%为虚假,50.1%为真实。 #### 3.2.2 预处理 在训练之前,应用了一个预处理流程来标准化文本数据。首先,使用\[SEP\]标记连接标题和文章正文,以实现联合上下文学习。预处理步骤包括:(i)使用正则表达式移除HTML标签和URL,(ii)进行Unicode NFC规范化以确保一致的孟加拉语编码,(iii)通过合并多个空格并修剪开头/结尾空格进行空白规范化,(iv)移除少于20个或超过2000个单词的文章,(v)去重,以及(vi)删除预处理后的空样本。标点符号被保留,因为它们可能包含与虚假新闻检测相关的文体线索。大约5.5%的文章因重复而被移除,另有0.3%因包含少于20个或超过2000个单词而被移除。 处理后的数据集使用分层抽样按80%训练集、10%验证集和10%测试集进行划分,以保持类别分布。由于数据集不平衡,真实样本约占83.5%,虚假样本约占16.5%,我们使用Scikit-learn的平衡类别权重策略从训练集中计算逆频率类别权重,并在训练期间的加权交叉熵损失中纳入这些权重。 #### 3.2.3 上下文长度评估集 由于所有三个模型都在最大输入长度为512个标记的条件下进行评估,我们将保留的测试集根据孟加拉语BERT分词器划分为两个子集,以检查截断的影响: - •短文章(≤512个标记):BanglaBERT、CustomBERT和BanglaMamba处理完整的文章而不截断。 - •长文章(>512个标记):BanglaBERT、CustomBERT和BanglaMamba仅处理前512个标记,剩余内容被截断。 此评估检查512个标记的输入约束以及由此产生的对较长文章的截断是否显著影响三个模型的虚假新闻检测性能。 ### 3.3 分词 所有模型都使用孟加拉语BERT的SentencePiece分词器,词汇表大小为32,000个子词标记。使用共同的分词器确保了分类性能的差异源于模型架构,而不是分词方式的差异。短于最大序列长度的序列会进行填充,而长于该长度的序列则根据每个模型的上下文限制进行截断。 ### 3.4 模型架构 #### 3.4.1 BanglaBERT和CustomBERT 孟加拉语BERT作为预训练的Transformer基线。它是一个在大规模孟加拉语语料库上预训练的BERT风格Transformer编码器。我们使用孟加拉语BERT基础模型的较小版本,称为孟加拉语BERT-small;在本文中,我们简称其为孟加拉语BERT。我们实验中使用的具体预训练检查点在Hugging Face模型中心公开可用。111https://huggingface.co/csebuetnlp/banglabert_small在[CLS]标记表示上连接一个线性分类层,并在训练集上对所有参数进行端到端微调。 CustomBERT使用与BanglaBERT相同的架构和配置,但完全在训练数据上从零开始训练,没有任何大规模语言预训练。引入该模型是为了通过控制预训练的影响,与BanglaMamba进行更直接的比较。因此,CustomBERT和BanglaMamba之间的比较主要反映了底层Transformer和状态空间模型架构的差异,而BanglaBERT和CustomBERT之间的比较则说明了在相同Transformer配置下预训练的效果。 表1:BanglaBERT和CustomBERT的配置。 #### 3.4.2 BanglaMamba 提出的BanglaMamba模型基于Mamba状态空间模型架构构建,完全从零开始训练,未使用任何预训练语言表示。
相似文章
动荡回响:用于假新闻与暴力驱动暴乱活动早期预警的多模态NLP框架
本文介绍了一个多模态NLP框架,融合了XLM-RoBERTa和CLIP以及地理空间和讽刺特征,用于检测假新闻和预测暴力驱动的暴乱活动,在一个包含138,256个样本的孟加拉语/英语数据集上实现了98%的测试准确率。
从单语到多语:评估Mamba在南非语言中的ASR性能
本文评估了Mamba状态空间模型在七种南非语言上的ASR性能,发现其在资源更少的情况下达到了与Conformer相当的准确率,并探讨了多语训练策略和低资源场景。
具有自适应退出状态选择的循环状态空间语言模型
本文探索了使用Mamba和混合Mamba-Transformer骨干网络的循环(递归)状态空间语言模型,表明其在推理任务上优于非循环基线,并在等参数和等FLOPs预训练下保持竞争力,同时自适应退出状态选择改善了中间深度性能。
MambaLSTM:一种用于增强交通事故风险预测的时空框架
本文提出MambaLSTM,一种结合Mamba状态空间模型和LSTM的框架,用于时空交通事故风险预测,解决了特征融合中的噪声和全局空间关联问题。
超越干净文本:在噪声文本中评估编码器和解码器对孟加拉语事件检测的鲁棒性
本文介绍了一个包含噪声文本(ASR、拼写错误)的孟加拉语事件检测基准,并评估了仅编码器和仅解码器的大语言模型,发现解码器模型对噪声的鲁棒性更强。