AraSSM:用于阿拉伯语掩码语言建模的双向状态空间编码器

arXiv cs.CL 论文

摘要

介绍AraSSM,一种通过阿拉伯语语料库上的掩码语言建模进行预训练的双向Mamba状态空间编码器,在消费级GPU上从头训练,同时在阿拉伯语自然语言理解基准上取得了有竞争力的结果。

arXiv:2608.08256v1 公告类型:新 摘要:预训练的Transformer编码器(如AraBERT、MARBERT和CAMeLBERT)已成为阿拉伯语自然语言理解的标准骨干模型,但它们的自注意力机制随序列长度呈二次方扩展,这限制了长文档上的效率。Mamba作为一种选择性状态空间模型(SSM),提供了线性时间的序列建模,作为注意力的有力替代方案,然而目前尚不存在专门为阿拉伯语预训练的双向Mamba编码器。我们推出了AraSSM,一种通过掩码语言建模在包含阿拉伯语维基百科和CulturaX文本的语料库上预训练的双向Mamba编码器,在四块消费级NVIDIA RTX 2080Ti GPU(11GB)上端到端训练了约十天。我们遵循AraBERT引入的逐任务评估协议,通过在四个成熟的阿拉伯语NLU基准上进行微调来评估AraSSM,这些基准涵盖情感分类(HARD)、命名实体识别(ANERcorp)、抽取式问答(ARCD)和自然语言推断(XNLI-ar),并报告三个微调随机种子下的均值±标准差结果。AraSSM在情感分类上匹配或超过已发布的base规模Transformer基线(HARD上准确率96.37±0.03%),在抽取式问答(ARCD上EM 32.19±1.07,F1 63.79±0.25)和命名实体识别(ANERcorp上实体级F1 81.54±0.30)上具有竞争力,在自然语言推断(XNLI-ar上准确率72.83±0.07%)上则略逊于base规模Transformer范围,尽管它完全是在消费级硬件上从头训练的,而非大规模加速器集群。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:07

# AraSSM:用于阿拉伯语掩码语言建模的双向状态空间编码器
来源:https://arxiv.org/html/2608.08256
Ahmed Amine Aliane 阿拉伯语翻译研究所,阿尔及尔,阿尔及利亚 CERIST,阿尔及利亚 & Hassina Aliane CERIST,阿尔及利亚 & Nasredine Semmar CEA LIST,巴黎-萨克雷,法国

(2026年7月17日)

###### 摘要

预训练的Transformer编码器(如AraBERT、MARBERT和CAMeLBERT)已成为阿拉伯语自然语言理解的标准骨干网络,但其自注意力机制随序列长度呈二次方增长,限制了长文档上的效率。Mamba作为一种选择性状态空间模型(SSM),提供了线性时间序列建模,是注意力的有力替代方案,但目前尚不存在专门为阿拉伯语预训练的专用双向Mamba编码器。我们提出了AraSSM,一种双向Mamba编码器,通过掩码语言建模在结合阿拉伯语维基百科和CulturaX文本的语料库上进行预训练,并在四块消费级NVIDIA RTX 2080Ti GPU(11GB)上端到端训练约十天。我们通过微调四个成熟的阿拉伯语NLU基准来评估AraSSM,涵盖情感分类(HARD)、命名实体识别(ANERcorp)、抽取式问答(ARCD)和自然语言推理(XNLI-ar),遵循AraBERT引入的逐任务评估协议,并报告三次微调种子的均值±标准差结果。AraSSM在情感分类上达到或超过已发布的base级Transformer基线(HARD上准确率为96.37±0.03%),在抽取式问答(ARCD上EM为32.19±1.07,F1为63.79±0.25)和命名实体识别(ANERcorp上实体级F1为81.54±0.30)上具有竞争力,在自然语言推理上落后于base级Transformer范围(XNLI-ar上准确率为72.83±0.07%),尽管完全在消费级硬件上从头训练,而非大规模加速器集群。

*关键词* 阿拉伯语NLP ⋅ 状态空间模型 ⋅ Mamba ⋅ 掩码语言建模 ⋅ 预训练编码器

## 1 引言

预训练的Transformer编码器已成为阿拉伯语自然语言理解的主导范式。诸如AraBERT(Antoun等人,2020 (https://arxiv.org/html/2608.08256#bib.bib1))、ARBERT和MARBERT(Abdul-Mageed等人,2021 (https://arxiv.org/html/2608.08256#bib.bib2))以及CAMeLBERT(Inoue等人,2021 (https://arxiv.org/html/2608.08256#bib.bib4))等模型,通过将BERT预训练方法(Devlin等人,2019 (https://arxiv.org/html/2608.08256#bib.bib6))适配到阿拉伯语特有的分词和语料库,在各种阿拉伯语NLU任务上建立了强基线。然而,这些模型核心的自注意力机制随序列长度呈二次方扩展。这给这些编码器可以处理的上下文带来了严格的显存和计算上限,并且对于超出模型最大序列长度的文档,必须进行显式截断。

Mamba(Gu和Dao,2023 (https://arxiv.org/html/2608.08256#bib.bib9))作为一种选择性状态空间模型(SSM),最近已成为基于注意力的架构的有力替代方案,提供具有硬件感知并行性的线性时间序列建模,并在语言、音频和基因组学等模态上达到或超过Transformer的性能。针对领域或语言的Mamba适配已经证明,直接在专门数据上预训练SSM骨干网络,而非依赖通用检查点,具有重要价值。面向生物医学文本的BioMamba(Yue等人,2024 (https://arxiv.org/html/2608.08256#bib.bib10))和面向纵向临床笔记的ClinicalMamba(Yang等人,2024 (https://arxiv.org/html/2608.08256#bib.bib11))均表明,在领域内文本上预训练的Mamba编码器在各自任务上优于通用领域Mamba检查点和同等规模的Transformer基线。尽管有这些先例,目前尚不存在针对阿拉伯语的同等工作。近期将Mamba/SSM架构应用于阿拉伯语文本的工作并未进行阿拉伯语专属预训练,并报告称Mamba模型因此落后于更小的、经过阿拉伯语预训练的Transformer编码器(Al-Zawqari等人,2025 (https://arxiv.org/html/2608.08256#bib.bib14))。这表明架构本身并非限制因素,缺失的要素是针对阿拉伯语的专门预训练工作,类似于AraBERT对Transformer家族所做的贡献。

本文的第二个在很大程度上独立的动机是计算可及性。上述阿拉伯语Transformer编码器是在大规模加速器集群上预训练的。在本文中,我们介绍了AraSSM,一种通过掩码语言建模(MLM)目标从头为阿拉伯语预训练的双向Mamba编码器。AraSSM的预训练和微调完全在四块消费级RTX 2080Ti GPU(每块11GB,图灵架构)上完成,这一硬件预算是一个学术实验室而非工业研究团队能够负担的。我们认为由此产生的比较——在消费级硬件上训练的从头SSM编码器与在更大计算预算下训练的Transformer编码器进行比较——本身就具有信息量,无论AraSSM在单个任务上是达到还是落后于这些基线。

由于Mamba本质上是因果的,我们采用双向块设计,在每个序列上运行正向和反向选择性扫描混合器,并合并它们的输出,遵循其他模态中双向Mamba适配的通用方法,以获得完整的双向上下文,同时保留序列长度L上的O(L)复杂度,而非注意力机制的O(L²)复杂度。AraSSM在结合阿拉伯语维基百科和CulturaX的语料库上进行预训练,并在文档块级别进行清洗和去重。我们的贡献总结如下:

1. 我们首次引入了据我们所知专门通过掩码语言建模为阿拉伯语预训练的双向Mamba/SSM编码器。
2. 我们在四个成熟的阿拉伯语NLU基准上评估了AraSSM,涵盖情感分类(HARD)、命名实体识别(ANERcorp)、抽取式问答(ARCD)和自然语言推理(XNLI-ar),采用与AraBERT引入并被后续阿拉伯语Transformer编码器采用的微调协议直接可比的方法(Antoun等人,2020 (https://arxiv.org/html/2608.08256#bib.bib1),2021 (https://arxiv.org/html/2608.08256#bib.bib5)),并报告三次微调种子的结果以量化结果稳定性。
3. 我们将这些结果与四块消费级RTX 2080Ti GPU的计算预算进行对比(包括预训练和微调),这与通常用于预训练阿拉伯语Transformer编码器的加速器集群预算形成对比,并讨论了由此产生的准确率/计算权衡。

## 2 相关工作

我们的工作处于阿拉伯语预训练语言模型和状态空间序列建模的交汇点。本节概述这两个领域的关键进展,以及先前为特定领域和语言预训练基于Mamba的编码器的努力。

### 2.1 阿拉伯语预训练语言模型

阿拉伯语专属预训练遵循了基于Transformer的语言模型的总体轨迹。AraBERT(Antoun等人,2020 (https://arxiv.org/html/2608.08256#bib.bib1))是最早的阿拉伯语专属编码器之一,将BERT预训练方法(Devlin等人,2019 (https://arxiv.org/html/2608.08256#bib.bib6))适配到大型现代标准阿拉伯语(MSA)语料库,并采用阿拉伯语特有的预处理和分词。ARBERT和MARBERT(Abdul-Mageed等人,2021 (https://arxiv.org/html/2608.08256#bib.bib2))扩展了这一研究方向,其中MARBERT专门针对阿拉伯语方言变体,在大规模方言Twitter数据上进行预训练,而AraBERT则侧重于MSA语料库。CAMeLBERT(Inoue等人,2021 (https://arxiv.org/html/2608.08256#bib.bib4))系统研究了预训练数据多样性(MSA、方言和混合)对下游任务性能的影响,而AraELECTRA(Antoun等人,2021 (https://arxiv.org/html/2608.08256#bib.bib5))则将样本效率更高的ELECTRA预训练目标适配到阿拉伯语。ALU E(Seelawi等人,2021 (https://arxiv.org/html/2608.08256#bib.bib7))和ORCA(Elmadany等人,2023 (https://arxiv.org/html/2608.08256#bib.bib8))等基准测试工作通过将数十个单独数据集整合为复合排行榜,规范了这一不断壮大的阿拉伯语编码器家族的评估。在本工作中,我们在四个构成这些整合工作的广泛使用的单独基准(第4节)上评估AraSSM,而非使用ORCA/ALUE复合分数本身,以便我们的结果在每项任务上与AraBERT和AraELECTRA报告的原始终结果保持直接可比。然而,上述所有编码器都共享相同的底层Transformer架构及其相关的二次注意力开销,以及大规模预训练所需的巨大计算预算。

### 2.2 状态空间模型与Mamba

状态空间模型(SSM)提供了一种具有序列长度线性时间复杂度的注意力替代方案。结构化状态空间模型(S4)(Gu等人,2021 (https://arxiv.org/html/2608.08256#bib.bib15))首次证明SSM能够以Transformer的可并行性捕获长距离依赖,同时避免其二次成本。Mamba(Gu和Dao,2023 (https://arxiv.org/html/2608.08256#bib.bib9))引入了具有输入相关参数化的选择性状态空间机制,允许模型沿序列选择性地传播或遗忘信息,并结合硬件感知的并行扫描实现,在保持O(L)复杂度的同时缩小了与基于注意力的模型的性能差距。由于Mamba的循环本质上是因果的,将其适配到编码器风格的双向任务需要显式的架构修改。其他模态的先前工作通过运行成对的正向和反向混合器并合并其输出来解决这一问题,我们在AraSSM的编码器块中采用了这种方法(第3节)。这种双向适配已在视觉(Vim(Zhu等人,2024 (https://arxiv.org/html/2608.08256#bib.bib12))、VMamba(Liu等人,2024 (https://arxiv.org/html/2608.08256#bib.bib13)))和生物医学NLP(BioMamba(Yue等人,2024 (https://arxiv.org/html/2608.08256#bib.bib10)))中得到探索,证明该方法在保留Mamba线性时间复杂度同时可跨模态泛化。

### 2.3 领域与语言专属Mamba预训练

越来越多的研究表明,直接在领域内文本上预训练Mamba,而非微调通用检查点,能为专门领域带来更好的下游性能。BioMamba(Yue等人,2024 (https://arxiv.org/html/2608.08256#bib.bib10))在生物医学文献上预训练了基于Mamba的编码器,而ClinicalMamba(Yang等人,2024 (https://arxiv.org/html/2608.08256#bib.bib11))则在纵向临床笔记上预训练,两者在领域内任务上均优于通用领域Mamba和同等规模的Transformer基线。据我们所知,目前尚不存在针对阿拉伯语的同等语言专属预训练工作。最接近的相关工作将Mamba/SSM架构应用于阿拉伯语任务(竞争性辩论中的论点分类),但未进行阿拉伯语专属预训练,并发现缺乏此类预训练时,基于Mamba的模型表现不如更小的阿拉伯语专属Transformer编码器(Al-Zawqari等人,2025 (https://arxiv.org/html/2608.08256#bib.bib14)),这一发现与上述领域预训练文献一致,也是本文所要解决的核心空白。

## 3 方法

### 3.1 模型架构

AraSSM遵循第2.2节概述的双向块设计:每一层在相同的归一化隐藏状态上运行一个正向选择性扫描混合器和一个反向选择性扫描混合器,然后通过一个可学习的线性投影合并两个输出,再将结果传递给逐位置前馈子层。图1 (https://arxiv.org/html/2608.08256#S3.F1)展示了完整的块结构。

输入h → LayerNorm → 正向SSM → 反向SSM(翻转) → Concat + W_merge → + 残差 → FFN(LayerNorm→GELU MLP) → + 残差 → 输出h'
图1:一个AraSSM编码器块。正向和反向选择性扫描混合器在相同的归一化输入上运行;它们的输出在残差和前馈子层之前被拼接并合并。

形式上,选择性扫描混合器通过离散化的、输入相关的线性状态空间循环将输入序列x_1:L映射到输出序列y_1:L:

h_t = \bar{A}_t h_{t-1} + \bar{B}_t x_t, (1)
y_t = C_t h_t, (2)

其中h_t ∈ R^{d_state}是位置t的隐藏状态,\bar{A}_t、\bar{B}_t、C_t通过对连续参数A、B、C以及本身是x_t函数的步长\Delta_t进行离散化获得,使得循环具有选择性:

\Delta_t, B_t, C_t = f_\Delta(x_t), f_B(x_t), f_C(x_t), (3)

因此模型可以逐token选择保留还是覆写运行状态中的多少内容。给定块输入处的隐藏状态h ∈ R^{L×d},双向块计算

h_fwd = SSM(h), h_bwd = flip(SSM(flip(h))), (4)

并通过可学习投影W_merge ∈ R^{2d×d}合并两个方向:

h' = h + Dropout(W_merge [h_fwd; h_bwd])。 (5)

这反映了其他模态中采用的一般双向Mamba方法,并让每个token能够访问两侧的上下文,同时每次混合器调用仍然是因果的线性时间扫描。

对于批处理变长序列时引入的填充位置,我们在每个块内两次应用注意力掩码:一次在反向混合器之前,使得序列末尾的填充token不会将非零值泄漏到反向扫描中;一次在块的输出之后,使得填充在任何深度都不会对残差流产生贡献。如果没有这种掩码,反向混合器会静默地使真实token依赖于任意填充内容的身份,从而使模型在真实位置的行为依赖于批次组成,而不仅仅依赖于序列本身。具体而言,并非对填充序列进行简单反转,而是仅将每个样本的有效(非填充)位置原地反转,将填充保留在序列尾部原本所在的位置;当批次不包含填充时,这退化为普通的全序列翻转,在预训练期间总是如此,因为文档被打包成固定长度、无填充的块(第3.2节),因此这一微调时的掩码细节并不改变或使第4节用作起点的预训练检查点失效。

表1:AraSSM和AraBERT-base在总体规模上接近,尽管AraSSM的sm ...

相似文章

AudioMosaic:对比掩码音频表示学习

arXiv cs.LG

AudioMosaic 提出了一种基于对比学习的音频编码器,通过对频谱图块应用结构化时频掩码来构建正样本对,实现高效的大批量训练,在音频基准测试中达到最先进性能,并提升了音频-语言模型的效果。

具有自适应退出状态选择的循环状态空间语言模型

arXiv cs.AI

本文探索了使用Mamba和混合Mamba-Transformer骨干网络的循环(递归)状态空间语言模型,表明其在推理任务上优于非循环基线,并在等参数和等FLOPs预训练下保持竞争力,同时自适应退出状态选择改善了中间深度性能。