评估阿拉伯语言模型对抗鲁棒性
摘要
本文评估了五种阿拉伯语言模型在字符级、单词级和句子级攻击下的对抗鲁棒性,结果表明插入变音符号可使准确率降低92%,对抗训练能提升鲁棒性但存在局限性。
arXiv:2607.25814v1 公告类型: 新
摘要: 近期阿拉伯语言模型展现出的卓越能力也暴露了其脆弱性。与这些自然语言处理模型相关的主要安全风险之一是对抗攻击。此类攻击可误导模型做出错误预测,引发关键模型的安全与可靠性担忧。本研究旨在评估五种先进阿拉伯语言模型在面对不同粒度、采用不同示例生成策略的阿拉伯对抗攻击时的鲁棒性。我们还探索了一种基于对抗训练的防御技术以增强模型鲁棒性。结果表明,插入变音符号可使部分模型准确率降低92%,同时保持较低的扰动距离。在单词级攻击中,操控阿拉伯语连词能维持较高的语义相似度分数和较低的扰动距离,却导致准确率下降高达58%。在句子级攻击中,释义改写效果显著,使受害模型性能平均下降76%。尽管对抗训练整体提升了鲁棒性(其中MARBERT最为鲁棒,AraBERT相对增益最大),但挑战依然存在,尤其在面对字符级噪声时。这些发现凸显了当前防御策略在阿拉伯语等形态丰富语言中的潜力与局限。
查看缓存全文
缓存时间: 2026/07/29 09:55
# 阿拉伯语语言模型对抗鲁棒性评估 来源:https://arxiv.org/html/2607.25814 \[1,2\]\\fnmAnwar\\surAlajmi 1\]\\orgdiv计算机工程系,\\orgname科威特大学,\\country科威特 2\]\\orgdiv计算机科学系,\\orgname应用教育与培训局商业研究学院,\\country科威特 ###### 摘要 最近阿拉伯语语言模型展现出的卓越能力为暴露其漏洞打开了大门。此类自然语言处理模型面临的主要安全风险之一是对抗攻击。这些攻击可以欺骗模型做出错误预测,引发关键的模型安全与可靠性问题。本研究旨在评估五种最先进的阿拉伯语语言模型在一组不同粒度水平和不同示例生成策略的阿拉伯语对抗攻击下的鲁棒性。我们还探索了一种基于对抗训练的防御技术来增强模型鲁棒性。结果表明,插入变音符号可将某些模型的准确率降低92%,同时保持较低的扰动距离。对于词级攻击,操纵阿拉伯语连词可保持较高的语义相似度分数和较低的扰动距离,并导致准确率下降高达58%。对于句级攻击,释义攻击证明了其有效性,受害模型性能平均下降76%。虽然对抗训练提高了整体韧性,其中MARBERT最为鲁棒,AraBERT相对增益最大,但挑战依然存在,尤其是在字符级噪声方面。这些发现突显了当前防御策略在阿拉伯语等形态丰富语言中的潜力和局限性。 ###### 关键词: 自然语言处理,对抗攻击,鲁棒性,阿拉伯语语言模型 ## 1 引言 自然语言处理模型在融入人类生活关键方面(包括教育、医疗和媒体)的各种应用中取得了显著成功。然而,最近对这些模型的攻击暴露了严重的安全隐患。语言模型对此类攻击的敏感性具有关键影响,包括模型安全性、利用受攻击模型伤害他人、私人或敏感数据泄露,以及经济和社会影响\[DBLP:journals/corr/AmodeiOSCSM16\]。利用机器学习模型漏洞的攻击被称为对抗攻击。攻击者通过输入修改来精心制作恶意对抗样本,故意引导模型做出错误预测\[cubuk2017intriguing\]。 针对NLP模型的文本对抗攻击是通过一种计算机视觉攻击——快速梯度符号法(FGSM)引入的\[goodfellow2014explaining\]。由于特征空间差异,计算机视觉对抗攻击生成的对抗样本质量较差,不满足NLP中的语法正确性和语义相似性等攻击约束。因此,过去几年中引入了专门针对NLP的攻击策略,以进一步检验语言模型的弱点\[nlprobustnesss\]。 文本对抗攻击通常根据修改的对象进行分类\[ALSHEMALI2020105210\]。字符级攻击发生在插入、删除或替换字符时。词/令牌级攻击是对词/令牌执行相同操作,而句级攻击则通过对输入序列中的句子进行释义、替换、删除或注入来生成。有时由两个或更多上述粒度级别组成的攻击被称为多级攻击\[nlprobustnesss\]。进一步的分类基于对抗样本生成策略,包括基于编辑和基于重要性的方法\[QIU2022278\]。在基于编辑的技术中,不考虑修改对象的特征或属性。而基于重要性的方法通常侧重于扰动对受害模型预测最重要的对象。图1(https://arxiv.org/html/2607.25814#S1.F1)提供了文本对抗攻击的分类法。 参见图注 图1:NLP攻击分类法。 对抗攻击引发了关键伦理问题,特别是当语言模型部署在医疗和法律系统等关键应用时。利用这些模型的漏洞可能导致数据盗窃、业务中断、错误信息或伤害。攻击可以根据攻击者对受害模型参数的完全访问(白盒)或没有任何模型特定知识(黑盒)来设计\[wiyatno2019adversarial\]。通常此类攻击在现实世界中以黑盒形式发生\[nlprobustnesss,ALSHEMALI2020105210\]。此外,当攻击者期望特定错误预测时发生定向攻击,而非定向攻击则发生在攻击者旨在获得一般错误输出时\[wiyatno2019adversarial,tsipras2018robustness,acloser\]。对抗鲁棒性评估必须是任何NLP模型发布前考虑的关键措施,以缓解这些问题。尽管该领域在全球研究人员中引起了显著关注,但在阿拉伯语模型方面研究仍然非常不足。 阿拉伯语是全球第五大语言,拥有超过3.34亿使用者,是最流行的闪米特语言之一\[ethnologue2025\]。由于阿拉伯语特有的原因,如资源匮乏、语言复杂性及其多种方言,只有少数有限的研究讨论了这一领域\[anwar\]。阿拉伯语单词结构复杂,一个单词可以传达含义、时态、数量和性别。此外,阿拉伯单词上的不同元音(变音符号)可能完全改变其含义\[habash2022introduction,al2006design\]。因此,从计算语言学和NLP的角度看,阿拉伯语与其他语言相比提出了独特的挑战,特别是在对抗鲁棒性等领域,这需要跨多种语言细微差别的全面评估。 尽管NLP取得了重大进展,但由于其语言复杂性、方言多样性和资源限制,阿拉伯语在对抗鲁棒性研究方面仍然代表性不足。这些挑战在评估最先进的阿拉伯语和多语言NLP模型在对抗条件下的表现方面留下了关键空白。因此,本研究通过探索非定向黑盒对抗攻击对AraBERT\[arabert\]、MARBERT\[marbert\]、CaMeLBERT\[camel\]、mBERT\[devlin2018bert\]和XLM-T\[xlmt\]等领先模型的影响来填补这一空白。本文的关键贡献如下: - • 这项工作是首个评估阿拉伯语NLP模型对抗鲁棒性的研究,为它们在对抗条件下的表现提供了新见解。 - • 应用了多种阿拉伯语对抗攻击,涵盖所有粒度级别(字符级、词级和句级),使用不同的示例生成策略(基于编辑、基于重要性和基于释义)。 - • 一个全面的评估过程,包括准确率、攻击成功率、扰动率和语义相似性度量。 本文组织结构如下:第2节(https://arxiv.org/html/2607.25814#S2)回顾了语言模型对抗鲁棒性领域的相关研究。第3节(https://arxiv.org/html/2607.25814#S3)探讨了方法论,而第4节(https://arxiv.org/html/2607.25814#S4)展示并讨论了实验结果。最后,结论和未来工作在第5节(https://arxiv.org/html/2607.25814#S5)中提出。 ## 2 文献综述 对抗攻击是精心制作的输入示例,旨在有意操纵NLP模型产生错误输出。其中一些扰动示例可能不易被人类察觉,但有可能欺骗语言模型。文本攻击通常根据扰动对象的语义粒度(字符、词、令牌、句子)进行分类\[morris2020reevaluating\]。研究\[qiu2019review\]进一步根据生成示例所采用的策略对攻击进行分类。语义粒度类别具有作为子类别的示例生成策略:基于梯度、基于优化、基于重要性、基于释义和基于生成模型(GAN)。生成对抗示例时必须满足某些标准,包括语法错误等于或少于原始示例,以及语义相似性\[chen2021multi\]。存在多种检查上述要求的方法,如语法检查工具和语义相似性度量(余弦相似性、通用句子编码器(USE)\[cer2018universal\]和Sentence-BERT\[reimers-gurevych-2019-sentence\])。 字符级别的攻击涉及对字符的扰动,包括在给定序列中添加、删除、交换或替换字符。虽然这些策略非常高效且难以观察,但使用拼写检查工具可以容易地检测到它们\[shreya2022survey\]。黑盒主题下的字符级攻击侧重于添加自然或合成噪声,如标点符号、变音符号、特殊字符和数字。 虽然\[zero,formento-etal-2023-using\]提出的攻击方法是基于编辑的,但\[chai2023additive,alshemali2021character\]的工作依赖于基于重要性的字符变换。作者在\[chai2023additive\]中利用局部事后解释SHapley Additive exPlanations(SHAP)\[shap\]进行基于重要性的对抗样本生成。另一方面,\[alshemali2021character\]使用词重要性排名(WIR)来查找最重要的字符操作词。此外,DeepWordBug和TextBugger\[gao2018black,li2018textbugger\]通过贪婪WIR算法获得序列中词的重要性,然后对最重要的词应用多个字符级扰动。另一方面,TextAttack\[morris2020textattack\]提供了一个更广泛的框架,其中字符级操作是其工具包的一部分。它还提出了词级和语义级变换,包括释义和其他更高层次的更改。 对于词级攻击,\[li-etal-2020-bert-attack,bae,alshemali2019adversarial\]采用WIR来精心制作黑盒词替换。虽然\[li-etal-2020-bert-attack\]用其同义词替换重要性最高的词,但\[bae\]使用BERT掩码语言模型(MLM)来预测同义词。另一方面,\[alshemali2019adversarial\]扰动词以违反阿拉伯语语法规则,从而欺骗包括BERT、CNN和LSTM在内的受害模型。采用与\[bae\]类似的方法,\[ekbal2022adversarial\]使用BERT MLM替换得分最高的词。然而,没有使用传统的评分函数,而是使用SHAP来查找模型预测对原始序列中每个词的敏感性,这与\[alajmi2025evaluating\]中的词攻击类似。\[alshalan2023attacking\]中的工作评估了AraBERT和CaMeLBERT在基于编辑和基于梯度的词替换下的鲁棒性。AraBERT的准确率下降了7%(基于编辑)和37%(基于梯度),而CaMeLBERT的准确率在基于编辑和基于梯度攻击后分别降低了10%和36%。先前回顾的攻击研究总结于表1(https://arxiv.org/html/2607.25814#S2.T1.1.fig1)。 语言模型的对抗鲁棒性通常通过评估它们在精心制作的攻击面前的表现来衡量。它是衡量模型在对抗攻击下表现如何的指标\[ALSHEMALI2020105210,nlprobustnesss\]。为了提高NLP模型抵抗对抗攻击的能力,研究人员提出了依赖于数据增强的数据驱动方法。这意味着在真实数据和经过修改以创建对抗样本的合成数据混合上训练模型。这有助于模型学习对输入数据的微小变化不那么敏感,从而使它们对对抗攻击更加鲁棒。\[yoo2021towards\]中的工作利用了成本较低的数据增强。该研究在BERT和RoBERTa上提出了一个简单的普通对抗训练过程(A2T),以减少生成攻击的计算时间和复杂性,从而减少整体对抗训练时间。通常,该方法包括在DistilBERT\[distilbert\]相似性约束下生成白盒基于梯度的攻击。 另一种主动防御机制是使用ML攻击检测器来识别并从训练数据中移除对抗样本,如\[shen2023textdefense,huber2022detecting\]所提出的。在\[shen2023textdefense\]中,提出了一种基于删除评分的针对基于重要性攻击的防御方法。该方法计算原始和对抗序列的词重要性。然后,计算两者的熵来识别对抗样本。然而,\[huber2022detecting\]使用SHAP进行词重要性计算,然后使用TextAttack制作词级对抗攻击。之后,在生成的样本上训练检测模型。类似地,\[mozes2020frequency\]计算对抗样本和原始样本中的词频,以检测文本分类模型中的词级扰动。另一方面,\[zhou2019learning\]提出了一种通过使用k近邻(kNN)搜索语料库词嵌入空间来区分和恢复扰动令牌语义的方法。 除了对抗训练,表示学习也被认为是一种有效且主动的防御机制。这涉及使用诸如随机化输入和统一输入表示等技术来创建输入数据的更鲁棒表示。一个例子是\[zhou2020defense\]的Dirichlet Neighborhood Ensemble方法。作者专注于通过向目标模型暴露更广泛形式的输入样本(包括可能的同义词)来提高对抗鲁棒性。这是通过序列词嵌入及其同义词所跨越的凸包内的随机采样形成虚拟句子来完成的。该过程针对原始输入序列中的每个词进行。然后,在增强数据上训练模型,同时保持语义。最后,有许多被动防御策略可用于保护NLP模型免受对抗攻击,例如\[gao2018black,li2018textbugger\]中使用的拼写错误检查工具,用于防御字符级攻击\[qiu2019review\]。所审查的防御方法列表见表2(https://arxiv.org/html/2607.25814#S2.T2.1.fig1)。 \[alshahrani2024arabic\]中的作者将词级同义词替换应用于WordCNN\[hochreiter1997long\]、WordLSTM\[kim-2014-convolutional\]和AraBERTBASE。使用排名贪婪算法识别最重要的词,然后从AraBERTBASE v024作为MLM模型生成前k个替换词。WordCNN和WordLSTM在MSDA数据集上的准确率下降了近5%,而AraBERT的准确率下降了26.93%。 Transformer\[vaswani2017attention\]的引入通过注意力机制彻底改变了NLP领域,使模型能够增强
相似文章
压力下的风险:语言模型对抗鲁棒性的计算感知评估
本文提出了一种针对LLM对抗鲁棒性的计算感知评估框架,提出了基于FLOPs的风险-计算曲线和度量指标,以更好地评估攻击成本,发现对齐训练具有非单调效应,且计算成本因模型和危害类别而异。
RobustMAD:评估多模态小语言模型在可部署异常检测助手中的实际鲁棒性
RobustMAD 引入了一个基准,用于评估多模态小语言模型在实际部署的工业异常检测助手中的鲁棒性。它揭示了关键的失败模式,并为下一代系统提供了指导。
测试对未知对手的鲁棒性
# 测试对未知对手的鲁棒性 来源:[https://openai.com/index/testing-robustness/](https://openai.com/index/testing-robustness/) OpenAI 我们开发了一种方法来评估神经网络分类器是否能可靠地抵御训练期间未见过的对抗性攻击。我们的方法产生了一个新的指标 UAR(未知攻击鲁棒性),它评估单个模型对意外攻击的鲁棒性,并强调了需要在更多样化的未知攻击范围内测量性能
不同扰动,不同机制:理解面向零样本方言鲁棒性的持续预训练
本文系统研究了基于扰动的持续预训练(CPT)在提升多语言大语言模型零样本方言鲁棒性方面的作用,比较了德语、意大利语和阿拉伯语中的六种训练条件。研究发现,字符级噪声CPT是最有效的通用策略,并揭示了不同扰动方法会引发不同的鲁棒性机制。
随机分词法提高模型鲁棒性
本论文证明了使用随机分词而非确定性标准分词来训练大型语言模型,可以显著提升模型对对抗攻击和随机扰动的鲁棒性。这种改进在预训练、微调和上下文学习阶段都有表现,且不会增加推理成本。