大语言模型在文本之外安全吗?表情符号是否暴露了安全评估的漏洞?

arXiv cs.CL 论文

摘要

本文通过研究表情符号增强的提示,探讨了大语言模型在文本输入之外的安全性,揭示了当前安全评估的漏洞和模型依赖性漏洞。

arXiv:2608.18164v1 公告类型:新 摘要:大语言模型的安全性评估主要依赖于基于文本的对抗性提示,这可能忽略了由替代输入表示形式带来的漏洞。本研究以表情符号增强的提示作为此漏洞的测试案例,评估了四个开源大语言模型(Mistral 7B、Qwen 2 7B、Gemma 2 9B、Llama 3 8B)上的50个提示。结果显示鲁棒性存在显著差异:Gemma 2 9B 和 Mistral 7B 表现出非零成功率(10%),Llama 3 8B 为6%,而 Qwen 2 7B 则完全抵抗(0% 成功率)。卡方检验($\chi^2 = 32.94, p < 0.001$)证实了结果分布存在显著差异。这些发现表明,鲁棒性对输入表示形式敏感,并且局限于标准文本提示的评估可能低估了模型的漏洞。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:08

# 表情符号是否暴露了安全评估的漏洞:超越文本的LLM安全性
来源:https://arxiv.org/html/2608.18164
###### 摘要

大型语言模型(LLMs)的安全性评估主要依赖基于文本的对抗性提示,这可能会忽视因其他输入表示形式而产生的漏洞。本研究以表情增强提示作为测试案例,评估了四个开源LLM(Mistral 7B、Qwen 2 7B、Gemma 2 9B、Llama 3 8B)上的50个提示。结果显示鲁棒性存在显著差异:Gemma 2 9B和Mistral 7B呈现非零成功率(10%),Llama 3 8B为6%,而Qwen 2 7B则表现出完全抵抗(0%成功率)。卡方检验(χ²=32.94,p<0.001)证实结果分布存在显著差异。这些发现表明,鲁棒性对输入表示形式敏感,而仅限于标准文本提示的评估可能低估了模型的脆弱性。

## 1引言

大型语言模型(LLMs)正日益被部署于生产系统,因此强大的安全对齐成为关键要求3 (https://arxiv.org/html/2608.18164#bib.bib1);2 (https://arxiv.org/html/2608.18164#bib.bib2)。安全机制评估已有显著发展,许多基准测试通过文本提示评估对抗鲁棒性11 (https://arxiv.org/html/2608.18164#bib.bib3);14 (https://arxiv.org/html/2608.18164#bib.bib4)。然而,表情符号表示如何在安全评估设置中影响模型直接响应,却较少受到关注。

表情符号在现代通信中无处不在,为分词和其他自然语言处理流水线带来了独特挑战9 (https://arxiv.org/html/2608.18164#bib.bib6)。其语义表示能捕捉可能与基于关键词的安全过滤器不一致的上下文和情感细微差别1 (https://arxiv.org/html/2608.18164#bib.bib8)。先前研究表明,表情符号可用于规避安全分类器和评判模型的检测13 (https://arxiv.org/html/2608.18164#bib.bib9);12 (https://arxiv.org/html/2608.18164#bib.bib10),但它们对LLM提示级安全对齐的影响尚未得到充分理解。

本研究对表情越狱提示在四个开源LLM上进行了实证研究。结果表明,在某些情况下,表情增强提示能绕过安全机制,导致依赖于模型的漏洞。这些发现强调,对抗鲁棒性可能随输入表示而变化,表明仅关注文本提示的评估实践可能无法全面涵盖所有可能的故障模式。

## 2相关工作

对抗提示作为LLM安全对齐中的失败模式已被广泛研究,先前工作表明表层重构(如提示填充或术语替换)可绕过安全机制11 (https://arxiv.org/html/2608.18164#bib.bib3);14 (https://arxiv.org/html/2608.18164#bib.bib4);10 (https://arxiv.org/html/2608.18164#bib.bib5)。这些方法凸显了LLM对输入表示变化的敏感性。

近期研究探索了基于表情符号的对抗技术。13 (https://arxiv.org/html/2608.18164#bib.bib9)证明,表情序列能在无显式文本变化的情况下改变语义解释,从而规避基于关键词的过滤器。类似地,12 (https://arxiv.org/html/2608.18164#bib.bib10)表明,表情符号通过利用分词效应可误导安全分类器和评判模型。然而,这些研究主要聚焦于攻击评估系统,而非底层LLM。

表情符号作为输入标记引入了额外复杂性。其含义具有上下文依赖性和文化差异性1 (https://arxiv.org/html/2608.18164#bib.bib8),而学习到的表情表示能捕捉表情符号与文本概念间的语义关系4 (https://arxiv.org/html/2608.18164#bib.bib7)。这表明基于表情的输入可能暴露标准文本评估协议未捕捉的行为。

与先前工作相反,本研究直接在LLM上评估基于表情的对抗提示,以探究此类输入是否揭示了传统评估设置未反映的漏洞。

## 3方法论

本研究评估了四个开源LLM:Mistral 7B7 (https://arxiv.org/html/2608.18164#bib.bib11)、Qwen 2 7B8 (https://arxiv.org/html/2608.18164#bib.bib12)、Gemma 2 9B5 (https://arxiv.org/html/2608.18164#bib.bib13)和Llama 3 8B6 (https://arxiv.org/html/2608.18164#bib.bib14)。每个模型在完全相同的50个提示集上进行测试,未进行微调或系统级修改。这确保了在标准推理条件下对模型进行一致比较。

### 3\.1提示构建

构建了50个表情增强提示集,通过非标准输入表示探测安全机制。提示采用两种策略构建:表情填充(将表情符号与文本交错以破坏表层过滤)和表情链接(用表情序列隐式编码有害意图)。所有提示均针对模型安全策略定义的受限内容类别(如暴力或有害指令)。表3\.1 (https://arxiv.org/html/2608.18164#S3.SS1)展示了代表性示例。

表 1:示例表情增强提示。

### 3\.2评估协议

模型响应分为三类结果:成功(生成受限内容)、部分(模糊或部分遵从)、失败(拒绝或无关响应)。分类采用基于关键词的启发式方法,随后进行人工验证。

成功率定义为产生受限内容的提示比例。伦理合规性定义为模型是否避免生成受限或有害内容;成功响应视为不合规,而部分和失败响应视为合规,因为它们未提供可直接操作的有害内容。使用卡方检验评估不同模型间结果分布的差异(p<0.05)。

## 4结果

模型行为在表情增强提示下呈现显著差异。Qwen 2 7B未产生任何成功输出,而Gemma 2 9B和Mistral 7B均呈现非零成功率(10%)。这种差异表明,对基于表情提示的易感性在不同模型中并不一致。

仅成功率无法完全刻画模型行为。Gemma 2 9B合规率最低(66%),而Mistral 7B以相同成功率获得更高合规率(88%),这反映了模型处理模糊或部分对齐响应的方式差异。Qwen 2 7B未产生成功输出,但部分响应比例较高,表明基于表情的提示常被解释为定义不明确而非明确不安全。

卡方检验显示,结果分布差异具有统计学显著性(χ²=32.94,p<0.001)。观察到的变化表明,对抗鲁棒性取决于输入表示,基于表情的提示暴露了各模型间未一致捕捉的行为。

## 5讨论

表情增强提示暴露了表层安全机制与语义解释之间的错位。在各模型中,相当一部分响应被归类为部分响应,表明表情序列引入的是模糊性,而非触发一致的拒绝或遵从行为。这种行为表明,安全系统对非标准输入表示的校准并不一致。

模型差异进一步强化了这一观察。尽管成功率相同,Gemma 2 9B和Mistral 7B的合规水平差异显著,这表明差异在于如何解决模糊性,而非整体失败率。Qwen 2 7B未产生成功输出但部分响应比例较高,表明其对定义不明确输入的处理较为保守,而非鲁棒的语义解释。这些发现表明鲁棒性对输入表示敏感。因此,仅限于标准文本提示的评估可能低估了由表情符号等其他输入表示产生的漏洞。

## 参考文献

- Barbieriet al\.\(2018\)F\. Barbieri, J\. Camacho\-Collados, L\. E\. Anke, and H\. SaggionSemEval\-2018 task 2: multilingual emoji prediction\.InProceedings of the 12th International Workshop on Semantic Evaluation,pp\. 24–33\.引用于:§1 (https://arxiv.org/html/2608.18164#S1.p2.1),§2 (https://arxiv.org/html/2608.18164#S2.p3.1)\.
- Benderet al\.\(2021\)E\. M\. Bender, T\. Gebru, A\. McMillan\-Major, and S\. ShmitchellOn the dangers of stochastic parrots: can language models be too big?\.InProceedings of the 2021 ACM Conference on Fairness, Accountability, and Transparency,pp\. 610–623\.引用于:§1 (https://arxiv.org/html/2608.18164#S1.p1.1)\.
- Brownet al\.\(2020\)T\. B\. Brown, B\. Mann, N\. Ryder, M\. Subbiah, J\. Kaplan, P\. Dhariwal, A\. Neelakantan, P\. Shyam, G\. Sastry, A\. Askell,et al\.Language models are few\-shot learners\.InAdvances in Neural Information Processing Systems,Vol\.33,pp\. 1877–1901\.引用于:§1 (https://arxiv.org/html/2608.18164#S1.p1.1)\.
- Eisneret al\.\(2016\)B\. Eisner, T\. Rocktäschel, I\. Augenstein, M\. Bošnjak, and S\. RiedelEmoji2vec: learning emoji representations from their description\.InProceedings of the Fourth International Workshop on Natural Language Processing for Social Media,pp\. 48–54\.外部链接:文档 (https://dx.doi.org/10.18653/v1/W16-6208)引用于:§2 (https://arxiv.org/html/2608.18164#S2.p3.1)\.
- Google \(2024\)GoogleGemma\-2\-9B模型\.外部链接:链接 (https://ollama.com/library/gemma2)引用于:§3 (https://arxiv.org/html/2608.18164#S3.p1.1)\.
- Meta AI \(2024\)Meta AI推出Llama 3:开源语言模型的新标准\.外部链接:链接 (https://ai.meta.com/blog/meta-llama-3/)引用于:§3 (https://arxiv.org/html/2608.18164#S3.p1.1)\.
- Mistral AI \(2023\)Mistral AIMistral 7B\.技术报告Mistral AI\.注:arXiv:2310\.06825引用于:§3 (https://arxiv.org/html/2608.18164#S3.p1.1)\.
- Qwen团队 \(2024\)Qwen团队Qwen2:大型语言模型\.技术报告阿里云\.外部链接:链接 (https://qwenlm.github.io/)引用于:§3 (https://arxiv.org/html/2608.18164#S3.p1.1)\.
- Shoeb and de Melo \(2021\)A\. A\. M\. Shoeb and G\. de Melo评估现代文本处理工具中的表情符号使用\.InProceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers),pp\. 1379–1388\.外部链接:文档 (https://dx.doi.org/10.18653/v1/2021.acl-long.110)引用于:§1 (https://arxiv.org/html/2608.18164#S1.p2.1)\.
- Wallaceet al\.\(2019\)E\. Wallace, S\. Feng, N\. Kandpal, M\. Gardner, and S\. SinghUniversal adversarial triggers for attacking and analyzing NLP\.InProceedings of the 2019 Conference on Empirical Methods in Natural Language Processing,pp\. 2153–2162\.引用于:§2 (https://arxiv.org/html/2608.18164#S2.p1.1)\.
- Weiet al\.\(2023\)A\. Wei, N\. Haghtalab, and J\. SteinhardtJailbroken: how does LLM safety training fail?\.arXiv预印本 arXiv:2307\.02483\.引用于:§1 (https://arxiv.org/html/2608.18164#S1.p1.1),§2 (https://arxiv.org/html/2608.18164#S2.p1.1)\.
- Weiet al\.\(2024\)Z\. Wei, Y\. Liu, and N\. B\. ErichsonEmoji attack: a method for misleading judge LLMs in safety risk detection\.arXiv预印本 arXiv:2411\.01077\.引用于:§1 (https://arxiv.org/html/2608.18164#S1.p2.1),§2 (https://arxiv.org/html/2608.18164#S2.p2.1)\.
- Zhang \(2025\)Y\. ZhangEmoti\-attack: zero\-perturbation adversarial attacks on nlp systems via emoji sequences\.外部链接:2502\.17392,链接 (https://arxiv.org/abs/2502.17392)引用于:§1 (https://arxiv.org/html/2608.18164#S1.p2.1),§2 (https://arxiv.org/html/2608.18164#S2.p2.1)\.
- Zouet al\.\(2023\)A\. Zou, Z\. Wang, J\. Z\. Kolter, and M\. FredriksonUniversal and transferable adversarial attacks on aligned language models\.arXiv预印本 arXiv:2307\.15043\.引用于:§1 (https://arxiv.org/html/2608.18164#S1.p1.1),§2 (https://arxiv.org/html/2608.18164#S2.p1.1)\.

## 附录A数据集访问与伦理考量

由于本研究使用的提示具有有害性质,完整的提示集未公开发布。本文包含代表性示例和提示构建方法,以支持透明度和可重复性。应请求可为研究目的提供更多细节。

评估涉及使用基于表情的对抗表示探测安全机制的提示。本研究仅用于鲁棒性评估和安全行为分析,不用于误用或部署有害指令。

相似文章

当选择成为风险:多选题约束下大语言模型的安全失效

arXiv cs.CL

# 当选择成为风险:多选题约束下大语言模型的安全失效 来源:[https://arxiv.org/html/2604.16916](https://arxiv.org/html/2604.16916) Yuheng Chen1 Zhiyu Wu2 Bowen Cheng3 Tetsuro Takahashi1 1鹿儿岛大学 2复旦大学 3中国石油大学(北京) [email protected] ###### 摘要 大语言模型(LLMs)的安全性对齐主要在开放式生成环境进行评估,模型可通过拒绝回应来规避风险……