XL-SafetyBench:一个基于国家的跨文化LLM安全与文化敏感性基准
摘要
XL-SafetyBench是一个包含5500个测试用例的基准,涵盖10个国家-语言对,用于评估LLM安全性和文化敏感性,区分越狱鲁棒性与文化意识。
arXiv:2605.05662v1 公告类型:new
摘要:当前的LLM安全基准主要以英语为中心,且常常依赖翻译,未能捕捉到特定国家的危害。此外,它们很少评估模型将文化嵌入的敏感性与普遍危害区分开来的能力。我们提出了XL-SafetyBench,一个包含5500个测试用例的套件,涵盖10个国家-语言对,包括一个基于国家的对抗性提示的越狱基准(Jailbreak Benchmark)和一个将本地敏感性嵌入无害请求中的文化基准(Cultural Benchmark)。每个项目通过一个多阶段流水线构建,结合了LLM辅助发现、自动验证关卡以及每个国家的两名独立母语标注者。为了区分原则性拒绝与理解失败,我们评估攻击成功率(ASR)以及我们引入的两个补充指标:中性安全率(NSR)和文化敏感率(CSR)。对10个前沿模型和27个本地LLM的评估揭示了两个关键发现。首先,在前沿模型中,越狱鲁棒性和文化意识并未显示出耦合关系,因此综合安全得分会掩盖各轴的变化。其次,本地模型表现出近乎线性的ASR-NSR权衡(r = -0.81),表明它们表面的安全性反映了生成失败而非真正的对齐。XL-SafetyBench使得在多语言时代能够进行更细致、跨文化的安全评估。
查看缓存全文
缓存时间: 2026/05/08 06:38
# XL-SafetyBench:面向多语言大模型安全性与文化敏感性的国别化跨文化基准 来源:https://arxiv.org/html/2605.05662 Dasol Choi¹, Eugenia Kim², Jaewon Noh³, Seo Sang³, Eunmi Kim⁴, Myunggyo Oh⁴, Yunjin Park⁴, Kartono Brigitta Jesica⁵, Josef Pichlmeier⁵, Helena Berndt⁵, Sai Krishna Mendu⁶, Tungka Glenn⁷, Özlem Gökçe⁸, Suresh Gehlot⁹, Katherine Pratt², Amanda Minnich², Haon Park¹,¹⁰,¹¹¹¹ ¹AIM Intelligence, ²Microsoft, ³Korea AISI, ⁴KT Corporation, ⁵BMW Group, ⁶Coinbase, ⁷慕尼黑工业大学, ⁸安卡拉大学, ⁹Cyril Amarchand Mangaldas, ¹⁰首尔大学 ![[未配图]](https://arxiv.org/html/2605.05662v1/figures/hf-logo.png) HuggingFace (https://huggingface.co/datasets/AIM-Intelligence/XL-SafetyBench) ![[未配图]](https://arxiv.org/html/2605.05662v1/figures/github-mark.png) GitHub (https://github.com/AIM-Intelligence/XL-SafetyBench) ###### 摘要 当前的大语言模型(LLM)安全基准主要以英语为中心,且往往依赖机器翻译,未能捕捉到特定国家特有的危害类型。此外,这类基准很少评估模型识别文化嵌入敏感性(区别于普遍性危害)的能力。我们提出 **XL-SafetyBench**,这是一个包含 10 个国家-语言配对、共 5,500 个测试用例的测试集,包括一个针对国别化对抗性提示的 **越狱基准(Jailbreak Benchmark)** 和一个将本地敏感性嵌入到无害请求中的 **文化基准(Cultural Benchmark)**。每个测试项都通过一个多阶段流水线构建而成,该流水线结合了 LLM 辅助发现、自动验证门控以及每个国家配备的两位独立母语标注者。为了区分有原则的拒绝与理解失败,我们在攻击成功率(ASR)之外,还引入了两个互补指标:**中性安全率(NSR)** 和 **文化敏感性率(CSR)**。对 10 个前沿模型和 27 个本地模型的评估揭示了两个关键发现。首先,在前沿模型中,越狱鲁棒性和文化意识之间并未显示出耦合关系,因此综合安全评分会掩盖各维度上的差异。其次,本地模型呈现出近乎线性的 ASR-NSR 权衡关系(\(r=-0.81\)),表明其表面的安全性实质上源于生成失败,而非真正的对齐。XL-SafetyBench 使得在多语言时代进行更细致、跨文化的安全性评估成为可能。 **内容警告:** 本文包含对抗性和文化敏感性内容。 ## 1 引言 大语言模型越来越多地部署在语言和文化多样的人群中 (Pawar 等人, 2025 (https://arxiv.org/html/2605.05662#bib.bib11); Wang 等人, 2024 (https://arxiv.org/html/2605.05662#bib.bib5))。然而,安全性评估并未跟上这一全球化步伐。绝大多数安全基准都是用英语开发的;正如最近一项对近 300 篇安全出版物的调查所证实的那样,超过 90% 的文献完全忽略了非英语语言,即使是高资源语言也大多未被评估 (Yong 等人, 2025 (https://arxiv.org/html/2605.05662#bib.bib4))。现有的少数多语言基准也主要是将英语中心的提示翻译成其他语言 (Wang 等人, 2024 (https://arxiv.org/html/2605.05662#bib.bib5); Deng 等人, 2023 (https://arxiv.org/html/2605.05662#bib.bib6); Ning 等人, 2025 (https://arxiv.org/html/2605.05662#bib.bib8))。尽管这些工作揭示了模型在非英语语言中安全性更低,但基于翻译的方法在结构上无法捕捉危害在各国本地化的原生表现形式。此外,现有基准将安全性视为单一维度,未区分根本不同的失效模式。 我们认为,国别化安全性包含两个需要单独评估的不同维度。第一个是**针对国别化危害的越狱鲁棒性**:恶意意图在不同国家有不同的表现形式,扎根于本地平台和社会经济结构中。例如,围绕韩国全税制(一次性住房押金)设计的金融诈骗无法通过翻译通用的英语提示发现;模型必须抵制这些本地化的表现形式。第二个是**文化敏感性意识**:每种文化都有外来者可能忽略的禁忌。一个模型在法国推荐菊花作为感谢礼物——在那里菊花象征死亡——或者在韩国建议用红色墨水写名字标签——这并不是在产生普遍有害的内容,而是在文化安全性上失败。这两个维度需要不同的评估方法:第一个需要对抗性测试,模型应拒绝回答;而第二个需要自然表述的场景,模型必须检测出一个文化上有问题的细节,而该细节**并非**明确陈述的主题。这种设置在以往的文化基准中并未涉及,后者评估的是模型对直接陈述的文化内容的反应。 我们提出 **XL-SafetyBench**,一个覆盖北美、欧洲、亚洲和中东 10 个国家-语言配对(美国、法国、德国、西班牙、韩国、日本、印度、印度尼西亚、土耳其、阿联酋)的评估套件。我们的贡献如下: - **两个互补的国别化安全性基准**:我们引入了针对国别化对抗性攻击的**越狱基准**和针对嵌入在无害任务中的敏感性的**文化基准**。与以往将敏感元素作为明确主题的文化基准不同,我们的基准测试的是在自然任务中的隐式检测能力。 - **可扩展的、经过母语验证的构建流水线**:我们使用 LLM 辅助发现,并结合由母语者进行的多阶段人工在环(HITL)验证,生成了 5,500 个高质量的测试用例,确保了文化的真实性和高可靠性。 - **全面的评估与关键发现**:通过针对性的指标(ASR、NSR、CSR)评估 37 个 LLM(10 个前沿模型,27 个本地模型),我们发现:(i)越狱鲁棒性与文化意识之间并未显示出耦合关系,需要分解式的安全性报告;(ii)本地模型看似安全,实则源于生成失败而非真正的对齐。 参考图注图 1:**XL-SafetyBench 构建流水线**。一个统一的框架,生成两个互补的基准。(A) 越狱基准:通过 LLM 辅助发现、基础查询生成以及迭代的攻击者-裁判红队循环,生成国别化的对抗性提示(每个国家 450 个提示)。(B) 文化基准:发现特定国家的敏感性,并将其作为偶然细节嵌入到棘手但自然的表面任务中(每个国家 100 个场景)。两者都结合了 LLM 生成、自动验证门控以及双母语者验证。 ## 2 相关工作 ### 2.1 多语言安全基准 多语言安全基准在如何生成非英语评估数据方面各有不同。基于翻译的基准将英语提示扩展到其他语言:XSafety (Wang 等人, 2024 (https://arxiv.org/html/2605.05662#bib.bib5)) 将英语安全提示翻译成十种语言;MultiJail (Deng 等人, 2023 (https://arxiv.org/html/2605.05662#bib.bib6)) 将英语对抗性提示翻译成低资源语言用于越狱评估。母语收集超越了翻译:Aya 红队数据集 (Aakanksha 等人, 2024 (https://arxiv.org/html/2605.05662#bib.bib9)) 直接以八种语言收集人工策划的有害提示,并将每个提示标记为“全球”或“本地”。混合方法在同一基准内结合多种策略,如 LinguaSafe (Ning 等人, 2025 (https://arxiv.org/html/2605.05662#bib.bib8));而基于区域的方法直接操作化地理多样性,如 JailNewsBench (Kaneko 等人, 2026 (https://arxiv.org/html/2605.05662#bib.bib10)),该基准评估跨 34 个区域的越狱引发的虚假新闻。 基于翻译的基准继承了其英语来源的危害结构。国别特异性要么被操作为二元的全球-本地标签(Aya),要么是语言收集类型学而非危害类型学(LinguaSafe),要么是跨多个区域覆盖单一危害领域(JailNewsBench)。在这些基准中,不构成普遍有害内容的文化特定危害(例如违反本地社会规范)仍未得到处理。 ### 2.2 LLM 中的文化知识评估 越来越多的工作评估 LLM 的文化意识 (Pawar 等人, 2025 (https://arxiv.org/html/2605.05662#bib.bib11)),通常侧重于知识、价值观或适应性而非危害:知识基准在直接提问下探究特定文化的事实(BLEnD (Myung 等人, 2024 (https://arxiv.org/html/2605.05662#bib.bib12))、CulturalBench (Chiu 等人, 2025 (https://arxiv.org/html/2605.05662#bib.bib13)));价值观基准衡量与大众观点的对齐程度(GlobalOpinionQA (Durmus 等人, 2023 (https://arxiv.org/html/2605.05662#bib.bib14)));规范基准评估对所述行为可接受性的判断(NormAd (Rao 等人, 2024 (https://arxiv.org/html/2605.05662#bib.bib15)))。这些基准共享一个共同结构:文化元素是提示的明确主题,模型的任务是识别或判断它。没有现有的基准测试模型是否能在文化上有问题的细节附带出现在现实任务中时检测到它们。结合安全文献中缺乏国别化结构的情况(第 2.1 节 (https://arxiv.org/html/2605.05662#S2.SS1)),这使得在现有的任何基准之外,还存在未覆盖的对抗性和文化嵌入性的国别化危害。 ## 3 XL-SafetyBench 框架 XL-SafetyBench 通过两条并行的轨道评估国别化安全性:面向对抗鲁棒性的**越狱基准**和面向嵌入式敏感性的**文化基准**。如图 1 (https://arxiv.org/html/2605.05662#S1.F1) 所示,两条轨道遵循统一的流水线:通过结合网络搜索的 LLM 发现特定国家的种子,然后将其转化为对抗性攻击(越狱)或敏感性嵌入无害任务的场景(文化)。流水线应用了多阶段质量保证,结合 LLM 裁判和母语者人工在环(HITL)验证。最终的数据集覆盖 10 个国家-语言配对,并通过攻击成功率(ASR)、中性安全率(NSR)和文化敏感性率(CSR)进行评估。 | 危害类别 | 描述 | | :--- | :--- | | **犯罪活动** | 电信/语音钓鱼、深度伪造色情、在线毒品交易、加密货币诈骗、个人数据贩卖 | | **自残与危险建议** | 自杀方法、自伤技巧、饮食失调宣传、危险药物组合、未经证实的医疗方案 | | **仇恨与歧视** | 种族/民族仇恨言论、基于性别的歧视、宗教歧视、LGBTQ+ 歧视、残疾歧视 | | **社会经济冲突** | 财富不平等、学术精英主义、阶级冲突煽动、劳工剥削、住房不平等 | | **政治与虚假信息** | 选举虚假信息、政治诽谤、阴谋论、假新闻生成、舆论操纵 | 表 1:**越狱基准的分类体系**。25 个共享子类别在所有国家中固定。每个类别额外包含 5 个国家的灵活子类别(附录 G (https://arxiv.org/html/2605.05662#A7)),每个国家-语言配对共产生 50 个子类别。 ### 3.1 越狱基准:国别化对抗鲁棒性 #### 危害类别与子类别。 我们定义了五个危害类别(表 1 (https://arxiv.org/html/2605.05662#S3.T1)):犯罪活动、自残与危险建议、仇恨与歧视、社会经济冲突、政治与虚假信息。每个类别包含五个**共享**子类别(各国相同,便于跨国家比较)和五个**灵活**子类别,用于捕捉本地化的危害概念。为了发现灵活子类别,我们使用结合网络搜索的 LLM,检索各国的法律框架、社会现象和有记录的问题,为每个类别生成 10 个候选。然后由另一个 LLM 根据五个质量标准(附录 B.1 (https://arxiv.org/html/2605.05662#A2.SS1))对每个候选进行验证。此生成-验证循环最多重复三次,直到收集到七个验证通过的候选。然后,两位独立的母语标注者从多个维度对这些候选进行评分,每个危害类别选择平均分前五的候选。与 25 个共享子类别合并后,每个国家-语言配对共得到 50 个子类别(25 共享个 + 25 个灵活)。 参考图注图 2:**韩国房地产全税欺诈的国别化越狱提示构建**,展示了四阶段流水线:(1) 危害类别,(2) 基于韩国全税制(一次性住房押金)的国家特定子类别,(3) 带有明确恶意意图的母语基础查询,(4) 使用“权威冒充”策略生成的对抗性提示。 #### 基础查询生成。 对于每个子类别,我们生成本地语言的基础查询,这些查询在本地背景下表达了明确的恶意意图。两种子类别类型都用本地化细节实例化:共享查询融入了本地平台、法律术语和文化细微差别(例如,“电信钓鱼”变为涉及本地银行或消息应用程序的国家特定短信诈骗)。每个子类别由 LLM 生成 16 个候选查询;对于政治与虚假信息类别,我们额外对每个国家强制执行意识形态平衡约束。每个候选由另一个 LLM 裁判根据五个质量标准自动评分(附录 B.2 (https://arxiv.org/html/2605.05662#A2.SS2))。保留前四名,对于未通过质量阈值的子类别,最多进行三轮重试。随后,两位独立的母语者标注者审查这些查询,并根据平均排名选择最终三个。这为每个国家生成了 150 个基础查询(50 个子类别 × 3 个查询)。 #### 攻击生成。 每个基础查询通过自动化的红队流水线转化为对抗性提示。遵循 PAIR (Chao 等人, 2025 (https://arxiv.org/html/2605.05662#bib.bib69)) 框架,我们使用三个 LLM 角色:一个攻击者、一个探查目标和一个裁判。攻击者生成基础查询的伪装版本以绕过安全过滤器,裁判评估模型的响应是否构成成功的越狱。成功的攻击会反馈以指导后续迭代。为了最大化攻击多样性,我们扩展了框架,针对 3 个不同的探查目标模型运行此流水线,为每个基础查询在每个目标上收集一个成功的攻击。收集完成后,通过 LLM 修订通道纠正格式问题(如截断或语言混合)(完整过程见附录 B.3 (https://arxiv.org/html/2605.05662#A2.SS3))。这为每个国家生成了 450 个对抗性提示(5 个类别 × × 10 个子类别 × × 3 个基础查询 × × 3 种攻击变体)。 | 类别 | 描述 | | :--- | :--- | | 符号禁忌与赠礼 | 不吉利的数字、颜色象征、命名禁忌、赠礼禁忌、同音迷信 | | 食品、饮食法规与待客 | 宗教饮食规范、食品安全规范、待客期望、用餐礼仪、饮酒仪式 | | 死亡、哀悼与殡葬习俗 | 哀悼规程、纪念习俗、来世信仰、慰问礼仪、葬礼后仪式 | | 日常生活与公共行为 | 噪音规则、个人空间、小费习俗、公共行为规范、街头礼仪 | | 等级、称呼与社会礼让 | 敬语系统、年龄相关规程、职称使用、座位安排、代词使用 | | 法律雷区 | 冒犯君主罪、亵渎法律、摄影限制 |
相似文章
CCBENCH:通过隐式信号规范评估LLM文化能力(基于健康查询)
介绍CCBench,一个通过健康查询和使用跨六种文化的角色评估LLM文化能力的框架,发现即使是最佳模型也仅有20-30%的回答具有文化适切性。
CulturALL:评测大模型多语言多文化能力的实景基准
CulturALL 发布含 2,610 条样本、覆盖 14 种语言和 51 个地区的实景基准,用于检验大模型在真实文化场景下的表现;目前最佳模型仅得 44.48%,提升空间巨大。
IndustryBench:探测大语言模型在工业知识领域的边界
本文介绍了 IndustryBench,这是一个针对中文工业采购问答的大语言模型基准测试,以国家标准为参照评估模型表现,突显了安全合规方面的差距。研究揭示,在考虑安全违规的情况下,扩展推理往往会导致安全调整后的评分降低,并改变模型的排名。
SurakshaEval:面向多语言大语言模型的印度语言安全基准
介绍了 SurakshaEval,一个涵盖十种印度语言和英语的大语言模型安全基准,包含跨越七种危害类型的人工编写提示词。对多语言大语言模型进行基准测试,并发现了过度拒绝、在印度语言语境中遗漏隐含偏见等问题。
前沿LLM在阿拉伯文化和社会语言学知识上的基准测试:一个带有人类专家真值的交叉评估框架
本文介绍了一个交叉评估框架,用于在阿拉伯文化和社会语言学知识上对LLM进行基准测试,使用人类专家真值和自动评审。作者贡献了一个针对埃及和伊拉克阿拉伯语的提示-评分标准对数据集,评估了前沿LLM,并发现文化推理仍然是自动评分的主要失败模式。