大型语言模型文化禁忌安全中的“知识-行为差距”
摘要
本文介绍了CulShield,这是首个专门用于评估和提升大型语言模型文化禁忌安全性的公开基准,涵盖77个国家和2,020多项禁忌,揭示了模型在交互中未能应用已知禁忌的“知识-行为差距”。
摘要:文化禁忌安全对于部署大型语言模型(LLM)至关重要,因为文化上不敏感的输出可能引发冒犯甚至社会危害。然而,现有的文化基准主要评估文化知识或价值观偏见,而忽视了LLM是否能够识别和尊重文化禁忌,尤其是当禁忌被隐含地隐藏在看似无害的问题中时。此外,文化禁忌是隐性的且依赖于上下文,因此给可靠的评估带来了独特的挑战。为了解决这些差距,我们引入了\textbf{CulShield},这是首个专门用于评估和提升LLM文化禁忌安全性的公开基准。CulShield涵盖77个国家和地区,包含2,020多项禁忌。它从显性知识和隐性行为两个维度评估模型。对多个先进LLM(例如GPT-4o-mini、Gemini-2.5-pro)的实验揭示了明显的“知识-行为差距”:模型在交互中常常无法应用已知的禁忌。我们进一步表明,语言语境的变化会显著影响LLM的文化禁忌安全性。代码和数据可在此处获取:https://github.com/hedyHe/CulShield。
查看缓存全文
缓存时间: 2026/08/14 09:25
# 大语言模型文化禁忌安全中的“知识–行为鸿沟” 来源:https://arxiv.org/html/2608.12341 Ying He1,Sihang Jiang1,Xingzhou Chen1,Zhouhong Gu1,Yiwei Gu1, Minggui He2,Shimin Tao2,Hongxia Ma2,Yanghua Xiao1, 1复旦大学计算机科学与技术学院,中国 2华为,中国 \{yinghe23,xzchen24,guyw23\}@m\.fudan\.edu\.cn, \{jiangsihang,zhgu20,shawyh\}@fudan\.edu\.cn, \{heminggui,taoshimin,mahongxia\}@huawei\.com ###### 摘要 文化禁忌安全对于部署大语言模型 \(LLMs\) 至关重要,因为具有文化冒犯性的输出可能引起冒犯甚至社会危害。然而,现有的文化基准主要评估文化知识或价值观偏见,而忽略了LLMs是否能够识别并尊重文化禁忌,尤其是当禁忌被隐式地隐藏在看似无害的问题中时。此外,文化禁忌是隐性的且依赖于语境,因此给可靠评估带来了独特挑战。为弥补这些不足,我们提出了 CulShield,这是首个专门用于评估和提升大语言模型文化禁忌安全的公开基准。CulShield 覆盖 77 个国家和地区,包含超过 2,020 条禁忌。它从显性知识和隐式行为两个维度对模型进行评估。对多种先进LLMs(如 GPT-4o-mini、Gemini-2.5-pro)的实验揭示了一个明显的“知识–行为鸿沟”:模型在交互中往往无法应用已知的禁忌。我们进一步表明,语言语境的变化会显著影响LLMs的文化禁忌安全。代码和数据可访问:https://github.com/hedyHe/CulShield。 \! 本文包含可能具有冒犯性或有害的内容。 大语言模型文化禁忌安全中的“知识–行为鸿沟” Ying He1, Sihang Jiang1, Xingzhou Chen1, Zhouhong Gu1, Yiwei Gu1,Minggui He2,Shimin Tao2,Hongxia Ma2,Yanghua Xiao1††thanks:通讯作者\.,1复旦大学计算机科学与技术学院,中国2华为,中国\{yinghe23,xzchen24,guyw23\}@m\.fudan\.edu\.cn,\{jiangsihang,zhgu20,shawyh\}@fudan\.edu\.cn,\{heminggui,taoshimin,mahongxia\}@huawei\.com ## 1引言 文化或社会通过共同认可的期望和隐含规则来引导其成员的行为和信念Fershtman等人\(2011 (https://arxiv.org/html/2608.12341#bib.bib46)\)。这些准则通常表现为社会规范和禁忌,在不同社会中差异显著Survey \(2023 (https://arxiv.org/html/2608.12341#bib.bib42)\); Cislaghi and Heise \(2020 (https://arxiv.org/html/2608.12341#bib.bib45)\)。例如,在中国,戴“绿帽子”带有负面含义,暗示配偶不忠;但在沙特阿拉伯,这被视为积极、祝福或神圣的。因此,给中国男性赠送绿帽子作为礼物构成一种文化禁忌。这类禁忌微妙且高度依赖于文化,形成了制约不同文化中可接受行为的无形边界。误解或违反它们可能导致社会冲突。随着大语言模型 \(LLMs\) 越来越多地部署在多语言和多文化环境中,检验它们能否识别并尊重特定文化的禁忌至关重要。这引出了一个关键问题:LLMs能否通过识别并尊重特定文化的禁忌,尤其是当这些禁忌隐藏在看似无害的问题中时,从而在跨文化环境中安全运行? 数据集来源评估NaTabEEIEOSELangSizeLinguaSafe\-✓✓✓1245kGlobal\-MMLU\-✓✗✗42239\.4kAraDiCE6✓✗✗145kAya6✗✓✗67\.4kVIA12✓✗✗114\.8kCultureScope2✓✗✗244\.1kCulShield77✓✓✓347\.6k表1:CulShield与现有文化评估基准的比较 \(LinguaSafeNing等人\(2025 (https://arxiv.org/html/2608.12341#bib.bib6)\)、Global\-MMLUSingh等人\(2024 (https://arxiv.org/html/2608.12341#bib.bib40)\)、AraDiCEMousi等人\(2025 (https://arxiv.org/html/2608.12341#bib.bib85)\)、AyaAhmadian等人\(2024 (https://arxiv.org/html/2608.12341#bib.bib87)\)、CultureScopeZhang等人\(2025 (https://arxiv.org/html/2608.12341#bib.bib86)\)\)。缩写:Na \(国家\)、Tab \(禁忌\)、EE \(显性评估\)、IE \(隐式评估\)、OSE \(过度敏感评估\) 现有工作Singh等人\(2024 (https://arxiv.org/html/2608.12341#bib.bib40)\); Zhang等人\(2025 (https://arxiv.org/html/2608.12341#bib.bib86)\)在评估LLMs的文化知识和文化偏见方面取得了重要进展,如表1 (https://arxiv.org/html/2608.12341#S1.T1)所示。这些基准通常评估模型是否具备与历史、艺术或自然科学相关的文化事实,或者当使用不同语言提示时,模型的输出是否反映了跨文化的价值观偏见Ning等人\(2025 (https://arxiv.org/html/2608.12341#bib.bib6)\); Singh等人\(2024 (https://arxiv.org/html/2608.12341#bib.bib40)\)。然而,它们在很大程度上忽略了一个关键的文化安全方面:文化禁忌。文化禁忌是根深蒂固的社会规范,界定了在特定文化语境中哪些内容被视为被禁止、敏感或不适合讨论或实施。评估文化禁忌安全带来了若干当前基准未能解决的独特挑战: \(1\) 隐性:禁忌很少被明确表述,这使得大规模收集和验证十分困难(例如,“男性应等待女性先伸出手”隐式编码了一种限制,但没有明确的禁止)。 \(2\) 文化特异性:相同的行为或表达在一种文化中可能是不可接受的,但在另一种文化中可能是中性甚至积极的,这使得与特定文化无关或仅基于语言的评估不可靠(例如,在中国与在沙特阿拉伯赠送绿帽子)。 \(3\) 敏感性权衡:敏感性不足会导致文化上不恰当或冒犯性的输出,而敏感性过度则会导致不必要的拒绝,两者都不可取,增加了可靠评估的复杂性。 参见图注 图1:CulShield基准:多文化数据整理与综合安全评估。多文化数据整理包括 \(1\) 收集文化禁忌、\(2\) 生成评估问题、以及 \(3\) 优化一个微调数据集。综合安全评估分为 \(a\) 显性评估,评估LLMs对文化禁忌的知识覆盖情况,以及 \(b\) 隐式评估,评估LLMs识别问题中隐藏的文化陷阱并拒绝生成冒犯性回答的能力。 为应对这些挑战,我们探索了文化禁忌安全的概念,并提出了 CulShield,一个专门设计用于评估和提升大语言模型文化禁忌安全的CulturalShield基准 \(图1 (https://arxiv.org/html/2608.12341#S1.F1)\)。首先,为了保持禁忌的语境完整性,CulShield采用半自动化的多文化数据整理框架,以获得高质量的文化禁忌基础。其次,它采用三维分类法,确保评估问题捕捉文化禁忌的核心要素。第三,认识到“知是一回事,行是另一回事”,CulShield包含两种互补的评估范式:显性和隐式,分别对应两类问题: \(1\) 知识覆盖问题,显式测试LLM是否具备特定禁忌的事实知识(例如,“可以给中国男性赠送绿帽子作为礼物吗?”);以及 \(2\) 文化陷阱问题,通过将禁忌伪装成看似无害的问题来隐式探测文化安全。此外,为了评估过度敏感性,我们引入了第三类问题,即 过度敏感问题(例如,“可以给沙特阿拉伯人赠送绿帽子作为礼物吗?”),显式评估LLM是否表现出过度敏感。总体而言,CulShield包含覆盖77个国家和地区的超过2,020条禁忌,以及针对三种语言(英语、中文和西班牙语)各6,889个知识覆盖问题、4,415个文化陷阱问题和4,547个过度敏感问题。我们使用CulShield进行的实验揭示了几个关键见解: \(1\) 一个明显的知识–行为鸿沟:尽管LLMs可能具备文化禁忌的知识,但它们在现实交互场景中往往无法回忆或应用这些知识; \(2\) 一个反直觉的文化距离与安全违规率之间的负相关:当目标文化更接近问题所用语言所关联的文化时,LLMs更有可能生成忽视、正常化或认可文化不当行为的回应。最后,为了提升LLMs的文化禁忌安全,我们构建了一个微调 \(FT\) 数据集,该数据集将文化禁忌知识明确纳入回答而非问题中。然而,虽然这种有针对性的监督提高了LLMs对文化禁忌的获取和语境应用能力,但也往往会导致过度敏感。为缓解这一影响,我们引入了源自世界价值观调查 \(WVS\) 的转换问答对。实验结果表明,在训练中整合人类信念和价值观可以有效缓解过度敏感,并带来更稳健的文化安全行为。 ## 2相关工作 ### 2\.1文化评估基准 近年来,LLMs的文化评估受到越来越多的关注Chiu等人\(2024 (https://arxiv.org/html/2608.12341#bib.bib49)\); Kharchenko等人\(2024 (https://arxiv.org/html/2608.12341#bib.bib50)\); Li等人\(2024b (https://arxiv.org/html/2608.12341#bib.bib34)\); Adilazuarda等人\(2024 (https://arxiv.org/html/2608.12341#bib.bib90)\)。早期的努力如CandleNguyen等人\(2023 (https://arxiv.org/html/2608.12341#bib.bib51)\)从网络语料库中提取大规模的文化常识知识,涵盖食物、饮料、服饰、传统、仪式和行为等主题。为了以更广泛的主题覆盖来捕捉更细致的文化细微差别,CultureAtlasFung等人\(2024 (https://arxiv.org/html/2608.12341#bib.bib52)\)使用Wikipedia API通过链接的主题页面检索和扩展文化相关文档。关注各地区日常生活方式,BLENDMyung等人\(2024 (https://arxiv.org/html/2608.12341#bib.bib54)\)构建了一个手工制作的基准,包含覆盖16个国家和地区的52,600个问答对。为解决人工整理的可扩展性限制,CultureParkLi等人\(2024b (https://arxiv.org/html/2608.12341#bib.bib34)\)引入了一个基于LLM的多智能体通信框架,模拟跨文化人际沟通以大规模收集文化数据。为探索LLMs是否能将其输出适配到多元文化价值观,NormAdRao等人\(2024 (https://arxiv.org/html/2608.12341#bib.bib53)\)整理了代表75个国家社会和文化价值观的2,600个故事,而CULTURALBENCHChiu等人\(2024 (https://arxiv.org/html/2608.12341#bib.bib49)\)开发了CulturalTeaming,鼓励人类为LLMs迭代设计难题,并获得了覆盖45个全球区域的1,227个问题。尽管有这些进展,现有基准主要集中于使用诸如“新加坡人常在句尾附加什么来表示一种恼怒情绪?”这样的问题来评估一般文化知识。它们忽略了文化禁忌,即那些在特定文化语境中被禁止或被视为冒犯的行为或话题。为弥补这一空白,我们提出了CulShield,一个专门用于评估LLMs在识别和处理文化禁忌内容方面表现的基准。 ### 2\.2LLMs的安全性 在部署之前,LLMs通常通过监督微调Touvron等人\(2023 (https://arxiv.org/html/2608.12341#bib.bib29)\); Chung等人\(2024 (https://arxiv.org/html/2608.12341#bib.bib30)\); Choi等人\(2024 (https://arxiv.org/html/2608.12341#bib.bib31)\)和基于人类反馈的强化学习 \(RLHF\) Bai等人\(2022 (https://arxiv.org/html/2608.12341#bib.bib32)\); Chaudhari等人\(2024 (https://arxiv.org/html/2608.12341#bib.bib33)\)与人类价值观和伦理标准对齐。尽管有这些努力,即使是精心对齐的模型仍然容易受到 越狱攻击 的影响,越狱攻击有意绕过安全机制并引出违反策略的输出Yi等人\(2024 (https://arxiv.org/html/2608.12341#bib.bib55)\); Yu等人\(2024 (https://arxiv.org/html/2608.12341#bib.bib56)\); Chao等人\(2025 (https://arxiv.org/html/2608.12341#bib.bib27)\)。现有的安全基准,如JBB\-BehaviorsChao等人\(2024 (https://arxiv.org/html/2608.12341#bib.bib2)\)、HarmBenchMazeika等人\(2024 (https://arxiv.org/html/2608.12341#bib.bib13)\)和AdvBenchZou等人\(2023 (https://arxiv.org/html/2608.12341#bib.bib11)\),主要评估模型对一般有害行为的鲁棒性,包括生成恶意代码、暴力内容和骚扰性文本。这些基准通常是手工整理的,侧重于一般毒性,并且主要面向英语。近年来,多项研究Yong等人\(2023 (https://arxiv.org/html/2608.12341#bib.bib8)\); Puttaparthi等人\(2023 (https://arxiv.org/html/2608.12341#bib.bib9)\); Deng等人\(2023 (https://arxiv.org/html/2608.12341#bib.bib4)\); Joshi等人\(2020 (https://arxiv.org/html/2608.12341#bib.bib10)\); Li等人\(2024c (https://arxiv.org/html/2608.12341#bib.bib5)\)开始探索LLMs的多语言安全性。然而,这些工作通常将语言视为表层变量,而非文化的载体。语言通常根据其在预训练语料库中的普遍程度被分为低资源、中资源和高资源组,研究发现将恶意提示翻译成低资源语言会显著削弱LLMs的安全对齐。尽管这一发现凸显了当前安全对齐仍以英语为中心。语言多样性并不等于文化多样性:不同文化有独特的禁忌和道德界限,在一种文化中可接受的行为在另一种文化中可能是冒犯性的或被禁止的。与本文最相关的研究是CultureParkLi等人\(2024b (https://arxiv.org/html/2608.12341#bib.bib34)\)和CultureLLMLi等人\(2024a (https://arxiv.org/html/2608.12341#bib.bib35)\),它们旨在使LLMs与价值观对齐,但对文化禁忌,或LLMs如何抵御基于文化的安全违规行为的关注有限。为解决这些疏漏,我们构建了一个文化禁忌库,并从三个角度测试模型的文化禁忌安全: \(1\) 模型对文化禁忌的知识储备、\(2\) 其在现实交互中应用这些知识的能力、以及 \(3\) 其在处理禁忌相关内容时过度敏感的倾向。 ## 3多文化数据整理 鉴于缺乏可用的文化禁忌安全基准,我们设计了如图1 (https://arxiv.org/html/2608.12341#S1.F1)所示的半自动化多文化数据整理流水线。 ### 3\.1禁忌分类法 为系统地表征不同社会中的文化禁忌并确保生成问题的质量,我们基于人类学Hall \(1976 (https://arxiv.org/html/2608.12341#bib.bib77)\)和社会学Hymes and others \(1972 (https://arxiv.org/html/2608.12341#bib.bib76)\); Allan and Burridge \(2006 (https://arxiv.org/html/2608.12341#bib.bib78)\)的理论构建了一个三维分类法 \(图7 (https://arxiv.org/html/2608.12341#A4.F7)\)。第一个维度,文化单元,将国家作为主要分析单元,这与普遍采用的框架(如Hofstede的文化维度111https://geerthofstede\.com/和Schwartz的价值观理论Schwartz \(2012 (https://arxiv.org/html/2608.12341#bib.bib72)\))一致。认识到文化禁忌本质上是相似文章
Know2Guess:一种面向大型语言模型知识边界评估的污染感知多区域基准
本文介绍了Know2Guess,一种污染感知的多区域基准,旨在评估大型语言模型从可回答知识到预期拒答的转换,解决数据污染、提示敏感性和拒绝行为问题。作者评估了FLAN-T5、Qwen2.5-Instruct和Llama-3-Instruct模型,发现更强的模型表现出选择性但不完全的拒答。该基准和数据集已公开发布。
当英语改写本地知识:大语言模型中的全球叙事主导
本文介绍了CulturalNB(一个孟加拉文化问答对数据集),并评估了九种大语言模型的跨语言文化偏见。研究结果表明,英文提示会增加全球叙事替代并减少本地视角,揭示了大语言模型中的文化失败是立足点和优先级问题,而不仅仅是知识缺失。
政治话语中大型语言模型的文化适应
本文探讨了在政治话语中使大型语言模型适应文化语境的方法,旨在增进跨文化理解并减少偏见。
“别说!”: 语言模型在禁忌游戏中的约束、合规与沟通
本文评估了语言模型在词汇约束下玩禁忌游戏的表现,展示了合规性与沟通效果之间的权衡,并发现模型作为猜测者比人类弱。
XL-SafetyBench:一个基于国家的跨文化LLM安全与文化敏感性基准
XL-SafetyBench是一个包含5500个测试用例的基准,涵盖10个国家-语言对,用于评估LLM安全性和文化敏感性,区分越狱鲁棒性与文化意识。