安全对齐幻觉:LLMs中的跨语言安全差距
摘要
本文介绍了INCLUDE,一个多语言评估基准,用于量化LLMs中以印度为中心的社会文化偏见,揭示非英语印度语言比英语表现出更高的偏见,表明存在跨语言安全对齐差距。
arXiv:2608.18131v1 公告类型:新
摘要:当前大型语言模型(LLMs)的安全对齐训练严重以英语为中心。当这些安全过滤器在非英语语言中失效时,后果是即时且面向用户的:语音助手和口语对话系统可能会产生强化刻板印象的输出,绕过标准的以英语为中心的安全对齐,并将有害偏见传播给非英语社区。对于在印度语言多样化人口中部署的口语语言技术来说,这代表了一种关键的故障模式。为了解决这一跨语言差距,我们介绍了INCLUDE(用于理解和检测嵌入偏见的印度文化视角),这是一个多语言评估基准,旨在量化以印度为中心的社会文化偏见。INCLUDE包含2,604个提示,跨越六种提示语言:英语、印地语、孟加拉语、马拉地语、泰米尔语和Hinglish(印地语-英语代码混合)。我们使用这个基准评估了十个开源和闭源LLMs,分析了14,988个偏见分数。我们的统计结果揭示了两个关键发现。首先,孟加拉语在开源模型中产生了最高的平均偏见分数。其次,英语显示出显著的逆转,在开源模型中产生最低的偏见,但在闭源模型中产生最高的偏见。
查看缓存全文
缓存时间: 2026/08/20 09:57
# 安全对齐幻觉:大语言模型的跨语言安全鸿沟
来源:https://arxiv.org/html/2608.18131
###### 摘要
当前大语言模型 \(LLMs\) 的安全对齐训练严重偏向英语。当此类安全过滤器在非英语语言中失效时,其后果是直接且面向用户的:语音助手和对话系统可能产生强化刻板印象的输出,绕过以英语为中心的标准安全对齐,并将有害偏见传播至非英语社区。对于在印度语言多样人群中部署的语音技术而言,这是一种关键的失效模式。为解决这一跨语言鸿沟,我们提出了INCLUDE(理解与检测嵌入偏见的印度文化视角),这是一个旨在量化以印度为中心的社会文化偏见的多语言评估基准。INCLUDE包含2,604条提示语,涵盖六种提示语言:英语、印地语、孟加拉语、马拉地语、泰米尔语以及印地英语混合语(Hinglish)。我们使用该基准评估了十种开源和闭源大语言模型,分析了14,988个偏见分数。我们的统计结果揭示了两个关键发现:第一,在开源模型中,孟加拉语产生的平均偏见分数最高;第二,英语表现出显著的逆转现象,在开源模型中产生最低偏见,但在闭源模型中却产生最高偏见。
## I 引言
针对英语等高资源语言严格实施的安全过滤与公平性检查,很少以同等严谨性扩展至低资源和代码混合语言\[22 (https://arxiv.org/html/2608.18131#bib.bib22)\]。安全过滤器是诸如Constitutional AI (CAI) 之类的后训练对齐实践,它训练模型遵循一套人类定义的原则以防止冒犯性模型输出。因此,一个通过了以英语为中心的安全审计\[25 (https://arxiv.org/html/2608.18131#bib.bib25)\]的模型,当在印度区域语言中被提示时,仍可能传播根深蒂固的刻板印象——这是一种安全幻觉,使得非英语使用者得不到有意义的算法保护。
主要的语音助手正在积极集成LLM后端以获取多种优势。苹果已使用先进的LLM能力彻底改造了Siri\[1 (https://arxiv.org/html/2608.18131#bib.bib1)\],类似地,谷歌助理关联至Gemini,亚马逊的Alexa关联至亚马逊的LLM和Anthropic的Claude。随着这些集成成为常态,语音助手会继承其查询的LLM中嵌入的跨语言偏见。考虑到语音交互较低的准入门槛,这种继承尤其有害:识字能力有限的人群、儿童以及低资源或代码混合语言的使用者,常常依赖语音交互,正是因为使用这些语体(即非拉丁文字,如天城文)进行输入很繁琐,这使他们不成比例地暴露在底层LLM嵌入的偏见之中。
INCLUDE旨在直接测量跨语言安全鸿沟,评估模型对跨六种提示语言(英语、印地语、孟加拉语、马拉地语、泰米尔语和印地英语混合语)的文化相关刻板印象提示的反应。我们使用它评估了十个模型:六个开源模型(TinyLlama、Qwen、MistralAI、DeepSeek、GPT-2、Gemma)通过对数似然评分,以及四个闭源嵌入模型(Voyage-3.5、Voyage-3-Large、OpenAI text-embedding-3-large、Cohere embed-multilingual-v3.0)通过词嵌入关联测试(WEAT)的余弦相似性测试。
本文对语音语言技术领域做出了三项直接贡献。首先,在开源模型中,所有五种低资源印度语言引发的偏见显著高于英语,这揭示了印度语境下的安全对齐不对称性。其次,用于语音检索管线的闭源嵌入模型表现出显著的逆转:英语提示引发最强的刻板印象关联,这表明除了后训练对齐之外,预训练语料库的组成引入了另一条偏见途径。第三,由于印地英语混合语作为语音交互的主要代码混合语体,其在统计上与其他所有印度语言无法区分,这揭示了印地英语混合语尽管在词汇上与英语相似,却继承了低资源语言的完整偏见特征。
## II 相关工作
诸如StereoSet\[2 (https://arxiv.org/html/2608.18131#bib.bib2)\]和CrowS-Pairs\[3 (https://arxiv.org/html/2608.18131#bib.bib3)\]等既定基准有效地量化了英语中的偏见,但不适用于非西方语境。在印度语境内,Khandelwal等人\[4 (https://arxiv.org/html/2608.18131#bib.bib4)\]提出了Indian-BhED,Sahoo等人\[5 (https://arxiv.org/html/2608.18131#bib.bib5)\]提出了IndiBias,建立了以印度为中心的偏见测量;然而,两者分别仅关注一到两种语言。Rinki等人\[6 (https://arxiv.org/html/2608.18131#bib.bib6)\]和Santhosh等人\[7 (https://arxiv.org/html/2608.18131#bib.bib7)\]分别提出了评估跨十种达罗毗荼语言和跨多种模型架构的以印度为中心的偏见的严谨框架。虽然INCLUDE建立在两者优势的基础上,但它引入了新的测量技术——用于开源模型的对数似然评分和用于闭源模型的WEAT余弦相似性测试,并将评估扩展至前述研究均未涉及的代码混合语言印地英语混合语。
代码混合的印地英语混合语尤其被忽视。Sheth等人\[10 (https://arxiv.org/html/2608.18131#bib.bib10)\]发现,印地英语混合语缺乏拼写标准化和稀疏的代码转换训练数据,使其成为多语言系统持续面临的挑战。这种结构性的代表不足为印地英语混合语在开源模型中相对于单语语言较低的刻板印象激活提供了一个可能的解释。
Shen等人\[8 (https://arxiv.org/html/2608.18131#bib.bib8)\]指出,大语言模型在低资源语言中产生不安全回应的频率要高得多,并且对高资源语言进行的人类反馈强化学习(RLHF)对其他提示语言的安全性改进甚微。Ning等人\[9 (https://arxiv.org/html/2608.18131#bib.bib9)\]在大规模上证实了这一点,发现安全对齐模型在中低资源语境中表现不佳。这两项研究都未评估代码混合语言,这是一个INCLUDE直接解决的局限性。
## III 方法论
### III-A 定义偏见分段
为测量大语言模型中以印度为中心的社会文化偏见,本研究定义了六个偏见维度:种姓、交叉性、地域、宗教、社会经济地位(SES)和口头语言。这些维度的选定基于其在科学、文化和历史文献中记录详实的普遍性\[4 (https://arxiv.org/html/2608.18131#bib.bib4)\]。在六个维度下,共有27个身份群体。一个身份群体代表在其各自维度内通常成为刻板印象目标的人群(例如,种姓维度下的婆罗门)。每个身份群体都有关联的刻板印象或反刻板印象标签(例如,印度教徒——刻板印象:耍蛇人,反刻板印象:清洁),称为属性。在本文后续内容中,“偏见分段”统称偏见维度、身份群体和属性。
### III-B 专家验证
一个由20人组成的专家小组(包括中小学教师、大学教师和母语者)审查了偏见分段的刻板印象准确性。根据小组反馈,对偏见分段进行了迭代修订;例如,将种姓与族裔混为一谈的属性,或被认为对当代话语过于陈旧的属性,被删除或重新措辞。匿名反馈被记录在案,问卷未收集任何个人可识别信息。专家小组成员事先被告知研究主题的敏感性,并可随时退出。
### III-C 提示构建
使用经过验证的偏见分段,构建了用于开源模型的完形填空式提示和用于闭源模型的目标-属性提示元组,以量化方式引出大语言模型的刻板印象行为。为确保观察到的模型对刻板印象的任何偏好都严格归因于其训练数据和架构,这些提示被设计为全面、词汇自然且不含明显的刻板印象线索。每个完形填空式提示包含一个带有一个掩码标记位置的上下文句子,后跟三个候选属性,其顺序可变:一个刻板印象属性(S\_stereo)、一个反刻板印象属性(S\_anti)以及一个无意义的属性选项,旨在作为对照以防范随机选择回应。
见图注图1:提示实例示例。一个无偏见的模型不应系统性地偏好选项\(a\)而非\(b\);选项\(c\)作为干扰基线。评估闭源模型需要不同的提示模板,因为其架构透明度有限。每个元组由四个核心元素完整实例化:目标身份群体(target)、一个刻板印象属性(att\_A)、一个反刻板印象属性(att\_B)以及提示语言(lang)。
见图注图2:英语中的目标-属性元组及其在马拉地语中的翻译对应。
### III-D 提示翻译
为全面评估偏见传播,使用由GPT-4o驱动的自动化流程,将完整的提示集翻译成五种低资源印度语言:印地语、孟加拉语、印地英语混合语、泰米尔语和马拉地语。为验证翻译质量,来自专家小组的、具有母语水平的双语注释者独立地在5点李克特量表上审查所有翻译,评估刻板印象强度的保持情况。在语义等价性不足的地方,注释者直接修改了翻译提示,然后才最终确定评分,确保所有评分的翻译在语义上等同于原始的英语来源。为确保评分准确性,注释者采用了回译,将翻译后的提示回译成英语。通过匿名参与、不收集个人可识别信息以及随时退出的权利,确保了注释者的福祉。
注释者间一致性使用线性加权的Cohen’s κ评估(五点评分量表)。线性权重根据分歧在量表上的距离按比例进行惩罚。解释阈值遵循Landis & Koch\[11 (https://arxiv.org/html/2608.18131#bib.bib11)\]的标准。如表I (https://arxiv.org/html/2608.18131#S3.T1)所示,印地英语混合语(κ=0.977, n=100)和泰米尔语(κ=0.927, n=198)的注释者间一致性几乎是完美的,印地语(κ=0.639, n=33)为实质性一致,马拉地语(κ=0.585, n=32)为中度一致,孟加拉语(κ=0.357, n=36)为一般一致。值得注意的是,所有五种语言在1分范围内的同意率均达到88.9%或更高,表明注释者在评估上大体一致。
为验证闭源模型元组的翻译,双语注释者对每个元组中的每个术语(每个元组三个)进行了回译检查,并提供了二元判断:要么确认其在目标语言中的适当性,要么拒绝并提出更符合上下文的替代方案。这确保了非英语语言中基于嵌入的偏见分数反映的是语言原生的语义表示。
表I:五种语言翻译质量的注释者间一致性(加权Cohen’s κ)
见图注图3:一对英语-印地英语混合语示例句子,由两位双语注释者独立审查,用于完形填空式提示。
### III-E 提示评估
对于开源模型,每个完形填空式提示使用条件对数似然评分进行评估,如第IV节 (https://arxiv.org/html/2608.18131#S4)所述。对于闭源模型,每个目标-属性元组使用WEAT余弦相似性评分进行评估,如第V节 (https://arxiv.org/html/2608.18131#S5)所述。
### III-F 统计分析
为评估跨提示语言观察到的偏见分数差异是否具有统计可靠性,在14,988个原始偏见分数观察数据集上进行了两种互补分析。未使用标准ANOVA,因为相同的提示在所有六种语言中重复出现,违反了ANOVA所需的独立性假设;将相同提示的重复测量视为独立观察会提高I类错误率。因此,采用线性混合效应模型,将提示标识作为随机效应以显式解释这种依赖性。开源和闭源模型分开分析,因为它们的指标在数值尺度上不可通约。整体组间差异使用Friedman检验(一种非参数重复测量替代方法)进行评估,该检验报告Kendall’s W(0-1)作为效应量,其中较高的值表示更强的组间一致性,p值表示在零假设(无组间差异)下观察到该结果的概率(全程p<0.05)。配对事后检验使用带Holm校正的Wilcoxon符号秩检验进行,以识别哪些特定语言对存在显著差异,并在所有结果文件中应用Benjamini-Hochberg FDR校正作为保守的稳健性检查。
表II:偏见评估数据集的原始分数
## IV 开源评估指标
每个语言模型本质上都是一个下一个词预测器。给定文本,它会为每个可能的下一个标记分配概率。开源评估流程利用这一特性,向每个模型呈现一个完形填空式提示,并测量它对每个候选补全(刻板印象、反刻板印象和无意义)的“惊讶”程度。这种惊讶通过损失分数量化,定义为:
L=−1N∑i=1NlogP(tokeni)\\mathcal\{L\}=\\frac\{1\}\{N\}\\sum\_\{i=1\}^\{N\}\\log P(\\text\{token\}\_\{i\}) (1)
其中N是补全中的标记数,P(tokeni)是模型对每个标记的预测概率。较低的损失表示模型认为该补全很自然。
损失分数和对数似然是同一枚硬币的两面,关系为L=−log-likelihood \\mathcal\{L\}=-\\log\\text\{-likelihood\}。原始概率是极小的小数,直接计算存在数值不稳定性。对数似然将其转换为可处理的负数,而损失分数则取反以得到正数。尽管底层数学原理完全相同,但取反纯粹是为了计算便利。
对于每个模型运行,针对每种提示语言和目标偏见维度(例如,DeepSeek-英语-种姓.csv),对应216个单独的结果文件,每个提示的偏见分数计算如下:
δi=Lanti-stereotype(i)−Lstereotype(i) \\delta\_\{i\}=\\mathcal\{L\}\_\{\\text\{anti-stereotype\}\}^\{\(i\)\}-\\mathcal\{L\}\_\{\\text\{stereotype\}\}^\{\(i\)\} (2)
解释如下:δi>0表示模型认为刻板印象更自然(有偏见);δi<0表示模型偏好反刻板印象(无偏见)。负值在汇总前被截断为零。如果不截断,反刻板印象的偏好会在平均值中抵消刻板印象的偏好,产生一个混淆了...的分数。相似文章
低资源语言中的LLM安全对齐:一项系统性文献综述
本系统性文献综述研究了大型语言模型在低资源语言中的安全对齐,指出存在持续的多语言安全差距,并提出了未来方向,如基于文化背景的基准测试和参与式数据收集。
SurakshaEval:面向多语言大语言模型的印度语言安全基准
介绍了 SurakshaEval,一个涵盖十种印度语言和英语的大语言模型安全基准,包含跨越七种危害类型的人工编写提示词。对多语言大语言模型进行基准测试,并发现了过度拒绝、在印度语言语境中遗漏隐含偏见等问题。
语言塑造多语言大语言模型中指令层级遵循度
本文介绍了XIH-Bench,一个用于评估多语言大语言模型中指令层级遵循度的基准,揭示了语言依赖的不对称性以及语言边界效应,即跨语言冲突比同语言冲突产生更高的遵循度。
良性多语言微调对安全影响的异质性
本文首次对良性多语言微调对LLMs的安全影响进行了全面的实证研究,表明安全结果因语言而异,仅评估英语是不够的。
形式对齐而非语义对齐:低资源孟加拉语贬损言语中LLM安全性的理解-遏制解耦
这篇arXiv论文对五种前沿LLM在原生孟加拉语贬损言语上的表现进行了审计,发现安全对齐未能泛化到低资源语言——尽管有高资源对齐,模型仍以高比率理解和生成不安全内容。作者提出了“理解-遏制解耦”概念,并表明推理和人格框架会进一步瓦解安全过滤器。