SurakshaEval:面向多语言大语言模型的印度语言安全基准
摘要
介绍了 SurakshaEval,一个涵盖十种印度语言和英语的大语言模型安全基准,包含跨越七种危害类型的人工编写提示词。对多语言大语言模型进行基准测试,并发现了过度拒绝、在印度语言语境中遗漏隐含偏见等问题。
arXiv:2608.07862v1 公告类型:新
摘要:现有的大语言模型(LLM)安全评估数据集主要关注英语和西方语境,往往忽视了其他语言中存在的语言多样性和基于文化的安全风险。为了解决这一差距,我们引入了 SurakshaEval,一个新颖的安全基准,由覆盖真实世界场景的人工编写提示词组成,专门针对十种主要印度语言——阿萨姆语、孟加拉语、古吉拉特语、印地语、卡纳达语、马拉雅拉姆语、马拉地语、旁遮普语、泰米尔语和泰卢固语——以及英语而设计。SurakshaEval 既包含印度各地通用的提示词,也包含捕获本地化社会文化敏感性的区域性和语言特定提示词。我们在 SurakshaEval 上对一系列最先进的 LLM 进行了基准测试,建立了基线安全性能,并识别了反复出现的失败模式,包括过度拒绝、对隐含偏见的遗漏检测,以及在区域敏感环境中情境意识不足。我们的结果表明,即使强大的多语言 LLM 在使用印度语言(尤其是母语文字)时,也难以可靠地满足细微差别的安全要求。这些发现凸显了亟需纳入区域特定数据和结构化评估协议的安全评估框架,从而支持开发并部署符合多样化社会价值观、安全、合乎道德地运行的 AI 系统。我们的代码和数据可在 https://github.com/debobanerjee/SurakshaEval 获取。警告:本文包含可能具有冒犯性或不安全的内容。
查看缓存全文
缓存时间: 2026/08/11 08:06
# SurakshaEval:面向多语言大语言模型的印度语安全基准 Source: https://arxiv.org/html/2608.07862 \\fontspec\_if\_language:nTF ENG\\addfontfeatureLanguage=English Debopriyo Banerjee1,\\equalcontrib, Kapil Rajesh Kavitha2,\\equalcontrib,3Angana Borah,2Xudong Han,4Yuxia Wang,5Parameswari Krishnamurthy,2Utkarsh Agarwal,2Atharva Kulkarni,6Swaran Lata,7Ayush Munot,2Dhruv Sahnan,2Aaryamonvikram Singh,2Preslav Nakov,2Monojit Choudhury ###### 摘要 现有的大语言模型(LLM)安全评估数据集主要聚焦于英语和西方语境,往往忽视了其他语言中存在的语言多样性和植根于文化的安全风险。为弥补这一空白,我们提出了SurakshaEval——一个由人工编写提示组成的新型安全基准,覆盖真实世界场景,专门针对十种主要印度语言(阿萨姆语、孟加拉语、古吉拉特语、印地语、卡纳达语、马拉雅拉姆语、马拉地语、旁遮普语、泰米尔语和泰卢固语)以及英语设计。SurakshaEval 既包含印度各地通用的提示,也包含捕捉本地化社会文化敏感性的地区和语言特定提示。我们在 SurakshaEval 上对一系列最先进的 LLM 进行了基准测试,建立了基线安全性能,并识别了反复出现的失败模式,包括过度拒绝、对隐含偏见的漏检,以及在区域敏感场景中上下文意识不足。我们的结果表明,即使强大的多语言 LLM 在印度语言环境中(尤其是使用本地文字时)也难以可靠地满足细微的安全要求。这些发现凸显了迫切需求,即建立纳入区域特定数据和结构化评估协议的安全评估框架,从而支持开发并部署安全、合乎道德且与多元社会价值观一致的 AI 系统。我们的代码和数据可在https://github.com/debobanerjee/SurakshaEval获取。警告:本文包含可能冒犯或不安全的内容。 ## \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English1 引言 大语言模型(LLM)在各类语言理解和生成任务中表现出色。随着其部署扩展到真实世界的多语言环境,对 LLM 生成内容的安全性和可靠性的担忧也相应增加,推动了人们对 AI 安全研究的更多关注。 越来越多的工作开发安全基准来评估模型防护措施和失败模式(lin2025safetysurvey;wang2023not),其中包括针对中低资源语言的研究(yasser2025arabic;goloburda2025qorgau)。然而,在这些工作中,印度语言仍然严重代表性不足。考虑到印度语言的多样性、数字语料有限、标注数据集稀缺以及拼写规范不够标准化,这一空白影响重大,所有这些因素都加剧了构建稳健安全基准的挑战。 参见标题\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English图1:SurakshaEval概述:一个旨在评估 LLM 在印度不同区域和社会文化背景下安全行为的印度语安全基准。该基准包含 10 种印度语言和英语的区域特定安全提示,涵盖七种危害类型。印度官方承认 22 种语言\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English1\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English1\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English1https://rajbhasha.gov.in/en/languages-included-eighth-schedule-indian-constitution,涵盖多个语系(language families),\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2https://en.wikipedia.org/wiki/Languages“ ̇of“ ̇India包括印度-雅利安语系、达罗毗荼语系、南亚语系和汉藏语系。这些语言承载着丰富的区域、文化和历史细微差异,塑造了人们的交流和社会规范。阿萨姆语、孟加拉语、古吉拉特语、印地语、马拉地语和旁遮普语等印度-雅利安语系语言拥有共同的历史根源,影响着词汇和句法;而卡纳达语、马拉雅拉姆语、泰米尔语和泰卢固语等达罗毗荼语系语言则展现出独特的语法结构和文学传统。在实践中,英语经常与本地语言共存并混合,产生了广泛的语码混合形式(chadha2022codeswitchedcodemixed;gupta:2023:mutant;tatariya-etal-2023-transfer;alam-etal-2025-bnsentmix),这进一步增加了语言表征和安全评估的复杂性。 最近的一些进展引入了对 LLM 在各类实用驱动任务中的功能能力进行评估的印度语基准(singh:2024:indicgenbench;ahuja:2024:megaverse;verma:2025:milu;singh:2025:indicqabenchmark)。例如,IndicGenBench(singh:2024:indicgenbench)评估了 29 种印度语言的生成能力,而 Megaverse(ahuja:2024:megaverse)提供了覆盖 83 种语言的大规模多语言和多模态套件。MILU(verma:2025:milu)评估了 LLM 在 11 种印度语言和多个知识领域中的表现。其他基准和框架进一步丰富了印度语 NLP 评估版图(watts:2024:pariksha;rohera:2024:l3cubeindicquest;kumar:2022:indicnlgbenchmark;kakwani:2020:indicnlpsuite;devane:2025:bhashabenchv1)。然而,只有少数数据集明确涉及印度语境或本地印度文字的安全问题(sahoo:2024:indibias;Khandelwal:2024:Indian-BhED;nawale:2025:fairitales)。现有资源往往将覆盖范围限制在英语或印地语,并且对区域特定风险的覆盖十分稀疏,包括植根于文化的刻板印象、政治敏感话题、有争议的历史或当代事件,以及语言特定的辱骂或诽谤表达。印度语言在 AI 安全评估中的这种代表性不足,凸显了亟需明确考虑区域和语言多样性(尤其是本地文字)的基准。 为弥补这一空白,我们引入了SurakshaEval(图\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English1 (https://arxiv.org/html/2608.07862#S1.F1)),这是一个新颖的安全基准数据集,涵盖 10 种主要的印度语言:阿萨姆语(as)、孟加拉语(bn)、古吉拉特语(gu)、印地语(hi)、卡纳达语(kn)、马拉雅拉姆语(ml)、马拉地语(mr)、旁遮普语(pa)、泰米尔语(ta)和泰卢固语(te),以及英语(en)。SurakshaEval 将*区域特定敏感性*作为主要风险领域,并围绕七种危害类型的分类法组织数据集:区域与种族问题(RR)、政治敏感话题(PS)、法律与人权事务(LH)、争议事件/话题(CE)、社会与文化关切(SC)、特定个人(SI)和成人内容(AC)。该数据集包含 2,968 条人工编写的提示,涵盖英语和印度文字。我们的贡献总结如下: - \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English•我们引入了SurakshaEval,这是一个涵盖十种印度语言和英语的新安全基准数据集,旨在捕捉印度语境中区域和语言特定的安全风险。 - \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English•我们开发了*自动评估指南*,用于跨不同危害类别进行结构化安全评估。 - \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English•我们对最先进的*双语和多语言 LLM* 进行了*全面评估*,为当前印度语安全领域的局限性和失败模式提供了实证见解。 ## \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2 相关工作 ##### 印度语 LLM。 近年来,本土印度语 LLM 的开发加速推进。\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=EnglishSarvam-1\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English3\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English3\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English3https://www.sarvam.ai/blogs/sarvam-1是印度最早开发的多语言 LLM 之一,支持十种主要的印度语言。\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=EnglishKutrim-2-12B-Inst(Kallappa:2025:Krutrim2LLM)是一个 120 亿参数的多语言模型,基于\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=EnglishMistral-NeMo架构\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English4\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English4\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English4https://mistral.ai/news/mistral-nemo,在英语之外还扩展到 22 种印度语言。NVIDIA 的\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=EnglishNemo-4-Mi-Hi-4B-Inst\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English5\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English5\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English5https://blogs.nvidia.com/blog/llms-indian-languages/针对印地语,并已被用于 Indus 2.0 等行业项目,该项目专注于印地语及其方言变体。这些模型反映了对印度语言技术日益增长的投资,但也凸显了对印度语言和文化背景下安全行为进行系统评估的必要性。 ##### 印度语 NLP 基准。 印度次大陆拥有一百多种语言;其中超过四十种语言的使用者超过一百万,但只有 22 种语言具有官方宪法地位(aatman2025indic)。一些基准评估了 LLM 在这方面的能力:IndicMMLU-Pro(kj:2025:indicmmlupro)将 MMLU-Pro 扩展到九种印度语言,用于理解、推理和生成;BhashaBench-V1(devane:2025:bhashabenchv1)评估了英语和印地语中农业、法律、金融和阿育吠陀等领域的印度中心知识。社区努力进一步扩展了资源。AI4Bharat\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English6\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English6\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English6https://ai4bharat.iitm.ac.in/发布了用于翻译、分类和命名实体识别的IndicNLPSuite(kakwani:2020:indicnlpsuite)和IndicNLG(kumar:2022:indicnlgbenchmark);FLORES(goyal:2022:flores)支持印度语多语言翻译评估;IndicGenBench(singh:2024:indicgenbench)涵盖 29 种语言和 13 种文字的生成任务。总体而言,这些努力显著改善了印度语评估版图。 尽管取得了这些进展,大多数印度语基准仍面向实用导向的 NLP 任务,对安全、偏见和伦理的覆盖有限。专门的安全基准对于确保印度语 LLM 不仅能力出色,而且部署可靠和安全至关重要。 参见标题\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English图2:SurakshaEval基准和评估框架的详细图示,包括三个阶段:(i)由领域专家进行的分类法开发,定义了七个植根于文化的危害类别;(ii)针对 10 种地区性印度语言(阿萨姆语、孟加拉语、古吉拉特语、印地语、卡纳达语、马拉雅拉姆语、马拉地语、旁遮普语、泰米尔语和泰卢固语)的数据收集与验证,每门地区语言由一名人工标注者(母语者)为每种危害类型生成 10 到 20 条提示(以探究性问题的形式),涵盖通用场景和区域特定场景。这些提示随后经过机器翻译(根据原始生成提示的语言和文字,在英语和地区语言之间双向翻译),并由人工标注者验证翻译,接着使用 LLM 评审小组(PoLL)进行危害标签验证和提示过滤,以完善提示集及其相关危害标签;(iii)安全评估,将精选提示提交给目标 LLM,并由双小组 PoLL 集成对其响应进行评估,产生最终的二元安全判定(安全/不安全)。我们使用SurakshaEval基准评估了 27 个最先进的 LLM,涵盖具有双语和多语言能力的开源权重模型和专有模型。 ##### 安全评估。 安全对于 LLM 的负责任部署至关重要,但大多数现有安全基准仍以英语为中心(lin2025safetysurvey)。例如,Do-Not-Answer数据集(wang2023not)提出了一个全面的风险分类法,但仅用英语评估模型防护措施。先前工作表明,与非英语语言相比,LLM 在使用非英语提示时往往会产生更多不安全响应(song:2024:multilingualblending;wang-etal-2024-languages),这凸显了将安全评估扩展到英语之外的必要性。因此,最近的工作引入了针对中文(wang2024chinese)、阿拉伯语(yasser2025arabic)和哈萨克-俄语语境(goloburda2025qorgau)的本地化安全基准,进一步证实了安全风险和文化敏感性在不同语言和地区之间存在显著差异。 ##### 印度语安全评估。 在印度语境下,安全评估主要集中在英语和印地语上。(wang2025human)专门研究了印地语中的 LLM 滥用问题。Indian-BhED(Khandelwal:2024:Indian-BhED)针对印度特定偏见(如种姓和宗教),但仅限于英语。Indic-Bias(nawale:2025:fairitales)和 IndiBias(sahoo:2024:indibias)分析了印度环境中的刻板印象和社会偏见,但仅提供英语(部分情况下还有印地语)版本。XSafety(wang-etal-2024-languages)包含多种语言(包括印地语和孟加拉语)的提示,涵盖 14 类安全问题;然而,其提示相对简短且本地化程度较轻,对印度社会政治和文化语境中经常出现的区域和文化特定敏感性的强调有限。鉴于印度显著的语言多样性以及现有安全基准在本地印度文字覆盖方面的不足,显然需要地区扎根、语言多样且旨在揭示文化细微风险的评估资源。我们的工作通过引入SurakshaEval 弥补了这一空白,这是一个覆盖十种主要印度语言和英语的开源安全基准,其提示经过精心设计,以捕捉区域特定和植根于文化的安全问题。 ## \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English3 数据集 ### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English3.1 SurakshaEval 我们借鉴了(wang2024chinese)的方法来构建SurakshaEval,这是一个覆盖十种主要印度语言和英语的安全基准。它针对由印度社会政治和文化背景塑造的区域特定安全风险,将提示按多种危害类型分类,用于评估多语言 LLM。图\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2 (https://arxiv.org/html/2608.07862#S2.F2)概述了分类法开发、数据收集和验证过程。 \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English表1:危害类型分类法及说明性示例问题,重点展示不同的印度区域语境。
相似文章
Inspect India Evals:面向印度语言文化语境的大语言模型开放评估框架
介绍Inspect India Evals,一个用于在印度语言文化语境中评估大语言模型的开源框架,包含六项基准测试,涵盖多语言能力、偏见、安全性和文化知识。对五个模型的测试显示,Sarvam-M 24B和Gemma 2 27B表现领先。
Schützen: 在保加利亚语和德语语境中评估LLM安全性
介绍Schützen,一个用于评估保加利亚语和德语中LLM安全性的安全数据集,揭示了安全行为中的跨语言差异,并倡导开发针对特定区域的评估资源。
XL-SafetyBench:一个基于国家的跨文化LLM安全与文化敏感性基准
XL-SafetyBench是一个包含5500个测试用例的基准,涵盖10个国家-语言对,用于评估LLM安全性和文化敏感性,区分越狱鲁棒性与文化意识。
良性多语言微调对安全影响的异质性
本文首次对良性多语言微调对LLMs的安全影响进行了全面的实证研究,表明安全结果因语言而异,仅评估英语是不够的。
前沿LLM在阿拉伯文化和社会语言学知识上的基准测试:一个带有人类专家真值的交叉评估框架
本文介绍了一个交叉评估框架,用于在阿拉伯文化和社会语言学知识上对LLM进行基准测试,使用人类专家真值和自动评审。作者贡献了一个针对埃及和伊拉克阿拉伯语的提示-评分标准对数据集,评估了前沿LLM,并发现文化推理仍然是自动评分的主要失败模式。