多语言语言模型中有毒内容检测与缓解策略综述
摘要
本综述综合了关于多语言大语言模型中有毒内容检测与去毒化研究,梳理了威胁模型、任务形式、检测方法和缓解策略,同时指出了持续存在的挑战,如语言覆盖不均衡以及危害定义的文化依赖性。
arXiv:2606.25380v1 Announce Type: new
摘要:大语言模型(LLMs)正越来越多地在多种语言中部署,但其安全行为在不同语言和文化背景下仍不均衡。本综述综合了关于多语言LLMs的有毒内容检测与去毒化研究。我们首先梳理了利用语言选择、翻译枢轴、代码切换、正字法变异、多轮交互以及部署后微调来削弱安全对齐的威胁模型。然后,我们组织了任务形式(有毒到中性改写、有毒分类和有毒生成评估)、多语言检测方法(跨语言编码器、翻译管道、表示级探针和基于LLM的检测器)以及缓解策略,涵盖数据过滤、监督和偏好调优、解码时引导、表示编辑和多语言护栏。在这些领域中,我们指出了持续存在的挑战:语言覆盖不均衡、危害定义的文化依赖性、碎片化的评估协议,以及去毒化可能压制合法的方言或身份相关表达的风险。
查看缓存全文
缓存时间: 2026/06/25 05:11
# 面向多语言语言模型的毒性检测与缓解策略综述 来源:https://arxiv.org/html/2606.25380 Soham Dan¹, Himanshu Beniwal², Thomas Hartvigsen³ ¹Scale AI, ²印度理工学院甘地讷格尔分校, ³弗吉尼亚大学 [email protected], [email protected], [email protected] ###### 摘要 大语言模型(LLMs)的部署正日益跨越多种语言,但其安全行为在不同语言和文化背景下仍不均匀。本文综述了面向多语言LLM的毒性检测与去毒化研究工作。我们首先对利用语言选择、翻译枢纽、语码转换、正字法变体、多轮交互以及部署后微调来削弱安全对齐的威胁模型进行了分类。随后,我们梳理了任务设定(有毒到中性改写、毒性分类、有毒生成评估)、多语言检测方法(跨语言编码器、翻译流水线、表示层探针和基于LLM的检测器),以及涵盖数据过滤、监督和偏好调优、解码时引导、表示编辑和多语言护栏的缓解策略。在这些领域,我们识别出持续存在的挑战:语言覆盖不均衡、危害定义随文化而异、评估协议碎片化,以及去毒化可能抑制合法的方言或身份相关表达。 # 面向多语言语言模型的毒性检测与缓解策略综述 Soham Dan¹, Himanshu Beniwal², Thomas Hartvigsen³ ¹Scale AI, ²印度理工学院甘地讷格尔分校, ³弗吉尼亚大学 [email protected], [email protected], [email protected] 参见图注 图1:多语言毒性威胁模型、任务设定、评估指标、检测方法和缓解策略的分类树。 ## 1 引言 大语言模型(LLMs)在多语言环境中日益普及,驱动着从多语言聊天机器人到跨语言内容审核等各类应用(de Wynter等,2025(https://arxiv.org/html/2606.25380#bib.bib97);Hartvigsen等,2022(https://arxiv.org/html/2606.25380#bib.bib96);Kim等,2025(https://arxiv.org/html/2606.25380#bib.bib48))。随着部署范围的扩大,安全风险也随之增加:LLMs可能生成、放大或未能检测到有毒内容,如仇恨言论、骚扰、粗言秽语和基于身份的辱骂,而这些风险在不同语言中分布并不均匀(Röttger等,2021(https://arxiv.org/html/2606.25380#bib.bib88);Sharma和Bhalla,2025(https://arxiv.org/html/2606.25380#bib.bib126);Deshpande等,2023(https://arxiv.org/html/2606.25380#bib.bib65);Krasnodębska等,2026(https://arxiv.org/html/2606.25380#bib.bib133))。尽管英语去毒化取得了显著进展,但多语言检测与缓解仍不够成熟,尤其是对于低资源语言、方言、语码转换输入以及特定文化语境下的危害(Beniwal等,2025a(https://arxiv.org/html/2606.25380#bib.bib47);Tiţa和Zubiaga,2021(https://arxiv.org/html/2606.25380#bib.bib111);Dementieva等,2024a(https://arxiv.org/html/2606.25380#bib.bib25);Logacheva等,2022(https://arxiv.org/html/2606.25380#bib.bib54);de Wynter等,2025(https://arxiv.org/html/2606.25380#bib.bib97))。 #### 多语言毒性的复杂性。 多语言去毒化并非英语安全协议的简单翻译(Neplenbroek等,2025(https://arxiv.org/html/2606.25380#bib.bib84);Kumar等,2025(https://arxiv.org/html/2606.25380#bib.bib12))。毒性范围从显性类别(如诽谤、直接辱骂和脏话)到隐形式(如微攻击、讽刺和带毒性的居高临下语气),后者更难标注、检测和缓解(Wen等,2023(https://arxiv.org/html/2606.25380#bib.bib45);Sap等,2022(https://arxiv.org/html/2606.25380#bib.bib125))。危害的定义也因社区而异:在某些语境中无害、被重新定义或属于方言的表达,在另一些语境中可能具有冒犯性。多语言环境还引入了额外的技术脆弱性。语码转换、音译和混合文字输入可能削弱检测器和拒绝行为(Zhang等,2023(https://arxiv.org/html/2606.25380#bib.bib128);Al Ghanim等,2024(https://arxiv.org/html/2606.25380#bib.bib20);Yoo等,2025(https://arxiv.org/html/2606.25380#bib.bib21)),而预训练模型可能从良性或模糊提示退化为有害内容(Gehman等,2020(https://arxiv.org/html/2606.25380#bib.bib58))。这些失败与生成语言中更广泛的文化和社会偏见相互作用(Vongpradit等,2024(https://arxiv.org/html/2606.25380#bib.bib44);Dammu等,2024(https://arxiv.org/html/2606.25380#bib.bib43))。 #### 当前方法的不足。 传统审核系统严重依赖关键词列表、规则和监督分类器,这些方法在面对改写、混淆、方言变化和语境依赖含义时显得脆弱(Kim等,2025(https://arxiv.org/html/2606.25380#bib.bib48);Huang,2025(https://arxiv.org/html/2606.25380#bib.bib41))。LLM对齐减少了许多显性危害,但并未均匀地跨语言传递:低资源语言中的恶意提示更有可能引发不安全响应(Deng等,2024(https://arxiv.org/html/2606.25380#bib.bib2);Shen等,2024(https://arxiv.org/html/2606.25380#bib.bib8)),而偏好优化或RLHF数据仍然集中在少数高资源语言中(Dang等,2024(https://arxiv.org/html/2606.25380#bib.bib119);Lu等,2025(https://arxiv.org/html/2606.25380#bib.bib51))。偏好调优可以跨语言迁移,但迁移质量随表示对齐和语言资源可用性而变化(Li等,2024b(https://arxiv.org/html/2606.25380#bib.bib68);Neplenbroek等,2025(https://arxiv.org/html/2606.25380#bib.bib84))。机器翻译也不是万能的退路:多语言翻译系统可能通过幻觉和数据偏差引入、放大或掩盖毒性(Costa-Jussà等,2023(https://arxiv.org/html/2606.25380#bib.bib39))。这些失败使得多语言去毒化成为集技术鲁棒性、评估有效性和社会语言学覆盖于一体的难题(Adragna等,2020(https://arxiv.org/html/2606.25380#bib.bib38);Cecchini等,2024(https://arxiv.org/html/2606.25380#bib.bib37))。 本综述提供了多语言LLM去毒化的集中概述,将关于检测与缓解的最新研究综合成一个包含数据集、方法和评估框架的分类体系(图1(https://arxiv.org/html/2606.25380#S0.F1))。相关综述广泛考察了多语言LLM安全性(Krasnodębska等,2026(https://arxiv.org/html/2606.25380#bib.bib133));我们的重点在于更狭窄的去毒化管线:如何跨语言诱导、测量、检测和缓解有毒行为。 #### 范围与贡献。 本综述围绕以下主题组织: - •我们整理了多语言威胁模型,涵盖语言转移越狱、翻译/枢纽攻击、语码转换提示、多语言红队以及跨语言微调导致的适应期安全崩溃(§2(https://arxiv.org/html/2606.25380#S2))。 - •我们将任务设定分为三类:有毒到中性改写、毒性分类、以及有毒生成/提示延续,并调查了评估每类任务所使用的数据集和指标。 - •我们调研了多语言毒性检测方法,涵盖基于编码器和解码器的Transformer、基于翻译的流水线、表示层探针以及基于LLM的零样本检测。 - •我们提出了基于机制的去毒化分类法,涵盖数据中心过滤、监督和偏好调优、解码时引导、表示编辑以及多语言护栏。最后,我们讨论了当前面临的开放性挑战——跨语言覆盖缺口、文化错位、评估碎片化以及过度抑制——并指出了构建全球安全且公平的LLM的具体方向。 ## 2 在多语言LLM中诱导毒性的威胁模型 我们关注**多语言特有**的毒性诱导威胁模型,这些模型是利用语言选择、跨语言迁移或多语言交互来从安全对齐模型中引出有毒输出的对抗性程序。在本综述中,我们将安全漏洞(越狱、对齐绕过、红队测试)视为诱导有毒输出的机制;“安全失败”和“毒性引出”因此是同一问题的两个方面。为了使这些威胁模型具有可比性,我们使用四个诊断维度:(i)语言组成(单语言 vs. 语码转换),(ii)文字组成(标准文字 vs. 混合文字/音译),(iii)翻译中介(直接 vs. 枢纽/往返),以及(iv)文化规范差异(普遍性危害 vs. 文化条件性危害)。以下各小节实例化了这些维度:语言转移攻击孤立地考察非英语提示;翻译中介攻击强调枢纽和往返评估;语码转换攻击结合语言与文字组成;多语言红队/适应攻击则揭示了这些语言操作符如何与文化条件性安全策略相互作用。 ### 2.1 提示空间的多语言攻击 #### 语言转移越狱。 这类威胁主要测试**语言组成**:恶意或模糊请求保持单语言,但用英语之外的语言表达。Deng等人(2024(https://arxiv.org/html/2606.25380#bib.bib2))形式化了(i)**无意**多语言越狱(良性用户使用代表性不足的语言进行提示)和(ii)**有意**多语言越狱(攻击者将多语言提示与明确的恶意指令相结合),并展示了低资源语言中不安全率显著更高。 #### 翻译中介和枢纽攻击。 这类威胁强调**翻译中介**:将不安全的英语提示翻译成目标低资源语言以增加遵从度,然后将回复翻译回英语。Shen等人(2024(https://arxiv.org/html/2606.25380#bib.bib8))通过实验证明,低资源语言中表达的恶意提示对应更高的不安全回复率,从而推动基于翻译/枢纽的红队测试。最近的防御方法通过强调英语安全性同时强制目标语言输出,进一步凸显了翻译是多语言安全中的核心失败模式(Zhang等,2025(https://arxiv.org/html/2606.25380#bib.bib22))。 #### 语言混合:语码转换与多语言混合。 这类威胁结合了**语言组成**和**文字组成**,因为多语言提示可能在一个上下文中混合语言、文字和音译形式。Yoo等人(2025(https://arxiv.org/html/2606.25380#bib.bib21))表明,语码转换的红队测试查询可以比单语言攻击更有效地引发不安全行为,他们引入了一个合成框架(CSRT)来大规模生成此类查询。作为补充,Upadhayay和Behzadan(2024(https://arxiv.org/html/2606.25380#bib.bib3))提出了**三明治攻击**,这是一种多语言混合提示,通过跨语言交错良性和对抗性片段,在黑盒环境下诱导有害续写。 ### 2.2 多语言红队测试 红队测试通过大规模生成对抗性提示和对话来操作化这些维度,其中包括那些在英语中心策略下可能未被捕捉到危害性的特定文化提示。早期工作确立了人工和语言模型辅助的红队测试方法论(Perez等,2022(https://arxiv.org/html/2606.25380#bib.bib5);Zhuo等,2023(https://arxiv.org/html/2606.25380#bib.bib36))。最近的多语言扩展明确针对多语言能力包络:CSRT生成语码转换攻击(Yoo等,2025(https://arxiv.org/html/2606.25380#bib.bib21));Rainbow Teaming产生多样化的开放式对抗性提示,并已被复制/扩展至波兰语作为具体的非英语安全压力测试(Samvelyan等,2024(https://arxiv.org/html/2606.25380#bib.bib6);Krasnodębska等,2025(https://arxiv.org/html/2606.25380#bib.bib7));而MM-ART自动化了**多轮、多语言**红队测试,结果显示脆弱性随对话长度急剧增加,且被单轮英语评估严重低估(Singhania等,2025(https://arxiv.org/html/2606.25380#bib.bib4))。 ### 2.3 部署后适应攻击 #### 跨语言微调攻击。 对齐后的多语言模型经常在部署后通过SFT/PEFT进行定制,这创造了适应期的攻击面,安全行为可能随语言和本地规范发生变化。Poppi等人(2025(https://arxiv.org/html/2606.25380#bib.bib23))表明,在**一种**语言上使用少量有毒数据集进行微调,可以导致**其他**语言的安全全面崩溃(跨语言攻击迁移)。他们的安全信息定位(SIL)分析表明,安全相关参数部分是与语言无关的,这使得稀疏更新能够引发多语言失败。 #### 通过新语言学习的越狱。 即使是良性适应也可能带来风险:Upadhayay和Behzadan(2025(https://arxiv.org/html/2606.25380#bib.bib19))表明,使用LoRA微调学习一种低资源语言——即便没有有害数据——仍可能降低拒绝行为,这意味着多语言扩展本身可能破坏安全保证。因此,多语言去毒化方法不仅应在单语言英语提示上评估,还应在多语言操作符组合(翻译/枢纽、语码转换、混合提示、音译)、多轮交互以及部署后适应压力测试下评估。上述威胁模型激发了接下来讨论的任务设定、数据集和指标。 ## 3 任务设定:数据集与指标 ### 3.1 数据集 毒性数据集大致可分为三类任务,每类对应一个不同的评估目标: **有毒到中性改写。** ParaDetox(Logacheva等,2022(https://arxiv.org/html/2606.25380#bib.bib54))引入了超过1万对英语有毒→中性改写对。后续工作探索了用于去毒化的跨语言迁移(Moskovskiy等,2022(https://arxiv.org/html/2606.25380#bib.bib135);Dementieva等,2023(https://arxiv.org/html/2606.25380#bib.bib24)),添加了印地语评估集(Mukherjee等,2023(https://arxiv.org/html/2606.25380#bib.bib93)),并在MultiParaDetox中将ParaDetox收集流程扩展至俄语、乌克兰语和西班牙语(Dementieva等,2024a(https://arxiv.org/html/2606.25380#bib.bib25))。TextDetox/PAN 2024共享任务及其COLING扩展将平行去毒化设置拓宽至9种语言:英语、西班牙语、德语、中文、阿拉伯语、印地语、乌克兰语、俄语和阿姆哈拉语(Dementieva等,2024b(https://arxiv.org/html/2606.25380#bib.bib94),2025(https://arxiv.org/html/2606.25380#bib.bib1))。SynthDetox-M(Moskovskiy等,2025(https://arxiv.org/html/2606.25380#bib.bib82),2024(https://arxiv.org/html/2606.25380#bib.bib113))通过少样本LLM提示,为德语、法语、西班牙语和俄语增加了1.6万对高质量合成改写对。APPDIA(Atwell等,2022(https://arxiv.org/html/2606.25380#bib.bib79))和CAPP(Som等,2024(https://arxiv.org/html/2606.25380#bib.bib95))提供了话语或对话级(未完待续,原文在此处截断)
相似文章
大型语言模型中的毒性测量与缓解:一项全面的复制研究
这项复制研究评估了DExperts在缓解LLM毒性方面的效果,发现其对显式毒性几乎完美安全,但对隐式仇恨言论效果降低,并且存在显著的延迟权衡。
超越全球规范:无需重新训练的语言模型毒性敏感性个性化
本文首次对推理时无需训练的语言模型毒性敏感性个性化方法进行了比较评估,显示所有方法均能将对齐错误减少28-47%,但揭示了对齐效果、个性化与语言质量之间的权衡。
大型音频语言模型综述:泛化、可信度与展望
一篇全面综述,回顾了大型音频语言模型(LALMs)的可信度挑战,包括跨模态越狱和声学后门等漏洞,并提出了纵深防御路线图。
更难防御:面向中文的通过隐式增强与混淆重写实现的毒性攻击
本文提出了CITA框架,用于生成中文隐式毒性攻击,以评估和改进大语言模型的毒性检测器,在测试模型上实现了较高的攻击成功率。
PSK@EEUCA 2026:利用合成数据增强微调大型语言模型以检测游戏聊天中的多类毒性
本文介绍了一个用于 EEUCA 2026 游戏聊天毒性检测共享任务的系统,该系统通过结合合成数据增强微调 Llama 3.1 8B 模型,获得了第四名。文章重点阐述了一种“验证陷阱”现象:由于数据分布偏移,较高的验证分数与测试集表现并不相关。