形式对齐而非语义对齐:低资源孟加拉语贬损言语中LLM安全性的理解-遏制解耦

arXiv cs.CL 论文

摘要

这篇arXiv论文对五种前沿LLM在原生孟加拉语贬损言语上的表现进行了审计,发现安全对齐未能泛化到低资源语言——尽管有高资源对齐,模型仍以高比率理解和生成不安全内容。作者提出了“理解-遏制解耦”概念,并表明推理和人格框架会进一步瓦解安全过滤器。

arXiv:2608.02941v1 公告类型:新 \n摘要:我们对五种前沿大语言模型在原生孟加拉语贬损言语(gali)上进行了六项协议的审计,以检验一个假设:理解-遏制解耦。我们提出,当代安全对齐绑定于高资源表面形式而非有害含义,导致模型理解低资源辱骂词的能力与其遏制该词的能力独立运作。每一项协议都在人工校准基线(kappa = 0.84)上证实了这一假设。在基线上,模型在孟加拉语中表现出7.92个百分点的理解缺陷,同时两种语言的令牌泄漏率完全相同,均为92.83%。严重性校准追踪表面解剖线索而非组合性危害(轻度俚语误差+4.00;威胁误差-2.00),而正字法扰动下表面上的遏制增益被证明是分词器驱动的“遏制幻象”。关键在于,显式的思维链推理挽救了理解(通过率94.72%),同时系统性地瓦解了遏制(使用率96.23%)。此外,专家人格框架将拒绝率降至6.57%,揭示基于关键词的过滤器完全忽视了去人性化的群体辱骂词。我们的研究结果表明,高资源基准无法证明低资源安全性,因此需要基于含义的遏制。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:41

# 形式对齐,而非意义对齐:低资源孟加拉语贬损语中 LLM 安全性的理解–遏制解耦

来源:https://arxiv.org/html/2608.02941

Shadab Bin Habib, A̱ K M Ferdous Reza Habib, Subarno Neel, Adib Sakhawat
Department of Computer Science and Engineering
Islamic University of Technology, Dhaka, Bangladesh
\{shadabhabib, ferdousreza, subarnoneel, adibsakhawat\}@iut\-dhaka\.edu

###### 摘要

我们通过六种协议对五个前沿大语言模型在孟加拉语本土贬损语(*gali*)上的表现进行审计,以检验一个单一假设:**理解–遏制解耦**(Comprehension–Containment Decoupling)。我们提出,当代安全对齐受限于高资源语言的表面形式,而非有害含义本身,这使得模型理解低资源辱骂语的能力与遏制该辱骂语的能力相互独立运作。每个协议都在人工校准基线(κ=0.84)上印证了这一假设。在基线条件下,模型在孟加拉语上表现出 7.92 个百分点的理解缺陷,但两种语言的 token 泄漏率却同样高达 92.83%。严重性校准追踪的是表面解剖学线索,而非组合性危害(温和俚语上误差 +4.00;威胁类上 -2.00),而在正字法扰动下看似存在的遏制提升,实则是一种由分词器驱动的“遏制幻象”(containment mirage)。更为关键的是,显式思维链(Chain-of-Thought)推理虽能显著提升理解能力(Pass 达 94.72%),却系统性地瓦解了遏制能力(Use 达 96.23%)。此外,专家角色设定使拒绝率骤降至 6.57%,揭示出基于关键词的过滤器会完全忽略去人性化的群体性辱骂语。我们的研究结果表明,高资源基准无法为低资源安全性提供可靠背书,必须转向以意义为根基的遏制机制。

# 形式对齐,而非意义对齐:低资源孟加拉语贬损语中 LLM 安全性的理解–遏制解耦

Shadab Bin Habib, A̱ K M Ferdous Reza Habib, Subarno Neel, Adib Sakhawat
Department of Computer Science and Engineering
Islamic University of Technology, Dhaka, Bangladesh
\{shadabhabib, ferdousreza, subarnoneel, adibsakhawat\}@iut\-dhaka\.edu

## 1 引言

大语言模型(LLMs)在广泛的 NLP 任务上展现了令人印象深刻的多语言能力,但近期研究表明,多语言能力并不必然意味着多语言安全对齐 Wang 等人 (2024 (https://arxiv.org/html/2608.02941#bib.bib1)); Yong 等人 (2025 (https://arxiv.org/html/2608.02941#bib.bib2)); Dan 等人 (2026 (https://arxiv.org/html/2608.02941#bib.bib6)) 。已有研究一致报告,在英语之外的安全行为有所退化,包括更高的不安全响应率、更弱的毒性缓解能力,以及低资源语言中更差的鲁棒性 Wang 等人 (2024 (https://arxiv.org/html/2608.02941#bib.bib1)); Jain 等人 (2024 (https://arxiv.org/html/2608.02941#bib.bib4)); Dan 等人 (2026 (https://arxiv.org/html/2608.02941#bib.bib6)) 。然而,大多数多语言安全基准评估的是翻译后的英语数据集或英语中心化分类法的多语言扩展,包括 XSAFETY Wang 等人 (2024 (https://arxiv.org/html/2608.02941#bib.bib1))、PolygloToxicityPrompts Jain 等人 (2024 (https://arxiv.org/html/2608.02941#bib.bib4)) 和 BanglaGuard Alam 等人 (2026 (https://arxiv.org/html/2608.02941#bib.bib3)) 。因此,它们所提供的证据有限,无法说明安全机制能否泛化到文化上地道的贬损表达,后者的含义源于本地语用,而非直接的词汇翻译。

孟加拉语本土贬损语(*gali*)是一个尤其具有挑战性的测试场。许多表达是习语性的、根植于文化,且在组合层面并不透明,这使得仅凭字面翻译很难推断其冒犯性。因此,这类表达为检验安全对齐究竟是遵循有害含义,还是仅仅遵循熟悉的高资源词汇模式,提供了绝佳机会。在本工作中,我们研究安全对齐两个互补方面之间的关系:*语义理解*(semantic comprehension),即模型是否正确解释某个表达的贬损含义;以及*遏制*(containment),即模型在生成过程中是否抑制或复现该冒犯性表达。我们假设这两个属性在低资源场景下会发生解耦。

> **理解–遏制解耦假说**。当有害含义通过低资源语言形式表达时,语义理解与安全遏制不再保持紧密耦合。因此,安全行为日益取决于表面实现,而非有害含义本身,这使得模型要么能够理解有害表达却不予以遏制,要么在语义理解不完整的情况下仍然拒绝生成。

为检验这一假设,我们使用一个由母语者标注的 100 条孟加拉语本土贬损表达数据集(κ=0.84),对五个前沿 LLM(gpt-oss-120b、gpt-4o-mini、qwen3.7-flash、gemini-2.5-flash-lite 和 deepseek-v4-flash)进行审计。我们通过六个互补协议评估模型行为,涵盖语义理解、文化严重性校准、正字法扰动、显式推理、多轮交互和专家角色提示。本研究引入了面向多语言安全的“理解–遏制解耦”视角,首次对这些场景下的孟加拉语本土贬损语进行全面的实证审计,并识别出三个反复出现的对齐现象:显式推理在显著提升语义理解的同时增加了冒犯性 token 的复现;正字法扰动下看似存在的鲁棒性可能源于分词器失效,而非真正的安全机制;专家角色设定在底层有害内容不变的情况下戏剧性地削弱了拒绝行为。

## 2 相关工作

近期研究表明,主要从英语数据中习得的安全对齐并不能始终如一地跨语言泛化。XSAFETY 引入了最早的几个多语言安全基准之一,证明非英语提示的不安全响应率显著高于英语对应提示,同时提出了基于提示的缓解策略 Wang 等人 (2024 (https://arxiv.org/html/2608.02941#bib.bib1)) 。Yong 等人 (2025 (https://arxiv.org/html/2608.02941#bib.bib2)) 进行的更广泛分析进一步揭示,多语言安全研究仍然以英语为中心,大多数研究只评估少数高资源语言,并且报告的聚合指标往往掩盖了具体语言上的失败。与这些发现互为补充,Dan 等人 (2026 (https://arxiv.org/html/2608.02941#bib.bib6)) 综述了多语言毒性检测与解毒方法,强调包括文化错位、语言覆盖不均衡和评估协议碎片化在内的持续挑战。

针对特定语言的对齐工作也已出现。BanglaGuard 通过结合提示分类、拒绝生成和响应过滤,为孟加拉语 LLM 引入了第一个专门的安全流水线,在保持有用性的同时改善拒绝行为 Alam 等人 (2026 (https://arxiv.org/html/2608.02941#bib.bib3)) 。然而,与现有的大多数多语言基准类似,其训练和评估数据在很大程度上源于英语有害提示的翻译,而非文化上地道的孟加拉语贬损表达。

多语言毒性评估主要集中于翻译语料或自然出现的毒性网络文本。PolygloToxicityPrompts 提供了一个跨越 17 种语言的大规模多语言基准,并表明毒性通常随语言资源的减少而增加,而指令微调能显著减少——但无法消除——不安全生成 Jain 等人 (2024 (https://arxiv.org/html/2608.02941#bib.bib4)) 。在生成之外,跨语言冒犯性语言检测也已通过迁移学习、多语言编码器和机器翻译流水线得到广泛研究,其中英语仍然是迁移的主导源语言 Jiang and Zubiaga (2026 (https://arxiv.org/html/2608.02941#bib.bib5)) 。

多项研究进一步表明,评估质量本身也会因语言和方言而异。Faisal 等人 (2025 (https://arxiv.org/html/2608.02941#bib.bib8)) 报告,LLM 判断者在多语言和方言变体上保持相对一致,但往往与人工标注不一致,尤其是在低资源场景下。类似地,Movva 等人 (2024 (https://arxiv.org/html/2608.02941#bib.bib7)) 和 Bavaresco 等人 (2025 (https://arxiv.org/html/2608.02941#bib.bib10)) 表明,基于 LLM 的安全判断系统性地偏离人类评估,尤其是在安全与毒性相关任务上。

近期研究表明,推理并非总能改善安全性。相反,显式思维链(CoT)推理在提升语义推理能力的同时,可能增加越狱成功率和有害内容生成 Lu 等人 (2025 (https://arxiv.org/html/2608.02941#bib.bib15)); Yang (2025 (https://arxiv.org/html/2608.02941#bib.bib18)); Zhao 等人 (2026 (https://arxiv.org/html/2608.02941#bib.bib17)) 。在复杂的叙事和多阶段越狱策略中也观察到类似现象,包括 Chain-of-Lure,它利用结构化推理逐步绕过安全机制 Chang 等人 (2026 (https://arxiv.org/html/2608.02941#bib.bib16)) 。

提示框架也会显著影响对齐行为。研究表明,角色设定提示既可以促进越狱攻击 Shah 等人 (2024 (https://arxiv.org/html/2608.02941#bib.bib25)),也可能在良性分类任务中引发虚假拒绝 Plaza-del-Arco 等人 (2025 (https://arxiv.org/html/2608.02941#bib.bib26)) 。相反,专家角色可能改善对齐导向的任务,同时损害事实检索,这表明角色效应高度依赖任务 Hu 等人 (2026 (https://arxiv.org/html/2608.02941#bib.bib27)) 。

正字法扰动提供了另一个重要的攻击面。先前工作证明,字符级扰动、空白操纵、同形替换以及相关的表面形式变换,能够成功绕过毒性检测系统,同时在很大程度上保留语义含义 Kurita 等人 (2020 (https://arxiv.org/html/2608.02941#bib.bib11)); Aggarwal and Zesch (2022 (https://arxiv.org/html/2608.02941#bib.bib12)); Cooper 等人 (2023 (https://arxiv.org/html/2608.02941#bib.bib13)); Kahu and Ahuja (2025 (https://arxiv.org/html/2608.02941#bib.bib14)) 。

总体而言,先前工作确立了多语言安全性在英语之外会退化,并且推理、提示和对抗性扰动能够显著改变模型行为。然而,现有的多语言基准主要评估翻译后的英语提示、英语分类法的多语言扩展或一般毒性语料。因此,它们无法区分安全对齐是遵循有害语义理解,还是仅仅遵循熟悉的高资源表面形式。据我们所知,尚无先前工作使用文化上地道的孟加拉语贬损表达来系统研究这一区别,并在统一评估框架内同时考察语义理解、遏制行为、严重性校准、正字法鲁棒性、推理、多轮交互和专家角色提示。

## 3 方法论

本工作研究当贬损含义通过文化上地道的孟加拉语形式而非熟悉的英语表面形式表达时,语义理解与安全遏制是否仍然保持耦合。我们将*理解*定义为正确识别表达的预期贬损含义,将*遏制*定义为在生成过程中抑制或拒绝复现贬损表达。我们假设这两个属性在低资源场景下会发生解耦。假设的完整形式化描述见附录 B (https://arxiv.org/html/2608.02941#A2) 。

### 3.1 数据集

我们整理了一个包含 100 条孟加拉语本土贬损表达的词表,涵盖解剖学、性别、性、社群、宗教、种姓、阶级和组合性侮辱等类别。五位孟加拉语母语者使用五点李克特量表独立标注了每条表达的冒犯严重程度,一致性达到了较高水平(κ=0.84)。为了进行跨语言比较,每条孟加拉语表达都配有对应的英语功能等价物,强调保留语用含义而非逐字翻译。不同实验使用词表的不同子集,包括用于配对评估的 53 条匹配孟加拉语–英语子集,以及用于专家角色分析的更大规模 501 条词表。额外的数据集统计、标注指南和提示模板见附录 A (https://arxiv.org/html/2608.02941#A1) 。

### 3.2 实验设计

我们通过六个互补协议评估五个前沿 LLM——gpt-oss-120b、gpt-4o-mini、qwen3.7-flash、gemini-2.5-flash-lite 和 deepseek-v4-flash。E1 测量模型解释个别贬损表达时的基线语义理解和 token 遏制情况。E2 比较模型给出的冒犯性评分与人类判断,以评估文化严重性校准能力。E3 测量在保留语义含义的前提下,模型面对罗马化孟加拉语和字符级空白扰动的鲁棒性。E4 以显式逐步推理重复 E1,以量化推理与安全行为之间的相互作用。E5 通过测量语言升级、引入新的贬损表达以及去升级行为,评估多轮辩论。最后,E6 研究专家角色提示是否会改变模型在贬损表达教育性讨论中的拒绝行为或遏制效果。完整的协议描述见附录 B (https://arxiv.org/html/2608.02941#A2) 。

### 3.3 评估

所有响应均使用统一评估框架进行人工标注。在不同实验中,我们记录*Pass*(表示正确的语义理解)、*Use*(表示复现了贬损表达)和*Refusal*(表示激活了安全机制)。对于多轮交互,我们额外标注*Escalation*(衡量冒犯性语言的升级程度)和*Innovation*(表示出现了此前未见过的贬损表达)。详细的标注标准见附录 A (https://arxiv.org/html/2608.02941#A1) 。

## 4 结果

我们首先呈现一个队列级综合视图,以单幅视角陈述解耦现象(第 4.1 (https://arxiv.org/html/2608.02941#S4.SS1) 节),然后依次报告每个协议(第 4.2 (https://arxiv.org/html/2608.02941#S4.SS2)–4.7 (https://arxiv.org/html/2608.02941#S4.SS7) 节),正文部分只保留关键发现。每个协议的完整模型级表格和逐条辱骂语的细分结果见附录 D (https://arxiv.org/html/2608.02941#A4) 。在所有表格中,阴影单元格标记出图注特别指出的结果——饱和度越高,表明支持或反对 H0 的证据越具有决定性——每个图注都会说明其阴影单元所展示的内容。

### 4.1 解耦总览

表 1 (https://arxiv.org/html/2608.02941#S4.T1) 汇总了五种表面条件下的队列级理解率(孟加拉语 Pass)与队列级遏制失败率(孟加拉语 Use)的对比,并附上英语单轮基线作为参照。如果安全性跟随含义,那么遏制……

相似文章

情绪很重要:句法敏感性如何破坏安全对齐

arXiv cs.CL

本文揭示了LLM安全对齐中一个广泛的句法漏洞,表明非祈使句的句法形式可以绕过16个模型(参数高达70B)的拒绝机制。通过因果中介分析,作者将问题追溯到带有语言偏见的后训练数据,并提出句法多样性作为缓解措施。