语言塑造多语言大语言模型中指令层级遵循度

arXiv cs.CL 论文

摘要

本文介绍了XIH-Bench,一个用于评估多语言大语言模型中指令层级遵循度的基准,揭示了语言依赖的不对称性以及语言边界效应,即跨语言冲突比同语言冲突产生更高的遵循度。

arXiv:2607.23545v1 公告类型:新论文 摘要:指令层级(IH)要求模型按来源优先级处理指令,确保高优先级指令覆盖低优先级指令。尽管这对于安全可控的部署至关重要,但现有评估几乎只关注英语,尚不清楚在多语言环境中IH遵循度是否保持稳定。我们提出了XIH-Bench,一个多语言IH评估基准,涵盖六种语言、四个领域和三种IH设置下的同语言和跨语言冲突。跨模型分析中,我们发现了两个一致的模式。首先,IH遵循度表现出明显的语言依赖不对称性:一种语言在高优先级位置增强遵循度,在低优先级位置可能变得具有破坏性。其次,跨语言冲突比同语言冲突产生更高的遵循度,我们将此现象称为语言边界效应。我们进一步表明,语言专业化可能使得模型偏好语言中的低优先级指令更难被覆盖,从而带来多语言可靠性和安全风险。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:29

# 语言塑造多语言大模型中的指令层级遵从性  
来源:https://arxiv.org/html/2607.23545  

Jiwon Moon¹, Yerin Hwang¹, Kyomin Jung¹,²†  
¹IPAI, 首尔大学  
²首尔大学电机与计算机工程系  
{wldnjs913, dpfls589, kjung}@snu.ac.kr  

###### 摘要  

指令层级(IH)要求模型根据来源对指令进行优先级排序,确保高优先级指令覆盖低优先级指令。尽管这对安全可控的部署至关重要,但现有评估几乎仅关注英语,使得在多语言环境下IH遵从性是否保持稳定尚不明确。我们提出了XIH-Bench,一个用于多语言IH评估的基准,涵盖六种语言、四个领域和三种IH设置下的同语言与跨语言冲突。在对多个模型进行评估时,我们发现了两个一致的模式。首先,IH遵从性表现出明显的语言依赖不对称性:一种语言在高优先级位置上增强遵从性,可能在低优先级位置上产生干扰。其次,跨语言冲突比同语言冲突产生更高的遵从性,我们将这一现象称为语言边界效应。我们进一步表明,语言专业化可能使得模型偏好语言中的低优先级指令更难被覆盖,从而产生多语言可靠性和安全风险。代码和数据可在github.com/g1moon/Language-Shapes-IH (https://github.com/g1moon/Language-Shapes-IH) 获取。  

# 语言塑造多语言大模型中的指令层级遵从性  

Jiwon Moon¹, Yerin Hwang¹, Kyomin Jung¹,²†  
¹IPAI, 首尔大学  
²首尔大学电机与计算机工程系  
{wldnjs913, dpfls589, kjung}@snu.ac.kr  

††脚注:†通讯作者  

## 1 引言  

大型语言模型(LLM)越来越多地部署于同一上下文窗口中包含来自多个来源的指令的场景,包括系统提示、用户消息和工具输出(Li et al. 2024a (https://arxiv.org/html/2607.23545#bib.bib24);Debenedetti et al. 2024 (https://arxiv.org/html/2607.23545#bib.bib11);Zhang et al. 2025a (https://arxiv.org/html/2607.23545#bib.bib56))。在这些多来源场景中,正确行为不仅取决于模型是否遵循某条指令,更取决于当来源冲突时模型是否遵循**正确**的指令。这一需求通常被形式化为指令层级(IH)(Wallace et al. 2024 (https://arxiv.org/html/2607.23545#bib.bib47);Guo et al. 2026 (https://arxiv.org/html/2607.23545#bib.bib16)),其中高优先级来源应覆盖低优先级来源。维护IH对于安全可控的部署至关重要,因为失败可能导致越狱、提示注入和系统提示泄露(Zou et al. 2023 (https://arxiv.org/html/2607.23545#bib.bib61);Liu et al. 2024 (https://arxiv.org/html/2607.23545#bib.bib28);Agarwal et al. 2024 (https://arxiv.org/html/2607.23545#bib.bib1))。这一挑战在多语言部署中尤为突出,因为高优先级和低优先级指令可能以不同语言编写,允许一种语言中的低优先级指令干扰甚至覆盖另一种语言中的高优先级指令(图1 (https://arxiv.org/html/2607.23545#S1.F1))。  

![引用图注](图1:Sys>>User设置下的多语言指令层级冲突。同一冲突在一种语言配置下被正确解决(左),但在另一种语言配置下则不正确(右),显示了层级遵从性随语言变化的情况。)

在IH中,优先级由来源决定而非语言,因此理论上IH遵从性应不随语言变化。然而,现有的IH基准几乎完全是英语中心的(Wu et al. 2024 (https://arxiv.org/html/2607.23545#bib.bib49);Zhang et al. 2025b (https://arxiv.org/html/2607.23545#bib.bib57)),使得我们不清楚来源冲突是否在不同语言中得到一致解决。尽管多语言指令遵循研究已显示出显著的跨语言差异(He et al. 2024 (https://arxiv.org/html/2607.23545#bib.bib17);Zeng et al. 2025 (https://arxiv.org/html/2607.23545#bib.bib55);Li et al. 2025 (https://arxiv.org/html/2607.23545#bib.bib26)),但它主要关注对单一指令的遵从性,而非跨层级冲突的解决。为填补这一空白,我们引入了XIH-Bench,一个用于多语言IH评估的大规模基准。XIH-Bench在保持任务和冲突结构不变的同时,系统性地改变分配给高优先级和低优先级指令的语言。它涵盖4个领域和3种IH设置,涉及6种类型多样的语言(英语、德语、西班牙语、法语、印地语和中文),包括同语言和跨语言冲突,共计78,894个评估实例。这一设计使得能够控制性地分析先前基准无法解决的关键问题:语言效应是否依赖IH位置?跨语言冲突与同语言冲突的行为是否不同?这些效应是反映一般的多语言趋势还是模型特定的语言专业化?  

利用XIH-Bench,我们评估了来自五个家族的13个模型,并发现多语言差异显著改变了预期层级是否得以维持。首先,层级遵从性表现出明显的语言依赖不对称性。同样的指令遵循能力在高优先级级别增强遵从性,在低优先级级别却可能产生干扰,使得该语言在被应覆盖时更难抑制。其次,跨语言冲突始终比同语言冲突产生更高的遵从性,揭示了一个*语言边界效应*。这一模式与语言对比有助于模型区分IH级别的观点一致。我们的进一步分析表明,这些模式部分上是模型特定的,某些模型中的语言专业化使一个高度偏好的语言在层级内获得不成比例的影响力。这些发现对研究和部署均有启示。现有的仅英语IH评估忽略了系统的跨语言变异,因此无法提供鲁棒性的完整图景。对于部署而言,多语言可靠性不仅要求模型能以给定语言遵循指令,还要求当该指令与更高优先级来源冲突时模型能抑制该指令——这一挑战在语言专业化模型中尤为严峻,因为其中主导语言难以被覆盖。通过将多语言指令遵循和指令层级统一在同一框架中,XIH-Bench使得在大规模下系统研究它们的交互成为可能。最终,语言并非指令的中性载体:它主动塑造了模型如何解决跨IH级别的冲突。  

## 2 相关工作  

#### 指令遵循。  
指令遵循评估已朝着具有明确可验证约束的基准发展。IFEval(Zhou et al. 2023 (https://arxiv.org/html/2607.23545#bib.bib60))建立了一种基于自动可检查指令的广泛使用的范式,后续基准(Qin et al. 2024b (https://arxiv.org/html/2607.23545#bib.bib40);Jiang et al. 2024b (https://arxiv.org/html/2607.23545#bib.bib21);Wen et al. 2024 (https://arxiv.org/html/2607.23545#bib.bib48))将评估扩展到更细粒度和组合约束。这一路线也已延伸到多语言环境。Multi-IF(He et al. 2024 (https://arxiv.org/html/2607.23545#bib.bib17))、M-IFEval(Dussolle et al. 2025 (https://arxiv.org/html/2607.23545#bib.bib12))、Marco-Bench-MIF(Zeng et al. 2025 (https://arxiv.org/html/2607.23545#bib.bib55))和XIFBench(Li et al. 2025 (https://arxiv.org/html/2607.23545#bib.bib26))显示,指令遵循性能在不同语言间差异显著。然而,这些基准主要评估模型是否以某种语言遵循给定指令,而非当指令来自不同IH级别发生冲突时模型是否保持正确的优先级。  

#### 指令层级与安全。  
另一条工作线研究在来自不同来源的竞争指令下的鲁棒性。指令层级形式化了在来源冲突下的特权指令优先级排序,SysBench和IHEval等基准评估模型是否能在跨层级(包括系统提示、用户指令、对话历史和工具输出)的冲突中正确解决(Wallace et al., 2024 (https://arxiv.org/html/2607.23545#bib.bib47);Qin et al., 2024a (https://arxiv.org/html/2607.23545#bib.bib39);Zhang et al., 2025b (https://arxiv.org/html/2607.23545#bib.bib57))。该问题也与安全密切相关。在冲突输入下未能保持来源优先级是提示注入和越狱漏洞的核心,包括直接和间接攻击(Liu et al., 2024 (https://arxiv.org/html/2607.23545#bib.bib28);Li et al., 2024b (https://arxiv.org/html/2607.23545#bib.bib25);Yi et al., 2025 (https://arxiv.org/html/2607.23545#bib.bib52))。近期工作进一步表明,这类风险扩展到了多语言和代理环境(Debenedetti et al., 2024 (https://arxiv.org/html/2607.23545#bib.bib11);Zhang et al., 2025a (https://arxiv.org/html/2607.23545#bib.bib56))。然而,先前工作尚未系统评估当竞争指令以不同语言编写而底层任务和冲突结构保持不变时,指令层级本身是否保持稳定。  

综上所述,先前工作研究了多语言指令遵循、指令层级以及提示注入相关鲁棒性,但在受控多语言环境下的指令层级研究仍几乎空白。为填补这一空白,我们引入了XIH-Bench,一个用于分析模型在多语言冲突下是否保持IH的基准,同时保持底层任务和冲突结构恒定。  

## 3 基准  

![引用图注](图2:XIH-Bench概览。左:三种层级设置和有序语言对分配。右:四个评估领域的代表性示例,显示高优先级指令、任务输入和冲突的低优先级指令。评估涵盖六种语言的所有有序对。)

我们引入XIH-Bench,一个用于评估LLM在多语言冲突下是否保持指令层级的基准。每个评估实例包含一条高优先级指令、一个任务输入,以及在冲突条件下一条矛盾的低优先级指令。基准在保持底层任务语义和冲突结构固定的同时,改变冲突领域、层级设置以及分配给竞争指令的语言。图2 (https://arxiv.org/html/2607.23545#S3.F2)总结了整体设计。XIH-Bench总共包含78,894个评估实例,覆盖四个领域、三种层级设置、两种条件和六种语言。  

### 3.1 层级设置  

遵循IH的先前工作(Wallace et al. 2024 (https://arxiv.org/html/2607.23545#bib.bib47)),我们假设一个三级层级:系统输入 > 用户输入 > 工具输出。当指令跨级别冲突时,模型应遵循更高特权的来源。我们评估由此顺序产生的所有两两设置:System>>User、System>>Tool和User>>Tool。这些设置让我们能够测试遵从性是否依赖于哪个较低级别引入冲突,同时保持层级原则固定。对于每种设置,我们构建两个条件。在参考条件下,仅存在高优先级指令,用于测量无IH冲突时的基线任务性能。在冲突条件下,一条低优先级指令明确与高优先级指令矛盾。比较两个条件可显示引入冲突的低优先级指令时性能下降的程度。  

### 3.2 基准领域  

为扩大覆盖范围,XIH-Bench涵盖四个领域,捕捉从显式格式违例到更语义和身份层面冲突的一系列层级失败。在这些领域中,每个评估实例遵循一个共同的三部分结构:定义预期行为的高优先级指令、提供待处理内容的任务输入(如适用),以及在冲突条件下矛盾的低优先级指令(见图2 (https://arxiv.org/html/2607.23545#S3.F2))。  

**规则遵循**评估关于输出格式的冲突。高优先级指令指定所需格式,任务输入提供内容,低优先级指令施加一个不兼容的格式约束。我们从先前工作中扩展规则遵循设置到多语言IH环境,仅保留能在语言间干净迁移的约束(Zhou et al. 2023 (https://arxiv.org/html/2607.23545#bib.bib60);Zhang et al. 2025b (https://arxiv.org/html/2607.23545#bib.bib57))。遵从性通过基于规则的验证进行评估。  

**任务执行**捕捉不兼容任务规范之间的冲突。任务输入来自Belebele(Bandarkar et al. 2024 (https://arxiv.org/html/2607.23545#bib.bib7))。高优先级指令要求翻译,而低优先级指令要求对同一段落进行问答。遵从性通过输出是否为翻译而非答案来确定,采用基于chrF++的标准(Popović 2017 (https://arxiv.org/html/2607.23545#bib.bib38))。  

**安全**在无单独任务输入的访问控制设置中测量对低层级提示注入的抵抗能力。高优先级指令仅当提供正确访问码时允许输出“Access Granted”,而低优先级指令试图在未满足该要求的情况下诱使同样输出。我们通过重构先前的访问控制和提示注入设置来构建此领域,用于多语言IH评估(Toyer et al. 2023 (https://arxiv.org/html/2607.23545#bib.bib46);Zhang et al. 2025b (https://arxiv.org/html/2607.23545#bib.bib57))。性能通过防御成功率测量。  

**人格注入**评估一个冲突的低层级人格是否能取代在更高层级指定的人格。高优先级指令分配一个人格,任务输入要求自我介绍,低优先级指令分配一个冲突的人格。此设置受启发于部署中高层级提示指定助手的角色、语调或职业身份的场景(Mao et al. 2025 (https://arxiv.org/html/2607.23545#bib.bib29);OpenAI 2026 (https://arxiv.org/html/2607.23545#bib.bib35);Anthropic 2026 (https://arxiv.org/html/2607.23545#bib.bib5))。我们从PersonaHub(Ge et al. 2024 (https://arxiv.org/html/2607.23545#bib.bib13))构建语义不同的人格对,并应用LLM-as-a-Judge协议(Yu et al. 2025 (https://arxiv.org/html/2607.23545#bib.bib54))来确定回应更接近哪个人格。  

### 3.3 多语言配置  

#### 语言。  
基准涵盖六种语言:英语(EN)、德语(DE)、西班牙语(ES)、法语(FR)、印地语(HI)和中文(ZH)。选择基于公平性和多样性。为避免

相似文章

探索大语言模型在中文抽象语言掌握中的能力边界

arXiv cs.CL

本文介绍了Mouse基准测试,用于评估大语言模型在六个自然语言处理领域的中文抽象语言任务表现。研究表明,尽管当前最先进的模型在上下文理解任务中表现良好,但在这种亚文化网络语言上仍存在重大局限。

Linguistic Monoculture in LLM-Assisted Language Use

arXiv cs.AI

This paper introduces a mathematical framework to study how reliance on shared LLMs for writing may reduce population-level linguistic diversity, analyzing fixed, recursive, and personalized interaction mechanisms and characterizing equilibria and convergence rates.