多语言语言模型中语言控制的潜在机制
摘要
本文比较了三种方法,用于识别多语言语言模型中的语言控制潜在因子,以应对语码转换。实验在Gemma-2-2B和Qwen3-4B上进行,结果显示FreqSel最为有效。
arXiv:2609.00325v1 公告类型:新
摘要:多语言大型语言模型可能表现出无意中的语码转换——在生成过程中不必要地切换语言。我们提出了一项比较研究,涉及三种识别跨层转码器中语言控制潜在因子的方法:基于激活值的选择(ValSel)、基于激活频率的选择(FreqSel)和基于LLM生成的潜在注释的选择(AnnSel)。为评估这些方法在识别语言控制潜在因子方面的有效性,我们引入了两个表现出语码转换的多语言基准测试,用于跨七种语言的语言引导细粒度分析。通过对Gemma-2-2B和Qwen3-4B的针对性干预实验,我们发现所有三种方法都能有效操控生成语言,其中FreqSel取得最强的整体性能,而AnnSel通过显式语言注释提供了可解释的潜在选择。消融分析表明,这些方法选择的是非重叠但各自功能的潜在子集,表明存在冗余而非单一规范语言方向。代码和数据可在 https://github.com/rm-3284/Latent-Mechanism-Multilingual 找到。
查看缓存全文
缓存时间: 2026/09/02 05:49
# 多语言语言模型中的语言控制潜在机制 来源:https://arxiv.org/html/2609.00325 Ryo Mitsuhashi††注:第一作者在本研究进行时为卡塔尔计算研究所实习生。Sabri Boughorbel所属机构:沙特阿拉伯利雅得阿卜杜勒阿齐兹国王大学Majd Hawasly所属机构:卡塔尔多哈哈马德·本·哈利法大学卡塔尔计算研究所 邮箱:[[email protected]](mailto:) ###### 摘要 多语言大型语言模型可能出现非预期的代码切换——即在生成过程中不必要的语言交替。本文对三种在跨层转换器中识别语言控制潜在变量的方法进行了比较研究:基于激活值的选择(ValSel)、基于激活频率的选择(FreqSel)以及基于大语言模型生成的潜在标注的选择(AnnSel)。为了评估这些方法在识别语言控制潜在变量方面的有效性,我们引入了两个展示代码切换现象的多语言基准测试,以便对七种语言的语言引导进行细粒度分析。通过对Gemma-2-2B和Qwen3-4B进行针对性干预实验,我们发现所有三种方法都能有效操纵生成语言,其中FreqSel在整体性能上表现最强,而AnnSel通过显式语言标注提供了可解释的潜在变量选择。一项消融分析表明,这些方法选择的是非重叠但各自功能独立的潜在变量子集,表明存在冗余而非单一的语言控制方向。代码和数据可在https://github.com/rm-3284/Latent-Mechanism-Multilingual找到。 ## 1引言 大型语言模型已展现出显著的多语言能力,但这种灵活性也带来了一个非预期的后果:代码切换,即模型在生成过程中不适当地在不同语言间切换(Marchisio等人,2024 (https://arxiv.org/html/2609.00325#bib.bib12))。这一问题促使了在DeepSeek-R1等模型训练中引入显式语言一致性奖励(DeepSeek-AI等人,2025 (https://arxiv.org/html/2609.00325#bib.bib5))。 近期的机制可解释性研究已发现能够因果性地影响输出语言的神经元和潜在变量(Tang等人,2024 (https://arxiv.org/html/2609.00325#bib.bib14);Deng等人,2025 (https://arxiv.org/html/2609.00325#bib.bib6)),这表明针对性的干预可能在生成中提供细粒度的语言控制。然而,据我们所知,目前尚未存在关于语言控制机制发现的系统比较,且尚不清楚不同方法是否揭示相同的底层潜在变量或冗余表示。 我们比较了三种在跨层转换器(CLTs)中识别特定语言潜在变量的方法(Ameisen等人,2025 (https://arxiv.org/html/2609.00325#bib.bib1)):基于激活值差异的ValSel(Deng等人,2025 (https://arxiv.org/html/2609.00325#bib.bib6));基于特定语言激活频率的FreqSel(Andrylie等人,2025 (https://arxiv.org/html/2609.00325#bib.bib2));以及利用大语言模型生成的标注来寻找潜在变量的AnnSel,其描述明确指向从提取的电路图中获取的目标语言。与先前针对单层稀疏自编码器(SAEs)的工作不同,CLTs在所有层上提供了一个统一的稀疏字典,使得能够在潜在空间中对语言表示进行整体分析。 本工作的贡献包括:在受控环境中对语言引导潜在变量选择方法的比较研究;两个受控基准测试;对七种语言中干预机制有效性的分析;此外,我们还强调了两个模型家族中语言表示的潜在冗余性。 ## 2预备知识 ##### 语言控制的机制方法 先前的工作在多个抽象层次上研究了语言控制。在神经元层面,Tang等人(2024)(https://arxiv.org/html/2609.00325#bib.bib14)发现了语言神经元,选择性激活它们可以引导输出语言。在表示层面,Goncharov等人(2025)(https://arxiv.org/html/2609.00325#bib.bib7)通过PCA提取语言方向,使得可以通过方向消融进行引导。最近,稀疏自编码器(SAEs)通过学习单义特征的过完备稀疏基来解决多义性问题(Bricken等人,2023 (https://arxiv.org/html/2609.00325#bib.bib3)),已被应用于通过激活幅度(Deng等人,2025 (https://arxiv.org/html/2609.00325#bib.bib6))或频率模式(Andrylie等人,2025 (https://arxiv.org/html/2609.00325#bib.bib2))来隔离语言控制特征。 ##### 跨层转换器(CLTs) 扩展了SAEs,用一个联合训练的稀疏字典替换了所有层的MLP块(Ameisen等人,2025 (https://arxiv.org/html/2609.00325#bib.bib1)),能够捕获跨越模型深度的特征。在本文中,我们使用为Gemma-2-2B(Lieberum等人,2024 (https://arxiv.org/html/2609.00325#bib.bib11))和Qwen3-4B(Hanna,2025 (https://arxiv.org/html/2609.00325#bib.bib9))训练的CLTs。 ## 3通过潜在干预操纵生成语言 我们研究了三种特定语言的潜在变量选择方法,以及四种将生成引导至目标语言的潜在干预策略。 ### 3.1潜在变量选择方法 给定一个具有潜在空间$\mathcal{S}$的CLT和一组语言$L$,我们为语言$l \in L$识别一个与$l$生成特别相关的潜在变量子集$\mathcal{S}^{l} \subset \mathcal{S}$。我们基于激活幅度、激活频率和语义标注比较了三种选择标准。 #### 3.1.1基于值的选择(ValSel) 受Deng等人(2025)(https://arxiv.org/html/2609.00325#bib.bib6)启发,该方法识别那些对目标语言的激活幅度显著高于其他语言的潜在变量。对于一个潜在变量$s$和一个特定语言的语料库$D^{l}$,我们计算平均激活值: $\mu_{s}^{l} = \frac{1}{\|D^{l}\|} \sum_{t \in D^{l}} a_{s}(t) \quad (1)$ 其中$a_{s}(t)$表示潜在变量$s$在令牌$t$上的激活值。然后,潜在变量$s$针对语言$l$的$l$-单语性得分定义为: $v_{s}^{l} = \mu_{s}^{l} - \frac{1}{\|L\| - 1} \sum_{j \in L \setminus \{l\}} \mu_{s}^{j} \quad (2)$ 我们为每种语言$l$选择具有最高$l$-单语性得分的前$K$个潜在变量。 #### 3.1.2基于频率的选择(FreqSel) 依据Andrylie等人(2025)(https://arxiv.org/html/2609.00325#bib.bib2),该方法识别那些对特定语言激活更频繁的潜在变量。我们计算语言$l$中潜在变量$s$的激活概率: $P_{s}^{l} = \frac{1}{\|D^{l}\|} \|\{t \in D^{l} : a_{s}(t) > 0\}\| \quad (3)$ 一个潜在变量被认为特定于语言$l$,如果:(1) $P_{s}^{l} = \max_{j \in L} P_{s}^{j}$ 且 (2) 对于阈值$T \in [0,1]$,没有语言$l' \neq l$满足$P_{s}^{l'} \geq T \cdot P_{s}^{l}$。我们选择那些在语言$l$语料库中至少在$N\%$的示例中活跃,并且至少在语言$l$语料库中$M\%$的令牌上活跃的特定语言潜在变量。 #### 3.1.3基于标注的选择(AnnSel) 我们提出一种支持可解释性的方法,利用大语言模型生成的潜在变量标注。该方法分三个阶段进行:电路追踪、路径剪枝和标注过滤。 对于$D^{l}$中的每个句子,我们使用电路追踪工具(Hanna等人,2025 (https://arxiv.org/html/2609.00325#bib.bib10))追踪从输入令牌到预测输出令牌的归因图。我们在中点处截断句子,确保目标令牌是$l$中的一个有效词。然后我们贪婪地剪枝图,仅保留从每个令牌嵌入到基于最大瓶颈边权重的最高预测逻辑值的高重要性路径。最后,我们提取对预测有贡献的潜在变量,过滤掉那些标注中明确提及语言$l$(例如,对于$l=$‘ja’包含“日语”或“日本”)的潜在变量,以确保可解释的、与语言相关的选择。更多细节请参见附录A (https://arxiv.org/html/2609.00325#A1)。 | 上下文 | 目标 | 示例 | | :--- | :--- | :--- | | **反义词** | “[形容词]”的反义词是“[反义词]” | 示例1(英语,法语):“big”的反义词是“petit” | | | | 示例2(德语,日语):“大きい”の反义词是“小さい” | | **列举** | [枚举]是:[项目1],[项目2],[项目3],[项目4],... | 示例3(英语,西班牙语):四季是:el verano, el otoño, el invierno, la primavera | | | | 示例4(法语,中文):Les jours de la semaine sont: 星期日, 星期一, 星期二, 星期三, 星期四, ... | 表1:两个评估数据集的数据格式和示例。句子框架(无衬线字体)位于上下文语言$l_{0}$中,而目标语言$l$用粗体表示。示例展示了上下文/目标语言($l_{0}$, $l$)。 ### 3.2干预策略 对于发现的特定语言潜在变量集合$\{\mathcal{S}^{l}\}_{l \in L}$,我们应用推理时干预,将生成从上下文语言$l_{0}$引导至目标语言$l$。我们评估四种策略: - •目标放大:将每个潜在变量$s \in \mathcal{S}^{l}$设置为在$D^{l}$上计算的平均非零激活值。这自然会放大目标语言$l$的信号,同时避免分布外效应,且不影响其他语言。 - •干扰物零消融:通过将所有与干扰物$l_{0}$相关的潜在变量,或所有非目标语言$\bigcup_{j \in L \setminus \{l\}} \mathcal{S}^{j}$的潜在变量置零,来抑制来自其他语言的竞争信号。 - •干扰物方向消融:通过方向消融来消融干扰物语言$l_{0}$的潜在变量$\mathcal{S}^{l_{0}}$,其中通过移除残差流激活沿潜在变量方向的投影来抑制上下文语言。我们对具有最多潜在变量的单层(单层)或所有层(多层)进行此操作。 - •组合干预:同时应用干扰物消融和目标放大,在增强目标语言信号的同时抑制上下文语言信号。我们测试了干扰物零消融 + 目标放大(Zero+Amp),以及干扰物单层方向消融 + 目标放大(1L+Amp)。 ## 4实验 所有实验均在Gemma-2-2B-pt1^1(https://hf.co/mwhanna/gemma-scope-transcoders,来自Gemma-scope (Lieberum等人,2024 (https://arxiv.org/html/2609.00325#bib.bib11)))和Qwen3-4b^2(https://hf.co/mwhanna/qwen3-4b-transcoders)的转换器上进行。 对于ValSel,我们使用$K=50$(与Deng等人(2025)(https://arxiv.org/html/2609.00325#bib.bib6)针对Gemma-2-2B的26层选择2个潜在变量相对应)。对于FreqSel,我们设置$T=0.8$,$N=98$,$M=10$,遵循Andrylie等人(2025)(https://arxiv.org/html/2609.00325#bib.bib2)。对于AnnSel,我们使用电路追踪工具(Hanna等人,2025 (https://arxiv.org/html/2609.00325#bib.bib10))和Neuronpedia标注^3(https://www.neuronpedia.org)。 为了提取潜在变量子集,我们使用FLORES+(NLLB Team等人,2024 (https://arxiv.org/html/2609.00325#bib.bib13))数据集中的七种语言:英语(en)、法语(fr)、德语(de)、西班牙语(es)、中文(zh)、韩语(ko)和日语(ja)。我们分别对两个CLT和每个语言子集应用三种选择方法。我们在附录(表6 (https://arxiv.org/html/2609.00325#A4.T6))中报告了每种方法和语言提取的潜在变量数量。我们还在附录E (https://arxiv.org/html/2609.00325#A5)中报告了每种方法的计算成本,并在附录F (https://arxiv.org/html/2609.00325#A6)中进行了超参数敏感性分析。 ### 4.1数据集 我们引入了Antonyms和Enumerations两个新的评估数据集,用于语言引导干预。^4(参考附录K (https://arxiv.org/html/2609.00325#A11)和L (https://arxiv.org/html/2024/2609.00325#A12)获取完整列表。数据集也可从项目仓库访问。)Antonyms任务要求在给定语言$l_{0}$上下文的情况下,生成语言$l$中的目标反义词,创建了一个受控的代码切换场景。Enumerations测试开放式生成,要求在目标语言中延续一个列表。表1 (https://arxiv.org/html/2609.00325#S3.T1)展示了数据格式和示例。 ##### 数据集构建。 我们为Antonyms收集了七种语言(en, fr, de, es, zh, ja, ko)的每种语言100个反义词对,为Enumerations收集了7个有序类别。完整的形容词和单词列表分别在附录K (https://arxiv.org/html/2609.00325#A11)和L (https://arxiv.org/html/2024/2609.00325#A12)中提供。对于$7 \times 6 = 42$个有序的上下文和目标语言对$(l_{0}, l)$(其中$l_{0} \neq l$),我们为每个反义词对和每个枚举类别生成一个测试示例。 ##### 评估协议。 给定上下文,我们评估模型在语言$l$中是否更倾向于目标反义词或枚举,而不是其翻译。我们为每个示例记录Antonyms中目标令牌的logit和Enumerations中长度归一化的log概率,涵盖所有七种语言。成功的干预必须相对于基线增加这些值。 | 干扰物 ($l_{0}$) | $L \setminus \{l\}$ | 干扰物 ($l_{0}$) | 干扰物 ($l_{0}$) | 目标 ($l$) | Zero+Amp | 1L+Amp | | :--- | :--- | :--- | :--- | :--- | :--- | :--- | | Zero+Amp | 1L+Amp | zero | zero | one-layer | multi-layer | amplification | | ablation | ablation | direction ablation | direction ablation | | | | | ValSel | -8.02 | 22.39 | 1.99 | 13.98 | 69.57 | 79.83 | 69.73 | | FreqSel | 2.02 | 21.39 | -2.95 | -51.62 | 90.83 | 99.07 | 96.16 | | AnnSel | -0.20 | 11.90 | 0.30 | 64.05 | 87.00 | 96.72 | 89.33 | 表2:使用Antonyms对每种方法评估的干预有效性,计算为干预下top-1 logit差值的总变化(方程4 (https://arxiv.org/html/2609.00325#S4.E4))在所有目标语言上的平均值(越大越好),针对Gemma-2-2B。 ### 4.2发现 #### 4.2.1干预策略的有效性 为了评估语言操纵的有效性,我们在提取的潜在变量上进行干预,在一个上下文语言为$l_{0}$的句子中强制使用Antonyms执行目标语言$l$,其中目标是单个令牌。我们测量目标令牌的top-1 logit差值,即目标形容词的逻辑值与其最佳竞争者的逻辑值的差:$m_{l} = \max_{i \in L \setminus \{l\}} a_{i} - a_{l}$,其中$a_{l}$是目标形容词在语言$l$中的逻辑值。更负的$m_{l}$值表示目标语言$l$的概率更高。我们测量由于干预引起的$m_{l}$变化: $\Delta m_{l} = -(m_{l}^{after} - m_{l}^{before}) \quad (4)$ 因此,更大的正值变化表示更有效的干预。Gemma-2-2B的汇总结果见表2 (https://arxiv.org/html/2609.00325#S4.T2),详细结果见附录表19 (https://arxiv.org/html/2609.00325#A7.T19)、20 (https://arxiv.org/html/2609.00325#A7.T20)和21 (https://arxiv.org/html/2609.00325#A7.T21),以及Qwen3-4B的结果(表24 (https://arxiv.org/html/2609.00325#A7.T24)、23 (https://arxiv.org/html/2609.00325#A7.T23)和22 (https://arxiv.org/html/2609.00325#A7.T22))。 最有效的干预是Zero+Amp,它结合了干扰物语言$l_{0}$的零消融和目标语言放大,其次是1L+Amp,它使用$l_{0}$的单层方向消融代替。零消融似乎优于更...
相似文章
语言切换触发器在语言模型中的潜在绕行路径
本文识别了在80亿参数语言模型中语言切换后门的底层电路,其中三个词的拉丁触发器通过注意力头和正交潜在子空间将英语输出重定向为法语,最后一层的MLP将潜在信号转换为法语logits。
通用语还是探测器产物?重新思考多语言大语言模型中的潜在语言
本研究比较了用于识别多语言大语言模型中潜在语言的探测技术,发现不同方法产生不一致的结果,表明它们揭示了多语言处理的不同方面,而非单一的内部通用语。
因果干预揭示多语言模型中的类型学组织句法机制
本文使用因果干预来研究多语言模型中的句法机制,揭示了基于类型学相似性的分级跨语言迁移。
驾驭语言轴:从线性可解码性到因果控制
本文研究LLM中的语言身份是否可以通过紧凑的激活方向进行线性解码和因果控制。通过在多个模型家族上进行引导(steering)和消融(ablation)实验,作者表明语言选择具有方向依赖性、层特异性,并且在语言信号被消融时会恢复为英语。
中间语假设:LLMs 通过潜在与任务无关的特征空间进行翻译
该论文提出了中间语假设,认为大型语言模型通过将源文本编码到一个潜在与任务无关的特征空间中并从该空间解码来执行翻译,有经验证据支持其在方差、因果影响和单语微调方面的表现。