在多语言大语言模型中进行分布感知的语言神经元识别

arXiv cs.CL 论文

摘要

本文提出一种分布感知方法,用于在多语言大语言模型中识别特定语言神经元,该方法利用成对激活分布重叠,提高了跨语言因果效应隔离的特异性。

arXiv:2609.10993v1 Announce Type: new 摘要:多语言大语言模型(mLLMs)包含一小部分对特定语言敏感的前馈神经元,通常称为特定语言神经元。现有工作使用每个神经元语言激活概率的熵来衡量语言特异性,其中当激活值为正时,神经元被视为激活。然而,这种方法可能无法完全捕捉mLLMs的多语言特性,其中语言表示是分布式的且相互关联。我们提出分布感知语言神经元选择,它利用整个激活范围内(包括负值)每种语言激活分布之间的成对关系。具体而言,我们通过使用激活分布之间的成对重叠系数对语言进行聚类来量化每个神经元的语言特异性。在两个mLLMs和两个保留语料库上,我们的标识符更有效地隔离了特定语言因果效应,每个神经元产生的目标语言损害最高达4.9$\times$倍,同时保留了非目标语言性能。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:21

# 多语言大模型中分布感知的语言神经元识别  
来源:https://arxiv.org/html/2609.10993  
作者:Inho Won  
所属机构:KAIST  
邮箱:[[email protected]](mailto:[email protected])  
Junghun Yuk  
所属机构:KAIST  
Dongyeon Kim  
所属机构:KAIST  
Jihyo Kim†  
所属机构:KAIST InnoCORE PRISM-AI Center  
KyungTae Lim†  
所属机构:KAIST  

###### 摘要  
多语言大语言模型(mLLMs)包含一小部分对特定语言敏感的前馈神经元,通常称为语言特定神经元。现有工作通过计算每个神经元在不同语言下激活概率的熵来衡量其语言特异性,其中激活值大于零即视为神经元被激活。然而,这种方法可能未能充分捕捉mLLMs的多语言特性——其中语言表征是分布性的且相互关联。我们提出**分布感知的语言神经元选择**方法,该方法利用全激活范围(包括负值)下各语言激活分布之间的成对关系。具体而言,我们通过聚类各语言激活分布之间的成对重叠系数,量化每个神经元的语言特异性。在两个mLLMs模型和两个保留语料库上的实验表明,我们的识别器能更有效地隔离语言特定的因果效应,每个神经元产生的目标语言损害最高可达4.9倍,同时保持非目标语言的性能。  

---

## 1 引言  
多语言大语言模型(mLLMs)在单一共享参数空间内展现出跨越数十种语言的强大能力(Scao等人,2022;Yang等人,2025)。然而,这些模型内部如何组织多语言表征仍然是一个未解之谜。  

> 图1:识别结构性独特的语言分布比识别最常激活的语言更重要。此处,$a$ 表示激活值。分布视角揭示了仅激活概率所遗漏的差异。  

一种基于激活值的神经元级可解释性方法是回答这一问题的经验途径。先前的研究通过区分目标语言与其他语言的激活特征,将语言特定神经元(LSNs)定义为对特定语言表现出优先激活的神经元(Tang等人,2024;Kojima等人,2024;Zhang等人,2026)。它们将激活值为正的神经元视为对每种语言被激活,并通过每种语言激活概率的熵来量化语言特异性。在这种观点下,表现出语言特异性的神经元可以概念化为“主要为单一语言激活的神经元”。这些识别出的神经元为研究跨语言迁移机制、干预语言生成以及探究多语言知识组织提供了有用的分析工具(Rahmanisa等人,2025;Mondal等人,2025;Deng等人,2025)。  

然而,先前的LSN识别方法可能未能充分反映mLLMs的多语言特性。由于mLLMs在共享参数空间下使用多种语言进行训练,语言表征本质上是分布性且相互关联的。将连续激活二值化并视为各自独立的每种语言分布,会引入两个关键局限性:首先,它忽略了负激活的有用信息,因为激活值为负的神经元被视为不活跃;其次,由于激活概率是从每种语言的二值状态单独计算的,它们既无法保留每种语言激活分布的独特形状,也无法保留语言间的关联结构。  

图1提供了一个先前激活概率方法不足以捕捉语言特异性的示例。如左图所示,即使所有激活值均为正,先前方法可能仍无法将此神经元识别为语言特定的,因为尽管激活分布不同,其熵值仍然很高。此外,右图展示了一个仅关注激活概率可能无法捕捉结构独特性的场景:在此示例中,英语形成一个独立的分布,而先前方法会将其视为不活跃区域。这些结构性盲点提出了一个根本性问题:鉴于mLLMs的多语言特性,我们如何利用激活分布及其跨语言关联结构来识别语言神经元,同时避免潜在的信息损失?  

为了解决这个问题,我们提出**分布感知的语言神经元(DLN)选择**方法,该方法通过每种语言激活分布之间的成对重叠系数来估计神经元级别的语言特异性。通过建模完整的激活值范围,并基于成对重叠系数对语言进行聚类,DLN捕捉了激活分布之间的关联结构。该公式自然识别出两种类型的语言神经元:(1)*单语言神经元*(SLNs),特定于一种语言;(2)*多语言神经元*(MLNs),特定于多种语言。因此,我们的方法将识别目标重新定义为“激活分布在语言间存在差异的神经元”,而不仅仅关注主要为单一语言激活的神经元。  

通过对Llama-3.1-8B和SmolLM3-3B-Base在两个保留语料库上的评估,以及附录中对三个额外模型的验证,我们表明DLN比基于激活概率的基线方法能更有效地隔离语言特定的因果效应。消融DLN选择的SLN,每个神经元产生的目标语言损害最高可达4.9倍,同时保持非目标语言性能。DLN还能捕捉MLN,揭示如中日语言联盟这样的共享结构,该结构在聚类内产生7.12倍更高的损害,同时使用的神经元减少2.1倍。通过建模激活密度,DLN识别了在负激活范围内运行的神经元,包括对正激活率指标不可见但作为目标语言控制功能性触发器的英语SLN。最后,DLN在标准门控激活位置之外仍然有效,在门控乘积位置保持高选择性,而基于激活概率的基线在此位置则失去大部分有效性。  

我们的贡献如下:  
- • **分布感知的语言神经元识别框架**:通过将神经元选择表述为使用连续激活密度重叠系数的聚类问题,我们的方法有效利用了反映mLLMs特性的分布性和语言间关联结构。  
- • **在SLN和MLN上的有效性**:我们评估了方法识别的两类语言神经元的有效性。SLN在隔离语言特定因果效应方面显著优于基线,而MLN则识别了结构上耦合的语言联盟。  
- • **完整激活分布揭示的信息**:分析结果表明,我们的方法实现了其设计目标:(1)捕捉在负激活范围内识别的神经元的重要性;(2)通过考虑完整的激活值范围,实现灵活的干预位置选择。  

## 2 相关工作  
mLLMs在多种语言间共享参数,同时在生成中保持语言身份(Conneau等人,2020;Grattafiori等人,2024;Yang等人,2025)。先前工作表明,语言占据部分重叠的表征子空间(Pires等人,2019;Wu和Dredze,2019),且仅解码器的mLLMs可能内部依赖以英语为中心的枢轴表征(Wendler等人,2024;Schut等人,2025)。这些发现引出了一个机制性问题:在单一mLLM内部,语言特定和语言共享的计算是如何实现的?  

> 图2:所提方法的整体框架。  

神经元级分析为研究此问题提供了一种方法。先前工作表明,Transformer模型中的单个神经元可以编码事实、句法、语义或任务相关信息(Geva等人,2021;Dai等人,2022;Stanczak等人,2022)。将此扩展至多语言模型,Kojima等人(2024)通过测量每个神经元区分目标语言与其他语言的精确度来识别语言特定神经元(LSNs)。Tang等人(2024)引入了语言激活概率熵(LAPE),通过每种语言激活概率的熵来衡量语言特异性,将激活值为正的神经元视为活跃。基于LAPE,Zhang等人(2026)根据有多少种语言超过预定义的激活概率阈值,将神经元分为LSNs、语言相关神经元(LRNs)和通用神经元。  
1.  LSNs和LRNs与我们提出的单语言神经元(SLNs)和多语言神经元(MLNs)概念密切相关。我们使用SLNs和MLNs是为了强调所识别的神经元是与单一语言相关还是跨多种语言共享。  

然而,这些方法主要依赖于二元激活统计数据,即神经元是否以及对每种语言活跃。这种抽象可能遗漏分布差异:具有相似激活概率的语言可能仍会诱导不同的激活值分布,反之亦然。相比之下,我们分析了完整的每种语言激活分布,从而能够从分布激活模式中识别单语言和多语言神经元。  

## 3 分布感知的语言神经元  
在本节中,我们介绍*分布感知的语言神经元(DLN)*识别方法,该方法利用每种语言激活分布的完整范围,并使用成对重叠系数量化其关系。先前方法将每种语言激活分布简化为基于激活值符号的二元激活统计数据,尽管负激活可能包含用于确定语言特异性的有用信息。此外,多种语言可能具有几乎相同的二元激活统计数据,同时占据明显可分离的激活区间。此类神经元可能仍是语言特定的,但基于熵的方法可能无法识别它们。图2展示了我们方法的整体框架。  

### 3.1 分布重叠系数矩阵  
我们研究具有门控线性单元(GLU)前馈块的自回归Transformer语言模型(Shazeer, 2020)。我们将每个多层感知机(MLP)神经元索引为 $j=(\ell,n)$,其中 $\ell$ 是其层数,$n$ 是其在层内中间维度 $d_{\mathrm{ffn}}$ 中的位置。令 $d$ 表示残差流隐藏维度。给定门控投影 $W_{\mathrm{gate}}^{\ell} \in \mathbb{R}^{d_{\mathrm{ffn}} \times d}$,神经元 $j$ 对于输入 $x \in \mathbb{R}^{d}$ 的激活为 $a_j(x) = \bigl[\sigma(W_{\mathrm{gate}}^{\ell} x)\bigr]_n$,其中 $\sigma(\cdot)$ 是激活函数(例如 SiLU)。  

我们通过测量每种语言激活分布之间的重叠系数(共享面积)来确定每个神经元的语言特异性。令 $\mathcal{L}$ 表示语言集合,$p_j^k(v)$ 表示神经元 $j$ 在语言 $k \in \mathcal{L}$ 下激活值 $v=a_j(x)$ 的连续概率密度函数。成对重叠系数矩阵 $\mathbf{S}_j \in [0,1]^{|\mathcal{L}| \times |\mathcal{L}|}$ 计算如下:  
\[
\mathbf{S}_j[k,k'] = \int \min\left(p_j^k(v),\,p_j^{k'}(v)\right) dv.
\]  
这总结了 $\{p_j^k(v)\}$ 之间的关系。重叠系数是比较每种语言分布的几种有界、形状敏感统计量之一,我们采用它作为最直观且计算成本最低的选择。附录17显示,替代指标如Jensen-Shannon散度、平方Hellinger距离和Kolmogorov-Smirnov检验产生几乎相同的神经元集合,而带有尺度信息的指标(如Wasserstein-1距离、能量距离)则出现分歧。  

### 3.2 基于聚类的神经元分类  
为了区分具有不同激活模式的语言,我们将 $\mathcal{L}$ 划分为两个簇 $(A_j, A_j^c)$,通过最小化所有非平凡二分法上的簇间最大重叠系数 $\max_{k \in A_j, k' \in A_j^c} \mathbf{S}_j[k,k']$ 来实现。此过程等价于使用簇数 $K=2$ 的单链接聚类(Johnson, 1967)。这是一个选择决策,而非双峰性假设,因为 $\mathbf{S}_j$ 保留了所有成对关系,且具有三个或更多分离组的神经元仍会通过其最分离的二分法被检测到。附录17验证了该设计及替代链接方法的有效性。  

我们将 $A_j$ 定义为较小的簇,并将其指定为该神经元的候选语言集。这基于我们方法设计的假设:具有不同激活模式的语言是与该神经元关联最强的语言。较大的簇 $A_j^c$ 可被视为具有相对相似激活行为的语言参考组。  

### 3.3 神经元选择标准  
获得 $A_j$ 和 $A_j^c$ 后,我们仅在所有簇间重叠系数不超过阈值 $\tau$ 时才选择神经元 $j$ 为语言神经元:  
\[
\mathcal{N} = \left\{j: \max_{k \in A_j, k' \in A_j^c} \mathbf{S}_j[k,k'] \leq \tau \right\}.
\]  
否则,如果任何簇间对的重叠系数大于 $\tau$,则该神经元不被选择。我们将每个选择的语言神经元表示为 $j^\star \in \mathcal{N}$。

相似文章

大型音频语言模型中的多语言情感神经元

arXiv cs.CL

首次从神经元层面解释大型音频语言模型如何编码多语言情感,引入一致性正则化融合(Consistency-Regularized Fusion)以识别跨12种语言的多语言情感神经元,并展示了跨语言迁移的益处。

单个神经元足以绕过大型语言模型的安全对齐

arXiv cs.CL

这项研究表明,通过靶向负责拒绝响应的单个神经元,可以绕过大型语言模型的安全对齐机制,揭示了安全机制并非稳健地分布在整个模型中,而是由单个神经元介导的。

自然理解过程中语言模型的异质性神经预测性

arXiv cs.CL

本文研究了在自然语言理解过程中,语言模型表示如何预测MEG、ECoG等记录中的神经活动。研究结果表明,语言模型特征可作为有用的神经预测因子,但需谨慎避免将预测成功过度解读为共享神经组织的证据。