通用语还是探测器产物?重新思考多语言大语言模型中的潜在语言
摘要
本研究比较了用于识别多语言大语言模型中潜在语言的探测技术,发现不同方法产生不一致的结果,表明它们揭示了多语言处理的不同方面,而非单一的内部通用语。
arXiv:2609.00155v1 公告类型:新
摘要:潜在语言识别常被用来论证多语言语言模型通过语言特定状态(如英语枢纽)来引导计算。然而,现有探测器从不同信号推断潜在语言,例如隐藏状态的几何结构或从中间表示中解码的内容。鉴于这些主张影响了模型如何在不同语言间共享和引导信息的结论,我们探究这些探测器是否衡量相同的现象,还是揭示了多语言计算的不同方面。我们在模型家族、训练机制、领域、任务、检查点和多达27种语言上研究了这个问题。我们发现识别探测器系统性地不一致:基于GMM的表示探测器从隐藏状态几何结构中获取证据,显示出更早的跨语言混合;而基于解码的探测器依赖于输出空间的可解码性,保留了更清晰的语言特异性和更偏向英语的信号。这些差异追踪了模型的多语言能力和训练进程,但在不同领域间相对稳定。我们的结果表明,对潜在语言识别应持更谨慎的解释,即当前的探测器揭示了多语言处理的不同方面,而非直接揭示单一的内部通用语。
查看缓存全文
缓存时间: 2026/09/02 05:46
# 公共语还是探测工具?重思多语言大模型中的潜在语言
来源:https://arxiv.org/html/2609.00155
Badr AlKhamissi
Antoine Bosselut
所属机构:EPFL
通讯作者:{deniz\.bayazit,badr\.alkhamissi,antoine\.bosselut}@epfl\.ch
###### 摘要
潜在语言识别常被用来论证多语言大模型通过特定语言状态(如英语枢轴)进行计算路由。然而,现有探针从不同信号中推断潜在语言,例如隐状态的几何结构或中间表征的可解码性。由于此类结论会影响模型如何跨语言共享和路由信息的理解,我们提出疑问:这些探针衡量的是同一现象,还是揭示了多语言计算的不同方面?我们在不同模型系列、训练机制、领域、任务、检查点以及最多27种语言上研究了这一问题。我们发现识别探针系统性地存在分歧:基于隐状态几何证据的GMM表征探针显示出更早的跨语言混合,而依赖输出空间可解码性的解码探针则保留了更清晰的语言特异性和更强的英语偏向性信号。这些差异与模型多语言性和训练进程相关,但在不同领域间相对稳定。我们的结果表明,应对潜在语言识别采取更审慎的解读:当前探针暴露的是多语言处理的不同方面,而非直接揭示单一的内部通用语。111代码已发布于:https://github.com/bayazitdeniz/latent-lid
## 1引言
图1:多语言大模型是否在用英语工作?这取决于你如何提问。我们用三种探针探测同一个多语言大模型的中间隐状态:logitlens、tuned lens和基于表征的GMM,恢复出任务语言(tr, fr)及其他候选语言(如英语en)的三种不同潜在语言分布。我们研究了这些探针在不同模型、训练机制和任务间何时以及为何存在分歧。
多语言语言模型通常被假定通过将信息映射到共同或部分语言中性的表征来实现跨语言信息共享(Foroutan等人,2022;Dumas等人,2025)。然而,这种共享的形式仍不甚明了。一个有影响力的假说是:多语言模型依赖于一种*潜在语言*——一种中间的类语言状态,有时被描述为内部枢轴或通用语,模型通过它路由语义后再生成输出。Wendler等人(2024)在以英语为主导的模型(如LLaMA-2)中为该行为提供了证据,但使用更均衡多语言数据训练的新型模型可能表现不同(Üstün等人,2024;Foroutan等人,2025;Schut等人,2025)。这一现象引出一个更广泛的问题:潜在语言估计的多大程度上反映了模型的内部计算,多大程度上反映了诊断方法本身的假设?
图2:两类潜在语言识别(LLID)探针。给定一个中间隐状态h,基于解码的方法(左)将h通过模型的unembedding(可选地经由tuned lens)投影,并从得到的词表分布中推导语言分数。基于表征的方法(右)则将h与语言条件激活分布进行比较,这里使用逐层GMM,每个候选语言对应一个成分。两类探针作用于相同的h,但提取不同的证据:输出空间可解码性 vs 激活空间几何结构。
解释此类探针具有挑战性,因为潜在语言识别(LLID)是推断而非直接观察到的。如图1所示,潜在语言估计取决于从模型中提取何种证据。先前工作依赖两大类方法(图2):**基于表征的探针**从隐状态的几何结构推断语言(Shani和Basirat,2025),以及**基于解码的探针**通过将中间隐状态投影到模型输出头来推断语言(Wendler等人,2024;Zhong等人,2025)。这两类方法对模型“内部使用一种语言”意味着什么做出了不同假设,且尚不清楚它们识别的是共同机制,还是暴露了多语言编码和解码中的不同过程。
在本研究中,我们将LLID视为一个测量问题。我们不再追问多语言大模型是否“用英语思考”,而是探究潜在语言估计是反映了模型属性(如多语言性和训练进程),还是反映了诊断选择(如表征几何结构 vs 输出空间可解码性)。为此,我们在受控和开放式多语言任务上比较了基于GMM的表征探针与解码探针。我们首先测试基于解码的LLID在受控和开放式设置下的内部一致性和泛化能力(§4–5),然后询问基于表征的LLID在匹配条件下是否能复现相同模式(§6)。随后,我们追踪这些估计如何在不同领域、训练机制和检查点间变化。
我们的分析表明,LLID探针不应被视为可互换的单一现象测量工具。GMM表征探针揭示了更早的跨语言混合和较弱的英语主导性,而基于解码的探针则保留了更清晰的语言特异性和更强的英语偏向性信号。这一模式在我们的分析中反复出现,但每个探针的逐层行为依赖于具体模型。对于给定探针,这些效应在层堆栈中的出现位置及其随层变化的方式,取决于模型多语言性及其在预训练过程中的变化,尽管多语言性本身并不决定这些变化。相比之下,领域和语言清单的改变仅轻微偏移LLID估计。每种诊断方法提供的多语言计算视图是部分性的,受其从隐状态或解码输出中提取的证据所塑造,而非支持关于内部通用语的强论断。
## 2比较潜在语言探针的框架
### 2.1任务定义:潜在语言识别
设$\mathcal{L}$为有限候选语言集合,令$h \in \mathbb{R}^d$表示从模型某层及序列位置提取的隐状态。我们用变量$Z \in \mathcal{L}$表示潜在语言,并估计其在给定$h$下的条件分布为:
$$q(\ell) \approx \Pr(Z = \ell \mid h), \quad \ell \in \mathcal{L}$$
由于变量$Z$不可直接观测,我们将$q$视为诊断性估计,而非内部语言变量的基准证据。因此,不同的LLID估计器可能对相同提示和层产生不同分布。实践中,每个估计器通过选择一个或多个token位置并聚合所得语言证据来构建$q$(§3)。
### 2.2LLID的两类证据及其局限性
现有LLID方法主要区别于构建$q$所用的证据。我们区分两大类:**基于表征的方法**根据隐状态在激活空间中相对于从多语言数据学到的语言条件结构的位置来推断语言;**基于解码的方法**根据通过模型输出词表能从隐状态中读取出什么来推断语言。
#### 基于表征的LLID
此方法将隐状态$h$与从多语言数据学到的语言条件结构进行比较,例如GMM后验(Shani和Basirat,2025)、语言子空间(Zhao等人,2025)或神经元级指标(Zeng等人,2025)。这种比较产生逐语言分数,然后聚合为逐层分布$q$。在我们的实验中,我们使用来自各语言示例的隐状态,为每个候选语言拟合一个语言条件成分,得到逐层GMM,并将所得成分后验作为逐层语言分布$q$。该方法的一个常见担忧是:学到的结构可能混淆语言身份与相关因素(如书写系统、分词或领域)。然而,在我们的实验中,我们发现在STEM和艺术与人文等QA领域表现一致(§6)。
#### 基于解码的LLID
这些方法通过询问能从中间层解码出何种语言来估计潜在语言。令$\mathcal{V}$为模型词表,$W_U \in \mathbb{R}^{|\mathcal{V}| \times d}$为模型的unembedding矩阵。对于任意隐状态$h \in \mathbb{R}^d$,在最终层归一化后,我们形成一个中间词表分布:
$$p := \mathrm{softmax}(W_U h)$$
将模型未修改的输出头直接应用于中间隐状态被称为logitlens(nostalgebraist,2020),我们将此直接投影称为原始logitlens。由于中间表征可能与最终输出头预期的不匹配,我们还考虑tuned lens(Belrose等人,2025),它学习一个逐层仿射变换,在应用输出头之前从中间隐状态预测最终层隐状态。先前工作以多种方式将$p$映射为语言分数$q$,例如:对语言特定目标词的有效首token前缀概率求和(Wendler等人,2024;Dumas等人,2025);对多token语言特定答案序列概率评分(Zhong等人,2025);或从$p$解码一个或多个token并用外部语言识别(LID)模型分类(Ozaki等人,2025)。
在我们的实验中,对于补全已知的任务,我们对有效首token求和;若任务是开放式的,我们使用两个基于rollout的变体(argmax和top-p),其中从中间层解码的短续写被传递给LID分类器(Kargaran等人,2023)。基于解码的LLID方法假设最终unembedding在中间层仍有意义,这在早期层可能不成立。另一个担忧是,token级启发式方法(如目标字符串匹配)需要非平凡的设计选择(例如,收集有效补全)才能产生有意义的$\mathcal{L}$分布。
### 2.3比较LLID估计的度量指标
LLID估计沿多个维度变化,无法用单一指标捕捉:分布可能置信或分散,其主导语言可能匹配任务相关语言或枢轴至其他语言。此外,两个估计器可能一致或不一致。因此,我们使用一组互补的指标。除非另有说明,每个指标按估计器计算,并在每层各提示上平均。
#### 熵
熵 $H = -\sum_{\ell \in \mathcal{L}} q(\ell) \log q(\ell)$ 衡量LLID分布的分散程度;较低值表示尖锐估计,较高值表示语言混合。
#### 主导性
我们用 $D = \max_{\ell \in \mathcal{L}} q(\ell)$ 衡量主导性,当大部分概率质量分配给单一语言时,该值较高。
#### 枢轴率
枢轴率是主导估计语言与任务相关语言 $\ell_x$(例如翻译中的源语言或目标语言)不同的提示比例:
$$P_x = \mathbb{I}\Big[\arg\max_{\ell \in \mathcal{L}} q(\ell) \neq \ell_x\Big]$$
#### 一致性
给定两个LLID估计器 $a$ 和 $b$,一致性衡量估计器分配相同主导语言的频率:
$$A_x = \mathbb{I}\Big[\arg\max_{\ell \in \mathcal{L}} q_a(\ell) = \arg\max_{\ell \in \mathcal{L}} q_b(\ell)\Big]$$
在我们的实验中,此指标用于比较基于解码和基于表征的LLID。
## 3实验设置
### 3.1模型与多语言性度量
我们评估多达12个自回归语言模型,涵盖以英语为中心的基线、多语言基础模型及指令微调变体。由于训练混合比例未完全公开,我们考虑以下多语言性代理指标:零样本多语言QA准确率、跨语言困惑度和字节归一化似然。除非另有说明,跨模型图表按模型在INCLUDE数据集(Romanou等人,2025)上的零样本宏准确率递增排序。模型详情、分数和排名见附录B。
### 3.2评估机制
我们在两种设置下评估LLID:(1)**受控机制**,其中基准补全可用;(2)**开放式机制**,测试相同模式在自然文本中是否成立。确切的语言清单(即每种设置包含的候选语言集合)列于附录A的表1中。
#### 受控目标字符串评估
我们使用三种合成任务格式:复制、填空和翻译。复制要求模型以相同语言复现概念词,填空要求模型补全掩码上下文,翻译要求用指定目标语言给出概念词。这些示例建立在先前用于潜在语言分析的目标词设置基础上(Wendler等人,2024;Dumas等人,2025;Zhong等人,2025)。对于每个提示 $x$ 和候选语言 $\ell$,令 $w_{\ell,x}$ 为语言 $\ell$ 的答案。遵循Wendler等人的方法,令 $\textsc{Start}_{\tau}(w_{\ell,x}) \subseteq V$ 表示分词器 $\tau$ 下能开始 $w_{\ell,x}$ 的词表token集合。为简便,我们固定 $x$、$\ell$ 和 $\tau$,写作 $\textsc{Start}(w)$。受控的基于解码的语言分数定义为:
$$s_x(\ell) = \sum_{t \in \textsc{Start}(w)} P_{\theta}(x_{n+1}=t \mid h_n),$$
其中 $h_n$ 是最后一个提示token处的隐状态。我们将此概率质量之和称为**start mass**。相似文章
中间语假设:LLMs 通过潜在与任务无关的特征空间进行翻译
该论文提出了中间语假设,认为大型语言模型通过将源文本编码到一个潜在与任务无关的特征空间中并从该空间解码来执行翻译,有经验证据支持其在方差、因果影响和单语微调方面的表现。
可解释的人类与陌生的LLMs:评估响应中潜结构的专家分析
本研究采用探索性因子分析,比较人类与LLMs在评估中响应的潜在结构,揭示LLMs依赖与人类推理不同的统计上不透明的机制。
多语言语言模型中语言控制的潜在机制
本文比较了三种方法,用于识别多语言语言模型中的语言控制潜在因子,以应对语码转换。实验在Gemma-2-2B和Qwen3-4B上进行,结果显示FreqSel最为有效。
研究提示语言和响应语言对LLM内容生成的影响
本文研究提示语言和响应语言如何影响LLM的内容生成,发现提示语言显著影响输出长度,同时通过概念改写保持语义保真度。
你在说我的语言吗?关于多模态大语言模型中的口语遵循问题
本文解决了多模态大语言模型在ASR中的口语遵循问题,提出了一种软提示方法和新颖的度量标准来量化语言违规。它评估了三种缓解策略——零样本提示、监督微调和思维链推理——在多种语言上的效果,以提高转录保真度。