驾驭语言轴:从线性可解码性到因果控制

arXiv cs.CL 论文

摘要

本文研究LLM中的语言身份是否可以通过紧凑的激活方向进行线性解码和因果控制。通过在多个模型家族上进行引导(steering)和消融(ablation)实验,作者表明语言选择具有方向依赖性、层特异性,并且在语言信号被消融时会恢复为英语。

arXiv:2608.12334v1 公告类型:新 摘要:尽管大型语言模型具有令人印象深刻的多语言能力,但控制语言选择的潜在动态仍鲜为人知。在这项工作中,我们探究语言身份是仅能从隐藏状态中线性解码,还是可以通过一个紧凑的激活方向进行因果控制。我们在多个模型家族(包括Qwen 3.5-2B和Llama-3.2-1B-Instruct)上进行了详尽的因果干预分析,在FLORES-200数据集上的126万次生成中,分离出PCA导出的“语言轴”以执行引导和消融实验。 沿这些几何方向进行引导能可靠地强制语言切换,无论是在跨文字(英语到中文)还是同文字(英语到西班牙语)设置中;而等幅度的随机扰动几乎没有效果。我们的逐层分析表明,语言承诺高度局部化且明确依赖于特定语言对。英语到中文的切换抵抗早期干预,并在较深层容易引导,而英语-西班牙语的转变则提前发生,表现出独特的双峰敏感性。此外,有针对性的消融揭示了一种根本性的英语回归:一旦语言信号被移除,无论输入提示如何,模型都会回退到英语。最终,这些发现表明,语言决策边界在推理过程中表现为因果活跃的特征,具有方向依赖性和层特异性。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:24

来源:https://arxiv.org/html/2608.12334

###### 摘要

尽管大型语言模型具有令人印象深刻的多语言能力,但决定语言选择的潜在动态仍然鲜为人知。在本工作中,我们探究语言身份是仅仅可以从隐藏状态中线性解码,还是可以由一个紧凑的激活方向进行因果控制。我们在多个模型家族上(包括 Qwen 3.5-2B 和 Llama-3.2-1B-Instruct)进行了详尽的因果干预分析,在 FLORES-200 数据集上的 126 万余次生成中分离出 PCA 导出的“语言轴”,并开展引导(steering)与消融(ablation)实验。

沿这些几何方向进行引导,能够在跨文字系统(英译中)和同文字系统(英译西)场景中可靠地迫使语言发生切换,而同等幅度的随机扰动几乎没有任何效果。我们的逐层分析表明,语言承诺(language commitment)具有高度局部性,并且明确依赖于语言对。英译中的切换在早期层抵抗干预,并在较后层易于引导;而英西切换则提前发生,表现出明显的双峰敏感性。此外,定向消融揭示了一种基本的英语回退现象:一旦移除语言信号,模型无论输入提示如何都会回退到英语。最终,这些发现表明,语言决策边界在推理过程中表现为因果活跃的特征,具有方向依赖性和层特异性。

## 1 引言

自基础 Transformer 架构(Vaswani et al., 2017 (https://arxiv.org/html/2608.12334#bib.bib23))问世以来,大型语言模型已从狭窄、任务专用的系统演变为高度通用的推理引擎。在大规模数据与多样化预训练语料的驱动下,现代仅解码器 Transformer 展现出令人印象深刻的多语言能力(Brown et al., 2020 (https://arxiv.org/html/2608.12334#bib.bib3);BigScience Workshop and others, 2022 (https://arxiv.org/html/2608.12334#bib.bib2))。然而,决定模型选择生成哪种语言的内部机制仍然不清楚。当一个多语言模型用英语而非中文、或者用西班牙语而非英语作答时,这一决定究竟是由扩散到整个网络的模式、某个晚期解码偏差,还是一个紧凑、可操控的潜在变量所控制?

回答这一问题对于机制可解释性和实际可靠性都至关重要。从科学角度看,语言选择为研究 Transformer 模型如何将语义内容与表层形式分离提供了一个天然测试平台。一个模型在处理语义相似但语言不同的两个句子时,可能同时表示共享的语义结构和特定语言的句法。精确定位这些成分的表示位置与方式,有助于厘清多语言模型究竟是依赖语言中立的语义枢纽、语言锚定的流形,还是语言子空间之间的方向特定变换。从实际角度看,输出语言控制是部署系统中的常见失败模式,因为模型经常默认使用英语、意外发生语码转换,或者忽略以目标语言回答的明确指令(Marchisio et al., 2024 (https://arxiv.org/html/2608.12334#bib.bib11);Nie et al., 2025 (https://arxiv.org/html/2608.12334#bib.bib15);Wang et al., 2025 (https://arxiv.org/html/2608.12334#bib.bib25);Oh et al., 2026 (https://arxiv.org/html/2608.12334#bib.bib17))。对语言控制的机制性解释,可以在无需昂贵微调的情况下实现更可靠的多语言生成。

已有工作表明,语言身份通常可以从隐藏状态中线性解码(Kim & Lee, 2025 (https://arxiv.org/html/2608.12334#bib.bib7);Srinivasan et al., 2023 (https://arxiv.org/html/2608.12334#bib.bib21))。线性探针、表征聚类和跨语言嵌入分析都表明,Transformer 激活中包含丰富的语言特定结构(Mousi et al., 2024 (https://arxiv.org/html/2608.12334#bib.bib14);Chang et al., 2022 (https://arxiv.org/html/2608.12334#bib.bib4))。然而,可解码性并不等同于因果使用。某个特征可能很容易从激活中恢复,但在实际生成中几乎不起作用。相反,一个特定的激活方向可能与语言身份相关,但在被干预时却无法改变模型行为。要区分相关性与真正的因果控制,需要在推理过程中直接干预激活——即修改模型的内部状态——并测量输出语言是否可靠地改变。这种方法最近已被证明可以在神经元层面成功缓解语言混淆(Nie et al., 2025 (https://arxiv.org/html/2608.12334#bib.bib15))。

在本工作中,我们对多个 Transformer 架构(包括 Qwen 3.5-2B(Qwen Team, 2026 (https://arxiv.org/html/2608.12334#bib.bib18))和 Llama-3.2-

相似文章

角度-范数分解下的激活转向几何解释

arXiv cs.AI

本文通过将干预分解为角度和径向分量,分析了语言模型中的线性激活转向。研究发现概念主要编码在角度结构中,但范数调整对稳定性至关重要,支持球形转向方法的同时表明加性系数混淆了几何特性。

受控LLM激活的非满射性

Hugging Face Daily Papers

本文证明,LLM中的激活引导产生的内部状态无法通过任何文本提示复制,从而在白盒可控性和黑盒提示之间建立了形式上的区分。

解构并引导大型语言模型中的功能性元认知

arXiv cs.CL

本研究探讨了大型语言模型中的功能性元认知,证明诸如评估意识和自我评估能力等内部状态可以从残差流激活中线性解码。作者提出了一个机械机制框架来引导这些状态,展示了对推理行为、冗长度及安全响应的因果控制。