语言模型中的跨架构引导迁移:一项系统性实证研究
摘要
一项系统性实证研究显示,当规模足够(≥1.7B参数)时,从一种语言模型中提取的概念方向可以引导其他独立训练的模型,为柏拉图式表征假说提供了功能上的证据,并突显了跨模型可解释性工具的规模阈值。
arXiv:2608.05164v1 公告类型:新
摘要:独立训练的大语言模型可能在不同架构下形成共享的语义概念内部表征——但这种几何相似性是否对跨模型行为控制具有功能后果,尚未得到验证。我们首次对跨模型引导迁移进行了系统性评估,并表明共享的LLM几何结构在功能上是可利用的,但需满足一定条件:当存在足够的表征容量时,一种模型的概念方向可以引导另一个独立训练的模型。我们研究了跨越三个参数规模(0.8B–8B)和两个架构谱系的五个开放权重模型,为每个模型训练一个稀疏自编码器,覆盖15个语义域,并测试所有20个有向模型对的对齐情况。我们观察到在1.7B参数附近存在一个暗示性的不连续点:在≥1.7B规模下,47–49%的跨模型特征对通过验证(Pearson r ≥ 0.60,Procrustes余弦相似度0.895–0.956),而对齐在低于0.8B时急剧下降。跨模型引导向量(B3-TI)在15个监督概念上达到71.0%的胜率,而同模型原生向量为68.0%;一个单一通用向量在5个模型中的4个上达到67.3%,且无需逐模型监督。对于低于1.7B的模型以及一个生成不稳定的模型,迁移效果会下降,这证实了功能可利用性需要足够的表征容量。我们的发现强调了规模阈值在机制可解释性中的重要性:在7B规模下验证的工具可能无法在不重新验证的情况下迁移到较小模型。我们首次为柏拉图式表征假说提供了功能上的补充——在已识别的规模条件下,独立训练的LLM之间的几何收敛支持无需微调即可实现跨模型行为控制。
查看缓存全文
缓存时间: 2026/08/07 07:49
# 语言模型中的跨架构转向迁移:一项系统性实证研究
来源:https://arxiv.org/html/2608.05164
###### 摘要
独立训练的大型语言模型尽管存在架构差异,也可能发展出对语义概念的共享内部表征——但这种几何相似性是否会对跨模型行为控制产生功能性后果,此前尚未被系统性地检验。在本工作中,我们首次系统性地评估了独立训练 LLM 的共享几何结构是否*在功能上可利用*以实现跨模型转向迁移,并表明在条件满足时确实如此:当一个模型具有足够的表征容量时,从中提取的概念方向可以转向另一个独立训练的模型。我们研究了横跨三个参数规模(0.8B–8B)和两个架构谱系的五个开放权重模型,为每个模型训练一个稀疏自编码器(Sparse Autoencoder),覆盖 15 个语义域,并测试了全部 20 个有向模型对的对齐情况。具体而言,我们观察到一个约在 1.7B 参数附近的暗示性不连续:在≥\geq 1.7B 规模下,47–49% 的跨模型特征对验证通过(Pearsonr≥0.60r\geq 0.60,Procrustes 余弦值 0.895–0.956),而对齐在 0.8B 以下急剧退化,尽管原始激活几何结构得以保留(由于每个低于 7B 的层级仅有n=1n\{=\}1个模型,这尚不能确认为系统性的规模定律)。利用这种共享结构,跨模型转向向量(B3-TI)在 15 个监督概念和五个模型上实现了 71.0% 的胜率,而同一模型原生向量为 68.0%;来自无监督共享概念空间的单一通用向量在 5 个模型中的 4 个上实现了 67.3% 的胜率,且无需任何逐模型监督。对于 1.7B 规模以下的模型以及一个存在生成不稳定性的模型,迁移效果会退化,这确认了共享几何结构的功能可利用性需要足够的表征容量。我们的发现强调了规模阈值在机制可解释性中的重要性:在 7B 规模下验证的工具可能无法迁移到较小模型或前沿架构,除非重新验证。更广泛地说,我们为柏拉图式表征假说提供了首个功能性补充——表明在已识别的规模条件下,独立训练的 LLM 之间的几何收敛足以支持无需微调的跨模型行为控制。
## 1 引言
机制可解释性的一个核心问题是,独立训练的语言模型的内部表征是否*普遍*:不仅在它们响应的特征上相似,而且在几何上对齐,以支持转向(steering)、抑制(suppression)和跨模型迁移等功能性操作。如果这种共享几何结构不仅仅是一种结构上的好奇,而是实际上*可利用的*——即从一个模型提取的概念方向能够因果性地控制一个它从未训练过的不同模型——那将标志着我们对跨架构可解释性工具的思考方式发生根本性转变。
柏拉图式表征假说(Platonic Representation Hypothesis,Huhet al., 2024 (https://arxiv.org/html/2608.05164#bib.bib13))提供了几何证据,表明跨模态和跨架构的表征会汇聚到一个共享的现实统计模型。这种共享几何结构是否具有*功能性*后果——具体来说,从一个模型提取的概念方向是否能够因果性地转向另一个独立训练的模型——仍然是一个悬而未决的问题。先前的转向向量研究(Turneret al., 2023 (https://arxiv.org/html/2608.05164#bib.bib10); Zouet al., 2023 (https://arxiv.org/html/2608.05164#bib.bib12))证明了*单一*架构内的功能控制,但未测试跨架构迁移。
本工作分三个阶段解决该问题:(1) 我们使用 SAE 提取的特征,在五个独立训练模型的所有 20 个有向对上对齐,确立了≥\geq 1.7B 参数模型存在跨架构特征级普遍性;(2) 我们探索共享结构是否在功能上可用于转向,通过测量在推理时注入的概念方向是否因果性地将输出分布向预期方向移动;(3) 我们证明跨模型转向迁移在实践中有效,跨模型向量优于朴素基线,且单一无监督通用向量无需逐模型监督即可泛化到 5 个模型中的 4 个。
我们的研究做出以下贡献:
1. 1.跨架构特征级普遍性的证据。在≥\geq 1.7B 规模的四个模型中,47–49% 的 MNN 提取特征对跨模型验证通过(Pearsonr≥0.60r\geq 0.60,Procrustes 余弦值 0.895–0.956,共激活富集28.6×28.6\times高于置换零分布),并有一个约在 1.7B 附近的暗示性不连续,低于此规模时对齐显著退化(每个低于 7B 的层级仅有n=1n\{=\}1个模型;系统性规模定律需要更广泛的模型扫描)。
2. 2.功能性转向可迁移性的探索。我们评估共享几何结构是否支持跨架构的因果概念控制,使用双向性判据(rbidir=‖Δ−‖/‖Δ+‖r_{\text{bidir}}=\|\Delta^{-}\|/\|\Delta^{+}\|)作为注入方向确实编码目标概念而非单向饱和触发的证据。B3-TI 向量的中位数rbidir=1.71r_{\text{bidir}}=1.71(82% 的模型-概念对满足rbidir≥0.5r_{\text{bidir}}\geq 0.5)确认了 T2 因果证据。
3. 3.跨模型迁移有效的证明。B3-TI 跨模型向量在 15 个监督概念和五个模型上实现了 71.0% 的胜率,而同一模型原生向量为 68.0%,朴素零投影基线为 65.7%(3.0 个百分点差距是有方向的;配对t(4)=1.85t(4)\{=\}1.85, p=0.14p\{=\}0.14,在n=5n\{=\}5个模型下统计功效不足)。来自无监督共享概念空间的单一通用向量在 5 个模型中的 4 个上,跨越 11 个无监督概念实现了 67.3% 的胜率,且无需逐模型监督。
4. 4.可复现流水线和完整发布的产物。所有中间和最终输出均发布在 Hugging Face 上:五个逐模型残差流激活数据集(A2),五个训练好的 TopK SAE(A3),4,100\+ 个带标签的特征文件(A4),每个概念的原始 SAE 解码器和 CAA 转向向量(A5),20 个训练好的跨模型 MLP 桥(B1),完整的成对对齐结果和统计量(B2),所有 20 个有向对的 B3-TI 跨模型向量(B3),训练好的通用 Global MLP(C1),通用概念聚类映射和结果(C2),以及 55 个 C3-Dec / C3-EncDec 通用转向向量(C3),连同所有评估结果(D1)和完整的转向评估数据集。
本文组织如下。第2节 (https://arxiv.org/html/2608.05164#S2)回顾相关工作。第3节 (https://arxiv.org/html/2608.05164#S3)描述端到端流水线。第4节 (https://arxiv.org/html/2608.05164#S4)呈现结果:几何普遍性(T1,§4.1 (https://arxiv.org/html/2608.05164#S4.SS1))、域结构(§4.2 (https://arxiv.org/html/2608.05164#S4.SS2))和功能迁移(T2,§4.3 (https://arxiv.org/html/2608.05164#S4.SS3))。第5节 (https://arxiv.org/html/2608.05164#S5)讨论范围、失败模式和未来方向。
## 2 相关工作
Brickenet al.(2023 (https://arxiv.org/html/2608.05164#bib.bib5)) 展示了 SAE 将残差流激活分解为近乎单一语义的特征;Gaoet al.(2024 (https://arxiv.org/html/2608.05164#bib.bib8)) 确立了 TopK SAE 作为扩展高效的变体;Cunninghamet al.(2023 (https://arxiv.org/html/2608.05164#bib.bib9)) 评估了 GPT-2 规模上的可解释性——我们在其基础上,在五个架构上训练 TopK SAE,并使用其特征作为跨模型对齐基质。
Turneret al.(2023 (https://arxiv.org/html/2608.05164#bib.bib10)) 引入了对比激活添加(Contrastive Activation Addition, CAA),Zouet al.(2023 (https://arxiv.org/html/2608.05164#bib.bib12)) 展示了用于安全概念的线性表征探针,两者都在*单一*模型内运行;我们评估这些方向是否能够*跨*架构迁移。
Kornblithet al.(2019 (https://arxiv.org/html/2608.05164#bib.bib15)) 和Nguyenet al.(2021 (https://arxiv.org/html/2608.05164#bib.bib16)) 确立了 CKA 和 Procrustes 对齐作为表征相似性工具;Raghuet al.(2017 (https://arxiv.org/html/2608.05164#bib.bib14)) 贡献了 SVCCA;Huhet al.(2024 (https://arxiv.org/html/2608.05164#bib.bib13)) 将这些综合为柏拉图式表征假说(T1 收敛)——我们提供了首个 T2 功能性补充,表明 T1 对齐足够强,足以支持零样本转向迁移。
Haghverdiet al.(2018 (https://arxiv.org/html/2608.05164#bib.bib17)) 在基因组学中引入 MNN 用于跨数据集细胞匹配,此处被改编用于跨架构 SAE 特征对齐;Conneauet al.(2018 (https://arxiv.org/html/2608.05164#bib.bib18)) 将 MNN 应用于跨语言嵌入。
Wanget al.(2024 (https://arxiv.org/html/2608.05164#bib.bib1)) 和Lanet al.(2024 (https://arxiv.org/html/2608.05164#bib.bib3)) 在旋转不变度量下发现 LLM 对之间的 SAE 特征结构相似性较高,确立了几何普遍性但未测试因果转向迁移;Gurneeet al.(2024 (https://arxiv.org/html/2608.05164#bib.bib4)) 发现在神经元粒度上,1–5% 的神经元在 GPT-2 不同种子间是普遍的,而我们在架构不同的模型的 SAE 特征粒度上运行。
Lindseyet al.(2024 (https://arxiv.org/html/2608.05164#bib.bib2)) 引入了稀疏*跨编码器*(crosscoders),联合编码多个模型的激活以产生用于模型比较的共享特征集——我们的 Global MLP(C1)在概念上相关,但通过对比对齐显式优化跨模型转向迁移,而非特征分解。
## 3 方法
流水线跨越三个轨道的十一个步骤(视觉概览见附录A (https://arxiv.org/html/2608.05164#A1) 中的图3 (https://arxiv.org/html/2608.05164#A1.F3)):
轨道 A — 单模型*(每个架构运行):*
A1 语料库:涵盖 15 个语义域的 394,508 篇文本语料库。
A2 激活:残差流在≈50%\approx 50%深度处的平均池化(已发布)。
A3 SAE 训练:每个模型一个 TopK SAE,16,384 个潜在变量(已发布)。
A4 特征标注:delta 选择 + LLM 评判打分(已发布 4,100\+ 个文件)。
A5 原生向量:每个概念的 SAE 解码器和 CAA 向量(已发布)。
轨道 B — 成对跨模型*(20 个有向对):*
B1 特征对齐 + 通过 MNN 匹配训练 MLP 桥(已发布)。
B2 对验证:Pearsonr≥0.60r\!\geq\!0.60、Procrustes 余弦、富集(已发布)。
B3 通过 B1 桥生成的 B3-TI 跨模型转向向量(已发布)。
轨道 C — 全模型通用*(全部 5 个模型联合):*
C1 Global MLP:覆盖五个激活空间的联合编码器/解码器(已发布)。
C2 通用概念发现:HDBSCAN 产生 11 个规范概念(已发布)。
C3 通用向量:C3-Dec 和 C3-EncDec,无逐概念监督(已发布)。
轨道 D — 功能评估:
D1 在 30 个提示词×\times15 个概念×\times9 个强度上的胜率、双向性和概念分数Δ\Delta(所有结果已发布)。
完整的推导、超参数和失败分析在附录中;下面每一段指向相应章节。
#### 模型(表1 (https://arxiv.org/html/2608.05164#S3.T1))。
我们研究五个开放权重仅解码器模型,横跨三个参数规模(GPT-2-large 0.8B,Gemma-2-2B 1.7B,三个 7B 模型:LLaMA-3.1-8B,Mistral-7B,DeepSeek-7B)和两个架构谱系(GPT-2 绝对位置编码 MHA;LLaMA 家族 RoPE 变体,包括标准 MHA、GQA 和滑动窗口 GQA)。LLaMA(Hermes-3,仅 SFT)是唯一的指令微调模型;其余四个是未修改的基础检查点,纳入以测试微调是否会破坏表征普遍性(第4.1节 (https://arxiv.org/html/2608.05164#S4.SS1));结果是不会。
表 1:本研究中使用的模型。
#### A1–A2:语料库和激活。
我们从 17 个 HuggingFace 数据集汇编了 394,508 篇文本,涵盖 15 个语义域:Python 代码(3 个粒度级别)、SQL、四个数学子集(GSM8K、MetaMath、MATH-plus、NuminaMath-CoT)、创意写作、学术摘要、生物医学、法律、新闻、开放域问答和两个通用散文来源。对于每篇文本,我们记录目标层(≈\approx 50% 深度)的残差流隐藏状态的平均池化,然后按维度进行 z-score 归一化,以消除跨架构高达12×12\times的规模差异。完整规格见附录B (https://arxiv.org/html/2608.05164#A2)。
#### A3:稀疏自编码器训练。
每个模型训练一个 TopK SAE(Gaoet al., 2024 (https://arxiv.org/html/2608.05164#bib.bib8)):GPT-2-large 和 Gemma 使用64×64\times扩展(分别为 81,920 和 147,456 个特征),三个 7B 模型使用128×128\times扩展(每个 524,288 个特征)。7B 模型使用幽灵梯度(ghost gradients)以防止死神经元积累。所有五个 SAE 都收敛到 0% 死特征;重建损失范围从 0.065(GPT-2-large)到 0.250(LLaMA)。逐模型超参数和损失见附录C (https://arxiv.org/html/2608.05164#A3)。
#### A4:特征选择和域分配。
对于 15 个监督域中的每一个,通过差分deltaδc[f]=F̄pos,c[f]−F̄neg,c[f]\delta_{c}[f]=\bar{F}_{\text{pos},c}[f]-\bar{F}_{\text{neg},c}[f]选择 top-150 SAE 特征;域分配为argmaxc|δc[f]|\arg\max_{c}|\delta_{c}[f]|。这产生了每个模型 666–883 个带标签特征(总计 4,100 个);完整配置见附录D (https://arxiv.org/html/2608.05164#A4)。
#### A5:原生转向向量。
每个(模型、概念)对计算两种向量类型。*SAE 解码器向量*:概念的最高δc\delta_{c}特征的前 3 个 SAE 解码器列的置信度加权和,进行l2\ell_{2}归一化。*对比激活添加(CAA)向量*(Turneret al., 2023 (https://arxiv.org/html/2608.05164#bib.bib10)):概念的 50 个正例和 50 个负例文本的残差流平均差异,进行l2\ell_{2}归一化。两种类型之间的余弦相似性作为尝试跨模型迁移前的模型内质量检查。
#### B1:跨模型特征对齐。
对于 20 个有向模型对中的每一个,保留复合对齐分数≥0.70\geq 0.70的 MNN 选择特征对(总共 3,308 个验证对);为每个有向对训练一个 67M 参数的 MLP 桥,用于 B3-TI。逐对统计量见附录E (https://arxiv.org/html/2608.05164#A5)。
#### B2:对齐验证。
每个 B1 对使用 Pearsonr≥0.60r\geq 0.60、置换富集(BH-FDR)、Cohen's dd、Spearmanρ\rho、CCC 和 RSA 进行验证。原始激活上的无 SAE Procrustes 余弦提供了架构无关的上限。完整统计量见附录F (https://arxiv.org/html/2608.05164#A6)。
#### B3:跨模型转向向量。
*B3-TI(翻译注入)*:引导模型的 A5 SAE 解码器向量被编码为稀疏特征,通过 B1 MLP 桥投影,并通过目标 SAE 解码器解码(l2\ell_{2}归一化)。一个*朴素基线*(维度匹配,l2\ell_{2}归一化)提供了零学习成本参考。两个被放弃的 B3 变体在附录O (https://arxiv.org/html/2608.05164#A15)中描述。
#### C1:Global MLP。
五种模式---相似文章
跨语言引导的比喻语言生成
本文探讨了多语言大语言模型中内部表示的跨语言迁移,用于比喻语言生成,表明在一种语言中学习到的激活方向可以有效引导其他语言的生成。
跨语言探索参数化知识
本文探索了跨语言提示策略,以改进对大语言模型中参数化知识的访问,并在涵盖17种语言的多语言基准测试中展示了知识迁移和事实召回方面的显著提升。
小语言模型领域适配的可信度成本:跨架构实证研究
一项系统的跨架构实证研究,衡量小语言模型领域适配的可信度成本,发现安全保持的微调策略并不能可靠地迁移对齐性。
论大语言模型的固有可解释性:设计原则和架构调查
一份综合调查,回顾了大语言模型(LLM)固有可解释性的最新进展,将方法分为五个设计范式:功能透明性、概念对齐、表示可分解性、显式模块化和潜在稀疏性诱导。论文解决了在模型架构中直接构建透明性,而不是依赖事后解释方法的挑战。
通过标题特定激活引导控制工具使用
本文研究大型语言模型中的工具使用决策是否具有稳定的内部表征,这些表征可以通过激活引导(Activation Steering)提取和操控,并展示了在五个开源模型和三个领域中,标题特定引导向量可以抑制不必要的工具使用。几何分析揭示,工具调用步骤表现出弥散的双峰对齐,而非参数化基础概念所预期的清晰线性结构。