复杂度引导的组件级初始化用于语言模型预训练

arXiv cs.CL 论文

摘要

本文分析预训练GPT-2风格语言模型中的频谱模式,并测试这些模式能否用于初始化,发现粗粒度频谱匹配相比标准方法并不能提升预训练性能。

arXiv:2607.09204v1 公告类型:新 摘要:预训练语言模型通常表现出结构化的权重谱,这表明训练可能会反复产生类似的逐层和逐组件组织。我们探讨这些重复出现的频谱模式是否可以作为GPT-2风格语言模型预训练的初始化信号。首先,我们分析了十一个预训练的GPT-2风格检查点,这些检查点在大小、语言、分词器和训练语料上各不相同,测量了各层和Transformer子组件的Frobenius范数和有效秩熵。这些检查点显示出共同的深度趋势,特别是在残差写入矩阵中尺度增加和频谱集中程度增强。然后,我们构建了模仿预训练模型组件级幅度和频谱轮廓的初始化方案,并将其与几种权重初始化方法进行比较。这些初始化器明显改变了模型的结构性频谱模式,但评估结果并未显示相应的性能优势。预训练权重复用仍然具有竞争力,而仅靠粗粒度频谱匹配并不是可靠的优化策略。我们的结果表明,预训练频谱是训练模型结构的有用诊断工具,但有效复用可能需要保留比组件级尺度和奇异值形状更丰富的信息。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:57

# 面向语言模型预训练的复杂度引导组件级初始化
来源:https://arxiv.org/html/2607.09204
###### 摘要。

预训练语言模型常呈现结构化的权重谱,表明训练过程可能反复产生类似的逐层和逐组件组织。我们探究这些重复出现的谱模式是否可作为GPT-2风格语言模型预训练的初始化信号。首先,我们分析了十一个预训练的GPT-2风格检查点,这些模型在规模、语言、分词器和训练语料上各有不同,测量了跨层和Transformer子组件的Frobenius范数和有效秩熵。这些检查点显示出共有的深度趋势,特别是在残差写入矩阵中规模增大且谱集中度增强。接着,我们构建了模仿预训练模型组件级幅度和谱分布的初始化方案,并与多种权重初始化方法进行比较。这些初始化器明显改变了模型的结构性谱模式,但评估结果并未显示相应的性能优势。预训练权重复用仍具竞争力,而仅凭粗粒度的谱匹配并非可靠的优化策略。我们的结果表明,预训练谱是训练模型结构的有用诊断工具,但有效的复用很可能需要保留比组件级尺度和奇异值形状更丰富的信息。

语言模型预训练,Transformer初始化,逐层诊断,记忆化,训练动态

## 1. 引言

大型语言模型通常从随机初始化的权重开始训练,这些权重常来自高斯分布或相关分布。这种选择具有鲁棒性且与架构无关:它不假设关于数据、模型规模或训练最终产生的内部结构的先验知识。然而,这也忽略了越来越多的证据表明,训练后的语言模型并非参数空间中的任意点。在不同模型、层和组件中,预训练Transformer常展现出重复的结构规律性,包括其权重矩阵的特征谱属性(W. Wang and Z. Tu (2020) (https://arxiv.org/html/2607.09204#bib.bib8);20 (https://arxiv.org/html/2607.09204#bib.bib7);C. H. Martin and M. W. Mahoney (2021) (https://arxiv.org/html/2607.09204#bib.bib6))。

这些规律性提出了一个自然的问题:如果训练后的模型反复发展出相似的模式,能否在训练开始前就利用这些模式中的一部分?原则上,一种已经反映了预训练模型常见结构的初始化方法,可以减轻优化的负担。模型无需从头学习所有结构属性,而是从尺度、秩结构或谱形状更接近训练后Transformer的权重开始。同时,尚不清楚这种粗粒度的谱信息是否对预训练真正有用。谱相似性可能捕捉到了有意义的结构,但也可能丢弃了使预训练权重有效的特定方向、相关性和特征级组织。

在本文中,我们针对GPT-2风格语言模型研究这个问题。我们使用谱分析工具(包括Frobenius范数和有效秩熵)分析了多个预训练模型的权重矩阵(Martin and Mahoney,2021 (https://arxiv.org/html/2607.09204#bib.bib6))。我们的目标首先是确定在规模、语言、分词器和训练语料不同的模型中是否出现一致的谱模式。然后测试这些模式能否迁移到新模型的初始化中,以及这种初始化是否能改善预训练动态。

#### 研究问题与答案。

具体而言,我们提出以下问题。

本文其余部分组织如下。我们首先在第2节 (https://arxiv.org/html/2607.09204#S2) 分析现有预训练LLM,以识别其权重中反复出现的谱模式。然后,我们在第3节 (https://arxiv.org/html/2607.09204#S3) 提出并评估一种基于谱模式的初始化方法。最后,我们在第5节 (https://arxiv.org/html/2607.09204#S5) 讨论相关工作,并在第6节 (https://arxiv.org/html/2607.09204#S6) 进行总结。

## 2. 预训练LLM中的谱模式

谱分析是对矩阵特征值或奇异值的分析。在神经网络背景下,谱分析可以提供对权重矩阵几何和功能特性的洞察。大的奇异值表明矩阵强烈放大某些输入方向,这通常与更大的复杂性或敏感性相关(Glorot and Bengio,2010 (https://arxiv.org/html/2607.09204#bib.bib20); Staatset al.,2026 (https://arxiv.org/html/2607.09204#bib.bib13); Martin and Mahoney,2021 (https://arxiv.org/html/2607.09204#bib.bib6))。我们在第2.2节 (https://arxiv.org/html/2607.09204#S2.SS2) 定义谱模式,并在第2.3节 (https://arxiv.org/html/2607.09204#S2.SS3) 分析预训练GPT-2风格模型,以识别预训练LLM中共享的谱模式。

### 2.1. GPT-2 模块记号

GPT-2 是一种仅解码器 Transformer:token 嵌入到残差流中,然后通过一叠相同的因果自注意力和MLP模块,最后经过语言模型头。每个模块首先应用层归一化和多头因果自注意力,将注意力输出写回残差流,然后应用第二次层归一化和位置级MLP,再进行另一次残差写入。对于模块 l,设 x_l 为进入该模块的残差流。使用预层归一化 GPT-2 约定,两次残差写入为:

a_l = Attn(LN_1(x_l); W_QKV, W_O),  x̃_l = x_l + a_l,
m_l = W_down φ(W_up LN_2(x̃_l)),  x_{l+1} = x̃_l + m_l,

其中 φ 是 MLP 非线性函数。我们重点关注主导模块计算的四个密集矩阵。融合注意力输入矩阵 W_QKV 将残差流映射为查询、键和值特征;在 GPT-2 实现中,这通常存储为一个组合投影,然后分割成 Q、K 和 V(Radford et al.,2019 (https://arxiv.org/html/2607.09204#bib.bib1); Wolf et al.,2020 (https://arxiv.org/html/2607.09204#bib.bib4))。注意力输出矩阵 W_O 将拼接的头输出映射回残差流。MLP 升维投影 W_up 将残差维度扩展到隐藏 MLP 维度,而 MLP 降维投影 W_down 将激活后的隐藏表示映射回残差流。我们在表1 (https://arxiv.org/html/2607.09204#S2.T1) 中总结了用于组件级解释的组件权重和奇异值关联。当我们引用模块级聚合时,我们将 Transformer 模块内的这些组件矩阵组合起来;当我们引用组件图时,我们跟踪这些矩阵之一随深度的变化。

表 1. Transformer 模块组件中组件权重和奇异值的解释性关联。2^2在后续实验中,我们联合考虑 W_QKV,并单独考虑 W_O。这种分组是一个局限,因为 W_V 的功能更接近 W_O,而非 W_Q 和 W_K。一个表格列出了 W_Q 和 W_K、W_V 和 W_O、W_up 和 W_down,以及每个组件使用的组件权重或奇异值关联。

图 1. 预层归一化 GPT-2 模块记号。注意力输出和 MLP 输出被加回到残差流中。一个紧凑的 GPT-2 模块图,显示 x_l 经过层归一化、注意力、残差加法、层归一化、MLP、残差加法,得到 x_{l+1}。

### 2.2. 谱分析度量

我们使用静态谱度量,因为它们计算成本低,可直接从保存的权重矩阵计算,无需额外的数据传递、干预或微调运行。它们也是训练后神经网络和 Transformer 权重的成熟诊断工具:先前的工作使用谱摘要来研究隐式正则化、层和组件结构、初始化尺度以及复杂度控制(C. H. Martin and M. W. Mahoney (2021) (https://arxiv.org/html/2607.09204#bib.bib6);W. Wang and Z. Tu (2020) (https://arxiv.org/html/2607.09204#bib.bib8);20 (https://arxiv.org/html/2607.09204#bib.bib7);M. Staats, M. Thamm, and B. Rosenow (2026) (https://arxiv.org/html/2607.09204#bib.bib13);Z. Zhang, P. Lin, Z. Wang, Y. Zhang, and Z. J. Xu (2024) (https://arxiv.org/html/2607.09204#bib.bib16);Z. Zhang, P. Lin, Z. Wang, Y. Zhang, and Z. John Xu (2026) (https://arxiv.org/html/2607.09204#bib.bib17))。我们选择的度量分离了每个矩阵的互补属性:Frobenius 范数捕捉总规模,而有效秩熵描述该规模在奇异方向上的集中或分散程度。

#### Frobenius 范数

Frobenius 范数为:

∥W∥_F = sqrt(∑_{i,j} W_{ij}^2) = sqrt(∑_k σ_k(W)^2)。

它衡量总权重能量,有助于区分规模变化与谱形状变化。

#### 有效秩熵

仅 Frobenius 范数不能捕捉奇异值的分布。设 σ_i 为 W 的奇异值,令 p_i = σ_i / ∑_j σ_j。我们使用熵有效秩:

erank(W) = exp(-∑_i p_i log p_i)。

它衡量有多少奇异方向承载了显著质量(Martin and Mahoney,2021 (https://arxiv.org/html/2607.09204#bib.bib6))。

### 2.3. 预训练 LLM 共享相似的谱模式

我们分析了十一个 Hugging Face 检查点:英文 GPT-2 小模型和中等模型(Radford et al.,2019 (https://arxiv.org/html/2607.09204#bib.bib1)),俄语 GPT-2 小模型和大模型(Zmitrovich et al.,2024 (https://arxiv.org/html/2607.09204#bib.bib22)),以及 GPT-2 风格的越南语、中文、葡萄牙语、日语、土耳其语、诗歌生成和故事生成模型(Van,2025 (https://arxiv.org/html/2607.09204#bib.bib24); Guo,2023 (https://arxiv.org/html/2607.09204#bib.bib23); Guillou,2020 (https://arxiv.org/html/2607.09204#bib.bib25); Zhao and Sawada,2021 (https://arxiv.org/html/2607.09204#bib.bib29); Sawada et al.,2024 (https://arxiv.org/html/2607.09204#bib.bib30); Kesgin et al.,2024 (https://arxiv.org/html/2607.09204#bib.bib26); Zhao et al.,2023 (https://arxiv.org/html/2607.09204#bib.bib27); Vadrevu,2021 (https://arxiv.org/html/2607.09204#bib.bib28))。选择时保持架构家族固定,同时改变规模、语言、分词器和训练语料。我们分析了模块级聚合和四个子组件:融合的 W_QKV 注意力输入投影、W_O 注意力输出投影、W_up MLP 升维投影和 W_down MLP 降维投影。我们将 W_QKV 联合处理,因为它决定了用于计算和传输注意力信息的查询、键和值特征空间。我们单独分析 W_O,因为它将注意力输出映射回残差流,因此其谱与回写强度和方向性的联系比与注意力分数形成的联系更直接。

#### 总体观察

在预训练检查点中,经过每种模型的归一化后,层级的 Frobenius 范数和有效秩熵呈现相似的趋势。在 z-score 图中比在度量值图中更清晰,表明共同信号主要是结构性的,而非源于相同的绝对尺度。在组件层面,有效秩熵在最后几层跨多个组件下降。对于残差写入或值侧矩阵 W_O 和 W_down,下降最为显著,但 W_QKV 和 W_up 在深度后期也出现类似的下降。这意味着在网络的顶部,表示的频谱变得更加集中:较少的奇异方向承载了谱质量的大部分。与此同时,W_O 和 W_down 的 Frobenius 范数几乎随深度线性上升,表明这些矩阵的总权重质量增加,而它们的有效频谱却变窄。W_QKV 和 W_up 矩阵遵循相关但较弱的深度形状;这些矩阵的共同和个体趋势不如 W_O 和 W_down 明显。

请参阅标题(a)层 Frobenius 范数。层 Frobenius 范数。
请参阅标题(b)层有效熵。层有效熵。

图 2. 预训练模型逐层 Frobenius 范数和有效熵趋势。预训练模型逐层 Frobenius 范数和有效熵趋势。

#### 解释

我们通过神经记忆的概念解释组件级趋势(Sukhbaatar et al.,2015 (https://arxiv.org/html/2607.09204#bib.bib5))。在这种观点中,双矩阵计算可视为一种键值记忆:其中一个矩阵或矩阵乘积决定哪些特征被寻址,而另一个决定返回什么信息。这种解释已被应用于 Transformer 前馈层,因为其上下投影形成了这样的双矩阵计算(Geva et al.,2021 (https://arxiv.org/html/2607.09204#bib.bib9))。我们可以将相同的键值解释应用于注意力权重矩阵。

在这种观点下,W_QK 权重的功能类似于键,因为它们决定了注意力 logits,从而决定了选择或混合 token 位置的注意力权重(Elhage et al.,2021 (https://arxiv.org/html/2607.09204#bib.bib15))。W_VO 权重作为值通路,因为它们将选中的内容传输回残差流。这为 W_QKV 较弱的 Frobenius 范数趋势给出了一个自然的解释:注意力 logit 大小的变化在 logits 转换为注意力权重时被归一化,从而解释了几乎恒定的 Frobenius 范数,而 W_O 在后期层次中 Frobenius 范数增长和有效熵下降表明,残差回写方向变得越来越强但谱分布更集中。

然后,MLP 模式可以通过原始的上下键值解释来理解:W_up 检测或键化隐藏 MLP 空间中的特征,而 W_down 将类似值的信息写回残差流(Geva et al.,2021 (https://arxiv.org/html/2607.09204#bib.bib9),2022 (https://arxiv.org/html/2607.09204#bib.bib10))。由于 MLP 层常与事实和特征存储相关联(Geva et al.,2021 (https://arxiv.org/html/2607.09204#bib.bib9),2022 (https://arxiv.org/html/2607.09204#bib.bib10); Meng et al.,2022 (https://arxiv.org/html/2607.09204#bib.bib11)),W_down 中更强的共同趋势可能反映了后期层次在读出或残差写入侧的专门化。

相似文章

小初始化对大语言模型至关重要

arXiv cs.AI

本文表明,降低参数初始化规模能持续改善大型语言模型的预训练,且在推理密集型任务上收益最大。它发现了一种平衡推理与训练的关键初始化,并提出一个简单的γ-初始化规则。

LM预训练的泛化动态(阅读时间17分钟)

TLDR AI

本文揭示,在预训练过程中,语言模型会频繁且突然地在模式匹配与泛化行为之间切换,这种现象被称为“模式跳跃”(mode-hopping),并提出了一个用于研究该现象的小型评估套件。

大语言模型中的语言习得装置

arXiv cs.CL

本文提出了一种受LAD启发的预预训练方法,使用一种名为MP-Struct的形式语言,该语言编码了类自然语言结构。研究表明,这种方法提高了token效率,并赋予了模型类似人类的对结构不合理语言的抵抗力,挑战了先前关于有效预预训练语言的假设。

面向语言智能的可扩展视觉预训练

Hugging Face Daily Papers

本文证明,无需文本提取的文档无监督视觉预训练在语言智能方面持续优于纯文本预训练,为基础模型提供了一种高效且可扩展的方法。