数据可预测性如何塑造Transformer训练中的Weibull权重尺度增长

arXiv cs.LG 论文

摘要

本文揭示了Transformer训练中Weibull权重尺度的增长由数据可预测性决定,具体是通过双字母组合条件熵实现的,并建立了该增长的预测定律。

arXiv:2608.23573v1 公告类型:新 摘要:训练后的Transformer权重幅度可以用一个双参数Weibull分布来概括,其形状参数 $k \approx 1.2$ 在不同层和模型间保持稳定,因此尺度参数 $\lambda$ 承载了大部分训练引起的变动。是什么语料库属性决定了 $\lambda$ 的增长程度?使用双字母组合条件熵 $D = H(\text{next} \mid \text{prev})$,这是一个在训练前计算的无需训练的统计量,我们发现对于受控的损坏族,存在一个学习率条件定律 $\lambda^2 - \lambda_0^2 = C_0(\eta) + C_1(\eta)(H_r - D)^{0.59}$,其中 $H_r$ 是匹配预算的洗牌基线。凸指数继承自独立测量的数据端饱和关系,而非直接拟合增长曲线。在移除每个 $\eta$ 的两个系数后,跨越学习率一个数量级的23次运行都坍缩到 $(H_r - D)^{0.59}$ 上,斜率为1($R^2 = 0.941$;直接的每个 $\eta$ 拟合较弱,$R^2 \approx 0.82$)。由于 $D$ 在训练前计算,该定律是一个前向预测器:一个端到端的自我验证以5.7%的相对误差恢复了保留的族内权重增长。该读出在模型和每层分辨率上成立,并在两个测试的架构中成立,功能形式得以保留,仅系数发生变化。它也标记了其边界:跨语料库预测过度预测了代码,表明冗余是更广泛 $\Phi(D,R,A,H)$ 数据到权重框架中的第二轴。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:22

# 数据可预测性塑造Transformer训练中的韦布尔权重尺度增长
来源:https://arxiv.org/html/2608.23573

###### 摘要
训练后Transformer的权重幅度可用双参数韦布尔分布概括,其形状参数 $k \approx 1.2$ 在不同层和模型间保持稳定,因此尺度参数 $\lambda$ 承载了训练引发的主要变化。语料库的何种特性决定了 $\lambda$ 的增长幅度?我们采用无需训练的统计量——双字条件熵 $D = H(\text{next} \mid \text{prev})$(在训练前从原始数据计算得出),发现对于受控的腐败系列,存在一个与学习率相关的定律:
$\lambda^2 - \lambda_0^2 = C_0(\eta) + C_1(\eta)(H_r - D)^{0.59}$
其中 $H_r$ 是匹配预算的打乱基线。凸指数源自独立测量的数据侧饱和关系,而非直接拟合增长曲线。移除每个 $\eta$ 对应的两个系数后,涵盖一个数量级学习率的23次实验汇聚于 $(H_r - D)^{0.59}$ 单位斜率曲线($R^2 = 0.941$;直接按 $\eta$ 拟合的精度较弱,$R^2 \approx 0.82$)。由于 $D$ 在训练前计算,该定律具有前瞻性预测能力:端到端自验证以 5.7% 的相对误差恢复了留出族内的权重增长。该规律在模型和逐层分辨率上成立,且跨越两种测试架构,仅系数变化而函数形式保持不变。同时该定律明确了其边界:跨语料预测对代码过度预测,表明冗余性是更广泛的 $\Phi(D, R, A, H)$ 数据-权重框架的第二维度。

## 1 引言
训练后Transformer的权重并非随机数字的集合:在广泛模型中,线性层的权重幅度遵循韦布尔分布,可简洁概括为形状参数 $k$ 和尺度参数 $\lambda$(Ding, 2026a)。形状参数非常稳定——跨层和模型均 $k \approx 1.2$——因此训练期间变化的单一量就是尺度 $\lambda$。近期研究表明,$\lambda$ 在AdamW优化器下通过注入、衰减和对齐三种力的净值增长,且这种增长而非 $\lambda$ 本身才是训练动态的核心(Ding, 2026b)。这引出了优化器视角未解答的问题:训练数据的何种特性决定 $\lambda$ 的增长幅度?同一研究使问题具体化:观察到 $\lambda(t)$ 的峰值随训练数据一致性变化,并将受控的数据侧研究留待后续工作——本文即提供该研究。我们用单一的无训练数据统计量解答此问题。

令 $D = H(\text{next} \mid \text{prev})$ 为语料库的双字条件熵——衡量从前一个词预测下一个词的可预测性,可在任何训练前从原始数据计算。我们发现权重尺度增长是“可预测性边际” $(H_r - D)$ 固定幂次的仿射函数:
$\lambda^2 - \lambda_0^2 = C_0(\eta) + C_1(\eta)(H_r - D)^{0.59}$ (1)
其中 $\lambda_0$ 是初始尺度,$H_r$ 是匹配预算打乱下插值双字熵的饱和值(第8节)。两个事实使其超越*无约束*曲线拟合:首先,凸指数并非通过直接优化增长拟合选择,而是与独立测量的数据侧饱和指数绑定($0.59 = 1/p$,$p \approx 1.69$,第5节),因此函数形式受独立数据侧关系的经验约束,而非作为自由增长曲线指数引入。其次,该关系跨学习率收敛:移除每个 $\eta$ 的系数 $C_0(\eta), C_1(\eta)$ 后,涵盖 $\eta$ 一个数量级的23次实验汇聚于单一曲线 $y = (H_r - D)^{0.59}$,斜率为1.00($R^2 = 0.941$;第4节)。因这些系数按族拟合,此收敛检验了*共享指数和单位斜率*——而非较弱的按 $\eta$ 预测精度($R^2 \approx 0.82$),我们已在第4节明确报告。学习率仅通过系数 $C_0(\eta)$ 和 $C_1(\eta)$ 进入定律,它们在四个测试学习率上遵循幂律缩放(公式3)。由于预测输入 $D$ 在训练前从语料库计算,该定律是真正的前向预测:在受控腐败族内,可从训练前数据统计量预测权重尺度增长,我们在留出、端到端自验证中对此进行了验证(第6节)。这闭合了数据侧可测量量与权重侧动态量之间的循环——该方向与主要依赖下游代理或启发式的数据评估方法互补。成分本身是经典的——条件熵是困惑度的统计近亲,对齐量是权重-梯度的余弦相似度。我们的贡献在于*连接*:标准数据侧统计量与韦布尔权重尺度统计量通过受控定律关联,可在训练开始前预测训练结果。

模型和层级别的透镜。相同的韦布尔 $(k, \lambda)$ 标尺可在两个粒度上读取。整体模型给出单一尺度增长定律,关联语料库统计量 $D$;逐层则产生分块 $(k, \lambda)$ 估计,*定位*可预测结构写入网络的位置。该定律在每个分块保持相同函数形式,仅分块特异系数变化(中位逐块 $R^2 = 0.84 \approx$ 汇聚的0.82;第7节)。形状 $k$ 在分块间几乎均匀(1.16–1.21)——数据在各处塑造*相同类型*的分布——而尺度响应异质,集中于前馈块。由于二阶矩 $\langle w^2 \rangle = \lambda^2 \Gamma(1 + 2/k)$ 在汇聚下可加且 $k$ 均匀,汇聚的 $\lambda^2$ 可通过逐块 $\lambda^2$ 的参数计数加权平均很好地近似。

范围。我们的定律在*单一语料库内*建立,沿腐败梯度变化,固定语料库而改变下一词映射;$(H_r - D)$ 并非通用的跨语料指标,我们明确标记其边界(代码的低熵源于冗余而非丰富结构,偏离定律——第8节)。第二数据维度(冗余性)及跨架构、多轮扩展留为未来方向(第8节、第10节)。

贡献。
1.  **学习率收敛定律**:从单一无训练数据统计量预测韦布尔权重尺度增长,凸指数与独立测量的数据侧关系绑定,而非自由增长曲线参数(第4节–第5节)。
2.  **模型级和层级权重尺度增长解释**:相同的 $(k, \lambda)$ 标尺揭示几乎均匀的分布*形状* $(k)$ 和异质的、前馈主导的*尺度* $(\lambda)$ 响应;该定律在两种粒度下成立,且汇聚的 $\lambda^2$ 形式可通过分块定律的参数加权聚合很好地近似(第7节)。
3.  **端到端自验证**:仅从数据统计量预测 $\lambda$ 与留出腐败级别上测量的 $\lambda$ 匹配(5.7%相对误差),残差定位于训练侧梯级(第6节)。
4.  **明确范围和未来方向**:该定律在受控腐败族内建立;跨语料时,它对映射丰富的文本预测有效,但对代码过度预测一个量化幅度,表明冗余性是第二数据维度,并激励更广泛的多维 $(D + R)$ 数据框架(第8节、第10节)。

符号说明见附录A。

## 2 背景与设置
韦布尔权重尺度。跨Transformer,线性层的权重幅度可用形状参数 $k$ 和尺度参数 $\lambda$ 的韦布尔分布良好描述(Ding, 2026a)。形状几乎是普适的(传输类矩阵 $k \approx 1.2$),因此变化的量是尺度 $\lambda$。我们将 $\lambda$ 视为可应用于任何粒度的权重分布读出量(第7节)。

三力动态。在AdamW下,平方尺度作为净力(注入、衰减和对齐)的积分演化:$\lambda^2(t) = \lambda_0^2 + \int (\text{净力}) \, \mathrm{d}t$(Ding, 2026b)。因此增长 $\lambda^2 - \lambda_0^2$ 是累积力平衡:注入项提供与数据无关的基线,而对齐项捕获更新中依赖可学习数据结构的连贯分量(我们在第5节经验验证了线性关系)。这激励我们建模增长 $\lambda^2 - \lambda_0^2$ 而非 $\lambda$ 本身,并赋予定律截距和斜率(第4节–第5节)注入基线/对齐效率的解读。稳态分析表征了尺度如何依赖优化器超参数,$\lambda_{\text{steady}} \propto \sqrt{\eta / \lambda_{\text{wd}}}$(van Laarhoven, 2017;Fan et al., 2025;Wang & Aitchison, 2025)。本研究与之互补:聚焦训练*数据*如何调节饱和前 $\lambda^2$ 的瞬态增长。同一研究已凭经验标记此依赖性——$\lambda(t)$ 的峰值随训练数据一致性变化——并将受控的数据侧解释留待后续工作,本文即提供。

数据侧变量。我们询问语料库的何种训练前特性设定对齐项。此选择源于对候选数据侧统计量的广泛搜索,包括高阶和基于嵌入的语料库结构概念;在此受控环境中,双字条件熵 $D = H(\text{next} \mid \text{prev})$(Shannon, 1948;Cover & Thomas, 2006)作为最简单统计量出现,可在训练前计算且预测权重尺度增长。$D$ 从相邻词计数计算,衡量局部下一词可预测性:低 $D$ 意味前一词强烈约束下一词,而高 $D$ 意味即使以前一词为条件,下一词仍不确定。边际 $(H_r - D)$ 则衡量相对于匹配预算打乱基线 $H_r$ 的剩余可预测局部结构量。此处该统计量用作局部语料库结构的探针,是困惑度的统计近亲,而非本身作为新的数据质量指标提出(第8节)。

## 3 方法
腐败梯度。为隔离单一数据属性——局部下一词映射的完整性——我们固定语料库(wikitext),仅改变该映射的破坏程度。腐败级别 $\rho \in [0, 1]$ 打乱序列内一定比例的词位置;$\rho = 0$ 为干净语料库,$\rho = 1$ 为完全打乱。我们使用两个仅从数据计算的量概括每个腐败语料库(训练前):其双字条件熵 $D = H(\text{next} \mid \text{prev})$(从前2.4M词的词计数插值估计),及其结构保留分数 $S$(相对于干净语料库保留的相邻词对比例,从1线性变化到0,在第5节推导中作为机制结构变量)。由于插值双字熵在大多数相邻结构被破坏后饱和,我们使用 $\rho \leq 0.6$ 作为主要非饱和分析区域,并将饱和尾部视为边界情况(第8节)。

固定锚点:$\lambda_0$ 和 $H_r$。$\lambda_0$ 是每次运行首个检查点的韦布尔尺度——已测量,且因所有运行从共同检查点分支而在腐败轴上相同。其值是模型和初始化的属性,而非普适常数:继续训练运行为 $\lambda_0 = 0.0232$,从头训练运行为 $0.0177$。减去 $\lambda_0^2$ 分离增长并移除初始化偏移。$H_r = 8.0$ 是 $D$ 在匹配预算打乱下的饱和值——在此词预算下双字估计器的插值有限样本上限,而非信息论边缘熵(第8节)。$\lambda_0^2$ 和 $H_r$ 均非自由参数:指数由第5节的数据侧饱和关系设定,增长拟合仅估计两个系数 $C_0(\eta)$ 和 $C_1(\eta)$。

估计 $D$:偏差与方差。边际 $(H_r - D)$ 可解读为双字通道预测信息的匹配预算估计:两项使用相同插值估计器和词预算,因此大量有限样本偏差共享——尽管不完美,因占用双字支撑随腐败变化。其采样*方差*小:跨12个不相交的2.4M词子样本,$D$ 的标准误差在所有腐败级别下低于0.011比特(小于0.2%)——小于绘图标记——且移动块自举一致,因此定律的残差散布非 $D$ 估计噪声的人为产物。

韦布尔权重尺度读出。我们对传输类权重矩阵——注意力输出投影和两个前馈矩阵——的幅度拟合韦布尔分布,并报告其尺度 $\lambda$。除非说明,$\lambda$ 是单一*模型级*拟合:所有此类矩阵跨所有层的幅度汇聚为单一分布,通过对数-对数韦布尔图回归在10–90%分位数带拟合一次。

相似文章

权重稀疏Transformer中的单个参数具有可解释性

arXiv cs.LG

本文介绍了一种自动化的大语言模型流水线,用于生成并验证关于Transformer中单个权重何时起作用的、人类可读的描述。研究发现,在权重稀疏的Transformer中,12%至31%的权重在全局范围内具有可解释性,其表现优于稠密Transformer。

训练前预测:粒子物理基础模型的缩放定律

arXiv cs.AI

本文证明,在小规模Transformer模型上拟合的缩放定律能够准确预测在粒子物理喷注数据上训练的更大模型的损失,从而在大规模训练之前将计算预算转化为预期的物理性能。他们发布了五个预训练模型以及完整的训练方案。

关于循环变换器中残差缩放:稳定性与可迁移性

arXiv cs.LG

本文分析了循环(权重共享)变换器中的残差缩放问题,表明权重共享需要比标准残差网络更强的缩放(1/N),并推导出一种因式参数化方法,使得超参数可以在不同循环次数之间迁移,无需重新调参。