测量开放大语言模型中的最大激活值

arXiv cs.CL 论文

摘要

本文测量了来自8个开放LLM家族的27个检查点的最大激活幅度,发现不同家族、架构和训练阶段之间存在显著差异,这对低位量化和部署具有影响。

arXiv:2605.15572v1 Announce Type: new 摘要:激活的动态范围是低位量化、激活缩放和稳定LLM推理的一级约束。先前的工作表征了2024年之前LLaMA风格模型上的异常特征和巨大激活,而下游激活量化堆栈继承了这一图景,并未针对后LLaMA时代开放模型的爆发进行重新审视。我们提出一个面向部署的问题:在现代开放LLM中,激活值能达到多大,且这个幅度如何在不同家族、代际和训练阶段之间变化?在统一流程下(5000样本多领域语料库、家族专属分词、嵌入层、隐藏状态、注意力、MLP/MoE、SwiGLU门控和最终归一化的相同钩子),我们测量了来自8个开放家族的27个检查点的全局和逐层最大值,这些家族涵盖密集、MoE、视觉语言、中间训练和指令微调变体。我们发现:(i) 在可比较的参数数量下,全局最大值跨越近四个数量级,Qwen3.5和MoE检查点在10^2到10^3范围内,而Gemma3-27B-it达到约7×10^5;(ii) 跨家族和跨代比较打破了简单的单调缩放规律;(iii) MoE检查点的峰值比同等规模的密集对应物低14.0至23.4倍,而残差流在22/24个检查点中承载了全局最大值。一个轻量级的INT-8合理性检查表明,测得的最大值与通过激活尺度选择的低位重建误差相关。我们得出结论:最大激活幅度是一个与家族、架构和训练阶段相关的模型属性——而不是大小的简单副产品——在低位部署之前,应与任何开放权重的发布一并测量和报告。代码公开在 https://github.com/clx1415926/Max_act_llm
查看原文
查看缓存全文

缓存时间: 2026/05/18 06:32

# 测量开放大语言模型中的最大激活值
来源:https://arxiv.org/html/2605.15572
陈璐萱1,2\*,田涵2,4\*,陈欣然2,孔瑞2,王芳2,陈佳敏2,李宇晨2†,赵家树2,王帅强2,熊浩一3,尹大伟2†  
1上海交通大学 2百度公司 3独立研究员 4南开大学  
[email protected], [email protected]

###### 摘要

激活值的动态范围是低比特量化、激活值缩放以及稳定 LLM 推理的一阶约束。先前的工作在 2024 年之前的 LLaMA 风格模型上描述了异常特征和大规模激活,而后续的激活值量化堆栈继承了这一图景,并未在后 LLaMA 开放模型爆发期对其进行重新审视。我们提出了一个面向部署的问题:在现代开放 LLM 中,激活值可以有多大?这个大小在不同模型家族、不同代际和不同训练阶段之间如何变化?在一个统一的流程下(5000 样本的多领域语料库、按家族定制的分词、嵌入层、隐藏状态、注意力机制、MLP/MoE、SwiGLU 门控和最终归一化层的相同钩子),我们对来自 8 个开放模型家族的 27 个检查点(涵盖密集、MoE、视觉-语言、中间训练和指令微调变体)测量了全局和逐层最大值。我们发现:(i)在可比较的参数规模下,全局最大值跨越了近四个数量级,Qwen3.5 和 MoE 检查点在 \(10^2\)–\(10^3\) 范围内,而 Gemma3-27B-it 达到约 \(7\times10^5\);(ii)跨家族和跨代际的比较打破了简单的单调缩放规律;(iii)MoE 检查点的峰值比同规模密集对应点低 14.0–23.4 倍,而残差流在 22/24 个检查点中承载了全局最大值。一个轻量级的 INT-8 完整性检查表明,通过激活值缩放选择,测量到的最大值与低比特重建误差存在共变。我们得出结论:最大激活值的大小是一个与模型家族、架构和训练阶段相关的模型属性——而不是参数量的简单副产品——并且在低比特部署之前,应随着任何开放权重的发布一起测量和报告。代码公开在 https://github.com/clx1415926/Max_act\_llm。

††脚注:∗共同第一作者,贡献相等。†通讯作者。

## 1 引言

大语言模型(LLM)的激活值动态范围不仅仅是一个描述性统计量:它决定了推理系统、激活值量化器和缩放规则必须容纳的数值范围 [9 (https://arxiv.org/html/2605.15572#bib.bib1)]。例如,在低比特推理中,每个张量的激活值缩放比例通常被选择为覆盖校准集上观测到的最大幅度。因此,极少数的极大激活值会主导缩放比例,浪费大部分量化级别在很少使用的数值上,并放大普通激活值的重建误差。本文研究一个简单但部署关键的量:**最大激活幅度**,定义为在固定评估协议下,跨层和关键组件观测到的最大绝对值激活值。

极端激活值、大规模激活值和异常特征已从多个角度进行了研究,包括存在性测试、令牌级或特征级定位以及功能干预。然而,部署方面的问题仍缺乏系统性的梳理:在最近的开放 LLM 中,激活值能达到多大?最大的值出现在哪里?它们如何随模型家族、架构、模型代际和训练阶段变化?这个问题日益重要,因为现代开放模型不仅在参数量上有所不同。它们在归一化和训练方案、密集计算与 MoE 计算、视觉-语言适配、指令微调以及发布的中间训练阶段等方面都存在差异。因此,参数规模本身可能不再是激活值范围的可靠代理。

先前关于极端激活值的工作大致沿着两条独立的脉络发展。**可解释性**脉络始于 [11 (https://arxiv.org/html/2605.15572#bib.bib4)],他们基于 \(6\sigma\) 规则在 OPT/BLOOM 上定义了“涌现性异常特征”;[29 (https://arxiv.org/html/2605.15572#bib.bib3)] 引入了“大规模激活”,将其定义为同时满足大幅度(\(|x_i| > 100\))和局部稀疏性(≥1000 倍于每个令牌的中位数)的坐标;[5 (https://arxiv.org/html/2605.15572#bib.bib6)] 将其归因于注意力头需要通过残差流实现“无操作”路由的需要;最近的工作进一步完善了这幅图景——[15 (https://arxiv.org/html/2605.15572#bib.bib28)] 追踪了注意力汇在预训练期间何时出现,[30 (https://arxiv.org/html/2605.15572#bib.bib24)] 将大规模激活的“尖峰”与注意力汇解耦,并将其定位到前归一化 transformer 中早期层的阶梯式上升块。所有这些研究都将该现象归类处理,并分析了一小部分 LLaMA 家族或单一架构的检查点。**量化**脉络则将同样的激活值视为部署障碍:SmoothQuant [33 (https://arxiv.org/html/2605.15572#bib.bib5)]、AWQ [18 (https://arxiv.org/html/2605.15572#bib.bib8)]、GPTQ [12 (https://arxiv.org/html/2605.15572#bib.bib9)] 和 Outlier Suppression+ [32 (https://arxiv.org/html/2605.15572#bib.bib7)] 迁移或重新缩放异常质量;旋转方法 QuaRot [3 (https://arxiv.org/html/2605.15572#bib.bib11)]、SpinQuant [21 (https://arxiv.org/html/2605.15572#bib.bib10)] 和 DuQuant [17 (https://arxiv.org/html/2605.15572#bib.bib30)] 移除异常基底;FlatQuant [31 (https://arxiv.org/html/2605.15572#bib.bib31)] 学习仿射平坦化变换;PrefixQuant [6 (https://arxiv.org/html/2605.15572#bib.bib25)] 和 KIVI [22 (https://arxiv.org/html/2605.15572#bib.bib29)] 针对 KV 缓存;而 FP8 预训练流程 [9 (https://arxiv.org/html/2605.15572#bib.bib1), 10 (https://arxiv.org/html/2605.15572#bib.bib26)] 将类似的缓解措施融入低精度训练,[20 (https://arxiv.org/html/2605.15572#bib.bib27)] 则认为高稀疏度的 MoE 路由进一步改变了激活值模式。所有这些缓解措施都“变换掉了”上限,而不是测量它如何随现代发布版本变化。

尚不清楚这些发现对于最近一波后 LLaMA 开放版本是否仍然成立——Qwen2.5/3/3.5 [26 (https://arxiv.org/html/2605.15572#bib.bib15), 27 (https://arxiv.org/html/2605.15572#bib.bib16)]、Qwen2.5-VL [4 (https://arxiv.org/html/2605.15572#bib.bib17)]、Gemma 2 和 Gemma 3 [13 (https://arxiv.org/html/2605.15572#bib.bib18), 14 (https://arxiv.org/html/2605.15572#bib.bib19)]、Ling-mini 系列 [19 (https://arxiv.org/html/2605.15572#bib.bib20)] 以及 gpt-oss [24 (https://arxiv.org/html/2605.15572#bib.bib21)]——这些模型在多个维度上同时与早期的 LLaMA 风格模型出现分歧:归一化堆栈、门控 MLP 变体、MoE 路由、多模态适配、中间训练版本和指令微调。据我们所知,先前没有研究在统一协议下报告这些模型家族的激活值幅度。我们的论文在两条轴线上都是互补的:我们首次在统一协议下测量了来自 8 个家族的 27 个后 LLaMA 开放检查点的全局最大值 \(M = \max|a|\),将 \(M\) 视为一个连续的、可发布的模型属性(而非二元的异常标志),并将 \(M\) 直接与每个张量的 INT-8 重建误差联系起来——这些输入是目前机制性和量化缓解路径所缺乏的。

我们通过一项关于现代开放 LLM 中最大激活值的统一实证调查来填补这一空白。我们的主要分析涵盖了来自 8 个模型家族的 24 个检查点:Qwen2.5、Qwen2.5-VL、Qwen3、Qwen3.5、Gemma2、Gemma3、Ling 和 GPT-OSS。我们还额外分析了 3 个 Qwen2.5-Instruct 检查点,以分离监督微调的影响。所有检查点都在同一个 5000 样本的多领域语料库上进行评估,文本语料库为每个模型家族重新进行分词。在前向推理过程中,我们使用 PyTorch 钩子从嵌入层、逐层隐藏状态、注意力输出、MLP 或 MoE 输出、SwiGLU 门控预激活以及最终归一化输出中流式传输激活值统计数据。这个协议使我们能够在相同的测量流程下比较全局最大值、逐层峰值轨迹、承载组件、家族和代际效应,以及匹配的架构或训练对比。

**贡献。** 我们的工作做出以下贡献:

- **迄今为止规模最大的跨家族激活值调查。** 我们在一个统一的流程下(5000 样本的多领域语料库、按家族定制的分词、嵌入层、隐藏状态、注意力/MLP/MoE 输出、SwiGLU 门控和最终归一化层的相同钩子),对来自 8 个现代开放家族(Qwen2.5/2.5-VL/3/3.5、Gemma2/3、Ling、GPT-OSS)的 24 个检查点——涵盖密集、MoE、视觉-语言、中间训练和指令微调变体——测量了全局和逐层最大激活值,超越了 [11 (https://arxiv.org/html/2605.15572#bib.bib4), 29 (https://arxiv.org/html/2605.15572#bib.bib3)] 中 LLaMA 衍生的单一文化。
- **“大规模激活”的连续幅度重新表述。** 我们将 [29 (https://arxiv.org/html/2605.15572#bib.bib3)] 的二元同一令牌标准替换为部署相关的统计量 \(M = \max|a|\),并展示了这两种观点可能不一致——一些未通过二元标准的检查点反而是最容易量化的,而一些通过标准的却是最难的。
- **五个匹配设计的比较。** 我们在相同的测量基底上,分离了 (i) 家族内缩放、(ii) 同规模 MoE 与密集对比、(iii) 同家族视觉-语言与纯文本对比、(iv) 同骨干网络 Base 与 Instruct 对比,以及 (v) 同家族训练阶段效应,提供了关于激活值峰值的规模、家族、代际、架构、模态和训练进展的首次观察性分解。
- **具有部署意义的实证发现。** (a) 全局最大值在可比较的参数规模下跨家族变化了几个数量级,打破了简单的单调缩放规律;(b) 残差流在 22/24 个主要检查点中承载了全局最大值;(c) MoE 相对于相近的密集对应物将峰值幅度降低了 14.0–23.4 倍;(d) SFT 主要压缩后期层峰值;(e) 在固定家族和架构下,训练进展可以单调增加全局最大值;(f) 一个轻量级的每张量 INT-8 探测表明,较高的 \(M\) 与显著较低的 SQNR 相关。
- **开放流程和逐检查点统计量。** 我们发布了基于钩子的测量代码和逐检查点激活值统计量,以支持可重复性以及未来的量化、缩放和架构研究。我们**不**声称对观察到的差异存在因果机制(见 D 节 (https://arxiv.org/html/2605.15572#A4))。

## 2 测量协议

参见图题:图 1:流程概览。整体流程如图 1 (https://arxiv.org/html/2605.15572#S2.F1) 所示,包含三个步骤:数据准备、激活值测量和分析。我们使用统一的离线评估协议。我们首先构建一个多领域文本语料库,使用每个模型家族的分词器对相同文本进行分词,对每个检查点运行前向推理,并记录逐层激活值统计量。所有图表均由生成的逐模型统计量产生。

### 2.1 语料库构建

目标评估语料库包含 5000 个样本。数据从 RedPajama [28 (https://arxiv.org/html/2605.15572#bib.bib2)] 来源采样并按内容类型分桶。目标类别数量为:850 个数学或科学样本、850 个代码样本、850 个英文网页样本、850 个知识导向样本(如百科、书籍或问答文本)、400 个中文样本、300 个其他低资源语言样本,以及 900 个额外的英文或混合网页样本。这种设计降低了最大激活值统计量被单一领域主导的风险,并确保语料库涵盖正式文本、自然网页文本、知识密集型文本、代码和多语言内容。

语料库还控制了序列长度的多样性。样本被随机截断为 256、512、1024、2048 或 4096 个令牌,目标比例分别为 1%、1%、2%、3% 和 93%。因此,语料库以长上下文输入为主,同时保留少量短到中等长度的序列。生成的语料库平均长度约为 3899 个令牌,总计约 1950 万个令牌。

为避免分词器不匹配的伪影,文本语料库保持固定,同时为每个模型家族分别进行分词。因此,模型接收到语义相同的文本,但令牌序列与它们自己的分词器对齐,从而减少了由分词器不兼容引起的激活值统计偏差。

### 2.2 模型套件与 instrumentation

我们根据三个原则选择模型。首先,我们覆盖最近主流开放 LLM 家族,而非将研究局限于早期的 LLaMA 风格模型。其次,我们包含多种参数规模和架构形式,使我们能够分离规模、家族和架构的影响。第三,我们包含特殊变体,如 MoE 模型、视觉-语言模型、中间训练检查点和指令微调模型,以便检查最大激活值是否随路由、模态适配、训练进展或监督微调(SFT)而变化。

主要实验包含来自 8 个家族的 24 个检查点:Qwen2.5、Qwen2.5-VL、Qwen3、Qwen3.5、Gemma2、Gemma3、Ling 和 GPT-OSS。除了公开发布的 Gemma3 检查点(是指令微调模型)外,我们将主要分析检查点视为基础或中间训练检查点,如表 2 (https://arxiv.org/html/2605.15572#A1.T2) 所示。因此,Gemma2/Gemma3 的比较应被解释为公开检查点的家族级别对比,而非严格的基础到基础代际消融。

### 2.3 记录的统计量与峰值稳定性

统计量流程包含三个阶段。首先,共享文本语料库使用每个模型家族的分词器转换为令牌序列。其次,每个检查点以其完整权重加载,并仅进行前向推理评估;不修改任何参数。在推理过程中,PyTorch 前向钩子收集六类激活张量:嵌入输出、残差更新后的逐层隐藏状态、逐层注意力输出、逐层 MLP 输出或 MoE 块输出、SwiGLU 风格架构中的 MLP 门控预激活,以及最终 LayerNorm 输出。第三,逐模型的 JSON 统计量用于生成所有图表。对于每个捕获的组件,我们记录均值、标准差、RMS、平均绝对值、最大值、最小值,以及绝对值分位数的流式估计。

由于全局最大激活值是一个极端统计量,我们首先验证它并非由少量偶然样本触发。对于四个代表性模型,我们从原始 5000 样本语料库中构建类别比例相同的 1000 和 2000 样本子集。每个子集大小重复 5 次,每次重复运行完整的激活扫描。得到的峰值一致地再现了 5k 参考运行的数量级。在 1k 重复中,Qwen3-30B-A3B 的最大变异系数为 10.1%,在 2k 重复中为 8.2%。这些结果表明,报告的最大激活值

相似文章

大型语言模型有多像人类?一个关注语域的语言评估框架

arXiv cs.CL

本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。