神经坍缩是被禁止的:语言模型中的信息下限
摘要
本文认为,语言模型表示中的类内方差并非不完全的神经坍缩,而是分配的信息存储,且这种分配服从信息下限定律。在14个模型中,宏观类别结构仅承载4–12%的表示方差,而词元内上下文则占据79–91%。
查看缓存全文
缓存时间: 2026/07/13 08:00
# 语言模型中的信息地板
来源:https://arxiv.org/html/2607.09487
## 神经坍缩是被禁止的:语言模型中的信息地板(2026 年 7 月)
###### 摘要
语言模型表示中的类内方差通常被认为是未完成的神经坍缩。我们认为这是分配的信息存储,并且这种分配服从一条定律。一个单行的中心化恒等式否定了包括我们自己早期的一些单纯形等角紧框架(ETF)论断;在 14 个模型的无量纲方差份额中,宏观类别结构仅占表示方差的 4–12%,而词元内上下文占 79–91%,这一比例在 100 倍的参数范围内保持稳定。在理论方面,词元级别的权重衰减根据类别的类型数量(而非出现次数)对其进行惩罚,将下一个词元预测简化为一个不平衡的 \(K\) 类问题,其最优解按类型数量对类别范数进行排序。一个反向的(converse)下界(针对二元类别已证明)迫使类内分散至少与条件互信息 \(I(\text{token};\text{context}\mid\text{category})\) 成比例。这条定律成立:在每一个测试的模型和划分中,在无模型估计下,甚至在跨模型情况下(一个模型的信息可以预测另一个模型的分散),恒等分散(而非总方差)追踪这一信息;在预训练过程中,类别份额会超调、衰减然后部分恢复,因为它必须携带的信息从未消失。
## 1 引言
在图像分类中,训练的终末期是几何结构收紧的时候:类内变异性坍缩,类均值收敛到一个单纯形等角紧框架,即 Papyan 等人 [12](https://arxiv.org/html/2607.09487#bib.bib12) 提出的神经坍缩 (NC)。语言模型则反转了这一剧本。通过测量公开预训练检查点上隐藏状态的几何结构,我们发现类别层次的结构几乎立即结晶、超调,然后在训练的很长剩余时间中部分溶解,最后,在大多数模型大小中,部分回归,而困惑度却单调下降。语言模型终末期并没有完成其表示的坍缩;它重新分配了表示。图 1 (https://arxiv.org/html/2607.09487#S1.F1) 预览了这种反转带来的三个发现。
***
**图 1:** (a) 在 13 个模型中,方差由词元内上下文主导;宏观类别结构只是一小片,在 100 倍参数范围内保持稳定。(b) 类内恒等分散追踪模型实现的类别条件信息 \(\hat{I}(c;\mathrm{ctx}\mid S_{k})\)(合并偏相关 \(r=0.755\)),这是第 3 节 (https://arxiv.org/html/2607.09487#S3) 的信息地板所要求的分散通道。(c) 随着预训练进行,类别间份额超调、衰减并部分恢复,在 Pythia(虚线)和 OLMo-2(实线)中共享一个词元轴。
我们认为,这个看似悖论的解决是信息论的而非几何的,并且它重新定义了语言模型中类内方差的性质。以往从分类任务继承来的解读,将残余的类内变异性视为未完成的坍缩:更多规模或更多训练应该可以消除的噪声。仅从测量角度,这种解读就站不住脚。使用表示方差的无量纲三层分解(词元内上下文变异性、类内词元恒等性、类别结构),我们在来自三个家族(GPT-2、Pythia、Qwen2.5;70M–6.9B 参数)的 14 个模型中发现:词元内上下文变异性占总方差的 79–91%(一个退化模型中为 69%),词元恒等性占 4–13%,宏观类别结构仅占 4–12%(同一个退化模型中为 28%),并且这种分配在 100 倍的参数范围内以及从 500 到 26,000 个词元类型的覆盖范围内大致稳定。这种分配看起来是由数据决定的,而非容量。与此同时,约 60% 的模型交叉熵损失是在 \(K=10\) 的类别内解决的,因此方差主导的成分也是损失主导的成分。我们的解释是,这个方差是模型存储上下文的地方,并且这种分配服从一条具有有证明下界的定律。
在理论方面(第 3 节 (https://arxiv.org/html/2607.09487#S3)),我们做了三步推进。首先,一个单行的中心化恒等式表明,任何中心化的、近似等范数配置的平均成对余弦都被固定在接近 \(-1/(K-1)\) 的位置,这否定了单纯形 ETF 测量的一系列论断,包括我们自己在早期版本中报告的。其次,一个精确分解表明,词元级别的权重衰减并不均匀地作用于类别结构。它按类别 *类型数量*(包含的不同词元数)比例惩罚该类别的平均头部行,而类别的出现 *质量*(总频率)仅通过损失进入。在类内无上下文读取情况下,下一个词元预测于是简化为一个不平衡的 \(K\) 类问题——当类内条件分布均匀时精确成立,一般情况有一个显式的耦合项。求解 \(K=2\) 情况表明,其范数通过诱导的衰减和偏移由类型数量排序,而非质量,因此最优解是一个扭曲的框架而非正则单纯形;对于一般的 \(K\),我们得到了闭式最优解(一个斜投影,在等衰减时简化为 SELI 的中心化矩阵),并有完整证明,并进行了实证检验。第三,一个反向(converse)下界:如果类内选择依赖于上下文,特征就不能坍缩;我们在二元情况下证明,沿着读取方向的分散至少与条件互信息 \(I(\mathrm{token};\mathrm{context}\mid\mathrm{category})\) 成比例。该下界约束了总类内分散,从而确立了上下文相关选择需要分散,但没有说明哪个成分承载它。因此我们分别测试了各个成分,发现该要求是局部化的:类均值的词元恒等分散追踪条件信息(第 4 节 (https://arxiv.org/html/2607.09487#S4)),而总方差则不然,这与静态的类内偏好可以通过头部行表达而上下文相关的则不能一致。
通过单次推理过程估计每个类别的模型实现的条件信息,我们发现恒等分散在 16 个模型-划分组合中的 16 个(四个模型,四个划分)中追踪该信息,只要划分提供足够多的类别,Spearman 相关系数在 0.58–0.85 之间,并且在控制边际熵、类别质量和类型数量后,合并的模型内等级偏相关为 \(r=0.755\)(\(p=3\times 10^{-30}\));在 50,000 序列的训练语料库上,对全部 24k 类型覆盖词汇重复该估计器,在 12 个额外组合中的 12 个中复现了该定律(合并偏相关 \(r=0.773\),\(n=200\) 个类别)。总方差则没有显示任何关系(混合符号接近零),并且恒等分散追踪条件信息的强度大约是追踪边际熵的两倍:负对照表现符合预期。
第 5 节 (https://arxiv.org/html/2607.09487#S5) 测试了约简的框架方面:中心化类别质心范数在 14 个模型中的 14 个中下降,在两个可分离的通道中;类型数量通道正是我们的 \(K=2\) 解在一阶下预测的,而质量通道主要继承自词元级频率-范数关系,并通过频率匹配的零模型控制。当直接从模型的解嵌入行读取预测时,在 24 个模型-体制-划分单元中的 24 个中观察到相同的不对称性。
第 6 节 (https://arxiv.org/html/2607.09487#S6) 使用相同的无量纲工具回到动态分析。在 Pythia 检查点上,类别间份额在第 32–64 步急剧上升,在前一千步内达到峰值 0.15–0.21,在训练中期衰减到 0.05–0.07,然后在四种大小中的四种中恢复 1.5–1.8 倍;词元内份额相应地下降并重新扩张,这种模式与(尽管本身不能证明)上下文相关选择的存储成本增长相一致。我们在预注册标准下对 OLMo-2 预训练检查点重复该协议:四个中的三个通过,且轨迹的最低点落在与 Pythia 相同的词元计数上。最近有报道称在合成设置中下一个词元预测的瞬态语义几何结构是向对称性的单调溶解 [19](https://arxiv.org/html/2607.09487#bib.bib19),以及在没有类别结构或坍缩视角的真实检查点上追踪到的非单调谱几何 [7](https://arxiv.org/html/2607.09487#bib.bib7);我们使用的分解显示了非单调性所在,并且表明在真实模型上故事有不同的结局:类别结构部分回归,因为它必须携带的信息从未消失。
#### 贡献。
1. **测量**。一个推翻平均余弦 ETF 证据的中心化恒等式;一个无量纲的三级方差分解;跨 14 个模型和两个覆盖范围的分配图景;以及一个陷阱附录,其中协方差匹配的高斯零模型将 k-means 与混洗之间的分离(基于该分离的量级论断——包括我们自己的)削减到了 1.1–1.75 的超额因子(一个下界,零模型故意严格,但这是因子而非数量级)。
2. **理论**。将带有词元级权重衰减的下一个词元预测精确约简为一个大小加权、有偏移的不平衡 \(K\) 类问题(定理 1 (https://arxiv.org/html/2607.09487#Thmtheorem1));诱导出的双重加权(风险中的质量,衰减和偏移中的类型数量),精确求解了 \(K=2\) 情况,表明是衰减而非质量决定了范数顺序(命题 3 (https://arxiv.org/html/2607.09487#Thmproposition3));以及一个已证明的类内分散信息下界(命题 4 (https://arxiv.org/html/2607.09487#Thmproposition4)),一般几何结构以闭式、完全证明的方式获得(定理 2 (https://arxiv.org/html/2607.09487#Thmtheorem2))。
3. **一个经验定律**。在每个测试的模型和划分中,类内恒等分散以理论区分的方式追踪模型实现的条件信息。
4. **动态**。在两个家族(Pythia 以及符合预注册标准的 OLMo-2)的公开预训练检查点上,类别结构结晶、超调、衰减并部分恢复,超调后最小值在词元轴上跨家族对齐;该模式对平均余弦度量不可见,与全局谱解释不同,并且与合成设置中语义结构单调溶解的外推相矛盾。
#### 证明了什么、测量了什么、推测了什么。
我们在行内标记每一个论断。每个理论论断都有完整证明;一般 \(K\) 几何结构的最终符号条件(在早期草稿中已数值验证)现在以闭式证明(附录 B.4 (https://arxiv.org/html/2607.09487#A2.SS4)),并且没有依赖现有的不平衡无约束特征模型 (UFM) 定理(这些定理既不覆盖每类衰减也不覆盖偏移)。值得事先说明的适用范围说明:一般 \(K\) 的下界仍是一个猜想(二元情况已证明),第 32–64 步的动态起始只能在 Pythia 上解析(其公开检查点网格足够密集);OLMo-2 的网格则不够。附录按名称审计了我们早期版本中当前工具推翻的论断。
## 2 无伪迹的方差分配测量
在我们问残余类内方差是未完成坍缩还是存储信息之前,我们需要一个能经受住自身伪迹考验的分配测量。本节构建这样一个测量并报告其结果;附录 A (https://arxiv.org/html/2607.09487#A1) 记录了未能经受考验的度量。
#### 提取协议。
对于每个模型,我们在 WikiText-103 [8](https://arxiv.org/html/2607.09487#bib.bib8) 上计算每个词元的类别统计信息:上下文被打包成 512 词元序列,对于每个在下一个词元位置上至少出现 50 次的词汇项 \(c\),我们记录第 \(L-1\) 层隐藏状态的均值 \(\boldsymbol{\mu}_{c}\)、每维方差和计数 \(n_c\)。在验证划分上,这为每个模型产生大约 500–560 个覆盖类型(依赖于分词器的频繁词元子集);在训练划分(50,000 序列)上,覆盖范围增加到 24,000–26,000 个类型,使所有模型完全处于过完备区域 (\(C/d \in [12, 34]\))。我们分析了跨 GPT-2 (124M–1.5B)、Pythia (70M–6.9B) [2](https://arxiv.org/html/2607.09487#bib.bib2) 和 Qwen2.5 (0.5B–3B) 的 14 个预训练模型。类别通过对类均值进行 \(k\)-means 聚类形成(\(K=10\),固定种子)作为说明性划分;没有任何东西依赖于这一选择,并且我们在全文遍历 \(K \in \{10,20,50\}\) 以及一个外生的通用词性划分 [14](https://arxiv.org/html/2607.09487#bib.bib14)。聚类是种子稳定的(平均调整 Rand 指数 0.76,跨重启),并与粗略的词性结构部分对齐(V-测度 0.37)。
#### 三级分解。
所有标题性的量都是从总方差的确切定律导出的无量纲份额。以计数 \(n_c\) 为权重,类别分配 \(k(c)\),质量加权的类别均值 \(\mathbf{m}_k\) 和全局均值 \(\boldsymbol{\mu}_G\),总方差精确分解为:
\[
\underbrace{\textstyle\sum_{c} n_c \sigma_c^2}_{\text{词元内}} \;+\; \underbrace{\textstyle\sum_{c} n_c \|\boldsymbol{\mu}_c - \mathbf{m}_{k(c)}\|^2}_{\text{类内词元恒等}} \;+\; \underbrace{\textstyle\sum_{k} N_k \|\mathbf{m}_k - \boldsymbol{\mu}_G\|^2}_{\text{类别间}},
\]
其中 \(\sigma_c^2\) 是求和后的每维词元内方差,\(N_k\) 是类别质量。份额是每一项除以总和。由于份额是无量纲的,它们可以在嵌入维度、模型规模、检查点和覆盖范围之间进行比较;附录 A (https://arxiv.org/html/2607.09487#A1) 记录了在本文早期版本中,维度度量(类距离归一化方差 CDNV 的 \(\alpha=2\) 变体)如何制造出虚假的两个数量级的缩放趋势。
***
**表 1:** 在 \(L-1\) 层的方差分配(计数加权份额;\(K=10\) 说明性划分)。CDNV 是标准的( \(\alpha=0\) )聚类级别值,以便与神经坍缩文献进行比较。底部块:在过完备区域的训练划分提取。GPT-2 XL 是一个已知的退化情况(质心近乎共线)。
***
**图 2:** 14 个模型在验证覆盖范围上以及 8 个训练划分提取(24k–26k 类型)下的表示方差分配(计数加权份额,\(K=10\) 说明性划分)。词元内上下文变异性在所有地方占主导地位;宏观类别结构只是一小片;该图景跨家族、100 倍参数范围和 45 倍的覆盖类型变化保持稳定。
#### 分配图景相似文章
语言模型中连续混合坍塌的动态特性
本文探讨了预训练语言模型在推理过程中未能保留token嵌入连续混合的原因,确定了架构扭曲和动态系统效应为主要失败来源。
大语言模型顺序后训练中的表征坍塌
本文研究了大型语言模型在顺序后训练中的表征坍塌现象,表明重复的适应阶段会压缩内部表征,降低可塑性和域外泛化能力。作者提出了轻量级干预措施,在不牺牲行为增益的前提下保留未来的可学习性。
类别编码在神经坍缩中的作用
本文研究了类别标签编码如何影响神经网络分类器中的神经坍缩,表明在独热编码和平衡数据下,随着偏置正则化增加,未中心化的均值特征从单纯形等角紧框架转变为正交框架。
信息阴影:衡量语言模型可学习的结构性限制
本文介绍了“信息阴影”概念——即语言模型从文本中学习时面临的结构性限制,这些限制不随规模、数据或架构改变而改变。它识别了三种不同类型的限制,并提供了检测这些限制的探针,对基准设计和能力审计具有启示意义。
Decodable But Not Detachable: Training Data Granularity Determines Parametric Modularity in Large Language Models
This paper investigates when large language models develop domain-specific parametric shells (causally necessary neuron populations), finding that modular training data at the token level (e.g., languages, code) produces functional shells, while academic subject domains do not, despite being linearly decodable.