大型语言模型中的层次化分级

arXiv cs.LG 论文

摘要

本文介绍了分级大型语言模型(GLLMs),这是一种代数框架,对 Transformer 表示施加层次化分级,理论上可提高语言层次结构的样本效率,同时保持推理复杂度不变。该框架提供了几何与信息论角度的论证,并概述了一种分级选择流程,该流程在配套手稿中得到验证。

arXiv:2607.22757v1 公告类型:新 摘要:我们介绍了分级大型语言模型(GLLMs),这是一种代数框架,为 Transformer 的表示空间赋予一种分级,并通过嵌入层、自注意力机制以及训练目标传播诱导的加权标量作用。该构建将分级神经网络和分级 Transformer 的理论扩展到自回归语言模型,同时保持表达能力、渐近计算复杂性和推理成本不变。 主导的几何图像来自几何不变量理论。分级带来的优势由分级环面上的 Kempf–Ness 泛函表达;相较于均匀架构有所改进的分级构成一个开放凸锥,其成员资格由 Hilbert–Mumford 类型准则判定,该准则将分级方向与目标和数据的两个可测剖面配对;最优分级是两个矩映射的公共点,具有闭式解;而普通 Transformer 则表现为该锥边界上的一个半稳定各向同性点,是更大分级族中的一个成员,而非特殊最优解。 此外,对于分层目标,我们证明了分级先验与没有先验之间的极小极大分离:在所有估计量中,分级目标类与均匀目标类的风险在一个明确的样本量窗口内分离,分离因子在几何分层下随层数增加呈指数衰减。这两个剖面均可离线估计,因此最优分级构成一个凸规划的解,该规划可在训练开始前得到验证。由于分级在训练后被吸收到学习参数中,每个 GLLM 都可编译为具有相同架构和推理复杂度的标准 Transformer。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:21

# 大型语言模型中的层次化分级  
来源:https://arxiv.org/html/2607.22757  
T. Shaska  
计算机科学与工程系,奥克兰大学,罗切斯特,密歇根州 48309  
[email protected] (mailto:[email protected])  

###### 摘要。  
我们引入了分级大型语言模型(GLLMs),这是一种代数框架,它为transformer的表示空间配备了一种分级结构,并通过嵌入、自注意力和训练目标传播由此诱导的加权标量作用。该构造将分级神经网络和分级transformer的理论扩展到了自回归语言模型,同时保持了表达能力、渐近计算复杂性和推理成本。主导的几何图景是几何不变量理论。分级的好处通过分级环面上的Kempf–Ness泛函来表达;比统一架构有所改进的分级构成一个开凸锥,其成员资格由一类Hilbert–Mumford型准则决定,该准则将分级方向与目标和数据的两个可测量轮廓配对;最优分级是两个矩映射的重合点,具有闭式解;而普通transformer则作为锥边界上的一个半稳定各向同性点出现:它是更大分级族的一员,而非一个特殊的最优解。另外,对于层次分层的目标,我们证明了分级先验与其缺失之间的极小极大分离:在所有估计量上,分级和均匀目标类别的风险在一个明确的样本量窗口内分离,其因子在几何分层下随层级数量指数衰减。两个轮廓都可以离线估计,因此在训练开始之前,最优分级就解决了经过认证的凸规划问题。由于训练后分级被吸收到学习参数中,每个GLLM都可以编译成一个标准transformer,具有完全相同的架构和推理复杂度。我们最后讨论了在没有规范分级的领域(以自然语言为例)中的分级选择程序,以及一个预注册的验证计划,其实验结果将在配套手稿中报告。  

###### 关键词和短语:  
分级向量空间,分级transformer,大型语言模型,层次化注意力,样本复杂度,极小极大下界,归纳偏置  

###### 2020 数学主题分类:  
68T07, 68T50, 68Q32, 62C20, 16W50  

## 1. 引言  

大型语言模型(LLMs)已经从统计 n-gram 估计器发展为拥有 O(10^11) 个参数、在 O(10^13) 个 token 上训练的 transformer 系统,并且现在能够生成相对流畅的文本、执行多步骤任务、支持代码合成和科学工作;参见 [radford2019language] 以及其他众多来源。这一进展几乎完全来自规模扩展;参见 [kaplan2020scaling]。其背后的架构是统一的:每个 token 占据相同的空间,该空间的每个坐标权重相同,每个注意力头在一个平坦、各向同性的几何结构上进行计算,其中没有哪个方向是特殊的。相比之下,语言是分层的。子词单元组成词,词组成短语和从句,从句组成句子,句子组成话语,话语组成语用推理。一个没有这种层次结构表示的模型必须从数据中恢复它。这种恢复的成本是第2节 (https://arxiv.org/html/2607.22757#S2) 集中讨论的问题。答案主要由两个论述给出。第一个是经典猜想:一个没有结构先验的架构必须从长度为 n 的输入中,区分深度为 L 的语法所允许的 Ω(n^L) 个解析树,其样本成本随 L 指数增长(猜想1 (https://arxiv.org/html/2607.22757#Thmcon1))。这个猜想推动了分级程序的发展,但下面的结果都不依赖于它。第二个更弱,可以在不训练模型的情况下在标注语料库上测量,并且是这个框架所依赖的假设:在语言中,决定层次化目标的特征并不是承载语料库方差的特征(假设1 (https://arxiv.org/html/2607.22757#Thmassum1))。  

本工作引入了分级大型语言模型(GLLMs),它通过表示空间的代数结构而非新的架构组件来提供缺失的先验。该构建建立在关于机器学习中分级向量空间的一系列工作之上:关于分级空间的人工神经网络 [2024-02]、具有分级神经元、激活函数和损失函数的分级神经网络 [sh-89],以及包含线性分级Transformer(LGT)和指数分级Transformer(EGT)的分级Transformer框架 [sh-95]。所有这些的底层对象是一个分级向量空间 R^n_q:它是 R^n 的一个副本,配备了一个分级元组 q = (q_0, ..., q_{n-1}) 和诱导的标量作用 λ ⋆ x = (λ^{q_0} x_0, ..., λ^{q_{n-1}} x_{n-1}), λ > 1。一个分级元组说明了哪些坐标重要以及重要多少。为嵌入空间的维度分配分级,并通过注意力、嵌入和损失函数传播该作用,会放大承载句法核心、语义核和语用信号的子空间,并降低其余部分的权重。没有移除任何东西:分级改变了表示空间的度量,而保持其上的计算不变,因此表达能力、可并行性和自回归解码都得以保留。改变的是模型搜索所依据的几何结构。  

该结构包含三个部分和一个成本分析。第3节 (https://arxiv.org/html/2607.22757#S3) 在因果解码器堆栈内开发了指数分级多头自注意力(EG-MHSA),并确立了三个事实来定位其优势。分级使注意力的渐近成本保持不变,每层为 O(n^2 d + n d^2)(命题4 (https://arxiv.org/html/2607.22757#Thmprop4))。分级矩阵通过一个可逆替换被吸收到投影权重中(注1 (https://arxiv.org/html/2607.22757#Thmrem1)),因此训练后的 GLLM 可以编译成一个标准 Transformer,具有完全相同的架构,并以零部署成本承载其先验(推论1 (https://arxiv.org/html/2607.22757#Thmcor1));表1 (https://arxiv.org/html/2607.22757#S2.T1) 中的变体都没有这个属性,因为循环和稀疏性将其偏置编码到计算中,并在每次前向传播时为其付出代价。在固定的范数预算下,分级约束集是一个椭球体,其轴与分级对齐,并且严格包含均匀球(命题5 (https://arxiv.org/html/2607.22757#Thmprop5)),因此优势不可能来自可表示性:在共同预算下更大的类别反而会损害泛化性能,而不是改善它。这些事实共同将优势定位于表示给定目标所需的范数,从而定位于学习它所需的数据。  

第4节 (https://arxiv.org/html/2607.22757#S4) 引入了多层次分级嵌入(MLGE),将 R^d = ⊕_{l=0}^{L-1} V_l 分解为特定层次的子空间,并执行了该分析。第5节 (https://arxiv.org/html/2607.22757#S5) 将分级扩展到训练目标,并精确刻画了它何时对语料库条件保持一致(命题9 (https://arxiv.org/html/2607.22757#Thmprop9))。第8节 (https://arxiv.org/html/2607.22757#S8) 陈述了将测试所得预测的程序,而第6节 (https://arxiv.org/html/2607.22757#S6) 将结果整合到框架的主要目的中:一个在没有任何分级的领域中用于选择、认证和定价分级的程序。  

分析得出了本文的中心量。记 α 为目标能量在分级基上的分布特征(profile),τ 为数据方差在分级基上的分布特征(定义2 (https://arxiv.org/html/2607.22757#Thmdefn2))。那么,基于 Rademacher 复杂度的分级类别的样本复杂度与均匀类别的样本复杂度之比为:  

Λ(g) = (∑_{j=1}^d α_j g_j^{-2}) (∑_{j=1}^d τ_j g_j^2),  

min_{g ∈ R_{>0}^d} Λ(g) = (∑_{j=1}^d √(α_j τ_j))^2 = BC(α, τ)^2 ≤ 1,  

等式成立当且仅当 α = τ(命题7 (https://arxiv.org/html/2607.22757#Thmprop7))。因此,分级的全部好处就是 Bhattacharyya 亲和度,即目标分配权重的分布与数据分配方差的分布之间的重合程度。分级并不创造信息:它将关于目标的正确先验转化为以该比率为比例的样本复杂度降低,而错误的先验则转化为以相同比率的样本复杂度增加。在轮廓的几何分层下,该比率随层级数量指数衰减(推论3 (https://arxiv.org/html/2607.22757#Thmcor3))。这是任何指数级(关于 L 的)陈述进入本工作的唯一途径,并且它是作为一个假设出现,而非一个定理。  

命题8 (https://arxiv.org/html/2607.22757#Thmprop8) 将该量解读为对分级本身的一个条件,它是本文的主要正面结果。分级界限严格更小的分级形成一个开凸集,沿 1 方向平移不变,因此限制为非负有理数没有损失。当且仅当 ⟨q, α - τ⟩ > 0 时,即目标能量超过数据方差的坐标上设置高分,反之设置低分,一阶近似下就进入该集合。该集合非空当且仅当 α ≠ τ,而标准 transformer(设 g = 1)位于其边界上:那里的增益恰好为 1,梯度为 2(log λ)(τ - α) ≠ 0。因此,各向同性不是样本复杂度景观的局部最优。它的规范轨道是一组唯一的分级,使得对于每个语料库和每个目标,增益等于 1——这是忽略轮廓的选择——而从该点开始,沿着两个轮廓确定的方向存在一个下降方向。两个轮廓都可以离线估计,因此该内积的符号可以在任何预训练开始之前进行检查(注17 (https://arxiv.org/html/2607.22757#Thmrem17))。该区域内的最优分级则是凸规划的解,而非搜索的结果(推论4 (https://arxiv.org/html/2607.22757#Thmcor4)),并投影到命题10 (https://arxiv.org/html/2607.22757#Thmprop10) 所允许的裁剪区域。从估计轮廓计算出的分级所获得的增益,在估计误差下仅以二阶量退化(引理2 (https://arxiv.org/html/2607.22757#Thmlem2)):增益的梯度在最优处为零,因此该框架在需要保护的地方恰好得到了保护。  

这个选择问题的几何结构在几何不变量理论中具有自然的解释,详见第6.7节 (https://arxiv.org/html/2607.22757#S6.SS7)。可行集是一个开凸锥;准则 ⟨q, α - τ⟩ > 0 是一个 Hilbert–Mumford 型配对,它决定了哪些方向从均匀点下降;而普通 transformer 作为分级作用的半稳定点位于边界上。详细的推导推迟到该小节,以便先用初等语言陈述统计内容。  

三个事实确定了主张的定位。优势不在于表达能力:根据注1 (https://arxiv.org/html/2607.22757#Thmrem1) 和注3 (https://arxiv.org/html/2607.22757#Thmrem3),分级和未分级模型实现相同的函数类,分级的内容在于参数化、初始化和隐式偏置。优势也不在于优化:指数级重新缩放使平滑常数退化了一个因子 λ^{q_max} ≥ 1,因此分级模型可用的驻点保证比其未分级对应物更弱(引理5 (https://arxiv.org/html/2607.22757#Thmlem5) 和 5.1 (https://arxiv.org/html/2607.22757#S5.Thmthm1))。这种不对称性是这个主张的实质,并且它的两个方面都由同一个常数定价:在 clip λ^{q_max} ≤ C 下,优化步数的损失最多为 C,统一关于 L 和轮廓;而 token 的节省最多为 C^2(注16 (https://arxiv.org/html/2607.22757#Thmrem16),命题10 (https://arxiv.org/html/2607.22757#Thmprop10))。代价关于 clip 是线性的,而购买是二次的,因此在任何设置下交易都是有利的,并且当 clip 打开时,就达到了推论3 (https://arxiv.org/html/2607.22757#Thmcor3) 的指数级区域。分级花费一种廉价资源——每步的计算——来节省一种昂贵的资源——高质量的 token。优势存在于表示给定目标所需的范数中,因此存在于学习它所需的数据中,这正是命题7 (https://arxiv.org/html/2607.22757#Thmprop7) 和 8 (https://arxiv.org/html/2607.22757#Thmprop8) 以闭式解放置它的地方。  

命题7 (https://arxiv.org/html/2607.22757#Thmprop7) 比较了两个上界,针对的是由线性读出组成的分级嵌入。由于分级和未分级模型实现相同的函数,该框架声称的分离是分级先验与其缺失之间的分离,而非两个假设类之间的分离。将界限的比较转化为那种分离的是一个匹配的极小极大下界,在均匀目标类上,且估计量不受限制。定理4.1 (https://arxiv.org/html/2607.22757#S4.Thmthm1) 在推论3 (https://arxiv.org/html/2607.22757#Thmcor3) 的分层分层(level-stratified)模式下证明了这一点:在平方损失和所有估计量下,极小极大风险的比值为 Θ(Λ(g)),在一个明确的样本量窗口内,因此在计划配置所处的模式下,分离得以建立。一般情况是猜想2 (https://arxiv.org/html/2607.22757#Thmcon2),而第8.4节 (https://arxiv.org/html/2607.22757#S8.SS4) 记录了其证明所需的内容;注11 (https://arxiv.org/html/2607.22757#Thmrem11) 记录了范围。本手稿解决了两个局限性——引理2 (https://arxiv.org/html/2607.22757#Thmlem2) 中估计分级的自适应成本,以及定理4.1 (https://arxiv.org/html/2607.22757#S4.Thmthm1) 中分层模式下的下界——而剩下的每一个都指出了修复所需的工具。  

这些成本很小,是计算出来的而不是声称的。分级精确地保持了注意力的渐近复杂度(命题4 (https://arxiv.org/html/2607.22757#Thmprop4))。训练开销主要由 d^2 参数级别的投影主导,对于第8.1.1节 (https://arxiv.org/html/2607.22757#S8.SS1.SSS1) 的配置,在 345M 参数时为 0.33%,在 7B 参数时为 0.24%;这源于在这些规模下 d^2 ≪ N,并且必须在其他规模下重新计算。在部署时开销为零:根据推论1 (https://arxiv.org/html/2607.22757#Thmcor1) 和 3 (https://arxiv.org/html/2607.22757#Thmrem3),训练后的 GLLM 可以编译成一个标准 Transformer,具有完全相同的架构和相同的推理成本,因此训练数字是先前先验终身总成本的上限。该框架...

相似文章

理解大型语言模型

arXiv cs.CL

本章回顾了当前对大型语言模型的理解,讨论了它们的Transformer架构、类似人类认知的涌现能力,以及关于LLM是真正理解还是仅仅模拟理解的争论。

GiLT:利用依存图增强Transformer语言模型

arXiv cs.CL

论文提出了GiLT(Graph-Infused Layers Transformer Language Model),它通过在token预测过程中增量构建的依存图特征来调整注意力权重,从而改善句法泛化能力,在保持竞争性困惑度的同时超越基线模型。

大型语言模型是否适用于图计算?进展与展望

arXiv cs.CL

本综述回顾了大型语言模型在图计算中的应用,将其分为两种范式:LLM作为执行器和LLM作为规划器。研究发现,LLM在简单任务上表现良好,但在大规模精确计算方面不可靠,并提出了未来方向。

面向大型语言模型的卷积

arXiv cs.CL

本技术报告探讨了在Transformer块中为大型语言模型的查询/键/值投影添加轻量级深度可分离卷积,提供局部归纳偏置,以极小的参数成本提高下游任务准确性。