训练Transformer:初始化时每层权重W = V·Uᵀ,揭示语料库确定的最优秩 — 寻找arXiv背书人 (cs.LG) [D]

Reddit r/MachineLearning 论文

摘要

本文为Transformer提出原生因子化权重(Native Factorized Weights),即每个线性层从初始化开始就训练为两个低秩矩阵的乘积。实验表明,存在一个由语料库决定的最优秩,可最小化验证损失,并形成一个泛化区间,以更少的参数超越密集基线模型。

我一直在运行一个实验,我称之为原生因子化权重(Native Factorized Weights, NFW):不是训练标准Transformer再事后压缩,而是每个线性层在初始化时就被替换为W = V·Uᵀ,并从头开始以这种形式训练。没有事后SVD。没有在预训练模型上附加LoRA适配器。因子化是模型的基础,因此这些层被称为“Sliver层”,因为每层由两个低秩矩阵组成。比较:密集W矩阵使用n²个参数,而U和V使用2nr个参数。 它奏效了。在合适的秩下,NFW模型的层数与密集基线相同,但参数数量只有其一部分,性能却更优。由于参数数量大幅降低,可以将预算用于将隐藏维度加倍。因此,论文中的大多数比较都是配置D(密集;n×n权重)与配置S{r}(秩为r的Sliver;2nr + 2nr权重)。对于r << n,配置S实现了结构压缩。这本身就很有趣。但更令人惊讶的发现是为什么——以及合适秩的边界在哪里。 核心发现 存在一个由语料库决定的最优秩r*,可最小化验证损失。它不是模型规模的函数——而是训练语料库的函数。超过第二个阈值r'(记忆化开始点),模型获得足够容量,开始在训练预算内记忆,验证损失开始上升。这创建了一个泛化区间[r*, r'),在此区间内训练在结构上是安全的。仅从损失曲线本身并不清楚你是否处于区间内,直到你映射完整的秩扫描。 WikiText-2上的结果(n=2048, L=4 Transformer, 20k步) 不同秩下NFW训练结果的曲线,与密集W基线对比 上图显示20,000步时的验证损失,清晰表明最优秩被两侧边界限定。这与训练过程中任何步骤观察到的最低验证损失评估相符: 密集基线:验证困惑度6.219,训练/验证差距1.504 NFW r=8:验证7.423(欠拟合区间) NFW r=16:验证6.228(接近r*) NFW r=32:验证5.617,差距1.302 —— 以更少参数击败密集模型 NFW r=64:验证5.849,差距1.841(差距扩大——接近r') NFW r=128:验证6.083,差距2.603(记忆化压力明显) 在生产训练条件下(dropout + warmup) 密集 + dropout/warmup:最低验证5.759,但第9600步后发散——差距飙升至3.9 NFW r=32 + dropout/warmup:验证5.545,差距1.148 —— 全程稳定 秩约束和随机正则化作用于正交的失败模式。Dropout对抗噪声;秩上限对抗记忆化。带有dropout的密集模型仍然可以记忆——只是带有噪声地记忆。而秩约束模型在结构上无法做到。 几何解释 训练好的Transformer中的权重矩阵位于低秩流形附近。NFW只是将该流形作为训练空间,而非背景空间。r*是流形维度与语料库信息量匹配的点。r'是流形宽度足以容纳训练集的点。在当前的W矩阵中,训练结果难以清晰分解为U和V,因为开放空间允许噪声累积并混淆蒸馏。通过使用U和V作为唯一允许的存储方式,噪声永远不被允许。 计算优势 当前该结构尚未有原生推理内核。为了进行推理,必须将W矩阵实例化,以便执行标准Transformer推理。如果这项研究有价值且该模型类型值得采用,为其设计的原生内核将因参数数量减少而实现类似的计算压缩比。 代码与结果 GitHub:[https://github.com/Malkom1366/native-factorized-weights](vscode-file://vscode-app/c:/Users/malko/AppData/Local/Programs/Microsoft%20VS%20Code/fcf604774b/resources/app/out/vs/code/electron-browser/workbench/workbench.html) 完整的结果JSON、训练脚本和Sliver层实现都在那里。 请求 我是一名独立研究员。我已准备好完整(更长的)论文,但arXiv要求首次提交cs.LG分类的论文需要背书。如果您符合条件,并且在查看仓库后愿意为我背书,我将不胜感激。我非常希望其他人能够复现这些结果,并确认它们在其他语料库上也成立。
查看原文

相似文章

权重稀疏Transformer中的单个参数具有可解释性

arXiv cs.LG

本文介绍了一种自动化的大语言模型流水线,用于生成并验证关于Transformer中单个权重何时起作用的、人类可读的描述。研究发现,在权重稀疏的Transformer中,12%至31%的权重在全局范围内具有可解释性,其表现优于稠密Transformer。

联邦轻量级微调

arXiv cs.LG

本文介绍了FLITE(联邦低秩迭代训练引擎),一种联邦微调方法,通过使用冻结的仿射映射网络,从一个小型可训练潜变量和低秩可种子重生的因子分解生成权重,将每轮每客户端的通信量降至每轮1280个浮点数(约5KB)——相比于全权重FedAvg减少了8718倍。在CIFAR-100数据集上使用ResNet-18进行测试,准确率与全权重FedAvg相差在0.5个百分点以内。

基于可学习秩的参数高效微调

arXiv cs.CL

来自阿德莱德大学的研究人员提出了 LR-LoRA(可学习秩 LoRA),这是一种参数高效微调方法,在训练过程中动态学习每个 Transformer 层的适配器秩,而非使用固定的全局秩。LR-LoRA 在语言理解和常识推理基准测试上达到了最先进的性能,超越了固定秩 LoRA 基线。