更换乘积,保留参数:Transformer的关联代数层
摘要
本文研究了将Transformer层中的矩阵乘法替换为关联代数积,以在保留参数的同时降低计算成本,证明了其可行性,提高了吞吐量,但存在一些性能权衡。
查看缓存全文
缓存时间: 2026/09/29 08:09
论文页面 - 更换乘积形式,保留参数结构:基于结合代数层的Transformer架构
来源:https://huggingface.co/papers/2609.32814 我们研究能否用另一种计算成本更低的结合积替代Transformer投影层中使用的矩阵乘法,同时保持相同的权重库与参数规模。
我们构造了一种双线性秩低于标准矩阵乘法的结合代数乘积。对于q=2的情形,该乘积的秩为6,而Strassen的2×2算法秩为7。这使得我们能够在不引入额外非线性变换的前提下替换线性投影层,同时降低其计算开销。
我们在三个层级验证该方法:包括针对Qwen与DeepSeek等多种Transformer架构的GPU投影核测试;以及两个参数规模约1.1亿、仅MLP乘法法则不同的解码器语言模型(各训练123亿token)。代数模型在四个提示领域实现6.2%–7.8%的端到端生成吞吐量提升,但在GSM8K、MBPP与IFEval基准测试中得分略低。
研究结果初步验证了在保留完整参数库的前提下,改变Transformer投影乘法法则的可行性与可训练性。
相似文章
Transformer联合作者验证后Transformer时代成本效率突破
一个1.5亿参数的非Transformer架构在ARC-AGI-1上实现了最先进的成本效率,并获得了Transformer论文联合作者Łukasz Kaiser的验证,表明循环潜在推理可以取代暴力扩展。
训练Transformer:初始化时每层权重W = V·Uᵀ,揭示语料库确定的最优秩 — 寻找arXiv背书人 (cs.LG) [D]
本文为Transformer提出原生因子化权重(Native Factorized Weights),即每个线性层从初始化开始就训练为两个低秩矩阵的乘积。实验表明,存在一个由语料库决定的最优秩,可最小化验证损失,并形成一个泛化区间,以更少的参数超越密集基线模型。
@rohanpaul_ai: 有趣,这篇论文表明Transformer可能不需要独立的键和值投影就能表现良好。这篇论文…
本论文研究了Transformer是否需要独立的键和值投影,发现共享它们可将KV缓存减少50%,而困惑度仅增加3.1%,并且与GQA和MQA结合时进一步减少。
并行流形引导:通过残差能量塑形实现大型关联记忆的高效适应
本文提出H-Res,一种通过塑形关联记忆的能量景观来适应大型Transformer模型的方法,无需修改权重或添加提示,保留了记忆容量,且性能优于LoRA。
Tensor Cache: 基于驱逐条件的Transformer关联记忆
Tensor Cache 引入了一种两级缓存机制,将滑动窗口注意力中驱逐的键值对压缩成固定大小的关联记忆,从而在无需无界内存增长的情况下改进长上下文语言建模。