变宽变换器

Hugging Face Daily Papers 论文

摘要

提出了一种非均匀宽度分配的变换器(沙漏形状),在语言建模中优于均匀基线,减少了FLOPs和KV缓存大小。

扩展模型规模,特别是深度和宽度,推动了基于变换器的语言模型的显著进步。然而,大多数架构在每一层保持相同的宽度,即使不同层可能扮演不同的计算角色,也均匀分配固定的参数和计算预算。在这项工作中,我们通过提出一种沙漏形变换器架构,经验性地研究了网络深度上的非均匀容量分配。该设计在保持较宽的前期和后期层的同时,缩小了中间层,并利用了一种无参数残差调整机制。在从200M到2B参数(密集)以及3B参数(MoE)的仅解码器语言模型中,我们的沙漏形变换器在语言建模损失上始终优于参数匹配的均匀基线。通过减少平均层宽度,该架构还降低了总体FLOPs(在拟合的损失匹配缩放曲线下减少22%)以及更小的KV缓存内存和I/O成本(减少15%)。在分析中,我们展示了这种瓶颈结构在残差流中产生了定性的不同表示。总体而言,我们的结果表明,非均匀宽度分配可以带来语言模型更资源优化的扩展。
查看原文
查看缓存全文

缓存时间: 2026/06/17 03:35

论文页面 - Variable-Width Transformers

来源:https://huggingface.co/papers/2606.18246

摘要

一种新颖的变压器架构采用了各层宽度不均匀分配的方式,通过无参数残余大小调整机制,在性能和效率上均优于均匀设计。缩放模型规模,特别是深度(https://huggingface.co/papers?q=depth)和宽度(https://huggingface.co/papers?q=width),推动了基于Transformer的语言模型(https://huggingface.co/papers?q=transformer-based%20language%20models)的重大进展。然而,大多数架构在所有层中保持恒定宽度(https://huggingface.co/papers?q=width),尽管不同层可能扮演不同的计算角色,但仍将固定参数和计算预算均匀分配。在本工作中,我们通过提出一种times-shaped结构,实证研究了跨网络深度(https://huggingface.co/papers?q=depth)的非均匀容量分配。

相似文章

全带宽Transformer

Hugging Face Daily Papers

全带宽Transformer是一种新的Transformer变体,通过门控线性单元反馈顶层隐藏状态,在不改变核心架构的情况下提升推理能力和效率。在多达400B个token上训练后,它能匹配使用1.5倍数据训练的标准Transformer,同时生成更短的推理轨迹。

可变位宽量化:为“更大但更小”的语言模型学习每组的精度

arXiv cs.LG

介绍了可变位宽量化(VBQ),一种训练时的方法,其中每组64个权重通过Gumbel-Softmax松弛学习自己的位宽(1、2、4、8)。VBQ发现了一种异构分配,实现了“更大但更小”的机制,例如,平均位宽1.82的1.31亿参数模型在TinyStories上的困惑度为4.2,击败了5500万FP16模型(困惑度4.4),同时存储减少3.8倍;而1.46B模型在FineWeb-Edu上与593M FP16控制模型表现相当,存储减少约3.7倍。

训练、阅读和编辑可解释的Transformer

arXiv cs.LG

本文介绍了一种通过清晰度惩罚训练带有可解释性算子的Transformer的方法,该惩罚利用每通道方差下限避免崩溃,实现了高可解释性并与传统基线保持质量一致。