变宽变换器
摘要
提出了一种非均匀宽度分配的变换器(沙漏形状),在语言建模中优于均匀基线,减少了FLOPs和KV缓存大小。
查看缓存全文
缓存时间: 2026/06/17 03:35
论文页面 - Variable-Width Transformers
来源:https://huggingface.co/papers/2606.18246
摘要
一种新颖的变压器架构采用了各层宽度不均匀分配的方式,通过无参数残余大小调整机制,在性能和效率上均优于均匀设计。缩放模型规模,特别是深度(https://huggingface.co/papers?q=depth)和宽度(https://huggingface.co/papers?q=width),推动了基于Transformer的语言模型(https://huggingface.co/papers?q=transformer-based%20language%20models)的重大进展。然而,大多数架构在所有层中保持恒定宽度(https://huggingface.co/papers?q=width),尽管不同层可能扮演不同的计算角色,但仍将固定参数和计算预算均匀分配。在本工作中,我们通过提出一种times-shaped结构,实证研究了跨网络深度(https://huggingface.co/papers?q=depth)的非均匀容量分配。
相似文章
全带宽Transformer
全带宽Transformer是一种新的Transformer变体,通过门控线性单元反馈顶层隐藏状态,在不改变核心架构的情况下提升推理能力和效率。在多达400B个token上训练后,它能匹配使用1.5倍数据训练的标准Transformer,同时生成更短的推理轨迹。
可变位宽量化:为“更大但更小”的语言模型学习每组的精度
介绍了可变位宽量化(VBQ),一种训练时的方法,其中每组64个权重通过Gumbel-Softmax松弛学习自己的位宽(1、2、4、8)。VBQ发现了一种异构分配,实现了“更大但更小”的机制,例如,平均位宽1.82的1.31亿参数模型在TinyStories上的困惑度为4.2,击败了5500万FP16模型(困惑度4.4),同时存储减少3.8倍;而1.46B模型在FineWeb-Edu上与593M FP16控制模型表现相当,存储减少约3.7倍。
Codec-Gauge:为Transformer KV缓存学习压缩友好的变换框架
Codec-Gauge 为Transformer KV缓存学习小型正交通道变换(度量),以在固定比特率下提高压缩保真度,显著降低多个模型和后端上的KL散度。
双流Transformer:将主预填充路径与额外解码计算解耦
本文介绍了双流Transformer,一种通过添加辅助流进行续写预测、同时共享权重和主KV缓存来解耦预填充和解码计算的架构,从而实现分阶段计算分配并提高效率。
训练、阅读和编辑可解释的Transformer
本文介绍了一种通过清晰度惩罚训练带有可解释性算子的Transformer的方法,该惩罚利用每通道方差下限避免崩溃,实现了高可解释性并与传统基线保持质量一致。