ResBM:一种基于Transformer的新型架构,用于低带宽流水线并行训练,实现128倍激活压缩 [R]

Reddit r/MachineLearning 论文

摘要

ResBM提出了一种基于Transformer的架构,采用残差编码器-解码器瓶颈用于流水线并行训练,在保持收敛的同时实现了128倍激活压缩。该工作通过减少阶段间通信开销,推进了去中心化、互联网级分布式训练的发展。

[](https://www.reddit.com/r/MachineLearning/?f=flair_name%3A%22Research%22)Macrocosmos发布了一篇关于ResBM(残差瓶颈模型)的论文,这是一种专为低带宽流水线并行训练设计的新型Transformer架构。[https://arxiv.org/abs/2604.11947](https://arxiv.org/abs/2604.11947) ResBM在流水线边界引入了残差编码器-解码器瓶颈,旨在减少阶段间通信,同时保留显式的低秩恒等路径。论文报告了SOTA的128倍激活压缩,与未压缩基线相比,在收敛性上没有显著损失。在他们的实验中,最强的压缩结果使用了Muon,论文将ResBM定位为去中心化/互联网级流水线并行训练的一项进展。
查看原文

相似文章

Block-Based Double Decoders

arXiv cs.LG

提出了一种基于块的雙解碼器(block-based double decoders),这是一种使用双重因果块注意力掩码的新型Transformer架构,结合了解码器仅训练效率与编码器-解码器推理效率,实现了强大的扩展性能并减少了KV缓存内存。