ResBM:一种基于Transformer的新型架构,用于低带宽流水线并行训练,实现128倍激活压缩 [R]
摘要
ResBM提出了一种基于Transformer的架构,采用残差编码器-解码器瓶颈用于流水线并行训练,在保持收敛的同时实现了128倍激活压缩。该工作通过减少阶段间通信开销,推进了去中心化、互联网级分布式训练的发展。
[](https://www.reddit.com/r/MachineLearning/?f=flair_name%3A%22Research%22)Macrocosmos发布了一篇关于ResBM(残差瓶颈模型)的论文,这是一种专为低带宽流水线并行训练设计的新型Transformer架构。[https://arxiv.org/abs/2604.11947](https://arxiv.org/abs/2604.11947) ResBM在流水线边界引入了残差编码器-解码器瓶颈,旨在减少阶段间通信,同时保留显式的低秩恒等路径。论文报告了SOTA的128倍激活压缩,与未压缩基线相比,在收敛性上没有显著损失。在他们的实验中,最强的压缩结果使用了Muon,论文将ResBM定位为去中心化/互联网级流水线并行训练的一项进展。
相似文章
RED-PIM: 使用处理内存减少Transformer的数据移动
提出了RED-PIM,一种算法-架构协同设计,将内存体间的数据移动从O(N²)降低到O(N),并缩小注意力矩阵,使Transformer模型的推理时间显著降低(16%到99.99%)。
WAV:面向深度仅解码器Transformer的多分辨率块残差路由
本文提出多分辨率残差路由方法WAV v1,这是块注意力残差机制的扩展,通过引入方向性细节基来增强块表示,从而改进深度仅解码器Transformer的训练效果。
Block-Based Double Decoders
提出了一种基于块的雙解碼器(block-based double decoders),这是一种使用双重因果块注意力掩码的新型Transformer架构,结合了解码器仅训练效率与编码器-解码器推理效率,实现了强大的扩展性能并减少了KV缓存内存。
并行流形引导:通过残差能量塑形实现大型关联记忆的高效适应
本文提出H-Res,一种通过塑形关联记忆的能量景观来适应大型Transformer模型的方法,无需修改权重或添加提示,保留了记忆容量,且性能优于LoRA。
@bravo_abad: 一种将CNN和Transformer转化为分辨率无关神经算子的原则性构建方法 训练U-Net或…
本文提出了一种原则性构建方法,将CNN和Transformer转化为分辨率无关的神经算子,使得在一个网格分辨率上训练的模型能够泛化到其他分辨率,这对于科学机器学习应用(如偏微分方程求解)至关重要。