Pathway的BDH(后Transformer架构)在从零训练的10M到1B参数规模上匹配GPT-2的缩放规律,可在普通GPU上运行

Reddit r/LocalLLaMA 论文

摘要

据报道,Pathway的BDH(一种后Transformer架构)在标准GPU上从零训练时,在10M到1B参数范围内匹配GPT-2的缩放性能。

暂无内容
查看原文

相似文章

使用奇偶瓶颈层扩展可解释的Transformer

arXiv cs.LG

介绍了ParityTransformer,这是一种GPT-2规模的架构,具有深度奇偶瓶颈层,使中间表示在设计上即可解释,在无需传统宽瓶颈内存成本的情况下高效强制稀疏性,并在稀疏探测任务上展示了具有竞争力的性能。