Pathway的BDH(后Transformer架构)在从零训练的10M到1B参数规模上匹配GPT-2的缩放规律,可在普通GPU上运行
摘要
据报道,Pathway的BDH(一种后Transformer架构)在标准GPU上从零训练时,在10M到1B参数范围内匹配GPT-2的缩放性能。
暂无内容
相似文章
使用奇偶瓶颈层扩展可解释的Transformer
介绍了ParityTransformer,这是一种GPT-2规模的架构,具有深度奇偶瓶颈层,使中间表示在设计上即可解释,在无需传统宽瓶颈内存成本的情况下高效强制稀疏性,并在稀疏探测任务上展示了具有竞争力的性能。
Humanoid-GPT:扩展数据和结构以实现零样本运动追踪
Humanoid-GPT 是一种GPT风格的Transformer,在十亿级运动语料库上预训练,实现了对未见过的动作和任务的全身运动追踪的零样本泛化。
@IntuitMachine: 让小型模型超越其规模的唯一改变 1/ 大家都知道你需要一个 70B 模型才能在...上击败 GPT-4
一篇介绍原子任务图(ATG)的帖子,它是一种基于 DAG 的执行载体,通过将计划结构存储在图中而非线性文本中,让一个 8B 的小模型在复杂代理任务上超越 GPT-4,减少了上下文膨胀,并实现了局部故障恢复。
@aakashgupta:Karpathy 对 Dwarkesh 说,只要数据足够干净,10 亿参数的模型就能达到今天 1.8 万亿参数前沿模型的智能水平
Andrej Karpathy 向 Dwarkesh Patel 表示,用超干净数据训练的 10 亿参数模型可媲美当今 1.8 万亿参数的前沿模型,相当于 1,800 倍的有效压缩。
我仅能腾出小规模来摆弄Transformer
一名学生介绍了Silia,这是一种新颖的Transformer架构,将注意力机制和前馈网络合并为统一操作,以在≤10M参数规模下节省参数,尽管计算资源有限,仍以更少的参数实现了与GPT-2相当的性能。