Pathway的BDH(后Transformer架构)在从零训练的10M到1B参数规模上匹配GPT-2的缩放规律,可在普通GPU上运行
摘要
据报道,Pathway的BDH(一种后Transformer架构)在标准GPU上从零训练时,在10M到1B参数范围内匹配GPT-2的缩放性能。
暂无内容
相似文章
Pathway是否刚刚揭示了Andrew Curran预测的架构突破?其150M模型树立了ARC-AGI-1成本效率新前沿
Pathway的150M参数BDH-CQ模型在ARC-AGI-1上达到29.5%的准确率,每个任务成本仅为0.0007美元,创下新低,采用循环记忆和潜在推理,而非长token链。该架构或许正是Andrew Curran预告的突破,OpenAI研究员Lukasz Kaiser担任投资者和顾问。
Show HN: TurboGPT:在13秒内训练22KiB的transformer
TurboGPT是一个开源的CUDA C++工具,能够实现微型字节级GPT模型的快速训练,在1.5G个token上仅用13秒就达到了2.5295 BPB。
使用奇偶瓶颈层扩展可解释的Transformer
介绍了ParityTransformer,这是一种GPT-2规模的架构,具有深度奇偶瓶颈层,使中间表示在设计上即可解释,在无需传统宽瓶颈内存成本的情况下高效强制稀疏性,并在稀疏探测任务上展示了具有竞争力的性能。
Humanoid-GPT:扩展数据和结构以实现零样本运动追踪
Humanoid-GPT 是一种GPT风格的Transformer,在十亿级运动语料库上预训练,实现了对未见过的动作和任务的全身运动追踪的零样本泛化。
@IntuitMachine: 让小型模型超越其规模的唯一改变 1/ 大家都知道你需要一个 70B 模型才能在...上击败 GPT-4
一篇介绍原子任务图(ATG)的帖子,它是一种基于 DAG 的执行载体,通过将计划结构存储在图中而非线性文本中,让一个 8B 的小模型在复杂代理任务上超越 GPT-4,减少了上下文膨胀,并实现了局部故障恢复。