标签
据报道,Pathway的BDH(一种后Transformer架构)在标准GPU上从零训练时,在10M到1B参数范围内匹配GPT-2的缩放性能。
2026年年中持续学习现状与未来展望的概述,涵盖记忆方法(包括外部记忆、状态内记忆和权重更新),并分析了TTT、Titans和Dragon Hatchling等各类模型。
《Attention is All You Need》这篇开创性论文的一位合著者主张,这个领域应该超越Transformer,而Pathway主办的一场辩论正在探讨这一话题。