标签
文章对比了Mamba和RWKV两个AI模型架构阵营的路线:Mamba面向云侧企业AI平台,RWKV面向端侧和边缘设备,各自适配不同硬件与推理场景。
RWKV是一种新颖的语言模型架构,结合了RNN的高效性和Transformer的可并行化特性,以线性时间复杂度和恒定内存占用实现了强大的LLM性能。
BlinkDL 宣布了 RWKV-7 G1g,一种纯 RNN 大型语言模型,声称是其同类中最好的,且与通用 LLM 竞争,在单个 RTX 5090 上具有高速推理性能。
Ali Hatamizadeh 宣布了 Gated DeltaNet-2,一种新的线性注意力模型,在 1.3B 规模上优于 KDA 和 Mamba-3;@BlinkDL_AI 指出其循环与 RWKV-7 的 DPLR 几乎相同。