@seclink: 冷知识: Mamba 阵营:走的"云侧前沿模型"路线,客户是 NVIDIA/AI21/IBM 这类卖企业 AI 平台的公司 → 如果你要做长上下文、低成本推理的云 API 数据加工,这个方向值得跟踪。 RWKV 阵营:走的"端侧/边缘内置…

X AI KOLs Following 新闻

摘要

文章对比了Mamba和RWKV两个AI模型架构阵营的路线:Mamba面向云侧企业AI平台,RWKV面向端侧和边缘设备,各自适配不同硬件与推理场景。

冷知识: Mamba 阵营:走的"云侧前沿模型"路线,客户是 NVIDIA/AI21/IBM 这类卖企业 AI 平台的公司 → 如果你要做长上下文、低成本推理的云 API 数据加工,这个方向值得跟踪。 RWKV 阵营:走的"端侧/边缘内置"路线,客户是芯片厂、机器人、操作系统 → 如果你将来想做端侧灵巧手 / 第一视角设备的本地实时推理数据闭环,RWKV 的常显存、无 KV cache 特性反而更贴你的硬件约束。
查看原文
查看缓存全文

缓存时间: 2026/08/14 13:39

冷知识:

Mamba 阵营:走的“云侧前沿模型“路线,客户是 NVIDIA/AI21/IBM 这类卖企业 AI 平台的公司 → 如果你要做长上下文、低成本推理的云 API 数据加工,这个方向值得跟踪。

RWKV 阵营:走的“端侧/边缘内置“路线,客户是芯片厂、机器人、操作系统 → 如果你将来想做端侧灵巧手 / 第一视角设备的本地实时推理数据闭环,RWKV 的常显存、无 KV cache 特性反而更贴你的硬件约束。

相似文章

@MaxForAI: http://Z.ai和清华这篇ZCube,做Infra的家人们值得看下。 很多人聊AI infra,第一反应还是GPU、显存、量化、推理框架。 但到长上下文和Prefill-Decode分离之后,网络已经不再是机房里的「配角」了。 每一…

X AI KOLs Timeline

ZCube是一种新的网络架构,通过打平拓扑并混合单/多轨接入,优化了长上下文和PD分离场景下的KV Cache传输,在GLM-5.1生产集群中实现了交换机/光模块成本降低33%、GPU推理吞吐提升15%、TTFT P99下降40.6%。

@LinQingV: 之前做LLM推理芯片架构探索的时候,我把四大AI推理ASIC公司的架构都翻过一遍。Groq、SambaNova、Tenstorrent、Cerebras。前三家的思路虽然各有侧重,但底层逻辑都在同一个框架里:片上大SRAM + dataf…

X AI KOLs Timeline

The article analyzes the AI inference ASIC architectures of Groq, SambaNova, Tenstorrent, and Cerebras, highlighting Cerebras's unique wafer-scale engine design. It discusses the benefits of deterministic latency and high bandwidth for LLM inference, while noting challenges like yield, cost, and KV cache bottlenecks.