@SemiAnalysis_: 与对DeepSeek R1的恐慌类似,一些不明真相的人认为Kimi K3使用线性注意力(KDA)对……不利

X AI KOLs Following 新闻

摘要

SemiAnalysis认为,与无知的恐慌相反,Kimi K3的线性注意力(KDA)对NVIDIA、HBM、DRAM和网络并非不利,并解释了为什么降低KV-cache需求实际上是有益的。

与对DeepSeek R1的恐慌类似,一些不明真相的人认为Kimi K3使用线性注意力(KDA)对NVIDIA、HBM、DRAM和网络不利,因为它具有相对较低的KV-cache需求。事实恰恰相反,我们将在下面解释原因。👇️ 1/8🧵 https://t.co/ih3RbtrDs8
查看原文
查看缓存全文

缓存时间: 2026/07/20 11:30

类似于对DeepSeek R1的恐慌,有些缺乏专业知识的人认为Kimi K3使用线性注意力(KDA)对NVIDIA、HBM、DRAM和网络不利,因为它对KV缓存的需求相对较低。事实恰恰相反,原因如下。 1/8

Kimi K3实际上对NVIDIA非常有利,因为大模型推理正是NVL72的强项。由于K3拥有超过2.8万亿参数,需要大规模扩展域来存储其权重。 2/8

其次,尽管Kimi Delta Attention对KV缓存传输的网络需求降低了多达10倍,但其庞大的权重需要更多网络带宽来实现一项名为WideEP的优化——该优化将权重分布到不同GPU上。 3/8

WideEP将896个专家分布到多个GPU上,使得每个GPU的HBM仅包含少量专家,从而优化每令牌的内存使用和计算利用率。 4/8

然而,WideEP优化的一个不幸缺陷是消耗大量网络带宽。该优化高度适配GB200/GB300 NVL72这类机架级系统,其铜背板提供的带宽比同级别DGX B200系统高出18倍。 5/8

此外,由于权重占用超过1.5 TB的HBM容量,即使是在相对较低的用户并发下,K3的KDA和Gated MLA的KV缓存也需要卸载到CPU DDR5和NVMe上,因为HBM中剩余的空间极少。 6/8

Kimi团队自身也指出,实现K3的最佳推理需要一个至少包含64个芯片的大型扩展域机架。 7/8

最后,杰文斯悖论意味着:使注意力机制更高效将推动AI更广泛的应用,最终反而需要更多GPU、HBM、DRAM和网络——而非更少。 8/8

相似文章