@Kimi_Moonshot:我们开源 FlashKDA——基于 CUTLASS 的高性能 Kimi Delta Attention 核实现,预填充速度在 H20 上提升 1.72–2.22 倍
摘要
月之暗面开源 FlashKDA,基于 CUTLASS 的 Kimi Delta Attention 核实现,在 H20 GPU 上预填充速度提升 1.72–2.22 倍。
我们开源 FlashKDA——基于 CUTLASS 的高性能 Kimi Delta Attention 核实现。在 H20 上相比 flash-linear-attention 基线,预填充速度提升 1.72–2.22 倍,可作为 flash-linear-attention 的即插即用后端。前往 GitHub 探索:
相似文章
Moonshot 开源 FlashKDA:面向 Kimi Delta Attention 的 CUTLASS 内核,H20 上最高比 Triton 基线快 2.22 倍
MoonshotAI 发布 FlashKDA,开源 CUTLASS 内核实现 Kimi Delta Attention,在 H20 GPU 上相较 Triton 最高提速 2.22 倍。
MoonshotAI/FlashKDA
FlashKDA 是一个基于 CUTLASS 构建的高性能 Kimi Delta Attention (KDA) 内核实现,专为 SM90+ GPU 优化,并与 flash-linear-attention 集成。
@HotAisle:Kimi K2.6 + DFlash:8×MI300X 上 508 tok/s,自回归基线 90 tok/s 提升至 5.6 倍
Kimi K2.6 搭配 DFlash 推理系统在 8×AMD MI300X 上实现 508 tokens/s,相比 90 tokens/s 基线零质量损失地提升 5.6 倍吞吐。
Kimi-K3 技术报告 [pdf]
MoonshotAI发布了Kimi-K3,一个拥有2.8万亿参数的开源权重多模态智能体模型,具备100万token的上下文窗口,基于全新的Kimi Delta Attention和Attention Residuals架构,实现了显著的扩展性改进。
@akshay_pachaar: 一个矩阵取代了KV缓存。(该技术100%开源)Kimi刚刚发布了K3,一个前沿规模的开源模型…
Kimi发布了K3,一个2.8T参数的开源模型,采用delta attention避免KV缓存增长,实现了百万token上下文窗口,内存成本线性增长。