@Kimi_Moonshot:我们开源 FlashKDA——基于 CUTLASS 的高性能 Kimi Delta Attention 核实现,预填充速度在 H20 上提升 1.72–2.22 倍

X AI KOLs Following 工具

摘要

月之暗面开源 FlashKDA,基于 CUTLASS 的 Kimi Delta Attention 核实现,在 H20 GPU 上预填充速度提升 1.72–2.22 倍。

我们开源 FlashKDA——基于 CUTLASS 的高性能 Kimi Delta Attention 核实现。在 H20 上相比 flash-linear-attention 基线,预填充速度提升 1.72–2.22 倍,可作为 flash-linear-attention 的即插即用后端。前往 GitHub 探索:
查看原文

相似文章

MoonshotAI/FlashKDA

GitHub Trending (daily)

FlashKDA 是一个基于 CUTLASS 构建的高性能 Kimi Delta Attention (KDA) 内核实现,专为 SM90+ GPU 优化,并与 flash-linear-attention 集成。

Kimi-K3 技术报告 [pdf]

Hacker News Top

MoonshotAI发布了Kimi-K3,一个拥有2.8万亿参数的开源权重多模态智能体模型,具备100万token的上下文窗口,基于全新的Kimi Delta Attention和Attention Residuals架构,实现了显著的扩展性改进。