标签
一位开发了NVIDIA现用于TensorRT-LLM的内核的CMU博士讲解了快速注意力,内容涵盖融合CUDA内核、FlashInfer、Triton和分页KV注意力,使同一GPU每秒能处理更多token。
华盛顿大学SyFI团队在MLSys2026期间举办的FlashInfer AI内核生成竞赛中赢得了多个奖项,得到了NVIDIA和Modal的支持。