@pradheepraop: 实现了 MSA 论文中内核设计部分的 top-k 内核。https://github.com/Mantissagithub/learn_c…
摘要
从 MSA 论文内核设计部分实现了 top-k 内核,使用免指数比较和通过 CUDA shuffle 进行的 warp 级树合并。代码已发布于 GitHub。
查看缓存全文
缓存时间: 2026/06/15 13:04
实现了 msa 论文中内核设计部分的 top-k 内核。
https://github.com/Mantissagithub/learn_cuda/blob/msa/07_projects/msa/top_k.cu…
它基于两个思路:
- 免指数比较:无需计算 softmax,因为 softmax 不改变大小顺序
- 每个 warp 线程扫描 1/32 步长,维护一个小的本地 top-k,并通过洗牌操作树形合并结果
结果熬夜修改了 CUDA 代码,也清理了我的 learn_cuda 仓库,因此欢迎任何反馈或优化建议。
Mantissagithub/learn_cuda
Source: https://github.com/Mantissagithub/learn_cuda
learn_cuda
学习 CUDA(即 GPU 编程)
相似文章
MSLK kernel reference (Website)
Documentation reference for MSLK 1.3.0, a library of fused GPU kernels for transformer workloads including attention, quantization, GEMM, and MoE routing, supporting CUDA and ROCm with PyTorch integration.
AdaExplore:基于失败驱动的自适应与多样性保留搜索的高效内核生成
来自卡内基梅隆大学、华盛顿大学和Arm的研究人员提出了AdaExplore,这是一种用于GPU内核代码生成的LLM智能体框架。该框架通过失败驱动自适应与多样性保留搜索技术,在不进行额外微调的情况下,在KernelBench Level-2和Level-3基准测试中分别实现了3.12倍和1.72倍的加速。
使用Codex进行自动研究:如何实现232倍更快的内核
一篇博客文章详细描述了作者如何在GPU模式竞赛中使用Codex优化内核,在QR分解中实现232倍加速,并分享自动研究的经验。
@dejavucoder: 我最新的一篇博客文章 "auto-research with codex: 我如何在使用Codex的GPU Mode中实现比基线快212倍的内核…"
Sankalp的博客文章,详细描述了他如何使用Codex在GPU Mode的竞赛中为QR分解实现快232倍的GPU内核,并概述了他的自动研究方法论。
@songhan_mit: 探索 KDA (Kernel Design Agents): https://github.com/mit-han-lab/kernel-design-agents…
KDA (Kernel Design Agents) 是来自 MIT HAN Lab 的一个开源、以代理为中心的工作流,用于使用编码代理对性能敏感的 CUDA 内核任务进行研究、实现、验证和迭代。它帮助 Databricks 在 NVIDIA 的 SOL-ExecBench 排行榜上获得了第一名。