@levidiamode: GPU编程的第163/365天 - 今天看几个不同的agentic GPU内核优化系统。我最感兴趣的两个是…
摘要
一条推文讨论了两种agentic GPU内核优化系统:@dogacel0的Auto GPU Kernel和@songhan_mit实验室的Kernel Design Agents,两者均在MLSys Sparse Attention FlashInfer比赛中获胜。该帖子突出了使用子代理和Claude技能进行GPU编程的不同方法。
查看缓存全文
缓存时间: 2026/06/16 01:13
163/365 of GPU Programming
今天关注了几个不同的代理式GPU内核优化系统。目前我最感兴趣的两个是:
- @dogacel0 的 Auto GPU Kernel,他利用这个系统赢得了今年 MLSys 的 DeepSeek Sparse Attention FlashInfer 挑战赛。
- @songhan_mit 实验室的 Kernel Design Agents,该系统在同一比赛的 MoE 赛道中获得了第一名。
看到子代理和 Claude 技能(如 Kernel Wiki)在优化这些 GPU 编程的代理循环中的不同用途,真的很有趣。这两个系统都为我自己的工作流程提供了很好的灵感。
仓库链接:
- https://github.com/Dogacel/auto-gpu-kernel…
- https://github.com/mit-han-lab/kernel-design-agents…
相似文章
KernelArc:一个用于GPU内核优化的多智能体框架
KernelArc是一个多智能体框架,使用策略专业化智能体来自主优化GPU内核以处理异构工作负载,并在NVIDIA GPU基准测试中取得顶级排名。
AgentKernelArena:兼顾泛化能力的GPU内核优化代理基准测试
AgentKernelArena是一个开源基准测试,用于评估AI编码代理在GPU内核优化方面的表现,涵盖完整的代理工作流程以及跨196个任务对未见配置的泛化能力。
@levidiamode: GPU编程第157/365天:另一个对我非常有帮助的FlashAttention4资源是@charles_irl的演讲…
一个每日GPU编程帖子重点介绍了Charles_irl的演讲,该演讲在论文发布前逆向工程了FlashAttention4代码,并赞扬了Modal团队对代码的深入剖析和对前向传播的合理推断。
@ekzhang1:我看着像这个家伙一样写真正的GPU内核的人 :)
AI模型Claude被用于使用pyptx DSL编写FlashAttention前向内核,在NVIDIA B200硬件上实现了与手工调优的FlashAttention-4近乎相同的性能。
@levidiamode: Day 138/365 of GPU Programming 今年我最喜欢的讲座之一是斯坦福大学的CS336第7讲关于GPU…
一位学习者分享了对斯坦福大学CS336第7讲关于GPU并行性的热情,该讲座涵盖了基本操作,并将其连接到多GPU设置以及张量并行、数据并行和流水线并行等技术。