@leloykun: 我又忙忘了时间 >.< 最近如果给我发过私信,真的非常抱歉。我保证会逐一查看!--- 在本次迭代中,我……
摘要
作者开发了一个从 Lean4 到 TileLang 的张量程序超优化器,能够自动生成优化后的加速器内核并推导超参数缩放定律,在 A100 GPU 上实现了 1.8 倍的加速。
我又忙忘了时间 >.< 最近如果给我发过私信,真的非常抱歉。我保证会逐一查看!--- 在本次迭代中,我构建了一个 Lean4-to-TileLang 张量程序超优化器。借助它,我现在拥有了一套形式化基础设施,让我(或我的智能体)能够在 Lean4 中定义神经网络架构,并自动获得:1. TileLang 中经过优化的 IO 感知加速器内核。它可以自动发现 FlashAttention2、FlashNorm、split-k matmul 等模式。目前在我的基准测试集上,于 A100 上实现了约 1.8 倍的几何平均加速比。2. 优化器选择与参数化方案,支持超参数在模型宽度和深度之间进行迁移(参见我之前的博客文章)。3. 超参数缩放定律,指导我们在扩展 batch size、训练步数、数据集规模等时如何调整超参数(参见引用推文)。4. 优化器的低秩代理,用于在小规模下加速超参数调优,并能将结果迁移至全秩场景(我们即将发表相关论文,敬请期待!)。
相似文章
@leloykun:[进行中] 关于 Lean4-to-TileLang 张量程序超级优化器的博文:
一篇技术博文介绍了一种 Lean4-to-TileLang 张量程序超级优化器,能自动生成优化的 GPU/TPU 内核与超参数缩放规律,展示了相较 torch.compile 的性能提升。
AccelOpt:一种用于AI加速器内核优化的自我改进LLM智能体系统
AccelOpt是一种自我改进的LLM智能体系统,通过迭代生成和优化记忆自主优化AI加速器内核,在AWS Trainium上实现了49%至61%的峰值吞吐量提升,同时比Claude Sonnet 4便宜26倍。
@levidiamode: GPU编程的第163/365天 - 今天看几个不同的agentic GPU内核优化系统。我最感兴趣的两个是…
一条推文讨论了两种agentic GPU内核优化系统:@dogacel0的Auto GPU Kernel和@songhan_mit实验室的Kernel Design Agents,两者均在MLSys Sparse Attention FlashInfer比赛中获胜。该帖子突出了使用子代理和Claude技能进行GPU编程的不同方法。
@ekzhang1:我看着像这个家伙一样写真正的GPU内核的人 :)
AI模型Claude被用于使用pyptx DSL编写FlashAttention前向内核,在NVIDIA B200硬件上实现了与手工调优的FlashAttention-4近乎相同的性能。
@charles_irl: 重写并行是一项重大举措,如果能比我们用CuTe DSL实现的速度更快就好了。FA4是一个非常…
关于使用CuTe DSL和瓦片编程模型重写并行性以提升FA4 (FlashAttention 4) 内核性能的讨论。