@seclink:有点意思,来学点东西...
摘要
auto-gpu-kernel 1.0 版本已发布,这是一个能自动生成高性能 GPU 内核的元级工具。
有点意思,来学点东西...
查看缓存全文
缓存时间: 2026/09/16 05:54
有点意思,了解一下…
Doğaç (@dogacel0): “auto-gpu-kernel”1.0版在初版发布四个月后终于推出!
这是一个完全自主的内核生成“元框架”,能够同时优化内核与框架层,生成光速级内核🧵
相似文章
@dogacel0: 在初始发布4个月后,"auto-gpu-kernel" 版本 1.0 终于发布!这是一个完全自主的内核生成…
Auto-GPU-Kernel 版本 1.0 已发布,这是一个自主的 GPU 内核生成和优化工具,在 MLSys 2026 FlashInfer AI Kernel Generation Contest 中排名第一,平均加速比为 34.93 倍。
@levidiamode: GPU编程的第163/365天 - 今天看几个不同的agentic GPU内核优化系统。我最感兴趣的两个是…
一条推文讨论了两种agentic GPU内核优化系统:@dogacel0的Auto GPU Kernel和@songhan_mit实验室的Kernel Design Agents,两者均在MLSys Sparse Attention FlashInfer比赛中获胜。该帖子突出了使用子代理和Claude技能进行GPU编程的不同方法。
使用Codex进行自动研究:如何实现232倍更快的内核
一篇博客文章详细描述了作者如何在GPU模式竞赛中使用Codex优化内核,在QR分解中实现232倍加速,并分享自动研究的经验。
[P] 读了太多架构手册后,我构建了一个可移植的GPU ISA [P]
一个名为WAVE的可移植GPU ISA,将内核编译为通用二进制文件,并翻译成特定厂商的后端(Metal、PTX、HIP、SYCL),已在多个GPU上验证结果。
@liao_lucas: https://x.com/liao_lucas/status/2097149853499588971
本文介绍了在AI推理和性能工程背景下的GPU内核,解释了它们的定义、使用方法以及自定义内核在优化中的优势。