KernelZero: 协同进化Proposer与Coder实现持续改进的GPU内核生成
摘要
KernelZero提出了一种协同进化框架,利用Proposer和Coder模型提升GPU内核生成能力,在CUDA和Triton基准测试中表现出色。
查看缓存全文
缓存时间: 2026/09/29 08:09
论文页面 - KernelZero:持续改进GPU内核生成的提议器与编码器协同进化框架
来源:https://huggingface.co/papers/2609.33074 作者:
,
,
,
,
,
,
,
,
,
,
摘要
高性能GPU内核是现代机器学习系统的核心,但自动生成既正确又高效的内核仍具挑战性。现有基于大语言模型的方法面临两大局限:与模型当前能力匹配的高质量训练数据稀缺,以及内核正确性与性能之间的固有矛盾。为解决这些挑战,我们提出KernelZero——一个通过两个专用模型持续改进GPU内核生成的协同进化框架:一个根据API集合生成Torch模块的提议器,以及一个将其转化为CUDA或Triton内核的编码器。KernelZero采用前沿驱动模块生成机制,基于编码器当前弱点持续生成能力匹配的训练模块。它进一步引入正确性感知的组相对策略优化,仅在正确性达到足够可靠程度后才优化性能。通过交替优化提议器和编码器,KernelZero形成了自动化的课程学习流程,实现了针对性且训练高效的的能力提升。实验证明,KernelZero-7B在CUDA任务上超越Claude-4.5-Sonnet,在Triton任务上超越DeepSeek-V4-Pro。在KernelBench基准测试中,其CUDA pass@1得分在第1级和第2级分别达到75.8%和69.6%,pass@10得分达到100%和97%;Triton pass@1得分分别达到77.2%和72.5%。
查看arXiv页面 (https://arxiv.org/abs/2609.33074)查看PDF (https://arxiv.org/pdf/2609.33074)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.33074)
在您的智能助手中获取此论文:
hf papers read 2609\.33074
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型2个
kcxain/KernelZero-CUDA-7B 文本生成• 8B• 更新于22分钟前 (https://huggingface.co/kcxain/KernelZero-CUDA-7B)
kcxain/KernelZero-CUDA-SFT-7B 文本生成• 8B• 更新于22分钟前 • 307 (https://huggingface.co/kcxain/KernelZero-CUDA-SFT-7B)
引用本文的数据集0个
暂无关联此论文的数据集
在数据集README.md中引用arxiv.org/abs/2609.33074,即可从本页面关联。
引用本文的 Spaces0个
暂无关联此论文的Space
在Space README.md中引用arxiv.org/abs/2609.33074,即可从本页面关联。
包含本文的收藏夹1个
相似文章
Show HN: 智能代理CUDA内核优化器
一个智能代理CUDA内核优化器,通过迭代代码生成、正确性检查、基准测试和优化,自动化GPU实现生成,由LangGraph和OpenAI模型驱动。
AdaExplore:基于失败驱动的自适应与多样性保留搜索的高效内核生成
来自卡内基梅隆大学、华盛顿大学和Arm的研究人员提出了AdaExplore,这是一种用于GPU内核代码生成的LLM智能体框架。该框架通过失败驱动自适应与多样性保留搜索技术,在不进行额外微调的情况下,在KernelBench Level-2和Level-3基准测试中分别实现了3.12倍和1.72倍的加速。
CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution
This paper presents CAKE, a compiler-agent co-design framework that lets AI agents author a hardware-explicit IR for GPU kernels, achieving significant speedups over baselines across various workload families.
KernelArc:一个用于GPU内核优化的多智能体框架
KernelArc是一个多智能体框架,使用策略专业化智能体来自主优化GPU内核以处理异构工作负载,并在NVIDIA GPU基准测试中取得顶级排名。
EGG:专家引导的内核生成智能体框架
EGG 是一个专家引导的智能体框架,它将 GPU 内核生成分解为算法结构设计和硬件特定调优两个阶段,并采用阶段感知的多智能体协作机制。在 KernelBench 和实际工作负载上,EGG 相比 PyTorch 实现平均 2.13 倍的加速。