KernelZero: 协同进化Proposer与Coder实现持续改进的GPU内核生成

Hugging Face Daily Papers 论文

摘要

KernelZero提出了一种协同进化框架,利用Proposer和Coder模型提升GPU内核生成能力,在CUDA和Triton基准测试中表现出色。

高性能GPU内核对现代机器学习系统至关重要,然而自动生成既正确又高效的内核仍然具有挑战性。现有的基于大语言模型的方法面临两大主要限制:与模型当前能力相匹配的高质量训练数据的稀缺性,以及内核正确性与性能之间的固有权衡。为了解决这些挑战,我们提出了KernelZero,一个通过两个专门模型持续改进GPU内核生成的协同进化框架:一个Proposer从API集合生成Torch模块,以及一个Coder将它们转换为CUDA或Triton内核。KernelZero使用一种前沿驱动的模块生成机制,基于Coder的当前弱点持续生成与能力对齐的训练模块。它进一步引入了正确性感知的组相对策略优化(CA-GRPO),仅在正确性变得足够可靠后才优化性能。通过交替优化Proposer和Coder,KernelZero形成了一个自动课程,实现有针对性且训练高效的能力提升。实验表明,KernelZero-7B在CUDA上超越了Claude-4.5-Sonnet,在Triton上超越了DeepSeek-V4-Pro。在KernelBench Level 1和2上,它分别取得了75.8%和69.6%的CUDA pass@1分数,pass@10达到100%和97%。在Triton上,它分别取得了77.2%和72.5%的pass@1分数。
查看原文
查看缓存全文

缓存时间: 2026/09/29 08:09

论文页面 - KernelZero:持续改进GPU内核生成的提议器与编码器协同进化框架

来源:https://huggingface.co/papers/2609.33074 作者:

,

,

,

,

,

,

,

,

,

,

摘要

高性能GPU内核是现代机器学习系统的核心,但自动生成既正确又高效的内核仍具挑战性。现有基于大语言模型的方法面临两大局限:与模型当前能力匹配的高质量训练数据稀缺,以及内核正确性与性能之间的固有矛盾。为解决这些挑战,我们提出KernelZero——一个通过两个专用模型持续改进GPU内核生成的协同进化框架:一个根据API集合生成Torch模块的提议器,以及一个将其转化为CUDA或Triton内核的编码器。KernelZero采用前沿驱动模块生成机制,基于编码器当前弱点持续生成能力匹配的训练模块。它进一步引入正确性感知的组相对策略优化,仅在正确性达到足够可靠程度后才优化性能。通过交替优化提议器和编码器,KernelZero形成了自动化的课程学习流程,实现了针对性且训练高效的的能力提升。实验证明,KernelZero-7B在CUDA任务上超越Claude-4.5-Sonnet,在Triton任务上超越DeepSeek-V4-Pro。在KernelBench基准测试中,其CUDA pass@1得分在第1级和第2级分别达到75.8%和69.6%,pass@10得分达到100%和97%;Triton pass@1得分分别达到77.2%和72.5%。

查看arXiv页面 (https://arxiv.org/abs/2609.33074)查看PDF (https://arxiv.org/pdf/2609.33074)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.33074)

在您的智能助手中获取此论文:

hf papers read 2609\.33074

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型2个

kcxain/KernelZero-CUDA-7B 文本生成• 8B• 更新于22分钟前 (https://huggingface.co/kcxain/KernelZero-CUDA-7B)

kcxain/KernelZero-CUDA-SFT-7B 文本生成• 8B• 更新于22分钟前 • 307 (https://huggingface.co/kcxain/KernelZero-CUDA-SFT-7B)

引用本文的数据集0个

暂无关联此论文的数据集

在数据集README.md中引用arxiv.org/abs/2609.33074,即可从本页面关联。

引用本文的 Spaces0个

暂无关联此论文的Space

在Space README.md中引用arxiv.org/abs/2609.33074,即可从本页面关联。

包含本文的收藏夹1个

相似文章

Show HN: 智能代理CUDA内核优化器

Hacker News Top

一个智能代理CUDA内核优化器,通过迭代代码生成、正确性检查、基准测试和优化,自动化GPU实现生成,由LangGraph和OpenAI模型驱动。

AdaExplore:基于失败驱动的自适应与多样性保留搜索的高效内核生成

arXiv cs.CL

来自卡内基梅隆大学、华盛顿大学和Arm的研究人员提出了AdaExplore,这是一种用于GPU内核代码生成的LLM智能体框架。该框架通过失败驱动自适应与多样性保留搜索技术,在不进行额外微调的情况下,在KernelBench Level-2和Level-3基准测试中分别实现了3.12倍和1.72倍的加速。

EGG:专家引导的内核生成智能体框架

arXiv cs.AI

EGG 是一个专家引导的智能体框架,它将 GPU 内核生成分解为算法结构设计和硬件特定调优两个阶段,并采用阶段感知的多智能体协作机制。在 KernelBench 和实际工作负载上,EGG 相比 PyTorch 实现平均 2.13 倍的加速。