MKEvolve:一个用于内核代码生成的模块化多智能体框架
摘要
介绍了MKEvolve,一个模块化多智能体框架,用于迭代地共同演化模块分解和硬件加速器的LLM生成内核,相比直接合成实现了更高的正确性和加速,同时减少了令牌使用量。
查看缓存全文
缓存时间: 2026/07/24 05:03
# MKEvolve:模块化多智能体框架实现内核代码生成 来源:https://arxiv.org/abs/2607.20501 查看PDF (https://arxiv.org/pdf/2607.20501) > 摘要:尽管基于LLM的代码生成取得了快速进展,为硬件加速器编写正确且高性能的内核仍然是扩展现代机器学习工作负载的关键瓶颈。我们提出MKEvolve(模块化内核演化),一个迭代式协同演化框架,它同步优化复杂PyTorch模块的模块化分解以及每个子模块的LLM生成内核——通过跨迭代的分裂与融合来精化分解,同时借助LLM驱动的束搜索独立改进每个子内核。最终生成的内核是经过独立验证的子内核的程序化组合,具有可配置性(子内核实现可替换)、可解释性(错误与加速效果可追溯至特定子内核)以及易于适配相关模型架构的特点。在KernelBench L2和L3上使用Triton进行的实验(覆盖多算子序列和完整模型架构)表明,与端到端直接合成基线相比,MKEvolve在提升正确性和加速比的同时,将LLM令牌使用量减少了高达35%。 ## 提交历史 来自:Jinsoo Yoo [查看电子邮件 (https://arxiv.org/show-email/e8583921/2607.20501)] **[v1]**2026年6月20日星期六 23:14:07 UTC(4,024 KB)
相似文章
MLEvolve:自动化机器学习算法发现的自我进化框架
MLEvolve是一个基于LLM的自我进化多智能体框架,用于自动化机器学习算法发现。它将树搜索扩展为Progressive MCGS,并引入基于图的跨分支信息流和Retrospective Memory。该框架在MLE-Bench上取得了最先进的性能,并在数学算法优化任务上优于AlphaEvolve。
KForge:面向AI加速器的LLM驱动跨平台内核生成
KForge是一个跨平台框架,利用两个协作的基于LLM的智能体,自动生成和优化适用于多种AI加速器的高性能计算内核,在NVIDIA B200和Intel Arc B580硬件上实现了显著的加速效果。
AdaExplore:基于失败驱动的自适应与多样性保留搜索的高效内核生成
来自卡内基梅隆大学、华盛顿大学和Arm的研究人员提出了AdaExplore,这是一种用于GPU内核代码生成的LLM智能体框架。该框架通过失败驱动自适应与多样性保留搜索技术,在不进行额外微调的情况下,在KernelBench Level-2和Level-3基准测试中分别实现了3.12倍和1.72倍的加速。
CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution
This paper presents CAKE, a compiler-agent co-design framework that lets AI agents author a hardware-explicit IR for GPU kernels, achieving significant speedups over baselines across various workload families.
AsmEvo: 带功能等价验证的AMD GPU内核智能汇编级优化
AsmEvo 是一个用于AMD GPU内核的智能汇编级优化器,通过提出低级编辑并验证与原始二进制文件的功能等价性来提高性能,在MI308X GPU上实现了高达3.88倍的加速。