MKEvolve:一个用于内核代码生成的模块化多智能体框架

arXiv cs.AI 论文

摘要

介绍了MKEvolve,一个模块化多智能体框架,用于迭代地共同演化模块分解和硬件加速器的LLM生成内核,相比直接合成实现了更高的正确性和加速,同时减少了令牌使用量。

arXiv:2607.20501v1 公告类型: 新 摘要: 尽管基于LLM的代码生成取得了快速进展,为硬件加速器编写正确且高性能的内核仍然是扩展现代ML工作负载的关键瓶颈。我们提出了MKEvolve(模块化内核演化),这是一个框架,它迭代地共同演化复杂PyTorch模块的模块分解和每个子模块的LLM生成内核,通过跨迭代的分裂和融合来优化分解,同时通过LLM驱动的束搜索独立改进每个子内核。生成的核是独立验证的子核的程序化组合,使其可配置(子核实现可互换)、可解释(错误和加速可追溯到特定子核),并且易于适应相关模型架构。在KernelBench L2和L3上使用Triton进行的实验,涵盖了多算子序列和完整模型架构,表明MKEvolve在正确性和加速比上都优于端到端直接合成基线,同时将LLM令牌使用量减少了高达35%。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:03

# MKEvolve:模块化多智能体框架实现内核代码生成
来源:https://arxiv.org/abs/2607.20501
查看PDF (https://arxiv.org/pdf/2607.20501)

> 摘要:尽管基于LLM的代码生成取得了快速进展,为硬件加速器编写正确且高性能的内核仍然是扩展现代机器学习工作负载的关键瓶颈。我们提出MKEvolve(模块化内核演化),一个迭代式协同演化框架,它同步优化复杂PyTorch模块的模块化分解以及每个子模块的LLM生成内核——通过跨迭代的分裂与融合来精化分解,同时借助LLM驱动的束搜索独立改进每个子内核。最终生成的内核是经过独立验证的子内核的程序化组合,具有可配置性(子内核实现可替换)、可解释性(错误与加速效果可追溯至特定子内核)以及易于适配相关模型架构的特点。在KernelBench L2和L3上使用Triton进行的实验(覆盖多算子序列和完整模型架构)表明,与端到端直接合成基线相比,MKEvolve在提升正确性和加速比的同时,将LLM令牌使用量减少了高达35%。

## 提交历史

来自:Jinsoo Yoo [查看电子邮件 (https://arxiv.org/show-email/e8583921/2607.20501)] **[v1]**2026年6月20日星期六 23:14:07 UTC(4,024 KB)

相似文章

MLEvolve:自动化机器学习算法发现的自我进化框架

Hugging Face Daily Papers

MLEvolve是一个基于LLM的自我进化多智能体框架,用于自动化机器学习算法发现。它将树搜索扩展为Progressive MCGS,并引入基于图的跨分支信息流和Retrospective Memory。该框架在MLE-Bench上取得了最先进的性能,并在数学算法优化任务上优于AlphaEvolve。

KForge:面向AI加速器的LLM驱动跨平台内核生成

arXiv cs.LG

KForge是一个跨平台框架,利用两个协作的基于LLM的智能体,自动生成和优化适用于多种AI加速器的高性能计算内核,在NVIDIA B200和Intel Arc B580硬件上实现了显著的加速效果。

AdaExplore:基于失败驱动的自适应与多样性保留搜索的高效内核生成

arXiv cs.CL

来自卡内基梅隆大学、华盛顿大学和Arm的研究人员提出了AdaExplore,这是一种用于GPU内核代码生成的LLM智能体框架。该框架通过失败驱动自适应与多样性保留搜索技术,在不进行额外微调的情况下,在KernelBench Level-2和Level-3基准测试中分别实现了3.12倍和1.72倍的加速。

Verilog-Evolve: 反馈驱动与技能演进的Verilog生成

arXiv cs.CL

Verilog-Evolve 是一个反馈驱动的框架,通过迭代优化大型语言模型生成的 Verilog 代码,利用功能仿真、综合和时序指标促进更优候选方案的选出,并跨任务演进可复用的修复技能。