@songhan_mit: 探索 KDA (Kernel Design Agents): https://github.com/mit-han-lab/kernel-design-agents…
摘要
KDA (Kernel Design Agents) 是来自 MIT HAN Lab 的一个开源、以代理为中心的工作流,用于使用编码代理对性能敏感的 CUDA 内核任务进行研究、实现、验证和迭代。它帮助 Databricks 在 NVIDIA 的 SOL-ExecBench 排行榜上获得了第一名。
查看缓存全文
缓存时间: 2026/07/02 04:18
mit-han-lab/kernel-design-agents
来源:https://github.com/mit-han-lab/kernel-design-agents
Kernel Design Agents
Kernel Design Agents (KDA) 是一种以智能体为中心的工作流程,利用编码智能体对性能敏感的 CUDA 内核任务进行研究、实现、验证和迭代。
本仓库记录了早期的研究原型,目前仍在积极开发中(我们期待社区的反馈!)。如果您对 HAN Lab Mafia 在 MLSys Kernel Contest 中排名第 1~3 名的方案感兴趣,请参考 mit-han-lab/mlsys2026-flashinfer-contest (https://github.com/mit-han-lab/mlsys2026-flashinfer-contest) 进行性能评估和复现。
目录
| 路径 | 用途 |
|---|---|
docs/agent-flow.md | 最小端到端 KDA 工作流程。 |
prompts/README.md | 如何使用提示模板。 |
prompts/basic-flow.md | 针对新任务的通用起始提示。 |
CLAUDE.md | 面向仓库的智能体指令。 |
开始使用
在启动智能体会话之前,请先安装工作流程依赖项:
``bash git clone –recurse-submodules https://github.com/mit-han-lab/kernel-design-agents.git cd kernel-design-agents
链接技能
mkdir -p ~/.claude/skills ln -s “(pwd)/skills/ncu-report-skill" ~/.claude/skills/ncu-report-skill ln -s "(pwd)/skills/KernelWiki” ~/.claude/skills/KernelWiki
或直接克隆技能
mkdir -p ~/.claude/skills && cd ~/.claude/skills git clone https://github.com/mit-han-lab/ncu-report-skill.git git clone https://github.com/mit-han-lab/KernelWiki.git ``
通过 Claude Code 插件 UI 安装 humanize 插件:
text /plugin marketplace add PolyArch/humanize /plugin install humanize@PolyArch
最小流程
- 为目标任务创建一个独立的实现工作空间。
- 定义任务契约:目标、约束、验证命令和晋升标准。
- 在实现工作空间中启动一个智能体会话。
- 将
prompts/basic-flow.md填充任务特定的细节后交给智能体。 - 要求智能体在实现工作空间的
docs/draft.md中编写简短的草稿计划。 - 将草稿转换为可执行的计划,可以手动完成,也可以使用像 Humanize 这样的规划工具。
- 以小迭代方式实现,每次有意义的更改后进行验证。
- 记录候选方案、基准测试或评估结果、性能分析证据以及最终的晋升决策。
该工作流程特意独立于任何单一的基准测试框架或硬件目标。下游任务可以添加自己的评估器、数据集、性能分析工具和领域特定的参考资料。
推荐的工作空间布局
将此仓库作为参考资料,然后在其他地方进行实现工作:
text task-workspace/ docs/ draft.md plan.md runs/ outputs/ profile/ benchmark.csv candidates.jsonl
具体文件可以根据领域而变化。重要的规则是:智能体需要记录足够的上下文,以便另一位工程师能够理解尝试了什么、通过了哪些验证、以及为什么选择最终的候选方案。
Yuchen Jin (@Yuchenj_UW): Databricks 在 NVIDIA 的 SOL-ExecBench 内核排行榜的 L1 单操作赛道中排名第一,这得益于 KDA (Kernel Design Agents) 🎉
令人难以置信的是:我们 100% 利用 AI 智能体击败了竞争对手。
这是递归自我改进的一个预演。核心
相似文章
@LigengZhu: 很激动地分享KDA:驱动HAN Lab Kernel Mafia在Kernel Cont中获得#1~3内核排名的Kernel Design Agents……
KDA是一个由智能体驱动的内核设计框架,通过最小化人工参与,帮助HAN Lab在MLSys FlashInfer Kernel Contest中获得顶尖排名。该智能体利用Humanize、KernelWiki和性能分析技能来生成最先进的内核。
AgentKernelArena:兼顾泛化能力的GPU内核优化代理基准测试
AgentKernelArena是一个开源基准测试,用于评估AI编码代理在GPU内核优化方面的表现,涵盖完整的代理工作流程以及跨196个任务对未见配置的泛化能力。
@levidiamode: GPU编程的第163/365天 - 今天看几个不同的agentic GPU内核优化系统。我最感兴趣的两个是…
一条推文讨论了两种agentic GPU内核优化系统:@dogacel0的Auto GPU Kernel和@songhan_mit实验室的Kernel Design Agents,两者均在MLSys Sparse Attention FlashInfer比赛中获胜。该帖子突出了使用子代理和Claude技能进行GPU编程的不同方法。
AdaExplore:基于失败驱动的自适应与多样性保留搜索的高效内核生成
来自卡内基梅隆大学、华盛顿大学和Arm的研究人员提出了AdaExplore,这是一种用于GPU内核代码生成的LLM智能体框架。该框架通过失败驱动自适应与多样性保留搜索技术,在不进行额外微调的情况下,在KernelBench Level-2和Level-3基准测试中分别实现了3.12倍和1.72倍的加速。
@songhan_mit: 我们开发了一种基于智能体的原生方法来加速生成式AI,延续了KDA(内核设计智能体)在更高层次上的成功…
Enze Xie 宣布推出 Sol Video Inference Engine,这是一个基于智能体的原生、无需训练的全栈加速器,用于视频扩散,能够自动调整缓存、稀疏注意力、令牌剪枝、量化和内核融合,在像 64B Cosmos3-Super 和 22B LTX-2.3 这样的大模型上实现了 >2 倍的端到端加速。