@songhan_mit: 探索 KDA (Kernel Design Agents): https://github.com/mit-han-lab/kernel-design-agents…

X AI KOLs Following 工具

摘要

KDA (Kernel Design Agents) 是来自 MIT HAN Lab 的一个开源、以代理为中心的工作流,用于使用编码代理对性能敏感的 CUDA 内核任务进行研究、实现、验证和迭代。它帮助 Databricks 在 NVIDIA 的 SOL-ExecBench 排行榜上获得了第一名。

探索 KDA (Kernel Design Agents): https://github.com/mit-han-lab/kernel-design-agents…
查看原文
查看缓存全文

缓存时间: 2026/07/02 04:18

mit-han-lab/kernel-design-agents

来源:https://github.com/mit-han-lab/kernel-design-agents

Kernel Design Agents

Kernel Design Agents (KDA) 是一种以智能体为中心的工作流程,利用编码智能体对性能敏感的 CUDA 内核任务进行研究、实现、验证和迭代。

本仓库记录了早期的研究原型,目前仍在积极开发中(我们期待社区的反馈!)。如果您对 HAN Lab Mafia 在 MLSys Kernel Contest 中排名第 1~3 名的方案感兴趣,请参考 mit-han-lab/mlsys2026-flashinfer-contest (https://github.com/mit-han-lab/mlsys2026-flashinfer-contest) 进行性能评估和复现。

目录

路径用途
docs/agent-flow.md最小端到端 KDA 工作流程。
prompts/README.md如何使用提示模板。
prompts/basic-flow.md针对新任务的通用起始提示。
CLAUDE.md面向仓库的智能体指令。

开始使用

在启动智能体会话之前,请先安装工作流程依赖项:

``bash git clone –recurse-submodules https://github.com/mit-han-lab/kernel-design-agents.git cd kernel-design-agents

链接技能

mkdir -p ~/.claude/skills ln -s “(pwd)/skills/ncu-report-skill" ~/.claude/skills/ncu-report-skill ln -s "(pwd)/skills/KernelWiki” ~/.claude/skills/KernelWiki

或直接克隆技能

mkdir -p ~/.claude/skills && cd ~/.claude/skills git clone https://github.com/mit-han-lab/ncu-report-skill.git git clone https://github.com/mit-han-lab/KernelWiki.git ``

通过 Claude Code 插件 UI 安装 humanize 插件:

text /plugin marketplace add PolyArch/humanize /plugin install humanize@PolyArch

最小流程

  1. 为目标任务创建一个独立的实现工作空间。
  2. 定义任务契约:目标、约束、验证命令和晋升标准。
  3. 在实现工作空间中启动一个智能体会话。
  4. prompts/basic-flow.md 填充任务特定的细节后交给智能体。
  5. 要求智能体在实现工作空间的 docs/draft.md 中编写简短的草稿计划。
  6. 将草稿转换为可执行的计划,可以手动完成,也可以使用像 Humanize 这样的规划工具。
  7. 以小迭代方式实现,每次有意义的更改后进行验证。
  8. 记录候选方案、基准测试或评估结果、性能分析证据以及最终的晋升决策。

该工作流程特意独立于任何单一的基准测试框架或硬件目标。下游任务可以添加自己的评估器、数据集、性能分析工具和领域特定的参考资料。

推荐的工作空间布局

将此仓库作为参考资料,然后在其他地方进行实现工作:

text task-workspace/ docs/ draft.md plan.md runs/ outputs/ profile/ benchmark.csv candidates.jsonl

具体文件可以根据领域而变化。重要的规则是:智能体需要记录足够的上下文,以便另一位工程师能够理解尝试了什么、通过了哪些验证、以及为什么选择最终的候选方案。

Yuchen Jin (@Yuchenj_UW): Databricks 在 NVIDIA 的 SOL-ExecBench 内核排行榜的 L1 单操作赛道中排名第一,这得益于 KDA (Kernel Design Agents) 🎉

令人难以置信的是:我们 100% 利用 AI 智能体击败了竞争对手。

这是递归自我改进的一个预演。核心

相似文章

AdaExplore:基于失败驱动的自适应与多样性保留搜索的高效内核生成

arXiv cs.CL

来自卡内基梅隆大学、华盛顿大学和Arm的研究人员提出了AdaExplore,这是一种用于GPU内核代码生成的LLM智能体框架。该框架通过失败驱动自适应与多样性保留搜索技术,在不进行额外微调的情况下,在KernelBench Level-2和Level-3基准测试中分别实现了3.12倍和1.72倍的加速。

@songhan_mit: 我们开发了一种基于智能体的原生方法来加速生成式AI,延续了KDA(内核设计智能体)在更高层次上的成功…

X AI KOLs Following

Enze Xie 宣布推出 Sol Video Inference Engine,这是一个基于智能体的原生、无需训练的全栈加速器,用于视频扩散,能够自动调整缓存、稀疏注意力、令牌剪枝、量化和内核融合,在像 64B Cosmos3-Super 和 22B LTX-2.3 这样的大模型上实现了 >2 倍的端到端加速。