@tqchenml:我们将在这个春天的 CMU ML Systems 课程(@SCSatCMU)中教授 Agentic GPU Programming for MLSys 模块……
摘要
Tianqi Chen(MLC AI)宣布了一本开源在线书籍,以及即将在 CMU ML Systems 课程中开设的 Agentic GPU Programming for MLSys 模块,内容涵盖编程智能体如何利用编译器驱动的工具链、知识库和基准测试来编写和优化 GPU kernel。
查看缓存全文
缓存时间: 2026/10/01 00:13
面向 MLSys 的 Agentic GPU 编程 —— 面向 MLSys 的 Agentic GPU 编程
来源:https://mlc.ai/agentic-gpu-programming-for-mlsys/
面向 MLSys 的 Agentic GPU 编程# (https://mlc.ai/agentic-gpu-programming-for-mlsys/#agentic-gpu-programming-for-mlsys)
机器学习系统依赖高速 GPU kernel 来完成训练与推理服务。Attention、矩阵乘法以及融合算子在这些系统中占据了大量的计算工作量。改进这些 kernel 的实现方式,能够显著降低运行模型所需的时间与资源。
要让这些 kernel 跑得更快,需要对算法、GPU 硬件以及编程模型有深入的理解。如今,coding agent 已经能够越来越多地承担这些工作:查找相关实现、编写 kernel、解读诊断信息,并决定下一步尝试什么。要有效发挥这些能力,就需要一套能够协调各项工作的 workflow,以及一个能让 agent 获取其所需知识与反馈的运行环境。
本书介绍了 agentic GPU 编程的核心要素。你将学习编译器驱动的 harness 如何赋能 agent,使其能够表达优化思路、诊断错误、测量性能,并保留值得留存的优化结果。这些能力共同构成了一条高效的优化流程。
本书首先构建编译器基础、领域特定的程序分析、知识库,以及 GPU 基准测试与性能剖析。随后展示了 agent workflow 如何与该编译器 harness 协同,引导一次完整的优化运行。
本书的素材源自我们构建和使用 agentic GPU 编程系统的实战经验。它是 Modern GPU Programming for MLSys (https://mlc.ai/modern-gpu-programming-for-mlsys/) 的配套书籍,我们计划将其整合进 Carnegie Mellon University 的 Machine Learning Systems (https://mlsyscourse.org/) 课程体系。
本书是开源的。欢迎通过 GitHub 仓库 (https://github.com/mlc-ai/agentic-gpu-programming-for-mlsys) 提交贡献、纠错以及补充示例。
本书结构# (https://mlc.ai/agentic-gpu-programming-for-mlsys/#how-this-book-is-organized)
- 第一部分,Agentic GPU 编程的核心要素。 本部分介绍 agentic GPU 编程的基础要素。开篇概述了在迭代式 kernel 开发过程中,编译器基础设施与 agent workflow 如何协同配合。后续各章通过示例与交互式图解,逐一展开核心要素——领域特定程序分析、可复用知识、基准测试与性能剖析。本部分最后对比了不同的 agent workflow,并展示了如何将这些要素组合成有效的 GPU 优化策略。
- 第二部分,TIRx Harness 概览。 本部分介绍 TIRx——编译器 harness 的一个具体实现,也是本书其余章节所使用的运行环境。内容涵盖 TIRx 的编译器基础,以及带执行接口的 KCoral 基准测试服务器。
- 第三部分,Agentic GPU 编程实战。 本部分是一份动手实践教程,将前面章节的内容付诸实践,完整走通 agentic GPU 编程的端到端流程。它深入分析了 harness 在优化运行过程中返回的反馈,以及 agent 与 harness 各组成部分之间的交互模式,并在结尾提供了若干进阶技巧。Grouped GEMM 引出了整套 workflow;而录制的 Kimi Delta Attention 运行记录则提供了诊断与评估的示例。
相似文章
面向MLSys的现代GPU编程
CMU机器学习系统课程的一本新书教授面向ML系统的现代GPU编程,涵盖Blackwell架构、GEMM和FlashAttention,使用TIRx Python DSL。
@gneubig: 今年秋季,CMU将开设一门关于AI代理的新课程!目标是让你学会如何创建脚手架、构建评…
卡内基梅隆大学将在今年秋季开设一门关于AI代理的新课程,涵盖脚手架、评估以及使用强化学习训练代理型LLM,理论与实践并重。
@levidiamode: GPU编程的第163/365天 - 今天看几个不同的agentic GPU内核优化系统。我最感兴趣的两个是…
一条推文讨论了两种agentic GPU内核优化系统:@dogacel0的Auto GPU Kernel和@songhan_mit实验室的Kernel Design Agents,两者均在MLSys Sparse Attention FlashInfer比赛中获胜。该帖子突出了使用子代理和Claude技能进行GPU编程的不同方法。
@shao__meng: Weekends are perfect for settling down to systematically learn foundational knowledge CMU Fall Latest Course 11-768: AI…
CMU offers a new fall 2026 course on AI Agents taught by Daniel Fried and Graham Neubig, covering topics like tool calling, reinforcement learning training, and human-computer interaction.
@HongyiJin258:AI 智能体正在成为 GPU 内核工程师。我们正在围绕它们重新思考编译器栈。认识一下 TIRx Harness:一个开……
MLC AI 发布 TIRx Harness,这是一个开源编译器框架,为 AI 智能体提供一个结构化环境,用于探索、调试和优化 GPU 内核。由智能体构建的 Kimi Delta Attention 内核,在前向传播上相比 FlashKDA 实现了 2.94 倍的几何平均加速,在反向传播上相比 FLA 实现了 6.84 倍的加速。