标签
本文认为,现代硬件(特别是IOMMU)通过消除上下文切换的开销,使微内核再次变得可行,并建议重新审视微内核设计以提高安全性和可靠性。
KDA (Kernel Design Agents) 是来自 MIT HAN Lab 的一个开源、以代理为中心的工作流,用于使用编码代理对性能敏感的 CUDA 内核任务进行研究、实现、验证和迭代。它帮助 Databricks 在 NVIDIA 的 SOL-ExecBench 排行榜上获得了第一名。
Enze Xie 宣布推出 Sol Video Inference Engine,这是一个基于智能体的原生、无需训练的全栈加速器,用于视频扩散,能够自动调整缓存、稀疏注意力、令牌剪枝、量化和内核融合,在像 64B Cosmos3-Super 和 22B LTX-2.3 这样的大模型上实现了 >2 倍的端到端加速。
从 MSA 论文内核设计部分实现了 top-k 内核,使用免指数比较和通过 CUDA shuffle 进行的 warp 级树合并。代码已发布于 GitHub。
KDA是一个由智能体驱动的内核设计框架,通过最小化人工参与,帮助HAN Lab在MLSys FlashInfer Kernel Contest中获得顶尖排名。该智能体利用Humanize、KernelWiki和性能分析技能来生成最先进的内核。
这篇评论文章认为,由于根本性的硬件差异,AI内核在不同硬件(TPU、GPU等)上的可移植性在结构上是不可能的,并且尽管业界渴望可移植性,但最好的AI堆栈始终需要特定于硬件的DSL才能获得最佳性能。