标签
本文介绍了如何在 Splash 中使用 'make tune-kernels' 工具来优化40核 M5 Max 芯片上的 AI 模型解码,通过为特定硬件调优内核布局,实现高达20%的速度提升。
一个智能代理CUDA内核优化器,通过迭代代码生成、正确性检查、基准测试和优化,自动化GPU实现生成,由LangGraph和OpenAI模型驱动。
这个Twitter线程介绍了Hugging Face的Kernels,这是一个工具,允许用户选择和替换AI模型中支持层的优化内核实现,而无需重写整个模型。
本文描述了针对 DeepSeek-V4.1-Flash AI 模型在 Metal 硬件上的一项优化,改进了注意力内核,使其仅启动必要的 tile 块,从而减少了计算浪费并提升了推理速度。
本文介绍了tritonBLAS,这是一种分析模型,用于优化GPU GEMM内核参数,无需运行时自动调优,实现近最优性能并显著减少编译时间。
本文介绍AMDKernelVault,这是一个用于AMD GPU内核优化的开放数据集和训练框架,包含大规模HIP和Triton内核,以及用于生成和验证内核的代理驱动流水线。
Google Accelerator Agents是一个GitHub仓库,包含AI驱动的工具,用于加速TPU上的机器学习开发,特色是使用Gemini的代理进行代码迁移和内核优化。
本文介绍了DataKernelBench,这是一个用于评估LLMs在优化GPU内核以处理数据库查询方面的基准测试,相比如torch.compile等基线方法实现了加速。
KernelArc是一个多智能体框架,使用策略专业化智能体来自主优化GPU内核以处理异构工作负载,并在NVIDIA GPU基准测试中取得顶级排名。
This paper presents CAKE, a compiler-agent co-design framework that lets AI agents author a hardware-explicit IR for GPU kernels, achieving significant speedups over baselines across various workload families.
Kernel Forge是一个开源智能体框架,利用大语言模型和蒙特卡洛树搜索,为任何未经修改的PyTorch模型自动生成并优化CUDA内核,在Gemma 4 E2B的softmax上实现了高达2.83倍的加速。
作者优化了BitNet三值模型在CPU上的矩阵乘法内核,单独测试实现了29倍加速,但发现模型是内存密集型,端到端仅提升6-10%。推理引擎已开源。
SonicSampler 提出了一套统一的Tile感知Triton内核,垂直融合了整个LLM采样流水线,支持动态的逐请求行为和推测性验证,相较于最先进的基线实现了高达16倍的加速。
JAXBench是一个新的基准测试套件,包含50个JAX工作负载,用于评估在谷歌云TPU上的AI生成内核优化,提供人工调优基线和智能体评估框架。论文发现,基于精选TPU文档进行条件化处理能显著提升正确性和加速比,其中Autocomp波束搜索在人工调优内核上相比XLA实现了高达1.6倍的几何平均加速。
作者在其共100部分的GPU学习系列中,回顾了Andrew Kerr在GTC 2020上的一场讲座,内容是关于开发高性能CUDA内核以将NVIDIA A100的Tensor Core性能推向极致,探讨了相关技术以及原生CUDA与CUTLASS之间的取舍。
Sharon Zhou提出了一个与厂商无关的内核级GPU性能基准测试,旨在帮助AI代理优化前沿模型的计算效率,并以AMD的AgentKernelArena为起点。
用户分享了使用Sol的计划:优化llama.cpp中的MTP支持、标准化聊天模板、恢复废弃的whisper项目、完成个人理财应用以及内核优化。
Xenova 使用 Fable 5 编写优化内核,在 M4 上的 WebGPU 中为 Gemma 4 实现了每秒 255 个 token 的速度,展示了用于端侧推理的代理内核优化。
Meta的一位PyTorch核心工程师展示了一个快速的CUDA内核优化循环,其性能优于昂贵的训练营,获胜代码通过KernelBot竞赛合并到了PyTorch中。
Linux 7.2 内核合并了一项针对匿名/未命名管道的性能优化,通过在互斥锁外部预分配页面来避免竞争,使吞吐量提升 6-48%,延迟降低 17-33%。