标签
PTXBench被介绍为一个基准,用于评估和适配大型语言模型,以使用架构特定的PTX优化GPU内核,显示性能不均和微调见解。
一条教育性推文,解释了 NVIDIA 软件栈的三个层级(CUDA C++、PTX、SASS),以及 CUDA 的抽象如何构建护城河,同时提到 Luminal 的自动编译器搜索。
Claude Fable 5 通过为 B200 fp8 GEMM 手动编写 PTX 代码,在 KernelBench-Hard 上取得了顶级结果,超越了其他模型,并在计算密集型形状上达到峰值性能的 44-59%。
本文通过一个简单的向量加法示例,详细介绍了CUDA内核从源代码到硬件执行的编译和启动全过程,并阐述了nvcc、PTX、SASS及ioctls的作用。
INT21 宣布推出 PTX Kernel Factory,这是一个自我改进的智能体集群,能够自主大规模生成专家级 PTX GPU 内核,并提供开源概念验证实现和 beta 访问权限。
CUDA 13.3 引入了重大增强,包括 Tile C++ 支持、C++23 标准、改进的 NVRTC、稳定的 CUDA Python 1.0 API,以及 PTX 9.3 中的新 fabric 指令和异步多内存操作,主要面向内核开发者和运行时工程师。