C++ CuTe / CUTLASS vs CuTeDSL (Python) in 2026 — 新的GPU内核/LLM推理工程师到底应该学什么?[D]
摘要
讨论GPU内核工程从C++ CuTe/CUTLASS向NVIDIA基于Python的CuTeDSL的转变,质疑新工程师是应该学习遗留的C++模板,还是优先考虑为LLM推理工作而兴起的新技术栈。
对于刚开始从事GPU内核工程或LLM推理(FlashAttention / FlashInfer / SGLang / vLLM这类工作)的人来说,大多数招聘信息仍然将“C++17、CuTe、CUTLASS”列为硬性要求。与此同时,NVIDIA自2025年底以来一直在大力推广CuTeDSL(CUTLASS 4.x中的Python DSL),将其作为新内核的新推荐路径——性能相同,无需模板元编程,支持JIT,迭代速度更快,并且与TorchInductor直接集成。在FlashAttention-4、FlashInfer以及SGLang的NVIDIA合作路线图中,这种转变感觉非常真实。向已经在这个领域工作的人请教一个问题:对于一个2026年刚入门的人来说,是值得深入学习遗留的C++ CuTe/CUTLASS模板,还是应该优先学习CuTeDSL → Triton → Mojo(只需轻量级的C++来阅读旧代码)?这个“新技术栈”(CuTeDSL + Triton + Rust/Mojo用于推理服务)目前是否已具备生产可行性,或者招聘信息是否正确地指出,你仍然需要扎实的C++ CUTLASS技能才能被录用并交付真正的内核?对于那些希望为FlashInfer / SGLang / FlashAttention做出贡献的新内核工程师,在正确的学习顺序方面有什么实战经验或建议?期待诚实的看法——谢谢!
相似文章
@charles_irl: GPU 术语表新增文章:CuTe DSL、CUTLASS 和 CuTe——用于编写一些最高性能…
GPU 术语表新增文章,涵盖 CuTe DSL、CUTLASS 和 CuTe——这些工具用于在数据中心 GPU 上编写高性能 GPU 内核,并附有 Python 示例。
@PyTorch:PyTorch 2.14 通过 NVGEMM 将 CuTeDSL 生成的 CUTLASS 内核引入 Inductor,为 PyTorch Distributed 提供新的 nccl2 后端…
PyTorch 2.14 引入了重大更新,包括在 Inductor 中使用 NVGEMM 处理 CUTLASS 内核,用于分布式计算的新 nccl2 后端,高级容错性,以及在 Apple Silicon 上的原生线性代数。
大规模LLM推理开放手册(GPU内部机制、KV缓存、批处理、vLLM/SGLang/TensorRT-LLM)[P]
一本正在编写中的开放手册,解释LLM推理内部机制,包括GPU内存层次结构、KV缓存、批处理以及vLLM和TensorRT-LLM等流行推理引擎。
@TheAhmadOsman: 为什么我关注你硬件的推理引擎/软件栈? - 2x RTX 3090s: ~14.5 tok/s → ~64 tok/s 提升到…
不同硬件上推理引擎性能对比:在2x RTX 3090s上从基线迁移到TP=2的vLLM,性能从~14.5 tok/s提升至~64 tok/s;在RTX PRO 6000上迁移到Sglang,性能从~32 tok/s提升至~110 tok/s。推荐在CUDA/多GPU场景使用vLLM/Sglang,在边缘设备使用llama.cpp。
大语言模型与本地AI硬件的推理引擎(2026版)
本文提供了一份全面的指南,针对2026年本地AI硬件上的大语言模型推理引擎,解释了如何根据硬件策略、工作负载和服务模型进行选择,并涵盖了诸如llama.cpp、MLX、ExLlamaV2/3、vLLM、SGLang、TensorRT-LLM和NVIDIA Dynamo等引擎。