标签
PyTorch Conference 北美会议将展示来自各组织的专家团队在 torch.compile、自定义内核编写以及扩展效率方面取得的重大突破。
PyTorch 2.14 引入了重大更新,包括在 Inductor 中使用 NVGEMM 处理 CUTLASS 内核,用于分布式计算的新 nccl2 后端,高级容错性,以及在 Apple Silicon 上的原生线性代数。
一篇博文,解释 PyTorch FX 图,这是 PyTorch 2.0 编译生态系统中使用的一种中间表示。它涵盖了核心对象 Graph、Node 和 GraphModule,以及如何理解和使用它们。
一种加速矩阵乘法的技术,适用于 M 和 N 较小而 K 较大的情况(如 MoE routers 和 small-batch decoding),通过分解 K 并并行运行部分 GEMM,然后将 epilogue 折叠到归约存储中。该方法使用自定义 Triton 内核,在大多数形状上击败了 PyTorch Inductor。
本文介绍了Decompose-K技术,用于加速瘦高大K矩阵乘法,通过将K维度分割成块,执行批量矩阵乘法,并求和部分结果。还提供了PyTorch实现和基准测试,显示对于形状不佳的矩阵乘法,相比标准torch.compile有显著加速。
作者解释了算子融合是torch.compile加速的关键机制,并提供了一个仅500行的Python最小实现及配套的笔记作为教学工具。
本文解释了 PyTorch 中的 torch.compile 堆栈,详述了从 API 到 Dynamo、FX 图、ATen 操作以及用于 JIT 编译的 Torch Inductor 的各个步骤。
发布了一个自定义内核,进一步优化来自Lightricks的LTX-2.3,在GB10上实现了1.52倍加速,基于之前的torch.compile和cuDNN注意力优化。
宣布性能分析教程的第2部分,涵盖线性层追踪、gemm epilogues、MLP追踪以及torch compile与Liger内核的对比,并附有完整内容的链接。
Sayak Paul 描述了一个使用 torch.compile 分析和优化 Diffusers 流水线的项目,并宣布由 Ari G. 教授的相关教程系列。