torch-compile

标签

Cards List
#torch-compile

@PyTorch:来自整个生态系统的工程团队将展示 torch.compile、自定义内核编写…的重大突破

X AI KOLs Timeline · 昨天 缓存

PyTorch Conference 北美会议将展示来自各组织的专家团队在 torch.compile、自定义内核编写以及扩展效率方面取得的重大突破。

0 人收藏 0 人点赞
#torch-compile

@PyTorch:PyTorch 2.14 通过 NVGEMM 将 CuTeDSL 生成的 CUTLASS 内核引入 Inductor,为 PyTorch Distributed 提供新的 nccl2 后端…

X AI KOLs Following · 2026-09-02 缓存

PyTorch 2.14 引入了重大更新,包括在 Inductor 中使用 NVGEMM 处理 CUTLASS 内核,用于分布式计算的新 nccl2 后端,高级容错性,以及在 Apple Silicon 上的原生线性代数。

0 人收藏 0 人点赞
#torch-compile

@jino_rohit: https://x.com/jino_rohit/status/2071247775837356399

X AI KOLs Timeline · 2026-06-28 缓存

一篇博文,解释 PyTorch FX 图,这是 PyTorch 2.0 编译生态系统中使用的一种中间表示。它涵盖了核心对象 Graph、Node 和 GraphModule,以及如何理解和使用它们。

0 人收藏 0 人点赞
#torch-compile

@shreyansh_26: 当 M 和 N 很小而 K 很大时,如何让矩阵乘法变快?(MoE routers、small-batch decode。)Decompose-K: …

X AI KOLs Timeline · 2026-06-22 缓存

一种加速矩阵乘法的技术,适用于 M 和 N 较小而 K 较大的情况(如 MoE routers 和 small-batch decoding),通过分解 K 并并行运行部分 GEMM,然后将 epilogue 折叠到归约存储中。该方法使用自定义 Triton 内核,在大多数形状上击败了 PyTorch Inductor。

0 人收藏 0 人点赞
#torch-compile

@shreyansh_26: https://x.com/shreyansh_26/status/2069125463860302212

X AI KOLs Timeline · 2026-06-22 缓存

本文介绍了Decompose-K技术,用于加速瘦高大K矩阵乘法,通过将K维度分割成块,执行批量矩阵乘法,并求和部分结果。还提供了PyTorch实现和基准测试,显示对于形状不佳的矩阵乘法,相比标准torch.compile有显著加速。

0 人收藏 0 人点赞
#torch-compile

尽管有高度优化的NumPy函数,torch.compile()如何实现大幅加速?[D]

Reddit r/MachineLearning · 2026-06-19

作者解释了算子融合是torch.compile加速的关键机制,并提供了一个仅500行的Python最小实现及配套的笔记作为教学工具。

0 人收藏 0 人点赞
#torch-compile

@jino_rohit: 理解 torch.compile 堆栈 torch.compile 是一种加速 PyTorch 代码的技术。torch.compile 通过…

X AI KOLs Timeline · 2026-06-17 缓存

本文解释了 PyTorch 中的 torch.compile 堆栈,详述了从 API 到 Dynamo、FX 图、ATen 操作以及用于 JIT 编译的 Torch Inductor 的各个步骤。

0 人收藏 0 人点赞
#torch-compile

@RisingSayak: 发布首个内核以最终优化来自@Lightricks的LTX-2.3!torch.compile + cuDNN attn 已经…

X AI KOLs Following · 2026-06-12 缓存

发布了一个自定义内核,进一步优化来自Lightricks的LTX-2.3,在GB10上实现了1.52倍加速,基于之前的torch.compile和cuDNN注意力优化。

0 人收藏 0 人点赞
#torch-compile

@ariG23498: 现在是性能分析时间!在第2部分中,我们涵盖:> 追踪线性层 > 讨论 mul + add 与 linear 的对比 > gemm epilogues (我最…

X AI KOLs Timeline · 2026-06-11 缓存

宣布性能分析教程的第2部分,涵盖线性层追踪、gemm epilogues、MLP追踪以及torch compile与Liger内核的对比,并附有完整内容的链接。

0 人收藏 0 人点赞
#torch-compile

@RisingSayak: 我意识到,无法分析的东西就无法优化。这就是为什么我在Diffusers中开始了一个小项目,来……

X AI KOLs Following · 2026-05-22 缓存

Sayak Paul 描述了一个使用 torch.compile 分析和优化 Diffusers 流水线的项目,并宣布由 Ari G. 教授的相关教程系列。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈