@charles_irl: ^这是CuTe DSL的一个示例,它用于FlashAttention-4内核等。以下是CuTe示例内核…
摘要
一条推文展示了一个CuTe DSL内核示例,该示例使用布局来表达转置,是FlashAttention-4内核的一部分。
^这是CuTe DSL的一个示例,它用于FlashAttention-4内核等。以下是CuTe内核示例,内含一个巧妙技巧:使用布局来表达转置。 https://modal.com/notebooks/modal-labs/examples/nb-owEUD0kdSVeL4KeEX5sjh1…
相似文章
@charles_irl: CuTe 和 CuTe DSL 文章包含最小代码片段,说明核心原则和基本用法。这些片段…
CuTe 和 CuTe DSL 文章提供了最小代码片段和 Modal Notebooks,以便动手学习。
@charles_irl: 重写并行是一项重大举措,如果能比我们用CuTe DSL实现的速度更快就好了。FA4是一个非常…
关于使用CuTe DSL和瓦片编程模型重写并行性以提升FA4 (FlashAttention 4) 内核性能的讨论。
@charles_irl: GPU 术语表新增文章:CuTe DSL、CUTLASS 和 CuTe——用于编写一些最高性能…
GPU 术语表新增文章,涵盖 CuTe DSL、CUTLASS 和 CuTe——这些工具用于在数据中心 GPU 上编写高性能 GPU 内核,并附有 Python 示例。
@fedebruzzone7: 从范畴论的角度:CuTe 布局的范畴基础 https://arxiv.org/abs/2601.05972
本文引入了一个范畴框架来形式化 NVIDIA 的 CUTLASS 库中的布局代数,定义了范畴和态射以表征张量布局,并提供了一个 Python 实现以及兼容性证明。
@PatrickToulme: 这个练习让我相信DSL和编译器的未来在很大程度上是代理化的。编程语言和DSL但…
Claude Fable 使用 pyptx DSL 为 NVIDIA B200 编写了一个 FlashAttention 前向内核,其性能与手动调优的 CUTLASS 内核接近,展示了 AI 代理在编译器和 DSL 设计中的潜力。