tensor-core

标签

Cards List
#tensor-core

在RTX GPU上探索FlashAttention-3/4优化

Reddit r/LocalLLaMA · 2026-07-09

本文探讨了FlashAttention-3/4优化是否对RTX GPU有益,得出结论:由于消费级显卡的硬件限制,FA-2已是天花板。

0 人收藏 0 人点赞
#tensor-core

@elliotarledge:Claude Fable 5 [max] 在 KernelBench-Hard 上的表现。给我印象最深的核心是 B200 fp8 GEMM:它手动编写了原始的 SM10…

X AI KOLs Timeline · 2026-07-03 缓存

Claude Fable 5 通过为 B200 fp8 GEMM 手动编写 PTX 代码,在 KernelBench-Hard 上取得了顶级结果,超越了其他模型,并在计算密集型形状上达到峰值性能的 44-59%。

0 人收藏 0 人点赞
#tensor-core

@charles_irl: 重写并行是一项重大举措,如果能比我们用CuTe DSL实现的速度更快就好了。FA4是一个非常…

X AI KOLs Following · 2026-06-11 缓存

关于使用CuTe DSL和瓦片编程模型重写并行性以提升FA4 (FlashAttention 4) 内核性能的讨论。

0 人收藏 0 人点赞
#tensor-core

FP8就是你所需的一切(第一部分):驳斥硬件FP64作为HPC圣杯的观点

arXiv cs.AI · 2026-06-08 缓存

本文认为,在使用Ozaki Scheme II的情况下,FP8张量核心可以替代原生FP64硬件,用于像NVIDIA B300这样的AI优化GPU上的高性能科学计算,以更高的吞吐量实现完全的双精度精度。作者提出了张量-内存均衡模型,并表明在所有工作负载中,模拟的FP64性能可以比原生FP64高出数个数量级。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈