flash-attention

标签

Cards List
#flash-attention

@__solo69__: Flash attention 遵循这一原则,最小化昂贵的数据移动,并最大化对已达到快速片上内存的数据的复用

X AI KOLs Timeline ↗ · 2026-09-14 缓存

一条推文解释了 Flash attention 背后的优化原则,重点是最小化数据移动和最大化片上内存复用,背景是语言建模课程讲座。

0 人收藏 0 人点赞
#flash-attention

@zhangchitc: 为什么FlashAttention既快速又具有GPU内存高效性?

X AI KOLs Timeline ↗ · 2026-09-12

一条推文询问为什么FlashAttention在AI计算中既快速又具有GPU内存高效性。

0 人收藏 0 人点赞
#flash-attention

CUDA/HIP:Flash Attention 调优(gfx1201)由 pwilkin · 拉取请求 #28102 · ggml-org/llama.cpp

Reddit r/LocalLLaMA ↗ · 2026-09-11 缓存

此拉取请求为 llama.cpp 项目中的 CUDA/HIP 引入了 Flash Attention 调优优化,针对 gfx1201 硬件以提升推理性能。

0 人收藏 0 人点赞
#flash-attention

@pallavishekhar_: 学习LLM推理工程 - Prefill vs Decode - KV Cache - PagedAttention - Flash Attention - Continuous Batching…

X AI KOLs Timeline ↗ · 2026-08-28 缓存

LLM推理工程关键概念的教育概述,涵盖KV cache、PagedAttention、Flash Attention和连续批处理等技术,以优化推理性能。

0 人收藏 0 人点赞
#flash-attention

为什么推测解码在2026年走向成熟?

Reddit r/LocalLLaMA ↗ · 2026-08-10

讨论了为什么推测解码在2026年对LLM推理而言走向成熟,引用了Uber的早期使用、Apple和DeepMind的论文以及Tri Dao的研究,并观察了其在框架和本地部署中的采用情况。

0 人收藏 0 人点赞
#flash-attention

@charliermarsh: 在Astral,我们为流行的GPU支持包(如FlashAttention和DeepSpeed)创建了预构建的wheel,并分发…

X AI KOLs Following ↗ · 2026-07-30 缓存

Astral正在开源其为支持GPU的Python包(如FlashAttention和DeepSpeed)预构建wheel的构建管道,并通过标准Python索引向所有人提供这些wheel。

0 人收藏 0 人点赞
#flash-attention

面向V100用户:SGLang运行Qwen+Dflash和Laguna

Reddit r/LocalLLaMA ↗ · 2026-07-27

修改SGLang以在V100 GPU上支持Qwen和Laguna模型,使用自定义的FlashAttention和Marlin内核,在4xV100硬件上获得了不错的吞吐量。

0 人收藏 0 人点赞
#flash-attention

Google 正在更新 Gemma 4 的聊天模板,大幅修复工具调用并减少“惰性”,在 Hopper GPU 上启用 Flash Attention 4,同时提供关于如何操作及改进其视觉能力的交互式指南!

Reddit r/LocalLLaMA ↗ · 2026-07-15 缓存

Google 更新了 Gemma 4 的聊天模板,显著修复了工具调用,减少了惰性,在 Hopper GPU 上启用了 Flash Attention 4,并发布了交互式视觉指南。这些更新现已可在 Hugging Face 上获取。

0 人收藏 0 人点赞
#flash-attention

@Alacritic_Super: LLM推理的最大瓶颈不是算术运算,而是数据移动。一次乘加运算仅需…

X AI KOLs Timeline ↗ · 2026-07-15 缓存

一条科普线程,解释LLM推理的主要瓶颈是数据移动而非计算,并强调了量化、KV缓存优化和FlashAttention等减少内存流量技术的要点。

0 人收藏 0 人点赞
#flash-attention

Flash-MSA: 利用稀疏注意力内核加速百万token训练

Hacker News Top ↗ · 2026-07-12 缓存

介绍Flash-MSA,首个针对MiniMax稀疏注意力在Hopper和Blackwell GPU上的高性能开源训练内核,实现高效的百万token训练。

0 人收藏 0 人点赞
#flash-attention

@Alacritic_Super: 如果你认真对待LLM推理,学习FlashAttention。它是现代…背后最重要的优化之一。

X AI KOLs Timeline ↗ · 2026-07-08 缓存

一条推文推荐在LLM推理中学习FlashAttention,强调其在优化GPU内存流量和加速注意力机制方面的重要性,并附有FlashAttention、FlashAttention-2和FlashAttention-3的GitHub仓库和论文链接。

0 人收藏 0 人点赞
#flash-attention

@ekzhang1:我看着像这个家伙一样写真正的GPU内核的人 :)

X AI KOLs Timeline ↗ · 2026-07-08 缓存

AI模型Claude被用于使用pyptx DSL编写FlashAttention前向内核,在NVIDIA B200硬件上实现了与手工调优的FlashAttention-4近乎相同的性能。

0 人收藏 0 人点赞
#flash-attention

@PatrickToulme: 这个练习让我相信DSL和编译器的未来在很大程度上是代理化的。编程语言和DSL但…

X AI KOLs Timeline ↗ · 2026-07-07 缓存

Claude Fable 使用 pyptx DSL 为 NVIDIA B200 编写了一个 FlashAttention 前向内核,其性能与手动调优的 CUTLASS 内核接近,展示了 AI 代理在编译器和 DSL 设计中的潜力。

0 人收藏 0 人点赞
#flash-attention

@seclink: https://x.com/seclink/status/2072187033263784397

X AI KOLs Timeline ↗ · 2026-07-01 缓存

Hybrid Sliding Window Attention (Hybrid SWA) 是一种在长文本语言模型中平衡计算效率与全局长距离依赖的混合注意力机制,通过交替使用局部SWA层和全局注意力层,显著压缩KV Cache同时保持推理能力。文章详细介绍了其设计原理、在Gemma、Qwen等模型中的应用,以及vLLM和HuggingFace等开源项目中的最佳实践。

0 人收藏 0 人点赞
#flash-attention

机制驱动的LLM训练不稳定性预判监测器

arXiv cs.CL ↗ · 2026-06-29 缓存

提出了一种基于机制驱动的监测器,用于预判检测LLM训练不稳定性,通过从低精度闪光注意力(flash attention)和MoE路由器中提取内部信号,使得能在损失发散前数千步进行检测。

0 人收藏 0 人点赞
#flash-attention

面向MLSys的现代GPU编程

Hacker News Top ↗ · 2026-06-23 缓存

CMU机器学习系统课程的一本新书教授面向ML系统的现代GPU编程,涵盖Blackwell架构、GEMM和FlashAttention,使用TIRx Python DSL。

0 人收藏 0 人点赞
#flash-attention

@yukangchen_: 我们很高兴分享一篇新的技术文章《KV缓存压缩及其基础设施问题》。https://research.nvidia.…

X AI KOLs Timeline ↗ · 2026-06-16 缓存

NVIDIA Research发布了一篇技术博客,探讨KV缓存压缩技术及其基础设施问题,包括FlashAttention和paged attention如何为长上下文LLM的生产部署带来实际障碍,并提出了一个使用RoPE的几何解决方案。

0 人收藏 0 人点赞
#flash-attention

@charles_irl: 重写并行是一项重大举措,如果能比我们用CuTe DSL实现的速度更快就好了。FA4是一个非常…

X AI KOLs Following ↗ · 2026-06-11 缓存

关于使用CuTe DSL和瓦片编程模型重写并行性以提升FA4 (FlashAttention 4) 内核性能的讨论。

0 人收藏 0 人点赞
#flash-attention

@charles_irl: 给不关心FA4在softmax与MMA负载上分配多少warpgroup的人的tl;dr。推理与训练不…

X AI KOLs Following ↗ · 2026-06-11 缓存

解释推理内核与训练不同,Flash Attention 4 侧重于改变跨KV的并行性并支持小型不规则负载。

0 人收藏 0 人点赞
#flash-attention

@maximelabonne: Parallax 是一种参数化的局部线性注意力形式,它摒弃了数值求解器,在解码性能上媲美 FA 2/3……

X AI KOLs Following ↗ · 2026-06-10 缓存

Parallax 是一种新的参数化局部线性注意力形式,去除了数值求解器,在解码方面与 FlashAttention 2/3 相匹配。其有效性取决于优化器,与 Muon 配合有效,但与 AdamW 配合无效,这凸显了优化器几何形状的作用。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈