@maximelabonne: Parallax 是一种参数化的局部线性注意力形式,它摒弃了数值求解器,在解码性能上媲美 FA 2/3……
摘要
Parallax 是一种新的参数化局部线性注意力形式,去除了数值求解器,在解码方面与 FlashAttention 2/3 相匹配。其有效性取决于优化器,与 Muon 配合有效,但与 AdamW 配合无效,这凸显了优化器几何形状的作用。
查看缓存全文
缓存时间: 2026/06/10 19:54
Parallax 是局部线性注意力的一种参数化形式,它摒弃了数值求解器,在解码阶段表现与 FA 2/3 相当。
最令人印象深刻的是,这种架构的优势在 Muon 优化器下得以发挥,但在 AdamW 下却消失了,因为模型学会了抑制它。
这取决于优化器的几何结构!
来自 Tilde 的优质论文层出不穷,非常棒的工作!
相似文章
Parallax: 参数化局部线性注意力机制用于语言建模
介绍Parallax,一种参数化局部线性注意力机制,结合硬件感知优化,提升LLM预训练效率和性能,在0.6B和1.7B规模实现帕累托改进。
@zhaoran_wang: 对我来说,最酷的发现是你可以连接/插值所有 softmax/线性 变体,并给出一个有前途的方向……
讨论了这样一个发现:所有 softmax/线性注意力变体都可以被插值,并且 Muon 优化器对于 Parallax 超越 Softmax Attention 至关重要。包含论文和代码链接。
MiniMax 稀疏注意力
MiniMax 稀疏注意力 引入了一种分块稀疏注意力机制,针对超长上下文的大语言模型实现了显著的加速。在1M上下文长度下,每个token的注意力计算减少28.4倍,在H800 GPU上预填充阶段实际速度提升14.2倍,解码阶段提升7.6倍。该方法附带了一个开源推理内核以及一个公开发布的多模态模型。
@Hass_Abdallah11: 我们有两篇新的 Colfax 文章,关于优化 FlashAttention-4,其中包括我(解码)和 Jack Carlisle(反向传播)的工作…
文章详细介绍了 FlashAttention-4 的优化技术,包括用于解码的 S/P 乒乓方法以重叠操作,在 NVIDIA Blackwell GPU 上实现了高达 16% 的性能提升。
FlashPrefill V2:面向长上下文LLM服务的块稀疏预填充注意力
FlashPrefill V2通过均值校正的稀疏注意力和优化的GPU算子改善了长上下文LLM服务,相比FlashAttention-2和稠密基线提供了显著的加速。