@maximelabonne: Parallax 是一种参数化的局部线性注意力形式,它摒弃了数值求解器,在解码性能上媲美 FA 2/3……

X AI KOLs Following 论文

摘要

Parallax 是一种新的参数化局部线性注意力形式,去除了数值求解器,在解码方面与 FlashAttention 2/3 相匹配。其有效性取决于优化器,与 Muon 配合有效,但与 AdamW 配合无效,这凸显了优化器几何形状的作用。

Parallax 是一种参数化的局部线性注意力形式,摒弃了数值求解器,在解码性能上媲美 FA 2/3。 最令人印象深刻的是,该架构的优势与 Muon 配合有效,但在 AdamW 下消失,因为模型学会了抑制这种优势。 这取决于优化器几何形状! Tilde 推出了大量高质量论文,干得漂亮!
查看原文
查看缓存全文

缓存时间: 2026/06/10 19:54

Parallax 是局部线性注意力的一种参数化形式,它摒弃了数值求解器,在解码阶段表现与 FA 2/3 相当。

最令人印象深刻的是,这种架构的优势在 Muon 优化器下得以发挥,但在 AdamW 下却消失了,因为模型学会了抑制它。

这取决于优化器的几何结构!

来自 Tilde 的优质论文层出不穷,非常棒的工作!

相似文章

MiniMax 稀疏注意力

Hugging Face Daily Papers

MiniMax 稀疏注意力 引入了一种分块稀疏注意力机制,针对超长上下文的大语言模型实现了显著的加速。在1M上下文长度下,每个token的注意力计算减少28.4倍,在H800 GPU上预填充阶段实际速度提升14.2倍,解码阶段提升7.6倍。该方法附带了一个开源推理内核以及一个公开发布的多模态模型。