Parallax: 参数化局部线性注意力机制用于语言建模

Hugging Face Daily Papers 论文

摘要

介绍Parallax,一种参数化局部线性注意力机制,结合硬件感知优化,提升LLM预训练效率和性能,在0.6B和1.7B规模实现帕累托改进。

大型语言模型(LLM)已成为人工智能的核心范式,但注意力的核心计算原语在结构上仍未改变。局部线性注意力(LLA)是一种在测试时回归框架中源于非参数统计的注意力机制。与以往对高效注意力变体的研究不同,LLA将softmax注意力中的局部常数估计升级为局部线性估计,从而在关联记忆方面获得了可证明更优的偏差-方差权衡。然而,由于计算和数值稳定性问题,LLA尚未在LLM预训练中进行大规模应用。我们引入了Parallax,一种可扩展至LLM的参数化局部线性注意力。Parallax消除了LLA中的数值求解器,并学习一个额外的类查询投影器来探测KV协方差。我们将Parallax置于一个由带宽、投影器构造和仿射结构连接的注意力机制家族中。我们提出了一种硬件感知算法,提高了相较于FlashAttention的算术强度,使注意力进入更受计算约束的状态。我们的原型解码内核在多种批大小和上下文长度下匹配或超越了FlashAttention 2/3。我们在0.6B和1.7B规模上预训练了Parallax,发现在整个预训练过程中困惑度持续改善,这些改进可迁移至下游基准。在参数匹配和计算匹配的控制下,优势依然存在,证明了帕累托改进。我们进行了细致的预训练消融实验,发现Muon解锁了Parallax能力这一新现象。据我们所知,这是架构研究文献中首次对注意力机制的强架构-优化器协同设计进行实证展示。
查看原文
查看缓存全文

缓存时间: 2026/05/29 02:59

论文页面 - Parallax:用于语言建模的参数化局部线性注意力

来源:https://huggingface.co/papers/2605.29157

摘要

局部线性注意力通过参数化和硬件感知优化得到增强,在保持计算稳定性的同时提升了 LLM 训练效率和性能。

大型语言模型(LLM)已成为人工智能的核心范式,但其核心计算原语——注意力机制在结构上始终未曾改变。局部线性注意力(Local Linear Attention,LLA)是一种源自测试时回归框架中非参数统计的注意力机制。与先前关于高效注意力变体的研究不同,LLA 将 softmax 注意力中的局部常数估计升级为局部线性估计,在关联记忆方面实现了可证明更优的偏差-方差权衡。然而,由于计算和数值稳定性问题,LLA 尚未在 LLM 预训练中进行规模化应用。我们提出 Parallax,一种可扩展至 LLM 的参数化局部线性注意力。Parallax 消除了 LLA 中的数值求解器,并学习一个额外的类查询投影器来探测 KV 协方差。我们将 Parallax 置于一个由带宽、探测器构造和仿射结构连接的注意力机制家族之中。我们提出一种硬件感知算法,相比 FlashAttention 提高了算术强度,使注意力进入更偏向计算密集的范式。我们的原型解码核在不同批次大小和上下文长度下,性能可媲美或超越 FlashAttention 2/3。我们在 0.6B 和 1.7B 规模上预训练 Parallax,发现整个预训练过程中困惑度持续改善,并且这种提升可迁移至下游基准测试。在参数匹配和计算匹配两种控制条件下,该优势均持续存在,展现了帕累托改进。我们进行了细致的预训练消融实验,并发现一个新现象:Muon 优化器释放了 Parallax 的能力。据我们所知,这是架构研究文献中首次针对注意力机制展示架构-优化器强协同设计的实证结果。

查看 arXiv 页面 (https://arxiv.org/abs/2605.29157)
查看 PDF (https://arxiv.org/pdf/2605.29157)
GitHub (https://github.com/Yifei-Zuo/Parallax)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.29157)

在你的代理中获取这篇论文:

hf papers read 2605.29157

没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接到此论文

在模型的 README.md 中引用 arxiv.org/abs/2605.29157 即可从此页面链接该模型。

引用此论文的数据集0

没有数据集链接到此论文

在数据集的 README.md 中引用 arxiv.org/abs/2605.29157 即可从此页面链接该数据集。

引用此论文的 Space0

没有 Space 链接到此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2605.29157 即可从此页面链接该 Space。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到一个收藏 (https://huggingface.co/new-collection) 即可从此页面链接它。

相似文章

Lighthouse Attention(11分钟阅读)

TLDR AI

Lighthouse Attention是一种基于选择的分层注意力机制,通过在前向+反向传播中实现约17倍的速度提升(在512K上下文下),并在98K上下文中实现1.4–1.7倍的端到端加速,从而加速长上下文预训练。该机制使用Llama-3 530M模型在50B token上进行了验证。

Dynamic Linear Attention

Hugging Face Daily Papers

DLA引入了自适应状态合并和容量受限的内存建模,用于多状态线性注意力,提升了长上下文LLM的性能。