Parallax: 参数化局部线性注意力机制用于语言建模
摘要
介绍Parallax,一种参数化局部线性注意力机制,结合硬件感知优化,提升LLM预训练效率和性能,在0.6B和1.7B规模实现帕累托改进。
查看缓存全文
缓存时间: 2026/05/29 02:59
论文页面 - Parallax:用于语言建模的参数化局部线性注意力
来源:https://huggingface.co/papers/2605.29157
摘要
局部线性注意力通过参数化和硬件感知优化得到增强,在保持计算稳定性的同时提升了 LLM 训练效率和性能。
大型语言模型(LLM)已成为人工智能的核心范式,但其核心计算原语——注意力机制在结构上始终未曾改变。局部线性注意力(Local Linear Attention,LLA)是一种源自测试时回归框架中非参数统计的注意力机制。与先前关于高效注意力变体的研究不同,LLA 将 softmax 注意力中的局部常数估计升级为局部线性估计,在关联记忆方面实现了可证明更优的偏差-方差权衡。然而,由于计算和数值稳定性问题,LLA 尚未在 LLM 预训练中进行规模化应用。我们提出 Parallax,一种可扩展至 LLM 的参数化局部线性注意力。Parallax 消除了 LLA 中的数值求解器,并学习一个额外的类查询投影器来探测 KV 协方差。我们将 Parallax 置于一个由带宽、探测器构造和仿射结构连接的注意力机制家族之中。我们提出一种硬件感知算法,相比 FlashAttention 提高了算术强度,使注意力进入更偏向计算密集的范式。我们的原型解码核在不同批次大小和上下文长度下,性能可媲美或超越 FlashAttention 2/3。我们在 0.6B 和 1.7B 规模上预训练 Parallax,发现整个预训练过程中困惑度持续改善,并且这种提升可迁移至下游基准测试。在参数匹配和计算匹配两种控制条件下,该优势均持续存在,展现了帕累托改进。我们进行了细致的预训练消融实验,并发现一个新现象:Muon 优化器释放了 Parallax 的能力。据我们所知,这是架构研究文献中首次针对注意力机制展示架构-优化器强协同设计的实证结果。
查看 arXiv 页面 (https://arxiv.org/abs/2605.29157)
查看 PDF (https://arxiv.org/pdf/2605.29157)
GitHub (https://github.com/Yifei-Zuo/Parallax)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.29157)
在你的代理中获取这篇论文:
hf papers read 2605.29157
没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接到此论文
在模型的 README.md 中引用 arxiv.org/abs/2605.29157 即可从此页面链接该模型。
引用此论文的数据集0
没有数据集链接到此论文
在数据集的 README.md 中引用 arxiv.org/abs/2605.29157 即可从此页面链接该数据集。
引用此论文的 Space0
没有 Space 链接到此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2605.29157 即可从此页面链接该 Space。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到一个收藏 (https://huggingface.co/new-collection) 即可从此页面链接它。
相似文章
@maximelabonne: Parallax 是一种参数化的局部线性注意力形式,它摒弃了数值求解器,在解码性能上媲美 FA 2/3……
Parallax 是一种新的参数化局部线性注意力形式,去除了数值求解器,在解码方面与 FlashAttention 2/3 相匹配。其有效性取决于优化器,与 Muon 配合有效,但与 AdamW 配合无效,这凸显了优化器几何形状的作用。
Lighthouse Attention(11分钟阅读)
Lighthouse Attention是一种基于选择的分层注意力机制,通过在前向+反向传播中实现约17倍的速度提升(在512K上下文下),并在98K上下文中实现1.4–1.7倍的端到端加速,从而加速长上下文预训练。该机制使用Llama-3 530M模型在50B token上进行了验证。
从参数到数据:一种任务参数引导的高效LLM对齐微调流水线
P2D是一个统一框架,利用任务敏感的注意力头进行数据选择和结构剪枝,通过仅更新10%的头部和10%的数据,实现了8.3个百分点的性能提升和7.0倍的加速。
通过注意力头重加权实现大语言模型的数据高效适配
介绍了一种数据高效方法——注意力头重加权(AHR),通过为每个注意力头学习单个标量来适配大语言模型至文本分类任务,大幅减少可训练参数,同时在有限数据场景下优于LoRA。
Dynamic Linear Attention
DLA引入了自适应状态合并和容量受限的内存建模,用于多状态线性注意力,提升了长上下文LLM的性能。