使用灯塔注意力的长上下文预训练
摘要
灯塔注意力是一种仅用于训练的、基于层次选择的注意力算法,它降低了因果Transformer长序列训练的计算复杂度,通过恢复阶段后的竞争性最终损失实现更快的预训练。
查看缓存全文
缓存时间: 2026/05/15 16:26
论文页面 - 长上下文预训练:Lighthouse Attention
来源:https://huggingface.co/papers/2605.06554
摘要
Lighthouse Attention 通过使用基于层次选择的注意力机制,在长序列上高效训练因果 Transformer,在降低计算复杂度的同时保持模型性能。
在极端序列长度下训练因果 Transformer 的瓶颈在于缩放点积注意力(SDPA)的二次时间和内存消耗。本文提出 Lighthouse Attention,一种仅训练阶段的对称层次注意力算法,它包裹在普通 SDPA 之上,并在训练末期可轻松移除。我们的层次选择也是无需梯度的,从而避免了处理复杂且可能低效的反向传播核。我们的贡献有三点:(i) 一个次二次的层次前后处理步骤,对序列进行自适应压缩与解压缩。(ii) 一种对称压缩策略,同时池化查询、键和值,同时保持从左到右的因果性,大幅提升了并行度。(iii) 一种两阶段训练方法:大部分时间使用 Lighthouse Attention 进行预训练,最后通过短时间训练恢复为完整注意力模型。我们进行了初步的小规模 LLM 预训练实验,在保持其他设置完全相同的情况下,与完整注意力训练相比,我们的方法实现了更快的总训练时间,并在恢复阶段后取得了更低的最终损失。完整代码见:https://github.com/ighoshsubho/lighthouse-attention
查看arXiv页面 查看PDF 项目页面 GitHub1 添加到收藏
在你的 agent 中获取这篇论文:
hf papers read 2605.06554
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2605.06554 即可在此页面建立链接。
引用此论文的数据集 0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2605.06554 即可在此页面建立链接。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2605.06554 即可在此页面建立链接。
包含此论文的收藏集 0
没有收藏集包含此论文
将这篇论文添加到一个收藏集中以便在此页面建立链接。
相似文章
Lighthouse Attention(11分钟阅读)
Lighthouse Attention是一种基于选择的分层注意力机制,通过在前向+反向传播中实现约17倍的速度提升(在512K上下文下),并在98K上下文中实现1.4–1.7倍的端到端加速,从而加速长上下文预训练。该机制使用Llama-3 530M模型在50B token上进行了验证。
@NousResearch: 今天我们发布Lighthouse Attention,一种基于选择的分层注意力机制,用于长上下文预训练,实现…
NousResearch发布Lighthouse Attention,一种基于选择的分层注意力机制,在98K上下文下实现1.4-1.7倍实际时间加速,在单个B200上的512K上下文下,其前向/后向传播比标准注意力快约17倍,并在530M参数的Llama-3模型上跨50B tokens进行了验证。
@omarsar0: Nous Research 提出的一个很酷的想法。如果你可以使用一个次二次方复杂度的包装器来加速长上下文预训练,并在部署前移除它,会怎样?
Nous Research 推出了 Lighthouse Attention,这是一种仅用于训练的次二次方包装器,旨在加速扩展点积注意力(SDPA)的长上下文预训练。该包装器可在部署前移除,从而保持原生推理效率。
分层稀疏注意力机制的正确实现:迈向无限上下文建模
提出HiLS注意力机制,一种基于块的稀疏注意力方法,通过语言模型损失端到端学习块选择,性能可与全注意力媲美,同时支持超长上下文外推和更快的推理速度。
面向高效长上下文生成的Context Memorization
提出了attention-state memory,一种免训练方法,将预计算的注意力状态存储在轻量级记忆中,以提高长前缀推理的准确率并降低延迟,在基准测试中优于传统方法。