使用灯塔注意力的长上下文预训练

Hugging Face Daily Papers 论文

摘要

灯塔注意力是一种仅用于训练的、基于层次选择的注意力算法,它降低了因果Transformer长序列训练的计算复杂度,通过恢复阶段后的竞争性最终损失实现更快的预训练。

训练极长序列的因果Transformer受到缩放点积注意力(SDPA)二次时间复杂度和内存消耗的瓶颈限制。在这项工作中,我们提出了灯塔注意力,一种仅用于训练的、基于对称选择的层次注意力算法,它封装了普通的SDPA,并且可以在训练末期轻松移除。我们的层次选择也是无梯度的,这使我们无需处理复杂且可能低效的反向传播内核。我们的贡献有三个方面:(i)一个次二次的层次预处理和后处理步骤,对序列进行自适应压缩和解压缩。(ii)一种对称压缩策略,同时池化查询、键和值,同时保持从左到右的因果性,极大地提高了并行性。(iii)一种两阶段训练方法:我们在大部分训练时间中使用灯塔注意力进行预训练,然后在最后通过短时间训练恢复完整的注意力模型。我们进行了初步的小规模LLM预训练实验,与其他设置匹配的全注意力训练相比,我们的方法在恢复阶段后实现了更快的总训练时间和更低的最终损失。完整代码见:https://github.com/ighoshsubho/lighthouse-attention
查看原文
查看缓存全文

缓存时间: 2026/05/15 16:26

论文页面 - 长上下文预训练:Lighthouse Attention

来源:https://huggingface.co/papers/2605.06554

摘要

Lighthouse Attention 通过使用基于层次选择的注意力机制,在长序列上高效训练因果 Transformer,在降低计算复杂度的同时保持模型性能。

在极端序列长度下训练因果 Transformer 的瓶颈在于缩放点积注意力(SDPA)的二次时间和内存消耗。本文提出 Lighthouse Attention,一种仅训练阶段的对称层次注意力算法,它包裹在普通 SDPA 之上,并在训练末期可轻松移除。我们的层次选择也是无需梯度的,从而避免了处理复杂且可能低效的反向传播核。我们的贡献有三点:(i) 一个次二次的层次前后处理步骤,对序列进行自适应压缩与解压缩。(ii) 一种对称压缩策略,同时池化查询、键和值,同时保持从左到右的因果性,大幅提升了并行度。(iii) 一种两阶段训练方法:大部分时间使用 Lighthouse Attention 进行预训练,最后通过短时间训练恢复为完整注意力模型。我们进行了初步的小规模 LLM 预训练实验,在保持其他设置完全相同的情况下,与完整注意力训练相比,我们的方法实现了更快的总训练时间,并在恢复阶段后取得了更低的最终损失。完整代码见:https://github.com/ighoshsubho/lighthouse-attention

查看arXiv页面 查看PDF 项目页面 GitHub1 添加到收藏

在你的 agent 中获取这篇论文:

hf papers read 2605.06554

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2605.06554 即可在此页面建立链接。

引用此论文的数据集 0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2605.06554 即可在此页面建立链接。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2605.06554 即可在此页面建立链接。

包含此论文的收藏集 0

没有收藏集包含此论文

将这篇论文添加到一个收藏集中以便在此页面建立链接。

相似文章

Lighthouse Attention(11分钟阅读)

TLDR AI

Lighthouse Attention是一种基于选择的分层注意力机制,通过在前向+反向传播中实现约17倍的速度提升(在512K上下文下),并在98K上下文中实现1.4–1.7倍的端到端加速,从而加速长上下文预训练。该机制使用Llama-3 530M模型在50B token上进行了验证。

面向高效长上下文生成的Context Memorization

Hugging Face Daily Papers

提出了attention-state memory,一种免训练方法,将预计算的注意力状态存储在轻量级记忆中,以提高长前缀推理的准确率并降低延迟,在基准测试中优于传统方法。