多头注意力残差

Hugging Face Daily Papers 论文

摘要

介绍了多头注意力残差(MHAR),它将路由查询重塑为逐子空间头,使每个特征子空间通过自己的 softmax 读取深度历史。在基于 Nemotron 的语料库上从头训练,MHAR 在 100M 到 1B 规模上相比标准 Transformer 持续改善验证损失,并提升训练中期的下游准确率。

Transformer 通过单一加性残差流跨深度传播信息:每个子层只读取最近的状态。注意力残差通过让每个子层使用学习到的 softmax 进行注意力操作来放宽这一限制。然而,这种读取使用一个跨整个宽度共享的单一查询,因此每个特征子空间都必须通过同一个分布来读取深度历史。这种被迫妥协的代价随着子空间在读取哪些层上的分歧程度而增加,而分歧随模型宽度增大而增加。我们引入了多头注意力残差(MHAR):将路由查询重塑为 H 个逐子空间头,每个头在深度历史上拥有自己的 softmax。读取变为块对角形式,这种重塑不增加参数且计算开销可忽略不计,H = 1 时精确恢复为注意力残差。在基于 Nemotron 的退火语料库上进行从头训练,该语料库经过去重、质量过滤,并以 STEM 和代码内容为主。与标准 Transformer 相比,MHAR 在 100M、350M 和 1B 上的验证损失分别降低了 0.061、0.149 和 0.140。在每种设置下,它都在四种方法中取得了最佳结果,且增益从 100M 到更大规模不断增大。头数量是一个真正的设计轴,而不是一个自由旋钮:验证损失关于 H 呈 U 形,在不同规模下 H = 4 或 H = 8 处有一个平坦的最优点。我们在大规模模型上采用 H = 8;超过这一点过度分裂(H = 16)会持续回吐部分增益。对训练后查询的直接探针实验证实,学习到的子空间分歧是根本驱动因素。融合的 Triton 路由内核将注意力残差训练吞吐量从基线的 0.2-0.5 倍提高到 0.55-0.88 倍,同时保持接近基线的峰值内存。使用 delta 注意力残差的保持恒等性转换支持 8B 规模的中期训练,在 GSM8K 上带来 +3.2、在 GPQA 上带来 +3.1 的提升。
查看原文
查看缓存全文

缓存时间: 2026/07/31 05:52

论文页面 - 多头注意力残差

来源:https://huggingface.co/papers/2607.27230

摘要

Transformer 通过单条加性残差流在深度方向上传播信息:每个子层只读取最近的状态。注意力残差通过让每个子层借助学习到的 softmax 进行注意力操作来放宽这一限制。然而,这种读取使用了一个在整个宽度上共享的单一查询,因此每个特征子空间都必须通过同一个分布来读取深度历史。这种被迫妥协的代价会随着子空间在应读取哪些层上的分歧增大而增长,而分歧会随模型宽度增大而加剧。我们引入了多头注意力残差(Multi-Head Attention Residuals,MHAR):将路由查询重塑为 H 个按子空间划分的头,每个头在深度历史上拥有自己的 softmax。读取变为块对角结构,重塑不增加参数且计算开销可忽略,而 H=1 时则精确恢复注意力残差。在基于去重后的 Nemotron 退火语料库(经过质量过滤,并以 STEM 和代码为主)上从头训练,MHAR 在 100M、350M 和 1B 规模下均优于标准 Transformer 的验证损失(分别提升 -0.061、-0.149 和 -0.140)。在四种方法中,它在所有设置下都取得最佳结果,且收益从 100M 到更大规模持续增加。头数是一个真正的设计轴,而非免费旋钮:验证损失关于 H 呈 U 形曲线,在不同规模下 H=4 或 H=8 处有平坦最优区域。我们在大规模模型中采用 H=8;过度拆分(H=16)会持续回吐部分收益。对训练后查询的直接探测证实,学习到的子空间分歧是根本驱动力。融合的 Triton 路由内核将注意力残差训练吞吐量从基线的 0.2-0.5 倍提升到 0.55-0.88 倍,同时保持接近基线的峰值内存。使用 delta 注意力残差的保恒等转换支持 8B 中途训练,在 GSM8K 上带来 +3.2 的提升,在 GPQA 上带来 +3.1 的提升。

查看 arXiv 页面 (https://arxiv.org/abs/2607.27230) 查看 PDF (https://arxiv.org/pdf/2607.27230) GitHub (https://github.com/wdlctc/multi-head-attention-residuals) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.27230)

在你的 agent 中获取这篇论文:

hf papers read 2607\.27230

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.27230 即可从此页面链接该论文。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.27230 即可从此页面链接该论文。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.27230 即可从此页面链接该论文。

包含此论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接该论文。

相似文章

多头循环记忆代理

arXiv cs.LG

本文指出记忆保留是长上下文场景下循环记忆代理的瓶颈,并提出多头循环记忆(MHM),这是一种无需训练的框架,通过“先选择后更新”策略将记忆划分为独立的头。轻量级实例化版本 MHM-LRU 显著提升了 100K 至 1M token 范围内的记忆保留率和端到端准确率,在 896K token 的 RULER-HQA 上,将记忆保留率从低于 30% 提升至 73.96%。

Delta Attention Residuals

Hugging Face Daily Papers

Delta Attention Residuals 通过关注特征变化(增量)而非累积隐藏状态,改进了Transformer模型中的逐层路由,在220M到7.6B参数的规模上实现了1.7-8.2%的验证困惑度提升。

Hierarchical Global Attention (HGA)

arXiv cs.LG

Hierarchical Global Attention (HGA) 是一种可直接替换预训练长上下文Transformer中密集因果注意力的方法。它采用分层两级路由机制,使得能够对一个小规模路由工作集进行精确注意力计算,从而允许像 Qwen3-30B 这样的模型在单个 RTX 5090 上以64K上下文运行,且质量损失极小。