多头注意力残差
摘要
介绍了多头注意力残差(MHAR),它将路由查询重塑为逐子空间头,使每个特征子空间通过自己的 softmax 读取深度历史。在基于 Nemotron 的语料库上从头训练,MHAR 在 100M 到 1B 规模上相比标准 Transformer 持续改善验证损失,并提升训练中期的下游准确率。
查看缓存全文
缓存时间: 2026/07/31 05:52
论文页面 - 多头注意力残差
来源:https://huggingface.co/papers/2607.27230
摘要
Transformer 通过单条加性残差流在深度方向上传播信息:每个子层只读取最近的状态。注意力残差通过让每个子层借助学习到的 softmax 进行注意力操作来放宽这一限制。然而,这种读取使用了一个在整个宽度上共享的单一查询,因此每个特征子空间都必须通过同一个分布来读取深度历史。这种被迫妥协的代价会随着子空间在应读取哪些层上的分歧增大而增长,而分歧会随模型宽度增大而加剧。我们引入了多头注意力残差(Multi-Head Attention Residuals,MHAR):将路由查询重塑为 H 个按子空间划分的头,每个头在深度历史上拥有自己的 softmax。读取变为块对角结构,重塑不增加参数且计算开销可忽略,而 H=1 时则精确恢复注意力残差。在基于去重后的 Nemotron 退火语料库(经过质量过滤,并以 STEM 和代码为主)上从头训练,MHAR 在 100M、350M 和 1B 规模下均优于标准 Transformer 的验证损失(分别提升 -0.061、-0.149 和 -0.140)。在四种方法中,它在所有设置下都取得最佳结果,且收益从 100M 到更大规模持续增加。头数是一个真正的设计轴,而非免费旋钮:验证损失关于 H 呈 U 形曲线,在不同规模下 H=4 或 H=8 处有平坦最优区域。我们在大规模模型中采用 H=8;过度拆分(H=16)会持续回吐部分收益。对训练后查询的直接探测证实,学习到的子空间分歧是根本驱动力。融合的 Triton 路由内核将注意力残差训练吞吐量从基线的 0.2-0.5 倍提升到 0.55-0.88 倍,同时保持接近基线的峰值内存。使用 delta 注意力残差的保恒等转换支持 8B 中途训练,在 GSM8K 上带来 +3.2 的提升,在 GPQA 上带来 +3.1 的提升。
查看 arXiv 页面 (https://arxiv.org/abs/2607.27230) 查看 PDF (https://arxiv.org/pdf/2607.27230) GitHub (https://github.com/wdlctc/multi-head-attention-residuals) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.27230)
在你的 agent 中获取这篇论文:
hf papers read 2607\.27230
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.27230 即可从此页面链接该论文。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.27230 即可从此页面链接该论文。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.27230 即可从此页面链接该论文。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接该论文。
相似文章
多头循环记忆代理
本文指出记忆保留是长上下文场景下循环记忆代理的瓶颈,并提出多头循环记忆(MHM),这是一种无需训练的框架,通过“先选择后更新”策略将记忆划分为独立的头。轻量级实例化版本 MHM-LRU 显著提升了 100K 至 1M token 范围内的记忆保留率和端到端准确率,在 896K token 的 RULER-HQA 上,将记忆保留率从低于 30% 提升至 73.96%。
Delta Attention Residuals
Delta Attention Residuals 通过关注特征变化(增量)而非累积隐藏状态,改进了Transformer模型中的逐层路由,在220M到7.6B参数的规模上实现了1.7-8.2%的验证困惑度提升。
WAV:面向深度仅解码器Transformer的多分辨率块残差路由
本文提出多分辨率残差路由方法WAV v1,这是块注意力残差机制的扩展,通过引入方向性细节基来增强块表示,从而改进深度仅解码器Transformer的训练效果。
穿越瓶颈:多头潜在注意力如何在语言模型中分离内容与位置
本文首次对多头潜在注意力(MLA)进行机械可解释性研究,分析其低秩瓶颈如何分离内容与位置信息,并重塑Transformer电路。
Hierarchical Global Attention (HGA)
Hierarchical Global Attention (HGA) 是一种可直接替换预训练长上下文Transformer中密集因果注意力的方法。它采用分层两级路由机制,使得能够对一个小规模路由工作集进行精确注意力计算,从而允许像 Qwen3-30B 这样的模型在单个 RTX 5090 上以64K上下文运行,且质量损失极小。