@SemiAnalysis_: Transformer 的注意力机制已经取得了长足进步。我们感谢开源社区的研究人员和工程师们……
摘要
SemiAnalysis 的一条推文庆祝 Transformer 的注意力机制取得的进步,并感谢开源社区让 AI 变得易于使用,邀请大家贡献以完善注意力的开放历史。
查看缓存全文
缓存时间: 2026/06/29 02:22
Transformer的Attention机制已经走过了很长一段路。我们要感谢开源社区的研究人员和工程师们,他们持续让高性能AI变得触手可及。请与我们一起庆祝,分享这篇文章,@更多贡献者,并分享趣闻轶事,共同完成Attention开放历史!(1/8)
与2017年《变形金刚》电影系列逐渐衰落形成对比的是,NLP中的Transformer架构展现出了巨大潜力。它引入了多头注意力(MHA),并显著提升了困惑度得分。我们感谢@ashVaswani、@NoamShazeer、@YesThisIsLion和@aidangomez发表了这篇开创性工作。(2/8)
MHA的早期变体包括:由Noam Shazeer发明的多查询注意力(MQA)、由@MetaAI LLaMA团队发明的分组查询注意力(GQA),以及由@MistralAI推广的滑动窗口注意力(SWA)。MQA、GQA和SWA建立在MHA之上,显著提升了推理性能,其中GQA成为许多近期稀疏注意力变体的基础,尤其是在智能体AI时代。我们感谢这些团队公开分享这些技术。(3/8)
MHA之后最重大的飞跃之一是@tri_dao的FlashAttention。FlashAttention大幅降低了前向和后向传播的内存需求,解锁了显著的性能提升,并实现了高效的长上下文训练。自最初发布以来,已经推出了三个新版本,每个版本都针对当时最新的GPU进行了优化。我们感谢Tri Dao、@tensorcore、Jay Shah、@tedzadouri以及开源社区中许多其他推动系统效率前沿的人。(4/8)
注意力机制的创新并未停止,尽管MHA/GQA/SWA仍然难以被超越。2024年,DeepSeek-V3/R1展示了接近前沿的能力,证明了其内部的多头潜在注意力(MLA)的有效性。在OpenAI的o1看似遥遥领先的时候,DeepSeek-R1重新点燃了开源社区能够缩小差距的希望。MLA自此成为许多开源权重模型的事实标准注意力机制。我们感谢@deepseek_ai的杰出工作和对开放精神的承诺。(5/8)
智能体AI对长上下文的需求加速了旨在克服上下文墙的注意力研究。过去一年,线性注意力成为主流,最值得注意的是@songlinyang4的门控Delta网络(GDN)在开源权重模型中获得了强劲的采用率。GDN发明后,@Alibaba_Qwen在Qwen 3.5中采用了它,而@kimi_moonshot通过Kimi Delta Attention对其进行了改进。在稀疏注意力方面,@deepseek_ai再次引领开放研究,提出了原生稀疏注意力和DeepSeek稀疏注意力(DSA)。受DSA启发,@MiniMax_AI开发了MiniMax稀疏注意力,@ZhipuAI则通过GLM-5.2中的IndexShare进一步推进了它。最后,SWA-GQA混合注意力方法由@cohere推广,最近由@xiaomimimo团队改进,该团队发布了详细的消融研究。我们感谢所有开源模型训练实验室分享他们的知识、研究和优秀的开源权重模型。(6/8)
随着ChatGPT的爆火,LLM服务的研究变得非常活跃。高效的LLM服务一直是一个重大挑战,直到管理KV缓存的注意力方法(如Radix Attention)的发明。Radix Attention的作者围绕它构建了一个推理引擎,后来成为@sgl_project;该团队后来创立了Radix Ark。感谢@ying11231、@zhyncs42和@banghuaz构建了如此快速且强大的推理引擎。(7/8)
大约在同一时间,vLLM推理引擎及其背后的PagedAttention在开源社区引起了轰动。由@woosuk_k启动的@vllm_project已成为最广泛使用的推理引擎之一。来自Inferact的@simon_mo_、@kaichaoyou和@rogerw0108,以及来自Red Hat的@robertshaw21和@mgoin_一直是该项目的关键维护者,持续推动项目和社区前进。我们深深感谢Inferact和Red Hat团队。(8/8)
相似文章
@currying: 非常棒的13页讲解!
一条推文重点介绍了《理解Transformer与注意力机制》,这是一篇13页的论文,从应用数学的角度解释了Transformer架构和注意力机制。
@antoniolupetti: 《理解Transformer与注意力机制》是一篇非常有趣的论文,它从应用数学的角度介绍了Transformer架构…
一条推文重点介绍了一篇由Michel Fabrice Serret撰写的arXiv论文,该论文从应用数学的角度介绍了Transformer和注意力机制,涵盖了向量化、多头注意力以及降低注意力成本的方法,如KV缓存和Latent Attention。
@anirudhbv_ce: 推断系列第1天:Transformer架构(Attention is All You Need)Transformer通过完全并行化序列处理杀死了RNN,使得序列…
本文是30天推断系列的一部分,解释了Transformer架构及其核心组件如自注意力和多头注意力,以及它在现代人工智能中的重要性。
@antoniolupetti:丹尼尔·朱拉夫斯基和詹姆斯·H·马丁所著的《Transformers》是我读过的最清晰、数学基础最扎实的介绍之一……
一条推文重点介绍了朱拉夫斯基和马丁教科书中的Transformer架构章节,赞扬其对自注意力、多头注意力及相关机制清晰且数学基础扎实的解释。
@shubh6200: 周末花了些时间阅读这篇文章,老实说真希望它早几年就存在。我们看的每个AI教程都…
一条推文推荐了一篇arXiv论文,该论文为应用数学家讲解了Transformer的数学基础,涵盖分词、嵌入、多头注意力和KV缓存。