@SemiAnalysis_: Transformer 的注意力机制已经取得了长足进步。我们感谢开源社区的研究人员和工程师们……

X AI KOLs Timeline 新闻

摘要

SemiAnalysis 的一条推文庆祝 Transformer 的注意力机制取得的进步,并感谢开源社区让 AI 变得易于使用,邀请大家贡献以完善注意力的开放历史。

Transformer 的注意力机制已经取得了长足进步。我们感谢开源社区的研究人员和工程师们持续让高性能 AI 变得易于使用。请与我们一同庆祝,分享此帖、标记更多贡献者、分享轶事,以完善注意力的开放历史!(1/8)
查看原文
查看缓存全文

缓存时间: 2026/06/29 02:22

Transformer的Attention机制已经走过了很长一段路。我们要感谢开源社区的研究人员和工程师们,他们持续让高性能AI变得触手可及。请与我们一起庆祝,分享这篇文章,@更多贡献者,并分享趣闻轶事,共同完成Attention开放历史!(1/8)

与2017年《变形金刚》电影系列逐渐衰落形成对比的是,NLP中的Transformer架构展现出了巨大潜力。它引入了多头注意力(MHA),并显著提升了困惑度得分。我们感谢@ashVaswani、@NoamShazeer、@YesThisIsLion和@aidangomez发表了这篇开创性工作。(2/8)

MHA的早期变体包括:由Noam Shazeer发明的多查询注意力(MQA)、由@MetaAI LLaMA团队发明的分组查询注意力(GQA),以及由@MistralAI推广的滑动窗口注意力(SWA)。MQA、GQA和SWA建立在MHA之上,显著提升了推理性能,其中GQA成为许多近期稀疏注意力变体的基础,尤其是在智能体AI时代。我们感谢这些团队公开分享这些技术。(3/8)

MHA之后最重大的飞跃之一是@tri_dao的FlashAttention。FlashAttention大幅降低了前向和后向传播的内存需求,解锁了显著的性能提升,并实现了高效的长上下文训练。自最初发布以来,已经推出了三个新版本,每个版本都针对当时最新的GPU进行了优化。我们感谢Tri Dao、@tensorcore、Jay Shah、@tedzadouri以及开源社区中许多其他推动系统效率前沿的人。(4/8)

注意力机制的创新并未停止,尽管MHA/GQA/SWA仍然难以被超越。2024年,DeepSeek-V3/R1展示了接近前沿的能力,证明了其内部的多头潜在注意力(MLA)的有效性。在OpenAI的o1看似遥遥领先的时候,DeepSeek-R1重新点燃了开源社区能够缩小差距的希望。MLA自此成为许多开源权重模型的事实标准注意力机制。我们感谢@deepseek_ai的杰出工作和对开放精神的承诺。(5/8)

智能体AI对长上下文的需求加速了旨在克服上下文墙的注意力研究。过去一年,线性注意力成为主流,最值得注意的是@songlinyang4的门控Delta网络(GDN)在开源权重模型中获得了强劲的采用率。GDN发明后,@Alibaba_Qwen在Qwen 3.5中采用了它,而@kimi_moonshot通过Kimi Delta Attention对其进行了改进。在稀疏注意力方面,@deepseek_ai再次引领开放研究,提出了原生稀疏注意力和DeepSeek稀疏注意力(DSA)。受DSA启发,@MiniMax_AI开发了MiniMax稀疏注意力,@ZhipuAI则通过GLM-5.2中的IndexShare进一步推进了它。最后,SWA-GQA混合注意力方法由@cohere推广,最近由@xiaomimimo团队改进,该团队发布了详细的消融研究。我们感谢所有开源模型训练实验室分享他们的知识、研究和优秀的开源权重模型。(6/8)

随着ChatGPT的爆火,LLM服务的研究变得非常活跃。高效的LLM服务一直是一个重大挑战,直到管理KV缓存的注意力方法(如Radix Attention)的发明。Radix Attention的作者围绕它构建了一个推理引擎,后来成为@sgl_project;该团队后来创立了Radix Ark。感谢@ying11231、@zhyncs42和@banghuaz构建了如此快速且强大的推理引擎。(7/8)

大约在同一时间,vLLM推理引擎及其背后的PagedAttention在开源社区引起了轰动。由@woosuk_k启动的@vllm_project已成为最广泛使用的推理引擎之一。来自Inferact的@simon_mo_、@kaichaoyou和@rogerw0108,以及来自Red Hat的@robertshaw21和@mgoin_一直是该项目的关键维护者,持续推动项目和社区前进。我们深深感谢Inferact和Red Hat团队。(8/8)

相似文章

@currying: 非常棒的13页讲解!

X AI KOLs Timeline

一条推文重点介绍了《理解Transformer与注意力机制》,这是一篇13页的论文,从应用数学的角度解释了Transformer架构和注意力机制。