@gordic_aleksa: 新深度博文时刻:Inside the Transformer: The Life of a Token 对现代密集Transformer的深入探讨,我…
摘要
一篇深入探讨现代密集Transformer内部工作原理的博文,涵盖YaRN(位置信息)、混合注意力(实现160k上下文长度)、soft capping、QK归一化,以及Transformer数学(包括FLOPs/Token公式和集群规模估算)。
查看缓存全文
缓存时间: 2026/05/26 19:13
新深度博文:揭秘Transformer:一个Token的生命
深度剖析现代密集Transformer,涵盖YaRN(为什么成对坐标旋转能引入位置信息?)、混合注意力机制(实现160k上下文长度)、软上限、QK归一化等,跟随Token在Transformer中的流动。
额外Transformer数学:FLOPs/Token公式(以及6N公式何时失效)、集群规模估算(给定模型/数据大小和期望的实验吞吐量,你需要多大集群)等等。
相似文章
@TheTuringPost: 一个理解或复习Transformer架构的绝佳资源。它解释了Transformer如何逐个token处理文本…
推荐一个解释Transformer架构的教育资源,涵盖token嵌入、自注意力、残差连接,以及与GPT和BERT的联系。
@currying: 非常棒的13页讲解!
一条推文重点介绍了《理解Transformer与注意力机制》,这是一篇13页的论文,从应用数学的角度解释了Transformer架构和注意力机制。
@shubh6200: 周末花了些时间阅读这篇文章,老实说真希望它早几年就存在。我们看的每个AI教程都…
一条推文推荐了一篇arXiv论文,该论文为应用数学家讲解了Transformer的数学基础,涵盖分词、嵌入、多头注意力和KV缓存。
@nicodotdev:关于 Transformers.js 你一直想了解的一切,都在一个视频中。我深入探讨了 AI 模型如何从…运行
一个深入探讨的视频,解释如何使用 Transformers.js 从 JavaScript 运行 AI 模型,涵盖张量、ONNX、量化、WebGPU/WASM 等。
@techwith_ram:Brandon Sandhu 对 Transformer 架构的推导 本文旨在从直觉和数学角度理解……
这篇由 Brandon Sandhu 撰写的论文提供了数学上严谨而又易于理解的 Transformer 架构推导,涵盖了分词、嵌入、注意力机制及其他核心组件,前提知识为线性代数、微积分、概率论和信息论。