@gordic_aleksa: 新深度博文时刻:Inside the Transformer: The Life of a Token 对现代密集Transformer的深入探讨,我…
摘要
一篇深入探讨现代密集Transformer内部工作原理的博文,涵盖YaRN(位置信息)、混合注意力(实现160k上下文长度)、soft capping、QK归一化,以及Transformer数学(包括FLOPs/Token公式和集群规模估算)。
查看缓存全文
缓存时间: 2026/05/26 19:13
新深度博文:揭秘Transformer:一个Token的生命
深度剖析现代密集Transformer,涵盖YaRN(为什么成对坐标旋转能引入位置信息?)、混合注意力机制(实现160k上下文长度)、软上限、QK归一化等,跟随Token在Transformer中的流动。
额外Transformer数学:FLOPs/Token公式(以及6N公式何时失效)、集群规模估算(给定模型/数据大小和期望的实验吞吐量,你需要多大集群)等等。
相似文章
@TheTuringPost: 一个理解或复习Transformer架构的绝佳资源。它解释了Transformer如何逐个token处理文本…
推荐一个解释Transformer架构的教育资源,涵盖token嵌入、自注意力、残差连接,以及与GPT和BERT的联系。
@nicodotdev:关于 Transformers.js 你一直想了解的一切,都在一个视频中。我深入探讨了 AI 模型如何从…运行
一个深入探讨的视频,解释如何使用 Transformers.js 从 JavaScript 运行 AI 模型,涵盖张量、ONNX、量化、WebGPU/WASM 等。
@techwith_ram:Brandon Sandhu 对 Transformer 架构的推导 本文旨在从直觉和数学角度理解……
这篇由 Brandon Sandhu 撰写的论文提供了数学上严谨而又易于理解的 Transformer 架构推导,涵盖了分词、嵌入、注意力机制及其他核心组件,前提知识为线性代数、微积分、概率论和信息论。
@AndrewYNg: 新课程:Transformers in Practice。你将获得对基于Transformer的LLM工作方式的实践理解,从而能够推理…
deeplearning.ai与AMD合作推出的新课程《Transformers in Practice》,教授对基于Transformer的LLM的实践理解,涵盖文本生成、注意力机制以及量化(quantization)和KV缓存等推理优化技术。
@s_scardapane:《Transformer Cookbook》,作者@pentagonalize、@davidweichiang 等人。对在Transformer权重中“硬编码”算法的优美介绍……
一条推文介绍了《Transformer Cookbook》这篇论文,该论文遵循RASP论文,对在transformer权重中硬编码算法(加法、查找、分支)提供了优美的介绍。