@ProfTomYeh: 手动解析Transformer ~ 6步详解如下 学习Transformer架构就像打开汽车的引擎盖……

X AI KOLs Timeline 新闻

摘要

通过手动计算注意力加权和前馈网络,逐步讲解Transformer架构的核心组件,以说明Transformer的工作原理。

手动解析Transformer ~ 6步详解如下 学习Transformer架构就像打开你汽车的引擎盖。有这么多未知部分:嵌入、位置编码、注意力加权、自注意力、交叉注意力、多头注意力、层归一化、跳跃连接、softmax、线性层、Nx、右移、查询、键、值、掩码。 但其中哪些真正让汽车运行起来? 我认为在核心,有两个最关键的组件: 注意力加权和前馈网络。 其他一切都是为了使其运行更快、更持久的增强,这就是我们如何从汽车发展到卡车,以及在“大型”语言模型中“大型”一词的由来。 所以我完全手动绘制并计算了这两部分。 目标:将五个特征通过一个Transformer块推进,自己填写每个单元格。 1. 给定 五个位置的输入特征,来自前一个块。 2. 注意力矩阵 让我们将所有五个特征输入到一个查询-键模块(QK)中,并读回一个注意力权重矩阵A。该模块的细节另有专门文章说明。 3. 注意力加权 我们将输入特征乘以A,得到注意力加权特征Z。仍然是五个位置。其效果是*跨位置*横向组合特征:X1变为X1 + X2,X2变为X2 + X3,依此类推。 4. 第一层 让我们将所有五个加权特征输入到FFN的第一层。乘以权重和偏置。这次组合发生在*跨特征维度*上,垂直方向,每个特征从3个数字增长到4个。 注意,每个位置都经过相同的权重矩阵。这就是“逐位置”的含义。 5. ReLU 我们划掉负数。它们变为零。 6. 第二层 让我们将其降回来:从4维降到3维。输出馈送到下一个块,该块具有完全独立的参数集,整个过程再次运行。 你刚刚手动计算了一个Transformer块。 要点:这两个部分执行两个不同的工作,单独任何一个都不足以完成任务。注意力跨位置混合,因此一个特征可以看到其邻居。FFN跨特征维度混合,因此每个位置可以独立思考。先横向,然后纵向。然后这种模式重复N次,每个块都有自己的独立权重集。这就是上面列表中的Nx,也是让Transformer运行的关键。 保存此帖! #AIbyHand #Transformers #DeepLearning
查看原文
查看缓存全文

缓存时间: 2026/08/23 09:35

Transformer 架构手算指南 — 6步详解

研究 Transformer 架构就像打开汽车引擎盖。面对诸多未知部件:嵌入、位置编码、注意力加权、自注意力、交叉注意力、多头注意力、层归一化、跳跃连接、softmax、线性层、Nx、右移、查询、键、值、掩码…

但究竟是哪些部件让汽车真正运转起来?

我认为其核心本质包含两个最关键组件: 注意力加权与前馈网络。 其他所有设计都是为提升运行效率与持续性所做的优化,正如汽车如何演变为卡车,以及大型语言模型中“大”字的由来。

因此我完全通过手算推导了这两个核心组件: 目标: 将五个特征输入单个Transformer模块,逐单元手工计算

  1. 已知条件 五个位置的输入特征,来自上一个模块的输出。

  2. 注意力矩阵 将所有五个特征输入查询-键模块(QK),读取得到注意力权重矩阵A。该模块的详细机制另有专文说明。

  3. 注意力加权 将输入特征与A相乘,得到注意力加权特征Z。仍保持五个位置。其效果是实现跨位置的特征混合:水平方向上,X1 变为 X1 + X2,X2 变为 X2 + X3,依此类推。

  4. 第一层 将五个加权特征输入前馈网络第一层。进行权重和偏置的线性变换。此次特征混合发生在跨特征维度的垂直方向,每个特征从3个数值扩展为4个。 注意:所有位置共享相同的权重矩阵。这正是“位置无关”(position-wise)的含义。

  5. ReLU激活 将负值清零。

  6. 第二层 将维度从4个压缩回3个。输出将传送至下一个模块,该模块拥有完全独立的参数组,整个过程再次循环。

至此,你已完成一个Transformer模块的手工计算。

核心结论: 这两个组件承担着不同的职责,且缺一不可。注意力机制实现跨位置混合,使每个特征能感知其相邻特征;前馈网络实现跨特征维度混合,让每个位置能独立进行内部思考。先水平混合,后垂直混合,该模式重复N次,每个模块都拥有独立的权重参数组——这正是前文列表中的Nx所指,也是驱动Transformer运转的核心机制。

#AI手算 #Transformers #深度学习

相似文章

Transformer 数学探索器 [P]

Reddit r/MachineLearning

这个交互式工具通过数据流图可视化 Transformer 模型的数学基础,涵盖了从 GPT-2 到 Qwen 3.6 的架构以及各种注意力机制。