@antiAIvo:学习 Transformer 时,最难处理的是多维矩阵操作,人类大脑只能在三维中建模……

X AI KOLs Timeline 工具

摘要

本文介绍了一个针对 Transformer 中注意力机制的可视化工具,允许用户自定义输入矩阵,并查看注意力分数的逐步计算过程。这是一个初始版本,计划根据用户反馈进行未来更新。

学习 Transformer 时 最难处理的部分是多维矩阵操作 人类大脑只能在三维中建模;超出三维的部分变得抽象 为了消耗 Codex 的 tokens 我凭感觉开发了一个 Transformer 操作的可视化工具 在此体验:https://nano-ai.tech/attention/ 该工具分解并可视化注意力机制的每一步: 具体过程: 1. 自定义输入矩阵 Q / K / V 2. 实时计算 S = QKᵀ / √d 3. 显示因果掩码、稳定 softmax、加权求和 4. 点击查询行查看该行如何对 V 进行加权 当然,这只是一个初始版本 我会根据时间和心情决定后续更新和优化 🫡
查看原文
查看缓存全文

缓存时间: 2026/09/19 23:08

学习Transformer时

最难处理的是多维矩阵运算
人脑只能建模三维;超出这个维度就变得抽象

为了消耗Codex的Token额度
我随性制作了一个Transformer运算可视化工具
立即体验:https://nano-ai.tech/attention/

此工具将注意力机制的每个步骤进行拆解可视化:
具体流程:

  1. 自定义输入矩阵 Q / K / V
  2. 实时计算 S = QKT / √d
  3. 展示因果掩码、稳定化softmax、加权求和
  4. 点击查询行即可查看该行如何对V加权

当然这只是初版
后续会根据时间和心情决定更新与优化 🫡


大模型实验室 · Future Priced

来源:https://nano-ai.tech/attention/ ← 首页 (https://nano-ai.tech/) 文章 (https://nano-ai.tech/articles/) 大模型实验室 (https://nano-ai.tech/attention/)## 大模型实验室

Attention (https://nano-ai.tech/attention/) LayerNorm (https://nano-ai.tech/lab/layernorm/) ReLU / GELU (https://nano-ai.tech/lab/activation/) 单头; 3个token; dk=2。演示矩阵仅用于展示计算过程,不代表实际训练模型或语义含义。

初始示例

Q =

[100111] K =

[100111] V =

[100231]

1. 可编辑输入矩阵 Q / K / V

Q [3×2]

K [3×2]

V [3×2]

启用因果掩码

S = QKT / √2 掩码在softmax前应用:稳定化softmax:先减去行最大值 O = AV

2. 分步解析

3. 得分矩阵 S [3×3]

注意力权重 A = 逐行softmax(S)(热力图)

点击左侧查询行或权重行,可查看该行对V的加权方式。

4. 输出矩阵 O = A V [3×2]

当前选中的查询行

相似文章

Transformer模型图解

Hacker News Top

一个交互工具,视觉化解释Transformer模型的架构,使用GPT-2来说明关键组件,如嵌入、注意力机制和输出预测。