@daylenyang: this berkeley 189 lecture is probably the clearest explainer of the attention mechanism i've come across. provides a ve…

X AI KOLs Timeline 新闻

摘要

Berkeley 189 lecture provides a clear explanation of the attention mechanism, tracing the evolution from RNN+attention to Transformer and contrasting MLP/CNN parameter efficiency.

this berkeley 189 lecture is probably the clearest explainer of the attention mechanism i've come across. provides a very good intuitive understanding. if you already know about CNNs then scroll to about halfway in: https://t.co/oVUGqSV15O
查看原文
查看缓存全文

缓存时间: 2026/07/20 23:35

this berkeley 189 lecture is probably the clearest explainer of the attention mechanism i’ve come across. provides a very good intuitive understanding. if you already know about CNNs then scroll to about halfway in: https://t.co/oVUGqSV15O


TL;DR

伯克利189课程用清晰的思路解释了注意力机制:从RNN+注意力的历史,到Transformer彻底抛弃RNN、仅靠注意力实现强大表示学习,并对比了MLP与CNN的参数效率和可扩展性。


为什么注意力机制如此重要

今天几乎每一个现代模型——包括大型语言模型、扩散模型、图像/视频生成模型——底层都使用Transformer架构。而Transformer的核心就是注意力机制。2017年的论文《Attention is All You Need》定义了这幅著名的架构图,它很可能是过去十年人工智能领域最引人注目的论文之一,作者来自多伦多大学和谷歌大脑。

但“Attention is All You Need”意味着还有别的东西是你不需要的。那别的东西是什么?答案是循环神经网络(RNN)。注意力机制早在2014年就被发明了,但它总是与RNN搭配使用。这篇论文的核心结论是:你不需要RNN,只需要注意力部分。这就诞生了今天无处不在的Transformer架构。

一条清晰的历史演变路径

课程从你已经学过的CNN出发,然后回顾了注意力是如何被引入的,最后展示了Transformer如何把RNN彻底剔除。基本思路是:

  • 你学过CNN(卷积神经网络)。
  • 然后有了残差连接等创新。
  • 注意力被发现,并最初与RNN结合。
  • Transformer说:注意力就是一切。

现在,几乎所有大规模网络都基于Transformer架构,尽管它最初是为自然语言设计的,但已被广泛用于计算机视觉、多模态任务、扩散模型、视频生成等。人们普遍认为Transformer是目前最强的通用架构。

所有架构的共同思想:表示学习

无论是CNN、RNN还是Transformer,核心都是特征变换(表示学习)。初始输入(单词或像素)被转换成向量(嵌入),神经网络逐层构建新的表示。目标是让深层表示比浅层表示更“上下文相关”——即包含来自远处词或像素的信息。

最后几层应该代表与预测任务相关的抽象概念。例如,区分猫和狗时:

  • 初始像素层:小毛发、小形状。
  • 中间层:猫的胡须、耳朵等特征。
  • 最后层:毛的类型、眼睛形状等抽象概念。

这些中间表示始终是向量(嵌入)。

第一个网络:多层感知机(MLP)

MLP是全连接网络,由线性层(矩阵乘法)和ReLU非线性组成:

h1 = ReLU(W1 * x)
h2 = ReLU(W2 * h1)
...

假设嵌入维度为 D,层数为 L,每层是 D×D 的矩阵加上偏置(可忽略)。所以参数数量约为 D² × L。当 D=16000 时,D² 就是 2.56 亿,这非常巨大。MLP是表达能力最强的架构(任何其他架构都能被巨大的MLP模拟),但参数太多,而且不能改变输入大小——如果输入从D变为D+5,你必须从头学习新权重。

卷积如何解决MLP的缺点

CNN用固定的感受野(例如3×3卷积核)在输入上滑动,使用相同权重。对于单通道3×3核,只有9个参数,在整个图像上复用。对比MLP,处理1000×1000像素的图像时每层需要P²个权重(P=10⁶,即一万亿),而CNN的参数数量是固定的9,与图像大小无关。

CNN还可以通过零填充处理边界像素,并且当输入图像尺寸变化时(例如从3×3变成3×4),只需用相同核继续滑动,无需重新训练。

小结

课程从MLP的参数爆炸问题出发,引出卷积的效率,然后为后续讲解注意力机制和Transformer打下基础。注意力机制将彻底改变信息交互的方式——不再局限于局部感受野,而是让每个位置都能直接关注所有其他位置。


Source
YouTube: @daylenyang - this berkeley 189 lecture is probably the clearest explainer of the attention mechanism…

相似文章