@Tabbu_ai: https://x.com/Tabbu_ai/status/2058145123444347339

X AI KOLs Timeline 新闻

摘要

一篇教育性推文串,解释了理解和从头构建LLM架构的11个关键课程,涵盖token、嵌入、注意力、位置编码、数据质量和常见误解。

https://t.co/9Ot16gtXO8
查看原文
查看缓存全文

缓存时间: 2026/05/23 18:15

如何从零构建LLM架构:大多数人跳过的11个有力经验

每个人都在谈论AI。

但真正理解大型语言模型(LLM)是如何构建的人少之又少。

大多数人每天都在使用像OpenAI ChatGPT、Anthropic Claude或Google Gemini这样的工具……

但这些系统背后却是基于数学、模式和超大规模工程构建的、一种惊人地优雅的架构。

好消息是什么?

你不再需要博士学位或研究实验室才能理解这些基础。

如果你想从零构建LLM架构——或者至少深入理解它们的工作原理——这11个经验将帮你节省数月的困惑。

1. 别再以为LLM是魔法

初学者最大的错误是假设LLM会“思考”。

它们并不会。

LLM本质上只是被训练用来回答一个问题的预测引擎:

“下一个最可能出现的Token是什么?”

仅此而已。

当你输入:

“法国的首都是……”

模型预测:

“巴黎”

并不是因为它像人类一样“知道”地理……

而是因为数十亿的训练样本教会了它词语之间的统计关系。

理解这一点会改变一切。

你不再追逐噱头,而是开始学习系统。

2. 在学Transformer之前先学Token

在学习Transformer、注意力机制或缩放法则之前……

先理解Token。

LLM并不像人类一样看待文字。

它们将文本转换成称为Token的小块。

示例:

文本可能的Token“ChatGPT is amazing”[“Chat”, “G”, “PT”, “is”, “amazing”]

不同的模型有不同的切分方式。

为什么这很重要:

  • Token化影响成本

  • 上下文长度

  • 性能

  • 速度

  • 内存使用

如果你跳过Token化,架构的其他部分会显得令人困惑。

3. Embedding是真正的基石

在Token化之后,Token会被转换成称为Embedding的向量。

Embedding是含义的数值表示。

含义相近的词语在向量空间中会更接近。

示例:

  • “King”和“Queen”在数学上产生关联

  • “Dog”和“Puppy”出现在相近的位置

  • “Apple”可以根据上下文改变含义

这就是模型开始理解语义关系的方式。

没有Embedding:

LLM只是随机的文本预测器。

有了Embedding:

它们开始捕捉语言结构。

4. 注意力机制永远改变了AI

Transformer架构引入了一个革命性的想法:

注意力。

具体来说:

“自注意力。”

这使得每个Token可以观察句子中的所有其他Token,并决定哪些信息最重要。

示例:

在句子:

“那只动物没有过马路,因为它累了。”

单词“它”需要上下文来理解。

注意力机制帮助模型理解“它”指的是“动物”。

单单这一机制就彻底改变了现代AI。

这就是基于Transformer的模型优于旧式RNN和LSTM架构的原因。

5. 位置编码解决了一个大问题

Transformer并行处理Token。

速度很快。

但对序列的理解却很糟糕。

没有位置编码:

句子:

“狗咬了人”

看起来可能与:

“人咬了狗”

完全相同。

位置编码将顺序信息注入Embedding中。

这帮助模型理解结构、语法和含义。

一个小细节。

影响巨大。

6. 更大的模型并不总是更聪明

大多数人认为:

参数越多 = 智能越高。

并不总是如此。

一个强大的LLM取决于:

  • 训练质量

  • 数据集的多样性

  • 架构设计

  • 对齐微调

  • 检索系统

  • 微调策略

一些较小的模型在特定任务上表现优于较大的模型,因为它们训练得更高效。

优化比蛮力更重要。

7. 数据质量比大多数人想象的更重要

垃圾进。

垃圾出。

训练数据的质量决定了模型有多大用处。

现代LLM流水线在以下方面投入巨大精力:

  • 清洗数据集

  • 去除重复

  • 过滤有害内容

  • 平衡来源

  • 策划高质量文本

训练数据集质量差会导致幻觉、偏见和不稳定的输出。

这是LLM工程中最容易被忽视的部分之一。

8. 微调才是模型变得有用的地方

预训练模型是通用的。

微调使它们变得专用。

这就是公司如何为以下领域创建AI系统:

  • 法律研究

  • 编程

  • 医疗保健

  • 金融

  • 客户支持

  • 教育

方法包括:

  • 监督微调

  • 指令微调

  • RLHF(基于人类反馈的强化学习)

  • LoRA微调

正是这一层将原始智能转化为可用的产品。

9. 上下文窗口比你意识到的更重要

上下文窗口定义了模型在对话期间能记住多少信息。

小上下文:

  • 更快

  • 更便宜

  • 记忆有限

大上下文:

  • 更多推理能力

  • 更好的长文理解

  • 更高的计算成本

现代模型在上下文长度上竞争激烈,因为记忆极大地改变了可用性。

这就是为什么长上下文架构变得至关重要。

10. 推理优化是隐藏的战场

训练获得关注。

推理让产品变得可用。

一旦模型训练完成,工程师必须优化:

  • 延迟

  • GPU使用率

  • 量化

  • 内存效率

  • 并行化

  • 缓存

为什么?

因为大规模运行LLM极其昂贵。

如果推理成本过高,一个在研究阶段可行的模型可能在商业上失败。

未来属于高效的架构——而不仅仅是庞大的架构。

11. 学习LLM的最佳方法是构建小型模型

大多数初学者无休止地看教程。

但真正动手构建的人极少。

最快的学习路径是:

  • 构建一个微型Transformer

  • 在小型数据集上训练

  • 实验注意力机制

  • 可视化Embedding

  • 故意搞坏一些东西

即使是一个微型字符级模型,也能教会你超过100小时的理论知识。

你不需要数十亿参数也能理解LLM。

你需要的是好奇心 + 动手实现。

最后思考

AI革命不仅仅是使用工具。

更是理解这些工具底层的系统。

LLM从外部看可能像是魔法……

但在内部,它们由以下构件组成:

  • Token

  • Embedding

  • 注意力机制

  • Transformer

  • 训练流水线

  • 优化系统

一旦你理解了这些基础模块……

AI就不再显得神秘。

你会在各处看到模式。

如今深入理解这些架构的人,将塑造未来十年的软件、商业乃至互联网本身。

开始学习的最佳时间是几年前。

第二好的时间就是现在。

相似文章

LLMs 101:实用指南(2026年版)

X AI KOLs

一份关于LLMs的全面实用指南,涵盖推理机制、令牌、Transformer、KV缓存、本地部署硬件和量化,截至2026年5月。