@Tabbu_ai: https://x.com/Tabbu_ai/status/2058145123444347339
摘要
一篇教育性推文串,解释了理解和从头构建LLM架构的11个关键课程,涵盖token、嵌入、注意力、位置编码、数据质量和常见误解。
查看缓存全文
缓存时间: 2026/05/23 18:15
如何从零构建LLM架构:大多数人跳过的11个有力经验
每个人都在谈论AI。
但真正理解大型语言模型(LLM)是如何构建的人少之又少。
大多数人每天都在使用像OpenAI ChatGPT、Anthropic Claude或Google Gemini这样的工具……
但这些系统背后却是基于数学、模式和超大规模工程构建的、一种惊人地优雅的架构。
好消息是什么?
你不再需要博士学位或研究实验室才能理解这些基础。
如果你想从零构建LLM架构——或者至少深入理解它们的工作原理——这11个经验将帮你节省数月的困惑。
1. 别再以为LLM是魔法
初学者最大的错误是假设LLM会“思考”。
它们并不会。
LLM本质上只是被训练用来回答一个问题的预测引擎:
“下一个最可能出现的Token是什么?”
仅此而已。
当你输入:
“法国的首都是……”
模型预测:
“巴黎”
并不是因为它像人类一样“知道”地理……
而是因为数十亿的训练样本教会了它词语之间的统计关系。
理解这一点会改变一切。
你不再追逐噱头,而是开始学习系统。
2. 在学Transformer之前先学Token
在学习Transformer、注意力机制或缩放法则之前……
先理解Token。
LLM并不像人类一样看待文字。
它们将文本转换成称为Token的小块。
示例:
文本可能的Token“ChatGPT is amazing”[“Chat”, “G”, “PT”, “is”, “amazing”]
不同的模型有不同的切分方式。
为什么这很重要:
-
Token化影响成本
-
上下文长度
-
性能
-
速度
-
内存使用
如果你跳过Token化,架构的其他部分会显得令人困惑。
3. Embedding是真正的基石
在Token化之后,Token会被转换成称为Embedding的向量。
Embedding是含义的数值表示。
含义相近的词语在向量空间中会更接近。
示例:
-
“King”和“Queen”在数学上产生关联
-
“Dog”和“Puppy”出现在相近的位置
-
“Apple”可以根据上下文改变含义
这就是模型开始理解语义关系的方式。
没有Embedding:
LLM只是随机的文本预测器。
有了Embedding:
它们开始捕捉语言结构。
4. 注意力机制永远改变了AI
Transformer架构引入了一个革命性的想法:
注意力。
具体来说:
“自注意力。”
这使得每个Token可以观察句子中的所有其他Token,并决定哪些信息最重要。
示例:
在句子:
“那只动物没有过马路,因为它累了。”
单词“它”需要上下文来理解。
注意力机制帮助模型理解“它”指的是“动物”。
单单这一机制就彻底改变了现代AI。
这就是基于Transformer的模型优于旧式RNN和LSTM架构的原因。
5. 位置编码解决了一个大问题
Transformer并行处理Token。
速度很快。
但对序列的理解却很糟糕。
没有位置编码:
句子:
“狗咬了人”
看起来可能与:
“人咬了狗”
完全相同。
位置编码将顺序信息注入Embedding中。
这帮助模型理解结构、语法和含义。
一个小细节。
影响巨大。
6. 更大的模型并不总是更聪明
大多数人认为:
参数越多 = 智能越高。
并不总是如此。
一个强大的LLM取决于:
-
训练质量
-
数据集的多样性
-
架构设计
-
对齐微调
-
检索系统
-
微调策略
一些较小的模型在特定任务上表现优于较大的模型,因为它们训练得更高效。
优化比蛮力更重要。
7. 数据质量比大多数人想象的更重要
垃圾进。
垃圾出。
训练数据的质量决定了模型有多大用处。
现代LLM流水线在以下方面投入巨大精力:
-
清洗数据集
-
去除重复
-
过滤有害内容
-
平衡来源
-
策划高质量文本
训练数据集质量差会导致幻觉、偏见和不稳定的输出。
这是LLM工程中最容易被忽视的部分之一。
8. 微调才是模型变得有用的地方
预训练模型是通用的。
微调使它们变得专用。
这就是公司如何为以下领域创建AI系统:
-
法律研究
-
编程
-
医疗保健
-
金融
-
客户支持
-
教育
方法包括:
-
监督微调
-
指令微调
-
RLHF(基于人类反馈的强化学习)
-
LoRA微调
正是这一层将原始智能转化为可用的产品。
9. 上下文窗口比你意识到的更重要
上下文窗口定义了模型在对话期间能记住多少信息。
小上下文:
-
更快
-
更便宜
-
记忆有限
大上下文:
-
更多推理能力
-
更好的长文理解
-
更高的计算成本
现代模型在上下文长度上竞争激烈,因为记忆极大地改变了可用性。
这就是为什么长上下文架构变得至关重要。
10. 推理优化是隐藏的战场
训练获得关注。
推理让产品变得可用。
一旦模型训练完成,工程师必须优化:
-
延迟
-
GPU使用率
-
量化
-
内存效率
-
并行化
-
缓存
为什么?
因为大规模运行LLM极其昂贵。
如果推理成本过高,一个在研究阶段可行的模型可能在商业上失败。
未来属于高效的架构——而不仅仅是庞大的架构。
11. 学习LLM的最佳方法是构建小型模型
大多数初学者无休止地看教程。
但真正动手构建的人极少。
最快的学习路径是:
-
构建一个微型Transformer
-
在小型数据集上训练
-
实验注意力机制
-
可视化Embedding
-
故意搞坏一些东西
即使是一个微型字符级模型,也能教会你超过100小时的理论知识。
你不需要数十亿参数也能理解LLM。
你需要的是好奇心 + 动手实现。
最后思考
AI革命不仅仅是使用工具。
更是理解这些工具底层的系统。
LLM从外部看可能像是魔法……
但在内部,它们由以下构件组成:
-
Token
-
Embedding
-
注意力机制
-
Transformer
-
训练流水线
-
优化系统
一旦你理解了这些基础模块……
AI就不再显得神秘。
你会在各处看到模式。
如今深入理解这些架构的人,将塑造未来十年的软件、商业乃至互联网本身。
开始学习的最佳时间是几年前。
第二好的时间就是现在。
相似文章
@CamilleRoux: 对LLMs内部工作原理的精彩解释:tokens、embeddings、positional encoding、attention、feed-forward…
这条推文分享了一篇关于LLMs内部工作原理的详尽解释,涵盖了tokens、embeddings、positional encoding、attention和feed-forward网络,来源于0xkato的一篇博文。
LLMs 101:实用指南(2026年版)
一份关于LLMs的全面实用指南,涵盖推理机制、令牌、Transformer、KV缓存、本地部署硬件和量化,截至2026年5月。
@harshbhatt7585: https://x.com/harshbhatt7585/status/2063593933314113587
作者分享了从头训练一个160M参数大语言模型的经验,尝试了多种架构,如多Token预测和分层推理模型。他强调快速迭代、简化思路以及理解架构有效原因的重要性。
@techNmak: 这是学习LLM工作原理的最佳方式。交互式3D,逐步讲解。涵盖:→ 嵌入 → 层归一化 → 自注意力…
一个交互式3D逐步指南,通过可视化方式学习LLM工作原理,涵盖嵌入、自注意力、softmax等关键Transformer概念。推荐使用视觉化方法,而非阅读论文。
@TheAhmadOsman: 不可思议的资源 从第一性原理理解LLM的最完整指南现已可在网上阅读…
一份全面的免费指南,从第一性原理解释LLM,涵盖令牌、Transformer、注意力机制、微调和本地部署。