烘焙模型:LLM训练的隐喻
摘要
文章以烘焙为喻,解释训练大型语言模型的过程,将烘焙中的原料和步骤与AI中的数据和训练进行比较。
暂无内容
查看缓存全文
缓存时间: 2026/08/18 16:04
# 模型烘焙术
来源:https://newsletter.kentbeck.com/p/baking-a-model
我记得高中时走向校车的路上,痴迷地翻阅一本摩托罗拉6800指令集手册。当时其实完全看不懂——布尔表达式、指令编码、时序图——但我着迷于整个机制的奥秘。这台复杂的机器若能理解,便能掌握操控之力。
此刻我对AI模型也有同样的感受。虽不敢说已洞悉细节,但整个机制令我着迷。我关注两个层面:
- 模型如何运作
- 构建模型的机械原理
本文将从第二个角度切入,探讨模型的构建过程(后续可能还有系列文章)。
[](https://substackcdn.com/image/fetch/$s_!PlwL!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F961d0b32-94f1-43bf-84a9-af749bcc28c9_768x1024.jpeg)周六的佛卡夏面包
我热爱烘焙。将原始食材转化成全新形态——食材本身未必可口,但经组合烹制便成美味。况且烘焙对初始条件极度敏感:过程早期的微小改动,可能导致后期的巨大变化。
最近我在尝试冷藏发酵法,让酵母在冰箱中完成一夜的工作。当我研究模型构建时,突然意识到这与模型训练存在奇妙的类比——至少以我目前的理解(若有错误请在评论区指正)。
首先需要渐进式阐明"模型"的定义。我会先过度简化,再逐步揭示复杂性。
所谓"模型",即能与人类对话的计算机系统(看吧,我说了会过度简化——请稍安勿躁,这段解释很快结束)。
[](https://substackcdn.com/image/fetch/$s_!V6B1!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F2c43435e-df14-4fb6-b170-1a4bd69a47b0_2604x2657.heic)
实际上要复杂些。模型分为两部分:
- 用户界面:负责输入输出格式处理、流程控制与身份验证等
- 模型本体:实现魔法的核心部分
[](https://substackcdn.com/image/fetch/$s_!RWhE!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc449c8cf-8d4a-4715-be23-317365b56cf0_2486x2640.heic)
用户界面采用传统编程技术构建(尽管这两年"传统"已发生剧变)。而模型本体(我们的探索主题)则采用截然不同的技术打造。
[](https://substackcdn.com/image/fetch/$s_!OINh!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F58717e01-2c56-4654-9667-57d36a600ae1_1170x672.jpeg)
模型本质是一组数字参数。今日探讨暂止于此(或许未来会研究这些参数如何生成文本,但得先加深理解)。
[](https://substackcdn.com/image/fetch/$s_!CFeV!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa8e3b4f2-e00e-4ee5-8a41-33b6cb138a49_2141x1742.heic)
这些数字从何而来?与编程编写语句序列不同,AI模型通过"训练"生成。
[](https://substackcdn.com/image/fetch/$s_!kKy8!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fed913c17-e213-40f6-9597-d233320b651c_826x952.jpeg)
训练与编程有相似之处——都通过修改载体来改变其未来行为——但也存在根本差异。
我们不可能凭空猜中全部正确参数。实际过程是:先获得近似正确的数值,再逐步调优至更优状态。两种模式截然不同。
[](https://substackcdn.com/image/fetch/$s_!qNW0!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F6a3d6be7-1258-4cbf-afc5-de64a43a3faa_1416x556.jpeg)
(据我所知,训练分为预训练、后训练与中训练(对此我一无所知),但不存在单独"训练"的概念,它只是这三者的组合。但愿未来术语能更完善。)
预训练是大规模批量作业。整个团队设置初始条件——数据与空白模型。数据在模型中历经亿万次正反向传播。过程中定期存档以防崩溃。团队会监测预训练是否偏离正轨并需要调整重启。预训练是场豪赌——耗资数亿美元,且(更昂贵地)耗费数月时间。
(我需要深入了解预训练团队的协作方式。)
预训练就是模型训练的冷藏发酵:
- 混合原料
- 放入无人打扰的环境
- 静待过程自然发展
- 成品虽不可直接使用,却是后续流程的基石
后训练由众多小型批次组成。研究人员(我这个外行直白地称其为"模型工程师")针对原始模型表现欠佳的具体问题,探索可能的优化调整。最终产出大量代码与数据片段(存活下来的实验成果),应用于现有模型。
后训练是对原始模型的补充完善。当足够多的补充与用户界面结合,模型便能响应类似"给我推荐5种创意佛卡夏配料"的请求。
后训练是模型训练的塑形与烹调阶段:将具有潜力的素材转化为人类可享用的佳肴。(此比喻未涵盖后训练的协作性、迭代性与可逆性——唉。)
在后续文章中,我将深入探讨整个流程涉及的不同团队与角色。他们的激励机制、工具链、工作节奏、长短期考量、功能与愿景侧重、专业背景及文化存在有趣差异。
但首先,我想确认自己对流程的理解是否正确。如有谬误请指正。
**多数团队面临的并非战略问题,而是适应问题。** 你的计划永远不可能完美适应现实。关键在于当计划失效时,你的组织是弯折还是断裂。
我助团队柔韧应变。*适应方能繁荣。*
现正承接少量**定制演讲**与**咨询项目**。通过访谈您的团队成员、剖析真实软件流程,提供洞见与解决方案。
想了解合作可行性?请介绍您的团队背景。(https://kentbeck.com/kent-beck-sponsorship#inquire)
相似文章
@neural_avb: 如果你仔细想想,2026年的LLM训练其实是一个三步循环:- 用一些数据训练 - 内部测试/运行分类评估…
这条推文概述了2026年LLM训练的三步循环:用数据训练、运行评估、为表现不佳的任务添加合成数据。它强调了通过开源模型和廉价API进行合法蒸馏的易得性,并指出仅凭推理轨迹训练就能获得高分。
IEEE 推出大型语言模型培训课程
IEEE 推出了一门关于大型语言模型的新培训课程,旨在帮助技术专业人员掌握 LLM 用于工程实践,涵盖 API、RAG 和安全等主题。
@leerob: 人类尝试困难的事情,失败,学习,并通过重复变得更好。AI模型并没有你想象的那么不同…
通过人类学习中的练习、指导和强化作为类比,解释AI模型如何学习,涵盖预训练、监督微调和强化学习。
从零开始使用MLX构建大语言模型
一份关于使用Apple的MLX框架从零开始构建大语言模型的指南。
@pmddomingos: 你可以阅读数百篇充满炒作的大语言模型文章,却仍然不知道它们是如何工作的。或者,你可以阅读这篇,然后...
一条推文推荐了一篇全面的博客文章,该文章从注意力机制和分布式表示开始,解释了大语言模型的历史,旨在帮助读者揭开LLMs的神秘面纱。