@_avichawla: https://x.com/_avichawla/status/2053049489963811135
摘要
本文概述了2026年大语言模型(LLM)工程的路线图,详细阐述了包括提示词工程、RAG系统、上下文管理在内的八大关键支柱,并为每项支柱提供了精选的免费及开源资源。
查看缓存全文
缓存时间: 2026/05/09 16:10
2026 LLM 工程路线图(附免费且 100% 开源资源)
使用大型语言模型(LLM)不仅仅关乎提示词(Prompt)。
生产级系统需要对 LLM 的工程化、部署和优化有深入的理解。
以下是定义专业 LLM 开发的八大支柱:
让我们逐一了解它们。
1. 提示工程(Prompt Engineering)
每个 LLM 的旅程都从这里开始,因为提示词是你手中成本最低的杠杆。
在转向检索或微调之前,你应该知道一个结构良好的提示词能带你走多远。
这意味着编写减少歧义的指令,使用少样本(few-shot)示例来固定格式,并使用思维链(chain-of-thought)来稳定推理过程。
目标是将提示词视为代码,即进行适当的版本控制、测试和可复现,而不是那种只管用一次、第二天就失效的复制粘贴式黑魔法。
GIF
我在下面总结了 8 种从 LLM 获取更好输出的提示技巧:
Avi Chawla@_avichawla·Apr 25 8 种生成更好 LLM 输出的技巧:
大多数人与 LLM 的交互方式都是一样的:输入一个问题,点击发送,然后处理返回的任何结果。
这是零样本(zero-shot)提示,它作为基线。但是当输出不够好时,第一个修复方法Show moreQuoteAvi Chawla@_avichawla·Oct 20, 2025 终于,研究人员开源了一种新的推理方法,真正防止了 LLM 的幻觉。
它击败了思维链(Chain-of-Thought)等流行技术,拥有 90.2% 的最先进(SOTA)成功率。
以下是当前技术存在的核心问题,而这种方法解决了这些问题:92613211K
更多免费资源:
-
这份提示工程指南是全面的开放指南,涵盖所有技巧,并附有论文和笔记本:
-
Anthropic 的提示工程概览是官方指南,保持最新,并包含提示生成器:
-
OpenAI 的提示工程指南涵盖了推理模型、结构化输出和智能体工作流:
-
这个提示工程仓库提供了 22 个从基础到高级的动手 Jupyter 笔记本:
2. RAG 系统
一旦答案需要模型训练数据中从未见过的数据(如公司文档、客户历史记录、截止日之后的任何内容),提示就会遇到瓶颈。
RAG(检索增强生成)通过将文档嵌入向量索引、在查询时检索顶级块并将它们拼接进提示词中来解决这个问题。
GIF
构建一个可工作的 RAG 系统的典型流水线组件包括:块大小和重叠、检索前的查询重写,以及检索后的交叉编码器重排序。
你应该掌握几种 RAG 架构:
Avi Chawla@_avichawla·Feb 27 面向 AI 工程师的 8 种 RAG 架构:
(附使用解释)
- 朴素 RAG (Naive RAG)
- 完全基于查询嵌入与存储嵌入之间的向量相似度检索文档。
- 最适用于简单的、基于事实的查询,其中直接语义匹配就足够了。
2)Show more911648620K
免费资源:
-
这个 RAG 技巧仓库为每种技巧提供了笔记本教程,从朴素 RAG 到智能体。
-
LangChain 的从零构建 RAG 是一个视频系列,教授从基础到高级模式的 RAG。
-
Awesome RAG 是一个精选的框架、论文和教程列表。
-
使用 LLM 构建 RAG 智能体 是一门免费的 NVIDIA 课程,涵盖文档处理、嵌入和部署。
3. 上下文工程(Context Engineering)
检索只是众多输入之一。
模型的上下文窗口还包含对话历史、工具输出、过去会话的记忆、系统提示和少样本示例,它们都在争夺相同的 token 空间。
GIF
上下文工程是一门决定哪些保留、哪些压缩、哪些丢弃的学科,因为每个 token 都会消耗资金并稀释注意力。RAG 只是这个更大问题中的一种工具。
以下是我最近关于上下文工程的一个演示:
Avi Chawla@_avichawla·Sep 11, 2025 让我们一步步构建上下文工程工作流:42615781K
免费资源:
-
Anthropic 的《面向 AI 智能体的高效上下文工程》是上下文策略方面的经典工程指南。
-
这份上下文工程指南涵盖系统提示、检索、记忆和工具定义。
4. 微调(Fine-tuning)
当提示和上下文达到瓶颈时,下一个杠杆就是权重。
LoRA 和 QLoRA 通过在单个 GPU 上训练小型低秩矩阵而不是完整的参数集,使基础模型适应特定领域,通常只需几千个示例即可缩小特定领域的差距。
这篇文章教你 5 种必须知道的 LLM 微调技巧:
Avi Chawla@_avichawla·Apr 1 我现在微调 LLM 已经超过 2 年了!
以下是前 5 种 LLM 微调技巧,配有视觉解释:
首先,LLM 微调有什么不同?
传统的微调对于 LLM 来说是不切实际的(数十亿参数;数百 GB)。
因为这种类型的Show more1613869928K
困难的部分在于数据,包括去重、指令格式化和质量过滤。训练循环反而是容易的部分。
我的联合创始人写了一篇关于你在 2026 年应该如何思考 LLM 微调的文章:
Akshay @akshay_pachaar·Mar 4 文章 如何在 2026 年微调 LLM 每个使用 LLM 构建的团队最终都会遇到同样的瓶颈。 你编写了详细的系统提示,添加了少样本示例,调整了温度,但你的智能体仍有 30-40% 的概率出错。 The…202451.5K253K
更多免费资源:
-
Sebastian Raschka 的《从零构建大型语言模型》有一个免费的配套仓库,涵盖从零开始的预训练、指令微调和 LoRA。
-
Hugging Face LLM 课程由社区驱动,涵盖 Transformer 和端到端的微调。
-
Unsloth 笔记本是免费的 Colab 笔记本,用于快速 LoRA/QLoRA 微调。
5. 智能体(Agents)
智能体扩展了 LLM 循环:模型选择一个工具,调用它,读取结果,并决定下一步做什么,直到任务完成。
工程工作在于编排,处理跨回合的状态管理、工具返回垃圾数据时的重试逻辑、防止无限循环的步骤限制,以及模型选择错误工具时的优雅失败。
我在此总结了构建智能体的几种模式:
Avi Chawla@_avichawla·Oct 31, 2025 构建多智能体系统的 7 种模式:1010147533K
此外,这是我的联合创始人关于构建智能体的速成课程:
Akshay @akshay_pachaar·Jul 12, 2025 构建 AI 智能体速成课程!
涵盖内容:
- 什么是 AI 智能体
- 将智能体连接到工具
- MCP 概述
- 用 MCP 服务器替换工具
- 设置可观察性和追踪
全部使用 100% 开源工具!37185941115K
一些免费资源:
-
Hugging Face 智能体课程是一门涵盖 smolagents、LangGraph、LlamaIndex 和智能体 RAG 的完整免费课程。
-
Anthropic 的《构建高效智能体》是一份关于智能体设计模式的简洁指南。
-
Awesome AI agents 列出了 1500+ 资源和工具。
-
Agents towards production 提供了涵盖生产级智能体全生命周期的教程。
6. LLM 部署
GIF
部署关乎处理并发请求、在负载下扩展以及在流量激增时保持延迟有界。
问题在于许多团队试图将 DevOps 实践应用于 LLM 应用。
但 DevOps、MLOps 和 LLMOps 解决的是根本不同的问题。
首先阅读这篇文章,以便你理解 LLM 部署的根本挑战:
Avi Chawla@_avichawla·Dec 23, 2025 DevOps vs. MLOps vs. LLMOps:
许多团队试图将 DevOps 实践应用于 LLM 应用。
但 DevOps、MLOps 和 LLMOps 解决的是根本不同的问题。
DevOps 是以软件为中心的。你编写代码,测试它,然后部署它。反馈循环很直接:Does theShow moreGIF1913764155K
一旦你在心理上将 LLMOps 与 DevOps 分开,推理引擎就成了第一个具体的决策点。
vLLM 使用 PagedAttention 将 KV 缓存浪费从 60-80% 降低到 4% 以下,这意味着在相同硬件上吞吐量比 TGI 高 2-4 倍。
在此之上,你还需要添加服务层(LitServe、BentoML)、用于路由和成本控制的 LLM 网关(LiteLLM),以及每次请求的成本跟踪。
以下是我使用 LitServe 覆盖 LLM 部署的一个演示:
Avi Chawla@_avichawla·May 9, 2025 让我们部署一个 Qwen 3 智能体 RAG(100% 私有):743514100K
还有另一个演示,教授如何构建和部署一个编程智能体,它可以直接从 Slack 抓取文档、编写生产就绪的代码、解决问题并提交 PR:
Avi Chawla@_avichawla·Aug 7, 2025 我已经在生产环境中构建 AI 智能体超过一年了。
如果你想学习,这里有一个简单的教程(动手):211421.7K291K
一些资源:
-
vLLM 是高吞吐量推理引擎,是服务开源模型的标准。
-
Lightning AI 的 LitServe 是一个基于 FastAPI 构建的灵活服务框架,专为具有批处理和流式功能的 AI 工作负载设计。
-
LiteLLM 在一个接口背后统一了 100+ 个 LLM API,并处理路由和成本控制。
7. LLM 优化
第一张推理账单会让这项技能变得至关重要。
量化是最大的杠杆,它将权重从 FP16 降至 4-bit(llama.cpp 中的 Q4_K_M),通常 perplexity(困惑度)损失不到 1%,同时内存消耗减少约 4 倍,这使得 70B 模型可以放入单个 24GB GPU 中。
蒸馏通过在大型教师模型的输出上训练较小的学生模型来实现。剪枝移除低于阈值的权重。每个权衡都必须在实际工作负载上进行基准测试,而不是通用的评估。
我在下面总结了 72 种这样的技巧:
Avi Chawla@_avichawla·Apr 18 Anthropic. OpenAI. Gemini.
每个生产级 LLM 都运行在一堆优化之上,而不是单一的技巧。
我列出了其中 72 种,涵盖整个服务流水线,分为 9 层,从权重的 INT4 量化一直到应用程序边缘的模型级联。Show moreQuoteAvi Chawla@_avichawla·Apr 16 文章 清晰解释 LLM 中的提示缓存:Claude 如何实现 92% 缓存命中率的案例研究 每次 AI 智能体采取一步,它都会将整个对话历史发送回 LLM。 这包括系统指令、工具…166124332K
免费资源:
-
llama.cpp 支持 1.5 到 8-bit 量化,是普及本地推理的项目。
-
Unsloth 提供快 2 倍的微调和推理,并提供免费的 Colab 笔记本。
-
Hugging Face Optimum 是一个用于量化、ONNX 导出和感知硬件优化的工具包。
-
bitsandbytes 是 Transformers 中 8-bit 和 4-bit 量化背后的库。
8. 安全、评估与 LLM 可观察性
如果你无法判断系统是否真正工作,以上所有内容都白费了。评估和可观察性回答两个不同的问题:
-
评估(Evals) 问:“输出好吗?”在部署前使用黄金数据集运行,作为每次提示或模型更改的回归检查。
-
可观察性(Observability) 问:“现在发生了什么?”追踪实时请求,监控 token 使用率和延迟,揭示生产中的故障。
在此了解可观察性的层级:
Avi Chawla@_avichawla·May 5 视觉解释 AI 系统中的可观察性层级:
如果你正在向真实用户部署由 LLM 驱动的应用,你需要知道管道中每一步发生了什么。
以下是心智模型(参见附图):
将你的 AI 管道视为一系列Show moreGIFQuoteAvi Chawla@_avichawla·Jun 30, 2025 GIF 一个 Python 装饰器就是你追踪 LLM 应用所需的一切(开源)。
大多数 LLM 评估将应用视为端到端的黑盒。
但 LLM 应用需要组件级别的评估和追踪,因为问题可能出现在黑盒内部的任何地方,如检索器、工具调用或 LLM 本身。94722423K
这份实用指南涵盖使用 Comet Opik 将评估和可观察性集成到 LLM 应用中 →
说到安全,以下是每个 LLM 应用都应具备的 5 种提示注入实用防御措施:
GIF
上述八项技能假设模型已经训练完成。如果你想更深入地了解训练实际发生的过程,我在此分解了四个阶段:
Avi Chawla@_avichawla·Jul 21, 2025 清晰解释从零训练 LLM 的 4 个阶段(附视觉):454514.3K753K
此外,如果你想要一个单一的权威参考,Chip Huyen 的《AI Engineering: Building Applications with Foundation Models》是关于端到端生产化基础模型的最清晰书籍。
包含笔记和资源的配套仓库是免费的。
👉 轮到你了:你会在此添加哪些其他 LLM 开发技能?
到此结束!
如果你喜欢本教程:
找到我 → @_avichawla
每天,我都会分享关于 DS、ML、LLM 和 RAG 的教程和见解。
相似文章
逐步 LLM 工程项目 (2026 版)
一个基于项目的路线图,通过构建从分词器到服务栈的关键组件来学习 LLM 工程,包括硬件基础和后训练技术。
@akshay_pachaar: LLM工程师手册(每天30分钟,10周,50课)一个面向LLM推理服务的路线图,一切都指向一个服务,而不是分散在多个演示中。
一个为期10周、每天30分钟的工程师学习LLM推理服务的路线图,涵盖vLLM、SGLang、负载测试、量化以及优化技术,以构建一个可复现的基准测试。
LLM编码时代的软件工程最佳实践
一篇讨论软件工程最佳实践如何随着LLM编码工具的整合而发展的文章,为开发者提供指导。
@tom_doerr: 为期8周的实践型LLM工程课程,每周项目作业 https://github.com/ed-donner/llm_engineering…
由Ed Donner提供的免费开源8周实践型LLM工程课程,包含每周项目作业,涵盖Ollama、Llama 3.2及AI编程工具等主题。
@bibryam: 我作为高级工程师在2026年如何使用LLMs https://seangoedecke.com/how-i-use-llms-in-2026… 最大的AI工作流变化…
一位高级工程师描述了到2026年LLM代理如何演变成编码、调试和代码库研究的可靠协作者,而人类仍负责判断和审查。