@_avichawla: https://x.com/_avichawla/status/2053049489963811135

X AI KOLs Timeline 工具

摘要

本文概述了2026年大语言模型(LLM)工程的路线图,详细阐述了包括提示词工程、RAG系统、上下文管理在内的八大关键支柱,并为每项支柱提供了精选的免费及开源资源。

https://t.co/658QADQmDC
查看原文
查看缓存全文

缓存时间: 2026/05/09 16:10

2026 LLM 工程路线图(附免费且 100% 开源资源)

使用大型语言模型(LLM)不仅仅关乎提示词(Prompt)。

生产级系统需要对 LLM 的工程化、部署和优化有深入的理解。

以下是定义专业 LLM 开发的八大支柱:

让我们逐一了解它们。

1. 提示工程(Prompt Engineering)

每个 LLM 的旅程都从这里开始,因为提示词是你手中成本最低的杠杆。

在转向检索或微调之前,你应该知道一个结构良好的提示词能带你走多远。

这意味着编写减少歧义的指令,使用少样本(few-shot)示例来固定格式,并使用思维链(chain-of-thought)来稳定推理过程。

目标是将提示词视为代码,即进行适当的版本控制、测试和可复现,而不是那种只管用一次、第二天就失效的复制粘贴式黑魔法。

GIF

我在下面总结了 8 种从 LLM 获取更好输出的提示技巧:

Avi Chawla@_avichawla·Apr 25 8 种生成更好 LLM 输出的技巧:

大多数人与 LLM 的交互方式都是一样的:输入一个问题,点击发送,然后处理返回的任何结果。

这是零样本(zero-shot)提示,它作为基线。但是当输出不够好时,第一个修复方法Show moreQuoteAvi Chawla@_avichawla·Oct 20, 2025 终于,研究人员开源了一种新的推理方法,真正防止了 LLM 的幻觉。

它击败了思维链(Chain-of-Thought)等流行技术,拥有 90.2% 的最先进(SOTA)成功率。

以下是当前技术存在的核心问题,而这种方法解决了这些问题:92613211K

更多免费资源:

  • 这份提示工程指南是全面的开放指南,涵盖所有技巧,并附有论文和笔记本:

  • Anthropic 的提示工程概览是官方指南,保持最新,并包含提示生成器:

  • OpenAI 的提示工程指南涵盖了推理模型、结构化输出和智能体工作流:

  • 这个提示工程仓库提供了 22 个从基础到高级的动手 Jupyter 笔记本:

2. RAG 系统

一旦答案需要模型训练数据中从未见过的数据(如公司文档、客户历史记录、截止日之后的任何内容),提示就会遇到瓶颈。

RAG(检索增强生成)通过将文档嵌入向量索引、在查询时检索顶级块并将它们拼接进提示词中来解决这个问题。

GIF

构建一个可工作的 RAG 系统的典型流水线组件包括:块大小和重叠、检索前的查询重写,以及检索后的交叉编码器重排序。

你应该掌握几种 RAG 架构:

Avi Chawla@_avichawla·Feb 27 面向 AI 工程师的 8 种 RAG 架构:

(附使用解释)

  1. 朴素 RAG (Naive RAG)
  • 完全基于查询嵌入与存储嵌入之间的向量相似度检索文档。
  • 最适用于简单的、基于事实的查询,其中直接语义匹配就足够了。

2)Show more911648620K

免费资源:

  • 这个 RAG 技巧仓库为每种技巧提供了笔记本教程,从朴素 RAG 到智能体。

  • LangChain 的从零构建 RAG 是一个视频系列,教授从基础到高级模式的 RAG。

  • Awesome RAG 是一个精选的框架、论文和教程列表。

  • 使用 LLM 构建 RAG 智能体 是一门免费的 NVIDIA 课程,涵盖文档处理、嵌入和部署。

3. 上下文工程(Context Engineering)

检索只是众多输入之一。

模型的上下文窗口还包含对话历史、工具输出、过去会话的记忆、系统提示和少样本示例,它们都在争夺相同的 token 空间。

GIF

上下文工程是一门决定哪些保留、哪些压缩、哪些丢弃的学科,因为每个 token 都会消耗资金并稀释注意力。RAG 只是这个更大问题中的一种工具。

以下是我最近关于上下文工程的一个演示:

Avi Chawla@_avichawla·Sep 11, 2025 让我们一步步构建上下文工程工作流:42615781K

免费资源:

  • Anthropic 的《面向 AI 智能体的高效上下文工程》是上下文策略方面的经典工程指南。

  • 这份上下文工程指南涵盖系统提示、检索、记忆和工具定义。

4. 微调(Fine-tuning)

当提示和上下文达到瓶颈时,下一个杠杆就是权重。

LoRA 和 QLoRA 通过在单个 GPU 上训练小型低秩矩阵而不是完整的参数集,使基础模型适应特定领域,通常只需几千个示例即可缩小特定领域的差距。

这篇文章教你 5 种必须知道的 LLM 微调技巧:

Avi Chawla@_avichawla·Apr 1 我现在微调 LLM 已经超过 2 年了!

以下是前 5 种 LLM 微调技巧,配有视觉解释:

首先,LLM 微调有什么不同?

传统的微调对于 LLM 来说是不切实际的(数十亿参数;数百 GB)。

因为这种类型的Show more1613869928K

困难的部分在于数据,包括去重、指令格式化和质量过滤。训练循环反而是容易的部分。

我的联合创始人写了一篇关于你在 2026 年应该如何思考 LLM 微调的文章:

Akshay @akshay_pachaar·Mar 4 文章 如何在 2026 年微调 LLM 每个使用 LLM 构建的团队最终都会遇到同样的瓶颈。 你编写了详细的系统提示,添加了少样本示例,调整了温度,但你的智能体仍有 30-40% 的概率出错。 The…202451.5K253K

更多免费资源:

  • Sebastian Raschka 的《从零构建大型语言模型》有一个免费的配套仓库,涵盖从零开始的预训练、指令微调和 LoRA。

  • Hugging Face LLM 课程由社区驱动,涵盖 Transformer 和端到端的微调。

  • Unsloth 笔记本是免费的 Colab 笔记本,用于快速 LoRA/QLoRA 微调。

5. 智能体(Agents)

智能体扩展了 LLM 循环:模型选择一个工具,调用它,读取结果,并决定下一步做什么,直到任务完成。

工程工作在于编排,处理跨回合的状态管理、工具返回垃圾数据时的重试逻辑、防止无限循环的步骤限制,以及模型选择错误工具时的优雅失败。

我在此总结了构建智能体的几种模式:

Avi Chawla@_avichawla·Oct 31, 2025 构建多智能体系统的 7 种模式:1010147533K

此外,这是我的联合创始人关于构建智能体的速成课程:

Akshay @akshay_pachaar·Jul 12, 2025 构建 AI 智能体速成课程!

涵盖内容:

  • 什么是 AI 智能体
  • 将智能体连接到工具
  • MCP 概述
  • 用 MCP 服务器替换工具
  • 设置可观察性和追踪

全部使用 100% 开源工具!37185941115K

一些免费资源:

  • Hugging Face 智能体课程是一门涵盖 smolagents、LangGraph、LlamaIndex 和智能体 RAG 的完整免费课程。

  • Anthropic 的《构建高效智能体》是一份关于智能体设计模式的简洁指南。

  • Awesome AI agents 列出了 1500+ 资源和工具。

  • Agents towards production 提供了涵盖生产级智能体全生命周期的教程。

6. LLM 部署

GIF

部署关乎处理并发请求、在负载下扩展以及在流量激增时保持延迟有界。

问题在于许多团队试图将 DevOps 实践应用于 LLM 应用。

但 DevOps、MLOps 和 LLMOps 解决的是根本不同的问题。

首先阅读这篇文章,以便你理解 LLM 部署的根本挑战:

Avi Chawla@_avichawla·Dec 23, 2025 DevOps vs. MLOps vs. LLMOps:

许多团队试图将 DevOps 实践应用于 LLM 应用。

但 DevOps、MLOps 和 LLMOps 解决的是根本不同的问题。

DevOps 是以软件为中心的。你编写代码,测试它,然后部署它。反馈循环很直接:Does theShow moreGIF1913764155K

一旦你在心理上将 LLMOps 与 DevOps 分开,推理引擎就成了第一个具体的决策点。

vLLM 使用 PagedAttention 将 KV 缓存浪费从 60-80% 降低到 4% 以下,这意味着在相同硬件上吞吐量比 TGI 高 2-4 倍。

在此之上,你还需要添加服务层(LitServe、BentoML)、用于路由和成本控制的 LLM 网关(LiteLLM),以及每次请求的成本跟踪。

以下是我使用 LitServe 覆盖 LLM 部署的一个演示:

Avi Chawla@_avichawla·May 9, 2025 让我们部署一个 Qwen 3 智能体 RAG(100% 私有):743514100K

还有另一个演示,教授如何构建和部署一个编程智能体,它可以直接从 Slack 抓取文档、编写生产就绪的代码、解决问题并提交 PR:

Avi Chawla@_avichawla·Aug 7, 2025 我已经在生产环境中构建 AI 智能体超过一年了。

如果你想学习,这里有一个简单的教程(动手):211421.7K291K

一些资源:

  • vLLM 是高吞吐量推理引擎,是服务开源模型的标准。

  • Lightning AI 的 LitServe 是一个基于 FastAPI 构建的灵活服务框架,专为具有批处理和流式功能的 AI 工作负载设计。

  • LiteLLM 在一个接口背后统一了 100+ 个 LLM API,并处理路由和成本控制。

7. LLM 优化

第一张推理账单会让这项技能变得至关重要。

量化是最大的杠杆,它将权重从 FP16 降至 4-bit(llama.cpp 中的 Q4_K_M),通常 perplexity(困惑度)损失不到 1%,同时内存消耗减少约 4 倍,这使得 70B 模型可以放入单个 24GB GPU 中。

蒸馏通过在大型教师模型的输出上训练较小的学生模型来实现。剪枝移除低于阈值的权重。每个权衡都必须在实际工作负载上进行基准测试,而不是通用的评估。

我在下面总结了 72 种这样的技巧:

Avi Chawla@_avichawla·Apr 18 Anthropic. OpenAI. Gemini.

每个生产级 LLM 都运行在一堆优化之上,而不是单一的技巧。

我列出了其中 72 种,涵盖整个服务流水线,分为 9 层,从权重的 INT4 量化一直到应用程序边缘的模型级联。Show moreQuoteAvi Chawla@_avichawla·Apr 16 文章 清晰解释 LLM 中的提示缓存:Claude 如何实现 92% 缓存命中率的案例研究 每次 AI 智能体采取一步,它都会将整个对话历史发送回 LLM。 这包括系统指令、工具…166124332K

免费资源:

  • llama.cpp 支持 1.5 到 8-bit 量化,是普及本地推理的项目。

  • Unsloth 提供快 2 倍的微调和推理,并提供免费的 Colab 笔记本。

  • Hugging Face Optimum 是一个用于量化、ONNX 导出和感知硬件优化的工具包。

  • bitsandbytes 是 Transformers 中 8-bit 和 4-bit 量化背后的库。

8. 安全、评估与 LLM 可观察性

如果你无法判断系统是否真正工作,以上所有内容都白费了。评估和可观察性回答两个不同的问题:

  • 评估(Evals) 问:“输出好吗?”在部署前使用黄金数据集运行,作为每次提示或模型更改的回归检查。

  • 可观察性(Observability) 问:“现在发生了什么?”追踪实时请求,监控 token 使用率和延迟,揭示生产中的故障。

在此了解可观察性的层级:

Avi Chawla@_avichawla·May 5 视觉解释 AI 系统中的可观察性层级:

如果你正在向真实用户部署由 LLM 驱动的应用,你需要知道管道中每一步发生了什么。

以下是心智模型(参见附图):

将你的 AI 管道视为一系列Show moreGIFQuoteAvi Chawla@_avichawla·Jun 30, 2025 GIF 一个 Python 装饰器就是你追踪 LLM 应用所需的一切(开源)。

大多数 LLM 评估将应用视为端到端的黑盒。

但 LLM 应用需要组件级别的评估和追踪,因为问题可能出现在黑盒内部的任何地方,如检索器、工具调用或 LLM 本身。94722423K

这份实用指南涵盖使用 Comet Opik 将评估和可观察性集成到 LLM 应用中 →

说到安全,以下是每个 LLM 应用都应具备的 5 种提示注入实用防御措施:

GIF

上述八项技能假设模型已经训练完成。如果你想更深入地了解训练实际发生的过程,我在此分解了四个阶段:

Avi Chawla@_avichawla·Jul 21, 2025 清晰解释从零训练 LLM 的 4 个阶段(附视觉):454514.3K753K

此外,如果你想要一个单一的权威参考,Chip Huyen 的《AI Engineering: Building Applications with Foundation Models》是关于端到端生产化基础模型的最清晰书籍。

包含笔记和资源的配套仓库是免费的。

👉 轮到你了:你会在此添加哪些其他 LLM 开发技能?

到此结束!

如果你喜欢本教程:

找到我 → @_avichawla

每天,我都会分享关于 DS、ML、LLM 和 RAG 的教程和见解。

相似文章

逐步 LLM 工程项目 (2026 版)

X AI KOLs

一个基于项目的路线图,通过构建从分词器到服务栈的关键组件来学习 LLM 工程,包括硬件基础和后训练技术。