@PandaTalk8: 1/ 最近读到一本很适合系统补 LLM 基础的书: 《Foundations of Large Language Models》 作者是 Tong Xiao 和 Jingbo Zhu,来自中国东北大学 NLP Lab 与 NiuTrans…

X AI KOLs Timeline 新闻

摘要

推荐一本系统学习大型语言模型基础的中文书籍《Foundations of Large Language Models》,由东北大学 NLP Lab 与 NiuTrans Research 的 Tong Xiao 和 Jingbo Zhu 撰写。

1/ 最近读到一本很适合系统补 LLM 基础的书: 《Foundations of Large Language Models》 作者是 Tong Xiao 和 Jingbo Zhu,来自中国东北大学 NLP Lab 与 NiuTrans Research。 https://t.co/fWYjicwpa6
查看原文
查看缓存全文

缓存时间: 2026/06/12 12:58

1/ 最近读到一本很适合系统补 LLM 基础的书:

《Foundations of Large Language Models》

作者是 Tong Xiao 和 Jingbo Zhu,来自中国东北大学 NLP Lab 与 NiuTrans Research。

2/ 这本书不是追热点的“模型八卦书”,而是帮你理解大模型底层逻辑的基础读物:

预训练、生成模型、Prompting、对齐、推理。

3/ 两位作者长期深耕 NLP、机器翻译和语言建模。

Tong Xiao 是东北大学计算机教授、NLP Lab 主任、NiuTrans 联合创始人;Jingbo Zhu 是东北大学教授、博士生导师。

4/ 这本书的背景很清楚:

LLM 今天看起来像通用 AI 入口,但它的根在 NLP。

从语言建模到指令微调、RLHF、推理加速,很多新能力都有清晰的技术脉络。

5/ 读这本书,你获得的不是“更炫的 prompt”,而是底层判断力:

为什么预训练有效? 为什么 decoder-only 成为主流? 为什么 prompt 能改变模型行为? 为什么对齐这么重要?

6/ 这本书适合三类人:

AI 产品经理:建立技术判断框架; 开发者/工程师:理解能力边界和系统瓶颈; 研究者/学习者:系统梳理 LLM 基础概念和技术路线。

7/ 核心内容一:预训练。

它从无监督、监督、自监督预训练讲起,解释模型如何从海量文本中学习通用能力,再通过 fine-tuning 或 prompting 适配不同任务。

8/ 核心内容二:生成式模型。

包括 decoder-only Transformer、训练流程、模型扩展、分布式训练、scaling laws、长上下文建模。

想理解“模型为什么越大越强”,这一章很关键。

9/ 核心内容三:Prompting。

不只是提示词技巧,而是系统介绍 in-context learning、CoT、问题分解、自我改进、多答案集成、RAG、工具调用,以及 prompt 优化。

10/ 核心内容四:Alignment。

预训练模型只是“会续写”;要变成有用、可控、符合人类偏好的助手,还需要指令微调、奖励模型、RLHF、DPO 等方法。

11/ 核心内容五:Inference。

真正落地时,推理效率、解码策略、KV cache、batching、并行化、inference-time scaling 都很重要。

快、稳、便宜,很多取决于这里。

12/ 我推荐这本书,是因为它把 LLM 拆成了 5 个稳定模块:

预训练 → 生成模型 → Prompting → 对齐 → 推理

读完后,看新模型、新论文、新产品,会更容易判断它到底新在哪里。

相似文章

@Jolyne_AI: 一本开源实战书:《Hands-On Large Language Models》(《动手学大模型》)。 全书 12 章,从语言模型基础到提示词工程、语义搜索、模型微调,再到多模态应用,循序渐进,覆盖大模型落地的关键路径。 GitHub:h…

X AI KOLs Timeline

一本开源实战书《Hands-On Large Language Models》(《动手学大模型》),全书12章,覆盖语言模型基础、提示词工程、语义搜索、模型微调及多模态应用,提供可运行代码示例,适合实战学习。

@GitHub_Daily: 想搞懂大语言模型底层原理,大部分资料只介绍理论知识,或者只给源码,看完还是一头雾水。 偶然看到 EveryonesLLM 这个开源教程,手把手带我们在 Google Colab 上从零搭建一个完整的大语言模型,全程动手写代码。 整套教程分…

X AI KOLs Timeline

EveryonesLLM 是一个开源教程,提供29个章节的Colab笔记本,手把手教用户从零在Google Colab上搭建完整的大语言模型,包括预训练和指令微调,并支持中文。

@Xx15573208: 看了很多 Transformer 的文章,能听懂原理,但真正坐下来写代码,完全无从下手。 LLMs-from-scratch 专门解决这个问题:配套《Build a Large Language Model》一书,带你用 PyTorch …

X AI KOLs Timeline

LLMs-from-scratch 是一个 GitHub 仓库,配套《Build a Large Language Model》一书,提供从零用 PyTorch 实现 GPT 的完整代码,涵盖预训练、微调、RLHF 等全流程,已获 93K+ stars,适合想深入理解大模型原理的开发者。