@wsl8297: 加州大学开放课程《大语言模型的强化学习》,用“理论 + 实战”的方式,把 AI 训练的关键技术从零到一讲透,帮你系统建立从强化学习到 LLM 训练的完整框架。 课程内容覆盖全面,配套资源齐全:讲座幻灯片、完整视频、实践练习一应俱全,学完就…
摘要
加州大学助理教授Ernest K. Ryu推出《大语言模型的强化学习》开放课程,结合理论与实践全面解析RLHF、PPO/DPO等LLM训练关键技术及配套资源。该课程为开发者与研究者提供了从基础算法到实战部署的系统学习路径。
查看缓存全文
缓存时间: 2026/05/09 03:42
加州大学开放课程《大语言模型的强化学习》,用“理论 + 实战”的方式,把 AI 训练的关键技术从零到一讲透,帮你系统建立从强化学习到 LLM 训练的完整框架。 课程内容覆盖全面,配套资源齐全:讲座幻灯片、完整视频、实践练习一应俱全,学完就能上手做。 课程地址:http://ernestryu.com/courses/RL-LLM.html… 你将学到: - 深度强化学习核心:MDP、策略梯度、A3C、PPO 等关键算法 - 大语言模型基础:NLP、语言建模、RNN 等入门与脉络 - RLHF 全流程拆解:基于人类反馈的训练方法与落地思路 - 可验证奖励强化学习:面向更安全、更可靠的训练范式 - 动手实践:Jupyter 代码示例 + 课后作业,边学边练 课程由 UCLA 数学系助理教授主讲,YouTube 提供全套视频,内容扎实,适合想把“RL + LLM 训练”真正学明白的人。
Reinforcement Learning of Large Language Models
Source: https://ernestryu.com/courses/RL-LLM.html
Lecture slides
- Chapter 0: Prologue.
- Chapter 1: Deep Reinforcement learning.
- Chapter 2: Large Language Models.
- Chapter 3: Reinforcement Learning of Large Language Models.
Lecture videos
- Chapter 0: Prologue.
- Chapter 1.1: MDP foundations, imitation learning, and value iteration.
- Chapter 1.2: Deep policy evaluation.
- Chapter 1.3: Deep policy gradient methods (A3C).
- Chapter 1.4: Deep policy gradient methods (PPO, GRPO).
- Chapter 1.5: AlphaGo, test-time compute, and expert iteration.
- Chapter 2.1: NLP foundations, language modeling, RNNs.
- Chapter 2.2: Transformers I (BERT, GPT-1).
- Chapter 2.3: Transformers II (modern transformers updates and sampling methods).
- Chapter 2.4: In-context learning and instruction fine-tuning.
- Chapter 3.1: Reinforcement learning from human feedback (PPO, DPO).
- Chapter 3.2: Reinforcement learning with verifiable rewards (RLVR).
Course Information
Instructor
Ernest K. Ryu Assistant Professor of Mathematics, UCLA,

Prerequisites
Students are expected to have basic familiarity with deep learning at the level of image classification. No prior experience with reinforcement learning (RL) or large language models (LLMs) is assumed. For the deep RL lectures, students should be familiar with conditional expectations and the tower property (law of total expectation).
相似文章
@NFTCPS: 加州大学这课,搞AI的都给我冲! 理论+实战,把RL和LLM训练从零到一拆成渣。教你MDP、PPO算法、RLHF全流程,还有Jupyter代码实操。UCLA教授主讲,视频+作业都有,学完直接上手。 课程地址:https://ernestr…
This article recommends a UCLA-led online course on Reinforcement Learning for Large Language Models, covering theory, algorithms like PPO and RLHF, and practical coding exercises.
@Jolyne_AI: 分享一门来自加州大学伯克利分校的进阶课程:Advanced LLM Agents。 这门课聚焦大语言模型 Agent 的最新进展,从推理到规划、从代码到数学证明,系统拆解“能思考、会行动”的代理是怎么做出来的。 课程由 Dawn Song…
分享加州大学伯克利分校的进阶课程Advanced LLM Agents,聚焦大语言模型代理的最新进展,由Dawn Song教授主讲,邀请Google、Meta等研究员,内容涵盖推理、规划、代码生成等。
@GitHub_Daily: 想搞懂大语言模型底层原理,大部分资料只介绍理论知识,或者只给源码,看完还是一头雾水。 偶然看到 EveryonesLLM 这个开源教程,手把手带我们在 Google Colab 上从零搭建一个完整的大语言模型,全程动手写代码。 整套教程分…
EveryonesLLM 是一个开源教程,提供29个章节的Colab笔记本,手把手教用户从零在Google Colab上搭建完整的大语言模型,包括预训练和指令微调,并支持中文。
@Michaelzsguo: Alisa Liu 在准备 OpenAI 面试时,提到过 斯坦福课程 CS336: Language Modeling from Scratch。 如果你现在想系统学 LLM,或者以后想找 AI research / MTS / ML e…
推荐斯坦福公开课程CS336: Language Modeling from Scratch,该课程从零开始系统讲解语言模型的训练全流程,适合准备AI面试或想深入学习LLM的人。
@tan_maty: 吹爆这个课,计算机专业必看 CS336, 这是一门在 AI 圈子里最近封神的课程。 语言模型从零构建大语言 这门课由 Stanford 开设,授课老师是 NLP 领域的顶尖大佬 Percy Liang 和 Tatsunori Hashim…
A thread promoting Stanford's CS336 course on building language models from scratch, taught by NLP experts Percy Liang and Tatsunori Hashimoto, emphasizing hands-on understanding.