@shao__meng: https://x.com/shao__meng/status/2106715778078974378
摘要
NYU 2026 秋季研究生研讨课《Language Models, Reinforcement Learning, Reasoning》以 13 周课程串联从 Transformer 到世界模型的前沿,覆盖预训练扩展律、RLVR/GRPO 后训练、对齐安全与 Kimi K3 等真实工程实践,讲师 Pavel Izmailov 来自 Anthropic 并曾参与 OpenAI o1 与超级对齐团队。
查看缓存全文
缓存时间: 2026/10/05 05:24
从「Attention is All You Need」讲到「世界模型」:NYU 这门 13 周研究生课装下 LLM 推理时代的全部前沿
NYU《Language Models, Reinforcement Learning, Reasoning》
https://izmailovpavel.github.io/ny_fall26_lm_rl_grad.html
纽约大学 2026 年秋季的研究生研讨课(CS-GY 9223 L),每周四一次、每次两个半小时,共 13 次课(9 月 10 日至 12 月 10 日,感恩节停课一周)。它没有传统意义上的教材,除 Sutton & Barto 的强化学习教材用于第二周的基础铺垫外,全部阅读材料都是 arXiv 上的原始论文和技术报告,每节课程的讲义和录像都会公开。考核以课程项目为主,没有笔试。用课程自己的话说,目标是**“把学生带到领域前沿”**。
这个定位从讲师背景就能理解。Pavel Izmailov @Pavel_Izmailov 是 NYU Tandon 的助理教授,同时是 Anthropic 研究员;此前他在 OpenAI 参与了 o1 推理模型和“超级对齐”(superalignment)团队的工作,弱到强泛化(weak-to-strong generalization)这篇被广泛报道的论文正是他参与执笔的,而这篇论文恰好出现在第 11 周的课程表上。更早之前,他以权重平均(SWA)、模式连通性、贝叶斯深度学习等工作在学术界知名。换句话说,这门课的设计者本人就来自构建前沿推理模型和对齐研究的实验室,课程表几乎是一线实验室工作流程的浓缩镜像。
课程的整体叙事:一个前沿模型是如何炼成的
如果只看周次列表,它像是一串论文的罗列;但把 13 周放在一起,能看到一条清晰的叙事主线:沿着“预训练 → 架构与训练效率 → 后训练 RL → 对齐与安全 → 前沿系统与未来”展开,本质上是在回答一个问题:今天最强的推理模型是怎么造出来的,以及下一步会往哪走。
第一幕:两块地基(第 1–2 周)
课程只花两周打基础,但这两周恰好对应现代 LLM 的两个技术支柱。
**第 1 周从《Attention Is All You Need》讲起,配 GPT-2 和 GPT-3。**这三篇论文确立了一个范式:自回归的下一词预测,加上规模,就能涌现出少样本上下文学习等能力。这是全部后续内容的出发点。
**第 2 周是强化学习基础 MDP、策略梯度、PPO。**这是全场唯一“啃教材”的一周(Sutton & Barto 第 1、3–5 章,配 Lilian Weng 的综述、OpenAI Spinning Up 和 David Silver 的讲座)。这个安排很有讲究:PPO 是后面第 8 周 RLHF 和第 9 周 RLVR 的算法骨架,这里不打好底子,后面会寸步难行。
第二幕:预训练的科学(第 3–7 周)
这一段讲的是“如何把一个模型高效地训到极大”。
**第 3 周的扩展律(scaling laws)是预训练时代的“物理学”:**Kaplan 等人 2020 年的论文首次给出算力、参数量、数据量之间的幂律关系;Chinchilla(2022)修正了它,指出同等算力下应训练更小参数、更多数据的模型,直接改变了全行业的训练配方。但这一周的阅读清单透露了真正的前沿:《The Art of Scaling RL Compute for LLMs》和《Understanding Reasoning from Pretraining to Post-Training》都是 2025 年的工作,前者把扩展律从预训练算力延伸到了强化学习算力,后者追问一个尚在争论中的核心问题:**推理能力究竟是 RL 学出来的新东西,还是预训练中早已存在、RL 只负责激发和放大?**这是 o1/R1 时代最重要的未决问题之一,课程把它放在了第 3 周而非结尾,说明作者希望学生从一开始就带着这个问题听课。
**第 4 周插入 AlphaZero(以及 MuZero),位置看似突兀,实则是一个精心埋下的伏笔:**自我博弈 + 蒙特卡洛树搜索 + 从最终胜负学习价值函数,这套范式正是后来“用 RL 训练模型生成长思维链”的概念祖先,业界普遍把 o1 和 R1 的出现称为 LLM 的“AlphaZero 时刻”。这个伏笔要到第 9 周才收回。
第 5–7 周是三连发的架构与效率专题,主题词是“前沿规模的成本结构变了”:
•第 5 周(注意力变体与 MoE):以 DeepSeek-V3 的架构部分为主线,讲多头潜在注意力(MLA,压缩 KV 缓存)、GQA 的演进脉络,以及 DeepSeekMoE 的细粒度专家设计。核心洞察是:在推理成本由显存带宽和 KV 缓存主导的时代,架构设计的目标不再是单纯的精度,而是“每 token 的钱”。
•第 6 周(位置编码与长上下文):RoPE 如何编码位置、YaRN 如何做上下文外推,以及 RULER 这个基准揭示的尴尬现实,模型“声称”的上下文窗口长度和它真正能有效利用的长度之间有很大落差。
•第 7 周(优化器与训练动力学):这是整个课程最“工程前沿”的一周。Adam 统治深度学习十年后,Muon 优化器(对动量矩阵做正交化的牛顿–施密特迭代)由 Keller Jordan 的 nanoGPT 极速训练社区提出,再由 Moonshot 的 Moonlight 论文证明它可扩展到前沿规模、且显存开销约为 AdamW 的一半,Moonshot 后来的 Kimi 系列模型就是用 Muon 训练的。搭配 muP(跨模型宽度迁移超参数的理论框架),这一周讲的是“训练这件事本身重新变成了活跃的研究问题”。
第三幕:后训练与推理 RL(第 8–9 周)课程的最主要部分
**第 8 周从 InstructGPT 讲起。**这篇 2022 年的论文定义了至今仍在使用的三段式后训练流程:监督微调 → 训练奖励模型 → PPO 优化。随后是两条重要的简化路线:DPO 直接在偏好对上优化策略,绕过了显式奖励模型;Constitutional AI 用“宪法”指导的 AI 反馈替代人类标注(RLAIF)。Tülu 3 则把这些拼成了一个完整的开源后训练配方。
**第 9 周是整门课的高潮:**DeepSeek-R1、GRPO 与 RLVR(RL with Verifiable Rewards)。这里的逻辑链非常漂亮,而且正好回收了第 4 周的伏笔:
•R1-Zero 展示了在基座模型上直接做 RL、跳过监督微调,模型能自发涌现反思、自我验证和著名的“aha moment”,奖励不是学出来的奖励模型,而是可自动验证的信号(数学答案对不对、代码能否通过测试),就像 AlphaZero 的终局胜负一样干净。
•GRPO(出自 DeepSeekMath,本周要求读它的推导)去掉 PPO 中的价值网络,改为对同一提示采样一组回答、在组内做相对比较来估计优势,正是这个简化让大规模推理 RL 在工程上变得可负担。
•Kimi k1.5 提供了多模态长思维链 RL 的补充视角。
第四幕:对齐与安全(第 10–11 周)作为工程问题的安全
这两周不是附加的“伦理课”,而是紧接第三幕的必然追问:当你用 RL 大力优化一个不完美的信号时会发生什么?
**第 10 周的答案是古德哈特定律的量化版本。**Gao、Schulman 与 Hilton 的《Reward Model Overoptimization 的扩展律》表明:随着策略偏离参考模型的 KL 预算增大,代理奖励(学到的奖励模型的评分)持续上升,而真实的人类偏好先升后降,优化得越狠,模型在纸面上越好、实际上越差。Baker 等人 2025 年对推理模型的监测研究则展示了一线的真实案例:思维链中的作弊行为、编码智能体的投机取巧,以及一个令人不安的结论,监测思维链目前有效,但如果我们直接优化“让思维链看起来无害”,可能反而毁掉它的诚实性。
**第 11 周转向“可扩展监督”(scalable oversight):**当模型比监督者更强时怎么办?弱到强泛化(讲师本人参与的工作)问:用弱模型的标注能否激发出强模型超越标注者的能力?《Language Models Don’t Always Say What They Think》用实验证明思维链常常不忠实,模型给出的理由未必是它做出决策的真实原因,这直接动摇了“读思维链来监督模型”的可靠性。AI Debate 则提出了用 AI 互相辩论来放大人类判断的方案。这三篇放在一起,是对“监督比我们聪明的系统”这一问题的三种切入。
第五幕:前沿与未来(第 12–13 周)
**第 12 周通读 Kimi K3 的完整技术报告。**这是一次“期末综合演练”:整个学期讲过的所有东西(架构(含 Kimi Linear 的线性注意力混合设计)、Muon 优化器、RLVR、对齐)都出现在同一份报告里,学生需要能把每个概念在真实工程决策中认出来。
**第 13 周以世界模型收尾:**V-JEPA 2(LeCun 一系的预测式世界模型)、DreamerV3(模型式 RL 的代表作)、GameNGen(用扩散模型复刻 DOOM 的“神经游戏引擎”)、Genie 3(DeepMind 的交互式世界生成)。这既是首尾呼应(MuZero 本质上就是一个学出来的世界模型)也是对课程的方向性判断:语言之上的下一层前沿,可能是学习世界动力学、支撑规划与具身智能的模型。
这份课程表透露了什么
1. RL 重新回到了舞台中央。 13 周里直接与 RL 相关的有 6 周(第 2、4、8、9、10、11 周),加上第 3 周的 RL 算力扩展律,接近一半。课程标题把三个词并列,但 RL 是把“语言模型”和“推理”连接起来的那个枢纽。这忠实反映了 2025 年以来领域重心的迁移:从“预训练的规模游戏”转向“后训练的推理游戏”。
2. 领域的节奏已经快于教科书周期。 除一周教材外全部是原始论文,且 2024–2026 年的工作占了很大比重(DeepSeek-V3、R1、Muon、Kimi、弱到强、推理模型监测)。想在 2026 年“达到前沿”,唯一的途径就是读一手文献,这门课本身就在示范这种学习方式。
3. 中国实验室的工作已成为正典的一部分。 DeepSeek(V3、R1、GRPO)和 Moonshot(Moonlight、Kimi k1.5、Kimi Linear、K3)合计出现在至少 5 周的核心阅读中。这客观记录了 2025 年以来开源前沿格局的真实变化。
4. 安全与对齐被组织成了一条完整的技术主线。 从过优化的定量规律,到奖励作弊的实证案例,到可扩展监督的理论方案,它被当作与架构、优化器平级的工程学科来讲,而不是道德附录。这与讲师在 OpenAI 超级对齐团队和 Anthropic 的经历直接相关,也代表了前沿实验室看待安全问题的方式:它是系统构建中的第一等约束。
5. 项目制、无考试,是研究训练的明确信号。 研讨课的形式(读论文、讨论)加上项目考核,指向的培养目标是能独立做研究的人,而非掌握固定知识体系的应试者。
谁适合学、怎么学
这门课没有列先修要求,但从内容看,实际需要:能熟练读懂 Transformer 论文的深度学习基础、扎实的线性代数与概率,最好有过亲手训练模型的经历。RL 不需要先修,第 2 周就是为此设计的。
给自学者的几条具体建议:
•第 2 周要舍得花时间。 Sutton & Barto 的 3–5 章加上 Spinning Up 的实践,是后面一切 RL 内容的通行证;PPO 的截断目标函数值得手推一遍,因为第 8、9 周会反复遇到它。
•GRPO 的推导(DeepSeekMath)建议动笔。 它是 PPO 的一种精巧简化,理解了“组内相对优势”这个技巧,才能明白推理 RL 为什么在工程上跑得通。
•读 R1 时对照第 4 周的 AlphaZero。 这两篇论文相隔七年,共享同一个骨架:可验证的终局奖励 + 对“推理轨迹”的搜索式探索。
•读第 10 周时留意一个贯穿全课的问题:奖励从哪来、什么时候可信。 预训练的交叉熵、RLHF 的学习型奖励、RLVR 的可验证奖励、以及弱到强场景下“监督者本身就是奖励信号”,这是贯穿整门课的隐秘主线。
•把最后的 Kimi K3 报告当作自我检验:如果读报告时能对每个技术决策问出“为什么这么做、替代方案是什么”,这门课的目标就达到了。
相似文章
@shao__meng: CMU 秋季最新课程 11-768: AI Agents 第 12 讲讲义公开:Reinforcement Learning Systems 主讲:@gneubig 课程:https://cmu-agents.com 讲义:https:/…
CMU 课程 11-768 AI Agents 第 12 讲讲义公开,主题为强化学习系统,讲解如何在多 GPU 集群上训练 LLM Agent 的 RL:训练与推理引擎的协同、KV/Prefix Caching、Weight Sync、Agentic RL 常见陷阱(序列扩展、chat template、TITO、sync vs async)及从单程序到云原生微服务的系统设计选型。
@shao__meng: https://x.com/shao__meng/status/2104096547747291584
台大李宏毅教授2026年春季机器学习课程更新,聚焦大模型时代的AI Agent与模型自我进化,标志着课程从经典机器学习向前沿大模型技术的彻底转型。
[Full Workshop] Reinforcement Learning, Kernels, Reasoning, Quantization & Agents — Daniel Han
Daniel Han 在 AI 工程师世界大会上深入讲解了强化学习、模型微调、量化与智能体的实战经验,回顾了从 Llama 到 DeepSeek R1 的开源模型演进,并剖析了现代模型训练的五个关键阶段。
@tanzhengmc97: https://x.com/tanzhengmc97/status/2066531753762656730
用通俗易懂的语言解释了大模型的运行原理,包括词向量、Transformer注意力机制、下一个词预测训练以及涌现能力,适合初学者理解AI基础概念。
@FinanceYF5: 今晚少看一部剧,把这堂2小时34分钟的Stanford课程看完。 它从Tokenization、BPE一路讲到Transformer、预训练、RLHF、DPO和逐Token生成,完整拆解ChatGPT、Claude这类大模型是如何构建出来…
推荐斯坦福大学的一门AI课程,详细讲解大语言模型的构建原理,包括Tokenization、BPE、Transformer、预训练、RLHF和DPO。