[Full Workshop] Reinforcement Learning, Kernels, Reasoning, Quantization & Agents — Daniel Han

YouTube AI Channels 事件

摘要

Daniel Han 在 AI 工程师世界大会上深入讲解了强化学习、模型微调、量化与智能体的实战经验,回顾了从 Llama 到 DeepSeek R1 的开源模型演进,并剖析了现代模型训练的五个关键阶段。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/06/25 13:32

### TL;DR Daniel Han 在 AI 工程师世界大会上分享了强化学习、微调、量化与智能体的实战经验,回顾了从 Llama 到 DeepSeek R1 的开源模型演进,并剖析了模型训练的几个关键阶段(预训练、中期训练、监督微调、后训练与 RLVR)。 ## 演讲团队与背景 Daniel 首先介绍自己与团队的工作:通过推特分享 AI 前沿动态,去年修复了梯度累积 bug,引入了异步卸载梯度检查点。他们还与 Hugging Face、Google、Meta、Mistral 等团队合作,修复 Gemma、Llama、Mixtral 等开源模型中的 bug,并贡献了 Llama CBP、Qwen、Mistral 等项目的代码。团队在 Hugging Face 上每月下载量突破 1000 万,GitHub 包获得 4 万星,核心目标是让微调更快、内存更少。他们还提供免费的 Colab 和 Kaggle 笔记本(利用 Google 免费 GPU 和 Kaggle 每周 30 小时 GPU),并上传经过修复的量化模型(如 1.58 比特 DC R10528),可在低 VRAM 设备上运行。 ## 开源模型的演进 ### 从 Llama 开始的历史 - **Llama 1**:Meta 最初仅作为研究论文发布,权重被泄露,催生了开源运动。Llama 1 只训练了 1.4 万亿 token(远少于现在模型 10 倍以上)。训练损失与模型规模的关系:模型越大损失越低(70B 蓝线、650B 红线)。微调时正常损失应在 2–3 左右。 - **当前规模**:Google Gemma 3 在 14 万亿 token 上训练,Llama 4 在 30 万亿 token 上训练,比 Llama 1 多 10–30 倍。 ### 开源 vs 闭源:两次“干旱” Daniel 引用 Maxime 的图,显示开源模型在 MMLU(5-shot)上斜率比闭源模型陡,最终在 Llama 3.1 405B 时达到 GPT-4 水平。但随后出现两次“干旱”: 1. **第一次干旱(2022.12)**:ChatGPT 发布,开源模型在指令遵循和 RLHF 上落后,直到 Llama 1 才逐渐赶上。 2. **第二次干旱(2024.9)**:o1 预览版引入推理链,能力跃升;开源社区四个月内无法复制,直到 DeepSeek R1 发布(2025.1)才打破僵局。 Daniel 认为,每次闭源模型都做出阶跃函数(SFT/RLHF 跳跃 → RL 跳跃),但下一次跳跃未知。Yann LeCun 的蛋糕图(无监督学习 → 监督微调 → 强化学习)虽然来自 2016 年,但至今仍是核心框架。 ## 基座模型与微调阶段 所有大型模型都从基座模型开始(如 ChatGPT 的基座模型从未公开),然后通过微调变成聊天模型。开源模型的命名规则不统一(如 Gemma 3 PT/IT、Llama 4 Instruct、Qwen 3 Base/无后缀),Daniel 呼吁标准化。 ### 现代训练阶段的划分 Daniel 提出一个更新后的阶段模型: - **预训练**:使用所有网页、维基等数据,预测下一个词。 - **中期训练**(Interm Training):给高质量数据更高权重(如维基百科),也可扩展长上下文。 - **监督微调(SFT / 指令微调)**:将基座模型转换为聊天模型。 - **后训练**:偏好微调(DPO)、RLHF 等。 - **强化微调(RLVR)**:基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Reward),不同于传统偏好微调,直接利用奖励函数改进模型。 他强调,模型的训练是从随机初始化权重开始,通过上述阶段逐步提升能力。 ## 结语与互动 Daniel 在演讲中鼓励听众提问,并承诺回答所有问题。他提醒受众利用免费 GPU 资源,持续关注团队发布的修复模型,因为模型 bug 可能影响 10% 的准确率。 --- *Source: [Full Workshop] Reinforcement Learning, Kernels, Reasoning, Quantization & Agents — Daniel Han* (https://www.youtube.com/watch?v=OkEGJ5G3foU)

相似文章

@shao__meng: CMU 秋季最新课程 11-768: AI Agents 第 12 讲讲义公开:Reinforcement Learning Systems 主讲:@gneubig 课程:https://cmu-agents.com 讲义:https:/…

X AI KOLs Timeline

CMU 课程 11-768 AI Agents 第 12 讲讲义公开,主题为强化学习系统,讲解如何在多 GPU 集群上训练 LLM Agent 的 RL:训练与推理引擎的协同、KV/Prefix Caching、Weight Sync、Agentic RL 常见陷阱(序列扩展、chat template、TITO、sync vs async)及从单程序到云原生微服务的系统设计选型。

@shao__meng: https://x.com/shao__meng/status/2106715778078974378

X AI KOLs Timeline

NYU 2026 秋季研究生研讨课《Language Models, Reinforcement Learning, Reasoning》以 13 周课程串联从 Transformer 到世界模型的前沿,覆盖预训练扩展律、RLVR/GRPO 后训练、对齐安全与 Kimi K3 等真实工程实践,讲师 Pavel Izmailov 来自 Anthropic 并曾参与 OpenAI o1 与超级对齐团队。

@Michaelzsguo: 这是我最近看到的关于强化学习基础,以及它和现代 AI 关系的最好深度讨论之一。 Eric Jang 和 Dwarkesh 把一个看起来有点复古的练习,也就是用今天的工具重新构建 AlphaGo,变成了一堂非常清晰的大师课:为什么“搜索 +…

X AI KOLs Timeline

A detailed discussion on reinforcement learning and its connection to modern AI, using the reconstruction of AlphaGo with modern tools as a clear example of search and self-play. Key takeaways include neural network amortization of search, credit assignment challenges in LLMs vs AlphaGo, and implications for automated research.

@dair_ai: https://x.com/dair_ai/status/2053495521243799717

X AI KOLs Following

DAIR AI 的每周精选汇总了多项重磅研究论文,包括通过内化并行推理提升模型性能的 HeavySkill,以及利用强化学习优化智能体编排的 Sakana AI Conductor。此外,还涵盖了 Meta FAIR 关于自我改进预训练的研究工作。