[Full Workshop] Reinforcement Learning, Kernels, Reasoning, Quantization & Agents — Daniel Han
摘要
Daniel Han 在 AI 工程师世界大会上深入讲解了强化学习、模型微调、量化与智能体的实战经验,回顾了从 Llama 到 DeepSeek R1 的开源模型演进,并剖析了现代模型训练的五个关键阶段。
查看缓存全文
缓存时间: 2026/06/25 13:32
相似文章
@danielhanchen: I’m running a 3 hour advanced workshop at AI Engineer World’s Fair! 2026 has greatly changed how one should learn lower…
Daniel Han 在 AI Engineer World's Fair 上举办长达3小时的高级工作坊,分享了对开源大模型历史、训练阶段分类(预训练、中期训练、监督微调、后训练、强化微调)以及推理模型跃升的见解,并介绍了其团队在微调优化方面的开源贡献。
@shao__meng: CMU 秋季最新课程 11-768: AI Agents 第 12 讲讲义公开:Reinforcement Learning Systems 主讲:@gneubig 课程:https://cmu-agents.com 讲义:https:/…
CMU 课程 11-768 AI Agents 第 12 讲讲义公开,主题为强化学习系统,讲解如何在多 GPU 集群上训练 LLM Agent 的 RL:训练与推理引擎的协同、KV/Prefix Caching、Weight Sync、Agentic RL 常见陷阱(序列扩展、chat template、TITO、sync vs async)及从单程序到云原生微服务的系统设计选型。
@shao__meng: https://x.com/shao__meng/status/2106715778078974378
NYU 2026 秋季研究生研讨课《Language Models, Reinforcement Learning, Reasoning》以 13 周课程串联从 Transformer 到世界模型的前沿,覆盖预训练扩展律、RLVR/GRPO 后训练、对齐安全与 Kimi K3 等真实工程实践,讲师 Pavel Izmailov 来自 Anthropic 并曾参与 OpenAI o1 与超级对齐团队。
@Michaelzsguo: 这是我最近看到的关于强化学习基础,以及它和现代 AI 关系的最好深度讨论之一。 Eric Jang 和 Dwarkesh 把一个看起来有点复古的练习,也就是用今天的工具重新构建 AlphaGo,变成了一堂非常清晰的大师课:为什么“搜索 +…
A detailed discussion on reinforcement learning and its connection to modern AI, using the reconstruction of AlphaGo with modern tools as a clear example of search and self-play. Key takeaways include neural network amortization of search, credit assignment challenges in LLMs vs AlphaGo, and implications for automated research.
@dair_ai: https://x.com/dair_ai/status/2053495521243799717
DAIR AI 的每周精选汇总了多项重磅研究论文,包括通过内化并行推理提升模型性能的 HeavySkill,以及利用强化学习优化智能体编排的 Sakana AI Conductor。此外,还涵盖了 Meta FAIR 关于自我改进预训练的研究工作。