@natolambert: 新播客与@finbarrtimbers!我们盘点最新的后训练配方,从GLM 5.1、Kimi K2.6、DeepSeek V4、Xia…
摘要
Nathan Lambert和Finbarr Timbers讨论了大型语言模型的最新后训练配方,包括DeepSeek V4、GLM 5.1、Kimi K2.6,以及行业向多教师在线策略蒸馏的转变。
查看缓存全文
缓存时间: 2026/06/17 01:44
与 @finbarrtimbers 的新播客!我们全面回顾了最新的后训练方案,涵盖 GLM 5.1、Kimi K2.6、DeepSeek V4、小米 MiMo V2.5、Nemotron Ultra 等,并讨论了:
- 行业为何逐渐转向多教师同策略蒸馏(MOPD)
- Olmo 风格方案在哪些方面需要改进
- 后训练如何运作 / 如何适应更大的组织级工作
- 在奇点山麓时期的职业建议
- 以及其他话题
听说大家希望我开始做这个,所以趁我处于“失业空窗期”时挤了些时间!
章节:
00:00 开场与 Olmo 反思 06:28 后训练方案回顾(历史历程) 23:00 2026 年的模型方案(MiMo Flash、DeepSeek V4、GLM 5、Kimi K2.6 等) 39:05 开放式后训练讨论 48:22 大模型竞赛中的职业建议
链接见下方,请关注 @interconnectsai,点赞、订阅,再顺便买本我的书?
相似文章
@natolambert: 又一场快速讲座——很多人多次问过我关于我书籍的前置知识和应该了解的内容,所以我制作了一个小讲座…
Nathan Lambert 分享了一段视频讲座,涵盖了他书籍的前置知识,包括语言模型基础、概率和训练流程,使用 GLM 5.2 进行讲解。
DeepSeek 0813 “Pro” vs GLM 5.2 和 Kimi K3 🐋
DeepSeek 0813 “Pro” 与 GLM 5.2 和 Kimi K3 的对比,可能涵盖这些 AI 模型的基准性能和能力差异。
@latentspacepod: 在本期节目中,@OpenAI 首席研究官 @markchen90 与 @allenpark 一起制作火焰虾、煮韩式炖菜,并聊……
Latent Space 播客邀请 OpenAI 首席研究官 Mark Chen,在烹饪过程中讨论扩展定律、预训练、评估危机以及 OpenAI 的研究路线图。
@adithya_s_k: [必读] 我不知道这怎么会逃过我的注意。这可能是最好的开源端到端后训练…
一个开源的端到端后训练配方,涵盖SFT、RL和测试时扩展,包括模型、数据集和代码。
@cjzafir: 我日常使用的模型:> Codex 5.5 high (fast) > Deepseek v4 pro via API > Kimi 2.6 via API 我正在微调的模型...
用户分享了一份日常使用的AI模型列表(Codex 5.5、Deepseek v4 pro、Kimi 2.6)以及用于微调的模型(Qwen 3.5系列、Gemma4 E4B、GPT-oss 20B),目标是微调小型语言模型(SLM)成为专家语言模型(ELM)。