@ethayarajh: 我最近做了一场讲座,向年轻经济学家介绍后训练。幻灯片现在已上线!https://kawine.github.io/a…

X AI KOLs Timeline 新闻

摘要

一场向年轻经济学家介绍AI后训练的讲座,讨论了SFT、DPO等方法以及世界适应的未来挑战。

我最近做了一场讲座,向年轻经济学家介绍后训练。 幻灯片现在已上线!https://kawine.github.io/assets/aiesi_post-training_public.pdf… 不仅训练自己的模型比以往任何时候都更可行,而且经济学家和其他社会科学家可以在后训练的新时代发挥重要作用。 后训练套件大致如下: 1) SFT 2) 离线方法 (DPO/KTO/SimPO/等) 3) 在线方法 (PPO/GRPO/CISPO/等) 4) 强化学习环境 5) 蒸馏 (<--- 我们在这里) 6) 世界适应 (<--- 未来) 随着代理在现实世界中部署,现实世界将适应它们。这种适应在当前后训练范式中很大程度上被忽视,因为从静态环境中处理可验证奖励要简单得多且可扩展。然而,正如我们在OpenAI-Huggingface事件中所见,我们不应假设现实世界会保持不变——实际上恰恰相反。因此: 1. 我们如何在训练期间预测现实世界的适应? 2. 在这些场景中,均衡状态是什么样子的,如果存在的话? 3. 可以创建哪些工具来扩大人类监督? 许多这样的问题层出不穷,如果你是经济学家,这些都是值得研究的高影响力问题。
查看原文
查看缓存全文

缓存时间: 2026/08/23 03:32

我最近做了个演讲,向年轻经济学家介绍后训练(post-training)。幻灯片现已公开!https://kawine.github.io/assets/aiesi_post-training_public.pdf…

如今训练自己的模型比以往任何时候都更容易实现,而经济学家和其他社会科学家可以在后训练的新时代扮演重要角色。后训练技术套件大致包括:

  1. 监督微调(SFT)
  2. 离线方法(DPO/KTO/SimPO等)
  3. 在线方法(PPO/GRPO/CISPO等)
  4. 强化学习环境
  5. 蒸馏(<— 我们目前在此阶段)
  6. 世界适应(<— 未来方向)

随着智能体在真实世界中部署,现实世界本身也将随之适应。这种适应过程在当前后训练范式中很大程度上被忽视了,因为处理静态环境中的可验证奖励要简单得多,且更具可扩展性。然而,正如我们从 OpenAI-Huggingface 事件中看到的,我们不应假设现实世界会保持不变——事实恰恰相反。

因此:

  1. 如何在后训练过程中预见现实世界的适应?
  2. 在这些情景下,均衡会是什么样子——如果存在均衡的话?
  3. 可以创建哪些工具来扩展人类监督?

诸如此类的问题比比皆是。如果你是经济学家,这些都是值得研究、具有重大影响力的问题。


来源: https://kawine.github.io/assets/aiesi_post-training_public.pdf

相似文章