@yuwen_lu_: 看了一半,我靠怎么从来没人告诉我rl这么好玩
摘要
Sanbu 散步发布了现代RL教程Hands-On Modern RL,涵盖从CartPole+PPO入门到LLM后训练(RLHF、DPO、GRPO)和Agentic RL,代码先行,英文版即将更新。
查看缓存全文
缓存时间: 2026/05/31 07:03
看了一半,我靠怎么从来没人告诉我rl这么好玩
Sanbu 散步 (@sanbuphy): 花了段时间写了 RL 教程 Hands-On Modern RL,路线是从 CartPole + PPO 入门,然后到 LLM 后训练(RLHF、DPO、GRPO)、Agentic RL。代码先行,公式用来解释现象。英文版很快更新。 目前是草稿版本,RLHF、Agentic RL 部分本地审校中。 欢迎提 PR 或 Issue & 显卡支持:
相似文章
@sheriyuo: 大家期待已久的 Hands-on Modern RL 教程终于以英文PDF形式提供下载链接:https://github.com/walkinglabs/hands-on-modern-rl/releases/tag/v0.1.5…
一门开源、动手实践的现代强化学习课程,内容涵盖从经典控制到LLM后训练、RLHF、DPO、GRPO以及agentic RL,现提供免费英文PDF下载。
@qingke_ai: https://x.com/qingke_ai/status/2071281892964659384
该文章由ROLL团队分享了在终端环境中进行Agentic RL训练时的实践经验,包括环境管理器设计、异步训练管线以及多种模式切换,并对比了RLVR与Agentic RL的本质区别。
@Phoenixyin13: 强烈Recommend这个RL面试问题合集! @sheriyuo 整理的35道RL benchmark,Algorithm+Infrastructure全覆盖,从PPO、GRPO的clip、KL penalty、advantage计算,到…
推荐一个由@sheriyuo整理的RL面试问题合集,覆盖PPO、GRPO、MoE、vLLM等算法与基础设施,适合准备LLM RL方向面试与研究者。
@duange6099: 如果你最近也想入门 Claude Code, 下面这份资源合集我觉得很值得收藏,也欢迎大家来讨论使用心得,一起学习。 1、中文最全教程(推荐先看) 从安装到实战项目都讲了 https://github.com/shareAI-lab/le…
一位推特用户分享了一份精心整理的 Claude Code 学习资源合集,包含中文教程、命令技巧、技能库等,方便初学者入门。
@chengyongru: 我当时刚开始学RL的时候, 看的是赵世钰老师的Mathematical Foundations of Reinforcement Learning,我觉得也是一套非常不错的入门教程 github链接: https://github.com…
A tweet recommends the book 'Mathematical Foundations of Reinforcement Learning' by Shiyu Zhao, providing a GitHub link to the book's source code and slides.