asynchronous-rl

标签

Cards List
#asynchronous-rl

@VukRosic99: GLM 5.2 是如何训练的?清华异步强化学习论文解读——该论文用单次展开异步训练取代 GRPO 的等待全部展开批次的方法。

X AI KOLs Timeline · 2026-07-11 缓存

这篇来自清华大学的论文提出了单次展开异步优化 (SAO, Single-rollout Asynchronous Optimization),用于大语言模型的强化学习后训练。SAO 用单次展开异步训练取代了基于批次的 GRPO,以减少 GPU 空闲时间并提高稳定性。该技术被用于训练 GLM-5.2 模型(750B-A40B),在智能体编程和推理基准测试上取得了最先进的结果。

0 人收藏 0 人点赞
#asynchronous-rl

Z.ai的稳定异步强化学习(13分钟阅读)

TLDR AI · 2026-07-10 缓存

本文介绍了单rollout异步优化(SAO)技术,用于解决LLM后训练中异步RL的稳定性和异策略挑战,并证明SAO在智能体编码和推理基准测试上持续优于GRPO。

0 人收藏 0 人点赞
#asynchronous-rl

@Chengxing_Xie: 清华大学引入了SAO算法,旨在解决异步强化学习中的离策略漂移和稳定性挑战……

X AI KOLs Timeline · 2026-07-09 缓存

清华大学的SAO算法解决了大规模语言模型异步强化学习中的稳定性和离策略漂移问题,在智能体编程和推理基准测试上相比GRPO取得了稳定提升,并用于训练GLM-5.2模型。

0 人收藏 0 人点赞
#asynchronous-rl

@eliebakouch: 在GLM-5上进行强化学习所需了解的所有基础设施内容 https://primeintellect.ai/blog/rl-at-1t-scale…

X AI KOLs Timeline · 2026-06-23 缓存

Prime Intellect发布了prime-rl v0.6.0,支持在万亿参数规模的大型Mixture-of-Experts模型上进行高效强化学习,实现低于5分钟的步骤时间,并对异步强化学习进行了优化。

0 人收藏 0 人点赞
#asynchronous-rl

@vivek_2332: 新博客:异步强化学习中的权重同步。权重同步最近变得快得多,即使在前沿模型上也低于2秒…

X AI KOLs Timeline · 2026-06-18 缓存

一篇探讨异步强化学习中权重同步技术的博客文章,涵盖了不同框架下传输和负载的权衡。

0 人收藏 0 人点赞
#asynchronous-rl

@_djdumpling: Luke 是在 RL 基础设施方面最出色的人之一,绝对值得一读!

X AI KOLs Timeline · 2026-06-01 缓存

Luke J. Huang 的新博客文章调研了异步强化学习理论与基础设施,涵盖 8 家开放权重前沿实验室,并讨论了算法技术以及针对训练-推理不匹配的系统修复方案。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈