rl-framework

标签

Cards List
#rl-framework

@sgl_project:SGLang很荣幸能成为Miles的原生rollout引擎。我们致力于让token持续流转,让GPU保持忙碌状态...

X AI KOLs Timeline · 2026-08-18 缓存

SGLang正式宣布成为Miles v0.1的原生rollout引擎。Miles是一个针对大语言模型与多模态模型的开源强化学习框架,旨在提升大规模强化学习训练中的吞吐量、缓存效率与稳定性。

0 人收藏 0 人点赞
#rl-framework

@samsja19:我们在 prime rl 中花了大量时间设计优雅的算法 API,既富有表现力又可扩展,同时不牺牲性能……

X AI KOLs Following · 2026-07-06 缓存

Prime-rl 增加了一个一级算法层,内置六种 RL 算法(GRPO、MaxRL、OPD、OPSD、SFT、ECHO),使得通过单个文件实现自定义算法变得更加容易。

0 人收藏 0 人点赞
#rl-framework

@didier_lopes: 难以置信,Z. ai 竟然将其强化学习基础设施开源了。GLM-5.2 的整个 OPD 后训练只用了…

X AI KOLs Following · 2026-06-19 缓存

Z. ai 将其强化学习基础设施 slime 框架开源,该框架使 GLM-5.2 的 OPD 后训练在约两天内高效完成。slime 是一个用于强化学习扩展的 LLM 后训练框架,集成了 Megatron 和 SGLang,并已通过 GLM、Qwen、DeepSeek 和 Llama 等前沿模型的实战测试。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈