标签
SGLang正式宣布成为Miles v0.1的原生rollout引擎。Miles是一个针对大语言模型与多模态模型的开源强化学习框架,旨在提升大规模强化学习训练中的吞吐量、缓存效率与稳定性。
Prime-rl 增加了一个一级算法层,内置六种 RL 算法(GRPO、MaxRL、OPD、OPSD、SFT、ECHO),使得通过单个文件实现自定义算法变得更加容易。
Z. ai 将其强化学习基础设施 slime 框架开源,该框架使 GLM-5.2 的 OPD 后训练在约两天内高效完成。slime 是一个用于强化学习扩展的 LLM 后训练框架,集成了 Megatron 和 SGLang,并已通过 GLM、Qwen、DeepSeek 和 Llama 等前沿模型的实战测试。