radixark/miles
摘要
Miles 是一个企业级强化学习框架,专为大规模模型后训练设计,特点是通过 SGLang 实现高性能 rollout,并借助 Megatron-LM 提供可扩展训练能力。
查看缓存全文
缓存时间: 2026/09/04 11:51
radixark/miles 来源:https://github.com/radixark/miles
面向大规模模型后训练的企业级强化学习框架
网站 (https://miles.radixark.com/) | GitHub仓库 (https://github.com/radixark/miles) | 文档 (https://miles.radixark.com/docs) | 许可证 | Slack (https://slack.sglang.ai)
网站 (https://miles.radixark.com/) | 文档 (https://miles.radixark.com/docs) | 快速入门 (https://miles.radixark.com/docs/getting-started/quick-start) | 支持模型 (https://miles.radixark.com/docs/models) | Miles Diffusion (https://github.com/radixark/miles_diffusion) | 博客 (https://www.lmsys.org/blog?filter=miles) | Slack (https://slack.sglang.ai) (#miles-rl) |
动态更新
- [2026/08] 🔥 Miles v0.1 发布!阅读博文了解详情:Miles v0.1:生产级模型后训练。
- [2026/07] 面向 Blackwell 原生 8 位与 4 位 RL:在 Miles 中实现端到端 MXFP8 和 NVFP4 强化学习训练(博文)。
- [2026/07] 🔥 SGLang 与 Miles 首日支持 Kimi K3 模型(博文)。
- [2026/07] 在线策略蒸馏功能现已集成至 Miles(博文)。
- [2026/07] 🔥 SGLang 与 Miles 馾日支持前沿多模态模型 Inkling(博文)。
- [2026/07] DeepSeek-V4 Flash RL 训练现已支持 AMD Instinct MI355X(博文)。
- [2026/06] SGLang 与 Miles 首日支持 NVIDIA Nemotron 3 Ultra(博文)。
- [2026/05] 确保每个 token 都不被遗漏:Miles 中的 token-in-token-out 机制(博文)。
- [2026/04] 秒级更新万亿参数:大规模分布式 RL 中的 P2P 权重传输(博文)。
- [2026/04] 🔥 DeepSeek-V4 首日支持:通过 SGLang 与 Miles 实现从快速推理到验证型强化学习(博文)。
关于
Miles 是一个高性能、企业就绪的强化学习框架,专为大规模模型后训练设计。它结合了 SGLang (https://github.com/sgl-project/sglang) 的高吞吐量采样与 Megatron-LM (https://github.com/NVIDIA/Megatron-LM) 的可扩展训练,并提供了 RL 训练在万亿参数规模下所需的精度、稳定性和可观测性特性。
对于更倾向于直接使用 HuggingFace 实现进行训练的场景,也可选择 PyTorch FSDP2 后端。不过,最佳实践、并行策略以及最大规模模型均基于 Megatron-LM 构建。
请参阅训练后端。
“千里之行,始于一次采样。”
性能
- 完全异步 RL。 采样与训练工作节点解耦,支持可配置的在线与离线策略调度、优化的流水线以减少气泡,并提供可自定义的异步采样与评估模式。详见完全异步 RL。
- 快速智能体采样。 基于 SGLang (https://github.com/sgl-project/sglang) 的生成过程通过路由器分发请求,支持跨引擎负载均衡、保留每请求元数据,并对整个集群进行健康检查,针对多轮智能体工作负载进行优化。
- 快速权重更新。 即使在 Kimi-K2.6 等万亿参数模型上,新权重也能在数秒内同步至引擎。对于分布式部署,P2P RDMA (https://miles.radixark.com/docs/advanced/p2p-weight-transfer) 作为快速路径支持权重传输。
- 低精度训练。 支持 MXFP8 和 NVFP4 (https://miles.radixark.com/docs/advanced/low-precision) 训练,并采用数值稳定的 RL 配方以减少精度损失导致的训练发散。同时支持 FP8、INT4 QAT (https://miles.radixark.com/docs/advanced/int4-qat)、BF16 和 FP16。
- LoRA 与多 LoRA。 低秩适配器 (https://miles.radixark.com/docs/advanced/lora) 允许在部分 GPU 上训练前沿规模模型,且这些适配器可直接加载到 SGLang 中进行采样。
正确性与鲁棒性
- Token-in-token-out (TITO)。 适用于所有模型和所有黑盒测试环境 (https://miles.radixark.com/docs/user-guide/agentic-rollout),采样与训练之间无需解码/再编码的往返转换。
- 采样路由回放 (R3)。 在采样阶段记录的专家路由信息将在训练器的前向传播中回放 (https://miles.radixark.com/docs/advanced/miles-router),消除了可能导致大规模训练不稳定的 MoE 路由失配问题,并通过计算与通信重叠降低开销。
- 容错性。 当 SGLang 引擎意外终止时,Miles 会自动恢复该引擎并继续运行 (https://miles.radixark.com/docs/advanced/fault-tolerance):无需重启或暂停。
Miles 支持范围
- 首日模型支持。 DeepSeek-V4、Kimi-K3、GLM-5.2、Inkling 和 Nemotron 在发布当天即获得支持。在首日支持之外,几乎所有前沿模型均可在 Miles 上运行,包括 Kimi-K2.6 和 Qwen3.5。详见支持模型。
- 广泛的硬件支持。 支持 NVIDIA GB300、GB200、B300、B200、H200、H100 和 A100,以及通过 ROCm 支持的 AMD MI300X、MI325、MI350 和 MI355X。请参阅安装指南 了解各 GPU 状态及对应的容器镜像。
- 丰富的算法配方支持。 提供用于 RL 的 GRPO、GSPO、PPO 和 REINFORCE++,以及 SFT 和在线策略蒸馏 (https://miles.radixark.com/docs/advanced/on-policy-distillation)。
- 智能体环境。 通过集成 Harbor、HUD、NeMo Gym、OpenEnv、Verifiers 等连接器来训练编码和计算机使用智能体,并支持 AgentENV、Daytona、E2B 或 Modal 作为任务沙箱。详见智能体环境。
- 扩散模型。 在 Miles-diffusion (https://github.com/radixark/miles_diffusion) 中,基于 sglang-diffusion 采样引擎和 FSDP2 训练器,支持 Flow-GRPO、DiffusionNFT 和 SFT。
开始使用
致谢
Miles 分支自 slime (https://github.com/THUDM/slime),并集成了 SGLang (https://github.com/sgl-project/sglang)、Megatron-LM (https://github.com/NVIDIA/Megatron-LM) 和 torch_memory_saver (https://github.com/fzyzcjy/torch_memory_saver)。
Miles 的发展离不开众多团队的支持,涵盖硬件、云服务、模型实验室、智能体基础设施和学术界:
引用
如果 Miles 对您的研究或产品有所帮助,请引用:
@misc{miles2026,
title = {Miles: Enterprise-Grade Reinforcement Learning for Large-Scale Model Post-Training},
author = {Miles Team},
year = {2026},
howpublished = {\url{https://github.com/radixark/miles}}
}
相似文章
@PyTorch: 基于PyTorch、Ray、SGLang和NVIDIA Megatron-LM构建,Miles是RadixArk推出的一个用于大规模……的开源框架
Miles是RadixArk推出的一个开源框架,用于大规模LLM强化学习后训练,集成了PyTorch、Ray、SGLang和NVIDIA Megatron-LM,支持MoE、低精度和容错。
Miles:用于大规模LLM强化学习后训练的PyTorch原生栈(14分钟阅读)
Miles是RadixArk推出的一个开源的PyTorch原生框架,用于大规模LLM强化学习后训练,集成了SGLang、Megatron-LM和Ray,以实现高吞吐量的推演和分布式训练。
@MiniMax_AI:祝贺我们的长期合作伙伴SGLang/RadixArk发布Miles v0.1!从M系列到H3和Music 3,我们一直……
RadixArk发布Miles v0.1,这是一个开源强化学习框架,专为大型语言模型和多模态模型设计,旨在简化和扩展强化学习训练。
Miles v0.1:生产级后训练
Miles v0.1 是一个开源、生产就绪的系统,用于大规模强化学习和后训练,支持多种后端和模型,如 GLM-5.2,重点关注可扩展性和可访问性。
Miles v0.1: 生产级后训练 (阅读约20分钟)
Miles v0.1 是一个生产就绪的系统,用于前沿后训练,通过SGLang优化完全异步的强化学习循环和智能体展开。