radixark/miles

GitHub Trending (daily) 工具

摘要

Miles 是一个企业级强化学习框架,专为大规模模型后训练设计,特点是通过 SGLang 实现高性能 rollout,并借助 Megatron-LM 提供可扩展训练能力。

Miles 是一个企业级强化学习框架,用于 LLM 和 VLM 的后训练,从 slime 分叉并与之共同演化。
查看原文
查看缓存全文

缓存时间: 2026/09/04 11:51

radixark/miles 来源:https://github.com/radixark/miles

面向大规模模型后训练的企业级强化学习框架

网站 (https://miles.radixark.com/) | GitHub仓库 (https://github.com/radixark/miles) | 文档 (https://miles.radixark.com/docs) | 许可证 | Slack (https://slack.sglang.ai)
网站 (https://miles.radixark.com/) | 文档 (https://miles.radixark.com/docs) | 快速入门 (https://miles.radixark.com/docs/getting-started/quick-start) | 支持模型 (https://miles.radixark.com/docs/models) | Miles Diffusion (https://github.com/radixark/miles_diffusion) | 博客 (https://www.lmsys.org/blog?filter=miles) | Slack (https://slack.sglang.ai) (#miles-rl) |


动态更新

  • [2026/08] 🔥 Miles v0.1 发布!阅读博文了解详情:Miles v0.1:生产级模型后训练。
  • [2026/07] 面向 Blackwell 原生 8 位与 4 位 RL:在 Miles 中实现端到端 MXFP8 和 NVFP4 强化学习训练(博文)。
  • [2026/07] 🔥 SGLang 与 Miles 首日支持 Kimi K3 模型(博文)。
  • [2026/07] 在线策略蒸馏功能现已集成至 Miles(博文)。
  • [2026/07] 🔥 SGLang 与 Miles 馾日支持前沿多模态模型 Inkling(博文)。
  • [2026/07] DeepSeek-V4 Flash RL 训练现已支持 AMD Instinct MI355X(博文)。
  • [2026/06] SGLang 与 Miles 首日支持 NVIDIA Nemotron 3 Ultra(博文)。
  • [2026/05] 确保每个 token 都不被遗漏:Miles 中的 token-in-token-out 机制(博文)。
  • [2026/04] 秒级更新万亿参数:大规模分布式 RL 中的 P2P 权重传输(博文)。
  • [2026/04] 🔥 DeepSeek-V4 首日支持:通过 SGLang 与 Miles 实现从快速推理到验证型强化学习(博文)。

关于

Miles 是一个高性能、企业就绪的强化学习框架,专为大规模模型后训练设计。它结合了 SGLang (https://github.com/sgl-project/sglang) 的高吞吐量采样与 Megatron-LM (https://github.com/NVIDIA/Megatron-LM) 的可扩展训练,并提供了 RL 训练在万亿参数规模下所需的精度、稳定性和可观测性特性。
对于更倾向于直接使用 HuggingFace 实现进行训练的场景,也可选择 PyTorch FSDP2 后端。不过,最佳实践、并行策略以及最大规模模型均基于 Megatron-LM 构建。
请参阅训练后端。

“千里之行,始于一次采样。”

性能

  • 完全异步 RL。 采样与训练工作节点解耦,支持可配置的在线与离线策略调度、优化的流水线以减少气泡,并提供可自定义的异步采样与评估模式。详见完全异步 RL。
  • 快速智能体采样。 基于 SGLang (https://github.com/sgl-project/sglang) 的生成过程通过路由器分发请求,支持跨引擎负载均衡、保留每请求元数据,并对整个集群进行健康检查,针对多轮智能体工作负载进行优化。
  • 快速权重更新。 即使在 Kimi-K2.6 等万亿参数模型上,新权重也能在数秒内同步至引擎。对于分布式部署,P2P RDMA (https://miles.radixark.com/docs/advanced/p2p-weight-transfer) 作为快速路径支持权重传输。
  • 低精度训练。 支持 MXFP8 和 NVFP4 (https://miles.radixark.com/docs/advanced/low-precision) 训练,并采用数值稳定的 RL 配方以减少精度损失导致的训练发散。同时支持 FP8、INT4 QAT (https://miles.radixark.com/docs/advanced/int4-qat)、BF16 和 FP16。
  • LoRA 与多 LoRA。 低秩适配器 (https://miles.radixark.com/docs/advanced/lora) 允许在部分 GPU 上训练前沿规模模型,且这些适配器可直接加载到 SGLang 中进行采样。

正确性与鲁棒性

  • Token-in-token-out (TITO)。 适用于所有模型和所有黑盒测试环境 (https://miles.radixark.com/docs/user-guide/agentic-rollout),采样与训练之间无需解码/再编码的往返转换。
  • 采样路由回放 (R3)。 在采样阶段记录的专家路由信息将在训练器的前向传播中回放 (https://miles.radixark.com/docs/advanced/miles-router),消除了可能导致大规模训练不稳定的 MoE 路由失配问题,并通过计算与通信重叠降低开销。
  • 容错性。 当 SGLang 引擎意外终止时,Miles 会自动恢复该引擎并继续运行 (https://miles.radixark.com/docs/advanced/fault-tolerance):无需重启或暂停。

Miles 支持范围

  • 首日模型支持。 DeepSeek-V4、Kimi-K3、GLM-5.2、Inkling 和 Nemotron 在发布当天即获得支持。在首日支持之外,几乎所有前沿模型均可在 Miles 上运行,包括 Kimi-K2.6 和 Qwen3.5。详见支持模型。
  • 广泛的硬件支持。 支持 NVIDIA GB300、GB200、B300、B200、H200、H100 和 A100,以及通过 ROCm 支持的 AMD MI300X、MI325、MI350 和 MI355X。请参阅安装指南 了解各 GPU 状态及对应的容器镜像。
  • 丰富的算法配方支持。 提供用于 RL 的 GRPO、GSPO、PPO 和 REINFORCE++,以及 SFT 和在线策略蒸馏 (https://miles.radixark.com/docs/advanced/on-policy-distillation)。
  • 智能体环境。 通过集成 Harbor、HUD、NeMo Gym、OpenEnv、Verifiers 等连接器来训练编码和计算机使用智能体,并支持 AgentENV、Daytona、E2B 或 Modal 作为任务沙箱。详见智能体环境。
  • 扩散模型。 在 Miles-diffusion (https://github.com/radixark/miles_diffusion) 中,基于 sglang-diffusion 采样引擎和 FSDP2 训练器,支持 Flow-GRPO、DiffusionNFT 和 SFT。

开始使用

致谢

Miles 分支自 slime (https://github.com/THUDM/slime),并集成了 SGLang (https://github.com/sgl-project/sglang)、Megatron-LM (https://github.com/NVIDIA/Megatron-LM) 和 torch_memory_saver (https://github.com/fzyzcjy/torch_memory_saver)。
Miles 的发展离不开众多团队的支持,涵盖硬件、云服务、模型实验室、智能体基础设施和学术界:

引用

如果 Miles 对您的研究或产品有所帮助,请引用:

@misc{miles2026,  
  title = {Miles: Enterprise-Grade Reinforcement Learning for Large-Scale Model Post-Training},  
  author = {Miles Team},  
  year = {2026},  
  howpublished = {\url{https://github.com/radixark/miles}}  
}  

相似文章

Miles v0.1:生产级后训练

Hugging Face Daily Papers

Miles v0.1 是一个开源、生产就绪的系统,用于大规模强化学习和后训练,支持多种后端和模型,如 GLM-5.2,重点关注可扩展性和可访问性。