@eliebakouch: Xiaomi MiMo 开源 RL 环境 + 训练代码 https://github.com/XiaomiMiMo/verl

X AI KOLs Timeline 工具

摘要

Xiaomi MiMo 已开源强化学习训练环境和代码,适用于软件工程、漏洞复现和可视化开发等任务,提供详细指南和 Docker 支持。

Xiaomi MiMo 开源 RL 环境 + 训练代码 https://t.co/ydWIbjoLdU https://t.co/YsBVwO9Is2
查看原文
查看缓存全文

缓存时间: 2026/09/27 15:23

verl:面向大模型的火山引擎强化学习框架

[2025/04] Seed-Thinking-v1.5 技术报告 (https://github.com/ByteDance-Seed/Seed-Thinking-v1.5/blob/main/seed-thinking-v1.5.pdf) 已发布!基于 verl 训练的 Seed-Thinking-v1.5 在 AIME 2024 取得 86.7 分,Codeforces 55.0 分,GPQA 77.3 分,展现了卓越的 STEM 与编程推理能力。该方法不仅在推理任务上表现出色,还在多个领域展现出显著的泛化能力。

[2025/07] verl 将于7月8日在 AWS 新加坡 AI 小时活动 (https://pages.awscloud.com/aws-ai-hours-sg.html#agenda) 进行主题演讲,并于7月11日参加 LF AI & Data 新加坡举办的 Agent for SWE 线下交流会 (https://lu.ma/e498qhsi),届时将介绍 verl 及 verl-agent 项目最新进展。

[2025/06] verl 团队将于6月7日在中国 PyTorch 开发者大会 (https://www.lfasiallc.com/pytorch-day-china/) 上分享项目最新动态,欢迎在北京与我们的开发团队交流!

[2025/04] VAPO (https://arxiv.org/pdf/2504.05118)(基于价值的增强型PPO)论文介绍了我们面向推理模型的最新强化学习方法。该模型基于 Qwen-32B-base 训练,在 AIME 2024 上取得 60.4 分,性能优于 DAPO-32B。

[2025/05] PF-PPO (https://arxiv.org/abs/2409.06957) 已被 ICML 2025 收录,现已在 verl 中获得支持!PF-PPO 通过过滤潜在的噪声奖励信号并利用回放缓冲区重用高质量经验,显著提升了策略学习效率和鲁棒性。

[2025/04] 我们将在 ICLR 2025 Expo (https://iclr.cc/virtual/2025/calendar?filter_events=Expo+Talk+Panel&filter_rooms=)、SCI-FM 研讨会 (https://open-foundation-model.github.io/) 和 LMSys 会后交流会 (https://lu.ma/d23nyynm) 上进行关于最新后训练技术与 verl 编程指南的教程。讲座材料可在此处获取 (https://github.com/eric-haibin-lin/verl-community/tree/main/iclr25)。

[2025/03] verl v0.3.0.post1 已发布!详情请参阅发布说明 (https://github.com/verl-project/verl/releases/)。该版本相比前版实现了约 1.4 倍的性能提升 (https://tongyx361.github.io/blogs/posts/verl-intro/#/verl-flexible-and-efficient-rl-for-llms)。

[2025/05] verl 将于5月16日至17日在上海 A2M 大会 (https://a2m.msup.com.cn/home/?aid=4488&city=shanghai) 上进行展示。

[2025/05] verl 将在巴黎 GOSIM x PyTorch Day 2025 (https://paris2025.gosim.org/) 大会亮相,敬请期待!

[2025/03] 我们于3月中旬在 vLLM 北京交流会 (https://mp.weixin.qq.com/s/n77GibL2corAtQHtVEAzfg) 上介绍了 verl 的编程模型,并在 Sunnyvale 的 SGLang-LMSYS 组织者交流会 (https://lu.ma/ntjrr7ig) 上分享了 verl 介绍与更新 (https://github.com/eric-haibin-lin/verl-community/blob/main/slides/verl-lmsys-meetup.pdf)。

[2025/03] 我们将在 EuroSys 2025 上展示 verl(HybridFlow)。鹿特丹见!

[2025/02] verl v0.2.0.post2 已发布!

[2025/02] 我们在 Bytedance/NVIDIA/Anyscale Ray 交流会上展示了 verl。圣何塞见!

[2025/01] 豆包-1.5-pro (https://team.doubao.com/zh/special/doubao_1_5_pro) 发布,在大语言模型与视觉语言模型领域达到顶尖性能。其强化学习扩展预览模型使用 verl 训练,在数学基准测试中达到 OpenAI O1 级别性能(AIME 通过率 70.0 pass@1)。

[2024/12] verl 在 Ray Forward 2024 大会上进行展示,演示文稿已公开。

[2024/12] 团队在 NeurIPS 2024 上进行了题为“大语言模型后训练:从算法到基础设施“的演讲,演示文稿与视频已公开。

[2024/10] verl 在 Ray Summit 上进行展示,YouTube 视频已公开。

[2024/08] HybridFlow(verl)被 EuroSys 2025 大会收录。

相似文章

XiaomiMiMo/MiMo-V2.6-Flash-RL · Hugging Face

Reddit r/LocalLLaMA

MiMo-V2.6-Flash-RL 是一个多模态AI模型,通过扩展强化学习实现自我改进,采用稀疏混合专家架构,总参数3090亿,上下文长度为100万令牌。

XiaomiMiMo/MiMo-V2.5-Pro

Hugging Face Models Trending

小米发布了 MiMo-V2.5-Pro,这是一个开源的 MoE 语言模型,拥有 1.02T 总参数和 1M token 上下文长度,专为复杂的智能体(Agent)和软件工程任务进行了优化。