Molt:一个可扩展的、基于PyTorch原生的智能体强化学习训练框架
摘要
Molt是一个基于PyTorch原生的智能体强化学习训练框架,设计简洁紧凑,易于修改,同时实现了与基于Megatron的框架相当的性能。
查看缓存全文
缓存时间: 2026/07/27 05:40
论文页面 - Molt:一个面向智能体强化学习的可扩展原生PyTorch训练框架
来源:https://huggingface.co/papers/2607.21653
摘要
智能体强化学习研究涉及不断的算法修改、新的估计量、新的流水线阶段、新的推演方案,而在主流框架中,每一次改动都会牵一发而动全身地贯穿训练器、分布式后端和推演胶水层:这种代价在每个研究迭代中都由研究者承担。Molt 是一个原生 PyTorch 训练框架,旨在将这种代价降至最低:代码库紧凑且清晰,研究者可全盘掌握,AI 编码助手也能完整阅读与理解,从而实现算法流程的端到端追踪与修改。智能体是一个普通程序,单个异步循环同时训练多模态和混合专家策略,且绝不训练任何非自身生成的 token——在 token、策略版本和模型语义上保持一致。精简并不以性能为代价:在匹配的完全异步协议下,Molt 与基于 Megatron 的最先进堆栈在统计上表现相当。Molt 为开源项目,提供配方和容器,访问地址:https://github.com/NVIDIA-NeMo/labs-molt。
查看 arXiv 页面 (https://arxiv.org/abs/2607.21653)
查看 PDF (https://arxiv.org/pdf/2607.21653)
GitHub 605 (https://github.com/NVIDIA-NeMo/labs-molt)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.21653)
在您的智能体中获取此论文:
hf papers read 2607.21653
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2607.21653,即可从此页面建立链接。
引用此论文的数据集0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.21653,即可从此页面建立链接。
引用此论文的 Spaces0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2607.21653,即可从此页面建立链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面建立链接。
相似文章
@dair_ai:NVIDIA 最新研究。他们刚刚发布了一个面向智能体强化学习的 PyTorch 原生训练框架。(收藏)论文摘…
NVIDIA 发布了 Molt,一个面向智能体强化学习、注重紧凑性和可读性的 PyTorch 原生框架,性能与基于 Megatron 的堆栈相当。该框架是开源的,并附有论文。
Miles:用于大规模LLM强化学习后训练的PyTorch原生栈(14分钟阅读)
Miles是RadixArk推出的一个开源的PyTorch原生框架,用于大规模LLM强化学习后训练,集成了SGLang、Megatron-LM和Ray,以实现高吞吐量的推演和分布式训练。
@PyTorch: 基于PyTorch、Ray、SGLang和NVIDIA Megatron-LM构建,Miles是RadixArk推出的一个用于大规模……的开源框架
Miles是RadixArk推出的一个开源框架,用于大规模LLM强化学习后训练,集成了PyTorch、Ray、SGLang和NVIDIA Megatron-LM,支持MoE、低精度和容错。
@_akhaliq: LiteResearcher — 面向深度研究智能体的可扩展代理RL训练框架
LiteResearcher是一个可扩展的强化学习训练框架,专为深度研究智能体设计。
EvoTrainer:面向自主智能体强化学习的LLM策略与训练框架协同进化
EvoTrainer提出了一种自主训练框架,通过经验反馈协同进化LLM策略与训练框架,在数学推理、代码生成以及长期软件工程任务上超越了人工设计的强化学习基线。