Molt:一个可扩展的、基于PyTorch原生的智能体强化学习训练框架

Hugging Face Daily Papers 论文

摘要

Molt是一个基于PyTorch原生的智能体强化学习训练框架,设计简洁紧凑,易于修改,同时实现了与基于Megatron的框架相当的性能。

智能体强化学习研究涉及不断的算法修改、新的估计器、新的流水线阶段、新的部署方案,而在主流框架中,每一次修改都要贯穿训练器、分布式后端和部署胶水层:这些成本每次迭代都落在研究人员身上。Molt是一个基于PyTorch原生的训练框架,旨在降低这些成本:代码库紧凑且清晰,研究人员可以完全掌握,AI编码助手也能完整阅读和理解,从而可以端到端地追踪和更改算法流程。智能体是一个普通程序,一个异步循环训练多模态和混合专家策略,同时从不训练它没有生成的token,在token、策略版本和模型语义上保持一致。精简并不牺牲性能:在匹配的完全异步协议下,Molt在统计上可与最先进的基于Megatron的框架相媲美。Molt是开源的,并提供配方和容器,地址为 https://github.com/NVIDIA-NeMo/labs-molt。
查看原文
查看缓存全文

缓存时间: 2026/07/27 05:40

论文页面 - Molt:一个面向智能体强化学习的可扩展原生PyTorch训练框架

来源:https://huggingface.co/papers/2607.21653

摘要

智能体强化学习研究涉及不断的算法修改、新的估计量、新的流水线阶段、新的推演方案,而在主流框架中,每一次改动都会牵一发而动全身地贯穿训练器、分布式后端和推演胶水层:这种代价在每个研究迭代中都由研究者承担。Molt 是一个原生 PyTorch 训练框架,旨在将这种代价降至最低:代码库紧凑且清晰,研究者可全盘掌握,AI 编码助手也能完整阅读与理解,从而实现算法流程的端到端追踪与修改。智能体是一个普通程序,单个异步循环同时训练多模态和混合专家策略,且绝不训练任何非自身生成的 token——在 token、策略版本和模型语义上保持一致。精简并不以性能为代价:在匹配的完全异步协议下,Molt 与基于 Megatron 的最先进堆栈在统计上表现相当。Molt 为开源项目,提供配方和容器,访问地址:https://github.com/NVIDIA-NeMo/labs-molt。

查看 arXiv 页面 (https://arxiv.org/abs/2607.21653)
查看 PDF (https://arxiv.org/pdf/2607.21653)
GitHub 605 (https://github.com/NVIDIA-NeMo/labs-molt)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.21653)

在您的智能体中获取此论文:

hf papers read 2607.21653

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2607.21653,即可从此页面建立链接。

引用此论文的数据集0

没有数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.21653,即可从此页面建立链接。

引用此论文的 Spaces0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2607.21653,即可从此页面建立链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面建立链接。

相似文章