Nereus:LLM后训练的自适应并行处理

Hugging Face Daily Papers 论文

摘要

Nereus 是一个成本感知运行时,它将针对大型语言模型的强化学习后训练任务调整为高效执行计划,将延迟降低27.7%,并将吞吐量提升最多7.27倍,相比现有工具。

大型语言模型(LLMs)的强化学习(RL)后训练协调多个模型在GPU集群上的生成、推理和训练。运行期间可能发生多种变化,包括资源可用性、序列长度、内存压力和阶段瓶颈。因此,一个最初合适的执行计划可能随时间变慢甚至不可行。然而,调整一个模型共享GPU的任务面临重大挑战:决定新计划是否值得转换成本、重用任务的分布式状态,以及协调模型和阶段间的GPU转移。Nereus 作为一个成本感知运行时,旨在解决这些挑战,将RL后训练任务调整为高效执行计划。其低开销控制器选择一个内存可行的全局计划,并使用一个针对运行中任务校准的成本模型来允许转换。为估计和执行转换,Nereus将模型-阶段(一个模型在一个阶段)的每个副本的分布式状态表示为一个弹性模型单元。然后,它使用一个全局转换图来排序这些单元的转换和GPU转移。在一个基于真实数据的跟踪中,在线TP/PP适应将平均步延迟相对于初始固定TP/PP布局与DP缩放降低了27.7%。在一个达到1,024个GPU的1,000步运行中,六次转换消耗了总运行时间的0.079%。Nereus 在各种集群中,将端到端8B PPO吞吐量相比OpenRLHF提升2.14到7.27倍,相比Verl提升1.10到1.47倍。
查看原文
查看缓存全文

缓存时间: 2026/09/29 12:10

论文页面 - Nereus:面向LLM后训练的自适应并行化

来源:https://huggingface.co/papers/2609.34645

摘要

大型语言模型(LLMs)的强化学习(RL)后训练在GPU集群上协调生成、推理和训练的多个模型。在运行过程中,资源可用性、序列长度、内存压力和阶段瓶颈等多个因素可能发生变化,导致最初合适的执行计划随时间推移变得缓慢甚至不可行。然而,适应共享GPU的模型作业面临重大挑战:决定新计划是否值得转换成本、复用作业的分布式状态,以及跨模型和阶段协调GPU传输。Nereus旨在解决这些挑战,它作为一个成本感知的运行时系统,将RL后训练作业适配为高效的执行计划。其低开销控制器选择内存可行的全局计划,并使用针对运行中作业校准的成本模型来允许转换。为了估算和执行转换,Nereus将每个模型-阶段副本(一个阶段中的一个模型)的分布式状态表示为一个弹性模型单元(ElasticModelUnit),然后利用全局转换图来排序这些单元的转换和GPU传输。基于真实数据构建的跟踪表明,与带有数据并行(DP)缩放的初始固定张量并行(TP)/流水线并行(PP)布局相比,在线TP/PP自适应将平均步延迟降低了27.7%。在一次达到1,024个GPU的1,000步运行中,六次转换仅消耗总运行时间的0.079%。在多样化集群上,Nereus将端到端8B PPO的吞吐量相比OpenRLHF提高了2.14至7.27倍,相比Verl提高了1.10至1.47倍。

查看arXiv页面(https://arxiv.org/abs/2609.34645)查看PDF(https://arxiv.org/pdf/2609.34645)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.34645)

通过您的代理获取此论文:

hf papers read 2609.34645

尚未拥有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2609.34645以从本页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2609.34645以从本页面链接。

引用此论文的空间0

无空间链接此论文

在空间README.md中引用arxiv.org/abs/2609.34645以从本页面链接。

包含此论文的收藏0

无收藏包含此论文

将此论文添加到收藏(https://huggingface.co/new-collection)以从本页面链接。

相似文章