Nereus:LLM后训练的自适应并行处理
摘要
Nereus 是一个成本感知运行时,它将针对大型语言模型的强化学习后训练任务调整为高效执行计划,将延迟降低27.7%,并将吞吐量提升最多7.27倍,相比现有工具。
查看缓存全文
缓存时间: 2026/09/29 12:10
论文页面 - Nereus:面向LLM后训练的自适应并行化
来源:https://huggingface.co/papers/2609.34645
摘要
大型语言模型(LLMs)的强化学习(RL)后训练在GPU集群上协调生成、推理和训练的多个模型。在运行过程中,资源可用性、序列长度、内存压力和阶段瓶颈等多个因素可能发生变化,导致最初合适的执行计划随时间推移变得缓慢甚至不可行。然而,适应共享GPU的模型作业面临重大挑战:决定新计划是否值得转换成本、复用作业的分布式状态,以及跨模型和阶段协调GPU传输。Nereus旨在解决这些挑战,它作为一个成本感知的运行时系统,将RL后训练作业适配为高效的执行计划。其低开销控制器选择内存可行的全局计划,并使用针对运行中作业校准的成本模型来允许转换。为了估算和执行转换,Nereus将每个模型-阶段副本(一个阶段中的一个模型)的分布式状态表示为一个弹性模型单元(ElasticModelUnit),然后利用全局转换图来排序这些单元的转换和GPU传输。基于真实数据构建的跟踪表明,与带有数据并行(DP)缩放的初始固定张量并行(TP)/流水线并行(PP)布局相比,在线TP/PP自适应将平均步延迟降低了27.7%。在一次达到1,024个GPU的1,000步运行中,六次转换仅消耗总运行时间的0.079%。在多样化集群上,Nereus将端到端8B PPO的吞吐量相比OpenRLHF提高了2.14至7.27倍,相比Verl提高了1.10至1.47倍。
查看arXiv页面(https://arxiv.org/abs/2609.34645)查看PDF(https://arxiv.org/pdf/2609.34645)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.34645)
通过您的代理获取此论文:
hf papers read 2609.34645
尚未拥有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2609.34645以从本页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2609.34645以从本页面链接。
引用此论文的空间0
无空间链接此论文
在空间README.md中引用arxiv.org/abs/2609.34645以从本页面链接。
包含此论文的收藏0
无收藏包含此论文
将此论文添加到收藏(https://huggingface.co/new-collection)以从本页面链接。
相似文章
DynaTrain: 面向弹性大语言模型训练的快速在线并行度切换
DynaTrain 是一个分布式训练系统,能够在大语言模型上实现亚秒级在线并行度重配置,通过虚拟参数空间抽象,使转换速度比现有方法快多达三个数量级。
PARALLEL:一种受前额叶对齐强化启发的语言模型学习范式,在显式约束下进行自适应
本文介绍了PARALLEL,一种受前额叶对齐强化启发、用于语言模型学习的方法。该方法决定对每个样本进行适配的时机和强度,使用独立的控制器信号来提高适配效率,同时保持高性能。
NeuPAT:面向语言保持多模态大语言模型的神经元感知可塑性分配调优
NeuPAT 是一个轻量级、架构无关的框架,在多模态指令微调过程中分配神经元级别的更新约束,以保持多模态大语言模型(MLLM)的语言能力,可恢复普通微调所导致的语言退化中的 94.5%。
@LiorOnAI:现在你可以将任何LLM转换成更快的版本,而无需从头重新训练。NVIDIA刚刚在他们30B的模型上实现了这一点。她…
NVIDIA提出了一种方法,将任何LLM转换为更快的版本,方法是将模型拆分为两个副本:一个冻结用于上下文,另一个训练用于并行生成多个token,实现了2.4倍加速,且质量保留约99%,仅使用了8%的训练数据。
LLMZero:通过LLM智能体发现强化学习后训练的自适应训练策略
LLMZero利用LLM智能体通过树搜索在训练轨迹中进行搜索,发现用于强化学习后训练的自适应多参数过渡策略,该策略在多种任务中优于固定调度和网格搜索。