@robertnishihara: 一个关于RL中解耦重要性的绝佳案例。来自论文:LLM生成在预填充和解码之间交替…
摘要
Robert Nishihara 强调了一篇关于解耦RL工作负载的论文,表明使用计算优化的H800进行预填充,带宽优化的H20进行解码,可以分别将rollout时间减少21-51%和47%,强调没有单一硬件类型适合所有阶段。
查看缓存全文
缓存时间: 2026/06/20 18:20
关于 RL 中分解重要性的绝佳示例。摘自论文: LLM 生成过程在预填充与解码之间交替。 预填充属于计算密集型任务。 H800 针对计算性能进行了优化。 在 H800 上执行预填充可使生成时间缩短 47%。 解码属于带宽密集型任务。 H20 针对带宽性能进行了优化。 在 H20 上执行解码可使生成时间缩短 21% 至 51%。
除此之外,预填充与解码的比例取决于任务特性(例如,需要大量上下文压缩的多轮任务,其预填充开销占比更重)。
此外,预填充 / 解码仅关乎推理环节。还有许多其他组件对硬件有着不同的需求。
引用论文中的表述: 环境是有状态的、CPU 密集型进程,其延迟呈重尾分布——由主机争用、交互轮次方差大以及环境故障所致。 奖励工作负载是无状态的,且在专用 GPU 上利用率持续偏低——最低可降至 7.4%——但当轨迹完成后又需要弹性伸缩。 训练则需要配备高速互联的高端 GPU。
没有任何一种单一硬件类型能够满足所有阶段的需求。
ray (@raydistributed): RollArt 是大规模 RL 中分解技术的一个令人印象深刻的范例。
相似文章
加速视觉生成式LLMs的解耦RL:基于扩散并行与训练器辅助生成
本文介绍了DigenRL,一个用于基于扩散的生成式LLMs的解耦RL框架,它利用生成轴流水线并行和训练器辅助生成,相比现有系统实现了1.56-2.10倍的吞吐量提升。
@robertnishihara: 关于PD分离的一些直觉——PD不会加速预填充,实际上可能损害TTFT——PD的真正…
这篇来自Anyscale的博客文章解释了LLM服务中Prefill-Decode(PD)分离的直觉,展示了如何将预填充和解码阶段分配到专用GPU上,在使用Ray和vLLM的AMD MI325X上实现高达2.7倍的有效吞吐量提升和67%的成本节省,同时也讨论了PD分离何时没有帮助。
@raydistributed: RollArt 是大规模强化学习中去中心化的一个令人印象深刻的示例。https://cse.ust.hk/~weiwa/papers/rollart-osdi26.p…
RollArt 提出了一种用于大规模强化学习的解耦架构,展示了在效率和可扩展性方面的显著提升。
@CyrusHakha:我们在大规模服务LLM的客户中反复看到一种模式:预填充-解码分离常被当作一根魔杖……
基于客户模式,讨论大规模LLM服务中预填充-解码分离的微妙现实,并在AMD + vLLM上进行了验证。
@_avichawla: LLM推理中的预填充与解码。你是否注意到,LLM的第一个令牌总是需要片刻才出现…
解释LLM推理的两个阶段——预填充和解码,详细说明GPU瓶颈如何从预填充时的计算受限转变为解码时的内存受限,以及KV缓存的重要性。