受内存限制但不限于带宽:物理AI推理中批量1的LLM解码差距
摘要
本文研究了物理AI系统中批量1的LLM解码的性能差距,发现更快的内存带宽并没有按比例减少延迟,因为启动开销的存在,并且量化效率在不同硬件间差异显著。
查看缓存全文
缓存时间: 2026/06/01 15:20
论文页面 - 受内存约束但不受带宽限制:物理AI中批量=1的LLM解码推理差距
来源:https://huggingface.co/papers/2605.30571
摘要
物理AI系统中的批量=1自回归解码表明,仅靠内存带宽无法完全解释延迟问题——GPU加速受限于启动开销,而量化效率在不同硬件平台间差异显著。
物理AI系统(包括机器人、自动驾驶车辆、具身智能体以及边缘副驾驶)通常执行与云端LLM服务不同的推理负载:单流、批量=1的自回归解码,即一个机器人、一路摄像头输入或一个用户会话等待下一个令牌的生成。这类负载通常被描述为受内存带宽约束(https://huggingface.co/papers?q=memory-bandwidth-bound)。每个解码步骤都会流式加载模型权重和活跃KV缓存(https://huggingface.co/papers?q=KV%20cache),因此延迟本应与峰值HBM带宽(https://huggingface.co/papers?q=HBM%20bandwidth)成比例缩放。我们发现这种说法正确但不完整。我们在四款NVIDIA GPU(H100 SXM5、A100-80GB SXM4、L40S和L4)上,对三种7B-8B级别的GQA变换器(https://huggingface.co/papers?q=GQA%20transformers)测量了批量=1解码性能。我们评估了从2048到16384的上下文长度,在一个受控的bf16 SDPA(https://huggingface.co/papers?q=bf16%20SDPA)设置下获得了44个有效数据点。所实现的峰值HBM带宽(https://huggingface.co/papers?q=HBM%20bandwidth)占比随着峰值带宽的升高而下降。在头部的Qwen-2.5-7B ctx=2048数据点上,L4达到了其分析内存下限的大约81%,而H100仅达到27%。物理AI解码以内存为主导,但更快的内存并未转化为成比例的延迟改善。我们通过CUDA Graphs(https://huggingface.co/papers?q=CUDA%20Graphs)A/B实验验证了这个缺失项。在H100上,ctx=2048时,CUDA Graphs(https://huggingface.co/papers?q=CUDA%20Graphs)在N=10次全新会话中将解码延迟提升了1.259倍,Bootstrap 95%置信区间为1.253~1.267倍。在L4上,同样的干预仅带来1.028倍的提升。这分离出了一项启动侧的开销,该开销在快速GPU上变得明显,而在较慢的带宽约束型GPU上基本被隐藏。部署上的启示是:内存节省只有在运行时能够实际实现时才有意义。在L4上,bf16解码已接近内存下限,但常见的量化路径并未恢复预期的4倍权重流量缩减:bnb-nf4(https://huggingface.co/papers?q=bnb-nf4)达到59.36 ms/步,AutoAWQ(https://huggingface.co/papers?q=AutoAWQ)+Marlin(https://huggingface.co/papers?q=Marlin)达到45.24 ms/步(基准为62.32 ms的bf16)。GPTQ(https://huggingface.co/papers?q=GPTQ)+ExLlamaV2(https://huggingface.co/papers?q=ExLlamaV2)配合Ada调优的int4内核(https://huggingface.co/papers?q=Ada-tuned%20int4%20kernels)则达到了17.36 ms/步。
查看arXiv页面 (https://arxiv.org/abs/2605.30571)查看PDF (https://arxiv.org/pdf/2605.30571)项目页面 (https://huggingface.co/spaces/josefchen/physical-ai-inference-gap)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.30571)
在您的智能体中获取此论文:
hf papers read 2605\.30571
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
请在模型README.md中引用 arxiv.org/abs/2605.30571 以从此页面链接。
引用此论文的数据集0
无数据集链接此论文
请在数据集README.md中引用 arxiv.org/abs/2605.30571 以从此页面链接。
引用此论文的Spaces1
包含此论文的收藏集0
无收藏集包含此论文
请将此论文添加到一个收藏集(https://huggingface.co/new-collection)中以从此页面链接。
相似文章
@Alacritic_Super: LLM推理的最大瓶颈不是算术运算,而是数据移动。一次乘加运算仅需…
一条科普线程,解释LLM推理的主要瓶颈是数据移动而非计算,并强调了量化、KV缓存优化和FlashAttention等减少内存流量技术的要点。
内存
解释了为什么由于KV缓存随上下文长度和并发用户数扩展,LLM推理越来越受内存带宽限制,以及像vLLM和PagedAttention这样的系统如何提高内存利用率。
@pochenai: 受 @percyliang 的 CS336 启发,我构建了一个用于 LLM 推理的静态性能模型——无动态批处理/分块,j…
受 CS336 启发,一个用于 LLM 推理的静态性能模型提供了 VRAM、time-to-first-token 和吞吐量的分析界限,涵盖多种配置,并针对公开基准进行校准。
@_avichawla: LLM推理中的预填充与解码。你是否注意到,LLM的第一个令牌总是需要片刻才出现…
解释LLM推理的两个阶段——预填充和解码,详细说明GPU瓶颈如何从预填充时的计算受限转变为解码时的内存受限,以及KV缓存的重要性。
基于阈值的LLM推理独占批处理
本文分析了混合批处理与独占批处理在LLM推理中的权衡,表明最优选择取决于GPU内存带宽。提出了一种基于阈值的混合调度器,可在两种方法间动态切换,在带宽受限的GPU上实现高达41.9%的吞吐量提升。