受内存限制但不限于带宽:物理AI推理中批量1的LLM解码差距

Hugging Face Daily Papers 论文

摘要

本文研究了物理AI系统中批量1的LLM解码的性能差距,发现更快的内存带宽并没有按比例减少延迟,因为启动开销的存在,并且量化效率在不同硬件间差异显著。

物理AI系统,包括机器人、自动驾驶车辆、具身智能体和边缘副驾驶,通常运行与云端LLM服务不同的推理工作负载:单流、批量1的自回归解码,其中单个机器人、摄像头或用户会话等待下一个令牌。这种工作负载通常被描述为受内存带宽限制。每个解码步骤会流式加载模型权重和活动KV缓存,因此延迟应该与峰值HBM带宽成比例。我们表明这一观点正确但不完整。我们在四款NVIDIA GPU(H100 SXM5、A100-80GB SXM4、L40S和L4)上测量了三个7至8B类GQA transformers的批量1解码。我们评估了从2048到16384的上下文长度,在受控的bf16 SDPA设置下产生了44个有效数据点。峰值HBM带宽的利用率随着峰值带宽的上升而下降。在头号测试项Qwen-2.5-7B的ctx=2048单元上,L4达到了其分析内存下限的约81%,而H100仅达到27%。物理AI解码受内存主导,但更快的内存并未带来成比例的延迟增益。我们通过CUDA Graphs A/B实验测试了这一缺失项。在H100上,ctx=2048时,CUDA Graphs在10次全新会话中将解码延迟提升了1.259倍,95%自助法置信区间为1.253至1.267。在L4上,同一干预仅带来1.028倍的提升。这隔离出了一种启动侧开销,在快速GPU上显式可见,而在较慢、受带宽限制的GPU上基本隐藏。其部署启示是:内存节省仅在运行时实现时才真正有用。在L4上,bf16解码接近内存下限,但常见的量化路径并未实现预期的4倍权重流量降低:bnb-nf4达到59.36 ms/步,AutoAWQ+Marlin达到45.24 ms/步,而bf16基线为62.32 ms/步。采用Ada调优int4内核的GPTQ+ExLlamaV2达到17.36 ms/步。
查看原文
查看缓存全文

缓存时间: 2026/06/01 15:20

论文页面 - 受内存约束但不受带宽限制:物理AI中批量=1的LLM解码推理差距

来源:https://huggingface.co/papers/2605.30571

摘要

物理AI系统中的批量=1自回归解码表明,仅靠内存带宽无法完全解释延迟问题——GPU加速受限于启动开销,而量化效率在不同硬件平台间差异显著。

物理AI系统(包括机器人、自动驾驶车辆、具身智能体以及边缘副驾驶)通常执行与云端LLM服务不同的推理负载:单流、批量=1的自回归解码,即一个机器人、一路摄像头输入或一个用户会话等待下一个令牌的生成。这类负载通常被描述为受内存带宽约束(https://huggingface.co/papers?q=memory-bandwidth-bound)。每个解码步骤都会流式加载模型权重和活跃KV缓存(https://huggingface.co/papers?q=KV%20cache),因此延迟本应与峰值HBM带宽(https://huggingface.co/papers?q=HBM%20bandwidth)成比例缩放。我们发现这种说法正确但不完整。我们在四款NVIDIA GPU(H100 SXM5、A100-80GB SXM4、L40S和L4)上,对三种7B-8B级别的GQA变换器(https://huggingface.co/papers?q=GQA%20transformers)测量了批量=1解码性能。我们评估了从2048到16384的上下文长度,在一个受控的bf16 SDPA(https://huggingface.co/papers?q=bf16%20SDPA)设置下获得了44个有效数据点。所实现的峰值HBM带宽(https://huggingface.co/papers?q=HBM%20bandwidth)占比随着峰值带宽的升高而下降。在头部的Qwen-2.5-7B ctx=2048数据点上,L4达到了其分析内存下限的大约81%,而H100仅达到27%。物理AI解码以内存为主导,但更快的内存并未转化为成比例的延迟改善。我们通过CUDA Graphs(https://huggingface.co/papers?q=CUDA%20Graphs)A/B实验验证了这个缺失项。在H100上,ctx=2048时,CUDA Graphs(https://huggingface.co/papers?q=CUDA%20Graphs)在N=10次全新会话中将解码延迟提升了1.259倍,Bootstrap 95%置信区间为1.253~1.267倍。在L4上,同样的干预仅带来1.028倍的提升。这分离出了一项启动侧的开销,该开销在快速GPU上变得明显,而在较慢的带宽约束型GPU上基本被隐藏。部署上的启示是:内存节省只有在运行时能够实际实现时才有意义。在L4上,bf16解码已接近内存下限,但常见的量化路径并未恢复预期的4倍权重流量缩减:bnb-nf4(https://huggingface.co/papers?q=bnb-nf4)达到59.36 ms/步,AutoAWQ(https://huggingface.co/papers?q=AutoAWQ)+Marlin(https://huggingface.co/papers?q=Marlin)达到45.24 ms/步(基准为62.32 ms的bf16)。GPTQ(https://huggingface.co/papers?q=GPTQ)+ExLlamaV2(https://huggingface.co/papers?q=ExLlamaV2)配合Ada调优的int4内核(https://huggingface.co/papers?q=Ada-tuned%20int4%20kernels)则达到了17.36 ms/步。

查看arXiv页面 (https://arxiv.org/abs/2605.30571)查看PDF (https://arxiv.org/pdf/2605.30571)项目页面 (https://huggingface.co/spaces/josefchen/physical-ai-inference-gap)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.30571)

在您的智能体中获取此论文:

hf papers read 2605\.30571

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

请在模型README.md中引用 arxiv.org/abs/2605.30571 以从此页面链接。

引用此论文的数据集0

无数据集链接此论文

请在数据集README.md中引用 arxiv.org/abs/2605.30571 以从此页面链接。

引用此论文的Spaces1

包含此论文的收藏集0

无收藏集包含此论文

请将此论文添加到一个收藏集(https://huggingface.co/new-collection)中以从此页面链接。

相似文章

内存

Reddit r/artificial

解释了为什么由于KV缓存随上下文长度和并发用户数扩展,LLM推理越来越受内存带宽限制,以及像vLLM和PagedAttention这样的系统如何提高内存利用率。

基于阈值的LLM推理独占批处理

arXiv cs.AI

本文分析了混合批处理与独占批处理在LLM推理中的权衡,表明最优选择取决于GPU内存带宽。提出了一种基于阈值的混合调度器,可在两种方法间动态切换,在带宽受限的GPU上实现高达41.9%的吞吐量提升。