LLM推理的有效前沿
摘要
本文解释了LLM推理中的有效前沿概念,涵盖了延迟、吞吐量和成本之间的权衡,并概述了在部署中管理或提高效率的技术。
暂无内容
查看缓存全文
缓存时间: 2026/09/02 02:45
# 大语言模型推理的效率前沿
来源:https://www.baseten.co/blog/the-efficient-frontier-of-llm-inference/
在AI领域,我们借用了经济学家的术语“效率前沿”。我们用它来讨论权衡取舍,最常见的是模型在成本与能力之间的权衡。一个模型若能在给定成本或规模下提供最高水平的智能,则被称为“前沿模型”。
效率前沿展示了在资源受限环境中,两种有价值的结果之间进行权衡时的最优组合范围。效率前沿展示了在资源受限环境中,两种有价值的结果之间进行权衡时的最优组合范围。
在推理工程中,我们同样有效率前沿。这最常体现为延迟与吞吐量(这决定了成本)之间的权衡,不过我们也可以用质量换取吞吐量(通过量化、蒸馏和剪枝),或者用智能换取速度(体现为推理层级)。
推理工程师可使用两类技术:
1. **在两种因素间进行权衡,以使部署沿着效率前沿移动的技术。**
2. **将特定部署的整个前沿向外推移,创造更多整体效率,从而可将这些效率分配给最有益结果的技术。**
两类技术都极具价值。
能够通过权衡取舍来定位效率前沿上的任意一点,这非常有用。牺牲单用户速度,可以为批处理工作负载构建高吞吐量、低成本的流水线。当延迟敏感型用户支付意愿很高时,牺牲吞吐量以提升速度是合理的。
当然,将整个前沿向外推移也极为有用。解锁更多效率带来的增益,可以分配给更低延迟、更高吞吐量,或两者的组合。
本文将详细说明哪些推理工程技术让你能够定位前沿上的某一点,以及哪些技术能将整个前沿向外推移。在本文中,我们将假设运行的是像GLM-5.3 (https://www.baseten.co/library/glm-53/) 或Kimi K3 (https://www.baseten.co/library/kimi-k3/) 这样的大语言模型,用于具备KV缓存重用和最优KV感知路由功能的智能体编码场景。
## 管理权衡的技术
在生产中实现某个特定目标,通常与其说是发现某种新奇方法,不如说是根据流量的性质找到正确的配置组合。
管理权衡的技术让你能够定位效率前沿上的某个结果。管理权衡的技术让你能够定位效率前沿上的某个结果。
在实践中,效率前沿是非常不规则的。结果之间并非平滑连续的线条,微小的变化可能产生重大影响。这些临界点往往违反直觉,必须通过扫描实验来经验性地发现。
### 批量大小
延迟与吞吐量之间最明显的权衡来自批量大小。批量是并发处理的请求数量。虽然基于令牌级别的连续批处理意味着等待批次开始不会产生延迟,但配置的批量大小决定了单用户延迟和整体吞吐量。
批量设置较小时,单用户延迟表现优异,但每个GPU生成的总令牌数较少,这意味着每个令牌的成本相当高。增大批量则效果相反:单用户延迟变差,但整体吞吐量提升,成本降低。
### 并行策略
当今的大语言模型拥有数千亿甚至万亿参数,必须分布在多个GPU上。它们在GPU间的共享或并行化方式,可以提升延迟或吞吐量表现。
并行化将大模型拆分到多个GPU上。并行化将大模型拆分到多个GPU上。
对于延迟敏感的部署,应着重增加张量并行度。虽然张量并行需要昂贵的全对全通信,但它在通过高带宽NVLink互连运行时能有效降低延迟。
专家并行可以帮助同时改善延迟和吞吐量。较低程度的专家并行通常与更好的延迟相关,而广泛的专家并行(包括跨整个机柜GPU的专家并行)通常能支持更高的吞吐量。
另一种提升吞吐量的并行技术是注意力数据并行。该技术通过复制注意力层进行并行计算,以牺牲单请求速度为代价提升系统吞吐量。
### 量化
量化,即以较低的精度运行模型(使用权重、激活值和/或KV缓存值),可以同时改善延迟和吞吐量。量化模型将推动服务权衡的效率前沿。
然而,量化在质量和服务效率之间引入了一系列新的权衡。这是一个特别不规则的前沿,尤其是当使用像MXFP4和NVFP4这样的微缩浮点数格式时,可以在模型质量几乎没有降低的情况下,大幅提升服务效率。
## 推动前沿的技术
这些技术往往成为头条新闻。提升整体性能是推理工程中最有趣的部分。
推动前沿的技术带来全面增益。推动前沿的技术带来全面增益。
最妙的是,这些技术常常会叠加。例如,更好的硬件带来性能翻倍,同时更好的软件也带来性能翻倍,这意味着整体服务性能提升四倍,而这部分增益可以分配给延迟和吞吐量。
### 内核优化与运行时改进
CUDA内核是执行推理过程中某个单一部分(如矩阵乘法)的底层函数。提升单个内核的性能,以及推理引擎中前向传播的端到端性能,意味着生成每个令牌所需的资源更少。这些效率增益在整个技术栈中累积,并推动性能前沿。
关于内核级性能的更多内容,请阅读这篇由Baseten实习生Brian Li撰写的精彩文章 (https://www.baseten.co/blog/agentic-kernels-in-production/)。
### 投机解码
投机解码是猜测模型可能生成哪些令牌,然后验证这些猜测的过程。在投机解码技术初现时,这在延迟和吞吐量之间存在权衡:投机成本高,序列长度短,接受率低,意味着投机解码仅在小批量下可行。
如今,像EAGLE-3 (https://www.baseten.co/blog/how-to-train-custom-eagle-3-heads-for-speculative-decoding/)、DSpark和DFlash (https://www.baseten.co/blog/dflash-faster-llm-inference/) 这样的技术仍然与主模型循环竞争资源,在一定程度上限制了最大批量大小。然而,得益于这些技术的强大性能,特别是在输出令牌序列相对可预测的代码生成任务中,它们通过跳过前向传播带来效率增益,并以每用户每秒更多令牌的形式直接降低了延迟。
### 解耦
P/D解耦,或将预填充和解码分离到专用工作节点上,是优化大语言模型高吞吐量部署的一种策略。独立运行预填充和解码意味着工作节点可以针对推理每个阶段的独特特性进行优化,并且可以调整预填充和解码工作节点的比例,以匹配传入流量的输入输出序列长度和缓存命中率。
在实践中,解耦通常最有助于在保持延迟不变或略有改善的情况下增加吞吐量。在实践中,解耦通常最有助于在保持延迟不变或略有改善的情况下增加吞吐量。
本文提供了管理权衡的技术与提升系统整体性能技术的基本概述。如需了解本文中提及的每种技术的更多细节,请阅读我的免费书籍*《推理工程》* (https://www.baseten.co/inference-engineering/)。
相似文章
效率前沿:LLM上下文管理中成本-性能优化的统一框架
介绍效率前沿,一个用于优化LLM上下文管理中的成本和性能的统一框架,在HotpotQA上以可比较的性能实现了有效token使用量减少约25%。
前沿大语言模型是高效的批量优化器:评估推理模型在连续和离散环境中的表现
本文研究评估了前沿大语言模型在连续和离散环境中作为批量优化器的表现,发现它们在数值任务上具有竞争力,但在语义丰富的环境中比传统方法更有效。
深入vLLM:高吞吐量LLM推理系统剖析(2025)
深入探讨vLLM用于高吞吐量LLM推理的架构与组件,涵盖调度、分页注意力、连续批处理、高级特性、扩展、服务及基准测试。
推理计算如何影响前沿LLM的评估
本文系统研究了推理时计算(token预算、上下文压缩、重复提交)如何影响前沿LLM在具有挑战性的基准上的性能,表明得分是协议相关的,并提倡评估应将能力表示为推理计算的函数。
本地LLM推理优化:完整指南
一份关于在消费级硬件上优化本地LLM推理的全面指南,涵盖llama.cpp、vLLM和LM Studio等工具,并提供关于内存层次结构、层放置和常见故障模式的实用建议。