推理工程帕累托图谱:哪些优化在成本、质量和延迟前沿占主导?

arXiv cs.AI 论文

摘要

本文构建了大语言模型推理优化的成本-质量-延迟帕累托图谱,使用校准的模拟器评估不同硬件和场景下的配置和组合。

arXiv:2609.17863v1 公告类型:新 摘要:LLM推理优化在不同模型、GPU、提示和质量指标上报告加速,使其难以比较或组合。我们构建了一个成本、质量和延迟帕累托图谱,以识别不同部署约束下的最佳配置。由于全面测试不切实际,我们在L4、A100和H100 GPU上测量了54种Qwen2.5-7B-Instruct运行在vLLM 0.12上的配置,并使用这些锚点校准模拟器。它在锚定批量大小下复现测量,跨活动漂移低于1.5%。单独的质量评估在200个GSM8K问题上测试了FP16、AWQ 4bit、FP8权重和FP8 KV缓存,每个提示有五个示例。稀疏注意力仅在模拟中评估。在校准网格上,36种配置中有18种达到帕累托前沿。组合方法比单个方法更常达到前沿,15种组合中有9种,而21种单个方法中有9种。质量测试改变了赢家。AWQ 4bit在L4上将每令牌延迟降低到基线的0.34倍,但损失了5.9%的严格GSM8K准确率,在采样不确定性内接近95%的质量下限。灵活的答案提取与FP16准确率匹配,表明损失来自格式而非算术。FP8权重在所有三种GPU上保持基线准确率的99.4%,延迟为基线的0.61至0.65倍,并在四种场景赢家中的三种中出现。简单的FP8 KV缓存保持正常吞吐量但未正确回答200个问题中的任何一个,表明仅速度是不够的。在两种提示设计下,n gram推测解码测量为基线的0.90至0.98倍,在此堆栈上未增加任何好处。最佳选择取决于约束和GPU:H100在紧密延迟下获胜,而A100在吞吐量和低成本上获胜,每百万令牌0.106美元。
查看原文
查看缓存全文

缓存时间: 2026/09/17 09:26

# 推理工程帕累托图谱:哪些优化主导了成本、质量与延迟的边界?
来源:https://arxiv.org/html/2609.17863
Srikanta Datta Tumkur, Jay Iyer, Mehar Simhadri, Sai Pavan Kumar, Sai Kapil Kumar, Ramesh Nampelly

###### 摘要

针对大型语言模型推理的每项优化都有其对应的加速数字,但这些数字难以直接比较。量化论文报告一种收益,KV缓存压缩论文报告另一种,而推测解码、批处理和稀疏注意力各自报告的数字也不同,且几乎总是在不同的模型、GPU、提示词和质量指标上进行测试。对于预算固定、质量底线明确或延迟目标明确的实践者来说,这些数字无法简单叠加,也无法判断当多种方法叠加使用时哪种组合最优。本文构建了一个成本-质量-延迟帕累托图谱:将每项优化及所有有前景的组合置于共同坐标轴上,并在每种部署场景中指明占优配置。由于配置空间过大无法穷举测量,我们在真实硬件上测量锚点数据,并利用经过校准的分析模拟器填充其余空间。锚点数据来自Qwen2.5-7B-Instruct模型在L4、A100和H100实例上通过vLLM 0.12服务的54种配置,每种GPU对应三种任务场景共18种配置;校准后的模拟器在锚定批处理大小下复现这些配置,跨场景偏差低于1.5%。独立的质量评估分支对FP16、AWQ-4bit、FP8权重和FP8 KV缓存配置在GSM8K(200题,5-shot)上进行评分。稀疏注意力是唯一仅能通过模拟测试的方法。在校准的配置网格中,36种配置中有18种达到帕累托前沿,组合配置比单一方法更常达到前沿(15种中的9种 vs 21种中的9种)。评估质量指标会改变胜出者:AWQ-4bit在L4上可将每token延迟降至0.34倍,但严格GSM8K准确率下降5.9%,未达到95%质量底线的差距在采样误差范围内;准确率损失主要体现在答案格式而非计算上,因为灵活提取模式与FP16基线持平。FP8权重量化在所有三种GPU上保持99.4%基线准确率,延迟降至0.61-0.65倍,并出现在四种场景胜者配置中的三组。朴素FP8 KV缓存配置表现出正常吞吐量,但200题中答对数为零——这种仅追求速度的基准测试可能推荐的配置被图谱排除。在两种提示设计下,n-gram推测解码测得0.90-0.98倍延迟,对此技术栈无增益。胜者配置随约束条件和GPU类型而变化:H100主导严格延迟场景,A100则在吞吐量和每百万token成本0.106美元的低成本场景中胜出。

\\@IEEEabskeysecsize

索引词:\\@IEEEgobblelead大型语言模型推理、帕累托前沿、成本-质量-延迟、量化、推测解码、服务、基准测试、优化图谱。

## I 引言

参见图注图1:研究概览。(1)现有文献在不可比较的场景下报告许多孤立的加速数据,导致无法对比或组合。(2)受成本、质量或延迟约束的实践者需要知道哪种优化或组合占优。(3)我们将所有方法及有前景的组合置于共同的成本-质量-延迟坐标轴上,计算帕累托前沿,并构建图谱以显示各场景下的占优工作点。每个月都会涌现使LLM推理更便宜或更快的新方法:低比特量化[7 (https://arxiv.org/html/2609.17863#bib.bib7),8 (https://arxiv.org/html/2609.17863#bib.bib8),9 (https://arxiv.org/html/2609.17863#bib.bib9)]、KV缓存压缩与驱逐[10 (https://arxiv.org/html/2609.17863#bib.bib10),11 (https://arxiv.org/html/2609.17863#bib.bib11)]、推测解码[6 (https://arxiv.org/html/2609.17863#bib.bib6)]、连续批处理与服务级别目标感知调度[3 (https://arxiv.org/html/2609.17863#bib.bib3),4 (https://arxiv.org/html/2609.17863#bib.bib4)]以及稀疏注意力[12 (https://arxiv.org/html/2609.17863#bib.bib12)]。每项方法都有论文报告显著收益,但这些数字无法比较——它们来自不同模型、GPU、提示词和质量指标,因此论文A中的"三倍加速"与论文B中的"两倍加速"既无法相加或对比,也无法保证在给定部署中复现(图2 (https://arxiv.org/html/2609.17863#S1.F2))。

参见图注图2:在共同坐标轴上,大多数已发表工作点被支配。帕累托前沿——即没有其他配置能在质量和延迟上同时超越的配置集合——才是实践者应选择的范围。校准网格;锚点在RunPod实例上测量。这导致实际决策困难。需要固定质量下最低延迟、或固定延迟下最低成本的工程师无法通过阅读论文选择胜者,因为各方法不在同一坐标轴上且交互作用未知。同时缺乏中立平台供新方法对比,导致声称随时间推移产生分歧。核心问题是:在整个优化技术栈和不同硬件平台上,哪些配置位于成本-质量-延迟帕累托前沿?给定约束条件下应选择哪个?

障碍在于缺乏统一地图。已有优秀的模型质量基准和原始服务吞吐量基准[1 (https://arxiv.org/html/2609.17863#bib.bib1),13 (https://arxiv.org/html/2609.17863#bib.bib13)],近期研究开始从成本-质量前沿构建推理经济学框架[14 (https://arxiv.org/html/2609.17863#bib.bib14)]。但尚无单一图谱能将量化、KV压缩、推测解码、批处理和稀疏注意力——无论单独还是组合——共同置于部署所关心的三个轴上,并标注各场景下的占优选择。本文即构建此图谱。

我们在三种GPU(L4、A100、H100)上对Qwen2.5-7B-Instruct模型进行54种锚点配置测量(使用512 token提示、128 token输出的单一服务负载),报告质量、首token时间、每输出token时间、吞吐量和每百万token成本,并针对每种精度设置GSM8K质量评估分支。由于配置空间(方法×组合×硬件)远超直接测量能力,我们根据锚点校准分析模拟器[2 (https://arxiv.org/html/2609.17863#bib.bib2)]以填充空间,再计算严格延迟、高吞吐量和低成本约束下的帕累托前沿及占优工作点。

我们的贡献如下:
1. 1\.成本-质量-延迟帕累托图谱(图5 (https://arxiv.org/html/2609.17863#S3.F5)):将主要推理优化及其组合置于共同坐标轴,并标注各场景下的占优配置。
2. 2\.先测量后模拟的方法论(图4 (https://arxiv.org/html/2609.17863#S3.F4)):通过校准分析模拟器与实际运行数据,实现从锚点测量覆盖完整配置空间。
3. 3\.实践规则集:哪些优化反复出现在前沿,哪些组合占优,以及胜选如何随约束条件和GPU类型变化。

## II 背景与相关工作

### II\-A 优化技术栈

我们置于图谱的方法针对不同成本维度:量化[7 (https://arxiv.org/html/2609.17863#bib.bib7),8 (https://arxiv.org/html/2609.17863#bib.bib8),9 (https://arxiv.org/html/2609.17863#bib.bib9)]和KV缓存压缩或驱逐[10 (https://arxiv.org/html/2609.17863#bib.bib10),11 (https://arxiv.org/html/2609.17863#bib.bib11)]可减少内存与带宽占用;推测解码[6 (https://arxiv.org/html/2609.17863#bib.bib6)]减少解码步骤;连续批处理[3 (https://arxiv.org/html/2609.17863#bib.bib3)]与服务级别目标感知调度[4 (https://arxiv.org/html/2609.17863#bib.bib4)]提高利用率;稀疏注意力[12 (https://arxiv.org/html/2609.17863#bib.bib12)]减少注意力计算;预填充-解码分离[5 (https://arxiv.org/html/2609.17863#bib.bib5)]将两个阶段拆分。每种方法提供不同调控维度并影响不同坐标轴,只有统一的前沿框架才能使其具有可比性。

### II\-B 基准测试与经济学

MLPerf Inference[1 (https://arxiv.org/html/2609.17863#bib.bib1)]标准化服务测量,Spec-Bench[13 (https://arxiv.org/html/2609.17863#bib.bib13)]标准化推测解码评估,但两者均未将完整优化技术栈置于联合成本-质量-延迟前沿。近期研究探讨模型选择的推理经济学与成本-质量前沿[14 (https://arxiv.org/html/2609.17863#bib.bib14)],以及广泛的本地推理基准测试[15 (https://arxiv.org/html/2609.17863#bib.bib15)]。我们的图谱增加了优化和硬件维度,并提供显式的占优地图。

### II\-C 大规模配置空间的模拟

配置空间具有组合爆炸特性,穷举测量不可行。Vidur[2 (https://arxiv.org/html/2609.17863#bib.bib2)]表明,经过分析的模拟器可在误差范围内估算LLM推理延迟和吞吐量,并低成本搜索数百种部署配置。我们采用先测量后模拟的策略:在真实硬件上测量锚点,校准模拟器,再用其填充前沿空间。

参见图注图3:不同优化在不同场景下处于前沿,因此各方法在不同约束下出现在帕累托前沿的频率比单一加速数字更具信息价值。这是图谱报告场景地图的原因。校准网格,已测量锚点。
### II\-D 帕累托占优

若某配置在所有轴上至少与另一配置持平,且在至少一个轴上严格更优,则后者被“支配”。帕累托前沿是非支配配置集合;这是理性实践者应选择的唯一集合,具体选择由约束条件决定。形式上,图谱即前沿加上各约束下最优配置的标注。

### II\-E 我们的定位

我们将可比性和占优性视为交付物:统一协议、共同坐标轴、所有优化与组合的定位、基于实测锚点校准的模拟器,以及前沿与占优地图。输出是实践者选择优化方案时使用的地图。

## III 方法论

参见图注图4:先测量后模拟的图谱生成流程。对固定模型、负载和GPU集合运行每种优化以生成测量锚点(质量、TTFT、TPOT、吞吐量、成本)。分析模拟器针对这些锚点进行校准,然后用于填充大规模配置空间(优化×组合×硬件)。对每个模型和负载计算成本、质量和延迟的帕累托前沿,并标注各约束下的占优配置,最终形成图谱。
### III\-A 坐标轴与指标

每个配置置于三个轴:质量(任务准确率或与全精度模型的一致性)、延迟(TTFT和TPOT,报告P50和P99值)和成本(每百万token美元成本,基于吞吐量和GPU小时价格推算)。吞吐量和GPU显存作为辅助指标记录。质量始终与速度同步报告,确保没有配置通过隐式降低答案质量获胜。

### III\-B 配置与组合

配置指给定模型和GPU上的优化设置选择:量化比特数、KV保留率或比特数、推测草案、批处理策略、稀疏注意力预算。单一方法配置是构建模块;组合则叠加兼容方法(例如在服务级别目标感知批处理中将推测解码与量化KV缓存结合)。组合空间庞大,这正是需要模拟器的原因。

### III\-C 先测量后模拟

我们在每种GPU上直接测量锚点配置以捕获实际内核和内存行为,然后校准分析模拟器[2 (https://arxiv.org/html/2609.17863#bib.bib2)]使其延迟和吞吐量预测在较小误差内匹配锚点。校准后的模拟器填充其余空间。算法1 (https://arxiv.org/html/2609.17863#alg1)描述构建过程。

算法1 构建帕累托图谱
输入:模型、负载、GPU、优化配置、锚点
1:在真实硬件上测量锚点配置;记录质量、延迟、成本
2:用锚点校准分析模拟器
3:模拟完整配置和组合空间
4:对每个(模型、负载)do
5:   计算(质量、延迟、成本)帕累托前沿
6:   标注严格延迟、高吞吐量、低成本下的占优配置
7:end for
8:返回前沿和占优图谱

### III\-D 图谱解读

图谱(图5 (https://arxiv.org/html/2609.17863#S3.F5))是一个网格,行表示部署场景(绑定约束),列表示坐标轴或负载;每个单元格标注占优配置。三个假设待验证:少数组合反复出现在前沿;胜者随绑定约束变化(低成本场景倾向激进量化,严格延迟场景倾向推测解码,高吞吐量场景倾向批处理);GPU选择移动整个前沿。第V节 (https://arxiv.org/html/2609.17863#S5) 报告验证结果。

参见图注图5:图谱:各部署场景下的占优配置。带框单元格标记组合配置超越所有单一方法的情况。校准网格,已测量锚点。
### III\-E 成本核算

每百万token成本取决于GPU小时价格和测量吞吐量,两者均明确说明。模拟数据点携带模拟器的校准误差范围;测量锚点则不携带。我们从不将模拟延迟伪装成测量值,且每个前沿都标注锚点位置。

## IV 实验设置

### IV\-A 模型、负载、硬件与指标

测量活动锚定单一模型Qwen2.5-7B-Instruct在三种GPU(RunPod L4、A100 80GB PCIe、H100 PCIe)上的单一服务负载(512 token提示、128 token输出),均由vLLM 0.12服务,质量在GSM8K上评估。表I (https://arxiv.org/html/2609.17863#S4.T1) 列出协议定义的四种负载;其中仅数学负载(GSM8K)作为质量评估分支在此测量。指标面板包括质量、TTFT、TPOT(P50和P99)、吞吐量、GPU显存和每百万token成本,所有数值均注明模型、GPU、批处理大小和负载。

表I:协议负载及每种负载侧重的成本维度;此处仅测量数学负载(GSM8K)。
### IV\-B 优化与协议

优化方法包括量化(KIVI、TurboQuant、AWQ)、KV压缩与驱逐(PyramidKV、H2O)、推测解码(EAGLE-3)、连续批处理与服务级别目标感知调度(vLLM、Sarathi)以及稀疏注意力(NSA),每种均为可调控维度,及其兼容组合。其中活动锚定了量化(AWQ-4bit和在线FP8权重)、KV压缩(FP8 KV缓存)和推测解码(n-gram提示查找;所用服务引擎未实现草案模型推测解码,且目标模型无EAGLE头);稀疏注意力仅通过模拟测试。锚点在真实GPU上测量;其余使用校准分析器模拟。主要设置见表II (https://arxiv.org/html/2609.17863#S4.T2)。

表II:主要设置。
## V 结果

本节所有延迟、吞吐量和成本数据均源自54个已测量的锚点配置(2026年7月活动:RunPod L4每小时0.39美元,A100 80GB PCIe每小时1.39美元,H100 PCIe每小时2.89美元;vLLM 0.12.0,Qwen2.5-7B-Instruct,512 token提示,128 token输出)。

相似文章

LLM推理的有效前沿

Hacker News Top

本文解释了LLM推理中的有效前沿概念,涵盖了延迟、吞吐量和成本之间的权衡,并概述了在部署中管理或提高效率的技术。

本地LLM推理优化:完整指南

Reddit r/LocalLLaMA

一份关于在消费级硬件上优化本地LLM推理的全面指南,涵盖llama.cpp、vLLM和LM Studio等工具,并提供关于内存层次结构、层放置和常见故障模式的实用建议。

@polynoamial: https://x.com/polynoamial/status/2064210146558136827

X AI KOLs Following

本文认为,LLM基准测试性能越来越依赖于测试时的计算量,而当前的评估方法在控制推理预算时无法捕捉到能力的提升。它主张绘制性能与token数、成本或时间的关系图,并讨论了对安全评估的影响。