Mix-Quant: 量化预填充,精准解码的智能体大语言模型
摘要
Mix-Quant 提出了一种面向智能体大语言模型的阶段感知量化框架,在预填充阶段使用 NVFP4 量化以加速计算,同时在解码阶段保持 BF16 精度以维持准确性。该方法在智能体基准测试中实现了预填充速度提升最高 3 倍,且性能下降极小。
arXiv:2605.20315v1 Announce Type: new
摘要:LLM agents 近期作为一种通过规划、工具使用、记忆检索和多步交互解决复杂任务的强大范式出现。然而,这些智能体工作流通常会引入大量输入侧开销,使得计算密集型的预填充阶段成为长上下文、多轮推理中的关键瓶颈。在这项工作中,我们提出了 Mix-Quant,一个简单有效的阶段感知量化框架,用于快速智能体推理。我们首先研究了智能体 LLM 工作流中的 FP4 量化,并观察到量化整个推理过程可能导致显著的性能下降。相比之下,预填充阶段表现出大量量化冗余,因此可以在精度损失最小的情况下进行量化,尽管它是计算的主要来源。基于这一见解,我们对预填充阶段应用高吞吐量的 NVFP4 量化,同时对解码阶段保持 BF16 精度。通过将预填充加速与解码质量解耦,Mix-Quant 将阶段感知算法量化与硬件高效的 NVFP4 执行相结合,以缓解 LLM agents 中的推理瓶颈。在长上下文和智能体基准上的大量实验表明,Mix-Quant 在保持任务性能的同时显著提升了效率,在预填充阶段实现了高达 3 倍的加速。
查看缓存全文
缓存时间: 2026/05/21 06:32
# 量化预填充,精准解码:面向代理型大语言模型 来源:https://arxiv.org/html/2605.20315 Haiquan Lu, Zigeng Chen, Gongfan Fang, Xinyin Ma, Xinchao Wang 新加坡国立大学 haiquanlu@u\.nus\.edu,xinchao@nus\.edu\.sg ###### 摘要 LLM 代理近期已成为一种强大的范式,用于通过规划、工具使用、记忆检索和多步交互来解决复杂任务。然而,这些代理工作流通常会引入大量的输入侧开销,使得计算密集型的预填充阶段成为长上下文、多轮推理中的关键瓶颈。在这项工作中,我们提出了 Mix-Quant,一个简单而有效的阶段感知量化框架,用于快速的代理推理。我们首先研究了代理 LLM 工作流中的 FP4 量化,并观察到量化整个推理过程会导致显著的性能下降。相反,预填充阶段表现出大量的量化冗余,因此可以在精度损失最小的情况下进行量化,尽管它是计算的主要来源。基于这一洞察,我们将高吞吐量的 NVFP4 量化应用于预填充阶段,同时保留 BF16 精度用于解码。通过将预填充加速与解码质量解耦,Mix-Quant 结合了阶段感知的算法量化与硬件高效的 NVFP4 执行,以缓解 LLM 代理中的推理瓶颈。在长上下文和代理基准上的大量实验表明,Mix-Quant 在保持任务性能的同时实现了显著的效率提升,在预填充期间实现了高达 3 倍的速度提升。代码见:https://github.com/haiquanlu/Mix-Quant ## 1 引言 大型语言模型(LLM)代理已成为一种强大的范式,用于解决涉及工具使用、记忆检索、代码生成和多步交互的复杂现实世界任务[43 (https://arxiv.org/html/2605.20315#bib.bib43),33 (https://arxiv.org/html/2605.20315#bib.bib33),41 (https://arxiv.org/html/2605.20315#bib.bib41),38 (https://arxiv.org/html/2605.20315#bib.bib38)]。它们在编码代理、个人助手、网络代理和通用自主系统方面展现出了强大的潜力[21 (https://arxiv.org/html/2605.20315#bib.bib21)]。然而,代理工作流通常需要重复的推理步骤和多轮交互循环,导致大量的上下文处理开销。在许多情况下,输入上下文可能比生成的输出长几十到上百倍,这使得计算密集型的预填充阶段在延迟和吞吐量方面都成为主要的效率瓶颈。 参见图 1:代理工作流高度偏向输入,引入了大量预填充开销。NVFP4 量化可以大幅加速计算,但将其同时应用于预填充和解码会导致明显的精度下降。Mix-Quant 则对预填充使用 NVFP4,对解码使用精确的 BF16,在基本保持代理性能的同时实现了显著的加速。 为了减轻推理开销,先前的工作已经探索了多种模型效率策略[8 (https://arxiv.org/html/2605.20315#bib.bib8),22 (https://arxiv.org/html/2605.20315#bib.bib22),20 (https://arxiv.org/html/2605.20315#bib.bib20),11 (https://arxiv.org/html/2605.20315#bib.bib11)]。虽然这些方法在提高部署效率方面很有前景,但不同的策略针对不同的推理瓶颈,在推理阶段统一应用激进的压缩可能会导致不可忽视的性能下降。例如,后训练量化(PTQ)因其实用性而被广泛使用。仅权重量化 PTQ[8 (https://arxiv.org/html/2605.20315#bib.bib8),19 (https://arxiv.org/html/2605.20315#bib.bib19)]通过用 INT4 等低位格式表示模型权重来降低内存占用,提高了内存受限的自回归解码的吞吐量。然而,它对计算受限的预填充阶段的加速有限,因为激活仍保持高精度。相比之下,权重与激活量化[37 (https://arxiv.org/html/2605.20315#bib.bib37)]实现了低位矩阵乘法,直接降低了计算成本,但它可能会降低性能,尤其是在复杂的长时间轨迹任务中,因为误差会在每个解码步骤积累[17 (https://arxiv.org/html/2605.20315#bib.bib17),45 (https://arxiv.org/html/2605.20315#bib.bib45)]。 对预填充和解码应用统一的量化策略通常会导致不利的效率-性能权衡。预填充和解码在 LLM 推理中扮演不同的角色,并表现出不同的效率瓶颈[47 (https://arxiv.org/html/2605.20315#bib.bib47),28 (https://arxiv.org/html/2605.20315#bib.bib28)]。更具体地说,预填充处理固定的输入上下文,是计算密集型的;而解码则自回归地生成 token,对累积的数值误差更为敏感。这种区别提出了一个重要问题:我们能否将预填充和解码解耦,并根据各自不同的特征分别优化模型? 受此启发,我们提出了 Mix-Quant,一个阶段感知的量化框架,用于高效的长上下文 LLM 代理推理。Mix-Quant 将高吞吐量的 NVFP4 权重与激活量化应用于计算密集型的预填充阶段,同时保留 BF16 精度用于自回归解码。NVFP4 精度[24 (https://arxiv.org/html/2605.20315#bib.bib24)]是随 NVIDIA Blackwell 引入的一种微缩放 FP4 格式,它使用细粒度缩放来提高超低位宽下的数值精度,并为本机硬件支持的高效低精度计算提供了原生支持。我们方法的设计基于两个关键观察:(1) 长上下文、多轮代理工作流引入了大量的上下文处理开销,使得计算密集型的预填充阶段成为主要的效率瓶颈。因此,优化预填充阶段对于高效的代理推理至关重要;(2) 预填充和解码表现出不同的计算瓶颈和量化冗余行为。预填充并行处理固定的输入序列,适合激进的量化:量化误差不会在同一个预填充过程中递归地影响未来的输入,而且长代理上下文通常包含大量的冗余。相比之下,解码对误差敏感得多,因为每个采样的 token 都会影响生成过程。因此,量化误差可以在长轨迹中传播和累积,最终降低最终任务性能。通过将高吞吐量的 NVFP4 计算集成到预填充中,同时保持解码为精确的 BF16,Mix-Quant 结合了算法层面的阶段感知能力与硬件层面的加速,解决了代理推理中的长上下文处理瓶颈,同时保持了整体任务性能。 我们在一个综合的长上下文和代理基准测试套件上评估了 Mix-Quant,包括两个广泛使用的长上下文基准[2 (https://arxiv.org/html/2605.20315#bib.bib2),1 (https://arxiv.org/html/2605.20315#bib.bib1)]和三个多轮代理基准[29 (https://arxiv.org/html/2605.20315#bib.bib29),35 (https://arxiv.org/html/2605.20315#bib.bib35),3 (https://arxiv.org/html/2605.20315#bib.bib3)],使用了最先进的代理基础模型[10 (https://arxiv.org/html/2605.20315#bib.bib10),32 (https://arxiv.org/html/2605.20315#bib.bib32),39 (https://arxiv.org/html/2605.20315#bib.bib39)]。结果表明,与统一的 NVFP4 量化相比,Mix-Quant 能够在各种长上下文和代理场景中基本保持任务性能,同时在不同序列长度和批量大小下实现 2-3 倍的预填充加速。这些发现表明,阶段感知量化为输入密集型的 LLM 代理推理提供了有利的效率-性能权衡。 贡献。综上所述,我们的主要贡献包括:(1) 我们揭示了 LLM 代理工作流由于与环境的多步交互而高度偏向输入,使得计算密集型的预填充阶段成为长上下文代理推理中的主要效率瓶颈。同时,朴素的模型效率方法可能会损害任务性能,凸显了阶段感知优化的必要性。(2) 我们提出了 Mix-Quant,一个阶段感知的量化框架,将 NVFP4 量化应用于预填充,同时保留 BF16 精度用于自回归解码,从而在不引入严重误差累积的情况下提高效率。(3) 我们通过实验表明,Mix-Quant 在显著提高推理效率的同时,基本保持了代理任务性能,与 BF16 相比实现了高达 3 倍的预填充加速,展示了阶段感知模型量化在高效可靠的 LLM 代理方面的潜力。 ## 2 相关工作 长上下文代理工作流。LLM 代理通过动作接口、外部工具、记忆和来自交互环境的反馈来扩展语言模型。ReAct 引入了将推理轨迹与环境动作交错进行的模式[44 (https://arxiv.org/html/2605.20315#bib.bib44)],而 Toolformer 展示了语言模型可以学习调用外部 API 并根据工具输出进行条件化[33 (https://arxiv.org/html/2605.20315#bib.bib33)]。WebGPT 展示了浏览器辅助的问答[23 (https://arxiv.org/html/2605.20315#bib.bib23)],MemGPT 探索了长期交互的记忆管理[26 (https://arxiv.org/html/2605.20315#bib.bib26)],SWE 代理[14 (https://arxiv.org/html/2605.20315#bib.bib14),42 (https://arxiv.org/html/2605.20315#bib.bib42)]展示了代理-计算机接口对于软件工程的重要性。这些系统反复调用 LLM,提示中包含指令、工具模式、检索到的证据、执行轨迹和记忆状态。最近关于代理推理的工作进一步强调了大量的输入 token 开销、重复上下文冗余和高服务成本[34 (https://arxiv.org/html/2605.20315#bib.bib34),36 (https://arxiv.org/html/2605.20315#bib.bib36)]。Mix-Quant 正是受到这种工作负载转变的启发:对于长上下文代理,加速上下文处理通常与提高 token 生成吞吐量同等重要。 预填充-解码分离。预填充和解码具有不同的计算特征。预填充并行处理所有提示 token,主要是大规模矩阵乘法;而解码是自回归进行,反复流式传输模型权重和 KV 缓存条目。服务系统已经利用这一区别,将提示处理与 token 生成分离。Splitwise 将预填充和解码映射到不同的机器配置[27 (https://arxiv.org/html/2605.20315#bib.bib27)];DistServe 将阶段分散到不同的 GPU 池,以减少首 token 时间和每个输出 token 时间目标之间的干扰[47 (https://arxiv.org/html/2605.20315#bib.bib47)];其他算法方法
相似文章
通过联合优化架构与量化策略实现 LLM 压缩
来自 UiT 和奥斯陆大学的研究人员提出了一种可微分 NAS 框架,能够联合优化 LLM 压缩中的架构配置与混合精度量化策略。与先 NAS 后量化的顺序基线方法相比,该框架在七项推理任务中可实现最高 1.4 倍的推理加速,或最高 6% 的精度提升。
用于大语言模型压缩的联合结构化剪枝与混合精度量化
一种新颖的端到端大语言模型压缩框架,联合优化结构化剪枝与混合精度量化,在超低位宽精度下,相比于现有最先进方法实现了显著的困惑度降低和加速效果。
GEMQ:面向MoE大语言模型的全局专家级混合精度量化方法
提出GEMQ,一种面向MoE大语言模型的全局专家级混合精度量化方法,利用线性规划和路由器微调来减少内存占用并加速推理,同时将精度损失降至最低。
通过多轮提示验证提升量化模型在定性分析中的性能
本文提出一种多轮提示验证方法,以提升量化LLM(LLaMA-3.1 8B)在定性分析中的性能,减少幻觉,并在不同量化级别(8位、4位、3位、2位)下提高稳定性。
Qift: 移位友好的无零点W2训练后量化,用于旋转W2A4/KV4大语言模型推理
本文介绍了Qift,一种固定的无零点两位权重量化层级集,专为Hadamard旋转的大语言模型设计,通过利用旋转权重的近零中心高斯类分布,实现了改进的W2A4/KV4推理。在LLaMA-2-7B和LLaMA-3.1-8B上的实验显示,相比于标准W2量化,困惑度持续提升。