基于模型压缩与并行验证的高效大语言模型广告生成

arXiv cs.CL 论文

摘要

本文提出了一种利用模型压缩和并行验证的高效大语言模型广告框架,在百度的实际部署中实现了超过 1.8 倍的加速。

arXiv:2605.11582v1 公告类型:new 摘要:大语言模型(LLMs)在广告创意生成和精准广告投放等广告场景中展现出巨大的潜力。然而,由于高昂的推理延迟和计算成本,在实时广告系统中部署大语言模型面临着严峻的挑战。在本文中,我们提出了一种高效的生成式定向框架,该框架集成了自适应分组量化、层自适应层次稀疏化以及前缀树并行验证,旨在在保持生成质量的同时加速大语言模型的推理。在两个真实世界广告场景的大量实验表明,我们的框架在可接受的质量损失下实现了显著的加速,使其在实际部署中具有操作性可行性。
查看原文
查看缓存全文

缓存时间: 2026/05/13 06:15

# 通过模型压缩与并行验证实现高效的大模型广告应用
来源:https://arxiv.org/html/2605.11582
作者:Wenxin Dong, Chang Gao, Guanghui Yu, Xuewu Jiao†, Mingqing Hu, Qiang Fu, Peng Xu, Penghui Wei, Hui Xu, Yue Xing, Shuanglong Li, Lin Liu

###### 摘要

大型语言模型(LLM)的最新进展对在线广告等多个领域产生了重大影响。然而,传统方法往往在推理延迟效率和高昂的计算成本方面面临困境。为了解决这些问题,我们提出了一种创新的模型压缩框架,该框架集成了针对 GEMV(通用矩阵向量乘法)工作负载优化的层自适应组量化(layer-adaptive group-wise quantization)和层级半结构化稀疏化(layer-wise semi-structured sparsity)。我们还引入了一种新颖的基于前缀树的并行验证策略以进一步提升效率。在广告创意生成和目标广告两个场景下的广泛实验验证了我们方法的有效性。该框架已在主流广告平台投入生产部署,在真实世界实验中实现了超过 1.8 倍的加速,同时保持了具有竞争力的精度。

00footnotetext:†通讯作者。
00footnotetext:本研究于 2024 年完成,该系统自那时起已在百度的广告平台中部署。

## 1. 引言

最近,大语言模型(LLM)的问世引发了推荐系统的范式转变,推动了系统从传统的基于判别式的架构向基于生成式的方法过渡(Wang and Lim, 2023; Zhai et al., 2024)。这些模型利用了嵌入在 LLM 中的世界知识和推理能力,提供了卓越的泛化能力和鲁棒性。生成式目标定位(Generative targeting)指的是将生成式 LLM 与在线广告场景无缝集成的端到端、实时过程,根据用户查询直接生成相关广告。通过向模型中嵌入广告索引,这种新的技术范式对模型的定期更新提出了更高的要求。

然而,随着模型参数的扩展和实时需求的升级,LLM 增强型推荐系统中的推理复杂性日益增加,导致了可扩展性与效率之间的矛盾。这一冲突使得对延迟敏感的场景(例如广告)成为关键的性能瓶颈,迫切需要能够在不牺牲推荐质量的前提下有效优化推理的解决方案。

**动机与挑战。** 现有研究主要侧重于简单地将 LLM 应用于推荐系统(RS),重点在于精度侧的优化,如训练策略升级(Bao et al., 2023; Yang et al., 2023; Wang et al., 2024; Wei et al., 2024)和提示词创新(Liao et al., 2024; Zhang and Wang, 2023)。这些方法展现了卓越的准确性,显著提升了推荐系统的预测性能。然而,这些研究往往忽视了效率侧的优化,这对于在线实时商业广告交付等时间敏感场景尤为不利。

**我们的核心思路。** 为了应对这些技术挑战,我们致力于提出一种开创性且有效的生成式目标定位解决方案。具体而言,我们创新性地设计了一种索引压缩的数据结构,以支持半结构化层级 FP16 混合稀疏化,并利用自适应组量化技术实现从 FP16 到 INT4 的模型压缩。此外,我们开发了一个支持 INT4 权重量仅(weight-only)GEMV 和混合稀疏性的混合精度计算自定义内核,以增强矩阵加速效率。此外,在业务层面,我们采用层次聚类算法(Tay et al., 2022)将纯文本数据构建为语义结构化的前缀树。通过动态评估生成剩余 token 与验证剩余 token 之间的时间差,我们确定了启动前缀树并行验证的最佳时机。这种方法能够一步解码整个剩余序列长度,从而减少解码步骤并加速模型推理。

**贡献。** 本文的主要贡献总结如下:

- • 我们通过提出用于混合稀疏性的索引压缩 2bit-CSR 格式,优化了压缩稀疏行(CSR),将索引和权重的大小减少到优化前原始 CSR 大小的 30%。
- • 我们独立开发了一个支持 INT4 与稀疏矩阵乘法的自定义 SparseGemv 加速内核,填补了 NVIDIA 稀疏加速库(cuSparse/cuSparseLT)在高效 GEMV 操作方面留下的空白。
- • 我们创新性地提出了自适应组量化,增强了量化过程的灵活性和精度。
- • 据我们所知,我们是首个提出结合前缀树约束解码与束搜索(Beam Search)完整工作流程的人,并将其应用于广告目标定位场景中的生成任务。
- • 大量实验数据表明,我们的优化使推理速度提升了超过 78%。所提出的系统已部署在百度的广告平台上,服务于大规模实时流量。

## 2. 相关工作

### 2.1. 推荐系统中的大语言模型

将大语言模型(LLM)集成到推荐系统中已成为一个充满前景的研究方向。当前研究主要涵盖以下几个关键领域:(1)特征工程与表示学习,利用 LLM 生成丰富的语义嵌入(Zhang et al., 2024b; Geng et al., 2022);(2)排序优化,LLM 提高结果排序的准确性(Zhang and Wang, 2023; Liao et al., 2024; Luo et al., 2023; Lin et al., 2024b);以及(3)用户交互增强,专注于自然语言界面和基于对话的推荐(Bao et al., 2023; Jung et al., 2023)。并行推进的是生成式推荐(Kang and McAuley, 2018; Petrov and Macdonald, 2023)的采用,特别是自注意力机制。Zhai 等人(2024)的著名工作表明,统一的生成式推荐模型取得了突破性的性能,超越了传统的分层深度推荐系统。此外,最近的研究为传统搜索和推荐模型提出了高效的扩展解决方案(Zhang et al., 2024a)。然而,尽管取得了这些进展,当前方法在计算成本和延迟方面仍面临挑战,使其难以满足对响应时间有严格要求的在线推理场景。这需要新的方法来平衡性能与效率。

### 2.2. LLM 推理加速

近年来,LLM 推理加速的最新进展主要集中于两个正交互补的方法:模型压缩技术和解码优化策略。

**模型压缩。** 量化和稀疏化已成为减少模型尺寸的基本方法。包括 Frantar 等人(2023)、Lin 等人(2024a)及其衍生作品(Lee et al., 2024; Shao et al., 2024)在内的开创性工作建立了稳健的 4-bit 量化基线。然而,这些方法主要采用预定义的分组策略,容易忽视权重敏感度分布中的内在异质性。与此同时,稀疏性研究已从非结构化剪枝发展到硬件感知的半结构化范式。SparseGPT(Frantar and Alistarh, 2023)和 Wanda(Sun et al., 2024)实现了稀疏剪枝,在减少参数的同时保持模型质量方面也显示出前景。然而,SparseGPT 受限于其层级损失优化和对二阶导数的依赖,这限制了参数调整。基于重新训练的方法提供了更广泛的优化空间,能够实现更好的全局性能。

**投机解码(Speculative Decoding)。** 投机解码通过并行验证候选 token 来加速自回归解码,由 Leviathan 等人(2023)和 Chen 等人(2023)提出。像 Medusa(Cai et al., 2024)和 SpecInfer(Miao et al., 2024)这样的创新利用树状注意力进行并行预测。然而,现有方法统一应用并行解码,这可能效率低下。我们引入了动态并行启动机制,根据置信度和计算成本战略性地从顺序解码过渡到并行解码,优化工业推荐系统的响应时间和准确性。

## 3. 解决方案

### 3.1. 概述

该系统由两个主要组件组成:**模型压缩**和**前缀树并行验证**,旨在优化生成式目标定位任务的效率和准确性。

**模型压缩。** 它专注于在不牺牲精度的情况下减少模型尺寸和计算开销。它包括**组自适应量化**,该方法基于参数敏感度,将模型的层分为敏感层和非敏感层,对敏感组进行细粒度(更多组)量化,对非敏感组进行粗粒度(较少组)量化。**层自适应稀疏化**组件根据相对重要性在不同层之间修剪冗余参数,应用不同的比率以确保关键层保留更多信息,而较不重要的层则被更激进地修剪。这些压缩技术与内核无缝集成以实现优化执行。

**前缀树并行验证。** 负责高效且准确的 token 预测。该过程始于**前缀树构建**,其中层次聚类(Tay et al., 2022)将纯文本转换为结构化的前缀树(trie),trie 结构上宽下窄,随着深入候选结果变少。**并行验证触发器**动态评估并识别验证的最佳触发点,确保处理速度与准确性之间的平衡。最后,**基于树的并行验证**重构前缀树以进行序列生成,利用并行解码加速结果同时保持精度。

### 3.2. 模型压缩

**自适应组量化。** 为了增强量化过程的灵活性和精度,我们提出了一种自适应组方法,该方法根据各个线性层的敏感度定制量化策略。借鉴无损方法中权重敏感度解析解的启发(Dettmers et al., 2024),我们进一步将其测量策略整合到我们的方法中作为解析标准。因此,被识别为敏感的层通道被分配更多的组以实现更细的量化粒度,从而最小化量化误差。相反,对量化引起的变化表现出鲁棒性的非敏感通道被分配较少的组,在不牺牲准确性的情况下减少计算开销。

**稀疏化。** 为了进一步提高推理效率而不损害精度,我们提出了一种层级自适应 N:M 剪枝策略。基于半结构化稀疏性(Frantar and Alistarh, 2023),我们结合了基于重要性的权重选择。本质上,这种方法使得层可以在不同稀疏度下进行剪枝,更关键的层保留更高的密度(2:4),而较不关键的层表现出更大的稀疏性(1:4),如图 1 所示。

参考标题图 1. Transformer 层重要性
建立在 WandA(Sun et al., 2024)中确立的剪枝标准基础上,我们提出了一种精炼的方法来量化权重矩阵中各个元素的重要性。设 $w_0 \in \mathbb{R}^d$ 表示稀疏化之前的密集权重向量,$w = w_0 + \delta w$ 表示剪枝后的扰动对应物。由稀疏化操作引起的近似误差可以通过二阶泰勒展开推导得出:

(1) $\delta E = E(w) - E(w_0) = (\frac{\partial E}{\partial w})^\top \delta w + \frac{1}{2} \delta w^\top H \delta w + O(\|\delta w\|^3)$

其中 $H = \frac{\partial^2 E}{\partial w^2}$ 是 Hessian 矩阵。主要优化目标是找到一组权重元素以最小化引起的近似误差。在元素间独立性假设下并忽略高阶项,我们构建了拉格朗日约束优化问题:对于单个权重元素 $w_q$(满足 $w_q + \delta w_q = 0$),误差项将为:

(2) $(w_q \cdot \|x_q\|_2)^2 + w_q \cdot \|\frac{\partial E}{\partial w_q}\|$

其中 $x_q$ 表示将与 $w_q$ 一起操作的输入激活部分,$E$ 表示损失函数。因此,给定权重矩阵 $W$ 中任何元素 $W_{ij}$ 的标准变为:

(3) $\|W_{ij}\| \cdot \|X_j\|_2 + \|W_{ij}\| \cdot \|\frac{\partial E}{\partial W_{ij}}\|$

### 3.3. 修订后的内核

半结构化稀疏矩阵需要额外的索引数据,这 inherently 导致额外的带宽消耗和计算负担。因此,我们主要专注于解决这些关键挑战,以适应真实世界场景。基于我们上一代 Gemv(通用矩阵向量乘法)技术...

相似文章

LLM-OSDA:多轮LLM对话中原生广告的最优停止动态拍卖

arXiv cs.CL

本文提出了LLM-OSDA,一种用于多轮LLM对话中原生广告的动态点击付费拍卖机制,融合了贝尔曼最优停止、获胜者分配和包络定价。实验表明,与固定时机基线相比,净收入提高了11%,同时保持了用户留存率。

超越单槽位:多槽位保量展示广告的联合优化

arXiv cs.LG

提出了一种针对多槽位保量展示广告的联合优化框架,通过二分图匹配和合约轮盘机制解决槽位冗余和合约不平衡问题。在美团上的在线A/B测试显示,收入与合约履行显著提升。

LLM-as-a-Verifier:通用验证框架

Hugging Face Daily Papers

LLM-as-a-Verifier引入了一种概率验证框架,该框架从LLM的对数几率计算连续分数,并在粒度、重复评估和标准分解方面进行缩放。它在多个智能体基准测试上取得了最先进的结果,并为强化学习提供了密集反馈。