更少专家,更快解码:面向混合专家模型的成本感知推测解码

arXiv cs.CL 论文

摘要

本文提出EcoSpec,一种针对混合专家模型的成本感知推测解码框架,在草稿选择阶段考虑了专家激活成本。通过在无需修改目标模型验证规则的情况下减少专家足迹,该方法在DeepSeek-V3.1、Qwen3-235B-A22B和GPT-OSS-120B等大规模MoE模型上实现了高达1.62倍的加速。

arXiv:2607.12696v1 公告类型:新论文 摘要:稀疏混合专家(MoE)模型已成为扩展大型语言模型(LLM)的重要方法,但其推理效率在很大程度上取决于专家激活模式。推测解码(SD)通过并行验证多个草稿令牌来加速自回归生成,然而,现有的草稿选择策略主要优化接受概率。在大规模MoE模型中,选择草稿令牌也决定了验证期间激活的专家集合。我们观察到,基于置信度的SD可能引入\textit{专家分散}:高概率草稿令牌可能路由到不相交的专家,增加专家权重内存流量并降低推测带来的加速。受此观察启发,我们重新审视了在MoE推理非均匀内存成本结构下的草稿树选择。我们提出\textsc{EcoSpec},一种成本感知的推测解码框架,将预测的边际专家激活成本纳入草稿选择。借助轻量级专家预测器和动态专家缓冲区,\textsc{EcoSpec}倾向于选择那些在保持高接受概率的同时重用当前验证集已覆盖专家的草稿路径,且无需修改目标模型的验证规则。我们在三个大规模MoE模型上评估了\textsc{EcoSpec},包括DeepSeek-V3.1 (671B)、Qwen3-235B-A22B和GPT-OSS-120B,涵盖推理、编码、问答和对话基准。\textsc{EcoSpec}持续减少了活跃专家足迹并提升了端到端解码速度,最高实现$1.62\times$加速。这些结果表明,在大规模MoE模型中考虑专家激活成本对于高效的推测解码至关重要。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:23

# 成本感知的专家混合模型推测解码
来源:https://arxiv.org/html/2607.12696

###### 摘要

稀疏专家混合(MoE)模型已成为扩展大型语言模型(LLM)的重要方法,但其推理效率严重依赖于专家激活模式。推测解码(SD)通过并行验证多个候选令牌来加速自回归生成,然而现有的候选选择策略主要优化接受可能性。但在大规模MoE模型中,选择候选令牌也决定了验证期间激活的专家集合。我们观察到,基于置信度的SD会导致专家分散:高概率的候选令牌可能路由到不相关的专家,增加专家权重的内存流量,降低推测带来的加速效果。受此观察启发,我们重新审视了MoE推理非均匀内存成本结构下的候选树选择问题。我们提出EcoSpec,一种成本感知的推测解码框架,将预测的边际专家激活成本纳入候选选择。借助轻量级专家预测器和动态专家缓冲区,EcoSpec倾向于选择那些在保持高接受可能性的同时,重用当前验证集已覆盖专家的候选路径,而无需修改目标模型的验证规则。我们在三个大规模MoE模型上评估了EcoSpec,包括DeepSeek-V3.1(671B)、Qwen3-235B-A22B和GPT-OSS-120B,覆盖推理、编程、问答和对话基准测试。EcoSpec持续减少活跃专家足迹,并提升端到端解码速度,最高加速比达到1.62×。这些结果表明,考虑专家激活成本对于大规模MoE模型中高效的推测解码至关重要。

机器学习,ICML

## 1 引言

参见图注 (a) 延迟 vs. 专家负载
参见图注 (b) 专家激活负担
参见图注 (c) 单个专家成本

图1:MoE推测解码中的带宽瓶颈。(a) 验证延迟与活跃专家数量 E 呈线性关系,为获取额外专家带来了严格的延迟惩罚。(b) Top-K 表示每层激活 K 个专家。随着验证预算 γ 增加,标准基线方法(例如 Eagle)会迅速激活不相关的专家集合,导致内存带宽迅速饱和。(c) 单个专家的物理内存占用很大。对于 DeepSeek-V3.1 (FP8),仅加载一个专家就需要 44.04 MB 的 HBM 带宽,这意味着每条错误的专家路径都会带来巨大的 I/O 开销。

大型语言模型 (LLM) 在逻辑、编程和创造性任务中展示了卓越的能力 (Brown et al., 2020; OpenAI et al., 2024; Grattafiori et al., 2024),然而它们的部署越来越受到高推理延迟和服务成本的制约 (Rajbhandari et al., 2020)。标准的自回归解码过程逐个生成令牌,每一步都需要通过目标模型进行一次完整的前向传播 (Vaswani et al., 2017)。随着模型规模扩展到数千亿参数,这种串行依赖使得推理严重受限于内存:算术强度低,吞吐量通常受限于从高带宽内存 (HBM) 加载模型权重到片上计算单元所需的带宽 (Williams et al., 2009; Shazeer, 2019; Dao et al., 2022)。因此,降低解码延迟和内存流量已成为实时用户体验和基础设施效率的关键优先事项。

为了缓解串行解码瓶颈,推测解码 (SD) 作为一种推理加速范式被广泛研究 (Leviathan et al., 2023; Chen et al., 2023; Li et al., 2024b, a, 2026; Cai et al., 2024)。SD 使用低成本的草稿机制提出多个候选令牌,然后由目标模型并行验证。当草稿被接受时,一次目标模型前向传播可以推进多个令牌的生成,从而分摊参数加载并提高硬件利用率。对于密集 Transformer,其中相同的权重矩阵在所有验证位置上被重用,这种并行验证可以显著提升算术强度并降低每个生成令牌的有效成本 (Miao et al., 2024)。

然而,这种分摊背后的密集模型假设并不能直接扩展到稀疏专家混合 (MoE) 架构 (Shazeer et al., 2017; Fedus et al., 2022),后者越来越多地被用于大规模语言模型 (OpenAI et al., 2025; DeepSeek-AI et al., 2025; Yang et al., 2025)。在 MoE 层中,密集的前馈模块被一组专家替代,路由器将每个令牌分配到 top-k 个专家的子集 (Lepikhin et al., 2021; Du et al., 2022)。因此,并行验证不再在所有验证位置上重用一个固定的前馈权重集。其内存成本取决于验证令牌所激活的专家集合的并集:当不同的候选令牌路由到不相关的专家时,验证器必须从 HBM 获取额外的专家权重块。结果,MoE 推测解码中的验证延迟变得对专家重叠和重用非常敏感,而不是主要取决于验证令牌的数量。

这种 MoE 特有的成本结构暴露了现有 SD 方法基于接受驱动的选择目标与 MoE 验证的内存成本之间的不匹配。许多最近的 SD 方法将候选草稿组织成树,并主要根据置信度或接受可能性选择验证子集。这个标准对密集模型有效,因为主要目标是最大化每次目标模型前向传播中接受的令牌数量。然而,在 MoE 验证中,一个高概率的候选者仍然可能激活与其他验证令牌使用的专家不相关的专家。因此,添加这样的候选者可能会扩大每步的专家并集,增加专家权重的内存流量,并降低缓存重用 (Huang et al., 2026; Xue et al., 2024)。我们将这种每步专家足迹的扩展称为“专家分散”。如图 1 所示,验证延迟随着活跃专家足迹的增加而增加,而基于置信度的选择可能会迅速增加在一个验证步骤中接触的唯一专家数量。因此,即使接受率保持可比,扩展验证集也可能侵蚀端到端的加速效果。这一观察激发了一个成本感知的草稿选择目标,该目标在接受可能性与引入新专家的边际成本之间取得平衡。

为了解决这个问题,我们提出了 EcoSpec,一个用于 MoE 模型的成本感知推测解码框架。EcoSpec 在候选树选择阶段运行,在此阶段它在接受-成本权衡下选择用于并行验证的候选者。EcoSpec 不仅仅主要根据接受可能性对候选令牌进行排序,还考虑每个候选者带来的边际专家成本。这使得选择过程倾向于那些在保持高接受概率的同时,重用当前验证集已覆盖专家的候选路径。重要的是,EcoSpec 不修改目标模型的验证规则,因此保留了标准推测解码的无损语义 (Leviathan et al., 2023)。通过使草稿选择与 MoE 推理的内存成本结构对齐,EcoSpec 减少了验证期间不必要的专家权重流量。经验上,EcoSpec 在多个生产级 MoE 上实现了一致的加速,包括在 Qwen3-235B 上最高 1.62×,在 GPT-OSS-120B 上 1.50×,在 DeepSeek-V3.1 上 1.47×。

我们的贡献总结如下:

- • 我们识别并分析了大规摸 MoE 推测解码中的“专家分散”现象:基于置信度的草稿选择会扩大每步激活专家的并集,增加验证期间的专家权重内存流量。
- • 我们提出了 EcoSpec,一个成本感知的推测解码框架,将边际专家激活成本纳入候选树选择。借助轻量级专家预测器和动态专家缓冲区,EcoSpec 倾向于选择那些在保持高接受可能性的同时提高专家重用的候选路径,而不改变标准的无损验证过程。
- • 我们在三个大规模 MoE 模型上评估了 EcoSpec——DeepSeek-V3.1 (671B)、Qwen3-235B-A22B 和 GPT-OSS-120B——涵盖多种推理、编程和对话基准测试。EcoSpec 持续减少激活的专家并提升端到端解码速度,与现有 SD 基线相比,最高加速比达到 1.62×。

参见图注

图 2:EcoSpec 框架概述。过程从草稿生成开始,其中草稿模型 M_d 产生一个带有相关概率的候选令牌树。然后,EcoSpec 模块选择一组用于验证的候选令牌 S。它使用一个轻量级专家预测器 Π_θ 来估计专家激活,维护一个全局专家缓冲区 B 来跟踪已被选定令牌覆盖的专家,并使用成本感知的草稿选择来平衡接受可能性与专家激活成本。最后,目标 MoE 模型 M_p 对选定集合 S 执行并行验证。

## 2 相关工作

#### 推测解码与多令牌预测。

推测解码 (SD) 通过使用较低成本的草稿机制提出多个令牌,然后由目标模型并行验证,从而加速 LLM 推理 (Leviathan et al., 2023; Chen et al., 2023)。早期方法通常使用单独的草稿模型生成候选延续 (Miao et al., 2024)。最近的方法通过采用树结构草稿或辅助预测头进一步提高了草稿效率和接受率,包括 Medusa 和 EAGLE 系列 (Cai et al., 2024; Li et al., 2024b, a, 2026)。与此同时,多令牌预测 (MTP) 引入了一个辅助训练目标,使得模型内的令牌预测器可以作为推测验证的草稿头 (DeepSeek-AI et al., 2025; Gloeckle et al., 2024)。尽管草稿生成方式存在架构差异,这些方法通常基于置信度(接受可能性)对候选令牌进行排序,并未明确考虑在 MoE 验证中激活额外专家的硬件成本。因此,当应用于 MoE 模型时,高置信度的草稿仍可能触发快速扩大的激活专家并集,对应于我们的专家分散现象以及相关的内存低效问题。EcoSpec 通过优化一个成本感知的目标来明确这一点,该目标平衡了接受可能性与激活新专家的增量成本。

#### 专家混合模型的高效推理。

专家混合 (MoE) 模型增加了模型容量同时减少了每个令牌的 FLOPs,但其推理效率常常受限于专家权重内存流量和令牌-专家调度开销 (Shazeer et al., 2017; Liu et al., 2026)。先前的工作通过专家缓存和预取 (Xue et al., 2025; Huang et al., 2024)、优化的令牌调度和融合的 MoE 内核 (Gale et al., 2023) 以及减少不均匀专家利用的路由或负载均衡策略 (Fedus et al., 2022; DeepSeek-AI et al., 2025) 来改进给定路由模式下的 MoE 执行。近期系统进一步研究了推测解码设置下的 MoE 推理。SP-MoE 和 MoE-SpeQ 使用推测的前瞻支持专家预取、卸载和执行调度,旨在隐藏或减少 MoE 服务过程中的专家移动开销 (Chen et al., 2025; Wang et al., 2025)。而 MoE-Spec 则通过施加专家预算并选择在推测验证期间只加载一部分专家来减少验证时的专家成本 (McDanel et al., 2026)。这些方法要么在预测或路由的专家需求下优化运行时执行,要么改变验证时的专家预算。EcoSpec 处理的是解码管道的不同阶段:它保留标准的目标模型验证器和无损推测解码语义,仅更改在验证之前选择哪些候选树节点。因此,EcoSpec 与 MoE 运行时优化是互补的,因为在 EcoSpec 减少了由选定验证节点引起的专家工作集之后,仍然可以应用专家缓存、预取、卸载或优化调度。

参见图注

图 3:验证前成本感知子集构建的说明。我们在目标模型验证之前选择 γ=2 个候选令牌。左(步骤 1):根据接受-成本分数选择根令牌 t_0,并将其预测的专家足迹 {E_1, E_2, E_3, E_4} 添加到专家缓冲区 B 中用于后续评分。中(步骤 2):算法使用更新后的缓冲区重新评估剩余的候选者。尽管 t_1 具有更高的累积草稿概率 (P=0.53),但它引入了三个新的预测专家 (ΔCost=3)。相比之下,t_2 重用了 B 已覆盖的专家,只引入了两个新的预测专家 (ΔCost=2),因此获得了更高的分数 (S=0.20 > 0.17) 并被选中。右(最终):最终选定的集合是 S={t_0, t_2},说明了边际专家成本如何改变```

相似文章

投机解码的经济学

Hacker News Top

一篇关于混合专家模型和压缩注意力如何改变LLM推理中投机解码成本效益的技术分析,解释了推测令牌何时不再那么免费。

什么是推测性解码?(在paperswithco.de上热门)[R]

Reddit r/MachineLearning

推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。

MicroSpec: 通过轻量级上下文词汇表加速推测解码

arXiv cs.CL

MicroSpec 是一种无需训练的技术,它能即时构建紧凑的上下文感知词汇表,以加速大型语言模型中的推测解码,将平均词汇表大小减少40倍以上,并相比EAGLE-2实现了高达1.32倍的端到端加速。