专家联邦:面向大语言模型的高效通信分布式推理
摘要
专家联邦(FoE)将混合专家模块重组为独立处理KV头的集群,消除了节点间通信瓶颈,在保持生成质量的同时,将推理吞吐量和延迟提升高达5.2倍。
查看缓存全文
缓存时间: 2026/05/15 00:21
论文页面 - 专家联邦:面向大型语言模型的高效分布式推理
来源:https://huggingface.co/papers/2605.06206
摘要
专家联邦将混合专家模块重组为独立处理KV头的集群,在保持生成质量的同时消除了节点间的通信瓶颈。
混合专家(https://huggingface.co/papers?q=Mixture%20of%20experts)已成为使大型语言模型(LLM)计算高效的主要机制。然而,在分布式环境中,专家之间传输token嵌入是一个显著瓶颈。我们提出了新颖的专家联邦(FoE)架构。FoE将Transformer层(https://huggingface.co/papers?q=transformer%20layer)的MoE模块重构为多个MoE集群(https://huggingface.co/papers?q=MoE%20clusters)。每个集群只负责一个KV头(https://huggingface.co/papers?q=KV%20heads),并在这些专家之间应用专家并行(https://huggingface.co/papers?q=expert%20parallelism)。集群之间通过求和操作同步注意力后的残差,从而驱动下一个MoE块的路由(https://huggingface.co/papers?q=routing)和分发(https://huggingface.co/papers?q=dispatch)。在单节点设置(https://huggingface.co/papers?q=single-node%20setting)下,由于组内所有专家位于同一GPU上,FoE完全消除了全到全通信(https://huggingface.co/papers?q=all-to-all%20communication)。在多节点设置(https://huggingface.co/papers?q=multi-node%20setting)下,FoE将全到全通信(https://huggingface.co/papers?q=all-to-all%20communication)限制在节点内网络,从而显著降低通信开销。FoE的实现表明,在LongBench(https://huggingface.co/papers?q=LongBench)上,FoE在单节点和多节点设置(https://huggingface.co/papers?q=multi-node%20setting)下均显著提升了推理吞吐量(https://huggingface.co/papers?q=inference%20throughput)和延迟(https://huggingface.co/papers?q=latency),将端到端前向传播延迟(https://huggingface.co/papers?q=latency)降低了高达5.2倍,TTFT(https://huggingface.co/papers?q=TTFT)降低了3.62倍,TBT(https://huggingface.co/papers?q=TBT)降低了1.95倍。同时,其生成质量与相同规模和训练配置的混合专家(https://huggingface.co/papers?q=mixture%20of%20experts)模型相当。
查看arXiv页面(https://arxiv.org/abs/2605.06206)查看PDF(https://arxiv.org/pdf/2605.06206)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.06206)
在你的agent中获取这篇论文:
hf papers read 2605\.06206
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型关联此论文
在模型README.md中引用arxiv.org/abs/2605.06206以从本页链接。
引用此论文的数据集0
没有数据集关联此论文
在数据集README.md中引用arxiv.org/abs/2605.06206以从本页链接。
引用此论文的空间0
没有空间关联此论文
在空间README.md中引用arxiv.org/abs/2605.06206以从本页链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到一个收藏集(https://huggingface.co/new-collection)以从本页链接。
相似文章
MawForge:面向本地混合专家推理的内存受限专家物化
MawForge 提出了一种内存受限的方法,用于在受限的统一内存机器上服务大型混合专家(MoE)语言模型,通过将完整模型存储在磁盘上,并按需将专家张量物化到有限缓存中。在 MacBook Pro M5 Pro 上的实验表明,能够在 24GB 内存范围内有效服务 34GB 和 25GB 的模型,并分析了缓存大小权衡和推测解码结果。
PuzzleMoE:通过稀疏专家合并和位打包推理实现大型混合专家模型的高效压缩
PuzzleMoE 提出了一种成对双掩码专家合并算法和位级打包技术,用于压缩大型混合专家模型,在保持性能的同时减少存储并加速推理。
Mix-MoE:通过混合专家混合提升大语言模型的多语言机器翻译
Mix-MoE提出了一种混合专家混合框架,通过专门的专家组和傅里叶变换增强的路由机制来缓解多语言机器翻译中的参数干扰,相比基线方法取得了显著改进。
更少专家,更快解码:面向混合专家模型的成本感知推测解码
本文提出EcoSpec,一种针对混合专家模型的成本感知推测解码框架,在草稿选择阶段考虑了专家激活成本。通过在无需修改目标模型验证规则的情况下减少专家足迹,该方法在DeepSeek-V3.1、Qwen3-235B-A22B和GPT-OSS-120B等大规模MoE模型上实现了高达1.62倍的加速。
XPERT:通过专家知识迁移实现语言模型的高效训练
本文介绍了 XPERT,这是一个从预训练混合专家(MoE)语言模型中提取和复用专家知识的框架,旨在提高下游模型的训练效率和性能。