expert-parallelism

标签

Cards List
#expert-parallelism

大型语言模型中混合专家架构的演进:路由、拓扑、负载均衡与专家并行

arXiv cs.CL · 2026-08-11 缓存

一篇关于LLM中混合专家架构的技术综述,沿着专家粒度、拓扑、路由、负载均衡和执行来组织演进,并提出了架构里程碑和控制平面的互补视角。

0 人收藏 0 人点赞
#expert-parallelism

EasyBalance:分布式MoE推理中的跨层负载均衡

arXiv cs.LG · 2026-08-11 缓存

本文提出了EasyBalance,一种用于分布式混合专家(MoE)推理的跨层负载均衡策略。该策略在不修改专家-设备映射的情况下,调度并联合执行来自不同层的工作负载,以减少GPU空闲时间。实验表明,该策略可将空闲时间减少40%以上。

0 人收藏 0 人点赞
#expert-parallelism

Director: 通过在线主动专家放置加速分布式MoE服务

arXiv cs.LG · 2026-07-13 缓存

本文介绍了Director,一个分布式MoE服务系统,通过预测驱动的在线主动专家放置来最小化端到端延迟。它采用轻量级预测器和基于松弛法的优化器,对Mistral、DeepSeek和Qwen等模型可实现高达55%的延迟降低。

0 人收藏 0 人点赞
#expert-parallelism

@h100envy: 前伯克利博士,在 xAI 领导 SGLang 团队,解释了如何在 23 分钟内用 10 万块 GPU 为 Grok 提供服务——比价值 2000 美元的……更好

X AI KOLs Timeline · 2026-07-06 缓存

一位在 xAI 领导 SGLang 团队的前伯克利博士,解释了如何使用分离预填充/解码、专家分片以及通信/计算重叠,在 10 万块 GPU 上为 Grok 提供服务,以实现碾压 DeepSeek API 的价格。

0 人收藏 0 人点赞
#expert-parallelism

MACS: 面向高效多模态MoE推理的模态感知容量缩放

arXiv cs.LG · 2026-05-08 缓存

MACS是一个无需训练的推理框架,通过引入熵加权负载和动态模态自适应容量机制,减轻多模态MoE MLLMs在专家并行中的落后效应。

0 人收藏 0 人点赞
#expert-parallelism

专家联邦:面向大语言模型的高效通信分布式推理

Hugging Face Daily Papers · 2026-05-07 缓存

专家联邦(FoE)将混合专家模块重组为独立处理KV头的集群,消除了节点间通信瓶颈,在保持生成质量的同时,将推理吞吐量和延迟提升高达5.2倍。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈