expert-parallelism

标签

Cards List
#expert-parallelism

@PyTorch: 在 @vllm_project 中的弹性专家并行性允许您在活动的混合专家部署期间动态添加或移除GPU…

X AI KOLs Following ↗ · 2天前 缓存

本文推广了在2026年PyTorch Conference North America上关于vLLM中弹性专家并行性的演讲,讨论了如何在混合专家部署中动态添加或移除GPU,同时最小化停机时间。

0 人收藏 0 人点赞
#expert-parallelism

@yibie: https://x.com/yibie/status/2101491585741394047

X AI KOLs Timeline ↗ · 2026-09-20 缓存

本文详细解释了MoE(混合专家)推理工程,纠正了关于激活参数与部署成本的误解,并深入探讨了路由器选择、运行时分组、GPU执行、内存管理和专家并行等技术细节。

0 人收藏 0 人点赞
#expert-parallelism

@_avichawla: https://x.com/_avichawla/status/2100876555409039605

X AI KOLs Timeline ↗ · 2026-09-18 缓存

这篇文章解释了Mixture-of-Experts (MoE) 推理的工程方面,详细介绍了令牌路由、专家批处理、GPU分配和性能权衡,以实现高效的服务。

0 人收藏 0 人点赞
#expert-parallelism

大型语言模型中混合专家架构的演进:路由、拓扑、负载均衡与专家并行

arXiv cs.CL ↗ · 2026-08-11 缓存

一篇关于LLM中混合专家架构的技术综述,沿着专家粒度、拓扑、路由、负载均衡和执行来组织演进,并提出了架构里程碑和控制平面的互补视角。

0 人收藏 0 人点赞
#expert-parallelism

EasyBalance:分布式MoE推理中的跨层负载均衡

arXiv cs.LG ↗ · 2026-08-11 缓存

本文提出了EasyBalance,一种用于分布式混合专家(MoE)推理的跨层负载均衡策略。该策略在不修改专家-设备映射的情况下,调度并联合执行来自不同层的工作负载,以减少GPU空闲时间。实验表明,该策略可将空闲时间减少40%以上。

0 人收藏 0 人点赞
#expert-parallelism

Director: 通过在线主动专家放置加速分布式MoE服务

arXiv cs.LG ↗ · 2026-07-13 缓存

本文介绍了Director,一个分布式MoE服务系统,通过预测驱动的在线主动专家放置来最小化端到端延迟。它采用轻量级预测器和基于松弛法的优化器,对Mistral、DeepSeek和Qwen等模型可实现高达55%的延迟降低。

0 人收藏 0 人点赞
#expert-parallelism

@h100envy: 前伯克利博士,在 xAI 领导 SGLang 团队,解释了如何在 23 分钟内用 10 万块 GPU 为 Grok 提供服务——比价值 2000 美元的……更好

X AI KOLs Timeline ↗ · 2026-07-06 缓存

一位在 xAI 领导 SGLang 团队的前伯克利博士,解释了如何使用分离预填充/解码、专家分片以及通信/计算重叠,在 10 万块 GPU 上为 Grok 提供服务,以实现碾压 DeepSeek API 的价格。

0 人收藏 0 人点赞
#expert-parallelism

MACS: 面向高效多模态MoE推理的模态感知容量缩放

arXiv cs.LG ↗ · 2026-05-08 缓存

MACS是一个无需训练的推理框架,通过引入熵加权负载和动态模态自适应容量机制,减轻多模态MoE MLLMs在专家并行中的落后效应。

0 人收藏 0 人点赞
#expert-parallelism

专家联邦:面向大语言模型的高效通信分布式推理

Hugging Face Daily Papers ↗ · 2026-05-07 缓存

专家联邦(FoE)将混合专家模块重组为独立处理KV头的集群,消除了节点间通信瓶颈,在保持生成质量的同时,将推理吞吐量和延迟提升高达5.2倍。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈