TIDE:基于I/O感知专家卸载的高效无损MoE扩散LLM推理
摘要
TIDE 是一种用于扩散大型语言模型的无损推理系统,它利用专家激活的时间稳定性来减少 I/O 开销和计算,在单 GPU-CPU 系统上实现高达 1.4-1.5 倍的吞吐量提升。
查看缓存全文
缓存时间: 2026/05/22 02:36
论文页面 - TIDE: 高效且无损的 MoE 扩散大语言模型推理:面向 I/O 的专家卸载
来源:https://huggingface.co/papers/2605.20179
摘要
扩散大语言模型在资源受限设备上部署面临挑战,但名为 TIDE 的新型推理系统通过利用专家激活的时间稳定性并优化专家布局来减少 I/O 开销和计算,从而解决了这一问题。
扩散大语言模型(Diffusion Large Language Models)(dLLMs) 已成为自回归(AR)模型的有竞争力的替代方案,通过并行的块级解码提供更好的硬件利用率和双向上下文。然而,随着 dLLMs 继续使用混合专家(MoE)架构进行扩展,它们在资源受限设备上的部署仍然是一个开放的挑战。现有的基于 AR 的方法通常会导致高昂的 I/O 开销或显著的计算瓶颈。在这项工作中,我们提出了 TIDE,一种新颖的资源高效推理系统,它利用扩散过程中块内专家激活的时间稳定性。具体来说,我们利用扩散过程中块内专家激活的时间稳定性,并引入一种基于间隔的专家刷新策略,以I/O 感知的方式更新专家布局。为确保最佳性能,我们将推理调度建模为一个数学规划问题,求解最优间隔以最小化 I/O 流量和 CPU 计算。最重要的是,TIDE 是一种无损优化,无需模型训练,为 dLLM 推理提供了“免费午餐”加速。在单个 GPU-CPU 系统中,我们证明 TIDE 在 LLaDA2.0-mini 和 LLaDA2.0-flash 模型上分别实现了比先前基线高达 1.4 倍和 1.5 倍的吞吐量提升。
查看 arXiv 页面 | PDF | 项目页面 | GitHub2 | 添加到收藏
在您的智能体中获取此论文:
hf papers read 2605.20179
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
引用此论文的数据集0
没有数据集链接此论文
引用此论文的空间0
没有空间链接此论文
包含此论文的集合0
没有集合包含此论文
将此论文添加到一个集合中,以便从本页面链接到它。
相似文章
Qwen 30B MoE - 30tps - 6GB显存 - 搞定!
一位用户分享了在RTX 3050 6GB上成功运行Qwen 30B MoE的经验,支持90k上下文,速度达到每秒30-35个token,庆祝低端硬件的出色表现。
dots-studio/dots3-note-prev · Hugging Face
dots-studio 发布 dots3-note 预览版,这是 dots3 系列中首个开放权重模型:一个拥有 2800 亿参数的多模态 MoE,激活参数为 160 亿,支持 512K 上下文,并能理解文本、图像、视频和音频。
实验:Qwen3.8-2.4T-A95B 在 RTX 5090 + RTX 5060 Ti 上本地运行,约 0.80 tok/s
一个实验,使用 llama.cpp 在双消费级 GPU(RTX 5090 + 5060 Ti)上本地运行 Qwen3.8-2.4T-A95B MoE 模型,启用 MTP 推测解码后达到约 0.8 tok/s。
@PyTorch: AMD has been upstreaming optimizations for improved FP8 training support in PyTorch/TorchTitan and PyTorch/TorchAO, mak…
AMD upstreamed optimizations to PyTorch/TorchTitan and TorchAO for FP8 training on AMD Instinct GPUs, achieving up to 13.4% throughput gains on Llama3-8B and recovering 89% of FP8 quantization overhead on DeepSeek-V3 via fused Triton kernels.
@AdinaYakup: DeepSeek V4 Pro's weights are out https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813… - 1.6T / 49B MoE, MIT licens…
DeepSeek released DeepSeek-V4-Pro-0813, an open-weights MoE model (1.6T total / 49B active) with MIT license, 1M context, and enhanced agentic capabilities, outperforming its preview and competing with top proprietary models on benchmarks like Terminal-Bench 2.1.