expert-materialization

标签

Cards List
#expert-materialization

MawForge:面向本地混合专家推理的内存受限专家物化

arXiv cs.LG · 2026-07-14 缓存

MawForge 提出了一种内存受限的方法,用于在受限的统一内存机器上服务大型混合专家(MoE)语言模型,通过将完整模型存储在磁盘上,并按需将专家张量物化到有限缓存中。在 MacBook Pro M5 Pro 上的实验表明,能够在 24GB 内存范围内有效服务 34GB 和 25GB 的模型,并分析了缓存大小权衡和推测解码结果。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈