SkewAdam:一种分层优化器,将MoE状态内存减少97%(可在40GB GPU上容纳6.7B MoE模型)[R]

Reddit r/MachineLearning 论文

摘要

SkewAdam是一种分层优化器,可将MoE状态内存使用量减少97%,从而使得6.7B MoE模型能够适配单个40GB GPU。

暂无内容
查看原文

相似文章

Gefen:优化的随机优化器

arXiv cs.LG

Gefen是一种内存高效的优化器,通过自动共享二阶矩估计并使用学习到的码本量化一阶矩,将AdamW的内存占用减少约8倍,同时保持与AdamW相当的性能。

多层级MoE缓存

Reddit r/LocalLLaMA

讨论MoE模型的多层级缓存策略,通过将频繁激活的专家保留在GPU上来提升推理速度,参考了PowerInfer和llama.cpp分支等现有实现。