llm-runtime

标签

Cards List
#llm-runtime

我不知怎么就在 4070 Ti + 32GB 内存上本地跑起了 GPT-OSS 120B,速度 21 tok/s lol🏗😤🤣

Reddit r/ArtificialInteligence · 15小时前

一位开发者通过在 4070 Ti + 32GB 内存上利用 GPT-OSS 120B 的 MoE 架构,将冷专家从 NVMe 流式加载、热专家缓存在 GPU 上,并采用 top-1 近似,最终达到了 21 tok/s 的本地运行速度。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈